文件與多模態智慧21 分鐘多模態證據系統:視覺語言模型(VLM)、圖像基礎化(Figure Grounding)與跨模態檢索(Cross-Modal Retrieval)純文字系統一旦證據不再主要是文字,就會失效;在無障礙旅行規劃中,照片、平面圖、路線地圖、圖說和量測資料往往會共同決定答案。#Multimodal Evidence#Document Intelligence#Evidence ProvenanceHuang Tzu LinMar 20, 2026