文件與多模態智慧21 分鐘
多模態證據系統:視覺語言模型(VLM)、圖像基礎化(Figure Grounding)與跨模態檢索(Cross-Modal Retrieval)
純文字系統一旦證據不再主要是文字,就會失效;在無障礙旅行規劃中,照片、平面圖、路線地圖、圖說和量測資料往往會共同決定答案。
Huang Tzu Lin
超越 OCR:版面、表格、視覺語言模型、圖像基礎化與跨模態證據。
2 篇文章
純文字系統一旦證據不再主要是文字,就會失效;在無障礙旅行規劃中,照片、平面圖、路線地圖、圖說和量測資料往往會共同決定答案。
多數團隊第一次接觸文件處理,都是從 OCR 開始。問題看起來很直覺:把頁面轉成文字、為文字建索引,然後讓檢索系統或 LLM 來回答問題。