AI 系統架構24 分鐘
AI 系統的評估與可觀測性:建立迴歸發布閘門
AI 系統可能回傳一份精美的答案,同時在檢索時失敗、使用過時證據、呼叫錯誤工具,或修改錯誤紀錄。團隊若只評估最終文字,這些失敗會全部壓成一個模糊分數;若沒有衡量計畫就把一切都記錄下來,最後只會得到大量追蹤紀錄,卻無法做出發布決策。
Huang Tzu Lin
5 篇文章
AI 系統可能回傳一份精美的答案,同時在檢索時失敗、使用過時證據、呼叫錯誤工具,或修改錯誤紀錄。團隊若只評估最終文字,這些失敗會全部壓成一個模糊分數;若沒有衡量計畫就把一切都記錄下來,最後只會得到大量追蹤紀錄,卻無法做出發布決策。
當一個團隊準備建構進階 AI 旅遊 Copilot 時,真正的難題不是「用哪個模型」,而是「在系統能被正式環境信任之前,什麼事情必須發生、按什麼順序、憑什麼證據、在什麼狀態下、經誰核准?」這是架構問題——模型位於其中,但模型並不能解決這個問題。
多數團隊第一次接觸文件處理,都是從 OCR 開始。問題看起來很直覺:把頁面轉成文字、為文字建索引,然後讓檢索系統或 LLM 來回答問題。
大型語言模型之所以有用,是因為它們能用流暢的語言綜合、解釋和轉化資訊。但一旦我們要求它們處理即時的、私有的,或需要可驗證依據的資訊,它們就變得不可靠。模型在訓練期間可能看過類似的素材,但這不代表它能存取當前任務需要的那份飯店合約、無障礙稽核或客戶回饋紀錄。
客戶支援很適合當基礎系列的收束實作,因為一則訊息可能同時需要問題分解、私有紀錄、政策證據、工具、狀態、授權與人工交接。