推論基礎設施21 分鐘
推論基準測試、容量、SLO 與可觀測性
推論基準測試不是比誰印出的 tokens-per-second 最大。它是一個實驗,用來回答:一套版本固定的系統,能否在足夠比例的請求都符合明確延遲與可靠性目標時,持續承受指定工作負載。如果沒有工作負載、抵達過程、快取狀態、分母與百分位數,吞吐量數字就無法回答容量問題。
Huang Tzu Lin
2 篇文章
推論基準測試不是比誰印出的 tokens-per-second 最大。它是一個實驗,用來回答:一套版本固定的系統,能否在足夠比例的請求都符合明確延遲與可靠性目標時,持續承受指定工作負載。如果沒有工作負載、抵達過程、快取狀態、分母與百分位數,吞吐量數字就無法回答容量問題。
AI 系統可能回傳一份精美的答案,同時在檢索時失敗、使用過時證據、呼叫錯誤工具,或修改錯誤紀錄。團隊若只評估最終文字,這些失敗會全部壓成一個模糊分數;若沒有衡量計畫就把一切都記錄下來,最後只會得到大量追蹤紀錄,卻無法做出發布決策。