推論基礎設施17 分鐘
密集模型的分散式平行化與網路:部署規劃實作
推論服務之所以要分散到多個加速器,通常有兩個原因:模型放不進單一加速器,或單一加速器達不到延遲與吞吐量目標。兩個理由看似相近,設計結果卻不同。把同一筆請求拆到更多 GPU 上,可以讓模型放得下,卻也會在每次前向傳播加入通訊;複製模型則能提高整體請求吞吐量,但不會降低單一副本所需的記憶體。
Huang Tzu Lin
2 篇文章
推論服務之所以要分散到多個加速器,通常有兩個原因:模型放不進單一加速器,或單一加速器達不到延遲與吞吐量目標。兩個理由看似相近,設計結果卻不同。把同一筆請求拆到更多 GPU 上,可以讓模型放得下,卻也會在每次前向傳播加入通訊;複製模型則能提高整體請求吞吐量,但不會降低單一副本所需的記憶體。
Mixture-of-experts model 會把部分 dense feed-forward sublayer 換成多個 expert feed-forward network 與 learned router。每個 token 只啟動 routed expert 的子集,而 shared layer——有時還有 shared expert——仍會對每個 token 執行。Sparse activation 分開了儲存的總參數量與單一 token 啟動的參數量。