推論基礎設施17 分鐘
密集模型的分散式平行化與網路:部署規劃實作
推論服務之所以要分散到多個加速器,通常有兩個原因:模型放不進單一加速器,或單一加速器達不到延遲與吞吐量目標。兩個理由看似相近,設計結果卻不同。把同一筆請求拆到更多 GPU 上,可以讓模型放得下,卻也會在每次前向傳播加入通訊;複製模型則能提高整體請求吞吐量,但不會降低單一副本所需的記憶體。
Huang Tzu Lin
1 篇文章
推論服務之所以要分散到多個加速器,通常有兩個原因:模型放不進單一加速器,或單一加速器達不到延遲與吞吐量目標。兩個理由看似相近,設計結果卻不同。把同一筆請求拆到更多 GPU 上,可以讓模型放得下,卻也會在每次前向傳播加入通訊;複製模型則能提高整體請求吞吐量,但不會降低單一副本所需的記憶體。