跳至主要內容
標籤技術部落格

#Networking

1 篇文章

密集模型的分散式平行化與網路:部署規劃實作

推論服務之所以要分散到多個加速器,通常有兩個原因:模型放不進單一加速器,或單一加速器達不到延遲與吞吐量目標。兩個理由看似相近,設計結果卻不同。把同一筆請求拆到更多 GPU 上,可以讓模型放得下,卻也會在每次前向傳播加入通訊;複製模型則能提高整體請求吞吐量,但不會降低單一副本所需的記憶體。

Huang Tzu Lin