跳到正文
原文
Hugging Face Blog·· 2022-10-12精選AI 評分63

BLOOM 推理優化實錄:延遲降低 5x、吞吐量提升 50x

Optimization story: Bloom inference

AI 導讀

Hugging Face 團隊記錄了為 BLOOM 建置推理伺服器的優化過程,稱數週內將延遲降低 5x、吞吐量提升 50x。改用 Tensor Parallelism 後,延遲由 300ms/token 降至 91ms/token,吞吐量升至 10RPS;其後透過 torch.jit.script 和自訂 kernel 將延遲再降至 71ms/token。

推薦理由

文章以 BLOOM 的實測串連並行策略、算子融合和批次服務的取捨,呈現大型模型推理優化中如何平衡延遲與吞吐量。

來源:Hugging Face Blog · huggingface.co