Hugging Face Blog·· 2021-04-20AI 評分58
Hugging Face 解説 BERT 在 CPU 上的推理擴展(第一部分)
Scaling-up BERT Inference on CPU (Part 1)
AI 導讀
Hugging Face 首篇系列文章以 BERT 為例,測試並分析 CPU 核心配置、NUMA 親和性與多模型實例如何影響推理延遲及吞吐量。結果顯示,小型及中型問題使用單一 socket 通常延遲較佳,大型問題則可利用雙 socket;多實例方案的吞吐量接近線性擴展。文中舉例,8 核實例為 0.808$/h,48 核機器則為 4.848$/h,前者成本降低 6x。
來源:Hugging Face Blog · huggingface.co