Hugging Face Blog·· 2026-07-08精選AI 評分75
Hugging Face 更新 vLLM Transformers 建模後端,多種相容 LLM 架構推理吞吐量達原生實作水平
Native-speed vLLM transformers modeling backend
AI 導讀
Hugging Face 更新 vLLM 的 Transformers 建模後端,令多種相容 LLM 架構的推理吞吐量達到或超過 vLLM 手寫原生實作。測試涵蓋 Qwen3-4B 單 GPU、Qwen3-32B 張量並行,以及 Qwen3-235B-A22B-FP8 MoE 在同一 8×H100 節點上的數據並行與專家並行,三者均達到或超越原生實作吞吐量。
推薦理由
文章以三種不同規模及並行配置的 Qwen3 模型對照 vLLM 手寫實作,並説明 torch.fx 分析與運行時融合如何使相容模型達到原生推理速度。
來源:Hugging Face Blog · huggingface.co