Hugging Face Blog·· 2025-01-16AI 評分39
Text Generation Inference 引入多後端支援(TRT-LLM、vLLM)
Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference
AI 導讀
Hugging Face 為 Text Generation Inference(TGI)引入多後端架構,讓 TGI 作為統一前端接入不同推理引擎,並按模型、硬件及效能需求切換後端。團隊正與 NVIDIA TensorRT-LLM 團隊合作,並計劃於 Q1 '25 將 vLLM 整合為 TGI 後端。TGI Backends 將很快可於 Inference Endpoints 使用。
來源:Hugging Face Blog · huggingface.co