跳到正文
原文
Hugging Face Blog·· 2025-06-12AI 評分51

長提示詞如何阻塞其他請求並拖慢 LLM 推理效能

How Long Prompts Block Other Requests - Optimizing LLM Performance

AI 導讀

TNG 指出,長提示詞的 prefill 會阻塞後續請求,並在與 decode 共用 GPU 時拖慢已開始生成的請求。vLLM 的並行 partial prefill 可降低短請求的 time-to-first-token;例如可設定最多並行 4 個請求,當中最多 1 個的 prompt 超過 10,000 tokens。

來源:Hugging Face Blog · huggingface.co