跳到正文
原文
Hugging Face Blog·· 2024-05-16AI 評分56

Hugging Face 在 Transformers 加入 KV cache 量化功能,降低長文本生成的記憶體佔用

Unlocking Longer Generation with Key-Value Cache Quantization

AI 導讀

Hugging Face 將 KV cache 量化功能加入 Transformers,以較低精度儲存快取,減少長文本生成的記憶體佔用。int4 快取約帶來 x2.5 記憶體節省,品質接近 fp16,但較高 batch size 下生成速度會下降。

來源:Hugging Face Blog · huggingface.co