跳到正文
原文
Hugging Face Blog·· 2023-08-23精選AI 評分76

Hugging Face 將 AutoGPTQ 整合至 Transformers,支援大語言模型 GPTQ 量化

Making LLMs lighter with AutoGPTQ and transformers

AI 導讀

Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。

推薦理由

文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。

來源:Hugging Face Blog · huggingface.co