Hugging Face Blog·· 2023-08-23精選AI 評分76
Hugging Face 將 AutoGPTQ 整合至 Transformers,支援大語言模型 GPTQ 量化
Making LLMs lighter with AutoGPTQ and transformers
AI 導讀
Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。
推薦理由
文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。
來源:Hugging Face Blog · huggingface.co