跳到正文
原文
Hugging Face Blog·· 2025-05-21AI 評分58

Hugging Face Diffusers 探索量化後端,對比 FLUX.1-dev 的記憶體與推理時間

Exploring Quantization Backends in Diffusers

AI 導讀

Hugging Face Diffusers 文章比較五種量化後端在 FLUX.1-dev 上的記憶體佔用與推理時間。BF16 載入後約佔 31.447 GB,bitsandbytes 4-bit 為 12.584 GB、推理需 12 秒;torchao int4_weight_only 為 10.635 GB,但推理需 109 秒。

來源:Hugging Face Blog · huggingface.co