使用 Quanto 和 Diffusers 提升 Diffusion Transformer 的記憶體效率
Hugging Face 示範如何在 Diffusers 中使用 Quanto 量化 Transformer-based diffusion pipeline,以降低推理時的 GPU 記憶體佔用。
推薦理由:文章提供在 Diffusers 中以 Quanto 量化擴散 Transformer 與文字編碼器的操作步驟,並用記憶體和延遲數據呈現精度設定的取捨。
Hugging Face 示範如何在 Diffusers 中使用 Quanto 量化 Transformer-based diffusion pipeline,以降低推理時的 GPU 記憶體佔用。
推薦理由:文章提供在 Diffusers 中以 Quanto 量化擴散 Transformer 與文字編碼器的操作步驟,並用記憶體和延遲數據呈現精度設定的取捨。
Hugging Face 的 TGI 推出 Multi-LoRA serving,讓單一基礎模型可按請求動態選用不同 LoRA adapter,以一個部署服務多個微調模型。文中以 mistralai/Mistral-7B-v0.1 示範,載入 30 個 adapter 時 VRAM 增幅為 3%;實際可載入數量取決於 GPU 資源和所部署模型。
推薦理由:文章以 TGI 的部署及調用示例,展示單一基礎模型按請求選用不同 LoRA adapter 的做法,並比較多模型部署的成本與擴展管理。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
Hugging Face Blog 示範如何用 distilabel 為 Argilla 2.0 技術文件建立 RAG 聊天機械人。流程包括從文件建立切塊與合成查詢三元組、微調領域嵌入模型、建立向量資料庫,並將 Gradio 應用部署至 Hugging Face Spaces。聊天互動會記錄在 Argilla,供持續評估與改進。
推薦理由:文章串起文件切塊、合成查詢三元組、微調領域嵌入模型、向量檢索與對話評估,提供一套可複用的文件問答 RAG 實作流程。
Hugging Face 與 KerasHub 宣佈共用模型保存格式,讓 Hugging Face Hub 上部分 Transformers 模型可直接載入 KerasHub。首批涵蓋 Gemma 1、Gemma 2、Llama 3 和 PaliGemma;KerasHub 可透過 TensorFlow、JAX 或 PyTorch 後端運行這些模型。
推薦理由:共享模型保存格式讓受支援架構的 Transformers 模型可直接載入 KerasHub,並透過 TensorFlow、JAX 或 PyTorch 後端運行,呈現跨框架使用的實際路徑。
Hugging Face 宣佈,Google Cloud TPU v5e 現已支援 Inference Endpoints 和 Spaces,可用於部署生成式 AI 模型及運行 AI 示範應用。
Banque des Territoires、Polyconseil 與 Hugging Face 完成 EduRénov 首階段合作,開發主權數據 RAG 工具以支援地方政府。EduRénov 旨在協助 10,000 項公立學校設施翻新工程,並在 5 年內實現 40% 能源節省。項目要求確保所用運算服務與模型的主權。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。
Hugging Face 宣佈 Embedding Container for Amazon SageMaker 正式 GA,AWS 客户可在 SageMaker 部署嵌入向量模型,支援包括 RAG 在內的生成式 AI 應用。
Hugging Face 為 Intel Gaudi 適配並優化輔助生成,並將支援納入 Optimum Habana。該方法先由草稿模型生成 K 個 tokens,再交由目標模型評估;大型 Transformer 模型通常可提速約 2x,並維持與自回歸採樣相同的採樣品質。
Hugging Face 介紹如何使用 TGI Benchmarking 工具,測量 Text Generation Inference(TGI)在不同 batch size 下的吞吐量與延遲,並據此調整部署設定。
Hugging Face Inference Endpoints 新增 AWS Inferentia2 執行個體選項,使用者可從 Hugging Face Hub 部署支援的模型。
Hugging Face Spaces 推出 Dev Mode,讓用户可透過 VS Code 或 SSH 直接連接 Space 並編輯程式碼。功能目前處於 beta,供 PRO 訂閲者使用;修改後可在 Space 點擊「Refresh」測試,無需先推送變更或重建容器。確認修改後,可透過 commit and merge 保存。
Hugging Face 宣佈把 AMD Instinct MI300 整合至平台,透過 Transformers、text-generation-inference 等工具部署模型時無需改動程式碼。
推薦理由:文章比較 Azure MI300X 與 MI250 執行 Llama 3 70B 推理和微調的結果,並公開基準程式碼,便於核對性能差異及復現測試。
Hugging Face 宣佈推出 Dell Enterprise Hub,讓企業透過 Dell 平台在本地訓練和部署開源模型。平台提供包括 Llama 3、Mixtral 和 Gemma 在內的精選開源模型,可按授權或模型大小篩選,並查看模型資訊及適用的 Dell 平台。
Hugging Face 與 Microsoft 宣佈加深合作,擴充 Azure AI Studio 中可一鍵部署的 Hugging Face Collection,並推出 Spaces Dev Mode。
Hugging Face 將 KV cache 量化功能加入 Transformers,以較低精度儲存快取,減少長文本生成的記憶體佔用。int4 快取約帶來 x2.5 記憶體節省,品質接近 fp16,但較高 batch size 下生成速度會下降。
Hugging Face Blog 示範以 Intel Xeon CPU 運行嵌入模型、以 Intel Gaudi 2 運行 LLM,並透過 LangChain、Redis 和 TGI 構建及部署企業級 RAG 應用。
Hugging Face 現可讓組織透過 AWS 帳户,在 AWS Marketplace 訂閲並升級至 Enterprise Hub,費用由 AWS 帳户管理。
Hugging Face 示範透過自訂 inference handler,在 Hugging Face Inference Endpoints 將 ASR、説話人分離與推測解碼整合至單一 API endpoint。
推薦理由:文章展示如何把 ASR、説話人分離與推測解碼組成單一端點,並以長短音訊基準説明推測解碼的效益會隨輸入長度改變。
OpenAI 為 API 客户增加企業級支援,涵蓋更多安全功能與控制措施、Assistants API 更新,以及更好管理成本的工具。
Zama 團隊示範如何透過 Hugging Face Endpoints 部署 Concrete ML 預編譯模型,讓使用者在加密資料上執行推理。文章以垃圾郵件決策樹為例,説明 Endpoint 部署、客户端設定及自製預編譯模型的流程。文中指出,CPU Endpoint 當時最多提供 8 vCPU 和 16 GB RAM,FHE 評估密鑰存於 Endpoint 的 RAM,重啟後需要重新傳送。
Gradio reload mode 可在不重啟 Gradio server 的情況下載入來源檔案的最新變更,文章以此快速構建 AI 文件問答應用。
推薦理由:文章透過文件問答應用示範 Gradio reload mode,並説明如何用 gr.NO_RELOAD 保留客户端,減少開發迭代時重建資源的等待。
Hugging Face 推出 Deploy on Google Cloud 整合,讓用户可把 Hub 上的開放模型部署至 Vertex AI 或 GKE。所有帶有「text-generation-inference」標籤的模型均獲支援;Vertex Model Garden 提供數百個熱門開放 LLM 的即用測試硬件配置。
推薦理由:這項整合串起 Hugging Face 模型探索與 Google Cloud 部署,並為數百個熱門開放 LLM 提供測試硬件配置,呈現更直接的雲端部署流程。
Hugging Face Blog 示範使用 🤗 Optimum Intel 對 SetFit 模型進行靜態訓練後量化,在 Intel Xeon CPU 上推理時,最高吞吐量較原始 Transformers fp32 模型提升 7.8x。
Hugging Face 宣佈 TGI 自 1.4.0 起提供兼容 OpenAI Chat Completion API 的 Messages API,並將其提供於 Inference Endpoints。
推薦理由:文中以 Python、JavaScript、LangChain 和 LlamaIndex 示範如何沿用 OpenAI 相容介面接入開放模型,並交代 function calling 等限制。
Mistral AI 開放 La Plateforme 首批平台服務的 Beta,提供三個文字生成聊天端點及一個嵌入端點,並支援透過 API 呼叫。
推薦理由:平台把不同成本與效能取捨的生成端點,連同嵌入服務及 API 接入放在同一入口,呈現其面向開發者部署的服務組合。
Hugging Face Hub 為 Enterprise Hub 推出 Storage Regions,讓組織選擇模型與資料集的儲存區域。Enterprise Hub 組織可查看現有儲存庫所在區域,並選擇新儲存庫的區域;目前支援 US、EU,亞太區即將推出。
Hugging Face 在 🤗 Diffusers 中測試多種 SDXL 推理優化方法,並於 A100 GPU(40 GB)比較其記憶體佔用和推理延遲。未優化管線為 28.09GB、72,200.5ms;fp16 + SDPA 降至 21.72GB、11,413.0ms,加入 torch.compile 後延遲為 10,296.7ms。
推薦理由:文章以 A100 測試數據對照 SDXL 加速與省記憶體方案的取捨,並説明 Tiny Autoencoder 可能省略部分圖像細節,提供按硬件限制與生成用途選擇配置的參考。
Hugging Face 推出 Inference for PROs,為 PRO 用户開放精選模型的專屬 API 端點,並提高免費 Inference API 的使用速率限制。服務提供可直接使用的 HTTP 端點,方便試驗及原型開發;文章指出它不適合重型生產應用,並建議此類用途使用 Inference Endpoints。
推薦理由:文中列出 PRO 可用的精選模型、端點呼叫方式及服務不適用於重型生產應用的邊界,便於評估其原型測試用途。
Hugging Face Blog 示範在 Diffusers 中優化 AudioLDM 2 推理,將 10.24 秒音頻樣本的生成時間由約 14 秒縮短至不足 1 秒,音質下降幅度輕微。
Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。
推薦理由:文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。
Hugging Face 推出 SafeCoder 企業程式碼助手方案,讓客户在自家基礎設施訓練及部署,程式碼於訓練和推理期間不離開 VPC。SafeCoder 初始版本以 StarCoder 為基礎,可按客户私有程式碼庫微調;程式碼補全建議會對照 The Stack,顯示其是否匹配資料集中的程式碼及相關授權。SafeCoder 與 VMware 合作推出,現向 VMware 企業客户提供。
Hugging Face 將 Hugging Face Hub 上架 AWS Marketplace,組織可透過 AWS 帳户訂閲並支付 Hugging Face 託管服務的用量費用。Inference Endpoints、Spaces Hardware Upgrades 和 AutoTrain 等服務的費用會併入 AWS 帳單,定價與 Hugging Face 公開價格相同。
Hugging Face Blog 作者以 Transformers.js 製作 Doodle Dash,並示範如何構建可在瀏覽器本地運行的即時機器學習遊戲。遊戲模型以 Google Quick, Draw!
推薦理由:文章串連 Quick, Draw! 數據微調、ONNX 轉換與 Transformers.js 瀏覽器推理,呈現把圖像分類模型接入即時網頁遊戲的實作路徑。
Hugging Face Blog 示範如何使用 Hugging Face Inference Endpoints 部署開源 LLM,並以 API 提供服務。示範以 Falcon 40B instruct 建立端點、測試生成參數,並透過 Python 和 JavaScript 串流生成結果。
Jeff Boudier 與 Writer 聯合創辦人兼 CTO Waseem Alshikh 對談,探討 Writer 運用 Hugging Face 處理複雜生成式 AI 用例。
Livebook 可將筆記本部署為 Hugging Face Spaces 應用程式;示範以 Elixir 建立由 Whisper 機器學習模型驅動的語音聊天應用。應用只接受音訊訊息,並由 Whisper 自動轉成文字,整個示範流程不到 15 分鐘。Livebook 是開源的 Elixir 互動式程式碼筆記本,也可在 Spaces 免費執行,供使用者編寫及試驗筆記本。
Hugging Face 與 AMD 宣佈合作,提升 AMD CPU、GPU 平台上 Transformer 模型的訓練與推理效能。AMD 表示,初步測試中 MI250 訓練 BERT-Large 的速度較直接競爭對手快 1.2x,訓練 GPT2-Large 快 1.4x。
Hugging Face 推出適用於 Amazon SageMaker 的 LLM Inference DLC,讓用户在安全、受管理的環境中部署開源 LLM。文章以 Open Assistant 12B 示範使用 ml.g5.12xlarge(4 張 NVIDIA A10G GPU、96GB GPU 記憶體)部署模型、執行推理並建立 Gradio 聊天介面。