Hugging Face 將 AMD Instinct MI300 整合至平台並支援模型部署
Hugging Face 宣佈把 AMD Instinct MI300 整合至平台,透過 Transformers、text-generation-inference 等工具部署模型時無需改動程式碼。
推薦理由:文章比較 Azure MI300X 與 MI250 執行 Llama 3 70B 推理和微調的結果,並公開基準程式碼,便於核對性能差異及復現測試。
把模型跑起來的工程實踐:推理優化、顯存與成本、Serving 架構與基礎設施選型。
Hugging Face 宣佈把 AMD Instinct MI300 整合至平台,透過 Transformers、text-generation-inference 等工具部署模型時無需改動程式碼。
推薦理由:文章比較 Azure MI300X 與 MI250 執行 Llama 3 70B 推理和微調的結果,並公開基準程式碼,便於核對性能差異及復現測試。
Hugging Face 示範透過自訂 inference handler,在 Hugging Face Inference Endpoints 將 ASR、説話人分離與推測解碼整合至單一 API endpoint。
推薦理由:文章展示如何把 ASR、説話人分離與推測解碼組成單一端點,並以長短音訊基準説明推測解碼的效益會隨輸入長度改變。
Gradio reload mode 可在不重啟 Gradio server 的情況下載入來源檔案的最新變更,文章以此快速構建 AI 文件問答應用。
推薦理由:文章透過文件問答應用示範 Gradio reload mode,並説明如何用 gr.NO_RELOAD 保留客户端,減少開發迭代時重建資源的等待。
Hugging Face 推出 Deploy on Google Cloud 整合,讓用户可把 Hub 上的開放模型部署至 Vertex AI 或 GKE。所有帶有「text-generation-inference」標籤的模型均獲支援;Vertex Model Garden 提供數百個熱門開放 LLM 的即用測試硬件配置。
推薦理由:這項整合串起 Hugging Face 模型探索與 Google Cloud 部署,並為數百個熱門開放 LLM 提供測試硬件配置,呈現更直接的雲端部署流程。
Hugging Face 宣佈 TGI 自 1.4.0 起提供兼容 OpenAI Chat Completion API 的 Messages API,並將其提供於 Inference Endpoints。
推薦理由:文中以 Python、JavaScript、LangChain 和 LlamaIndex 示範如何沿用 OpenAI 相容介面接入開放模型,並交代 function calling 等限制。
Mistral AI 開放 La Plateforme 首批平台服務的 Beta,提供三個文字生成聊天端點及一個嵌入端點,並支援透過 API 呼叫。
推薦理由:平台把不同成本與效能取捨的生成端點,連同嵌入服務及 API 接入放在同一入口,呈現其面向開發者部署的服務組合。
Hugging Face 在 🤗 Diffusers 中測試多種 SDXL 推理優化方法,並於 A100 GPU(40 GB)比較其記憶體佔用和推理延遲。未優化管線為 28.09GB、72,200.5ms;fp16 + SDPA 降至 21.72GB、11,413.0ms,加入 torch.compile 後延遲為 10,296.7ms。
推薦理由:文章以 A100 測試數據對照 SDXL 加速與省記憶體方案的取捨,並説明 Tiny Autoencoder 可能省略部分圖像細節,提供按硬件限制與生成用途選擇配置的參考。
Hugging Face 推出 Inference for PROs,為 PRO 用户開放精選模型的專屬 API 端點,並提高免費 Inference API 的使用速率限制。服務提供可直接使用的 HTTP 端點,方便試驗及原型開發;文章指出它不適合重型生產應用,並建議此類用途使用 Inference Endpoints。
推薦理由:文中列出 PRO 可用的精選模型、端點呼叫方式及服務不適用於重型生產應用的邊界,便於評估其原型測試用途。
Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。
推薦理由:文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。
Hugging Face Blog 作者以 Transformers.js 製作 Doodle Dash,並示範如何構建可在瀏覽器本地運行的即時機器學習遊戲。遊戲模型以 Google Quick, Draw!
推薦理由:文章串連 Quick, Draw! 數據微調、ONNX 轉換與 Transformers.js 瀏覽器推理,呈現把圖像分類模型接入即時網頁遊戲的實作路徑。
Hugging Face 推出 Inference Endpoints,讓用户可從 Hugging Face Hub 將機器學習模型部署至所選雲端的受管基礎設施。
推薦理由:文章逐步展示從 Hugging Face Hub 將模型部署至 AWS,並比較 Protected 與 Private 端點的存取範圍和 VPC 設定。
Hugging Face 團隊記錄了為 BLOOM 建置推理伺服器的優化過程,稱數週內將延遲降低 5x、吞吐量提升 50x。改用 Tensor Parallelism 後,延遲由 300ms/token 降至 91ms/token,吞吐量升至 10RPS;其後透過 torch.jit.script 和自訂 kernel 將延遲再降至 71ms/token。
推薦理由:文章以 BLOOM 的實測串連並行策略、算子融合和批次服務的取捨,呈現大型模型推理優化中如何平衡延遲與吞吐量。
Hugging Face 將 LLM.int8() 整合至 Transformers 與 Accelerate,透過混合 INT8/FP16 矩陣乘法降低大型語言模型推理所需的記憶體。
推薦理由:文章串連 LLM.int8() 的離羣特徵處理、效能比較與 Transformers 整合細節,呈現 8-bit 量化降低大型模型記憶體需求的實作脈絡。
Hugging Face 説明 Transformers 的 TensorFlow 設計取向,將模型和層設為 Keras Model 與 Keras Layer,讓使用者可直接調用 fit()、compile() 和 predict()。
推薦理由:文章梳理 Hugging Face Transformers 對 TensorFlow 的六項設計取向,並以 Keras 訓練、資料管線、XLA 與部署示例,呈現這些取捨如何落實到模型訓練和部署流程。
文章示範以 amazon_reviews_multi 的英文資料微調 microsoft/deberta-v3-base,建立五類情感分類模型以篩選最不滿意的客户訊息。測試中,模型識別出約 95% 的極度不滿意訊息,並把約 12% 的中立或滿意訊息誤判為需要回覆。按每日 10,000 則訊息的假設估算,人工工作量可減少約 83%;文章指出,實際應用需要貼近業務情境的高質素訓練數據。
推薦理由:文章由任務界定、資料集篩選延伸至微調與業務指標設計,展示如何把模型評估對準客服實際處理目標。
Hugging Face 推出適用於 Amazon SageMaker 的 Inference DLC 和 Inference Toolkit,支援部署已訓練模型及 Model Hub 上 10,000+ 個公開模型。
推薦理由:文章分別示範訓練完成後、從 Amazon S3 檢查點及從 Model Hub 部署模型,並附上建立 SageMaker 推理端點的程式範例。
Hugging Face 推出 Accelerate,PyTorch 訓練腳本加入五行程式碼後,即可支援不同分散式設定及混合精度訓練。Accelerate 提供統一 API,準備模型、最佳化器及 DataLoader,並處理裝置配置和反向傳播。
推薦理由:Accelerate 將 PyTorch 分散式訓練及混合精度所需樣板封裝成少量 API 改動,並提供統一啟動器,呈現減少訓練腳本跨環境改動的實作方式。
Hugging Face 與 Amazon 宣佈戰略合作,推出 Hugging Face Deep Learning Containers,讓用户可在 Amazon SageMaker 訓練 Hugging Face Transformer 模型。
推薦理由:文章展示 Hugging Face 模型在 SageMaker 的訓練接入方式,並稱 SDK 擴展可把實驗設定與執行所需時間由數天縮至數分鐘。
Hugging Face 介紹以 PyTorch / XLA 在 Cloud TPU 訓練 Transformers 的整合方式,並保留 Hugging Face Trainer 原有介面。
推薦理由:文章梳理 PyTorch / XLA 接入 Hugging Face Trainer 的設備選擇、梯度同步與輸入流水線,並説明固定張量形狀對減少編譯成本的作用。
OpenAI 宣佈將其深度學習框架統一採用 PyTorch。
推薦理由:這項公告提供 OpenAI 深度學習框架選擇的背景,並明確指出其組織方向是統一採用 PyTorch。