Xet 儲存進入 Hugging Face Hub,首批倉庫完成 4.5 TB 遷移
Hugging Face 已將首批模型與數據集倉庫由 LFS 遷移至 Xet 儲存,總量 4.5 TB,並把 Hub 約 6% 的下載流量切至 Xet 基礎設施。
推薦理由:文章以首批倉庫遷移為例,交代下載開銷與節點負載失衡如何在真實流量下浮現,以及分階段遷移如何避免服務中斷。
Hugging Face 已將首批模型與數據集倉庫由 LFS 遷移至 Xet 儲存,總量 4.5 TB,並把 Hub 約 6% 的下載流量切至 Xet 基礎設施。
推薦理由:文章以首批倉庫遷移為例,交代下載開銷與節點負載失衡如何在真實流量下浮現,以及分階段遷移如何避免服務中斷。
Hugging Face 推出 FastRTC,這是一個讓開發者以 Python 建構即時音訊與影片 AI 應用的通訊程式庫。它內置語音偵測與輪次控制,提供支援 WebRTC 的 Gradio UI,並可將 Stream 掛載至 FastAPI 應用;亦支援 WebSocket。程式庫另提供語音轉文字、文字轉語音等工具,並可接駁不同 LLM、語音 API 或語音到語音模型。
推薦理由:FastRTC 將語音偵測、輪次控制和即時通訊整合起來,並提供 Gradio 測試介面及 FastAPI 部署方式,展示以 Python 搭建即時語音應用的實作流程。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家無伺服器推理服務商,並將它們接入模型頁面及 JavaScript、Python 客户端 SDK。
Mistral 推出 24B 參數的區域語言模型 Mistral Saba,支援阿拉伯語及多種印度源語言,並在 Tamil 等南印度源語言上表現尤佳。Mistral 稱,Mistral Saba 的回答比規模超過其 5 倍的模型更準確、相關,且速度更快、成本更低。它可透過 API 使用,也可在客户安全環境內本地部署,並能在單 GPU 系統上以每秒超過 150 tokens 的速度回應。
Hugging Face Hub 新增 Fireworks.ai 推理服務支援,用户可在模型頁面及 HF 工具與函式庫中使用無伺服器推理。
這項基準測試比較文字分類、文本嵌入及視覺嵌入的推理配置,估算處理 1B 筆輸入的成本與延遲。在 nvidia-L4($0.8/hr)上,三類任務每 1B 筆輸入的成本分別為 $253.82、$409.44 和 $44,496.51;測試程式碼見 https://github.com/datavistics/encoder-analysis。
推薦理由:三類實測呈現 GPU、batch size 與並行 VUs 對成本和延遲的影響,並提供可替換模型與硬件重跑的流程,供讀者估算自有配置處理 1B 筆輸入的開支。
Mistral AI 發佈 Mistral Small 3,這款 24B 參數低延遲模型採用 Apache 2.0 授權,並提供預訓練及 instruction-tuned checkpoint。
推薦理由:Mistral Small 3 將 24B 參數、Apache 2.0 開放權重和低延遲定位放在同一發佈中,並提供本地量化運行條件,便於比較小型模型的部署選擇。
Hugging Face 將 fal、Replicate、Sambanova 和 Together AI 四家無伺服器推理服務整合至 Hub 模型頁面及 JS、Python SDK。用户可使用自己的供應商 API key 直接呼叫並由供應商收費,也可透過 Hugging Face 路由請求,按供應商標準 API 價格計費且不加價。
推薦理由:四家無伺服器推理服務接入 Hub 模型頁面及 SDK,文章亦交代自帶供應商 API key 與 Hugging Face 路由的調用和計費差異,便於評估接入方式。
Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。
推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。
Hugging Face 為 Text Generation Inference(TGI)引入多後端架構,讓 TGI 作為統一前端接入不同推理引擎,並按模型、硬件及效能需求切換後端。團隊正與 NVIDIA TensorRT-LLM 團隊合作,並計劃於 Q1 '25 將 vLLM 整合為 TGI 後端。TGI Backends 將很快可於 Inference Endpoints 使用。
Hugging Face Blog 公開兩款靜態嵌入模型,稱其 CPU 推理比常見嵌入模型快 100 至 400 倍,且多項基準保留至少 85% 表現。
推薦理由:文章公開兩款模型的訓練配方與資料集,並以 NanoBEIR 結果呈現靜態嵌入模型在 CPU 速度與檢索品質間的取捨。
Hugging Face 的 83 款開源模型現可透過 Amazon Bedrock Marketplace 部署,模型端點由 Amazon SageMaker JumpStart 管理,並支援 Amazon Bedrock API。
推薦理由:材料交代 Hugging Face 的 83 款開源模型如何在 Bedrock Marketplace 部署,以及 SageMaker JumpStart 管理端點、Bedrock API 負責調用的服務銜接方式。
Mistral AI 推出 Batch API,讓 La Plateforme 上的 Mistral 模型以批次方式處理高流量請求,成本比同步 API 呼叫低 50%。
推薦理由:Batch API 將高流量請求的成本降至同步 API 呼叫的一半,並以檔案提交、處理後下載的流程,適合不要求同步回覆的批量任務。
Promega 採取由上而下的 ChatGPT 應用方式,帶動製造、銷售及市場營銷業務提速。
Hugging Face 宣佈與 Protect AI 合作,並將 Guardian 整合至 Hub 掃描套件,所有公開模型倉庫在推送檔案後都會自動接受掃描。
dottxt 與 Hugging Face 合作推出 outlines-core,將 Outlines 的結構化生成核心算法移植至 Rust。項目現已公開並整合至 outlines,Python 綁定版本 0.1.0 已推出,索引編譯速度平均提升 2x。輕量化核心讓其他程式庫更易整合結構化生成,亦可建立 Python 以外語言的綁定。
Stable Diffusion 3.5 Large(8B)及其 timestep 蒸餾版(8B)已在 Hugging Face Hub 提供,並可透過 Diffusers 進行推理與訓練。
推薦理由:文章把 Diffusers 中的量化推理與 LoRA 微調落到具體步驟,並提供在 24GB VRAM 消費級 GPU 上微調 SD3.5 Large 的參考路徑。
Hugging Face 發佈 Transformers.js v3,新增 WebGPU 支援和量化格式選擇,支援架構總數增至 120 種。官方稱 WebGPU 最高可比 WASM 快 100 倍;此版本另提供 25 個示例專案與範本,以及超過 1200 個已轉換模型。
推薦理由:這次更新把 WebGPU、量化格式選擇及 120 種架構納入同一 JavaScript 庫,並兼容 Node.js、Deno、Bun,展示其瀏覽器與伺服器端部署路徑。
Hugging Face 示範以自訂 Docker 映像,將 Speech-to-Speech(S2S)流程部署至 Hugging Face Inference Endpoints。
推薦理由:文章把多模型語音流程拆解為自訂 Docker 映像、端點設定和 WebSocket 音訊服務等步驟,提供部署複雜推理管線時可參照的實作路徑。
Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。
推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。
Hugging Face Blog 示範如何用 Optimum-Intel 和 OpenVINO GenAI 優化 Transformers 模型,並部署至邊緣或客户端環境。
Mistral AI 公佈多項更新,包括 Mistral Small v24.09、la Plateforme 免費層、模型降價及 le Chat 免費提供 Pixtral 12B 圖像理解。
推薦理由:免費層涵蓋開發者的實驗、評估與原型製作,價格表亦列出模型新舊費率及降幅,呈現試用門檻和 API 成本的變化。
Hugging Face 發佈 Accelerate 1.0.0 首批候選版本,供社羣在正式版推出前試用及遷移。文章列出多項棄用項目及替代寫法,並提供 `pip install --pre accelerate` 試用方式。Accelerate 支援 CPU、GPU、TPU、XPU、NPU、MLU 六類硬件加速器,並可維持 99% 原有訓練迴圈。
Hugging Face Blog 介紹 Hugging Face Hub 上 5 項常被忽略的工具,並以 Reddit 資料展示自動更新的視覺化語義搜尋流程。
推薦理由:文章以每日更新的 Reddit 資料為例,拆解 Hugging Face Hub 五項工具如何協作,從資料抓取、嵌入向量處理與事件觸發,直到視覺化語義搜尋。
Hugging Face Blog 提供了在 Google Cloud Vertex AI 部署 Meta Llama 3.1 405B Instruct FP8 的操作教程,並示範如何以 Text Generation Inference(TGI)執行線上推理。
Hugging Face Blog 的 ggml 入門指南介紹這個以 Transformer 推理為重點的 C/C++ 機器學習函式庫,並示範其基本用法。文章解釋 ggml_context、ggml_cgraph、ggml_backend 等概念,透過矩陣乘法展示張量建立、計算圖執行和 backend 記憶體配置流程。
Mistral AI 宣佈在 La Plateforme 開放旗下旗艦及專用模型自訂,並推出 Agents 早期版本及 mistralai 1.0 客户端 SDK。
推薦理由:這次發布把模型自訂、Agents 工作流程與客户端 SDK 更新並列,呈現 Mistral AI 如何涵蓋應用構建中的模型調整、流程編排和程式接入環節。
Hugging Face 示範如何在 Diffusers 中使用 Quanto 量化 Transformer-based diffusion pipeline,以降低推理時的 GPU 記憶體佔用。
推薦理由:文章提供在 Diffusers 中以 Quanto 量化擴散 Transformer 與文字編碼器的操作步驟,並用記憶體和延遲數據呈現精度設定的取捨。
Hugging Face 的 TGI 推出 Multi-LoRA serving,讓單一基礎模型可按請求動態選用不同 LoRA adapter,以一個部署服務多個微調模型。文中以 mistralai/Mistral-7B-v0.1 示範,載入 30 個 adapter 時 VRAM 增幅為 3%;實際可載入數量取決於 GPU 資源和所部署模型。
推薦理由:文章以 TGI 的部署及調用示例,展示單一基礎模型按請求選用不同 LoRA adapter 的做法,並比較多模型部署的成本與擴展管理。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
Hugging Face Blog 示範如何用 distilabel 為 Argilla 2.0 技術文件建立 RAG 聊天機械人。流程包括從文件建立切塊與合成查詢三元組、微調領域嵌入模型、建立向量資料庫,並將 Gradio 應用部署至 Hugging Face Spaces。聊天互動會記錄在 Argilla,供持續評估與改進。
推薦理由:文章串起文件切塊、合成查詢三元組、微調領域嵌入模型、向量檢索與對話評估,提供一套可複用的文件問答 RAG 實作流程。
Hugging Face 與 KerasHub 宣佈共用模型保存格式,讓 Hugging Face Hub 上部分 Transformers 模型可直接載入 KerasHub。首批涵蓋 Gemma 1、Gemma 2、Llama 3 和 PaliGemma;KerasHub 可透過 TensorFlow、JAX 或 PyTorch 後端運行這些模型。
推薦理由:共享模型保存格式讓受支援架構的 Transformers 模型可直接載入 KerasHub,並透過 TensorFlow、JAX 或 PyTorch 後端運行,呈現跨框架使用的實際路徑。
Hugging Face 宣佈,Google Cloud TPU v5e 現已支援 Inference Endpoints 和 Spaces,可用於部署生成式 AI 模型及運行 AI 示範應用。
Banque des Territoires、Polyconseil 與 Hugging Face 完成 EduRénov 首階段合作,開發主權數據 RAG 工具以支援地方政府。EduRénov 旨在協助 10,000 項公立學校設施翻新工程,並在 5 年內實現 40% 能源節省。項目要求確保所用運算服務與模型的主權。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。
Hugging Face 宣佈 Embedding Container for Amazon SageMaker 正式 GA,AWS 客户可在 SageMaker 部署嵌入向量模型,支援包括 RAG 在內的生成式 AI 應用。
Hugging Face 為 Intel Gaudi 適配並優化輔助生成,並將支援納入 Optimum Habana。該方法先由草稿模型生成 K 個 tokens,再交由目標模型評估;大型 Transformer 模型通常可提速約 2x,並維持與自回歸採樣相同的採樣品質。
Hugging Face 介紹如何使用 TGI Benchmarking 工具,測量 Text Generation Inference(TGI)在不同 batch size 下的吞吐量與延遲,並據此調整部署設定。
Hugging Face Inference Endpoints 新增 AWS Inferentia2 執行個體選項,使用者可從 Hugging Face Hub 部署支援的模型。
Hugging Face Spaces 推出 Dev Mode,讓用户可透過 VS Code 或 SSH 直接連接 Space 並編輯程式碼。功能目前處於 beta,供 PRO 訂閲者使用;修改後可在 Space 點擊「Refresh」測試,無需先推送變更或重建容器。確認修改後,可透過 commit and merge 保存。