Hugging Face Transformers 計劃推動模型定義標準化
Hugging Face 表示,Transformers 將朝跨框架模型定義標準化發展,目標是讓其支援的模型架構更易被其他生態工具採用。目前 Transformers 支援 300+ 種模型架構,平均每週新增約 3 種;團隊計劃簡化建模程式碼和 API,並加強模組化模型定義。
推薦理由:文章交代 Transformers 希望成為跨框架模型定義的共同基礎,並列出簡化模型貢獻流程、提升訓練與推理工具互通的具體方向。
Hugging Face 表示,Transformers 將朝跨框架模型定義標準化發展,目標是讓其支援的模型架構更易被其他生態工具採用。目前 Transformers 支援 300+ 種模型架構,平均每週新增約 3 種;團隊計劃簡化建模程式碼和 API,並加強模組化模型定義。
推薦理由:文章交代 Transformers 希望成為跨框架模型定義的共同基礎,並列出簡化模型貢獻流程、提升訓練與推理工具互通的具體方向。
Hugging Face 收購 Pollen Robotics,並開始銷售其開源人形機械人 Reachy 2。Reachy 2 可透過 sales@pollen-robotics.com 電郵訂購,價格為 $70,000,適用於研究、教育和具身 AI 實驗,並兼容 VR。
推薦理由:這宗收購把 Hugging Face 的 LeRobot 開源機械人項目與 Pollen Robotics 的硬件團隊納入同一組織,呈現其軟硬件佈局。
Language Technologies Lab 發佈 Visual Salamandra,將 7B 參數的 Salamandra 模型擴展至圖像與影片理解。
Hugging Face 將 Intel Gaudi 硬件支援原生整合至 Text Generation Inference(TGI)主線程式碼,令大語言模型推理服務可直接部署於 Gaudi。整合支援 Gaudi1、Gaudi2、Gaudi3、多卡推理、視覺語言模型及 FP8 量化,並提供版本為 3.2.1-gaudi 的官方 Docker 映像。
DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。
推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。
NVIDIA 在 GTC 2025 發佈 Cosmos Transfer、Physical AI Dataset 和 NVIDIA Isaac GR00T N1 三項 Physical AI 開源資源。
推薦理由:三項資源分別涵蓋可控合成場景、機械人訓練數據與人形機械人推理及技能,呈現 Physical AI 開發中生成、訓練和執行能力的不同分工。
Mistral AI 發佈 Mistral Small 3.1,改進文本表現與多模態理解,並將上下文窗口擴展至最高 128k tokens。官方稱模型推理速度為 150 tokens per second,表現超越 Gemma 3、GPT-4o Mini 等可比模型,並以 Apache 2.0 授權釋出。
推薦理由:文中將 Mistral Small 3.1 的文本、多模態、長上下文與多語言表現放入同級比較,並列出本地運行條件及下載、API 等使用入口。
Cohere For AI 發佈 Aya Vision 8B 和 32B,這組開放權重視覺語言模型支援 23 種語言。Aya Vision 32B 在 mWildVision 的 23 種語言平均比較中,對參數量超過其 2 倍的模型取得 52% 至 72% 勝率。團隊亦公開 AyaVisionBench,涵蓋 23 種語言、9 類任務,每種語言有 135 組圖像與問題配對,供研究使用。
推薦理由:文章拆解合成標註、多語言資料擴充與多模態模型合併等訓練做法,呈現 Aya Vision 的多語言視覺語言建模路徑。
Mistral AI 發佈 Mistral Small 3,這款 24B 參數低延遲模型採用 Apache 2.0 授權,並提供預訓練及 instruction-tuned checkpoint。
推薦理由:Mistral Small 3 將 24B 參數、Apache 2.0 開放權重和低延遲定位放在同一發佈中,並提供本地量化運行條件,便於比較小型模型的部署選擇。
Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。
推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。
Hugging Face 為 Text Generation Inference(TGI)引入多後端架構,讓 TGI 作為統一前端接入不同推理引擎,並按模型、硬件及效能需求切換後端。團隊正與 NVIDIA TensorRT-LLM 團隊合作,並計劃於 Q1 '25 將 vLLM 整合為 TGI 後端。TGI Backends 將很快可於 Inference Endpoints 使用。
Hugging Face 從倫理角度分析 AI 智能體,指出自主性愈高、人類交出的控制愈多,相關風險也隨之增加,並建議不要開發完全自主的智能體。文章認為,半自主智能體的效益與風險取決於自主程度、可執行任務及人類控制方式,並梳理準確性、私隱、安全和信任等面向的取捨。作者建議建立嚴謹評估、追蹤社會影響並加強透明披露,也認為開源有助擴大參與和問責。
IBM、Princeton、CMU 和 UIUC 合作訓練並推出 Bamba-9B 混合 Mamba2 模型,使用完全開放數據。該模型以 2.2T tokens 訓練;在 vLLM 測試中,相較 Meta Llama 3.1 8B,吞吐量最高提升 2.5 倍,延遲改善 2 倍。
推薦理由:文中對照 Bamba-9B 與 Meta Llama 3.1 8B 的 vLLM 推理數據,並列出數學及 MMLU 評測差距,兼顧效率與基準表現。
Technology Innovation Institute(TII)發佈 Falcon3 開放模型系列,推出 Falcon3-1B-Base、Falcon3-3B-Base、Falcon3-7B-Base、Falcon3-10B-Base 及 Falcon3-Mamba-7B-Base 五款基礎模型。
Hugging Face 與 Entalpic 宣佈啟動開源協作計劃 LeMaterial,並發布首個數據集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD,含 6.7M 條目及 7 項材料屬性,採用 CC-BY-4.0 授權。
Hugging Face 的 83 款開源模型現可透過 Amazon Bedrock Marketplace 部署,模型端點由 Amazon SageMaker JumpStart 管理,並支援 Amazon Bedrock API。
推薦理由:材料交代 Hugging Face 的 83 款開源模型如何在 Bedrock Marketplace 部署,以及 SageMaker JumpStart 管理端點、Bedrock API 負責調用的服務銜接方式。
Data is Better Together 社羣發佈採 Apache 2.0 授權的文生圖偏好數據集 open-image-preferences-v1,涵蓋多種生成類別、模型系列及提示詞複雜度。
Hugging Face Blog 發佈 EU AI Act 開源開發者指南,梳理法規對 AI 系統及 GPAI 模型的適用範圍與分級義務。指南聚焦有限風險 AI 系統和非系統性風險開源 GPAI 模型,涵蓋披露 AI 互動、以機器可讀格式標記合成內容、提供訓練內容摘要及尊重版權 opt-out 等要求。
推薦理由:文章區分有限風險 AI 系統與非系統性風險開源 GPAI 模型,梳理透明標示、訓練內容摘要及版權 opt-out 等合規要求。
Hugging Face 發佈 SmolVLM 2B 視覺語言模型系列,提供 Base、Synthetic 和 Instruct 三個版本。模型檢查點、VLM 資料集、訓練配方及工具均採 Apache 2.0 授權開放;模型亦已整合至 transformers。
推薦理由:文中將 SmolVLM 與其他模型的多項基準、GPU 記憶體及吞吐量並列,提供評估小型視覺語言模型效能與資源取捨的依據。
Cohere For AI 發佈 Aya Expanse 8B 和 32B 開放權重模型,並公開多語言訓練流程的技術細節。
推薦理由:文章拆解多語言訓練中的模型池數據仲裁、離線與線上偏好訓練及模型合併流程,呈現改善多語言表現的具體技術路徑。
dottxt 與 Hugging Face 合作推出 outlines-core,將 Outlines 的結構化生成核心算法移植至 Rust。項目現已公開並整合至 outlines,Python 綁定版本 0.1.0 已推出,索引編譯速度平均提升 2x。輕量化核心讓其他程式庫更易整合結構化生成,亦可建立 Python 以外語言的綁定。
Hugging Face 發佈 Transformers.js v3,新增 WebGPU 支援和量化格式選擇,支援架構總數增至 120 種。官方稱 WebGPU 最高可比 WASM 快 100 倍;此版本另提供 25 個示例專案與範本,以及超過 1200 個已轉換模型。
推薦理由:這次更新把 WebGPU、量化格式選擇及 120 種架構納入同一 JavaScript 庫,並兼容 Node.js、Deno、Bun,展示其瀏覽器與伺服器端部署路徑。
Mistral AI 公佈多項更新,包括 Mistral Small v24.09、la Plateforme 免費層、模型降價及 le Chat 免費提供 Pixtral 12B 圖像理解。
推薦理由:免費層涵蓋開發者的實驗、評估與原型製作,價格表亦列出模型新舊費率及降幅,呈現試用門檻和 API 成本的變化。
Hugging Face Blog 的 ggml 入門指南介紹這個以 Transformer 推理為重點的 C/C++ 機器學習函式庫,並示範其基本用法。文章解釋 ggml_context、ggml_cgraph、ggml_backend 等概念,透過矩陣乘法展示張量建立、計算圖執行和 backend 記憶體配置流程。
阿布扎比的 Technology Innovation Institute(TII)發佈 Falcon Mamba 7B,這是一款採用純 Mamba 架構、以 TII Falcon Mamba 7B License 1.0 開放存取的模型。
推薦理由:文章並列 Falcon Mamba 的基準表現與長序列生成結果,也説明 sequential prefill 對可處理提示長度的影響。
Hugging Face 宣佈收購 XetHub,並計劃以其技術替換 Hub 現有的 Git LFS 儲存後端。文中舉例,10GB Parquet 檔案新增一行時只需重傳少數區塊;未來修改 GGUF header 的單一 metadata 值,也只需重傳數 KB 的區塊。
推薦理由:XetHub 的分塊與去重技術將用於 Hub 儲存後端,文中的 Parquet 和 GGUF 例子展示小幅修改如何減少大型檔案的重傳量。
Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。
推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。
Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。
推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。
Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。
推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
Hugging Face 與 KerasHub 宣佈共用模型保存格式,讓 Hugging Face Hub 上部分 Transformers 模型可直接載入 KerasHub。首批涵蓋 Gemma 1、Gemma 2、Llama 3 和 PaliGemma;KerasHub 可透過 TensorFlow、JAX 或 PyTorch 後端運行這些模型。
推薦理由:共享模型保存格式讓受支援架構的 Transformers 模型可直接載入 KerasHub,並透過 TensorFlow、JAX 或 PyTorch 後端運行,呈現跨框架使用的實際路徑。
Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。
推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。
Hugging Face 計劃重新設計 Transformers 文件,令內容更貼合開發者需要,並改善導覽與內容整合。文件原為機器學習工程師與研究人員而寫,後隨文本、LLM及優化等階段逐步擴充,造成內容分散、結構僵化和導覽困難。重設方向是以程式碼示例和解決方案為先,結合初階機器學習概念,並採用可自然擴展的靈活架構。
TII 發佈 Falcon 2 系列的 11B LLM 與 11B VLM,VLM 可接收圖像並回答相關問題。LLM 使用逾 5000B tokens 訓練,主要支援英語,並對另外 10 種語言具備良好能力。VLM 結合 CLIP ViT-L/14 視覺編碼器,先以 558K 圖像描述配對訓練多模態投影器,再以 1.2M 圖像文字指令資料微調。
Hugging Face 宣佈把 AMD Instinct MI300 整合至平台,透過 Transformers、text-generation-inference 等工具部署模型時無需改動程式碼。
推薦理由:文章比較 Azure MI300X 與 MI250 執行 Llama 3 70B 推理和微調的結果,並公開基準程式碼,便於核對性能差異及復現測試。
Hugging Face 宣佈推出 Dell Enterprise Hub,讓企業透過 Dell 平台在本地訓練和部署開源模型。平台提供包括 Llama 3、Mixtral 和 Gemma 在內的精選開源模型,可按授權或模型大小篩選,並查看模型資訊及適用的 Dell 平台。
Hugging Face 與 Microsoft 宣佈加深合作,擴充 Azure AI Studio 中可一鍵部署的 Hugging Face Collection,並推出 Spaces Dev Mode。
Hugging Face 推出 Open CoT Leaderboard,透過比較 LLM 使用與不使用 CoT 提示時的準確率差值,衡量 CoT 帶來的準確率增益。
Meta 發佈開源大語言模型 Llama 3,提供 8B、70B 兩種參數規模,各有 base 與指令微調版本。模型上下文窗口為 8K tokens,另有以 Llama 3 8B 微調的 Llama Guard 2;授權允許再分發、微調和衍生作品,並要求衍生模型名稱以 Llama 3 開頭,衍生作品或服務標示 Built with Meta Llama 3。
推薦理由:文章梳理了 Llama 3 的型號、授權要求,以及 Hugging Face 上的推理部署和微調入口,呈現從模型取得到實際使用的主要路徑。
Mistral AI 發佈 Mixtral 8x22B 開放模型,採用稀疏混合專家(SMoE)架構,141B 參數中有 39B 為活躍參數,並以 Apache 2.0 授權發布。
推薦理由:Mixtral 8x22B 公開了參數規模、授權條款與多項基準結果,讓讀者可比較其開放使用條件及數學、編碼表現。