NVIDIA 在 GTC 2025 宣佈面向 Physical AI 開發者的開源模型與數據集
NVIDIA 在 GTC 2025 發佈 Cosmos Transfer、Physical AI Dataset 和 NVIDIA Isaac GR00T N1 三項 Physical AI 開源資源。
推薦理由:三項資源分別涵蓋可控合成場景、機械人訓練數據與人形機械人推理及技能,呈現 Physical AI 開發中生成、訓練和執行能力的不同分工。
開源模型、框架與倉庫動態:權重開放、社區項目爆火、開源與閉源的力量消長。
NVIDIA 在 GTC 2025 發佈 Cosmos Transfer、Physical AI Dataset 和 NVIDIA Isaac GR00T N1 三項 Physical AI 開源資源。
推薦理由:三項資源分別涵蓋可控合成場景、機械人訓練數據與人形機械人推理及技能,呈現 Physical AI 開發中生成、訓練和執行能力的不同分工。
Mistral AI 發佈 Mistral Small 3.1,改進文本表現與多模態理解,並將上下文窗口擴展至最高 128k tokens。官方稱模型推理速度為 150 tokens per second,表現超越 Gemma 3、GPT-4o Mini 等可比模型,並以 Apache 2.0 授權釋出。
推薦理由:文中將 Mistral Small 3.1 的文本、多模態、長上下文與多語言表現放入同級比較,並列出本地運行條件及下載、API 等使用入口。
Cohere For AI 發佈 Aya Vision 8B 和 32B,這組開放權重視覺語言模型支援 23 種語言。Aya Vision 32B 在 mWildVision 的 23 種語言平均比較中,對參數量超過其 2 倍的模型取得 52% 至 72% 勝率。團隊亦公開 AyaVisionBench,涵蓋 23 種語言、9 類任務,每種語言有 135 組圖像與問題配對,供研究使用。
推薦理由:文章拆解合成標註、多語言資料擴充與多模態模型合併等訓練做法,呈現 Aya Vision 的多語言視覺語言建模路徑。
Mistral AI 發佈 Mistral Small 3,這款 24B 參數低延遲模型採用 Apache 2.0 授權,並提供預訓練及 instruction-tuned checkpoint。
推薦理由:Mistral Small 3 將 24B 參數、Apache 2.0 開放權重和低延遲定位放在同一發佈中,並提供本地量化運行條件,便於比較小型模型的部署選擇。
Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。
推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。
IBM、Princeton、CMU 和 UIUC 合作訓練並推出 Bamba-9B 混合 Mamba2 模型,使用完全開放數據。該模型以 2.2T tokens 訓練;在 vLLM 測試中,相較 Meta Llama 3.1 8B,吞吐量最高提升 2.5 倍,延遲改善 2 倍。
推薦理由:文中對照 Bamba-9B 與 Meta Llama 3.1 8B 的 vLLM 推理數據,並列出數學及 MMLU 評測差距,兼顧效率與基準表現。
Hugging Face 的 83 款開源模型現可透過 Amazon Bedrock Marketplace 部署,模型端點由 Amazon SageMaker JumpStart 管理,並支援 Amazon Bedrock API。
推薦理由:材料交代 Hugging Face 的 83 款開源模型如何在 Bedrock Marketplace 部署,以及 SageMaker JumpStart 管理端點、Bedrock API 負責調用的服務銜接方式。
Hugging Face Blog 發佈 EU AI Act 開源開發者指南,梳理法規對 AI 系統及 GPAI 模型的適用範圍與分級義務。指南聚焦有限風險 AI 系統和非系統性風險開源 GPAI 模型,涵蓋披露 AI 互動、以機器可讀格式標記合成內容、提供訓練內容摘要及尊重版權 opt-out 等要求。
推薦理由:文章區分有限風險 AI 系統與非系統性風險開源 GPAI 模型,梳理透明標示、訓練內容摘要及版權 opt-out 等合規要求。
Hugging Face 發佈 SmolVLM 2B 視覺語言模型系列,提供 Base、Synthetic 和 Instruct 三個版本。模型檢查點、VLM 資料集、訓練配方及工具均採 Apache 2.0 授權開放;模型亦已整合至 transformers。
推薦理由:文中將 SmolVLM 與其他模型的多項基準、GPU 記憶體及吞吐量並列,提供評估小型視覺語言模型效能與資源取捨的依據。
Cohere For AI 發佈 Aya Expanse 8B 和 32B 開放權重模型,並公開多語言訓練流程的技術細節。
推薦理由:文章拆解多語言訓練中的模型池數據仲裁、離線與線上偏好訓練及模型合併流程,呈現改善多語言表現的具體技術路徑。
Hugging Face 發佈 Transformers.js v3,新增 WebGPU 支援和量化格式選擇,支援架構總數增至 120 種。官方稱 WebGPU 最高可比 WASM 快 100 倍;此版本另提供 25 個示例專案與範本,以及超過 1200 個已轉換模型。
推薦理由:這次更新把 WebGPU、量化格式選擇及 120 種架構納入同一 JavaScript 庫,並兼容 Node.js、Deno、Bun,展示其瀏覽器與伺服器端部署路徑。
Mistral AI 公佈多項更新,包括 Mistral Small v24.09、la Plateforme 免費層、模型降價及 le Chat 免費提供 Pixtral 12B 圖像理解。
推薦理由:免費層涵蓋開發者的實驗、評估與原型製作,價格表亦列出模型新舊費率及降幅,呈現試用門檻和 API 成本的變化。
阿布扎比的 Technology Innovation Institute(TII)發佈 Falcon Mamba 7B,這是一款採用純 Mamba 架構、以 TII Falcon Mamba 7B License 1.0 開放存取的模型。
推薦理由:文章並列 Falcon Mamba 的基準表現與長序列生成結果,也説明 sequential prefill 對可處理提示長度的影響。
Hugging Face 宣佈收購 XetHub,並計劃以其技術替換 Hub 現有的 Git LFS 儲存後端。文中舉例,10GB Parquet 檔案新增一行時只需重傳少數區塊;未來修改 GGUF header 的單一 metadata 值,也只需重傳數 KB 的區塊。
推薦理由:XetHub 的分塊與去重技術將用於 Hub 儲存後端,文中的 Parquet 和 GGUF 例子展示小幅修改如何減少大型檔案的重傳量。
Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。
推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。
Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。
推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。
Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。
推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
Hugging Face 與 KerasHub 宣佈共用模型保存格式,讓 Hugging Face Hub 上部分 Transformers 模型可直接載入 KerasHub。首批涵蓋 Gemma 1、Gemma 2、Llama 3 和 PaliGemma;KerasHub 可透過 TensorFlow、JAX 或 PyTorch 後端運行這些模型。
推薦理由:共享模型保存格式讓受支援架構的 Transformers 模型可直接載入 KerasHub,並透過 TensorFlow、JAX 或 PyTorch 後端運行,呈現跨框架使用的實際路徑。
Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。
推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。