Hugging Face 示範 Claude 和 Codex 如何編寫自訂 CUDA kernels
Hugging Face 製作 CUDA kernel 技能,Claude 和 Codex 依此為 diffusers 與 transformers 目標產生可運行的 kernel。
推薦理由:文章拆解如何把 GPU 架構知識、PyTorch 整合範式與基準測試流程封裝成技能,讓編碼智能體產出可構建、可測試的 CUDA kernel 專案。
Hugging Face 製作 CUDA kernel 技能,Claude 和 Codex 依此為 diffusers 與 transformers 目標產生可運行的 kernel。
推薦理由:文章拆解如何把 GPU 架構知識、PyTorch 整合範式與基準測試流程封裝成技能,讓編碼智能體產出可構建、可測試的 CUDA kernel 專案。
Hugging Face 宣佈 Transformers.js v4 已上架 NPM,安裝命令為 `npm i @huggingface/transformers`。
推薦理由:v4 支援 Node、Bun 和 Deno 的 WebGPU 加速,預設網頁版縮小 53%,呈現跨環境部署與下載、啟動效率的具體改進。
Hugging Face Hub 推出 Community Evals,讓 benchmark 資料集託管排行榜,並在模型卡片展示評測分數。使用者可透過 PR 為任意模型提交結果,結果會標示為「community」,且可附上論文、Model Card 或評測日誌等來源。資料集可用 eval.yaml 定義評測規格,供他人重現;這項功能目前處於 beta。
推薦理由:Hugging Face 將評測規格、模型分數與社羣提交納入 Hub 的可追溯流程,Hub 的 Git 歷史記錄新增及修改時間,方便聚合比較不同來源的模型成績。
DeepSeek R1 之後,中國開源 AI 生態正由模型擴展至部署、軟硬件協同與治理,開源成為中國 AI 機構近期的主流路徑。截至 2025 年中,逾 113k 個模型以 Qwen 為基礎,逾 200k 個模型倉庫標記 Qwen,遠多於 Meta 的 Llama(27k)和 DeepSeek(6k)。
Gradio 團隊推出開源 Python 函式庫 Daggr,可用程式串接 Gradio 應用、ML 模型及自訂函數,建立 AI 工作流程。Daggr 會自動生成視覺畫布,供使用者檢視中間輸出、修改輸入並單獨重跑步驟,同時保存工作流程狀態。該工具目前處於 beta,更新期間仍可能發生本機保存資料遺失。
Hugging Face 介紹 upskill 如何以 Claude Opus 4.5 完成 CUDA kernel 任務、從任務軌跡生成 Agent 技能,再評估技能對其他模型的效果。文中一個示例中,unsloth/GLM-4.7-Flash-GGUF:Q4_0 的測試表現由 40% 升至 85%;部分模型使用技能後 token 用量反而增加,文章建議逐一比較。
AssetOpsBench 是面向工業資產運維的 AI 智能體基準與評估系統,從六項質性維度評估智能體表現。它涵蓋 2.3M 個感測遙測點、4.2K 張工單及 53 種結構化失效模式,並以 881 條執行軌跡分析失敗。社羣測試中,沒有受測模型達到部署準備門檻 85 分;多智能體任務準確率為 47%,低於單智能體的 68%。
Transformers v5 將分詞器架構與訓練所得的詞彙、合併規則分離,並在類別中明確呈現正規化器等組件。相較 v4 每個模型各有 slow/fast 兩套實作,v5 改為每個模型一個檔案,預設採用 Rust-based TokenizersBackend;分詞器類別亦可直接實例化並用自有語料訓練。
推薦理由:文章對照 v4 與 v5,説明分離分詞器架構和訓練詞彙後,如何更直接檢查組件,並沿用模型架構訓練自訂分詞器。
Hugging Face 宣佈推出 swift-huggingface,一款提供完整 Hugging Face Hub API 的 Swift 套件,可作為獨立套件使用。
Hugging Face Skills 讓 Claude Code 等編碼智能體透過對話處理模型微調,涵蓋資料集驗證、GPU 選擇、雲端工作提交與進度監控。它亦兼容 Codex 和 Gemini CLI;文中以 Qwen3-0.6B 在 open-r1/codeforces-cots 上進行 SFT 為例,估算使用 t4-small 約需 20 分鐘、成本約 $0.30。
推薦理由:文章將資料集驗證、GPU 選擇、雲端工作提交與進度監控串成智能體訓練流程,並比較 SFT、DPO、GRPO 的適用場景。
Hugging Face 發佈 Transformers v5.0.0rc-0,將簡化模型定義、訓練、推理和生產支援列為重點,並以互操作性貫穿版本改造。
推薦理由:文章説明 Transformers v5 如何銜接訓練工具、推理引擎與本地部署,並呈現其聚焦 PyTorch、提升量化支援的工程取捨。
OVHcloud 已成為 Hugging Face Hub 支援的推理服務提供商,用户可透過 Hub 模型頁面及 JS、Python SDK 使用其服務。OVHcloud AI Endpoints 是全託管無伺服器服務,每百萬個 tokens 收費由 €0.04 起,基建設於歐洲數據中心。服務支援結構化輸出、函數呼叫及文字和圖像處理,首個 token 回應時間低於 200ms。
AnyLanguageModel 是一個 Swift 套件,以 Apple Foundation Models 的 API 為基礎,為 Apple 平台的本地與雲端 LLM 提供統一介面,目標是減少多供應商整合摩擦。
Hugging Face 與 Google Cloud 宣佈深化策略合作,協助企業以開放模型建置及客製化 AI。Google Cloud 客户對 Hugging Face 的使用量在過去 3 年增長 10x,目前每月涉及數十 PB 模型下載及數十億次請求;雙方正建置 CDN Gateway,將模型和資料集快取至 Google Cloud,以縮短下載時間並加強模型供應鏈穩健性。
Hugging Face Blog 提出語音複製「同意閘門」設計並提供示例 Space 和程式碼,系統需先確認説話者已明確同意才會啟動。示例會為每次同意生成一組新句子,分別表達明確同意及補充語音的音素多樣性,並以語音識別確認同意語句。作者指出,仍可能有人用另一個 TTS 系統生成相符語句,並列出音訊來源驗證、説話者嵌入向量相似度及即時錄音 metadata 作為可探索方向。
推薦理由:把每次生成的同意語句與語音辨識綁定,並以同一段錄音作複製輸入,展示了將知情同意設為工作流程前置條件的實作思路。
Hugging Face 發佈 Python 套件 huggingface_hub v1.0,遷移至 httpx,推出重設計的 hf CLI,並將 hf_xet 設為檔案傳輸預設套件。
推薦理由:文章集中説明 httpx、hf CLI 與 hf_xet 的變更,並列出 transformers v4、v5 的版本相容要求,便於維護者評估升級範圍。
Hugging Face 改進 datasets 與 huggingface_hub 的資料集串流,資料檔解析快 10 倍、啟動請求最多減少 100 倍,串流速度最高提升至原來的 2 倍。
推薦理由:文章拆解跨 DataLoader workers 快取與 Parquet 預取如何改善資料解析和吞吐,並列出 256 workers 下的請求量及穩定性結果,呈現大規模串流訓練的優化方向。
LeRobot 發佈 v0.4.0,加入 Datasets v3.0、VLA 模型 PI0 和 PI0.5、GR00T N1.5,以及硬件插件系統。Datasets v3.0 採用分塊 episode 格式並支援串流,可處理 OXE 級(> 400GB)資料集。
推薦理由:資料集規模化、模擬評測、多 GPU 訓練和硬件插件同時更新,勾勒出 LeRobot 從資料處理到機械人控制的工具鏈演進。
Meta 與 Hugging Face 合作推出 OpenEnv Hub,供開發者建立、分享和探索可用於訓練與部署的智能體環境。OpenEnv 以沙盒封裝任務所需工具、API、憑證及執行上下文,並提供清晰語義與隔離控制;團隊同時發布 OpenEnv 0.1 Spec(RFC)徵求社羣意見。
推薦理由:OpenEnv 將智能體任務所需的工具、API、憑證與執行上下文封裝成可分享環境,並銜接訓練和部署,呈現環境規格化的實際用途。
Hugging Face 與 VirusTotal 展開合作,持續掃描 Hugging Face Hub 上 2.2M+ 公開模型及數據集倉庫中的文件。瀏覽倉庫、文件或目錄頁時,Hub 會以文件雜湊值查詢 VirusTotal 的威脅情報資料庫,不會向 VirusTotal 傳送原始文件內容。結果可包括檢測數、已知惡意關聯或相關威脅活動情報,供用户下載或整合文件前參考。
推薦理由:文章交代了以文件雜湊值查詢威脅情報、而不傳送原始文件內容的流程,讓讀者理解安全檢查的資訊來源與隱私邊界。
Sentence Transformers 從 TU Darmstadt 的 UKP Lab 轉由 Hugging Face 接手,Tom Aarsen 繼續領導項目。項目維持社羣驅動及 Apache 2.0 開源授權;Hugging Face Hub 上已有超過 16,000 個 Sentence Transformers 模型。
推薦理由:文章交代維護者接續、基礎設施支援與 Apache 2.0 授權不變,呈現項目轉交後的維護安排和開源承諾。
Hugging Face 為開源工具 AI Sheets 加入視覺功能,讓用户可在試算表中分析圖片、抽取資料、生成及編輯圖像。AI Sheets 透過 Inference Providers 使用數千個開放模型;示例以自訂提示詞從手寫食譜圖片提取文字,並可修訂結果、整理後匯出資料集至 Hub。
推薦理由:這次更新把圖片理解、生成與編輯納入同一試算表流程,並以手寫食譜示範從提示詞抽取文字、修訂結果到匯出資料集的做法。
Hugging Face 更新開放 OCR 模型指南,加入 Chandra、OlmOCR-2 及模型在 OlmOCR Benchmark 的比較分數。指南對照多款模型的輸出格式、語言支援、功能與成本,並介紹 OmniDocBenchmark、OlmOCR-Bench 和 CC-OCR 等評測基準。
推薦理由:文章對照模型能力、輸出格式、評測基準與部署成本,並建議以代表性樣本檢驗不同文件和語言下的表現。
Hugging Face Blog 提供以 Optimum Intel 和 OpenVINO 在 Intel CPU 上本地運行 SmolVLM2-256M-Video-Instruct 的三步教程,涵蓋模型轉換、量化及推理。
推薦理由:文章展示 VLM 在 Intel CPU 上以 OpenVINO 完成轉換、兩種量化和推理的三步流程,並交代靜態量化校準與精度影響。
NVIDIA 發佈 Nemotron-Personas-India,一套依印度人口、地理及文化分佈合成的人物設定數據集,採用 CC BY 4.0 授權。數據集包含 21 million 個人物設定(3M 條記錄、每條 7 個設定),支援英語及以天城文、拉丁字母書寫的印地語,並有 27 個欄位和 7.7 billion tokens。
推薦理由:數據集以印度人口、地域分佈為基礎,涵蓋英語及兩種文字形式的印地語,並採 CC BY 4.0 授權,呈現其作為區域模型訓練素材的語言覆蓋與使用條件。
BigCodeArena 推出以程式碼實際執行評估程式生成模型的平台,讓使用者並排比較模型、測試輸出並投票。平台支援 10 種語言和 8 種執行環境,並已收集逾 14,000 段對話及 4,731 個投票樣本。
推薦理由:平台把程式實際執行和互動測試納入模型比較,並按程式語言與執行環境拆分結果,呈現總體排名之外的表現差異。
Hugging Face Blog 記錄將 RedNote 的 dots.ocr 視覺編碼器轉換至 Core ML,作為探索以 Core ML 和 MLX 在裝置端運行 OCR 的三篇系列首篇。
Hugging Face 的 Swift 函式庫 swift-transformers 發佈 1.0,標誌套件進入穩定階段,並為後續功能迭代奠定基礎。Tokenizers 和 Hub 現已成為頂層模組,套件亦採用支援有狀態模型的 Modern Core ML API,並完整支援 Swift 6。團隊表示,後續將聚焦 MLX 與智能體應用。
Hugging Face 推出 Gaia2 智能體基準及 Meta Agents Research Environments(ARE)框架,用於在更複雜、接近真實情境的環境中執行、除錯和評估智能體。
推薦理由:Gaia2 將智能體評測從唯讀檢索擴展至含模糊指令、時間要求和環境故障的互動任務,ARE 記錄執行 traces,便於分析智能體在複雜情境中的失誤。
Public AI 現已成為 Hugging Face Inference Providers 的支援服務商,用户可在 Hub 模型頁面及 Python、JS SDK 調用其推理服務。
Hugging Face 發佈 LeRobotDataset v3.0,將多個 episode 合併存入單一檔案,並可串流處理大型機械人資料集。v2 每個 episode 各存一個檔案,資料集擴展至數百萬個 episode 時會遇到檔案系統限制;v3 以關聯式 metadata 取得各 episode 資訊。
Hugging Face 為 Gradio 加入可見水印功能,讓開發者可在生成圖片、影片及 AI 文字內容中加入水印。gr.Image 和 gr.Video 可透過 watermark 參數設定水印,聊天介面亦可設定自訂文字水印,使用者複製 AI 回應時會自動附上標示。
Together AI 宣佈可透過其平台微調 Hugging Face Hub 上兼容的 LLM,微調後模型可供推理、下載或推回 Hub。流程以 Together 官方目錄中的基礎模型提供訓練配置,自選的 Hugging Face 模型則是實際微調對象;文中稱一般預期支援 100B params 以下的 CausalLM 模型。
推薦理由:文章交代了基礎模型提供訓練配置、自選 Hub 模型作為微調對象的分工,並列出讀取私有模型與將訓練結果推回 Hub 的接入流程。
mmBERT 以 ModernBERT 為基礎推出,使用超過 3T tokens 的多語言文本訓練,並在最後階段納入 FineWeb2 的 1,833 種語言。
推薦理由:mmBERT 展示分階段擴充語言、逐步降低遮罩率的訓練設計,並報告在最後 100B tokens 才納入的低資源語言上取得明顯提升。
Hugging Face 介紹如何在 ZeroGPU Spaces 使用 PyTorch AoT 編譯,將模型預先編譯後在不同程序中載入,以減少即時編譯造成的冷啟動開銷。
推薦理由:文章拆解 ZeroGPU Spaces 的 PyTorch AoT 編譯流程,並展示量化、動態形狀與區域編譯等可遷移的優化做法。
MCP 讓 AI 智能體透過自然語言使用研究工具,跨 arXiv、GitHub 與 Hugging Face 搜尋論文、程式碼、模型及資料集並交叉查證。Hugging Face 的 Research Tracker MCP 可從 MCP Settings 加入,並按 Claude Desktop、Cursor、Claude Code 或 VS Code 的指引完成設定。
Hugging Face 推出開源無代碼工具 AI Sheets,讓用户使用 AI 模型建立、豐富及轉換資料集。它以試算表介面新增提示詞欄位,支援透過 Inference Providers 使用 Hugging Face Hub 上數以千計的開放模型,也可使用本地模型,並可本機部署或部署至 Hub。
推薦理由:AI Sheets 將提示詞生成、人工校訂與資料集匯出串成工作流,校訂及按讚的儲存格可作為 few-shot 範例供後續生成重用。
Hugging Face 的 TRL 新增視覺語言模型對齊訓練支援,涵蓋 MPO、GRPO、GSPO、RLOO、Online DPO 與原生 SFT 支援。MPO 結合 DPO 偏好損失、BCO 品質損失與 SFT 生成損失,文中引述論文稱該組合在 MathVista 提升 6.2 pts。
OpenAI Developers 示範用 Hugging Face TRL 和 LoRA 微調 openai/gpt-oss-20b,讓模型按指定語言生成鏈式推理。
OpenAI 發佈 GPT OSS 開源模型系列,包含 117B 參數的 gpt-oss-120b 和 21B 參數的 gpt-oss-20b。兩款均為 MoE 推理模型,採用 MXFP4 4-bit 量化;gpt-oss-120b 可在單張 80 GB GPU 運行,gpt-oss-20b 可在 16GB 記憶體內運行。
推薦理由:文章將兩款模型的量化方式、硬件需求與多種部署路徑整理在一起,便於評估本地推理的資源門檻及接入方式。