自主 AI 入侵已成現實:Hugging Face 遭入侵事件的教訓
Hugging Face 披露稱,這宗入侵由自主 AI 智能體系統端到端推動,攻擊者取得主機層級存取權並橫向進入多個內部叢集。入侵以惡意數據集及處理流程中的兩條程式碼執行路徑為突破口,攻擊框架在短命沙盒執行數萬次自動操作,留下逾 17,000 條操作記錄;Hugging Face 的異常偵測流程最先標記事件。
Hugging Face 披露稱,這宗入侵由自主 AI 智能體系統端到端推動,攻擊者取得主機層級存取權並橫向進入多個內部叢集。入侵以惡意數據集及處理流程中的兩條程式碼執行路徑為突破口,攻擊框架在短命沙盒執行數萬次自動操作,留下逾 17,000 條操作記錄;Hugging Face 的異常偵測流程最先標記事件。
Hugging Face 披露,其部分生產基礎設施遭自主 AI 智能體系統入侵,攻擊者存取了有限範圍的內部資料集及多項服務憑證。Hugging Face 已封堵相關程式碼執行路徑、重建受影響節點並輪換憑證;目前未發現公開、面向用户的模型、資料集或 Spaces 遭篡改,合作夥伴或客户資料是否受影響仍在評估。
推薦理由:事件呈現託管模型安全護欄對事故分析的限制,也提供可遷移的準備方向,即預先驗證能在自有基礎設施運行的模型,以保護攻擊資料並維持調查能力。
Hugging Face Blog 的《PyTorch 效能分析》第 3 篇以 profiler traces 對照手寫注意力與 PyTorch SDPA 各後端的執行情況。
推薦理由:文章對照 CPU 與 GPU trace,展示如何從 kernel 數量、資料搬移及 CPU 開銷,辨認注意力實作的效能收益與成本。
Hugging Face 更新 vLLM 的 Transformers 建模後端,令多種相容 LLM 架構的推理吞吐量達到或超過 vLLM 手寫原生實作。測試涵蓋 Qwen3-4B 單 GPU、Qwen3-32B 張量並行,以及 Qwen3-235B-A22B-FP8 MoE 在同一 8×H100 節點上的數據並行與專家並行,三者均達到或超越原生實作吞吐量。
推薦理由:文章以三種不同規模及並行配置的 Qwen3 模型對照 vLLM 手寫實作,並説明 torch.fx 分析與運行時融合如何使相容模型達到原生推理速度。
Hugging Face 與 Amazon SageMaker AI 推出深連結整合,讓開發者可從受支援的模型頁面一鍵進入 SageMaker Studio 的微調或部署流程,並預載所選模型。新流程會在數秒內自動建立已配置權限的 Studio 網域;Studio 亦會顯示 G5、G6 GPU 配額的可用情況。
Hugging Face 與 Microsoft 將每週更新的精選開放權重模型目錄加入 Microsoft Foundry Model Catalog,並可一鍵部署至 Foundry Managed Compute。
推薦理由:文章梳理模型篩選、權重預置和執行環境掃描的上架流程,説明企業如何在私有網絡內部署而毋須連出 Hugging Face Hub。
LeRobot v0.6.0 新增世界模型策略、統一六項模擬基準的 lerobot-eval,以及用於部署和收集人工修正資料的 lerobot-rollout CLI。
推薦理由:版本把策略部署、人工接管修正與資料回訓串成可重複流程,並以統一 CLI 整合六項模擬基準,呈現機械人學習由實作到評估的工作流。
Hugging Face Storage 現已成為 SkyPilot 的一級儲存後端,可透過 hf:// URL 將 Bucket 或 Hub 倉庫接入跨雲任務。
推薦理由:這項整合把模型與數據集的存放位置和 GPU 雲端選擇分開,並明確呈現讀取不收 egress 費與跨雲寫回仍需付費的成本差異。
Hugging Face 為 Kernels 項目推出重大更新,新增 Hub 的 kernel 倉庫類型(https://huggingface.co/kernels),並加入可信發佈者及程式碼簽署機制。
Every Eval Ever(EEE)與 Hugging Face Community Evals 現已互通,評測結果可同步顯示於 Hugging Face 模型頁面及基準排行榜,並連回 EEE 完整記錄。
Hugging Face Blog 示範用一條命令在 HF Jobs 上以 vLLM 啟動私有、OpenAI-compatible 的 LLM 端點。內容提供 curl 和 Python OpenAI client 呼叫範例,並示範以 SSH、Gradio 及 Pi 延伸使用;每次請求須附上具該 Job 讀取權限的 HF token。
推薦理由:文章把 HF Jobs、vLLM 與 OpenAI-compatible API 的部署、驗證和停止流程串成可複用命令,並説明私有端點的 token 權限與成本控制。
Hugging Face 與 Treble Technologies 推出並開放提交 FFASR Leaderboard,這是針對真實遠場聲學條件的開放、社羣協作 ASR 評測基準。
Hugging Face 測試開源模型使用 transformers,CLI 與 Skill 縮短大型模型耗時,卻可能降低小模型成功率。Qwen3-14B 在 classify-sentiment 任務中,clone 環境的匹配率為 100%,Skill 環境則降至 0%。agent-eval CLI 可套用於其他命令列工具,並記錄匹配率、tokens、耗時、錯誤、行為標記及執行軌跡。
推薦理由:評測不只看任務是否成功,也追蹤 tokens、耗時與操作路徑,呈現 CLI 與 Skill 對大小模型的影響並不一致。
GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。
推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。
Hugging Face 推出 Discover Tool,作為 Agentic Resource Discovery(ARD)規範的參考實作,讓智能體可在執行時搜尋並發現能力。
推薦理由:ARD 把能力發現由預先安裝轉為跨登錄表搜尋,Hugging Face Discover 可按需求將 Space 呈現為技能或 MCP 伺服器。
Hugging Face Blog 第二篇 PyTorch 效能分析教程,從 nn.Linear 追蹤至 GeGLU MLP。
推薦理由:文章對比 eager、torch.compile 與 Liger,展示 MLP 融合如何減少 HBM 往返,以及固定形狀特化與跨形狀通用的取捨。
編碼智能體串接兩個 Hugging Face Spaces,生成巴黎地標圖像及 3D Gaussian splats,並將畫廊部署為靜態 Space mishig/monuments-de-paris。
推薦理由:案例展示了透過 Hugging Face Spaces 的 agents.md 串接圖像生成與單圖 3D 重建,並以各一句提示複用到日本及埃及主題畫廊,呈現多媒體工作流的可遷移性。
Hugging Face Blog 示範如何把 GitHub Actions 的 CI 工作交由 Hugging Face Jobs 執行,並以 Trackio 展示透過臨時 self-hosted runner 連接兩者的方式。
推薦理由:文章給出 GitHub Actions 接入 Hugging Face Jobs 的操作流程,並説明 workflow 標籤設定。
Hugging Face 重建 hf CLI,讓它按使用情境為人類與 AI 智能體提供不同格式的輸出,並以可直接執行的提示引導後續操作。
推薦理由:Claude Code 與 Codex 參與 18 項 Hub 任務的多輪測試,文章並列成功率與 token 用量,呈現 hf CLI 相較 curl/Python SDK 在多步操作上的差異。
Reachy Mini 對話應用現可透過 MCP 調用託管於公開 Hugging Face Spaces 的工具,新增能力時毋須把工具程式碼下載到本機。
Hugging Face Blog 發佈 PyTorch 效能分析系列首篇入門指南,示範 torch.profiler 的設定,以及 profiler 表格和 CPU、GPU 軌跡的讀法。
推薦理由:文章以矩陣乘加示範如何結合 profiler 表格與 CPU、GPU 軌跡辨認瓶頸,並區分調度層融合與實際 GPU kernel 融合。
Hugging Face 梳理 AI 智能體常見術語,解釋 Model、Scaffolding、Harness、Agent 等概念及其區別。文中將 Harness 定義為調用模型、處理工具調用及決定何時停止的執行層,Scaffolding 則涵蓋系統提示詞、工具描述、回應解析和上下文管理等行為定義層。
推薦理由:文章以模型、Scaffolding、Harness 與 Agent 的分工建立實用心智模型,並把這套脈絡延伸至訓練術語,便於理解智能體系統的組成與相關討論。
Hugging Face 發佈六款基於 Ettin ModernBERT encoder 的 Sentence Transformers CrossEncoder reranker,參數規模由 17.6M 至 1.00B,並公開訓練數據及完整訓練方案。
推薦理由:文章以 MTEB(eng, v2) Retrieval、NanoBEIR 及多種硬件吞吐測試比較六種尺寸,呈現 Ettin Reranker 在排序品質與速度間的取捨。
PaddleOCR 3.5 為支援的 OCR 與文件解析模型加入 Transformers 推理後端,開發者可透過 `engine` 參數選擇。`engine_config` 可設定 dtype、裝置配置及 attention implementation;若優先考慮 OCR 或文件解析吞吐量,文章通常建議使用預設的 paddle_static 後端。
IBM Granite 發佈兩款採 Apache 2.0 授權的多語嵌入模型:97M 參數的 granite-embedding-97m-multilingual-r2 和 311M 參數的 granite-embedding-311m-multilingual-r2。
推薦理由:文章提供 97M 與 311M 版本在多語檢索、長文及程式碼基準的比較,並交代 Matryoshka 維度選項對儲存與部署取捨的影響。
Hugging Face 為 Open ASR Leaderboard 加入 Appen Inc. 和 DataoceanAI 提供的私有英語 ASR 評測資料集,涵蓋多種口音及朗讀式、對話式語音。
Hugging Face Inference Providers 現已支援 DeepInfra,初期提供對話與文本生成,可使用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等開放權重 LLM。
Hugging Face Blog 提供 Transformers.js 在 Chrome Manifest V3 擴充功能中運行本地 AI 的實作指南。範例將模型初始化、推理和工具執行集中在背景 service worker,側邊欄提供聊天介面,content script 負責網頁內容擷取及元素標記。
推薦理由:文章拆解 Manifest V3 擴充功能內模型推理、對話狀態與頁面操作的分工,並説明背景 service worker 如何協調模型載入、工具執行與介面訊息。
Overworld 推出 Waypoint-1.5 即時影片世界模型,提升視覺保真度並擴大可本地運行的硬件範圍。桌面硬件 RTX 3090 至 5090 可生成最高 720p、60 FPS 的即時環境;另有面向更廣泛消費級硬件(包括遊戲筆電)的 360p 版本,Apple Silicon Mac 支援即將推出。
推薦理由:Waypoint-1.5 分設 720p 與 360p 檔位,並列明 RTX 3090 至 5090 可達最高 720p、60 FPS,呈現其畫質與本地硬件覆蓋方案。
Sentence Transformers v5.4 的同一 API 現可編碼並比較文字、圖像、音訊和影片,文章示範其多模態嵌入與 reranker 用法。嵌入模型將不同模態映射至共享嵌入空間;預訓練多模態 reranker 目前主要處理文字與圖像配對。示例涵蓋跨模態檢索、混合模態文件重排及先檢索再重排流程,並列出輸入格式、支援模型和安裝依賴。
推薦理由:文章展示 Sentence Transformers v5.4 的跨模態檢索與 reranker 重排流程,並整理支援模型和輸入格式,提供實作參考。
Safetensors 加入 Linux Foundation 旗下的 PyTorch Foundation,成為基金會託管項目。商標、倉庫及項目治理歸 Linux Foundation,Hugging Face 的兩名核心維護者仍在 Technical Steering Committee,並繼續負責日常工作。
推薦理由:Safetensors 轉由 Linux Foundation 治理,原維護者仍帶領項目,使用者所用格式與 API 不變。
Gradio 介紹 gradio.Server,讓自訂前端可使用 Gradio 的後端能力,同時採用自選的前端框架。gradio.Server 擴展 FastAPI,提供自訂路由等功能,並加入 Gradio 的佇列、SSE 串流、並發控制和 gradio_client 相容性。
推薦理由:文章以圖像去背示例展示如何讓自訂 HTML/CSS/JS 前端透過 gradio.Server 使用 Gradio 佇列、並發控制與 ZeroGPU,提供兼顧介面自由度和後端管理的實作參考。
Granite 4.0 3B Vision 現已推出,是面向企業文件理解的緊湊型視覺語言模型,支援表格抽取、圖表理解及語義鍵值對抽取。模型以 LoRA adapter 形式構建於 Granite 4.0 Micro 之上,可獨立使用或配合 Docling,並以 Apache 2.0 授權在 Hugging Face 提供。
Hugging Face 發佈 TRL v1.0,將已實作超過 75 種後訓練方法的研究程式碼庫明確定位為具穩定性契約的函式庫。穩定核心遵循語義化版本,實驗層則可快速變動;從最後一個 0.x 版本升級只需少量遷移。
推薦理由:TRL v1.0 把遵循語義化版本的穩定核心與可快速變動的實驗層置於同一套函式庫,呈現下游穩定需求與新方法迭代之間的契約設計。
Hugging Face 的 2026 年春季報告梳理過去一年開源 AI 生態的變化,指出平台用户、模型和數據集數量均接近翻倍。2025 年,Hugging Face 增至 13 million 名用户、逾 2 million 個公開模型及逾 500,000 個公開數據集;中國模型在過去一年佔平台下載量 41%,並在月度及總下載量上超越美國。
推薦理由:報告把平台增長、地域下載差異和衍生模型放在同一框架,呈現開源 AI 並非單一市場,而是由多個重疊的子生態構成。
Hugging Face 在 Hub 推出 Storage Buckets,為頻繁變動的 ML 產物提供非版本化 S3 類物件儲存。Buckets 建基於 Xet,以分塊及跨檔案去重減少重複傳輸;Enterprise 計費按去重後的儲存量計算。
推薦理由:文章交代 Buckets 與版本化倉庫分別承擔工作層和發布層,並説明 Xet 去重如何減少重複傳輸及 Enterprise 的計費儲存量。
LeRobot 團隊發佈 v0.5.0,擴展機械人硬件、策略模型、資料集處理及模擬環境支援。版本加入 Unitree G1 人形機械人完整支援(包括全身控制)、Pi0-FAST 自回歸 VLA 及 Real-Time Chunking,並新增 EnvHub 以從 Hugging Face Hub 載入模擬環境,亦整合 NVIDIA IsaacLab-Arena。
推薦理由:版本把人形機械人控制、即時推理、模擬環境和資料提速納入同次更新,呈現 LeRobot 從硬件接入至訓練工具鏈的擴展範圍。
Hugging Face 推出 Modular Diffusers,讓使用者以可重用區塊組合擴散模型流程,作為現有 DiffusionPipeline 的更靈活、可組合替代方案。
推薦理由:文章以現成流程、自訂區塊及 Hub 分享示例,展示如何把擴散工作流拆成可檢視、替換並重新組合的元件。
GGML 團隊加入 Hugging Face,並將持續維護 llama.cpp;Hugging Face 會為項目提供長期資源支持。團隊仍將 100% 時間用於維護,並對技術方向及社羣保有完全自主權與領導權;項目會繼續 100% 開源並由社羣推動。雙方計劃讓 transformers library 的模型定義更順暢地用於 llama.cpp,並改善 ggml 軟件封裝及本地模型部署體驗。
推薦理由:文章交代 GGML 團隊加入後 llama.cpp 的維護自主權與資源支持,也列出連接 transformers library 模型定義及改善本地部署體驗的方向。
Gradio 6 的 gr.HTML 現支援自訂 HTML 模板、作用域 CSS 與 JavaScript 互動,讓 LLM 可把前端、後端和狀態管理整合到單一 Python 檔案,構建互動式 Web 應用。