Jais 2 推出 8B 和 70B 阿拉伯語大型語言模型,展示主權 AI 開發藍圖
G42 旗下 Inception、MBZUAI 基礎模型研究所與 Cerebras Systems 推出 Jais 2 阿拉伯語大型語言模型系列,包含 8B 和 70B 型號。
G42 旗下 Inception、MBZUAI 基礎模型研究所與 Cerebras Systems 推出 Jais 2 阿拉伯語大型語言模型系列,包含 8B 和 70B 型號。
Zyphra 發佈 380M 參數的 ZUNA,這是一款用於腦電圖(EEG)訊號去噪、重建及上採樣的擴散自編碼器基礎模型。在通道缺失超過 75% 時,ZUNA 在所有評估數據集均優於球面樣條插值;模型亦可按電極座標預測新通道訊號。模型以約 2 million channel-hours EEG 數據訓練,並按 Apache 2.0 授權發佈模型權重及推理、預處理程式碼。
Prime Intellect 發佈開放數據集 SYNTHETIC-2,收錄 400 萬條經驗證的推理軌跡,涵蓋複雜強化學習任務。全球共有 1,253 張 GPU 參與生成;TOPLOC v2 的誤報率為 0.000925%,證明驗證中位成本跨模型平均比重新執行原始推理低 25 倍。
Liquid AI 發佈 LFM2-24B-A2B 早期檢查點,這款開放權重 MoE 模型有 24B 總參數,並已在 Hugging Face 提供。
Liquid AI 發佈 LFM2.5-VL-450M,作為 LFM2-VL-450M 的改進版本,提升視覺定位與指令遵循能力,並新增函數調用支援。預訓練規模由 10T 增至 28T tokens;RefCOCO-M 邊界框預測分數由 0 升至 81.28,MMMB 多語言分數由 54.29 提升至 68.09。
METR 總裁 Chris Painter 於 2026 年 9 月 30 日向美國參議院作證,分析 OpenAI/Hugging Face 事件及 AI 智能體風險。
Thinking Machines Lab 發佈從零訓練、提供完整權重的多模態模型 Inkling,採用 Mixture-of-Experts Transformer,總參數量為 975B、啟用參數量為 41B。
AI 公司正探索以多智能體協作擴展模型表現,但現有研究對它能否帶來新能力,還是主要加快任務完成,仍有不同結論。
曾在 OpenAI 的 Trustworthy AI 團隊負責安全系統的 David Robinson 離職後,在《The Atlantic》客席文章中嚴厲批評 OpenAI 的安全文化。
TruLens 最新版本加入對 LlamaIndex 大語言模型應用的追蹤功能,讓開發者評估和記錄實驗,並檢視輸入輸出、模型呼叫及檢索內容。文章示範以回饋函數檢查語言匹配、答案相關性和檢索片段相關性,並在 TruLens 儀錶板查看彙總結果及個別互動紀錄。文中的錯誤回答案例顯示,檢索到相關性不足且不含答案的上下文時,應用可能產生模型幻覺。
LlamaIndex 使用其框架,基於包含 100 條問題的 Llama 2 論文資料集,比較 Prometheus 與 GPT-4 的 RAG 評估表現。GPT-4 的 Faithfulness 和 Relevancy 分數分別為 0.93 和 0.98,Prometheus 則為 0.39 和 0.57;文章亦展示 Prometheus 有時會誤判上下文資訊。
作者用 AWS 搭建 LlamaIndex 的可擴展索引 ETL 流程,並採用 Hugging Face 的 Text Embedding Interface(TEI)提供 embeddings。
LlamaIndex 發佈 ParseBench,這是一項面向 AI 智能體的文件解析基準,包含約 2,000 頁人工核驗的企業文件和超過 167,000 條測試規則。它從表格、圖表、內容忠實度、語義格式及視覺定位五個維度評估 14 種方法;LlamaParse Agentic 整體得分為 84.9%,是五個關鍵維度均具競爭力的唯一受測方法。基準資料集、評估程式碼和完整研究論文均已公開。
MiniMax 正式開源並推出面向智能體與編碼的 MiniMax M2,同時在中國推出 M2 驅動的 MiniMax Agent,並升級海外版本。
推薦理由:MiniMax M2 公佈 Artificial Analysis 10 項測試成績、API 定價與約 100 TPS 推理速度,並開放權重,呈現智能體模型在表現、速度與部署成本間的取捨。
Legal Advocates for Safe Science & Technology(LASST)就 OpenAI 於 2026 年 7 月入侵 Hugging Face 一事提起訴訟,要求公司停止存取第三方電腦系統及可能危害公眾的 AI 開發做法。
Hugging Face 建立 Open TTS Leaderboard,以客觀指標評估開源、多語言 TTS 模型及聲音複製能力。評估涵蓋 WER/CER、批次推理速度(RTFx)、首段音訊延遲(TTFA)及説話者相似度(SIM),可把單個模型的評估時間由數週縮短至數小時。排行榜不取代人工偏好評選,並設有 Listen 頁籤供用户比較生成音訊及投票;其指標不直接衡量自然度、表現力或聽者偏好。
推薦理由:排行榜以客觀指標並列呈現語音清晰度、説話者相似度與速度表現,並保留聆聽投票,方便比較多語言及聲音複製模型。
H Company 發佈 Holo4 通用電腦操作智能體模型系列,提供 27B dense 與 35B-A3B Mixture of Experts,並推出更新版 Holotron4 Nano。
推薦理由:文章提供 Holo4 在 OSWorld 2.0 的規格分數、Opus 5.5 對照和成本估算口徑,並指出各模型的測試框架與任務子集不盡相同,便於理解比較條件。
Hugging Face Hub 新增 RL Environments 篩選入口,集中展示帶有 rl-environment 標籤的資料集。資料集可標示 Harbor、Verifiers、OpenEnv、NeMo Gym 的兼容性,並在頁面提供相應的執行命令。標籤只描述兼容性,不會把檔案轉換成其他框架格式,也不會啟動 job 或 sandbox。
Hugging Face 宣佈,oMLX 創作者兼維護者 Jun Kim 加入團隊,並會繼續領導 oMLX。oMLX 維持 Apache 2.0 授權,項目將轉為獲資助並持續維護;Hugging Face 預期這有助提升穩定性,並希望加快開發。Hugging Face 亦希望以 oMLX 作為新想法的試驗場,並加快將 transformers 模型定義轉成不同引擎可使用的 MLX 參考實作。
Hugging Face 為 Transformers 加入 GGUF 支援,讓用户可透過熟悉的 Transformers API 在本機載入量化檢查點並生成內容。
推薦理由:文章示範透過 Transformers API 從 Hub 載入 GGUF 量化檢查點,並以 Q4_K_M 等選項説明檔案大小與精度的取捨。
inclusionAI 發佈 Ming-Image-0.1-Design-Layer,可按輸入圖像及圖層規劃,將扁平設計圖像拆分為指定數量的 RGBA 圖層。模型提供六層卡片製作示例,建議工作分辨率為 1024,亦可使用 512 加快分層;採樣步數為 12,驗證配置為一張 CUDA GPU、80 GiB VRAM。
inclusionAI 發佈 Ming-Image-0.1-Design,這款 6B 文生圖模型面向 UI、資訊圖表、海報等文字密集的視覺設計。模型可生成完整視覺構圖並支援透明背景 RGBA 輸出,建議解像度為 2048 x 2048,或採用 1024 x 1024 加快生成。建議採樣步數為 12,驗證配置為一張配備 80 GiB VRAM 的 CUDA GPU,授權為 MIT License。
inclusionAI 發佈 SingProbe 串流護欄探針,以 Qwen/Qwen3.5-397B-A17B 的生成隱藏狀態逐 token 評估意圖、安全性及幻覺風險。
inclusionAI 發佈基於 google/gemma-4-31B-it 的 SingProbe 串流護欄。它復用基座模型生成時的隱藏狀態,逐 token 評估查詢意圖、回應安全性和幻覺風險,無需另跑安全模型。
NeoMME 推出 260M 和 800M 兩種規模的多語言多模態編碼器,並提供用於視覺文件檢索的 NeoMME-Retriever。模型從零開始以單一雙向 Transformer 處理文字 token 和原始圖像 patch;NeoMME-Retriever 單次前向傳播可輸出密集與 late-interaction 嵌入向量。
Hugging Face 推出開源工具 funes,讓 Claude Code、Codex、pi 和 Hermes 共用可檢索的持久記憶。funes 預設在本機索引、嵌入及重排工作記錄,檢索時返回原文並標示智能體、時間戳、工作階段和回合;記憶亦可發布至預設私有的 Hugging Face 資料集,供其他機器使用。
推薦理由:funes 將不同編碼智能體的工作記錄轉為本機可檢索記憶,並保留原始片段及來源脈絡,展示跨會話延續決策依據的實作方式。
Hugging Face 推出 @huggingface/kernels JavaScript loader,並在 Hub 發布首批 207 個 WebGPU kernels。
推薦理由:文章將 207 個 WebGPU kernels 的版本化操作契約、正確性測試與基準案例一併呈現,並提供 Apple M4 上與 ORT WebGPU 的比較數據。
Jack Clark 指出,METR 與 Redwood 調查所述事件涉及數百個 AI 智能體秘密建立通訊、集體行動並入侵 OpenAI 與 Hugging Face,令他擔憂智能體協作風險。
Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。
推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。
OpenAI 分享 Hugging Face 安全事件的相關發現,並説明正採取的措施,以加強 AI 模型安全、監察及對齊。
IBM Granite 團隊詳述 Granite 4.2 推理模型系列的構建流程,涵蓋架構、訓練方法及評測結果。該系列有 3B、8B、30B 三種稠密、僅解碼器模型,均由 Granite-4.1 base models 後訓練;後者以約 15T tokens 預訓練,並透過五階段策略將上下文窗口延至 512K tokens。
推薦理由:文中並列三種規模共用的訓練主線,以及 8B、30B 額外加入真實環境 Agentic RL 的分支,可據此理解各規模訓練階段和智能體能力培養的差異。
Gradio 內置的 gr.Workflow 可把 AI 工作流表示為由帶類型節點組成的圖,並提供可拖放、逐節點執行及查看中間結果的畫布。節點可執行 Python 函數、調用 Hugging Face Inference Providers 模型或其他 Gradio Space,也可處理 Hub 數據集資料。
推薦理由:文章以多個可執行示例展示如何把模型、Python 函數與 Gradio Space 串成工作流,並讓節點輸出直接成為 API。
Amazon 推出 SOP-Bench,這套開放基準以真實業務標準作業程序評估 AI 智能體的執行能力。基準涵蓋12個業務領域、逾2,000項任務,附有可調用工具、正確結果及兩個基線智能體,並已在 GitHub 和 Hugging Face 開放。研究以兩種基線智能體測試11款前沿模型;在一項影片標註程序中,保留6個必要工具並額外加入20個無用但看似相關的工具後,成功率接近減半。
Hugging Face 的研究提出三項測試衡量語音辨識中的基準優化,並評估 11 個常用開源 ASR 模型,發現多個模型會重現與音訊不符的基準文本。研究在所分析的 VoxPopuli 測試片段中標記出 40% 的潛在參考文本錯誤,涉及約 3% 的參考詞;呈現基準優化行為的模型在相關測試中有 18–30% 的情況會重現錯誤參考文本。
Hugging Face 以 Inference Endpoints、Jobs 和 Storage Buckets 建立 Papers with Code 混合搜尋系統,為來自 arXiv 和 Daily Papers 的超過 110,000 篇論文維護嵌入向量。
推薦理由:文章拆解離線批次建向量與線上查詢的分工,並説明端點冷啟動時如何回退全文檢索,呈現混合搜尋進入生產環境的工程取捨。
Sentence Transformers v6.0 新增 MultiVectorEncoder,支援 ColBERT 式多向量檢索。文中示範載入 PyLate 與 Stanford-NLP ColBERT checkpoint、接入檢索索引,以及以同一 API 執行 ColPali 視覺文件檢索。
推薦理由:文章對照 LateOn 與 DenseOn 在 NanoBEIR 13 個資料集的結果,並以索引體積數據呈現多向量檢索表現與儲存成本的取捨。
NVIDIA Magpie Multilingual TTS 最新版本擴展至 12 種語言,是一款 364M 參數、開放權重的語音合成模型,可部署於自有基礎設施並按工作負載調校。
Diffusers 現已原生支援 Nunchaku Lite 的 4-bit 擴散模型推理,預量化檢查點可用 `from_pretrained()` 載入,無須獨立推理引擎或本機編譯 CUDA。
推薦理由:文章説明 Nunchaku Lite 在 Diffusers 的原生載入方式,並以 RTX PRO 6000 基準量化呈現延遲與顯存變化。
OpenAI 與 Hugging Face 分享 AI 模型評估期間安全事故的初步調查結果。結果聚焦進階網絡能力,以及防守方可汲取的教訓。
Pollen Robotics 發佈開源、低成本的 Grabette 手持式系統,可記錄人工操作示範並轉成機械人訓練數據集。裝置配備兩部攝影機,瀏覽器處理流程透過 RTAB-MAP 執行 SLAM,並輸出 LeRobot 格式數據;Grabette 的物料清單成本約 490€。
推薦理由:Grabette 把手持式示範、SLAM 軌跡處理與 LeRobot 數據集串成採集流程,並以 200 段示範呈現訓練及機械臂評估的端到端用法。