Grok 4.6 介紹:聚焦長時間運行的智能體與複雜互動、視覺工作
Cursor 與 SpaceXAI 共同發佈 Grok 4.6,該模型基於 Grok 4.5,重點面向長時間運行的智能體及更複雜的互動和視覺工作。它在多項智能體編程和知識工作基準測試中展現前沿智能水平,並在由九項基準測試構成的 Artificial Analysis Intelligence Index 上與 GPT-5.6 Sol 持平。
Cursor 與 SpaceXAI 共同發佈 Grok 4.6,該模型基於 Grok 4.5,重點面向長時間運行的智能體及更複雜的互動和視覺工作。它在多項智能體編程和知識工作基準測試中展現前沿智能水平,並在由九項基準測試構成的 Artificial Analysis Intelligence Index 上與 GPT-5.6 Sol 持平。
NVIDIA Magpie Multilingual TTS 最新版本擴展至 12 種語言,是一款 364M 參數、開放權重的語音合成模型,可部署於自有基礎設施並按工作負載調校。
OpenAI 公佈網絡安全專用模型 GPT-5.6-Cyber,該模型透過 Daybreak Red 提供,用於經授權的漏洞研究、漏洞利用驗證及安全測試。相關頁面:https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
Meta 發佈 Muse Glimmer,一款由 Muse 蒸餾而來、面向本地智能體應用的多模態 30B 模型,採用 Apache 2.0 授權。模型由 2B ViT-style 視覺編碼器和 28B 文字解碼器組成,支援圖像、影片輸入及多模態工具調用。
推薦理由:文章把 Muse Glimmer 的本地智能體定位、30B 架構與 transformers、llama.cpp、vLLM 等入口連起來,提供從本地推理到託管部署的實作參考。
OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,提升其準確度與一致性,並擴大免費用户使用 GPT-5.6 Luna 的範圍。免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天。
推薦理由:公告交代 GPT-5.6 Sol 在準確度與一致性上的提升,並説明免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天,呈現模型調整與使用範圍的變化。
OpenAI 更新 GPT-5.6 Sol 和 GPT-5.6 Luna,並公佈青少年安全、生物與化學能力及網絡安全評估。U18 評估中,兩款模型表現與受測的 GPT-5.5 版本大致相若,未觀察到統計顯著差異;評估涵蓋高難度案例,結果不代表相關行為在一般使用中的出現頻率。
Mistral AI 發佈 Shieldstral,一款 3B 開放權重多模態安全分類器,可用自然語言政策評估文字與圖像,無須重新訓練。它將內容審核設計為可在推理時指定政策的二元問答,並輸出校準後的安全分數;Mistral 稱其在多項基準上匹配或超越模型規模最高達其 7x 的開放權重安全模型。
推薦理由:將審核政策置於推理時的自然語言問題中,使同一個 3B 模型可按部署情境調整文字與圖像判斷,無須重新訓練。
DeepSeek 將 DeepSeek-V4-Flash API 開放公開 Beta,並稱其智能體能力顯著增強,基準測試結果遠高於 V4-Pro-Preview。
Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。
推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。
Google DeepMind 今日在 Google Flow Music 推出音樂生成模型 Lyria 3.5,並提升旋律、歌詞及人聲生成品質。它可生成更豐富、複雜且自然的旋律結構,並改善歌詞的提示詞遵循度與結構意識,以及人聲的真實感、情感細膩度和發音。使用者也可更容易控制生成內容的節奏和時長。
上海人工智能實驗室 InternLM 發佈 35B 基礎模型 Intern-S2-Mobius,採用 Mobius-v0 架構。它以全域共享 Memory 供多個 Reasoners 反覆查詢和修訂隱藏狀態,並引入 Backward Residual Connection 和 Dynamic Latent Reasoning。
GPT-5.6 提升 AI 在模型、推理及智能體工作流程各方面的效率,有助於讓每一美元帶來更多實用智能。
Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。
推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。
NVIDIA 發佈 Cosmos-H-Dreams,一款根據機械人動作即時生成手術場景影片的模擬器。它將 Cosmos-H-Surgical-Simulator 蒸餾為因果學生模型,並透過 FlashDreams 在單張 NVIDIA RTX PRO 6000 上達到約 160 fps。
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。
Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。
推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。
Mercury 2 是 Inception Labs 推出的擴散式推理語言模型,官方稱其在標準 NVIDIA GPU 上解碼速度達 1,000+ tokens/second,300-token 推理鏈完成時間不到 300ms。
GPT-5.6 主打每個 token 帶來更多智能、每美元效能更強,並可按需提供更多能力,支援最艱鉅的工作。
OpenAI 發佈 GPT-5.6 系統卡,公開模型訓練資料、部署安全模擬及生物化學能力評估。部署模擬預測 GPT-5.6 Sol 的違規內容總量與 GPT-5.5 大致相若,性相關違規率由 0.05% 升至 0.07%,心理健康相關違規回應率由 0.03% 降至 0.02%。OpenAI 將 GPT-5.6 系列的生物與化學能力列為 High,並判定三款模型均不需按 Critical 能力處理。
Mistral AI 發佈 8B 模型 Robostral Navigate,讓機械人根據 RGB 圖像和自然語言指令自主導航。模型在 R2R-CE 已見及未見驗證集分別取得 79.4% 和 76.6% 成功率;未見集成績較最佳單相機方案高 9.7 個百分點,較採用深度感測或多相機的最佳系統高 4.5 個百分點。
OpenAI 介紹 GPT-Live,將其定位為面向自然人機互動的新一代語音模型,並稱其現正為 ChatGPT Voice 提供支援。
Mistral AI 發佈 Leanstral 1.5,這款 Apache-2.0 授權模型總參數量為 119B、活躍參數為 6B,面向 Lean 4 形式化驗證。
推薦理由:文章不只列出形式化數學基準,也以 AVL 樹複雜度證明及 57 個程式庫的漏洞排查,呈現 Leanstral 1.5 將定理證明延伸至實際程式驗證的應用。
Google DeepMind 推出 Nano Banana 2 Lite,並首次向開發者開放 Gemini Omni Flash。
推薦理由:兩款模型分別面向高速批量圖像生成與影片生成、對話式編輯,文中列出成本、延遲及 API 限制,可供評估多媒體工作流的取捨。
Google Research 發佈 TabFM,這款表格數據基礎模型以上下文學習執行分類與回歸,並可在單次前向傳遞中預測。TabFM 以結構因果模型動態生成的數億個合成資料集訓練,並在 TabArena 的 38 個分類與 13 個回歸資料集上評測。
OpenAI 預覽新一代模型 GPT-5.6 Sol,其程式編寫、科學及網絡安全能力更強,並配備 OpenAI 最先進的安全技術堆疊。
GPT-5 Pro 協助免疫學家 Derya Unutmaz 解開一宗困擾 3 年的免疫學謎團,並提供有關 T 細胞行為的見解。這項突破可能支持癌症及自身免疫研究。
Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。
推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。
GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。
推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。
Google DeepMind 發佈實驗性開放模型 DiffusionGemma,透過文字擴散並行生成文字,在專用 GPU 上文字生成最高快 4 倍。
推薦理由:DiffusionGemma 的優勢集中於低至中等批次的單加速器推理,高 QPS 雲端服務則可能收益較小並增加服務成本。
Google DeepMind 發佈 Gemini 3.5 Live Translate,這款音訊模型可自動識別 70+ 種語言,並進行近乎即時的語音轉語音翻譯。
推薦理由:模型以連續生成譯語音訊取代逐輪等待,並透過 API、Google Meet 和 Google Translate 進入開發、企業會議及日常翻譯場景,呈現其部署路徑。
Google DeepMind 發佈 Gemma 4 12B,定位為可在筆記型電腦本機運行的多模態模型,並為中型模型加入原生音訊輸入。它採用免多模態編碼器架構,將視覺和音訊輸入直接整合至 LLM backbone;標準基準表現接近 26B MoE,總記憶體佔用不足其一半。Gemma 4 12B 以 Apache 2.0 授權釋出,可透過 LM Studio、Ollama 等工具試用。
推薦理由:Gemma 4 12B 的免編碼器設計、接近 26B MoE 的基準表現與較低記憶體佔用,提供比較中型多模態模型架構和本機部署定位的具體依據。
NVIDIA 發佈 Nemotron 3.5 Content Safety,將多模態輸入、多語言覆蓋、自訂企業政策與可審計推理整合至單一 4B 模型。模型基於 Google Gemma 3 4B IT,明確訓練覆蓋 12 種語言,並承接其約 140 種語言的 zero-shot 泛化;可選 THINK mode 會輸出推理軌跡。
推薦理由:Nemotron 3.5 將多模態判定、自訂政策和可審計推理整合於 4B 模型,並附訓練資料集,提供企業安全審核的部署參考。
GPT-Rosalind 透過強化生物推理、藥物化學專業知識、基因組分析及實驗工作流程能力,推進生命科學研究。
OpenAI 的 GPT-Rosalind-5.5 系統卡指出,該模型由 GPT-5.5 增量訓練而成,面向進階生命科學研究,並以可信存取及負責任部署作為主要保障。
H Company 發佈 Holo3.1 電腦操作模型系列,擴展至網頁、桌面及手機環境,並提供本地推理量化權重。AndroidWorld 上,35B-A3B 模型的分數由 67% 升至 79.3%,4B 和 9B 版本由 58% 升至 72%。
推薦理由:文章同時列出不同尺寸、量化格式,以及 AndroidWorld 和 DGX Spark 數據,讀者可據此比較本地部署的性能與速度取捨。
FireRedTeam 發佈 FireRedASR2S,整合語音辨識、語音活動檢測、語言識別和標點預測四個模組。FireRedASR2-LLM 在 4 個普通話測試集的平均 CER 為 2.89%,在 19 個方言及口音測試集為 11.55%。
JetBrains 發佈 Mellum2,一款以自然語言和程式碼從零訓練的 12B MoE 模型,每個 token 啟用 2.5B 參數。模型採 Apache 2.0 授權,適用於路由、RAG、摘要、子智能體及高吞吐程式功能等工作負載。
OpenAI 的一個模型解決了有 80 年歷史的單位距離問題,推翻離散幾何中的一項重要猜想。這項成果標誌著 AI 驅動數學的一個里程碑。
推薦理由:這項成果為 AI 驅動數學提供一個具體案例,呈現模型解決離散幾何 80 年單位距離問題並推翻重要猜想的結果。
Hugging Face 發佈六款基於 Ettin ModernBERT encoder 的 Sentence Transformers CrossEncoder reranker,參數規模由 17.6M 至 1.00B,並公開訓練數據及完整訓練方案。
推薦理由:文章以 MTEB(eng, v2) Retrieval、NanoBEIR 及多種硬件吞吐測試比較六種尺寸,呈現 Ettin Reranker 在排序品質與速度間的取捨。
Google DeepMind 推出 Gemini Omni 系列首個模型 Gemini Omni Flash,可結合圖像、影片、文字及語音參考生成影片,並支援透過對話編輯。
推薦理由:材料把 Gemini Omni Flash 的多模態輸入、對話式影片編輯和分階段上線平台放在一起,便於理解新模型如何連接生成能力與實際使用入口。