Google DeepMind 發佈開放、輕量級多模態嵌入模型 EmbeddingGemma 2
Google DeepMind 發佈 EmbeddingGemma 2,將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,供裝置端推理使用。
推薦理由:EmbeddingGemma 2 將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,並列出裝置端記憶體與向量儲存數據,方便評估跨模態搜尋的本地部署。
Google DeepMind 發佈 EmbeddingGemma 2,將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,供裝置端推理使用。
推薦理由:EmbeddingGemma 2 將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,並列出裝置端記憶體與向量儲存數據,方便評估跨模態搜尋的本地部署。
Mistral AI 推出 Mistral Large 4 公開預覽版,權重預計月底釋出。模型具原生多模態能力,總參數量為 1 trillion、活躍參數量為 49 billion,並可透過 Mistral Studio API 試用。在 Artificial Analysis Cyber Index 名列全球前五,漏洞重現及修補測試得分 82%,Cybench 則解決 93% 的挑戰。
推薦理由:文章以 Cyber Index、漏洞重現與修補測試及 Cybench 結果,呈現 Mistral Large 4 在網絡安全基準中的相對表現。
Technology Innovation Institute 推出 Falcon-Emirati-7B,這款基於 Falcon-H1-Arabic、專攻阿聯酋阿拉伯語方言的 7B 模型在 Alyah 得分 84.83%。
Ai2 開源 AstaBrief 8B,這款模型可把研究問題和檢索到的文獻摘錄生成帶引用報告,並已在 Asta 的 Generate a report 功能中提供 Fast mode。
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
GPT-6.1 Sol 已在 Amazon Bedrock 正式開放使用,面向智能體編碼、電腦操作及專業工作負載。OpenAI 表示,GPT-6.1 Sol 在 DeepSWE v1.1 上匹配 GPT-6 Astra,單項任務成本約為 GPT-6 Astra 的五分之一;其分數亦比 GPT-6 Sol 的最佳結果高 6.4 個百分點,且所用推理力度較低。
推薦理由:文章列出 GPT-6.1 Sol 在 DeepSWE v1.1 上與 GPT-6 Astra 的任務成本對照,並比較其對 GPT-6 Sol 的分數提升。
NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。
推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。
OpenAI 發佈 GPT-6.1 Sol,稱其面向編碼、電腦操作及專業工作,智能水平接近 Astra。其 API 輸入及輸出 token 價格均為 Astra 標準 API 對應價格的五分之一。
推薦理由:公告把 GPT-6.1 Sol 的工作場景定位與 Astra 標準 API 輸入、輸出 token 價格作比較,便於瞭解其能力主張與定價定位。
H Company 發佈 Holo4 通用電腦操作智能體模型系列,提供 27B dense 與 35B-A3B Mixture of Experts,並推出更新版 Holotron4 Nano。
推薦理由:文章提供 Holo4 在 OSWorld 2.0 的規格分數、Opus 5.5 對照和成本估算口徑,並指出各模型的測試框架與任務子集不盡相同,便於理解比較條件。
OpenAI 發佈 GPT-6 Sol 和 Luna 兩款模型,稱兩者將前沿智能帶入日常工作,並在能力與成本之間採取不同取向。
Google DeepMind 發佈 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,前者面向規模化與成本效率,後者針對高複雜度任務。
推薦理由:文章區分兩款模型在規模化成本效率與高複雜度任務上的定位,並列出語音代理基準成績,方便比較其應用取向。
OpenAI 將 GPT‑Live‑1 引入 API,提供自然的全雙工語音對話及更強的指令遵循能力。它亦支援自訂聲音及電話服務。
推薦理由:原文列出全雙工對話、指令遵循、自訂聲音及電話支援,能讓讀者迅速掌握 GPT‑Live‑1 接入 API 後涵蓋的語音能力。
OpenAI 介紹 GPT-6 Astra,稱其為面向商業用途能力最強的模型。它具備進階推理、電腦操作能力,以及更強的寫作與設計判斷能力。
Google DeepMind 與 Google Research 發佈 WeatherNext 3,利用即時地球同步衞星資料逐小時生成全球天氣預報,部分地表變數解析度達 5 公里。
推薦理由:WeatherNext 3 以即時衞星觀測支援逐小時全球預報,並為部分變數提供 5 公里解析度;文中列出降水預測相對 IMERG、MRMS 等基線的 CRPS 改善幅度。
NeoMME 推出 260M 和 800M 兩種規模的多語言多模態編碼器,並提供用於視覺文件檢索的 NeoMME-Retriever。模型從零開始以單一雙向 Transformer 處理文字 token 和原始圖像 patch;NeoMME-Retriever 單次前向傳播可輸出密集與 late-interaction 嵌入向量。
OpenAI 推出 GPT-6 Astra,稱其為迄今最智能、最符合對齊要求的模型。OpenAI 表示,模型在電腦操作、編碼、網絡安全及科學領域具備最先進能力。
OpenAI 的 GPT-6 Astra 安全概覽指出,該模型是其目前廣泛部署中能力最強的模型。它也是首個在 Preparedness Framework 下達到網絡安全能力 Critical 級別的模型。
推薦理由:這段安全概覽同時交代 GPT-6 Astra 的部署定位與網絡安全能力級別,可供讀者把模型能力描述放回 Preparedness Framework 的評估框架理解。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。
Google Research 發佈 TimesFM-3,一款原生支援多變量零樣本預測的時間序列基礎模型,可在單次前向傳播中預測多條相關序列。它有 330 million parameters,使用超過 1 trillion time points 的真實及合成時間序列資料預訓練,並能結合多個目標、歷史協變量和已知未來協變量,無需任務專用微調。
Microsoft Research 公開 GigaPath-Flash 與 GigaTIME-Flash 兩款開放權重病理基礎模型,以降低大規模病理研究的計算成本。
Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。
推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。
Google DeepMind 發佈 Gemini 3.7 Flash,稱其在編碼、知識工作及網頁開發工作流上較 Gemini 3.6 Flash 有所提升。
推薦理由:文章列出 Gemini 3.7 Flash 在編碼、網頁開發和複雜文件基準上的對比數據,並交代入門價格,便於衡量效能與成本取捨。
Google DeepMind 發佈 SL2T 多語言手語轉文字模型,為 Gboard 和 Live Transcribe 帶來手語轉文字功能,首階段支援 ASL 至英文。
推薦理由:SL2T 以簽署者的身體姿態座標直接翻譯成文字,原始影片會即時丟棄,呈現其輸入處理方式與私隱保護設計。
NVIDIA Magpie Multilingual TTS 最新版本擴展至 12 種語言,是一款 364M 參數、開放權重的語音合成模型,可部署於自有基礎設施並按工作負載調校。
OpenAI 公佈網絡安全專用模型 GPT-5.6-Cyber,該模型透過 Daybreak Red 提供,用於經授權的漏洞研究、漏洞利用驗證及安全測試。相關頁面:https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
Meta 發佈 Muse Glimmer,一款由 Muse 蒸餾而來、面向本地智能體應用的多模態 30B 模型,採用 Apache 2.0 授權。模型由 2B ViT-style 視覺編碼器和 28B 文字解碼器組成,支援圖像、影片輸入及多模態工具調用。
推薦理由:文章把 Muse Glimmer 的本地智能體定位、30B 架構與 transformers、llama.cpp、vLLM 等入口連起來,提供從本地推理到託管部署的實作參考。
OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,提升其準確度與一致性,並擴大免費用户使用 GPT-5.6 Luna 的範圍。免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天。
推薦理由:公告交代 GPT-5.6 Sol 在準確度與一致性上的提升,並説明免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天,呈現模型調整與使用範圍的變化。
Mistral AI 發佈 Shieldstral,一款 3B 開放權重多模態安全分類器,可用自然語言政策評估文字與圖像,無須重新訓練。它將內容審核設計為可在推理時指定政策的二元問答,並輸出校準後的安全分數;Mistral 稱其在多項基準上匹配或超越模型規模最高達其 7x 的開放權重安全模型。
推薦理由:將審核政策置於推理時的自然語言問題中,使同一個 3B 模型可按部署情境調整文字與圖像判斷,無須重新訓練。
Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。
推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。
Google DeepMind 今日在 Google Flow Music 推出音樂生成模型 Lyria 3.5,並提升旋律、歌詞及人聲生成品質。它可生成更豐富、複雜且自然的旋律結構,並改善歌詞的提示詞遵循度與結構意識,以及人聲的真實感、情感細膩度和發音。使用者也可更容易控制生成內容的節奏和時長。
GPT-5.6 提升 AI 在模型、推理及智能體工作流程各方面的效率,有助於讓每一美元帶來更多實用智能。
Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。
推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。
NVIDIA 發佈 Cosmos-H-Dreams,一款根據機械人動作即時生成手術場景影片的模擬器。它將 Cosmos-H-Surgical-Simulator 蒸餾為因果學生模型,並透過 FlashDreams 在單張 NVIDIA RTX PRO 6000 上達到約 160 fps。
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。
Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。
推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。
GPT-5.6 主打每個 token 帶來更多智能、每美元效能更強,並可按需提供更多能力,支援最艱鉅的工作。
Mistral AI 發佈 8B 模型 Robostral Navigate,讓機械人根據 RGB 圖像和自然語言指令自主導航。模型在 R2R-CE 已見及未見驗證集分別取得 79.4% 和 76.6% 成功率;未見集成績較最佳單相機方案高 9.7 個百分點,較採用深度感測或多相機的最佳系統高 4.5 個百分點。
OpenAI 介紹 GPT-Live,將其定位為面向自然人機互動的新一代語音模型,並稱其現正為 ChatGPT Voice 提供支援。
Mistral AI 發佈 Leanstral 1.5,這款 Apache-2.0 授權模型總參數量為 119B、活躍參數為 6B,面向 Lean 4 形式化驗證。
推薦理由:文章不只列出形式化數學基準,也以 AVL 樹複雜度證明及 57 個程式庫的漏洞排查,呈現 Leanstral 1.5 將定理證明延伸至實際程式驗證的應用。
Google DeepMind 推出 Nano Banana 2 Lite,並首次向開發者開放 Gemini Omni Flash。
推薦理由:兩款模型分別面向高速批量圖像生成與影片生成、對話式編輯,文中列出成本、延遲及 API 限制,可供評估多媒體工作流的取捨。