Google DeepMind 發佈實驗模型 DiffusionGemma,專用 GPU 上文字生成最高快 4 倍
Google DeepMind 發佈實驗性開放模型 DiffusionGemma,透過文字擴散並行生成文字,在專用 GPU 上文字生成最高快 4 倍。
推薦理由:DiffusionGemma 的優勢集中於低至中等批次的單加速器推理,高 QPS 雲端服務則可能收益較小並增加服務成本。
模型推理能力的進展:思維鏈、推理模型、數學與邏輯基準的突破與爭議。
Google DeepMind 發佈實驗性開放模型 DiffusionGemma,透過文字擴散並行生成文字,在專用 GPU 上文字生成最高快 4 倍。
推薦理由:DiffusionGemma 的優勢集中於低至中等批次的單加速器推理,高 QPS 雲端服務則可能收益較小並增加服務成本。
Google DeepMind 發佈 Gemma 4 12B,定位為可在筆記型電腦本機運行的多模態模型,並為中型模型加入原生音訊輸入。它採用免多模態編碼器架構,將視覺和音訊輸入直接整合至 LLM backbone;標準基準表現接近 26B MoE,總記憶體佔用不足其一半。Gemma 4 12B 以 Apache 2.0 授權釋出,可透過 LM Studio、Ollama 等工具試用。
推薦理由:Gemma 4 12B 的免編碼器設計、接近 26B MoE 的基準表現與較低記憶體佔用,提供比較中型多模態模型架構和本機部署定位的具體依據。
NVIDIA 發佈 Nemotron 3.5 Content Safety,將多模態輸入、多語言覆蓋、自訂企業政策與可審計推理整合至單一 4B 模型。模型基於 Google Gemma 3 4B IT,明確訓練覆蓋 12 種語言,並承接其約 140 種語言的 zero-shot 泛化;可選 THINK mode 會輸出推理軌跡。
推薦理由:Nemotron 3.5 將多模態判定、自訂政策和可審計推理整合於 4B 模型,並附訓練資料集,提供企業安全審核的部署參考。
OpenAI 的一個模型解決了有 80 年歷史的單位距離問題,推翻離散幾何中的一項重要猜想。這項成果標誌著 AI 驅動數學的一個里程碑。
推薦理由:這項成果為 AI 驅動數學提供一個具體案例,呈現模型解決離散幾何 80 年單位距離問題並推翻重要猜想的結果。
Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。
推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。
Granite Team(IBM)詳述 Granite 4.1 的 3B、8B 和 30B 模型構建流程,涵蓋預訓練、監督式微調和多階段強化學習。預訓練以約 15T tokens 分五階段進行,並將上下文窗口擴至最高 512K tokens;其後以約 4.1M 經整理樣本作微調,採用 on-policy GRPO 配合 DAPO loss 進行強化學習。
推薦理由:文章梳理 Granite 4.1 從約 15T tokens 預訓練、約 4.1M 樣本微調到多階段強化學習的流程,呈現 dense 模型的訓練設計取捨。
NVIDIA 發佈 Nemotron 3 Nano Omni,這款長上下文多模態模型面向文件分析、音訊與影片理解、智能體電腦操作及通用推理。
推薦理由:文章並列 Nemotron 3 Nano Omni、Nemotron Nano V2 VL 與 Qwen3-Omni 的多項基準結果,另列系統效率數據,提供文件、影音和 GUI 任務的比較依據。
深度求索(DeepSeek)發佈 DeepSeek-V4,Pro、Flash 系列各有 instruct 與 base 版本,四款 checkpoint 均支援 1M-token 上下文。
推薦理由:文章把 KV cache 成本、混合注意力設計與智能體工作流串連起來,並以基準數據呈現長上下文能力在工具任務中的表現。
Google DeepMind 發佈 Gemma 4 開放模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四種尺寸,並採用 Apache 2.0 授權。
推薦理由:Gemma 4 提供從手機端到工作站的多種尺寸,並列出排行榜名次與上下文窗口,便於比較本地部署時的硬件需求和能力差異。
Mistral AI 發佈 Mistral Small 4,將 Magistral 的推理、Pixtral 的多模態及 Devstral 的智能體編碼能力整合至單一模型。
推薦理由:Mistral Small 4 整合指令、推理、多模態及智能體編碼能力,並列出相較 Mistral Small 3 的吞吐數據,可供比較單一模型承接多類任務時的效率表現。
Google Research 的前瞻性研究在真實門診流程中評估 AMIE 用於就診前病史採集的可行性。研究納入 100 名成人,互動由醫師即時監督且沒有觸發安全停止;AMIE 的鑑別診斷在 90% 個案中涵蓋最終診斷,前三項診斷準確率為 75%。研究屬單中心文字聊天研究,沒有對照組;PCP 的管理方案在實用性及成本效益方面較佳。
推薦理由:這項研究將 AMIE 用於門診前病史採集,展示即時醫師監督下的安全與診斷評估,亦交代單中心、無對照設計的限制。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,現正以預覽版向開發者及企業開放,開發者可透過 Google AI Studio 的 Gemini API 使用,企業則可透過 Vertex AI 使用。
推薦理由:文章把 Gemini 3.1 Flash-Lite 的定價、相較 2.5 Flash 的速度數據及質素描述並列,呈現其面向高頻工作負載的成本定位。
Google DeepMind 發佈 Gemini 3.1 Pro,作為 Gemini 3 系列核心模型升級,提升複雜問題的推理能力。它在 ARC-AGI-2 取得經驗證的 77.1% 得分,推理表現超過 Gemini 3 Pro 兩倍。
推薦理由:Gemini 3.1 Pro 在 ARC-AGI-2 取得經驗證的 77.1% 得分,並稱推理表現超過 Gemini 3 Pro 兩倍,為核心推理升級提供量化比較依據。
Google DeepMind 發佈 Gemini 3 Deep Think 重大升級,面向科學、研究與工程領域的複雜挑戰。
推薦理由:文章列出數學、編程及科學基準的具體成績,並交代 Gemini app 與 Gemini API 的開放方式,呈現本次升級的評測範圍和使用入口。
Google DeepMind 發佈 Gemini 3 Flash,結合 Gemini 3 Pro 級推理與 Flash 級延遲、效率和成本,並按 Artificial Analysis 基準測試較 Gemini 2.5 Pro 快 3x。
推薦理由:文章以推理、多模態與編碼基準成績,連同速度、token 用量及 API 定價,呈現 Gemini 3 Flash 的效能與成本定位。
OpenAI 表示,GPT-5.2 是其目前在數學與科學領域最強的模型,並在 GPQA Diamond 和 FrontierMath 等基準上取得新的最佳成績。文章列舉其求解一個尚未解決的理論問題,以及生成可靠數學證明的案例,展示基準表現如何轉化為實際研究進展。
推薦理由:文章把 GPQA Diamond、FrontierMath 的基準表現連結到求解尚未解決的理論問題和生成可靠數學證明的案例,呈現 GPT-5.2 在研究任務中的具體落點。
OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。
推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。
Mistral AI 發佈 Mistral 3 模型系列,包含 14B、8B、3B 三款 Ministral 3,以及 Mistral Large 3。Ministral 3 的每種尺寸均提供 base、instruct 和 reasoning 版本,具備圖像理解能力;全系列均按 Apache 2.0 授權釋出。
推薦理由:Mistral 3 覆蓋 3B 至 675B 的模型規模,並列出邊緣端與資料中心的部署路徑,可供比較開源模型的部署選擇。
Hugging Face 發佈 Transformers v5.0.0rc-0,將簡化模型定義、訓練、推理和生產支援列為重點,並以互操作性貫穿版本改造。
推薦理由:文章説明 Transformers v5 如何銜接訓練工具、推理引擎與本地部署,並呈現其聚焦 PyTorch、提升量化支援的工程取捨。
Google DeepMind 發佈 Gemini 3,推出預覽版 Gemini 3 Pro,並介紹加強推理能力的 Gemini 3 Deep Think。
推薦理由:Gemini 3 Pro 與 Gemini 3 Deep Think 的兩項基準成績並列,便於比較加強推理模式在 Humanity’s Last Exam 和 GPQA Diamond 的分數差異。