Mistral AI 發佈 Mistral OCR 3,在文件類測試中對 Mistral OCR 2 的整體勝率為 74%
Mistral AI 發佈 Mistral OCR 3,在表單、掃描文件、複雜表格及手寫內容的內部測試中,較 Mistral OCR 2 整體勝率為 74%。模型可經 API(mistral-ocr-2512)或 Mistral AI Studio 的 Document AI Playground 使用,定價為每 1,000 頁 $2,Batch API 折扣後為 $1。
Mistral AI 發佈 Mistral OCR 3,在表單、掃描文件、複雜表格及手寫內容的內部測試中,較 Mistral OCR 2 整體勝率為 74%。模型可經 API(mistral-ocr-2512)或 Mistral AI Studio 的 Document AI Playground 使用,定價為每 1,000 頁 $2,Batch API 折扣後為 $1。
Google DeepMind 發佈 Gemini 3 Flash,結合 Gemini 3 Pro 級推理與 Flash 級延遲、效率和成本,並按 Artificial Analysis 基準測試較 Gemini 2.5 Pro 快 3x。
推薦理由:文章以推理、多模態與編碼基準成績,連同速度、token 用量及 API 定價,呈現 Gemini 3 Flash 的效能與成本定位。
OpenAI 推出更快的 ChatGPT Images 體驗,並在 API 中提供 GPT-Image-1.5。材料亦提及 ChatGPT Images 2.5,但未提供更多細節。
推薦理由:更新同時涵蓋 ChatGPT Images 體驗提速與 GPT-Image-1.5 在 API 提供,呈現這次發佈涉及的兩部分變化。
Google DeepMind 更新 Gemini 2.5 Flash Native Audio,提升其處理複雜工作流、遵循指令及進行多輪語音對話的能力。它在 ComplexFuncBench Audio 得分為 71.5%,開發者指令遵循率由 84% 升至 90%;目前已在 Vertex AI 正式提供,並以預覽版開放 Gemini API。
推薦理由:更新同時改善即時語音 Agent 的函數調用、指令遵循與多輪對話,並以 ComplexFuncBench Audio 的 71.5% 得分呈現多步函數調用表現。
OpenAI 表示,GPT-5.2 是其目前在數學與科學領域最強的模型,並在 GPQA Diamond 和 FrontierMath 等基準上取得新的最佳成績。文章列舉其求解一個尚未解決的理論問題,以及生成可靠數學證明的案例,展示基準表現如何轉化為實際研究進展。
推薦理由:文章把 GPQA Diamond、FrontierMath 的基準表現連結到求解尚未解決的理論問題和生成可靠數學證明的案例,呈現 GPT-5.2 在研究任務中的具體落點。
OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。
推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。
Mistral AI 發佈 Devstral 2(123B)、Devstral Small 2(24B)兩款編碼模型,以及開源命令列助手 Mistral Vibe CLI。
推薦理由:Devstral 2 不只公佈基準測試成績,亦提供與 DeepSeek V3.2、Claude Sonnet 4.5 的人工評測結果,讀者可對照其在不同模型比較中的表現差異。
Mistral AI 發佈 Mistral 3 模型系列,包含 14B、8B、3B 三款 Ministral 3,以及 Mistral Large 3。Ministral 3 的每種尺寸均提供 base、instruct 和 reasoning 版本,具備圖像理解能力;全系列均按 Apache 2.0 授權釋出。
推薦理由:Mistral 3 覆蓋 3B 至 675B 的模型規模,並列出邊緣端與資料中心的部署路徑,可供比較開源模型的部署選擇。
DeepSeek 透過臨時端點提供 DeepSeek-V3.2-Speciale,收費與 V3.2 相同,且不提供工具呼叫。此服務提供至 2025 年 12 月 15 日 15:59(UTC)。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.2。deepseek-chat 對應非思考模式,deepseek-reasoner 對應思考模式。更新日誌:https://api-docs.deepseek.com/updates#deepseek-v32
Claude Platform 於 2025 年 11 月 24 日推出 Claude Opus 4.5,面向複雜專業任務、專業軟件工程及進階智能體。更新指出,該模型在視覺、編碼和電腦操作方面有顯著改進,定價亦較此前 Opus 模型更易負擔。
推薦理由:這批更新為多工具工作流程提供兩種改善方式,程式化工具調用旨在降低延遲和 token 用量,工具搜尋則讓大型工具目錄中的工具可按需載入。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),並以付費預覽方式向開發者開放。模型具備更準確的文字渲染和圖像本地化能力,支援 2K 和 4k 解析度;啟用 Google Search grounding 時,亦可連接即時網頁內容。
推薦理由:文章把 Nano Banana Pro 的文字渲染、本地化能力與接入方式,連同相較 Gemini 2.5 Flash Image 的成本和延遲取捨一併交代。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),一款基於 Gemini 3 Pro 的圖像生成與編輯模型。
推薦理由:相較原版 Nano Banana 主打快速、有趣的編輯,Pro 面向複雜構圖,並提供多語圖中文字、最多 5 人形象一致性和 2K、4K 輸出,呈現兩者的能力定位差異。
Google Research 介紹端到端即時語音到語音翻譯模型,以原説話者聲線輸出譯音,標準延遲為 2 秒。模型採用串流架構及時間同步訓練資料,支援英語與西班牙語、德語、法語、意大利語、葡萄牙語之間的雙向翻譯。相關功能已在 Google Meet 伺服器端提供,並作為 Pixel 10 的內置裝置端功能推出;Pixel Voice Translate 採用級聯式流程以擴大語言覆蓋。
推薦理由:文章説明串流架構如何配合時間同步訓練資料,把語音互譯的標準延遲控制在 2 秒,並以原説話者聲線輸出譯音,可瞭解低延遲與個人化如何結合。
OpenAI 發佈 GPT-5.1-Codex-Max,這是一款面向 Codex 的更快速、更智能的智能體編碼模型。它為長時間、專案級工作而設計,並提升推理能力與 token 效率。
Google DeepMind 發佈 Gemini 3,Gemini 3 Pro 已透過 Gemini API、Google AI Studio 和 Vertex AI 提供預覽。
推薦理由:文章並列 Gemini 3 Pro 的基準成績、API 定價和接入渠道,亦介紹 Google Antigravity 如何跨工作區管理智能體,具體呈現模型與開發流程的結合方式。
Google DeepMind 發佈 Gemini 3,推出預覽版 Gemini 3 Pro,並介紹加強推理能力的 Gemini 3 Deep Think。
推薦理由:Gemini 3 Pro 與 Gemini 3 Deep Think 的兩項基準成績並列,便於比較加強推理模式在 Humanity’s Last Exam 和 GPQA Diamond 的分數差異。
Google DeepMind 與 Google Research 發佈 WeatherNext 2,預報生成速度快 8 倍,並提供細至每小時解析度的全球天氣預測。
推薦理由:WeatherNext 2 與前代 WeatherNext 的比較覆蓋 0–15 天內 99.9% 的變量與預報時效,並列出單顆 TPU 每項預測少於一分鐘的耗時,便於同時衡量預報表現與計算效率。
Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。
推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。
OpenAI 已在 API 中提供 GPT-5.1,帶來更快的自適應推理、擴展的提示詞快取及更佳的編碼表現。API 新增 apply_patch 和 shell 工具。
推薦理由:更新涵蓋自適應推理、提示詞快取、編碼表現及 apply_patch 和 shell 工具,勾勒 GPT-5.1 面向開發者的 API 改進範圍。
OpenAI 正在升級 GPT-5 系列,以更温暖、能力更強的模型和新增的 ChatGPT 語氣、風格自訂方式推出 GPT-5.1。GPT-5.1 今天開始向付費用户逐步推出。
推薦理由:GPT-5.1 更新同時涵蓋模型能力與 ChatGPT 語氣、風格自訂,並交代先向付費用户推出,便於把握其功能變化和開放範圍。
Inception Labs 發佈升級版 Mercury 擴散式大語言模型,稱其編碼、指令遵循、數學問題求解與知識回憶表現均有提升。
OpenAI 推出 gpt-oss-safeguard,這是一組用於安全分類的開放權重推理模型。開發者可套用並迭代自訂政策。
IBM 發佈 Granite 4.0 Nano 小型模型系列,面向邊緣端及裝置端應用,提供混合 SSM 與傳統 Transformer 架構版本。型號包括 Granite 4.0 H 1B(約 1.5B 參數)、Granite 4.0 H 350M(約 350M 參數),以及傳統 Transformer 版的 Granite 4.0 1B 和 Granite 4.0 350M。
Sam Altman 宣佈推出 Sora App,結合新模型 Sora 2,並提供影片創作、分享和觀看功能。Cameo 功能可讓用户把自己和朋友加入影片,團隊為角色一致性投入大量工作。產品設有防止深偽肖像濫用、處理令人不安或違法內容的措施,並會定期檢視 Sora 對用户情緒和身心狀況的影響;作者亦提出長期用户滿意度、用户控制動態及優先創作等原則。
推薦理由:文章列出 Sora 在用户滿意度、動態控制和創作方面的原則,並交代深偽肖像濫用防護及定期檢視用户身心狀況的安排。
OpenAI 推出 Sora 2,這是一款可生成同步對白與音效的影片生成模型。材料並指出,Sora 產品已不再提供。
推薦理由:這則材料同時交代 Sora 2 的同步對白與音效生成能力,以及 Sora 產品已不再提供的狀態,讓讀者掌握模型能力介紹與產品供應情況。
OpenAI 發佈 Sora 2 系統卡,介紹這款基於 Sora 的影片與音訊生成模型。Sora 2 加入過往影片模型較難實現的能力,包括更準確的物理表現、更清晰的寫實效果、同步音訊、更強的可控性及更廣的風格範圍。
推薦理由:Sora 2 系統卡將其能力置於既有影片模型的比較脈絡中,並列出物理表現、同步音訊與風格範圍等變化。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.2-Exp,分別對應其非思考模式與思考模式。詳情可參閲更新日誌:https://api-docs.deepseek.com/updates#deepseek-v32-exp。
DeepSeek 將 API 中的 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.1-Terminus,分別對應非思考模式與思考模式。更新維持模型原有能力,減少中英文混雜及偶發異常字元。Code Agent 和 Search Agent 的效能亦獲進一步優化。
OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex,這是針對 Codex 中 AI 智能體編碼進一步優化的 GPT-5 版本。它會按任務複雜度動態調整思考投入,簡單對話查詢或小任務回應較快,複雜任務則獨立工作更長時間。
推薦理由:補充説明交代 GPT-5-Codex 面向 Codex 中的 AI 智能體編碼,並説明它如何按任務複雜度調整思考投入。
WRITER 發佈 Palmyra-mini 系列三款 1.5B 至 1.7B 開放模型,涵蓋通用生成、複雜邏輯推理及數學推理。
mmBERT 以 ModernBERT 為基礎推出,使用超過 3T tokens 的多語言文本訓練,並在最後階段納入 FineWeb2 的 1,833 種語言。
推薦理由:mmBERT 展示分階段擴充語言、逐步降低遮罩率的訓練設計,並報告在最後 100B tokens 才納入的低資源語言上取得明顯提升。
Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。
推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。
OpenAI 發佈更先進的語音對語音模型 gpt-realtime,並為 Realtime API 加入新 API 能力。更新包括 MCP server 支援、圖像輸入及 SIP 電話呼叫支援。
推薦理由:公告同時列出語音對語音模型與 Realtime API 的更新,並點明 MCP server、圖像輸入及 SIP 電話呼叫支援,方便掌握本次功能範圍。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.1,兩者分別對應非思考模式和思考模式。
Arm 發佈 Neural Super Sampling(NSS),供圖形與遊戲開發者試用;這款即時時域超採樣方案面向未來移動裝置。在 Enchanted Castle 演示中,NSS 在持續效能設定下將 540p 升頻至 1080p 用時 4ms,GPU 工作負載降低 50 percent;延遲受 GPU 配置、解像度及使用場景等因素影響。
OpenAI 在 API 平台推出 GPT-5,提供高推理性能和麪向開發者的新控制項,並稱其在真實編碼任務上達到同級最佳表現。
GPT-5 為編碼與設計開啟新的可能性,內容聚焦它如何在這兩個領域帶來新的探索方向。
OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統,並指其智能較此前所有模型有顯著提升。GPT-5 在編碼、數學、寫作、健康及視覺感知等方面均達到最先進水平。
推薦理由:原文以此前模型作比較,並列出編碼、數學、寫作、健康及視覺感知等表現領域,讓讀者掌握 GPT-5 公佈的能力範圍。
OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款開放權重推理模型。兩款模型依 Apache 2.0 license 及 OpenAI 的 gpt-oss usage policy 提供。
推薦理由:同時列出 gpt-oss-120b 與 gpt-oss-20b,並交代 Apache 2.0 授權及 gpt-oss usage policy,讀者可掌握模型開放使用的基本條件。