Google DeepMind 發佈 Gemini 3.5 系列,首款 Gemini 3.5 Flash 即日起推出
Google DeepMind 發佈 Gemini 3.5 模型系列,首款 Gemini 3.5 Flash 即日起透過 Gemini app 和 Google Search 的 AI Mode 向全球用户開放。
推薦理由:Gemini 3.5 Flash 列出代理任務、編碼及多模態基準成績,並比較每秒輸出 tokens 的速度,讓性能主張有多項指標可供對照。
Google DeepMind 發佈 Gemini 3.5 模型系列,首款 Gemini 3.5 Flash 即日起透過 Gemini app 和 Google Search 的 AI Mode 向全球用户開放。
推薦理由:Gemini 3.5 Flash 列出代理任務、編碼及多模態基準成績,並比較每秒輸出 tokens 的速度,讓性能主張有多項指標可供對照。
IBM Granite 發佈兩款採 Apache 2.0 授權的多語嵌入模型:97M 參數的 granite-embedding-97m-multilingual-r2 和 311M 參數的 granite-embedding-311m-multilingual-r2。
推薦理由:文章提供 97M 與 311M 版本在多語檢索、長文及程式碼基準的比較,並交代 Matryoshka 維度選項對儲存與部署取捨的影響。
OpenAI 在 API 推出新的即時語音模型,可對語音進行推理、翻譯和轉錄。這些模型旨在支援更自然、智能的語音體驗。
OpenAI 將 GPT-5.5 Instant 設為 ChatGPT 預設模型,並稱其回答更聰明、更準確,模型幻覺也有所減少。更新亦改善個人化控制。
推薦理由:更新既涉及回答表現,也涵蓋個人化控制,讀者可從兩個層面瞭解 GPT-5.5 Instant 成為 ChatGPT 預設模型後的變化。
Ling-2.6-1T 正式開源,定位為面向複雜任務的萬億級綜合旗艦模型。
OpenAI 説明 GPT-5 行為中由個性驅動的怪異表現「哥布林輸出」如何擴散。內容交代其時間線、根本原因及修正措施。
NVIDIA 發佈 Nemotron 3 Nano Omni,這款長上下文多模態模型面向文件分析、音訊與影片理解、智能體電腦操作及通用推理。
推薦理由:文章並列 Nemotron 3 Nano Omni、Nemotron Nano V2 VL 與 Qwen3-Omni 的多項基準結果,另列系統效率數據,提供文件、影音和 GUI 任務的比較依據。
深度求索(DeepSeek)發佈 DeepSeek-V4,Pro、Flash 系列各有 instruct 與 base 版本,四款 checkpoint 均支援 1M-token 上下文。
推薦理由:文章把 KV cache 成本、混合注意力設計與智能體工作流串連起來,並以基準數據呈現長上下文能力在工具任務中的表現。
OpenAI 介紹 GPT-5.5,這是一款面向跨工具複雜任務的模型,涵蓋編碼、研究與數據分析。
OpenAI 發佈 Privacy Filter,一款用於在文本中偵測及遮蔽個人身份識別資訊(PII)的開放權重模型。OpenAI 稱這款模型具備 state-of-the-art accuracy。公告網址為 https://openai.com/index/introducing-openai-privacy-filter。
OpenAI 推出 GPT-Rosalind,這是一款旨在加速藥物發現、基因組分析、蛋白質推理及科學研究工作流程的前沿推理模型。
Google DeepMind 發佈 Gemini 3.1 Flash TTS,提升文字轉語音的可控性、表現力與品質,並加入音訊標籤細調語音表現。模型支援 70+ 種語言及原生多説話者對話,在 Artificial Analysis TTS leaderboard 的 Elo 分數為 1,211。
推薦理由:文章聚焦音訊標籤如何細調語氣、節奏與表達,並列出 Gemini 3.1 Flash TTS 面向開發者、企業及 Workspace 用户的推出渠道。
OpenAI 擴大 Trusted Access for Cyber 計劃,向經審核的防禦者引入 GPT-5.4-Cyber。OpenAI 同時在 AI 網絡安全能力持續進展之際加強防護措施。
Google DeepMind 發佈 Gemini Robotics-ER 1.6,提升機械人的空間與多視角推理能力,並新增儀表讀數能力。模型在指點、計數、任務成功檢測等方面較 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有所提升,並透過 Gemini API 和 Google AI Studio 向開發者提供。
Overworld 推出 Waypoint-1.5 即時影片世界模型,提升視覺保真度並擴大可本地運行的硬件範圍。桌面硬件 RTX 3090 至 5090 可生成最高 720p、60 FPS 的即時環境;另有面向更廣泛消費級硬件(包括遊戲筆電)的 360p 版本,Apple Silicon Mac 支援即將推出。
推薦理由:Waypoint-1.5 分設 720p 與 360p 檔位,並列明 RTX 3090 至 5090 可達最高 720p、60 FPS,呈現其畫質與本地硬件覆蓋方案。
FireRedTeam 發佈 FireRed-Image-Edit-1.1,基於 FireRed-Image-Edit-1.0,優化人像一致性、多元素融合、風格化文字參照及人像妝效。內置 Agent 可自動處理超過 3 張輸入圖片的區域偵測、裁切拼接及提示詞改寫。項目提供的加速推理配置標示使用 30GB VRAM,生成約 4.5s/sample。
Google DeepMind 發佈 Gemma 4 開放模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四種尺寸,並採用 Apache 2.0 授權。
推薦理由:Gemma 4 提供從手機端到工作站的多種尺寸,並列出排行榜名次與上下文窗口,便於比較本地部署時的硬件需求和能力差異。
Google DeepMind 的 Gemma 4 多模態模型系列已登陸 Hugging Face,提供五種尺寸,支援圖像、文字及部分型號的音訊輸入。模型採 Apache 2 授權,最大上下文窗口為 256K;31B 和 26B A4B 的 text-only LMArena 估算分數分別為 1452 和 1441,後者有 4B 啟用參數。
推薦理由:文章列出五種 Gemma 4 規格、上下文窗口和音訊支援差異,並整理多個推理與微調框架的接入方式,可供比較型號特點及部署路徑。
Granite 4.0 3B Vision 現已推出,是面向企業文件理解的緊湊型視覺語言模型,支援表格抽取、圖表理解及語義鍵值對抽取。模型以 LoRA adapter 形式構建於 Granite 4.0 Micro 之上,可獨立使用或配合 Docling,並以 Apache 2.0 授權在 Hugging Face 提供。
Google DeepMind 推出 Gemini 3.1 Flash Live,提升即時語音對話的精準度並降低延遲。它在 ComplexFuncBench Audio 得分 90.8%,在 Scale AI 的 Audio MultiChallenge 開啟 thinking 時得分 36.1%。
推薦理由:原文以兩項語音基準呈現多步函數調用與複雜指令跟隨表現,並列出開發者、企業及一般用户的使用入口,可對照其能力與部署場景。
Google DeepMind 推出音樂生成模型 Lyria 3 Pro,支援生成最長 3 分鐘的曲目,並可按前奏、主歌、副歌和橋段等音樂結構提示創作。
推薦理由:文章呈現 Lyria 3 Pro 從段落提示到 Vertex AI 公開預覽的接入脈絡,並連結創作者音樂工具與企業按需音訊製作場景。
Mistral AI 發佈 4B 參數的 Voxtral TTS,支援 9 種語言語音生成。在典型的 10 秒語音樣本和 500 characters 輸入下,模型延遲為 70ms;人評顯示其自然度高於 ElevenLabs Flash v2.5,TTFA 相近。
推薦理由:原文以人評比較 Voxtral TTS 與 ElevenLabs Flash v2.5 的自然度和 TTFA,並列出模型延遲及 API 定價,提供評估語音智能體應用的具體依據。
OpenAI 發佈 GPT-5.4 mini 和 nano,兩者是 GPT-5.4 的較小、更快速版本。它們針對編碼、工具使用、多模態推理,以及高用量 API 和子智能體工作負載作最佳化。
Mistral AI 發佈 Mistral Small 4,將 Magistral 的推理、Pixtral 的多模態及 Devstral 的智能體編碼能力整合至單一模型。
推薦理由:Mistral Small 4 整合指令、推理、多模態及智能體編碼能力,並列出相較 Mistral Small 3 的吞吐數據,可供比較單一模型承接多類任務時的效率表現。
Mistral AI 開源 Leanstral,一款為 Lean 4 設計、用於程式碼生成與形式化證明的程式碼智能體,採用 6B active parameters。
Sarvam AI 開源 Sarvam 30B 和 Sarvam 105B 兩款從零訓練的推理模型,並提供 API、權重下載及本地推理範例。兩者採用 MoE Transformer 架構,分別以 16T 和 12T tokens 預訓練,並在印度使用 IndiaAI Mission 提供的算力訓練。
OpenAI 發佈 GPT-5.4,並稱其為面向專業工作的能力最強、效率最高的前沿模型。該模型具備最先進的編碼、電腦操作和工具搜索能力,並有 1M-token 上下文窗口。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,現正以預覽版向開發者及企業開放,開發者可透過 Google AI Studio 的 Gemini API 使用,企業則可透過 Vertex AI 使用。
推薦理由:文章把 Gemini 3.1 Flash-Lite 的定價、相較 2.5 Flash 的速度數據及質素描述並列,呈現其面向高頻工作負載的成本定位。
Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。
推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。
Inception Labs 發佈 Mercury 2 推理語言模型,透過擴散模型並行修訂生成回應,主打低延遲推理。官方列出其在 NVIDIA Blackwell GPUs 上達 1,009 tokens/sec,並稱生成速度提升 >5x;價格為 $0.25/1M input tokens、$0.75/1M output tokens。
Google DeepMind 發佈 Gemini 3.1 Pro,作為 Gemini 3 系列核心模型升級,提升複雜問題的推理能力。它在 ARC-AGI-2 取得經驗證的 77.1% 得分,推理表現超過 Gemini 3 Pro 兩倍。
推薦理由:Gemini 3.1 Pro 在 ARC-AGI-2 取得經驗證的 77.1% 得分,並稱推理表現超過 Gemini 3 Pro 兩倍,為核心推理升級提供量化比較依據。
GPT-5.2 在理論物理中提出一條新的膠子振幅公式,一篇新預印本記錄了這項結果。OpenAI 與學術合作者其後正式證明並驗證了該公式。
推薦理由:材料交代 GPT-5.2 提出的膠子振幅公式及 OpenAI 與學術合作者其後的正式證明和驗證,呈現模型研究結果的核查環節。
Google DeepMind 發佈 Gemini 3 Deep Think 重大升級,面向科學、研究與工程領域的複雜挑戰。
推薦理由:文章列出數學、編程及科學基準的具體成績,並交代 Gemini app 與 Gemini API 的開放方式,呈現本次升級的評測範圍和使用入口。
OpenAI 發佈 GPT-5.3-Codex-Spark,並稱其為首個即時編碼模型,生成速度快 15x,具備 128k 上下文窗口。目前以研究預覽形式向 ChatGPT Pro 用户提供。
推薦理由:公告列出生成速度、上下文窗口及研究預覽的適用對象,讓讀者可同時瞭解 GPT-5.3-Codex-Spark 的性能宣稱與目前開放範圍。
OpenAI 發佈 GPT-5.3-Codex,這款 Codex 原生智能體結合前沿編碼表現與通用推理,支援長週期的現實技術工作。
GPT-5.3-Codex 系統卡將該模型描述為迄今能力最強的智能體編碼模型。它結合 GPT-5.2-Codex 的前沿編碼表現,以及 GPT-5.2 的推理和專業知識能力。
Mistral AI 發佈 Voxtral Transcribe 2,包含用於批次轉寫的 Voxtral Mini Transcribe V2,以及面向即時應用的 Voxtral Realtime。
推薦理由:批次版與即時版的定位和能力差異清晰,文章亦列出即時轉寫的延遲設定、開放權重授權及兩款模型的 API 價格,便於比較部署選項。
OpenAI 將於 2026 年 2 月 13 日在 ChatGPT 退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini。這項安排與此前已宣佈的 GPT-5(Instant、Thinking 和 Pro)退役同步;API 目前沒有變更。
Overworld 發佈 Waypoint-1,這款即時互動影片擴散模型可透過文字、滑鼠和鍵盤控制,並按控制輸入逐影格生成。模型以 10,000 小時配有控制輸入及文字描述的多樣化遊戲影片訓練,並以 self-forcing 後訓練,令訓練更貼近逐影格推理。
推薦理由:Waypoint-1 從訓練之初便以互動體驗為目標,與常見的先用預訓練影片模型、再微調簡化控制輸入的做法形成對照。
Google DeepMind 推出 D4RT,這是一個統一的 AI 模型,可重建並追蹤跨越空間與時間的 4D 場景。測試中,D4RT 比此前方法快 18x 至 300x;在單顆 TPU 上,約 5 秒即可處理 1 分鐘影片,而舊方法最多需 10 分鐘。其查詢式 Transformer 架構支援點追蹤、點雲重建及相機姿態估計,應用方向包括機械人、擴增實境與世界模型。