NVIDIA 發佈 Nemotron 3 Nano Omni 長上下文多模態模型,面向文件分析、音訊與影片理解及智能體電腦操作
NVIDIA 發佈 Nemotron 3 Nano Omni,這款長上下文多模態模型面向文件分析、音訊與影片理解、智能體電腦操作及通用推理。
推薦理由:文章並列 Nemotron 3 Nano Omni、Nemotron Nano V2 VL 與 Qwen3-Omni 的多項基準結果,另列系統效率數據,提供文件、影音和 GUI 任務的比較依據。
文本之外的能力:視覺理解、圖文混合、音訊與影片的輸入輸出的模型與產品進展。
NVIDIA 發佈 Nemotron 3 Nano Omni,這款長上下文多模態模型面向文件分析、音訊與影片理解、智能體電腦操作及通用推理。
推薦理由:文章並列 Nemotron 3 Nano Omni、Nemotron Nano V2 VL 與 Qwen3-Omni 的多項基準結果,另列系統效率數據,提供文件、影音和 GUI 任務的比較依據。
Sentence Transformers v5.4 的同一 API 現可編碼並比較文字、圖像、音訊和影片,文章示範其多模態嵌入與 reranker 用法。嵌入模型將不同模態映射至共享嵌入空間;預訓練多模態 reranker 目前主要處理文字與圖像配對。示例涵蓋跨模態檢索、混合模態文件重排及先檢索再重排流程,並列出輸入格式、支援模型和安裝依賴。
推薦理由:文章展示 Sentence Transformers v5.4 的跨模態檢索與 reranker 重排流程,並整理支援模型和輸入格式,提供實作參考。
Google DeepMind 發佈 Gemma 4 開放模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四種尺寸,並採用 Apache 2.0 授權。
推薦理由:Gemma 4 提供從手機端到工作站的多種尺寸,並列出排行榜名次與上下文窗口,便於比較本地部署時的硬件需求和能力差異。
Google DeepMind 的 Gemma 4 多模態模型系列已登陸 Hugging Face,提供五種尺寸,支援圖像、文字及部分型號的音訊輸入。模型採 Apache 2 授權,最大上下文窗口為 256K;31B 和 26B A4B 的 text-only LMArena 估算分數分別為 1452 和 1441,後者有 4B 啟用參數。
推薦理由:文章列出五種 Gemma 4 規格、上下文窗口和音訊支援差異,並整理多個推理與微調框架的接入方式,可供比較型號特點及部署路徑。
Google DeepMind 介紹 AI 指針的設計原則與實驗演示,並宣佈即日起可在 Chrome 用指針向 Gemini 提問網頁內容。這套設計以四項原則為核心,讓指針結合視覺和語義上下文及語音,減少使用者撰寫詳細提示詞的需要。Magic Pointer 將即將在 Googlebook 推出。
推薦理由:文章以四項交互原則説明 AI 指針如何減少提示詞負擔,並列出 Gemini 在 Chrome 的現有功能及 Googlebook 即將推出的 Magic Pointer。
Google DeepMind 推出音樂生成模型 Lyria 3 Pro,支援生成最長 3 分鐘的曲目,並可按前奏、主歌、副歌和橋段等音樂結構提示創作。
推薦理由:文章呈現 Lyria 3 Pro 從段落提示到 Vertex AI 公開預覽的接入脈絡,並連結創作者音樂工具與企業按需音訊製作場景。
Mistral AI 發佈 Mistral Small 4,將 Magistral 的推理、Pixtral 的多模態及 Devstral 的智能體編碼能力整合至單一模型。
推薦理由:Mistral Small 4 整合指令、推理、多模態及智能體編碼能力,並列出相較 Mistral Small 3 的吞吐數據,可供比較單一模型承接多類任務時的效率表現。
Mistral AI 宣佈成為 NVIDIA Nemotron Coalition 創始成員,並計劃與 NVIDIA 共同開發前沿開源 AI 模型。聯盟首個項目是在 NVIDIA DGX Cloud 訓練基礎模型,支撐即將推出的 NVIDIA Nemotron 4 系列;相關模型將開源,供後訓練與專門化。Mistral AI 亦宣佈發佈 Mistral Small 4。
推薦理由:聯盟首個基礎模型將在 NVIDIA DGX Cloud 訓練,支撐 NVIDIA Nemotron 4 系列,並作為開源後訓練與專門化的共同基礎。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,現正以預覽版向開發者及企業開放,開發者可透過 Google AI Studio 的 Gemini API 使用,企業則可透過 Vertex AI 使用。
推薦理由:文章把 Gemini 3.1 Flash-Lite 的定價、相較 2.5 Flash 的速度數據及質素描述並列,呈現其面向高頻工作負載的成本定位。
Google DeepMind 在 Gemini app beta 推出 Lyria 3 音樂生成模型,使用者可用文字提示或上傳照片、影片生成 30 秒音軌。系統會按提示生成歌詞,並可調整風格、人聲和節奏;音軌嵌入 SynthID,Gemini 的核驗功能亦延伸至音訊,使用者可上傳檔案詢問其是否由 Google AI 生成。
推薦理由:Lyria 3 在 Gemini app 開放以文字、圖片或影片生成音樂,並納入 SynthID 與音訊核驗,呈現創作功能和 AI 內容識別並行的設計。
Google DeepMind 開始向美國年滿 18 歲的 Google AI Ultra 訂户逐步開放 Project Genie;這款由 Genie 3、Nano Banana Pro 和 Gemini 驅動的實驗研究原型,可建立、探索及改編互動世界。
推薦理由:原型把世界草圖、即時探索與改編放進同一體驗,並交代生成時長、物理表現和角色操控限制,可看出目前互動世界模型的使用方式與邊界。
Google 發佈開放醫療多模態模型 MedGemma 1.5 4B,新增 CT、MRI、病理全切片及胸部 X 光時間序列等醫療影像處理能力。其基準結果較 MedGemma 1 4B 提升,例如 CT 疾病分類準確率為 61%(58%),MRI 為 65%(51%),醫療文本 EHRQA 為 90%(68%)。
推薦理由:MedGemma 1.5 4B 在多項醫療影像與文本基準上較前代提升,文中列出的具體分數可用來比較不同任務的改進幅度。
Google DeepMind 發佈 Gemini 3 Flash,結合 Gemini 3 Pro 級推理與 Flash 級延遲、效率和成本,並按 Artificial Analysis 基準測試較 Gemini 2.5 Pro 快 3x。
推薦理由:文章以推理、多模態與編碼基準成績,連同速度、token 用量及 API 定價,呈現 Gemini 3 Flash 的效能與成本定位。
OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。
推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。
Mistral AI 發佈 Mistral 3 模型系列,包含 14B、8B、3B 三款 Ministral 3,以及 Mistral Large 3。Ministral 3 的每種尺寸均提供 base、instruct 和 reasoning 版本,具備圖像理解能力;全系列均按 Apache 2.0 授權釋出。
推薦理由:Mistral 3 覆蓋 3B 至 675B 的模型規模,並列出邊緣端與資料中心的部署路徑,可供比較開源模型的部署選擇。
Google DeepMind 在 Gemini App 推出 AI 圖像驗證功能,使用 SynthID 水印判斷圖片是否由 Google AI 生成或編輯。用户可上載圖片並直接提問;SynthID 自 2023 年推出以來,已為超過 20 billion 件 AI 生成內容加上水印。
推薦理由:文章交代 Gemini 如何透過 SynthID 水印檢查圖像是否由 Google AI 生成或編輯,並説明後續支援影片、音訊及更多介面的計劃。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),並以付費預覽方式向開發者開放。模型具備更準確的文字渲染和圖像本地化能力,支援 2K 和 4k 解析度;啟用 Google Search grounding 時,亦可連接即時網頁內容。
推薦理由:文章把 Nano Banana Pro 的文字渲染、本地化能力與接入方式,連同相較 Gemini 2.5 Flash Image 的成本和延遲取捨一併交代。
Google DeepMind 發佈 Gemini 3,Gemini 3 Pro 已透過 Gemini API、Google AI Studio 和 Vertex AI 提供預覽。
推薦理由:文章並列 Gemini 3 Pro 的基準成績、API 定價和接入渠道,亦介紹 Google Antigravity 如何跨工作區管理智能體,具體呈現模型與開發流程的結合方式。
Google DeepMind 發佈 Gemini 3,推出預覽版 Gemini 3 Pro,並介紹加強推理能力的 Gemini 3 Deep Think。
推薦理由:Gemini 3 Pro 與 Gemini 3 Deep Think 的兩項基準成績並列,便於比較加強推理模式在 Humanity’s Last Exam 和 GPQA Diamond 的分數差異。
Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。
推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。