Project Genie:用實驗原型探索無限互動世界
Google DeepMind 開始向美國年滿 18 歲的 Google AI Ultra 訂户逐步開放 Project Genie;這款由 Genie 3、Nano Banana Pro 和 Gemini 驅動的實驗研究原型,可建立、探索及改編互動世界。
推薦理由:原型把世界草圖、即時探索與改編放進同一體驗,並交代生成時長、物理表現和角色操控限制,可看出目前互動世界模型的使用方式與邊界。
Google DeepMind 開始向美國年滿 18 歲的 Google AI Ultra 訂户逐步開放 Project Genie;這款由 Genie 3、Nano Banana Pro 和 Gemini 驅動的實驗研究原型,可建立、探索及改編互動世界。
推薦理由:原型把世界草圖、即時探索與改編放進同一體驗,並交代生成時長、物理表現和角色操控限制,可看出目前互動世界模型的使用方式與邊界。
Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。
Google 發佈開放醫療多模態模型 MedGemma 1.5 4B,新增 CT、MRI、病理全切片及胸部 X 光時間序列等醫療影像處理能力。其基準結果較 MedGemma 1 4B 提升,例如 CT 疾病分類準確率為 61%(58%),MRI 為 65%(51%),醫療文本 EHRQA 為 90%(68%)。
推薦理由:MedGemma 1.5 4B 在多項醫療影像與文本基準上較前代提升,文中列出的具體分數可用來比較不同任務的改進幅度。
NVIDIA 發佈 Cosmos Reason 2,稱其在 Physical AI Bench 和 Physical Reasoning 榜單位列視覺理解開放模型第一。
Google Research 回顧 2025 年研究成果,涵蓋生成模型、生成式 UI、量子計算、AI 科學工具及氣候、醫療與教育應用。Gemini 3 引入生成式 UI,可按提示詞生成互動介面;Gemma 擴展至 140 多種語言。效能研究顯示,使用 Learn Your Way 的學生在保留測試中的得分高 11 個百分點。
Mistral AI 發佈 Mistral OCR 3,在表單、掃描文件、複雜表格及手寫內容的內部測試中,較 Mistral OCR 2 整體勝率為 74%。模型可經 API(mistral-ocr-2512)或 Mistral AI Studio 的 Document AI Playground 使用,定價為每 1,000 頁 $2,Batch API 折扣後為 $1。
Google DeepMind 發佈 Gemini 3 Flash,結合 Gemini 3 Pro 級推理與 Flash 級延遲、效率和成本,並按 Artificial Analysis 基準測試較 Gemini 2.5 Pro 快 3x。
推薦理由:文章以推理、多模態與編碼基準成績,連同速度、token 用量及 API 定價,呈現 Gemini 3 Flash 的效能與成本定位。
OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。
推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。
Google DeepMind 與 Kaggle 推出 FACTS Benchmark Suite,透過四項基準評估大語言模型的事實準確性。套件包含更新版 Grounding Benchmark - v2,以及 Parametric、Search、Multimodal 三項基準,並公開提供 3,513 個例子;Kaggle 管理私有保留集並維護公開排行榜。
Google Research 推出 Massive Sound Embedding Benchmark(MSEB),以統一框架評估八項機器聽覺能力。基準涵蓋語義與聲學任務,並可評估不同類型的模型;初步實驗顯示,現有聲音表徵在八項任務上仍有明顯提升空間。
Mistral AI 發佈 Mistral 3 模型系列,包含 14B、8B、3B 三款 Ministral 3,以及 Mistral Large 3。Ministral 3 的每種尺寸均提供 base、instruct 和 reasoning 版本,具備圖像理解能力;全系列均按 Apache 2.0 授權釋出。
推薦理由:Mistral 3 覆蓋 3B 至 675B 的模型規模,並列出邊緣端與資料中心的部署路徑,可供比較開源模型的部署選擇。
Google DeepMind 在 Gemini App 推出 AI 圖像驗證功能,使用 SynthID 水印判斷圖片是否由 Google AI 生成或編輯。用户可上載圖片並直接提問;SynthID 自 2023 年推出以來,已為超過 20 billion 件 AI 生成內容加上水印。
推薦理由:文章交代 Gemini 如何透過 SynthID 水印檢查圖像是否由 Google AI 生成或編輯,並説明後續支援影片、音訊及更多介面的計劃。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),並以付費預覽方式向開發者開放。模型具備更準確的文字渲染和圖像本地化能力,支援 2K 和 4k 解析度;啟用 Google Search grounding 時,亦可連接即時網頁內容。
推薦理由:文章把 Nano Banana Pro 的文字渲染、本地化能力與接入方式,連同相較 Gemini 2.5 Flash Image 的成本和延遲取捨一併交代。
Mistral AI 宣佈深化在德國的戰略承諾,與 SAP 建立多年合作,並與 Helsing 加速相關模型研發。與 SAP 的合作旨在為德國和歐洲提供完整的主權 AI 技術堆疊,將 Mistral AI 的模型整合至 SAP AI Foundation,並共同開發面向歐洲複雜產業與行政機構的專用方案。
Google DeepMind 發佈 Gemini 3,Gemini 3 Pro 已透過 Gemini API、Google AI Studio 和 Vertex AI 提供預覽。
推薦理由:文章並列 Gemini 3 Pro 的基準成績、API 定價和接入渠道,亦介紹 Google Antigravity 如何跨工作區管理智能體,具體呈現模型與開發流程的結合方式。
Google DeepMind 發佈 Gemini 3,推出預覽版 Gemini 3 Pro,並介紹加強推理能力的 Gemini 3 Deep Think。
推薦理由:Gemini 3 Pro 與 Gemini 3 Deep Think 的兩項基準成績並列,便於比較加強推理模式在 Humanity’s Last Exam 和 GPQA Diamond 的分數差異。
Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。
推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。
Google DeepMind公佈生物圈研究進展,涵蓋森林砍伐風險預測、地球物種分佈製圖,以及生物聲學模型 Perch 的更新。
Google Research 在 UIST’25 發表 StreetReaderAI 概念驗證原型,結合情境感知即時 AI 與無障礙導航,探索讓盲人及低視力人士使用 Street View。
Hugging Face 為開源工具 AI Sheets 加入視覺功能,讓用户可在試算表中分析圖片、抽取資料、生成及編輯圖像。AI Sheets 透過 Inference Providers 使用數千個開放模型;示例以自訂提示詞從手寫食譜圖片提取文字,並可修訂結果、整理後匯出資料集至 Hub。
推薦理由:這次更新把圖片理解、生成與編輯納入同一試算表流程,並以手寫食譜示範從提示詞抽取文字、修訂結果到匯出資料集的做法。
Hugging Face 更新開放 OCR 模型指南,加入 Chandra、OlmOCR-2 及模型在 OlmOCR Benchmark 的比較分數。指南對照多款模型的輸出格式、語言支援、功能與成本,並介紹 OmniDocBenchmark、OlmOCR-Bench 和 CC-OCR 等評測基準。
推薦理由:文章對照模型能力、輸出格式、評測基準與部署成本,並建議以代表性樣本檢驗不同文件和語言下的表現。
Hugging Face Blog 提供以 Optimum Intel 和 OpenVINO 在 Intel CPU 上本地運行 SmolVLM2-256M-Video-Instruct 的三步教程,涵蓋模型轉換、量化及推理。
推薦理由:文章展示 VLM 在 Intel CPU 上以 OpenVINO 完成轉換、兩種量化和推理的三步流程,並交代靜態量化校準與精度影響。
Hugging Face 為 Gradio 加入可見水印功能,讓開發者可在生成圖片、影片及 AI 文字內容中加入水印。gr.Image 和 gr.Video 可透過 watermark 參數設定水印,聊天介面亦可設定自訂文字水印,使用者複製 AI 回應時會自動附上標示。
OpenAI 發佈更先進的語音對語音模型 gpt-realtime,並為 Realtime API 加入新 API 能力。更新包括 MCP server 支援、圖像輸入及 SIP 電話呼叫支援。
推薦理由:公告同時列出語音對語音模型與 Realtime API 的更新,並點明 MCP server、圖像輸入及 SIP 電話呼叫支援,方便掌握本次功能範圍。
Hugging Face 的 TRL 新增視覺語言模型對齊訓練支援,涵蓋 MPO、GRPO、GSPO、RLOO、Online DPO 與原生 SFT 支援。MPO 結合 DPO 偏好損失、BCO 品質損失與 SFT 生成損失,文中引述論文稱該組合在 MathVista 提升 6.2 pts。
Mistral 以 Aerial Image Dataset 微調 Pixtral-12B,將衞星影像分類的整體準確率由 0.56 提升至 0.91,幻覺比例則由 5% 降至 0.1%。
Hugging Face Blog 介紹開源基準 TimeScope,評估視覺語言模型對 1 分鐘至 8 小時影片的理解能力。基準在長影片中插入約 5–10 秒短片,分別測試局部檢索、資訊綜合和細粒度時間感知。結果顯示模型表現會隨影片變長而下降;Gemini 2.5-Pro 是唯一在超過一小時影片上仍維持良好準確率的模型,而千問(Qwen)2.5-VL 在文字資訊綜合較強、細粒度動態辨識較弱。
Mistral AI 為 Le Chat 推出 Deep Research、語音、多語言推理、Projects 和圖片編輯等新功能。Deep Research(Preview)可搜尋可信來源並生成附參考資料的結構化報告,語音模式採用 Voxtral,多語言推理由 Magistral 驅動,圖片編輯則與 Black Forest Labs 合作。
推薦理由:Le Chat 把研究、語音、多語言推理、Projects 與圖片編輯納入同一產品,呈現其如何覆蓋資訊整理、語音互動和圖像修改等不同任務。
Mistral AI 發佈 Voxtral 語音理解模型,提供 24B 生產級版本及 3B 本地與邊緣部署版本。兩者均以 Apache 2.0 授權發布,並可透過 API 使用;32k token 上下文支援最長 30 分鐘音訊轉錄或 40 分鐘音訊理解,也可對音訊提問及生成摘要。API 價格由每分鐘 $0.001 起。
推薦理由:Voxtral 同時提供 24B 與 3B 版本及 API 使用方式,並列出音訊時長上限和起始價格,方便比較本地部署與雲端接入的適用情境。
NVIDIA 將 8B 視覺語言模型 Llama Nemotron Nano VL 上架 Hugging Face Hub,亦可透過 NVIDIA NIM API 使用,主打智能文檔處理與 OCR。
Gemma 3n 已接入多個主流開源工具庫,並推出 E2B、E4B 兩種尺寸的 base 與 instruct 版本。支援工具包括 Transformers、timm、MLX、llama.cpp、Transformers.js 和 Ollama;兩款模型實際參數量為 5B 和 8B,GPU 記憶體佔用約相當於 2B 和 4B 模型。
推薦理由:文章並列模型的實際參數量、GPU 記憶體需求和多個工具庫的接入方式,方便衡量 Gemma 3n 本地多模態部署時的硬件門檻與工具選擇。
H Company 發佈 Holo1 開源 VLM 系列及 WebClick UI 定位基準,後者收錄 1,639 項 UI 任務。Holo1 系列包括 Holo1-3B 和 Holo1-7B,後者在常見 UI 定位基準的平均準確率為 76.2%。Surfer-H 採用 Holo1 開放權重模型;H Company 稱,該智能體在真實網頁任務上的準確率為 92.2%,每項任務成本為 $0.13。
Hugging Face 發佈 SmolVLA,一款 450M 開源 Vision-Language-Action(VLA)機械人模型,以 LeRobot 社羣數據預訓練,可在消費級硬件上運行。
推薦理由:文中比較社羣數據預訓練前後的成功率,以及同步與非同步推理的完成時間和吞吐量,呈現數據與推理架構各自帶來的變化。
Mistral AI 發佈 Mistral Medium 3,定位為兼顧效能、成本與企業部署的語言模型。Mistral AI 稱,該模型在各項基準測試中的表現達到 Claude Sonnet 3.7 的 90% 或以上,API 定價為每 M token 輸入 $0.4、輸出 $2;亦可部署於任何雲端,包括使用 4 張或以上 GPU 的自託管環境。
推薦理由:文章將 Mistral Medium 3 與 Claude Sonnet 3.7 的基準表現、API 定價和自託管條件放在一起比較,呈現企業部署時效能、成本與部署方式之間的核心取捨。
Meta 發佈 Llama Guard 4 多模態安全模型,以及兩款用於偵測提示詞注入和越獄的 Llama Prompt Guard 2 分類器,參數量分別為 86M 和 22M。
推薦理由:文章交代 Llama Guard 4 的圖文審核範圍與單張 24 GB VRAM GPU 部署條件,並附 Llama Prompt Guard 2 分類器規格及使用示例。
Language Technologies Lab 發佈 Visual Salamandra,將 7B 參數的 Salamandra 模型擴展至圖像與影片理解。
Hugging Face 與 Cloudflare 合作,讓 FastRTC 開發者可透過 Hugging Face token 使用 Cloudflare 的企業級 WebRTC 基礎設施。
Hugging Face 將 Llama 4 Maverick (~400B) 與 Scout (~109B) 的權重上架 Hub,並宣佈 Transformers 與 TGI 支援。
推薦理由:文章整理了長上下文所用的 NoPE、分塊注意力與 temperature tuning 設計,讓讀者瞭解 Llama 4 延伸上下文窗口的架構取捨。
NVIDIA 在 GTC 2025 發佈 Cosmos Transfer、Physical AI Dataset 和 NVIDIA Isaac GR00T N1 三項 Physical AI 開源資源。
推薦理由:三項資源分別涵蓋可控合成場景、機械人訓練數據與人形機械人推理及技能,呈現 Physical AI 開發中生成、訓練和執行能力的不同分工。
Mistral AI 發佈 Mistral Small 3.1,改進文本表現與多模態理解,並將上下文窗口擴展至最高 128k tokens。官方稱模型推理速度為 150 tokens per second,表現超越 Gemma 3、GPT-4o Mini 等可比模型,並以 Apache 2.0 授權釋出。
推薦理由:文中將 Mistral Small 3.1 的文本、多模態、長上下文與多語言表現放入同級比較,並列出本地運行條件及下載、API 等使用入口。