跳到正文

#多模態

今日 0 條
1月30日週五
  1. Google DeepMind68

    Project Genie:用實驗原型探索無限互動世界

    Google DeepMind 開始向美國年滿 18 歲的 Google AI Ultra 訂户逐步開放 Project Genie;這款由 Genie 3、Nano Banana Pro 和 Gemini 驅動的實驗研究原型,可建立、探索及改編互動世界。

    推薦理由:原型把世界草圖、即時探索與改編放進同一體驗,並交代生成時長、物理表現和角色操控限制,可看出目前互動世界模型的使用方式與邊界。

1月23日週五
  1. Google Research44

    小模型,大成果:Google Research 以分解方法提升意圖提取效果

    Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。

1月14日週三
  1. Google Research70

    Google 發佈 MedGemma 1.5 4B,介紹 MedASR 醫療語音轉文字模型

    Google 發佈開放醫療多模態模型 MedGemma 1.5 4B,新增 CT、MRI、病理全切片及胸部 X 光時間序列等醫療影像處理能力。其基準結果較 MedGemma 1 4B 提升,例如 CT 疾病分類準確率為 61%(58%),MRI 為 65%(51%),醫療文本 EHRQA 為 90%(68%)。

    推薦理由:MedGemma 1.5 4B 在多項醫療影像與文本基準上較前代提升,文中列出的具體分數可用來比較不同任務的改進幅度。

1月6日週二
12月19日週五
  1. Google Research52

    Google Research 回顧 2025 年研究突破與應用成果

    Google Research 回顧 2025 年研究成果,涵蓋生成模型、生成式 UI、量子計算、AI 科學工具及氣候、醫療與教育應用。Gemini 3 引入生成式 UI,可按提示詞生成互動介面;Gemma 擴展至 140 多種語言。效能研究顯示,使用 Learn Your Way 的學生在保留測試中的得分高 11 個百分點。

12月17日週三
12月11日週四
  1. OpenAI News71

    OpenAI 發佈面向日常專業工作的 GPT-5.2

    OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。

    推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。

12月9日週二
12月4日週四
12月3日週三
  1. Mistral AI77

    Mistral AI 發佈 Mistral 3 模型系列,包含 Ministral 3 與 Mistral Large 3

    Mistral AI 發佈 Mistral 3 模型系列,包含 14B、8B、3B 三款 Ministral 3,以及 Mistral Large 3。Ministral 3 的每種尺寸均提供 base、instruct 和 reasoning 版本,具備圖像理解能力;全系列均按 Apache 2.0 授權釋出。

    推薦理由:Mistral 3 覆蓋 3B 至 675B 的模型規模,並列出邊緣端與資料中心的部署路徑,可供比較開源模型的部署選擇。

11月20日週四
  1. Google DeepMind66

    Google DeepMind 如何將 AI 圖像驗證功能帶入 Gemini App

    Google DeepMind 在 Gemini App 推出 AI 圖像驗證功能,使用 SynthID 水印判斷圖片是否由 Google AI 生成或編輯。用户可上載圖片並直接提問;SynthID 自 2023 年推出以來,已為超過 20 billion 件 AI 生成內容加上水印。

    推薦理由:文章交代 Gemini 如何透過 SynthID 水印檢查圖像是否由 Google AI 生成或編輯,並説明後續支援影片、音訊及更多介面的計劃。

  2. Google DeepMind75

    使用 Nano Banana Pro(Gemini 3 Pro Image)構建圖像應用

    Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),並以付費預覽方式向開發者開放。模型具備更準確的文字渲染和圖像本地化能力,支援 2K 和 4k 解析度;啟用 Google Search grounding 時,亦可連接即時網頁內容。

    推薦理由:文章把 Nano Banana Pro 的文字渲染、本地化能力與接入方式,連同相較 Gemini 2.5 Flash Image 的成本和延遲取捨一併交代。

11月19日週三
11月13日週四
  1. Google DeepMind66

    Google DeepMind 推出 SIMA 2:能在虛擬 3D 世界中遊玩、推理並與你一同學習的智能體

    Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。

    推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。

11月6日週四
10月30日週四
10月21日週二
  1. Hugging Face Blog66

    Hugging Face AI Sheets 加入圖片分析、生成與編輯功能

    Hugging Face 為開源工具 AI Sheets 加入視覺功能,讓用户可在試算表中分析圖片、抽取資料、生成及編輯圖像。AI Sheets 透過 Inference Providers 使用數千個開放模型;示例以自訂提示詞從手寫食譜圖片提取文字,並可修訂結果、整理後匯出資料集至 Hub。

    推薦理由:這次更新把圖片理解、生成與編輯納入同一試算表流程,並以手寫食譜示範從提示詞抽取文字、修訂結果到匯出資料集的做法。

  2. Hugging Face Blog67

    用開放模型提升 OCR 流程

    Hugging Face 更新開放 OCR 模型指南,加入 Chandra、OlmOCR-2 及模型在 OlmOCR Benchmark 的比較分數。指南對照多款模型的輸出格式、語言支援、功能與成本,並介紹 OmniDocBenchmark、OlmOCR-Bench 和 CC-OCR 等評測基準。

    推薦理由:文章對照模型能力、輸出格式、評測基準與部署成本,並建議以代表性樣本檢驗不同文件和語言下的表現。

10月15日週三
9月15日週一
8月28日週四
  1. OpenAI News76

    OpenAI 發佈 gpt-realtime 語音對語音模型並更新 Realtime API

    OpenAI 發佈更先進的語音對語音模型 gpt-realtime,並為 Realtime API 加入新 API 能力。更新包括 MCP server 支援、圖像輸入及 SIP 電話呼叫支援。

    推薦理由:公告同時列出語音對語音模型與 Realtime API 的更新,並點明 MCP server、圖像輸入及 SIP 電話呼叫支援,方便掌握本次功能範圍。

8月7日週四
8月1日週五
7月23日週三
  1. Hugging Face Blog50

    TimeScope:大型多模態模型能理解多長的影片?

    Hugging Face Blog 介紹開源基準 TimeScope,評估視覺語言模型對 1 分鐘至 8 小時影片的理解能力。基準在長影片中插入約 5–10 秒短片,分別測試局部檢索、資訊綜合和細粒度時間感知。結果顯示模型表現會隨影片變長而下降;Gemini 2.5-Pro 是唯一在超過一小時影片上仍維持良好準確率的模型,而千問(Qwen)2.5-VL 在文字資訊綜合較強、細粒度動態辨識較弱。

7月17日週四
  1. Mistral AI69

    Mistral AI 為 Le Chat 推出 Deep Research、語音等新功能

    Mistral AI 為 Le Chat 推出 Deep Research、語音、多語言推理、Projects 和圖片編輯等新功能。Deep Research(Preview)可搜尋可信來源並生成附參考資料的結構化報告,語音模式採用 Voxtral,多語言推理由 Magistral 驅動,圖片編輯則與 Black Forest Labs 合作。

    推薦理由:Le Chat 把研究、語音、多語言推理、Projects 與圖片編輯納入同一產品,呈現其如何覆蓋資訊整理、語音互動和圖像修改等不同任務。

7月15日週二
  1. Mistral AI77

    Mistral AI 發佈 Voxtral 語音理解模型

    Mistral AI 發佈 Voxtral 語音理解模型,提供 24B 生產級版本及 3B 本地與邊緣部署版本。兩者均以 Apache 2.0 授權發布,並可透過 API 使用;32k token 上下文支援最長 30 分鐘音訊轉錄或 40 分鐘音訊理解,也可對音訊提問及生成摘要。API 價格由每分鐘 $0.001 起。

    推薦理由:Voxtral 同時提供 24B 與 3B 版本及 API 使用方式,並列出音訊時長上限和起始價格,方便比較本地部署與雲端接入的適用情境。

6月28日週六
6月26日週四
  1. Hugging Face Blog74

    Gemma 3n 全面接入主流開源工具庫,推出 E2B、E4B 尺寸模型

    Gemma 3n 已接入多個主流開源工具庫,並推出 E2B、E4B 兩種尺寸的 base 與 instruct 版本。支援工具包括 Transformers、timm、MLX、llama.cpp、Transformers.js 和 Ollama;兩款模型實際參數量為 5B 和 8B,GPU 記憶體佔用約相當於 2B 和 4B 模型。

    推薦理由:文章並列模型的實際參數量、GPU 記憶體需求和多個工具庫的接入方式,方便衡量 Gemma 3n 本地多模態部署時的硬件門檻與工具選擇。

6月3日週二
  1. Hugging Face Blog62

    Hugging Face 發佈 SmolVLA:基於 LeRobot 社羣數據訓練的 450M 開源 VLA 模型

    Hugging Face 發佈 SmolVLA,一款 450M 開源 Vision-Language-Action(VLA)機械人模型,以 LeRobot 社羣數據預訓練,可在消費級硬件上運行。

    推薦理由:文中比較社羣數據預訓練前後的成功率,以及同步與非同步推理的完成時間和吞吐量,呈現數據與推理架構各自帶來的變化。

5月7日週三
  1. Mistral AI67

    Mistral AI 發佈 Mistral Medium 3,主打效能、成本與企業部署

    Mistral AI 發佈 Mistral Medium 3,定位為兼顧效能、成本與企業部署的語言模型。Mistral AI 稱,該模型在各項基準測試中的表現達到 Claude Sonnet 3.7 的 90% 或以上,API 定價為每 M token 輸入 $0.4、輸出 $2;亦可部署於任何雲端,包括使用 4 張或以上 GPU 的自託管環境。

    推薦理由:文章將 Mistral Medium 3 與 Claude Sonnet 3.7 的基準表現、API 定價和自託管條件放在一起比較,呈現企業部署時效能、成本與部署方式之間的核心取捨。

4月29日週二
4月11日週五
4月9日週三
4月5日週六
3月18日週二
3月17日週一
  1. Mistral AI68

    Mistral Small 3.1 發佈,支援多模態理解與最高 128k tokens 上下文窗口

    Mistral AI 發佈 Mistral Small 3.1,改進文本表現與多模態理解,並將上下文窗口擴展至最高 128k tokens。官方稱模型推理速度為 150 tokens per second,表現超越 Gemma 3、GPT-4o Mini 等可比模型,並以 Apache 2.0 授權釋出。

    推薦理由:文中將 Mistral Small 3.1 的文本、多模態、長上下文與多語言表現放入同級比較,並列出本地運行條件及下載、API 等使用入口。