Google DeepMind 發佈 Gemini 4 Argon,面向複雜長流程任務
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
Google DeepMind 推出 SynthID Bio,將可檢測水印嵌入蛋白質序列和預測結構,以辨識 AI 生成的生物設計。
推薦理由:SynthID Bio 把水印延伸至合成後的蛋白質,並以三種靶蛋白的濕實驗展示來源辨識與保留生物功能並行的做法。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,將近乎即時視像生成與語音結合,讓企業智能體以動態虛擬形象進行多模態對話。
Google DeepMind 發佈 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,前者面向規模化與成本效率,後者針對高複雜度任務。
推薦理由:文章區分兩款模型在規模化成本效率與高複雜度任務上的定位,並列出語音代理基準成績,方便比較其應用取向。
Google DeepMind 推出 AlphaGenome Atlas,提供人類基因組 9 billion 個單核苷酸變異的分子效應預測。平台整合 AlphaGenome 與 AlphaMissense 的預測,推出 AVI 分數,協助研究者排序變異並解讀分子效應,涵蓋編碼及非編碼區域。
推薦理由:UK Biobank 案例顯示,按預測分子效應聚合罕見變異,研究者在逾 54,000 名參與者資料中多找出 22% 的非編碼區域遺傳關聯。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。
Google DeepMind 推出 Gemini Omni 1.1 Flash,為影片生成加入場景延伸、首尾幀控制、影片參考輸入及 1080p 或 4K 輸出。
推薦理由:場景延伸可分析最多10秒的既有影片,並以10秒增量延長至累計40秒;配合首尾幀指定,呈現更長影片創作中的控制方式。
Google DeepMind 發佈 Gemini 3.7 Flash,稱其在編碼、知識工作及網頁開發工作流上較 Gemini 3.6 Flash 有所提升。
推薦理由:文章列出 Gemini 3.7 Flash 在編碼、網頁開發和複雜文件基準上的對比數據,並交代入門價格,便於衡量效能與成本取捨。
Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。
推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。
Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。
推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。
Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。
推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。
Google DeepMind 與 Isomorphic Labs 公佈聯合生物韌性方案,將工作分為防止威脅者濫用 AI 模型,以及運用 AI 支援疫情預防、檢測和應對兩部分。
Google DeepMind 發佈實驗性開放模型 DiffusionGemma,透過文字擴散並行生成文字,在專用 GPU 上文字生成最高快 4 倍。
推薦理由:DiffusionGemma 的優勢集中於低至中等批次的單加速器推理,高 QPS 雲端服務則可能收益較小並增加服務成本。
Google DeepMind 宣佈最高 $10M 的多智能體 AI 安全研究資助計劃,面向全球研究人員徵集申請。
Google DeepMind 發佈 Gemini 3.5 Live Translate,這款音訊模型可自動識別 70+ 種語言,並進行近乎即時的語音轉語音翻譯。
推薦理由:模型以連續生成譯語音訊取代逐輪等待,並透過 API、Google Meet 和 Google Translate 進入開發、企業會議及日常翻譯場景,呈現其部署路徑。
Google DeepMind 發佈 Gemma 4 12B,定位為可在筆記型電腦本機運行的多模態模型,並為中型模型加入原生音訊輸入。它採用免多模態編碼器架構,將視覺和音訊輸入直接整合至 LLM backbone;標準基準表現接近 26B MoE,總記憶體佔用不足其一半。Gemma 4 12B 以 Apache 2.0 授權釋出,可透過 LM Studio、Ollama 等工具試用。
推薦理由:Gemma 4 12B 的免編碼器設計、接近 26B MoE 的基準表現與較低記憶體佔用,提供比較中型多模態模型架構和本機部署定位的具體依據。
Google DeepMind 為 Project Genie 加入 Street View 地點錨定能力,並開始向全球符合資格的 Google AI Ultra $200 訂閲者逐步開放(18+)。
推薦理由:Project Genie 把美國 Street View 地點作為生成世界的起始位置,並可套用不同風格,具體呈現真實地理影像如何用於構建虛擬環境。
Google DeepMind 推出 Gemini Omni 系列首個模型 Gemini Omni Flash,可結合圖像、影片、文字及語音參考生成影片,並支援透過對話編輯。
推薦理由:材料把 Gemini Omni Flash 的多模態輸入、對話式影片編輯和分階段上線平台放在一起,便於理解新模型如何連接生成能力與實際使用入口。
Google DeepMind 推出 Gemini for Science,涵蓋 Google Labs 三項科學研究實驗及 Google Antigravity 的 Science Skills。
推薦理由:三項實驗工具分別對應假設生成、計算探索與文獻整理,呈現 Gemini for Science 將 AI 智能體引入科研流程不同環節的設計。
Google 擴展內容來源驗證工具至 Search、Gemini、Chrome、Pixel 和 Cloud,並在 Google Cloud 推出 AI Content Detection API。
推薦理由:內容驗證由面向一般使用者的 Gemini、Search、Chrome 延伸至 Cloud API,後者可識別 Google 及其他熱門模型生成內容,協助企業評估和管理自有平台上的媒體。
Google DeepMind宣佈在新加坡推出多項AI合作計劃,並參與Google與新加坡政府的全國AI夥伴關係。計劃涵蓋醫療與生命科學、科研、教育及可持續發展,並推進多模態與多語言安全基準研究;Gemini for Education已提供予小學至初級學院的所有教育工作者。
愛丁堡大學的 Filippo Menolascina 團隊使用 Co-Scientist 梳理 MASH 文獻,提出後經實驗驗證的肝病機製假説。針對近期獲批、用於 MASH 特定階段的 resmetirom 僅對少部分合資格患者有效的問題,該假説將 NLRP3 炎症小體指為連接疾病中炎症與代謝的分子橋樑。
Stanford University School of Medicine 的 Gary Peltz 團隊測試 Co-Scientist 提出的 3 種肝纖維化候選藥物,當中 2 種阻止纖維化並促進肝細胞再生。
推薦理由:研究在同一活體人類肝細胞平台比較 Co-Scientist 與研究者挑選的藥物,呈現系統從少量相關文獻線索中找到候選藥物的案例。
Google DeepMind 發佈 Gemini 3.5 模型系列,首款 Gemini 3.5 Flash 即日起透過 Gemini app 和 Google Search 的 AI Mode 向全球用户開放。
推薦理由:Gemini 3.5 Flash 列出代理任務、編碼及多模態基準成績,並比較每秒輸出 tokens 的速度,讓性能主張有多項指標可供對照。
Google DeepMind 公佈以 Gemini 構建的 Co-Scientist 多智能體科研系統,將逐步向研究人員開放。Hypothesis Generation 實驗工具將於未來數週開始推出,研究人員可在 labs.google/science 登記意向;系統以專職智能體生成、辯論和演化假設,再用 Elo-based tournament 排序並交叉核查文獻與數據。
推薦理由:Co-Scientist 以多智能體迭代生成、辯論和篩選科研假設,肝纖維化案例亦列出一項候選藥物在實驗室阻斷 91% 疤痕相關反應的結果。
Google DeepMind 宣佈與韓國科學技術情報通信部(MSIT)建立合作夥伴關係,支持韓國 AI 科研、人才培育及安全研究。Google 將在首爾辦公室設立 AI Campus,並探索與首爾大學(SNU)、韓國科學技術院(KAIST)等機構合作,在生命科學、能源、天氣與氣候等領域運用 AI for Science 模型。
Google DeepMind 宣佈與五家全球企業顧問公司合作,協助各行業大規模採用前沿 AI,推進 AI 驅動的企業轉型。合作方包括 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey,工作聚焦金融、製造、零售、媒體與娛樂等行業,涵蓋行業專屬 AI 能力開發及包括 Gemini 系列在內的前沿模型早期使用。
Google DeepMind 發佈 Gemini 3.1 Flash TTS,提升文字轉語音的可控性、表現力與品質,並加入音訊標籤細調語音表現。模型支援 70+ 種語言及原生多説話者對話,在 Artificial Analysis TTS leaderboard 的 Elo 分數為 1,211。
推薦理由:文章聚焦音訊標籤如何細調語氣、節奏與表達,並列出 Gemini 3.1 Flash TTS 面向開發者、企業及 Workspace 用户的推出渠道。
Google DeepMind 的 Gemma 4 多模態模型系列已登陸 Hugging Face,提供五種尺寸,支援圖像、文字及部分型號的音訊輸入。模型採 Apache 2 授權,最大上下文窗口為 256K;31B 和 26B A4B 的 text-only LMArena 估算分數分別為 1452 和 1441,後者有 4B 啟用參數。
推薦理由:文章列出五種 Gemma 4 規格、上下文窗口和音訊支援差異,並整理多個推理與微調框架的接入方式,可供比較型號特點及部署路徑。
Google DeepMind 介紹 AI 指針的設計原則與實驗演示,並宣佈即日起可在 Chrome 用指針向 Gemini 提問網頁內容。這套設計以四項原則為核心,讓指針結合視覺和語義上下文及語音,減少使用者撰寫詳細提示詞的需要。Magic Pointer 將即將在 Googlebook 推出。
推薦理由:文章以四項交互原則説明 AI 指針如何減少提示詞負擔,並列出 Gemini 在 Chrome 的現有功能及 Googlebook 即將推出的 Magic Pointer。
Google DeepMind 推出 Gemini 3.1 Flash Live,提升即時語音對話的精準度並降低延遲。它在 ComplexFuncBench Audio 得分 90.8%,在 Scale AI 的 Audio MultiChallenge 開啟 thinking 時得分 36.1%。
推薦理由:原文以兩項語音基準呈現多步函數調用與複雜指令跟隨表現,並列出開發者、企業及一般用户的使用入口,可對照其能力與部署場景。
Google DeepMind 公開一套經實證驗證的工具包及研究材料,用於評估 AI 有害操縱能力,並衡量操縱成效與模型採用操縱手法的傾向。研究涵蓋 9 項研究及逾 10,000 名來自英國、美國和印度的參與者,涉及金融、健康等高風險領域;結果顯示,不同領域的操縱成效不能互相推定,AI 在健康相關議題上達成有害操縱的效果最低。
推薦理由:研究把有害操縱評估拆分為操縱成效與模型採用操縱手法的傾向,並發現不同領域的結果不能互相推定,為高風險情境評估提供可複用方法。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,現正以預覽版向開發者及企業開放,開發者可透過 Google AI Studio 的 Gemini API 使用,企業則可透過 Vertex AI 使用。
推薦理由:文章把 Gemini 3.1 Flash-Lite 的定價、相較 2.5 Flash 的速度數據及質素描述並列,呈現其面向高頻工作負載的成本定位。
Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。
推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。
Google DeepMind 發佈 Gemini 3.1 Pro,作為 Gemini 3 系列核心模型升級,提升複雜問題的推理能力。它在 ARC-AGI-2 取得經驗證的 77.1% 得分,推理表現超過 Gemini 3 Pro 兩倍。
推薦理由:Gemini 3.1 Pro 在 ARC-AGI-2 取得經驗證的 77.1% 得分,並稱推理表現超過 Gemini 3 Pro 兩倍,為核心推理升級提供量化比較依據。
Google DeepMind 在 Gemini app beta 推出 Lyria 3 音樂生成模型,使用者可用文字提示或上傳照片、影片生成 30 秒音軌。系統會按提示生成歌詞,並可調整風格、人聲和節奏;音軌嵌入 SynthID,Gemini 的核驗功能亦延伸至音訊,使用者可上傳檔案詢問其是否由 Google AI 生成。
推薦理由:Lyria 3 在 Gemini app 開放以文字、圖片或影片生成音樂,並納入 SynthID 與音訊核驗,呈現創作功能和 AI 內容識別並行的設計。
Google DeepMind 宣佈與印度政府部門及當地機構建立新合作,擴大 AI 在科學與教育領域的應用。合作將向印度研究人員提供 AlphaGenome、AI Co-scientist 和 Earth AI,並推出 $30 million Google.org Impact Challenge: AI for Science。
推薦理由:文章列出研究機構合作、AI 科學挑戰賽及教材互動化安排,呈現 Google DeepMind 在印度推進科學與教育應用的具體路徑。
Google DeepMind 發佈 Gemini 3 Deep Think 重大升級,面向科學、研究與工程領域的複雜挑戰。
推薦理由:文章列出數學、編程及科學基準的具體成績,並交代 Gemini app 與 Gemini API 的開放方式,呈現本次升級的評測範圍和使用入口。
Google Research 與 Included Health 宣佈,待機構審查委員會(IRB)批准後,將在全美開展前瞻性、經參與者同意的隨機研究,評估對話式 AI 在真實虛擬醫療流程中的表現。研究將把 AI 管理患者互動的能力與限制,和標準臨牀實踐比較,從模擬研究及單中心可行性測試推進至全國規模的真實臨牀評估。