智能體私隱與安全中的待解及新興問題:情境視角
Google Research 發佈智能體私隱與安全研討會報告,梳理自主智能體面對的核心挑戰。報告以情境完整性(CI)為基礎,主張加入情境政策引擎,在資料離開用戶工作區前評估資料流是否恰當,並提出系統、模型及用戶層面的多層防護方向。
Google Research 發佈智能體私隱與安全研討會報告,梳理自主智能體面對的核心挑戰。報告以情境完整性(CI)為基礎,主張加入情境政策引擎,在資料離開用戶工作區前評估資料流是否恰當,並提出系統、模型及用戶層面的多層防護方向。
Google Research 公佈採用可信執行環境(TEE)的新一代聯邦學習系統,讓伺服器端的數據匿名化處理可供驗證和審計。設備上傳的訓練數據只會交由符合預先授權存取政策的 TEE 工作負載解密處理,相關政策亦發布於 Rekor 公開透明日誌。Gboard 已採用新系統推出英文及日文下一詞預測模型,模型私隱保障更強、準確度更高,計算時間亦較舊系統大幅縮短。
推薦理由:文章比較舊式聯邦學習與 TEE 架構在服務端可驗證性上的差異,並交代存取政策公開記錄機制及 Gboard 部署後在私隱、準確度和訓練速度上的變化。
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
Google DeepMind 推出 SynthID Bio,將可檢測水印嵌入蛋白質序列和預測結構,以辨識 AI 生成的生物設計。
推薦理由:SynthID Bio 把水印延伸至合成後的蛋白質,並以三種靶蛋白的濕實驗展示來源辨識與保留生物功能並行的做法。
Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,將近乎即時視像生成與語音結合,讓企業智能體以動態虛擬形象進行多模態對話。
Google DeepMind 推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,支援自訂聲線、逐句控制表演及雙人對話生成。
推薦理由:兩款 TTS 模型涵蓋逐句演繹與長篇生成,Flash TTS 另可自訂聲線;聲音複製設有同意驗證,生成音訊加入 SynthID 水印,呈現創作控制與防護安排。
Google Research 提出 MilleMiglia,一款以 C++ 編寫、用於生成中段物流配送問題擬真基準實例的工具。它以保護私隱的方式生成資料,旨在支援中段物流優化的後續研究。原始碼及文件可於 GitHub 取得。
Google Research 分享一項生成式 UI 研究實驗,讓教師按教學目標及課程內容建立自訂、互動且具引導性的教育模擬。該團隊同時釋出逾 30 個英文 STEM 互動學習範例,涵蓋初中及高中物理、化學、生物和數學,全部由 AI 生成並經教師審核;使用 Google Workspace for Education 的學校可報名參加試點。
Google DeepMind 發佈 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,前者面向規模化與成本效率,後者針對高複雜度任務。
推薦理由:文章區分兩款模型在規模化成本效率與高複雜度任務上的定位,並列出語音代理基準成績,方便比較其應用取向。
Google DeepMind 推出 AlphaGenome Atlas,提供人類基因組 9 billion 個單核苷酸變異的分子效應預測。平台整合 AlphaGenome 與 AlphaMissense 的預測,推出 AVI 分數,協助研究者排序變異並解讀分子效應,涵蓋編碼及非編碼區域。
推薦理由:UK Biobank 案例顯示,按預測分子效應聚合罕見變異,研究者在逾 54,000 名參與者資料中多找出 22% 的非編碼區域遺傳關聯。
Google Research 發現,UK Biobank 歐洲樣本有助於小樣本日本族羣 PRS 預測,但 Biobank Japan 訓練樣本達 15k 或以上時,目標族羣專屬模型更佳。
Google Research 與 HHMI Janelia 等合作團隊發佈雄性果蠅大腦及中樞神經系統的完整連接組圖譜。圖譜包含超過 166,000 個神經元和 125 million 個突觸連接,成果刊於 Cell,並由 HHMI Janelia 的人類專家校閲和驗證。研究者可透過開源工具 Neuroglancer 查看、探索和下載圖譜,並與雌性果蠅圖譜比較神經差異及個體變異。
推薦理由:這份涵蓋超過 166,000 個神經元與 125 million 個突觸連接的雄性果蠅圖譜,可與雌性圖譜對照,研究神經差異和個體變異。
Google DeepMind 與 Google Research 發佈 WeatherNext 3,利用即時地球同步衞星資料逐小時生成全球天氣預報,部分地表變數解析度達 5 公里。
推薦理由:WeatherNext 3 以即時衞星觀測支援逐小時全球預報,並為部分變數提供 5 公里解析度;文中列出降水預測相對 IMERG、MRMS 等基線的 CRPS 改善幅度。
Google DeepMind 推出有限度開放的 Fairwind Program,讓政府機構及可信賴夥伴使用進階 AI 網絡防禦能力。計劃把 Gemini 3.8 Flash Cyber 與 CodeMender 結合,用於自主發現、驗證及修復漏洞,並可在機構安全雲端環境內於數分鐘生成經驗證、可部署的修補程式。
推薦理由:Fairwind 將 Gemini 3.8 Flash Cyber 與 CodeMender 結合,讓參與機構在安全雲端環境內生成經驗證、可部署的漏洞修補程式,將人工修補由數週縮至數分鐘。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。
Google DeepMind 推出 Gemini 智能體影片理解功能,影片分析成本最多降低 66%、token 用量最多降低 88%,準確度最多提升 7%。
推薦理由:相較固定 FPS 靜態處理,Gemini 會動態檢視畫面、音訊與字幕,影片分析的 token 用量最多減少 88%、成本最多減少 66%。
Google Research 發佈 TimesFM-3,一款原生支援多變量零樣本預測的時間序列基礎模型,可在單次前向傳播中預測多條相關序列。它有 330 million parameters,使用超過 1 trillion time points 的真實及合成時間序列資料預訓練,並能結合多個目標、歷史協變量和已知未來協變量,無需任務專用微調。
Google Earth AI 介紹實驗性行星預測引擎(PPE),可根據自然語言查詢自主完成地理空間資料搜尋、整理、模型訓練與評估。測試中,21 項 CDC 健康指標的平均 R² 為 76.8%,高於人工專家流程的 60.0%;尼日利亞糧食安全由 ADM1 下採樣至 ADM2,R² 為 66.1%,基線為 31.5%。
Google DeepMind 推出 Gemini Omni 1.1 Flash,為影片生成加入場景延伸、首尾幀控制、影片參考輸入及 1080p 或 4K 輸出。
推薦理由:場景延伸可分析最多10秒的既有影片,並以10秒增量延長至累計40秒;配合首尾幀指定,呈現更長影片創作中的控制方式。
Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。
推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。
Google Research 提出 AgentHands,將 LLM 回應轉化為與語音同步、能配合 XR 空間場景的手勢。系統透過物件註冊、手勢事件和字級時間戳協調語音播放與動畫;研究以 N = 12 名參與者進行受試者內測試,使用蘭花護理和 3D 打印機操作任務,比較 AgentHands 與純語音基線。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,將匿名聚合流動模式融入地點表示,增強語言模型對地點動態功能的理解。在未見地點的測試中,到訪意向預測相對提升最高 81.9%,價格水平分類提升 75.1%,繁忙程度估算準確度提升 24.7%。
Google DeepMind 發佈 Gemini 3.7 Flash,稱其在編碼、知識工作及網頁開發工作流上較 Gemini 3.6 Flash 有所提升。
推薦理由:文章列出 Gemini 3.7 Flash 在編碼、網頁開發和複雜文件基準上的對比數據,並交代入門價格,便於衡量效能與成本取捨。
Google DeepMind 發佈 SL2T 多語言手語轉文字模型,為 Gboard 和 Live Transcribe 帶來手語轉文字功能,首階段支援 ASL 至英文。
推薦理由:SL2T 以簽署者的身體姿態座標直接翻譯成文字,原始影片會即時丟棄,呈現其輸入處理方式與私隱保護設計。
Google Research 提出 knowledge profiling 框架及 WikiProfile 基準,發現前沿大語言模型的事實性錯誤更多源於已編碼事實難以回憶,而非未能編碼。
推薦理由:研究以 WikiProfile 分別測量事實編碼、回憶與識別,將模型事實性錯誤區分為知識缺失或提取失敗,提供比單看答題準確率更細的診斷視角。
Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。
推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。
Google Research 提出 Chain-of-Evidence(CoE)可驗證研究框架,並以 Science One Framework 展示如何在自主研究中為每項主張建立證據鏈。
Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。
推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。
Google DeepMind 今日在 Google Flow Music 推出音樂生成模型 Lyria 3.5,並提升旋律、歌詞及人聲生成品質。它可生成更豐富、複雜且自然的旋律結構,並改善歌詞的提示詞遵循度與結構意識,以及人聲的真實感、情感細膩度和發音。使用者也可更容易控制生成內容的節奏和時長。
Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。
推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。
Google Research 以 13,917 名參與者評估 SymptomAI,臨牀專家在逾 50% 個案中偏好其鑑別診斷。主動追問的智能體策略在鑑別診斷準確度上顯著優於 Base 條件;研究亦發現 SymptomAI 的呼吸道感染診斷分類與症狀報告前的 Fitbit 生理訊號變化相符。研究產生的診斷僅供研究分析,不構成確認的臨牀診斷或正式醫療評估。
Google Research 在 Willow 超導量子處理器上驗證強化學習控制,讓系統依錯誤檢測訊號在運算中持續校準。刻意注入控制參數漂移後,該方法使錯誤更正碼的邏輯穩定性提升 3.5 倍;專家校準後再經 RL 微調,邏輯錯誤率額外降低 20%。涵蓋數百個 qubit 和數萬個控制參數的數值模擬顯示,所需 RL 訓練迭代次數不隨系統規模變化。
Google 在 DOE Genesis Mission Summit 2026 宣佈,將提供 $40 million 的 AI tokens 和雲端額度,支持 Genesis Mission 研究人員。
推薦理由:承諾同時涵蓋科學 AI 工具與 Gemini for Government 一年使用權,並附有顯微鏡校準時間及手動步驟的前後數據,可見資源投入如何落到實驗室工作流程。
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。
Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。
推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。
Google DeepMind 與 Isomorphic Labs 公佈聯合生物韌性方案,將工作分為防止威脅者濫用 AI 模型,以及運用 AI 支援疫情預防、檢測和應對兩部分。
Google Research 提出 SensorFM 大型感測器基礎模型,以來自五百萬名參與者的逾一萬億分鐘未標註穿戴式裝置訊號學習通用生理表徵。凍結模型編碼器後訓練的線性探測,在 35 項健康任務中的 34 項勝過特徵工程監督基線。在 31 份參與者檔案的評估中,加入 SensorFM 預測提升個人健康智能體摘要在五個評分維度的表現;與以真實測量值作依據的摘要評分則沒有統計顯著差異。
Google Research 在 10 座美國城市以 Google Maps 進行導航改道實驗,發現少於 2% 行程收到改道建議,也可提升行車速度並降低燃料消耗。
推薦理由:研究在 10 座美國城市以全市交叉實驗測試導航改道,呈現少於 2% 行程受影響時,行車速度上升、燃料消耗下降的路網效益。
Google DeepMind 與 A24 宣佈建立首創研究合作夥伴關係,合作將涵蓋多個研發項目,並協助藝術家發展新工作流程與技術。合作初期聚焦連結尖端科技與新一代娛樂,具體目標、技術成果及創作里程碑將隨時間演進。Google 亦已投資 A24。