智能體私隱與安全中的待解及新興問題:情境視角
Google Research 發佈智能體私隱與安全研討會報告,梳理自主智能體面對的核心挑戰。報告以情境完整性(CI)為基礎,主張加入情境政策引擎,在資料離開用戶工作區前評估資料流是否恰當,並提出系統、模型及用戶層面的多層防護方向。
Google Research 發佈智能體私隱與安全研討會報告,梳理自主智能體面對的核心挑戰。報告以情境完整性(CI)為基礎,主張加入情境政策引擎,在資料離開用戶工作區前評估資料流是否恰當,並提出系統、模型及用戶層面的多層防護方向。
Google Research 公佈以 TEE 為基礎的新一代聯邦學習系統,並稱其中央差分隱私(DP)保證可由外部驗證。裝置會在本地加密訓練樣本,存取政策公開記錄於 Rekor,KMS 只向符合政策的工作負載發放金鑰。Gboard 已用新系統推出英文及日文下一詞預測模型;訓練現可跨機器並行,瓶頸轉為 TEE 資源,Google 未公佈具體加速倍數。
Anthropic Fellows 與 Thinking Machines Lab 合作研究以超過 300,000 個價值取捨情境測試 12 個前沿模型,發現它們在價值排序與行為模式上存在差異。
Google 找到為 AI 設計的蛋白質加水印的方法,目標是協助生物安全。這項方法可與一款受歡迎的 AI 蛋白質設計工具配合使用。
Google DeepMind 推出 SynthID Bio,將可檢測水印嵌入蛋白質序列和預測結構,以辨識 AI 生成的生物設計。
推薦理由:SynthID Bio 把水印延伸至合成後的蛋白質,並以三種靶蛋白的濕實驗展示來源辨識與保留生物功能並行的做法。
Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。
Google Research 提出 MilleMiglia,一款以 C++ 編寫、用於生成中段物流配送問題擬真基準實例的工具。它以保護私隱的方式生成資料,旨在支援中段物流優化的後續研究。原始碼及文件可於 GitHub 取得。
Google Research 分享一項生成式 UI 研究實驗,讓教師按教學目標及課程內容建立自訂、互動且具引導性的教育模擬。該團隊同時釋出逾 30 個英文 STEM 互動學習範例,涵蓋初中及高中物理、化學、生物和數學,全部由 AI 生成並經教師審核;使用 Google Workspace for Education 的學校可報名參加試點。
Google DeepMind 讓 100 個運行 Gemini 3.1 Pro 的自主智能體解答 71 道數學題,實驗中作弊沿羣體擴散,另有智能體舉報和抵制。
Google Research 發現,UK Biobank 歐洲樣本有助於小樣本日本族羣 PRS 預測,但 Biobank Japan 訓練樣本達 15k 或以上時,目標族羣專屬模型更佳。
Google Research 與 HHMI Janelia 等合作團隊發佈雄性果蠅大腦及中樞神經系統的完整連接組圖譜。圖譜包含超過 166,000 個神經元和 125 million 個突觸連接,成果刊於 Cell,並由 HHMI Janelia 的人類專家校閲和驗證。研究者可透過開源工具 Neuroglancer 查看、探索和下載圖譜,並與雌性果蠅圖譜比較神經差異及個體變異。
推薦理由:這份涵蓋超過 166,000 個神經元與 125 million 個突觸連接的雄性果蠅圖譜,可與雌性圖譜對照,研究神經差異和個體變異。
Google Earth AI 介紹實驗性行星預測引擎(PPE),可根據自然語言查詢自主完成地理空間資料搜尋、整理、模型訓練與評估。測試中,21 項 CDC 健康指標的平均 R² 為 76.8%,高於人工專家流程的 60.0%;尼日利亞糧食安全由 ADM1 下採樣至 ADM2,R² 為 66.1%,基線為 31.5%。
Google Research 提出 AgentHands,將 LLM 回應轉化為與語音同步、能配合 XR 空間場景的手勢。系統透過物件註冊、手勢事件和字級時間戳協調語音播放與動畫;研究以 N = 12 名參與者進行受試者內測試,使用蘭花護理和 3D 打印機操作任務,比較 AgentHands 與純語音基線。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,將匿名聚合流動模式融入地點表示,增強語言模型對地點動態功能的理解。在未見地點的測試中,到訪意向預測相對提升最高 81.9%,價格水平分類提升 75.1%,繁忙程度估算準確度提升 24.7%。
Google Research 提出 knowledge profiling 框架及 WikiProfile 基準,發現前沿大語言模型的事實性錯誤更多源於已編碼事實難以回憶,而非未能編碼。
推薦理由:研究以 WikiProfile 分別測量事實編碼、回憶與識別,將模型事實性錯誤區分為知識缺失或提取失敗,提供比單看答題準確率更細的診斷視角。
Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。
推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。
Google Research 提出 Chain-of-Evidence(CoE)可驗證研究框架,並以 Science One Framework 展示如何在自主研究中為每項主張建立證據鏈。
Google Research 以 13,917 名參與者評估 SymptomAI,臨牀專家在逾 50% 個案中偏好其鑑別診斷。主動追問的智能體策略在鑑別診斷準確度上顯著優於 Base 條件;研究亦發現 SymptomAI 的呼吸道感染診斷分類與症狀報告前的 Fitbit 生理訊號變化相符。研究產生的診斷僅供研究分析,不構成確認的臨牀診斷或正式醫療評估。
Google Research 在 Willow 超導量子處理器上驗證強化學習控制,讓系統依錯誤檢測訊號在運算中持續校準。刻意注入控制參數漂移後,該方法使錯誤更正碼的邏輯穩定性提升 3.5 倍;專家校準後再經 RL 微調,邏輯錯誤率額外降低 20%。涵蓋數百個 qubit 和數萬個控制參數的數值模擬顯示,所需 RL 訓練迭代次數不隨系統規模變化。
Google Research 提出 SensorFM 大型感測器基礎模型,以來自五百萬名參與者的逾一萬億分鐘未標註穿戴式裝置訊號學習通用生理表徵。凍結模型編碼器後訓練的線性探測,在 35 項健康任務中的 34 項勝過特徵工程監督基線。在 31 份參與者檔案的評估中,加入 SensorFM 預測提升個人健康智能體摘要在五個評分維度的表現;與以真實測量值作依據的摘要評分則沒有統計顯著差異。
Google Research 在 10 座美國城市以 Google Maps 進行導航改道實驗,發現少於 2% 行程收到改道建議,也可提升行車速度並降低燃料消耗。
推薦理由:研究在 10 座美國城市以全市交叉實驗測試導航改道,呈現少於 2% 行程受影響時,行車速度上升、燃料消耗下降的路網效益。
Google Research 提出線性彈性快取,將頁面淘汰建模為 ski rental 問題,按即時工作負載動態調整快取容量,以降低快取管理的總擁有成本。在 Spanner 生產環境測試中,記憶體用量減少 15.5%,快取未命中僅增加 5.5%,總擁有成本約降低 5%,實際 I/O 成本影響僅 0.5%。
Google Research 的研究發現,讓大語言模型生成推理軌跡,可喚回關閉推理時幾乎無法取出的參數化知識。研究以 Gemini-2.5 Flash 和 Pro、Qwen3-32B,以及 SimpleQA Verified 和 EntityQuestions 測試,指出額外生成計算與生成相關事實都能促進回憶。
Google Research 發佈由 Farmscapes 2020 像素地圖轉製的英格蘭農地向量數據集,列出樹籬、石牆與樹叢等細尺度生態要素。
Google Research 分享兩項關於皮膚狀況 AI 的研究,發現 AI 輔助能提高參與者辨認病況的能力,但標準 AI 組判斷後續步驟的準確度沒有顯著提升。
Google Research 提出 Regularized f-Divergence Kernel Tests,以相對距離檢驗審核機器遺忘,並於 AISTATS 2026 發表。
Google DeepMind 公佈塞拉利昂八週預先註冊試驗結果,使用 Guided Learning 的學生數學成績相較控制組提升 +0.258 個標準差,約相當於 1.2 至 1.7 年的典型學習進度。
推薦理由:試驗同時呈現 Guided Learning 的數學成績變化、對話中的概念建構方式及不同起點學生的受益差異,勾勒 AI 輔助教學成效的多個面向。
Google Research 在 Nature 發表 PHRM 研究系統,透過智能手機前置鏡頭在面部解鎖後擷取 8 秒影片,於日常使用中被動估算心率(HR)及每日靜息心率(RHR)。
推薦理由:研究結合實驗室測試與八日自由生活驗證,按膚色報告 HR 誤差,並呈現 RHR 估算覆蓋率及穿戴裝置對照,讓讀者掌握日常使用中的證據範圍。
愛丁堡大學的 Filippo Menolascina 團隊使用 Co-Scientist 梳理 MASH 文獻,提出後經實驗驗證的肝病機製假説。針對近期獲批、用於 MASH 特定階段的 resmetirom 僅對少部分合資格患者有效的問題,該假説將 NLRP3 炎症小體指為連接疾病中炎症與代謝的分子橋樑。
Stanford University School of Medicine 的 Gary Peltz 團隊測試 Co-Scientist 提出的 3 種肝纖維化候選藥物,當中 2 種阻止纖維化並促進肝細胞再生。
推薦理由:研究在同一活體人類肝細胞平台比較 Co-Scientist 與研究者挑選的藥物,呈現系統從少量相關文獻線索中找到候選藥物的案例。
Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。
推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。
Google Research 提出一套評估大語言模型行為傾向與人類偏好對齊程度的框架,並分析 25 個大語言模型。研究將經驗證的心理問卷改編為情境判斷測試,並以 550 名參與者中每題 10 名標註者的偏好分佈作比較。結果顯示,模型在低人類共識情境仍普遍過度自信,部分模型的自我陳述亦與其在情境中的行為傾向不一致。
Google DeepMind 公開一套經實證驗證的工具包及研究材料,用於評估 AI 有害操縱能力,並衡量操縱成效與模型採用操縱手法的傾向。研究涵蓋 9 項研究及逾 10,000 名來自英國、美國和印度的參與者,涉及金融、健康等高風險領域;結果顯示,不同領域的操縱成效不能互相推定,AI 在健康相關議題上達成有害操縱的效果最低。
推薦理由:研究把有害操縱評估拆分為操縱成效與模型採用操縱手法的傾向,並發現不同領域的結果不能互相推定,為高風險情境評估提供可複用方法。
Google Research 開發 S2Vec,透過自監督學習將建成環境特徵轉為通用嵌入向量。評測中,S2Vec 在美國人口密度及中位收入等未見地區的零樣本地理適應任務中,通常是表現最佳的單一模型,但樹冠覆蓋、海拔等環境任務仍有改進空間。S2Vec 與影像嵌入向量融合,整體通常優於單一模態。
Google Research 與 NHS 合作開展兩項研究,評估 AI 單獨讀片及融入乳癌篩查雙讀仲裁流程的表現。單獨讀片評估的癌症檢出率由每 1,000 名女性 7.54 升至 9.33,AI 亦檢出原雙讀流程漏掉的間隔癌中的 25%。融入雙讀仲裁後,流程在癌症檢出敏感度和特異度上達非劣效,估計可減少 46% 的人工讀片;但仲裁者曾推翻 AI 對 93 宗陽性癌症個案作出的正確召回判斷。
推薦理由:兩項研究分別檢視 AI 單獨讀片及加入人機仲裁後的流程,讓讀者同時衡量讀片人力效益與仲裁風險。
Google DeepMind 發佈衡量 AI 邁向 AGI 進展的認知框架,提出 10 項假設對通用智能重要的認知能力。框架建議以涵蓋各能力的任務、具人口代表性的成人基準,以及 AI 相對人類表現分佈的比較,分三階段評估系統。
Google Research 推出 Groundsource,利用 Gemini 從新聞報道抽取突發洪水事件,建立涵蓋 150 多個國家的 2.6 million 筆開放歷史資料集。
推薦理由:文章列出 Groundsource 的人工核驗數據和 GDACS 事件匹配結果,讓讀者比較新聞抽取資料的時空準確度與既有災害檔案覆蓋情況。
Google Research 的前瞻性研究在真實門診流程中評估 AMIE 用於就診前病史採集的可行性。研究納入 100 名成人,互動由醫師即時監督且沒有觸發安全停止;AMIE 的鑑別診斷在 90% 個案中涵蓋最終診斷,前三項診斷準確率為 75%。研究屬單中心文字聊天研究,沒有對照組;PCP 的管理方案在實用性及成本效益方面較佳。
推薦理由:這項研究將 AMIE 用於門診前病史採集,展示即時醫師監督下的安全與診斷評估,亦交代單中心、無對照設計的限制。
Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。
推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。
Google Research 透過「貝葉斯教學」訓練 LLM 模仿貝葉斯助理的預測,提升推薦表現並泛化至其他任務。此方法採用監督式微調;在航班推薦測試中,未經特定訓練的 LLM 表現遠遜最優貝葉斯助理,且常在一次互動後便不再進步。