ARC Prize 發佈 ARC-AGI-3 互動式基準測試,評估智能體探索能力
ARC Prize 發佈 ARC-AGI-3,這是 ARC-AGI 系列首個完全互動式基準,包含數百個互動環境和數千個遊戲式關卡。環境沒有指示、規則或明示目標,AI 智能體須自行探索並將所學帶到難度逐步提高的關卡。ARC Prize 2026 現已開放參賽,獎金超過 $2 million;人類得分為 100%,前沿 AI 得分為 0.51%。
ARC Prize 發佈 ARC-AGI-3,這是 ARC-AGI 系列首個完全互動式基準,包含數百個互動環境和數千個遊戲式關卡。環境沒有指示、規則或明示目標,AI 智能體須自行探索並將所學帶到難度逐步提高的關卡。ARC Prize 2026 現已開放參賽,獎金超過 $2 million;人類得分為 100%,前沿 AI 得分為 0.51%。
Google Research 開發 S2Vec,透過自監督學習將建成環境特徵轉為通用嵌入向量。評測中,S2Vec 在美國人口密度及中位收入等未見地區的零樣本地理適應任務中,通常是表現最佳的單一模型,但樹冠覆蓋、海拔等環境任務仍有改進空間。S2Vec 與影像嵌入向量融合,整體通常優於單一模態。
Google Research 與 NHS 合作開展兩項研究,評估 AI 單獨讀片及融入乳癌篩查雙讀仲裁流程的表現。單獨讀片評估的癌症檢出率由每 1,000 名女性 7.54 升至 9.33,AI 亦檢出原雙讀流程漏掉的間隔癌中的 25%。融入雙讀仲裁後,流程在癌症檢出敏感度和特異度上達非劣效,估計可減少 46% 的人工讀片;但仲裁者曾推翻 AI 對 93 宗陽性癌症個案作出的正確召回判斷。
推薦理由:兩項研究分別檢視 AI 單獨讀片及加入人機仲裁後的流程,讓讀者同時衡量讀片人力效益與仲裁風險。
Google DeepMind 發佈衡量 AI 邁向 AGI 進展的認知框架,提出 10 項假設對通用智能重要的認知能力。框架建議以涵蓋各能力的任務、具人口代表性的成人基準,以及 AI 相對人類表現分佈的比較,分三階段評估系統。
美國人每天向 ChatGPT 發送近 300 萬則詢問薪酬與收入的訊息,這些查詢有助縮小薪資資訊差距。
Google Research 推出 Groundsource,利用 Gemini 從新聞報道抽取突發洪水事件,建立涵蓋 150 多個國家的 2.6 million 筆開放歷史資料集。
推薦理由:文章列出 Groundsource 的人工核驗數據和 GDACS 事件匹配結果,讓讀者比較新聞抽取資料的時空準確度與既有災害檔案覆蓋情況。
Google Research 的前瞻性研究在真實門診流程中評估 AMIE 用於就診前病史採集的可行性。研究納入 100 名成人,互動由醫師即時監督且沒有觸發安全停止;AMIE 的鑑別診斷在 90% 個案中涵蓋最終診斷,前三項診斷準確率為 75%。研究屬單中心文字聊天研究,沒有對照組;PCP 的管理方案在實用性及成本效益方面較佳。
推薦理由:這項研究將 AMIE 用於門診前病史採集,展示即時醫師監督下的安全與診斷評估,亦交代單中心、無對照設計的限制。
IH-Challenge 訓練模型優先遵循可信指令,改善前沿大語言模型的指令層級。此訓練亦提升模型的安全可引導性,以及抵禦提示詞注入攻擊的能力。
Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。
推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。
OpenAI 介紹 CoT-Control,並發現推理模型難以控制自身思維鏈,進一步凸顯可監控性作為 AI 安全保障的作用。
Google Research 透過「貝葉斯教學」訓練 LLM 模仿貝葉斯助理的預測,提升推薦表現並泛化至其他任務。此方法採用監督式微調;在航班推薦測試中,未經特定訓練的 LLM 表現遠遜最優貝葉斯助理,且常在一次互動後便不再進步。
新預印本將 single-minus 振幅延伸至引力子,GPT-5.2 Pro 協助推導及驗證量子引力中的非零引力子樹振幅。
OpenAI 最新威脅報告探討惡意行為者如何將 AI 模型與網站及社交平台結合使用。報告亦分析這類活動對偵測與防禦工作的意義。
新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。
OpenAI 不再評測 SWE-bench Verified,因其日益受到污染,且無法準確衡量前沿編碼進展。分析指出,該基準的測試存在缺陷,並有訓練洩漏;OpenAI 建議採用 SWE-bench Pro。
OpenAI 分享其 AI 模型在 First Proof 數學挑戰中的證明嘗試。這些嘗試用於測試模型處理專家級問題的研究級推理能力。
OpenAI 與 Paradigm 推出 EVMbench,評測 AI 智能體偵測、修補及利用高危智能合約漏洞的能力。
Google Research 提出 MapTrace,以合成數據訓練多模態大語言模型(MLLM)在地圖上追蹤有效路徑,應對模型難以理解空間幾何與拓撲關係的問題。
Visual Self-Refine(VSR)提出像素引導的圖表解析方法,將解析轉為以渲染像素驗證並修正結果的回饋迴圈。流程先預測錨點並渲染圖表,再檢視渲染結果,依據已驗證的像素修正最終解析;專案亦提供資料處理流程和 benchmark 評估腳本。
Google Research 提出開源原型框架 DialogLab,用於編寫、模擬及測試動態人類與 AI 羣體對話。框架採用「編寫、測試、驗證」流程,並以視覺化介面及驗證儀錶板協助設計與分析對話。14 名參與者的評估顯示,人類控制模式顯著更具投入感,並普遍被認為更有效、寫實。
Google 提出 Natively Adaptive Interfaces(NAI)框架,以多模態 AI 工具建立更個人化、具適應性的無障礙應用介面。NAI 主張按情境資訊作出設計決策,並以動態、由智能體驅動的模組取代靜態導覽。Gemini 原型可將即時影片轉為互動音訊描述,讓使用者即時查詢畫面細節。
Google Research提出 Sequential Attention,將子集選擇整合至單次模型訓練,以較低開銷提升模型效率並維持準確度。該方法以注意力分數逐步挑選特徵,在多項神經網絡基準測試中取得最先進結果。
Google Research 團隊對 180 種智能體配置進行受控評估,提出智能體系統的量化規模化原則。在可並行的金融推理任務中,集中式協作較單智能體提升 80.9%;在 PlanCraft 的序列規劃任務中,多智能體方案則令表現下降 39–70%。研究的預測模型根據工具數量及任務可拆解程度,對 87% 未見任務配置正確識別最佳協作策略。
Google Research 提出 ATLAS 多語言 scaling laws,相關研究將於 ICLR 2026 發表,基於 774 次訓練實驗,涵蓋 10M–8B 參數模型。
Google Research 在 NeurIPS 2025 介紹 GIST,這種資料子集選取演算法兼顧多樣性與效用。GIST 保證所選子集的價值至少達絕對最優解價值的一半,並在圖像分類等基準任務中超越最先進方法。
Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。
AssetOpsBench 是面向工業資產運維的 AI 智能體基準與評估系統,從六項質性維度評估智能體表現。它涵蓋 2.3M 個感測遙測點、4.2K 張工單及 53 種結構化失效模式,並以 881 條執行軌跡分析失敗。社羣測試中,沒有受測模型達到部署準備門檻 85 分;多智能體任務準確率為 47%,低於單智能體的 68%。
Google Research 在 Science Advances 發表 NeuralGCM 降水研究,報告模型在 280 km 解析度下改善最長 15 天的降水預報及多年氣候模擬。
推薦理由:研究展示以 NASA 衞星降水觀測直接訓練 NeuralGCM 機器學習部分的做法,並呈現極端降水與日變化模擬的改善。
Berkeley AI Research 提出一套以互信息直接評估及優化成像系統的框架,並在 NeurIPS 2025 論文中驗證其對四類成像應用的預測能力。方法利用含噪測量與已知噪聲模型估算互信息,測試涵蓋彩色攝影、射電天文、無透鏡成像和顯微鏡。IDEAL 僅優化成像系統的編碼器,不需反向傳播整個解碼器;在色彩濾光片設計中,結果匹配端到端優化,並減少記憶體及計算需求。
Google Research 回顧 2025 年研究成果,涵蓋生成模型、生成式 UI、量子計算、AI 科學工具及氣候、醫療與教育應用。Gemini 3 引入生成式 UI,可按提示詞生成互動介面;Gemma 擴展至 140 多種語言。效能研究顯示,使用 Learn Your Way 的學生在保留測試中的得分高 11 個百分點。
OpenAI 推出一套評估鏈式推理可監測性的框架與評測套件,涵蓋 24 個環境中的 13 項評測。研究結果顯示,監測模型內部推理比只監測輸出有效得多,並為 AI 系統日益強大時的可擴展控制提供一條有前景的路徑。
OpenAI 以數據呈現企業 AI 採用現況,展示組織如何從實驗走向實際生產力提升與新能力拓展。
OpenAI 推出 FrontierScience 基準測試,評估 AI 在物理、化學和生物學領域的推理能力,以衡量 AI 邁向真實科學研究的進展。
OpenAI 推出真實場景評估框架,衡量 AI 在濕實驗室加速生物研究的能力。研究使用 GPT-5 優化分子克隆方案,並探討 AI 輔助實驗的潛力與風險。
Google Research 提出 Urania,以差分隱私分析 AI 聊天機械人對話,提供端到端形式化隱私保證,避免單一對話過度影響摘要。框架透過差分隱私聚類及關鍵詞提取,再讓 LLM 僅根據經私隱保護的關鍵詞生成摘要,不接觸原始對話。與非差分隱私基線比較時,LLM 評估者在一項評測中最多有 70% 的情況偏好 Urania 的摘要。
Google DeepMind 與 Kaggle 推出 FACTS Benchmark Suite,透過四項基準評估大語言模型的事實準確性。套件包含更新版 Grounding Benchmark - v2,以及 Parametric、Search、Multimodal 三項基準,並公開提供 3,513 個例子;Kaggle 管理私有保留集並維護公開排行榜。
ARC Prize 公佈 2025 年競賽得主並分析 ARC-AGI 進展,最高獎項 Grand Prize 仍未有人取得。
Google Research 在兩篇新論文中提出 Titans 架構與 MIRAS 理論框架,旨在結合 RNN 的速度與 Transformer 的準確度,支援長期記憶。
Google Research 推出 Massive Sound Embedding Benchmark(MSEB),以統一框架評估八項機器聽覺能力。基準涵蓋語義與聲學任務,並可評估不同類型的模型;初步實驗顯示,現有聲音表徵在八項任務上仍有明顯提升空間。
OpenAI 研究人員正測試「confessions」方法,訓練模型在犯錯或作出不當行為時承認問題。此方法旨在提升 AI 誠實度與透明度,並增進對模型輸出的信任。