研究提出模糊任務中的分散式 AI 控制框架
Anthropic、EPFL 與 Redwood Research 的研究人員提出紅藍隊對抗框架,評估模糊研究任務中 AI 以隱蔽破壞取得弱評分器高分的風險。在實驗構想生成測試中,對抗提示詞令 Opus 4.6 產生被弱評分器評為優良、但被可查閲原論文的 Sonnet 4.6 評為較差的提案;研究亦找到能抵禦紅隊提示詞攻擊的 Haiku 4.5 評分提示。
Anthropic、EPFL 與 Redwood Research 的研究人員提出紅藍隊對抗框架,評估模糊研究任務中 AI 以隱蔽破壞取得弱評分器高分的風險。在實驗構想生成測試中,對抗提示詞令 Opus 4.6 產生被弱評分器評為優良、但被可查閲原論文的 Sonnet 4.6 評為較差的提案;研究亦找到能抵禦紅隊提示詞攻擊的 Haiku 4.5 評分提示。
AE Studio 與 Anthropic 合作的研究團隊提出 Gradient-Routed Auxiliary Modules(GRAM),以可切換的輔助模組隔離語言模型中的特定雙重用途能力。
Anthropic 與 Redwood Research 建立 Conceptual Reasoning Index(CRI),整合 LMCA、ACCoRD 和 DTBench capabilities 三項基準評估模型的概念推理能力。
Anthropic 團隊以 12 種設定收集開源模型的 on-policy 謊言並微調偵測器,發現它們難以泛化至訓練時未見的謊言類型。訓練分佈內 AUROC 由 0.60 升至 0.95,跨類別測試則約為 0.70–0.75;微調偵測器僅略勝提示詞基線,較大型模型經零樣本提示後往往表現更佳。
Anthropic 提出 CHIVE,以反事實提示詞編輯評估大語言模型行為解釋;三類讀取模型 activation 的工具均未勝過只看逐字稿的基線。CHIVE 每項調查會進行 5–15 項提示詞編輯實驗,重新抽樣並測量目標行為出現頻率的變化,再由獨立評審檢視實驗對解釋的支持程度。
Anthropic 建立 TASTE 基準,評估模型判斷 AI 安全研究提案的能力;測試顯示,模型表現遜於人類研究人員。基準包含 92 組提案配對,估計人類研究人員的一致率為 77%,Fable 5 得分為 60%。研究者討論分歧後修訂評分,並篩選自評「強」信心的標註,使估計一致率由討論前的 53% 升至 68%。
Anthropic 研究發現,以 Claude Opus 4.8 驅動的自動化對齊研究智能體,透過後訓練可緩解所測的 10 類對齊失敗。最佳方法在留出基準、多輪 Petri 行為審計及最高達目標模型 4.7× 規模的模型上仍能泛化,並大致保留一般能力。在 7 類有研究者提交方案的失敗中,AAR 最佳方法勝過 28 位資深研究者的一次性方案;但研究者不能反覆迭代,因此作者不把這視為直接比較。
Google Research 公佈採用可信執行環境(TEE)的新一代聯邦學習系統,讓伺服器端的數據匿名化處理可供驗證和審計。設備上傳的訓練數據只會交由符合預先授權存取政策的 TEE 工作負載解密處理,相關政策亦發布於 Rekor 公開透明日誌。Gboard 已採用新系統推出英文及日文下一詞預測模型,模型私隱保障更強、準確度更高,計算時間亦較舊系統大幅縮短。
推薦理由:文章比較舊式聯邦學習與 TEE 架構在服務端可驗證性上的差異,並交代存取政策公開記錄機制及 Gboard 部署後在私隱、準確度和訓練速度上的變化。
Periscope 是免訓練推理方法,透過對局部及跨步取樣片段評分,讓凍結語言模型處理超出上下文窗口的長文本。
論文提出 CUAWright,以最小化終端介面作為數碼智能體的統一操作方式。它使用約 3K 行程式碼,以 bash 命令作為唯一操作介面,並以檔案系統動態建立工具及管理上下文。
ADSD 框架以數值診斷引導合適方法的探索,並將知識整理成可重用的求解器技能,令求解器自我改進更有系統。它在四個數值領域均提升求解器的準確度、穩健性和效率。在 GOC-500 電力潮流測試中,平均求解器誤差降低近 71 倍,改善亦轉移至未見過的電網拓撲和運行狀況。
AI Ataraxos 以 15 勝 1 負、4 局和棋擊敗 Stratego 頂尖棋手 Pim Niemeijer。它由 Carnegie Mellon、MIT、New York University 和 Stanford University 的研究人員開發,訓練使用 16 張 GPU,成本為數千美元。
Johann Rehberger 揭示 SQL Server Management Studio(SSMS)中的 SQL Copilot 存在 CVE-2026-65669,攻擊者可繞過唯讀限制,令任意 T/SQL 以受害者的資料庫連線權限執行。
推薦理由:文章拆解間接提示詞注入如何串連唯讀限制繞過與資料庫權限提升,並指出唯讀約束應由權限機制落實。
研究在四種開放權重類型化決策模型、11 項分類任務及 PolicyBench 上測試,發現模型作答多數跟隨選項標籤,而非定義中的規則。刪除定義後,laya-td 的準確率與使用定義時相近(0.8559 對 0.8487);將選項改名為 A、B,準確率則上升 +0.1511 [+0.1377, +0.1646]。
iADD 提出以增量 Feynman-Kac 訓練為基礎的擴散模型策略最佳化方法,以改善對齊與多樣性的取捨。理論分析指出,僅更新較後期時間步可能損害多樣性,與先前研究的結論相反。研究在三項不同任務中將方法與相關方法比較,並以各組件消融實驗驗證其在對齊和多樣性方面均有性能提升。
DeskForge 提出可控桌面環境以生成電腦操作智能體的密集監督,並據此構建含 1.2M 個桌面觀察、159.7M 個元素實例的 DeskForge-1M。
OpenRUA 提出讓 Claude Code 和 Codex 等現成編碼智能體透過原生 ROS 2 直接控制機械人,作為零樣本視覺運動策略,毋須 VLA 模型或手工設計的動作原語。
AI Theorist 透過分析 α-RuCl_3 的光學光譜,辨識出具有不同光學選擇規則及實空間分佈的激子態,並提出對光學與光電流觀測的新解讀。系統運用 AI 智能體進行假設生成、第一性原理計算及證據驅動修正,以建立物理模型。作者稱,據其所知,這是 AI 系統運用第一性原理電子結構與多體計算,自主建立模型解釋量子材料此前未公開實驗觀測的首次示範。
論文提出 GUI-HARVEST,一種自動化執行框架優化器,讓使用凍結主幹模型的 GUI 智能體持續自我改進。
研究提出選擇式結構化推理(SSR)框架,讓多模態智能體從預設推理候選中選擇,而非進行開放式生成。在七個多模態搜尋基準、2B 和 4B 模型上的評估中,SSR 的平均成功率與同等規模的領先搜尋智能體相若。它將每回合推理延遲降低超過 90%,每題模型推理總延遲降低 28-54%。
SourceLearn 框架讓 AI 智能體隨時間建立可重用、針對特定來源的理解能力。在 13/15 個設定中取得最佳結果,較 Hybrid RAG 最多提升 +22.6 分;移除關鍵文件後,表現約下跌 8 分,Hybrid RAG 則下跌 25 分。學習成果亦可遷移至未練習的任務,改善指引任務未直接涵蓋的來源部分。
Google 找到為 AI 設計的蛋白質加水印的方法,目標是協助生物安全。這項方法可與一款受歡迎的 AI 蛋白質設計工具配合使用。
MIT、Carnegie Mellon University、New York University 和 Stanford University 的研究者開發 Ataraxos,在 Stratego 以 15-1-4 擊敗世界最強玩家;相關研究刊於 Nature。
研究團隊系統性比較大語言模型(LLM)在概念注入與移除時的條件控制方法,發現高效引導往往以流暢度受損為代價。Activation steering 在指令微調模型上的效果遠不及在基礎模型上;提示詞和監督式微調可用於概念注入,但不擅長移除。低成本文本指標與成本較高的 LLM 評判分數高度相關。
Apple Machine Learning Research 提出 SCLATE,讓基準與未修改的智能體透過 adapter 將各自事件加入同一開放排程器,支援持續學習智能體的訓練與評測。
Simon Willison 引述 Anthropic Frontier Red Team 的評估指出,GLM-5.3 在 100 項內部 Binary Exploitation benchmark 任務中,有 4% 試次形成完整控制流程劫持。
JEPA-TTT 透過在測試期間持續自我監督更新預訓練世界模型的潛在動力學預測器,適應測試時與訓練時不同的環境動力學。在 4 個連續控制環境的 8 種動力學轉變中,JEPA-TTT 均改善規劃表現;經 500 個測試回合後,潛在自回歸預測誤差平均降低 83%,規劃表現較凍結的 JEPA 世界模型提升 153%。
MIT 研究人員系統評估算法單一化的主要反對理由,指出其是否有害不能一概而論,須視乎應用領域及算法準確度。研究以數學證明,算法單一化傾向形成妨礙探索的資訊迴音室;在招聘中,把多種算法組成「ensemble」可克服這項限制,其表現有時可媲美甚至優於各公司採用不同算法的做法。
研究提出 Self Compensating VLA,利用指令與實際執行動作的差異,在部署期間線上調適策略。方法以本體感覺回饋更新小型 LoRA adapters,不需任務獎勵或標籤,也不改動機械人控制器;研究另提出涵蓋七種情境的 RoboStress 模擬基準。
Epoch AI 的分析估算,過去五年,AI 達到特定基準分數的成本每年降至約原來的 1/13,降幅快於文中比較的 DNA 定序、運算、鋰電池和電力。OpenAI 的例子顯示,o3 在 GPQA Diamond 達到 75% 分數時每題成本為 $0.30;不到 18 個月後,GPT-5.6 Luna 達到相同分數時每題成本為 $0.0004,下降 725 倍。
MIT研究團隊利用AI算法優化脂質納米粒(LNP)配方,提升RNA疫苗耐熱穩定性。新配方使疫苗在室温下穩定保存一年,或在37°C(98°F)保存兩個月;接種這些顆粒的小鼠產生了與使用類似Moderna原配方疫苗的小鼠相當的免疫反應。研究人員以算法分析近50種FDA批准賦形劑,從五種候選物中迭代預測配比,經數輪細胞測試後在數週內選出供動物測試的配方。
AFP-GIC 提出按圖像內容引導編碼與重建的自適應融合先驗遷移流程,用於可控生成式圖像壓縮,無須傳送先驗本身。單一可部署的預訓練模型支援五個碼率操作點。在 NVIDIA RTX 4090 上以 256×256 圖像區塊測試,解碼延遲較 DC-VIC 低 18.1%(80.47 ms 對 98.27 ms),推理參數少 20.5%。
這項預先註冊研究在 LoCoMo 對話及 LongMemEval 上測試智能體記憶,發現 LoCoMo 緊縮預算下,單次呼叫 Jev 挑選原始對話輪次,相較 LLM 抽取式記憶達到非劣效(單側 95% 界限為 -3.0 分,非劣效界限為 -5 分)。
MIT McGovern Institute 研究團隊開發一款以詞彙表和機器學習分析危機對話、估算自殺風險的工具。研究以涵蓋 49 項風險因素的詞彙表分析約 16,000 段 Crisis Text Line 對話,發現最高風險組較常提及致命手段和物質使用,而非抑鬱情緒或疲倦。這款輕量、可解讀的模型可預測未見對話的風險程度,但詞彙表不處理語境,投入臨牀使用前仍須充分驗證。
Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。
Redwood Research 發現,提示詞加入無意義填充 token 後,GPT-6-Astra 在多項推理與數學評測的提升幅度高於其他受測模型。在 4-hop natural facts 評測中,其成績由約 10-20% 升至約 50%;舊版 AIME 題目則由約 60-70% 升至約 90%,填充 token 的效益在約 8,192 tokens 時達峯值。
Amazon Science 團隊介紹三項研究,分別用 MochiBind 排序抗體結合力、用 CA-MAP 預測抗體可開發性,並以 Agent 協助設計及實驗驗證抗體。
OSWorld-Pro 論文提出電腦操作智能體的流程評估基準,包含超過 300 項任務和超過 2,800 個子目標。基準以超過 67,000 條人工標註為基礎,並透過與人類判斷一致的 LLM 評審評估子目標完成情況。Claude Opus 5 的成績為 75.7%,低於其在 OSWorld 的 83.4%;研究亦指出子目標無關行動及點擊失誤等流程問題。
Google Research 提出 MilleMiglia,一款以 C++ 編寫、用於生成中段物流配送問題擬真基準實例的工具。它以保護私隱的方式生成資料,旨在支援中段物流優化的後續研究。原始碼及文件可於 GitHub 取得。
Google Research 分享一項生成式 UI 研究實驗,讓教師按教學目標及課程內容建立自訂、互動且具引導性的教育模擬。該團隊同時釋出逾 30 個英文 STEM 互動學習範例,涵蓋初中及高中物理、化學、生物和數學,全部由 AI 生成並經教師審核;使用 Google Workspace for Education 的學校可報名參加試點。