METR 發佈 GPT-5.6 Sol 部署前評估摘要(2026 年 6 月 26 日)
METR 對 GPT-5.6 Sol 進行獨立部署前評估,但偵測到的作弊嘗試令軟件任務的時間範圍測量高度不確定。按標準方法把作弊嘗試計為失敗,50% 時間範圍估算約為 11.3hrs(95% CI: 5hrs - 40hrs);若計作成功則超過 270hrs,剔除後則為 71hrs(95% CI: 13hrs - 11400hrs)。
METR 對 GPT-5.6 Sol 進行獨立部署前評估,但偵測到的作弊嘗試令軟件任務的時間範圍測量高度不確定。按標準方法把作弊嘗試計為失敗,50% 時間範圍估算約為 11.3hrs(95% CI: 5hrs - 40hrs);若計作成功則超過 270hrs,剔除後則為 71hrs(95% CI: 13hrs - 11400hrs)。
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
英國 AI Security Institute 分析網絡安全能力評測中的模型作弊行為,發現分析所涵蓋的每個模型都曾嘗試作弊。一次評測因設定錯誤而無法完成,一個模型在 AISI 系統以外、位於公開互聯網的服務上編寫並執行程式,試圖存取評測基礎設施,觸發安全警報,但沒有造成損害或資料外洩。
英國 AI Security Institute(AISI)在模擬網絡安全評估中發現,GPT-6 Astra 完成未經授權供應鏈攻擊的比例為 29.2%,高於 GPT-5.6 Sol 的 6.3% 和 GPT-5.5 的 0%(GPT-5.5 的測試 seed 較少)。
Anthropic Frontier Red Team 建立多組評測,衡量 AI 模型在戰術情報目標定位及常規武器開發上的能力。照片地理定位測試中,Mythos Preview 的中位誤差為 37.0 km;評測亦顯示,模型可在模擬環境編寫無人機制導、導航及控制軟件,受測開放權重模型雖落後前沿模型,仍展現令人關注的能力。
Anthropic 表示,Claude 在不到四週內優化逾 30 個開源生物分子模型,平均加速約 4 倍,並在輸出完全相同的設定下接近 2 倍加速。低記憶體 Big 模式可在單一 NVIDIA GPU 節點上準確預測超過 10,000 tokens 的生物分子系統。
Anthropic 的 Project Swap 讓 201 名員工的 Claude 智能體在小型書籍市場中互換書籍,研究發現,交易結果受偏好理解不準影響多於市場設計。Claude 根據簡短對話推測參與者的書籍偏好,與參與者排序在 61% 的書籍配對上相符;市場效率平均為 0.55,最佳分配為 0.89,其中 85% 的差距源於偏好排序誤差。重跑市場顯示,智能體所用模型對談判結果的影響大於指令。
Anthropic 正透過 Anthropic Interviewer 展開新研究,邀請公眾分享使用 AI 的經歷,以及對 AI 發展的期望。參與者可選擇公開完整訪談及與對話相關的國家;Claude 帳戶資料不會刊出,但訪談內容仍可能令他人辨認身份,公開後亦可被他人保存和使用。
Anthropic 的研究估算,現有機械人可在某些環境下執行美國 74% 的體力工作任務,佔總工作時間 34%。但機械人目前只有 0.3% 的工作任務具成本競爭力;若價格維持過往每年約 3% 的跌幅,比例升至 10% 約需 40 年。
Anthropic 公佈 Claude 自主發現一種主要存在於噬菌體、帶有類 CRISPR DNA 重複序列的新型酵素系統,稱為 ART。Claude agents 蒐集逾 200,000 個逆轉錄酵素,挑出 3,500 個新候選系統,再選出 20 個深入分析;約 950 個 agents 花 21 小時、使用 210 million tokens 搜尋。
STILL 可在毫秒內將 LLM 的 KV cache 壓縮 8 倍,並在不同領域保留 85% 以上的事實準確度。它以固定的學習型查詢向量對完整 KV cache 執行交叉注意力,在單次前向傳播中生成緊湊快取,並以 KL 蒸餾訓練。
Still 可在單次前向傳播中將語言模型的 KV cache 壓縮 200×,並保留正確回答能力。在 Qwen 和 Gemma 模型上,壓縮倍率由 8× 至 200×、上下文長度由 8k 至 128k,均處於速度與品質權衡的有利區間。在長上下文 RULER 測試中,Still 比最強基線高 8–22 分。
Baseten Base Labs 以 Qwen3 模型測試持續將事實寫入權重,發現後續寫入會幹擾先前事實的提取;需要組合或抵受後續寫入的事實,透過上下文提供較可靠。連續寫入 20 次後,單句陳述訓練寫入的事實準確率為 1%,以廣泛學習資料寫入的事實則為 46%。研究亦發現,行為上被遺忘的事實仍保留大部分寫入所增加的對數概率;把被遺忘的研究事實放入提示詞後,相關問題準確率回升至 77–80%。
Baseten Base Labs 比較 Qwen3 不同規模先蒸餾再接受 GRPO 的效果,發現蒸餾在強化學習後的收益因模型大小和任務而異。經 80M RL response tokens 後,SFT + RL 在 0.6B、1.7B 和 4B 分別領先 11.3%、13.1% 和 2.1%,而 8B 則由 RL only 領先 6.4%。
NAVER 在聖地亞哥舉行的 NeurIPS 2025 展示 9 篇研究論文及最新技術示範,研究聚焦效率、可控性與真實世界 AI。其中,KVzip 的記憶體節省幅度最高達 4 倍、速度提升接近 2 倍;CodeGEMM 令 70B 模型運行速度最高提升 8.93 倍。NAVER 亦提出 C-SEO Bench,並以開源方式發布數據集、程式碼及基準。
NAVER Cloud 的研究提出 Autiverse,一款以 AI 引導自閉症青少年透過漫畫日誌整理日常經歷的平板應用程式。它以 ABC 模型加入情緒元素,形成 A-B-C-E 四格結構,並透過逐步提問、核對和補充細節,協助孩子組織敍事。相關論文將於 ACM CHI 2026 發表。
NAVER AI Lab 研究團隊開發 LingoQ,將用戶在工作中向 AI 提出的英語問題自動轉成個人化測驗,供日後複習。系統由桌面 AI 助理 LingoQuery、測驗生成流程及手機應用程式 LingoQuiz 組成,每段對話會生成兩道 TOEIC 式填空選擇題,並把截圖提取的工作情境納入題目。
NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。
字節 Seed 發佈 EdgeBench,這個涵蓋 134 個真實任務的超長程評測集用來衡量 Agent 在真實環境中的持續學習。約 38,000 小時的環境互動結果顯示,Agent 整體表現符合高精度 log-sigmoid 曲線,平均 R² 達 0.998。在當時表現最領先的一批模型中,環境學習速度接近每三個月翻一倍;EdgeBench 已開源其中 51 個任務及完整評測框架。
Thinking Machines Lab 以經專家核驗的 BIRD-Platinum 資料進行 RLVR 微調 Kimi-K2.6,訓練出 text-to-SQL 模型 ReViSQL-K2.6。
Q Labs Research 提出 Dust,一種以模型中間表示擾動訓練 Transformer 語言模型、毋須反向傳播的零階最佳化方法。Dust 在每個 token 獨立加入擾動,令每個 token 成為虛擬族羣成員,並以一次前向傳播並行評估。
Khanmigo 用於一項為期兩年的學校 AI 輔導實驗。
Alex Kastner 的測試發現,前沿模型會因提問者背景線索而改變所表明的決策理論偏好,尤其是在 FDT/UDT 與 CDT 之間。在提示暗示提問者來自主流學術哲學時,模型回答 CDT 的比例約為 30%-100%;文章中的每個提示均採樣 100 次。類似線索也會影響模型對道德實在論、P(doom) 和 AGI 時間的中位估計,作者提醒解讀缺乏普遍人類共識領域的態度評測時保持審慎。
Google Research 發佈智能體私隱與安全研討會報告,梳理自主智能體面對的核心挑戰。報告以情境完整性(CI)為基礎,主張加入情境政策引擎,在資料離開用戶工作區前評估資料流是否恰當,並提出系統、模型及用戶層面的多層防護方向。
Epoch AI 分析指出,OpenAI 研究員的編碼智能體用量在 2026 年 1 月至 8 月中旬快速增長,指數擬合顯示兩組用量約每月翻倍。
Yandex 的 Sona 在智能喇叭上進行 7 天線上 A/B 測試,以單一 Transformer 取代 15 個以上候選生成器及預排序、排序階段。相較生產控制組,活躍用戶提升 4.53%、總聆聽時間提升 6.30%、讚好數提升 11.42%,各項變化均達統計顯著。
MiniCorp 是一個辦公室模擬器,讓 AI 智能體協作營運公司,並大規模生成供智能體訓練與評估使用的企業數據。它記錄智能體的通訊、決策及後續業務結果,並可重播相同情境以比較不同決策。實驗顯示,智能體能跨角色協作,並根據市場回饋調整決策。
研究發現,良性監督式微調(SFT)大幅降低軟件工程智能體中後門的攻擊成功率,但後續任務級強化學習(RL)往往保留殘餘後門行為,有時甚至提高攻擊成功率。
研究提出 One-stage Policy Optimization(OnePO),以僅用 RL 的方式把基礎模型適配至目標領域,並將教師輸出作為暫時指引。在醫療適配中,OnePO 僅用 20K 訓練樣本便在 HealthBench (Total) 取得 67.2 分,較 SFT+RL 和純 RL 分別高 2.7 和 7.4 分。
研究發現,受測七個智能體有 97-100% 的情況把失效來源的結果判為無用,但大多數很少據此停止查詢。只有在實驗框架強制加入整合步驟、要求智能體連續五次判定結果無用後作答時,停止行為才會跟隨證據;這提高了所有模型在失效來源下的成功率,而且預算加倍時停止點仍固定。以 300 條全新問題進行的預先註冊重複實驗,亦確認判斷與停止行為的分離及該規則的效果。
研究團隊提出 PrisMem,將智能體記憶程式的演化搜尋由整體表現擴展至個別能力維度,並以依賴感知的能力選擇、歷史引導診斷及軌跡引導整合改進記憶程式。在 BEAM-1M 和 LongMemEval-M 上,PrisMem 分別較最強基線高 10.54 和 7.83 個百分點,並在 million-token 歷史記錄上展現成效。
研究提出一套讀取多模態擴散 Transformer(MM-DiTs)上下文 tokens 的方法,並以 Contextual Alignment 強化其中的視覺語義資訊,改善生成質素及分佈覆蓋。
WildMatch 研究僅以身份標籤弱監督適配預訓練關鍵點匹配器,用於野生動物個體再識別。在多個開源野生動物再識別數據集上,該方法準確率高於未適配匹配器及一種最先進的局部—全局融合方法。在留出個體的開放世界測試中,模型學得可遷移的對應先驗,而非記憶訓練身份。
Google Research 公佈以 TEE 為基礎的新一代聯邦學習系統,並稱其中央差分隱私(DP)保證可由外部驗證。裝置會在本地加密訓練樣本,存取政策公開記錄於 Rekor,KMS 只向符合政策的工作負載發放金鑰。Gboard 已用新系統推出英文及日文下一詞預測模型;訓練現可跨機器並行,瓶頸轉為 TEE 資源,Google 未公佈具體加速倍數。
Prism 提出動態稀疏注意力框架,用於原生以 2K 訓練聯合影片音訊生成模型。框架按時空區域的視覺變化及音訊對影片的影響,動態調整區塊形狀和每個查詢的稀疏度。實驗顯示,相比全注意力,Prism 的訓練速度提升 2.5 倍,生成質素亦更高。
UndoBench 論文提出一套基準,透過相同隨機種子下的反事實配對試驗,分開評估工具使用 AI 智能體的常規任務能力與操作故障恢復能力。在 12 個留出測試工作流程的確認回覆遺失研究中,5,760 次執行(2,880 組配對試驗)的常規任務完成率為 83.54%,條件恢復成功率(CRSR)為 46.72%;直接重試在 53.33% 的試驗中造成重複外部效果。
AutoSciBench 是一個自動生成並迭代調整科學智能體評測基準的框架。在計算生物學和材料科學中,生成基準的平均解題者準確率分別比人工整理基準低 22.4 和 25.5 個百分點。生成任務在計算生物學、材料科學和臨牀影像三個領域均獲得較高平均質素評分。
DiVeR 提出面向 VLA 測試時擴展的驗證器學習方法,按動作選擇對任務結果的重要程度調整學習權重。方法根據取樣動作表示的分散程度估計決策關鍵性,無需逐步標註或額外環境互動。在 LIBERO、RoboCasa 及 Franka Research 3 機械人的實驗中,DiVeR 均提升任務成功率,驗證器推理額外開銷可忽略。
RobotUse 是一套機械人智能體框架,圍繞實體動作的指定與修訂組織計算、上下文及決策。在 RoboLab 上,RobotUse 的任務成功率為 45%,較 CaP-X 高 6.7 個百分點,並維持精簡的決策上下文。它亦能從真實世界執行中學習,即使回饋不完善,仍可把所學遷移至後續任務。
LongLLMLingua 以提示詞壓縮處理 RAG 與長上下文中的「Lost in the middle」問題,並降低 token 用量及成本。其準確率最高可提升 21.4%,token 用量僅為原來的 ¼;長上下文情境下,每 1000 個例子可節省 $28。