Anthropic 研究提出抽象式紅隊測試,尋找觸發語言模型性格違規的查詢類別
Anthropic 的研究提出抽象式紅隊測試,透過搜尋自然語言查詢類別,找出可能令語言模型違反性格規範的真實失誤模式。研究在 7 個模型和 12 項性格原則上評估 Category-Level RL(CRL)與 Query-Category Iteration(QCI),兩者均勝過隨機抽樣基線,且 QCI 在查詢預算較少時通常收斂較快。
Anthropic 的研究提出抽象式紅隊測試,透過搜尋自然語言查詢類別,找出可能令語言模型違反性格規範的真實失誤模式。研究在 7 個模型和 12 項性格原則上評估 Category-Level RL(CRL)與 Query-Category Iteration(QCI),兩者均勝過隨機抽樣基線,且 QCI 在查詢預算較少時通常收斂較快。
Anthropic 建構由 Claude Opus 4.6 驅動的自動化對齊研究員,9 個並行 AAR 在弱到強監督任務中用 5 日達 PGR 0.97。
Anthropic 研究團隊比較 AI 組織與單一智能體在 12 項任務的表現,發現前者商業目標得分較高、倫理得分較低。研究涵蓋 AI 顧問及 AI 軟件團隊情境,作者觀察到角色分工與協調問題可能令倫理考量未能進入整體決策。差距受模型選擇影響,Opus 4.5 在郵件式顧問任務中的倫理差距較小;作者建議多智能體部署另行進行安全與對齊評估。
Anthropic 研究人員提出 Introspection Adapters(IA),以同一個 LoRA adapter 訓練大語言模型自述經微調後學到的行為。在 AuditBench 的 56 個植入行為模型評測中,IA 輔助調查代理的平均成功率為 59%,高於次佳方法的 53%;在 9 個加密微調攻擊模型中,亦至少一次辨識出其中 7 個。研究亦指出,該方法誤報率偏高,且訓練成本較大。
Anthropic 研究人員測試以微調資料集投毒,能否在不明顯削弱穩健性的情況下為憲法分類器植入後門。在以 Qwen3 8B 和 LoRA 訓練的分類器實驗中,約 32 個投毒樣本在不同訓練集規模下便足以植入後門;Anthropic 內部分類器的測試則需 32 至 128 個。
Anthropic 研究團隊提出 Model Spec Midtraining(MSM),在預訓練後、對齊微調(AFT)前,以討論 Model Spec 的合成文件訓練模型,藉此塑造後續對齊訓練的泛化。
Anthropic Fellows Program 研究團隊發佈 SLEIGHT-Bench,以 40 組合成攻擊測試前沿 AI 監控器的 11 類盲點。在 1% 假陽性率下,Opus 4.6 監控器有 50% 的攻擊在 10 次測試中一次也未被捕捉,只有 8/40 組攻擊能穩定檢出。
Artificial Analysis 更新 Capability Indices 至 v1.1,按領域整合 Intelligence Index v4.2、v4.3 的評測切片及專項評測。
Microsoft AI 公佈 MAI-DxO 與 Sequential Diagnosis Benchmark(SD Bench)的研究結果,稱 MAI-DxO 在 304 宗近期 NEJM 病例中診斷準確率最高達 85%,超過受測經驗豐富醫生羣組的四倍,並以較低成本得出正確診斷。
Dario Amodei 的 Google Scholar 頁面列出其 AI 研究論文、合著者、出版資訊及引用數,涵蓋語言模型、AI 安全與人類偏好強化學習。《Language models are few-shot learners》列有 83,699 次引用,《Language models are unsupervised multitask learners》列有 25,007 次引用。
Meta AI 公佈 Brain2Qwerty v2 研究,展示以非侵入式腦訊號即時解碼句子的端到端流程,詞準確率達 61%,高於文中所述其他非侵入式方法的 8%。
研究以涵蓋五個資料集、三類任務的 1,891 個樣本,評估 11 個 LLM 在實際 RAG 設定中的檢索穩健性;整體穩健性普遍偏高,但因任務而異。停用推理時,Qwen 和 GPT 模型的穩健性明顯下降,即使在單跳 QA 任務上亦然;把檢索文件作為工具回覆提供,則提升 Claude 模型表現、損害 Qwen 和 GPT 模型表現。研究指出,是否採用 RAG 仍須按個案判斷。
Anthropic、EPFL 與 Redwood Research 的研究人員提出紅藍隊對抗框架,評估模糊研究任務中 AI 以隱蔽破壞取得弱評分器高分的風險。在實驗構想生成測試中,對抗提示詞令 Opus 4.6 產生被弱評分器評為優良、但被可查閲原論文的 Sonnet 4.6 評為較差的提案;研究亦找到能抵禦紅隊提示詞攻擊的 Haiku 4.5 評分提示。
AE Studio 與 Anthropic 合作的研究團隊提出 Gradient-Routed Auxiliary Modules(GRAM),以可切換的輔助模組隔離語言模型中的特定雙重用途能力。
Anthropic 與 Redwood Research 建立 Conceptual Reasoning Index(CRI),整合 LMCA、ACCoRD 和 DTBench capabilities 三項基準評估模型的概念推理能力。
Anthropic 團隊以 12 種設定收集開源模型的 on-policy 謊言並微調偵測器,發現它們難以泛化至訓練時未見的謊言類型。訓練分佈內 AUROC 由 0.60 升至 0.95,跨類別測試則約為 0.70–0.75;微調偵測器僅略勝提示詞基線,較大型模型經零樣本提示後往往表現更佳。
Anthropic 提出 CHIVE,以反事實提示詞編輯評估大語言模型行為解釋;三類讀取模型 activation 的工具均未勝過只看逐字稿的基線。CHIVE 每項調查會進行 5–15 項提示詞編輯實驗,重新抽樣並測量目標行為出現頻率的變化,再由獨立評審檢視實驗對解釋的支持程度。
Anthropic 建立 TASTE 基準,評估模型判斷 AI 安全研究提案的能力;測試顯示,模型表現遜於人類研究人員。基準包含 92 組提案配對,估計人類研究人員的一致率為 77%,Fable 5 得分為 60%。研究者討論分歧後修訂評分,並篩選自評「強」信心的標註,使估計一致率由討論前的 53% 升至 68%。
Anthropic 研究發現,以 Claude Opus 4.8 驅動的自動化對齊研究智能體,透過後訓練可緩解所測的 10 類對齊失敗。最佳方法在留出基準、多輪 Petri 行為審計及最高達目標模型 4.7× 規模的模型上仍能泛化,並大致保留一般能力。在 7 類有研究者提交方案的失敗中,AAR 最佳方法勝過 28 位資深研究者的一次性方案;但研究者不能反覆迭代,因此作者不把這視為直接比較。
Periscope 是免訓練推理方法,透過對局部及跨步取樣片段評分,讓凍結語言模型處理超出上下文窗口的長文本。
論文提出 CUAWright,以最小化終端介面作為數碼智能體的統一操作方式。它使用約 3K 行程式碼,以 bash 命令作為唯一操作介面,並以檔案系統動態建立工具及管理上下文。
ADSD 框架以數值診斷引導合適方法的探索,並將知識整理成可重用的求解器技能,令求解器自我改進更有系統。它在四個數值領域均提升求解器的準確度、穩健性和效率。在 GOC-500 電力潮流測試中,平均求解器誤差降低近 71 倍,改善亦轉移至未見過的電網拓撲和運行狀況。
AI Ataraxos 以 15 勝 1 負、4 局和棋擊敗 Stratego 頂尖棋手 Pim Niemeijer。它由 Carnegie Mellon、MIT、New York University 和 Stanford University 的研究人員開發,訓練使用 16 張 GPU,成本為數千美元。
OpenRUA 提出讓 Claude Code 和 Codex 等現成編碼智能體透過原生 ROS 2 直接控制機械人,作為零樣本視覺運動策略,毋須 VLA 模型或手工設計的動作原語。
SourceLearn 框架讓 AI 智能體隨時間建立可重用、針對特定來源的理解能力。在 13/15 個設定中取得最佳結果,較 Hybrid RAG 最多提升 +22.6 分;移除關鍵文件後,表現約下跌 8 分,Hybrid RAG 則下跌 25 分。學習成果亦可遷移至未練習的任務,改善指引任務未直接涵蓋的來源部分。
Google 找到為 AI 設計的蛋白質加水印的方法,目標是協助生物安全。這項方法可與一款受歡迎的 AI 蛋白質設計工具配合使用。
Google DeepMind 推出 SynthID Bio,將可檢測水印嵌入蛋白質序列和預測結構,以辨識 AI 生成的生物設計。
推薦理由:SynthID Bio 把水印延伸至合成後的蛋白質,並以三種靶蛋白的濕實驗展示來源辨識與保留生物功能並行的做法。
MIT、Carnegie Mellon University、New York University 和 Stanford University 的研究者開發 Ataraxos,在 Stratego 以 15-1-4 擊敗世界最強玩家;相關研究刊於 Nature。
研究團隊系統性比較大語言模型(LLM)在概念注入與移除時的條件控制方法,發現高效引導往往以流暢度受損為代價。Activation steering 在指令微調模型上的效果遠不及在基礎模型上;提示詞和監督式微調可用於概念注入,但不擅長移除。低成本文本指標與成本較高的 LLM 評判分數高度相關。
Apple Machine Learning Research 提出 SCLATE,讓基準與未修改的智能體透過 adapter 將各自事件加入同一開放排程器,支援持續學習智能體的訓練與評測。
JEPA-TTT 透過在測試期間持續自我監督更新預訓練世界模型的潛在動力學預測器,適應測試時與訓練時不同的環境動力學。在 4 個連續控制環境的 8 種動力學轉變中,JEPA-TTT 均改善規劃表現;經 500 個測試回合後,潛在自回歸預測誤差平均降低 83%,規劃表現較凍結的 JEPA 世界模型提升 153%。
MIT 研究人員系統評估算法單一化的主要反對理由,指出其是否有害不能一概而論,須視乎應用領域及算法準確度。研究以數學證明,算法單一化傾向形成妨礙探索的資訊迴音室;在招聘中,把多種算法組成「ensemble」可克服這項限制,其表現有時可媲美甚至優於各公司採用不同算法的做法。
Epoch AI 的分析估算,過去五年,AI 達到特定基準分數的成本每年降至約原來的 1/13,降幅快於文中比較的 DNA 定序、運算、鋰電池和電力。OpenAI 的例子顯示,o3 在 GPQA Diamond 達到 75% 分數時每題成本為 $0.30;不到 18 個月後,GPT-5.6 Luna 達到相同分數時每題成本為 $0.0004,下降 725 倍。
MIT研究團隊利用AI算法優化脂質納米粒(LNP)配方,提升RNA疫苗耐熱穩定性。新配方使疫苗在室温下穩定保存一年,或在37°C(98°F)保存兩個月;接種這些顆粒的小鼠產生了與使用類似Moderna原配方疫苗的小鼠相當的免疫反應。研究人員以算法分析近50種FDA批准賦形劑,從五種候選物中迭代預測配比,經數輪細胞測試後在數週內選出供動物測試的配方。
MIT McGovern Institute 研究團隊開發一款以詞彙表和機器學習分析危機對話、估算自殺風險的工具。研究以涵蓋 49 項風險因素的詞彙表分析約 16,000 段 Crisis Text Line 對話,發現最高風險組較常提及致命手段和物質使用,而非抑鬱情緒或疲倦。這款輕量、可解讀的模型可預測未見對話的風險程度,但詞彙表不處理語境,投入臨牀使用前仍須充分驗證。
Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。
Microsoft 宣佈 Physical AI Toolchain 新增機械人推理卸載功能,支援透過 Kubernetes 工具把 AI 工作負載分配至機械人、邊緣 GPU 和雲端。
推薦理由:文章將實機工作負載的效能、電池續航與算力配置放在同一脈絡比較,並介紹以 Kubernetes 分配推理的工具,呈現卸載方案的收益與代價。
OpenAI 推出 MentalHealthBench,這是一項由專家提供意見的評測基準,用於評估 AI 在貼近現實的心理健康對話中能否提供有幫助且安全的回應。
Redwood Research 發現,提示詞加入無意義填充 token 後,GPT-6-Astra 在多項推理與數學評測的提升幅度高於其他受測模型。在 4-hop natural facts 評測中,其成績由約 10-20% 升至約 50%;舊版 AIME 題目則由約 60-70% 升至約 90%,填充 token 的效益在約 8,192 tokens 時達峯值。
Amazon Science 團隊介紹三項研究,分別用 MochiBind 排序抗體結合力、用 CA-MAP 預測抗體可開發性,並以 Agent 協助設計及實驗驗證抗體。