跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分71

Anthropic 研究:自動化對齊研究智能體可緩解已清晰界定的對齊失敗

Automated Researchers Can Mitigate Well-Characterized Alignment Failures

AI 導讀

Anthropic 研究發現,以 Claude Opus 4.8 驅動的自動化對齊研究智能體,透過後訓練可緩解所測的 10 類對齊失敗。最佳方法在留出基準、多輪 Petri 行為審計及最高達目標模型 4.7× 規模的模型上仍能泛化,並大致保留一般能力。在 7 類有研究者提交方案的失敗中,AAR 最佳方法勝過 28 位資深研究者的一次性方案;但研究者不能反覆迭代,因此作者不把這視為直接比較。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com