跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分60

Anthropic 研究團隊提出模組化框架,強化 AI 控制評估中的紅隊測試

Strengthening Red Teams: A Modular Scaffold for Control Evaluations

AI 導讀

Anthropic 研究團隊在 SHADE-Arena 中優化模組化攻擊策略框架,使 Claude 3.7 Sonnet 的安全分數由 0.87 降至 0.41。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com