Anthropic:Alignment Science Blog·· 4 天前AI 評分60
Anthropic 研究團隊提出模組化框架,強化 AI 控制評估中的紅隊測試
Strengthening Red Teams: A Modular Scaffold for Control Evaluations
AI 導讀
Anthropic 研究團隊在 SHADE-Arena 中優化模組化攻擊策略框架,使 Claude 3.7 Sonnet 的安全分數由 0.87 降至 0.41。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com