Anthropic:Alignment Science Blog·· 4 天前AI 評分63
Anthropic 發佈《2025 年夏季試點破壞風險報告》,評估 Claude Opus 4 的風險
Anthropic's Pilot Sabotage Risk Report
AI 導讀
Anthropic 發佈《2025 年夏季試點破壞風險報告》,評估現有 AI 系統及部署中的不對齊風險,重點分析 Claude Opus 4(https://alignment.anthropic.com/2025/sabotage-risk-report/)。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com