英國 AI Security Institute:Blog·· 3 小時前AI 評分64
英國 AI Security Institute 評估 Claude Mythos Preview 等模型是否會破壞 AI 安全研究
Evaluating whether AI models would sabotage AI safety research
AI 導讀
英國 AI Security Institute 與 Anthropic 合作評估 Claude Mythos Preview 和 Opus 4.7 的預發佈版本,以及 Opus 4.6、Sonnet 4.6;測試未發現任何模型自發破壞安全研究的例子。
來源:英國 AI Security Institute:Blog · aisi.gov.uk