跳到正文
原文
英國 AI Security Institute:Blog·· 3 小時前AI 評分64

英國 AI Security Institute 評估 Claude Mythos Preview 等模型是否會破壞 AI 安全研究

Evaluating whether AI models would sabotage AI safety research

AI 導讀

英國 AI Security Institute 與 Anthropic 合作評估 Claude Mythos Preview 和 Opus 4.7 的預發佈版本,以及 Opus 4.6、Sonnet 4.6;測試未發現任何模型自發破壞安全研究的例子。

來源:英國 AI Security Institute:Blog · aisi.gov.uk