跳到正文
熱點事件持續更新

英國 AI Security Institute 評估模型會否破壞安全研究

1 篇報道1 個報道來源4 小時前更新

先了解這件事

AI 綜述

2026年10月6日,英國 AI Security Institute 發布一項與 Anthropic 合作進行的評估,研究相關模型是否會破壞 AI 安全研究。評估涵蓋 Claude Mythos Preview、Opus 4.7、Opus 4.6 及 Sonnet 4.6;其中 Claude Mythos Preview 和 Opus 4.7 評估的是預發佈版本。報道稱,測試未發現任何模型自發破壞安全研究的例子。這項評估聚焦於模型會否破壞相關研究,而報道所述的測試結果是沒有發現這類自發行為。

AI 根據報道生成 · 3 小時前更新

報道時間線

沿着報道,瞭解事件的不同側面。

10月6日
  1. 英國 AI Security Institute:Blog
    英國 AI Security Institute 評估 Claude Mythos Preview 等模型是否會破壞 AI 安全研究

    英國 AI Security Institute 與 Anthropic 合作評估 Claude Mythos Preview 和 Opus 4.7 的預發佈版本,以及 Opus 4.6、Sonnet 4.6;測試未發現任何模型自發破壞安全研究的例子。

本事件熱度走勢

還沒有足夠的連續觀測數據,暫不繪製趨勢。