跳到正文
原文
METR:Blog·· 5 小時前AI 評分61

METR 發佈 Claude Opus 5.5 部署前評估摘要

Summary of METR's predeployment evaluation of Claude Opus 5.5 September 22, 2026 A summary of METR's independent, predeployment evaluation of Claude Opus 5.5 Read more

AI 導讀

METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。

來源:METR:Blog · metr.org