METR:Blog·· 5 小時前AI 評分61
METR 發佈 Claude Opus 5.5 部署前評估摘要
Summary of METR's predeployment evaluation of Claude Opus 5.5 September 22, 2026 A summary of METR's independent, predeployment evaluation of Claude Opus 5.5 Read more
AI 導讀
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
來源:METR:Blog · metr.org