跳到正文
原文
英國 AI Security Institute:Blog·· 3 小時前AI 評分56

英美 AI 安全研究所聯合評估 OpenAI o1 上線前表現,整體與參照模型相若

Pre-Deployment evaluation of OpenAI’s o1 model

AI 導讀

英美兩國 AI 安全研究所於 OpenAI 公開發布 o1 前進行聯合評估,發現三個測試領域的整體表現大致與參照模型相若。美國測試中,o1 解決 40 項網絡安全挑戰的 45%,高於最佳參照模型的 35%,並額外解決 3 項其他參照模型未能完成的密碼學挑戰;英國測試的學徒級挑戰解決率則為 36%,低於最佳參照模型的 46%。

來源:英國 AI Security Institute:Blog · aisi.gov.uk