Epoch AI:研究、數據與評測·· 21 天前AI 評分45
GPT-6 Astra 數學基準測試領先,但軟件工程未居首
GPT-6 Astra leads on math benchmarks, but not on software engineering
AI 導讀
Epoch AI 的 ECI 比較顯示,GPT-6 Astra 在數學基準測試領先,但未在軟件工程領先。比較涵蓋 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3,並以數學及軟件工程專項 ECI 評估模型能力;專項分數可與一般 ECI 比較。
來源:Epoch AI:研究、數據與評測 · epoch.ai