跳到正文
評測來源

MirrorCode

Epoch AI / 編程 · 長時間的軟件復現

官方評測
在 ATech Hot 中僅供參考
證據預算不計分
上游數據時間09/23 00:42
最近成功同步10/06 14:05

它測什麼,怎麼測

已發佈數據僅少量型號,且運行時間很長;樣本和運行條件不足以形成分類共識。

如何使用這份證據

僅供參考,不進入綜合或分類分數。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
1claude-opus-5-5_maxAnthropic77.4%Max 推理
2claude-fable-5-1_highAnthropic73.3%High 推理
3claude-fable-5_highAnthropic63.9%High 推理
4gpt-6-astra_highOpenAI46.7%High 推理
5claude-opus-4-7_highAnthropic31.1%High 推理
6gpt-5.6-sol_highOpenAI20.0%High 推理
7gpt-5.4-2026-03-05_highOpenAI15.6%High 推理
8gpt-5.5_highOpenAI10.0%High 推理
9gemini-3.1-pro-preview_highGoogle8.9%High 推理
評測侷限與數據署名

僅供參考,不進入綜合或分類分數。

數據許可:CC BY 4.0 · Epoch AI 自行評測數據

成績由 Epoch AI 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。