評測來源官方評測
MirrorCode
Epoch AI / 編程 · 長時間的軟件復現
在 ATech Hot 中僅供參考
證據預算不計分
上游數據時間09/23 00:42
最近成功同步10/06 14:05
它測什麼,怎麼測
已發佈數據僅少量型號,且運行時間很長;樣本和運行條件不足以形成分類共識。
如何使用這份證據
僅供參考,不進入綜合或分類分數。
評測成績
按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。
| 原榜名次 | 原榜型號 | 原始成績 | 代表配置 |
|---|---|---|---|
| 1 | claude-opus-5-5_maxAnthropic | 77.4% | Max 推理 |
| 2 | claude-fable-5-1_highAnthropic | 73.3% | High 推理 |
| 3 | claude-fable-5_highAnthropic | 63.9% | High 推理 |
| 4 | gpt-6-astra_highOpenAI | 46.7% | High 推理 |
| 5 | claude-opus-4-7_highAnthropic | 31.1% | High 推理 |
| 6 | gpt-5.6-sol_highOpenAI | 20.0% | High 推理 |
| 7 | gpt-5.4-2026-03-05_highOpenAI | 15.6% | High 推理 |
| 8 | gpt-5.5_highOpenAI | 10.0% | High 推理 |
| 9 | gemini-3.1-pro-preview_highGoogle | 8.9% | High 推理 |
評測侷限與數據署名
僅供參考,不進入綜合或分類分數。
數據許可:CC BY 4.0 · Epoch AI 自行評測數據
成績由 Epoch AI 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。