跳到正文
評測來源

LiveBench Global Average

LiveBench · 題庫持續更換,答案可以自動核對。用來看模型換題之後還能不能站住。

官方評測
在 ATech Hot 中交叉參考
證據預算不計分
上游數據時間09/30 03:01
最近成功同步10/06 14:05

它測什麼,怎麼測

保留官方 Global Average 作整體參考;正式分數使用互不重複的專項任務。

如何使用這份證據

原始 Global Average 留作參考;正式票改用互不重複的專項任務。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
1claude-fable-5-1-max-effortAnthropic83.4%Max 推理
2claude-opus-5-5-max-effortAnthropic83.2%Max 推理
3claude-fable-5-max-effortAnthropic83.0%Max 推理
4gpt-6-astra-maxOpenAI82.2%Max 推理
6gpt-6.1-sol-maxopenai81.6%Max 推理
7muse-spark-1.3-xhighMeta81.6%xHigh 推理
9deepseek-v4.1-flash-maxDeepSeek81.1%來源預設配置
10gpt-5.6-sol-maxOpenAI81.1%Max 推理
11gpt-5.5-xhighOpenAI80.2%xHigh 推理
12claude-opus-5-max-effortAnthropic80.1%Max 推理
13smaug-agenticAbacus.AI79.5%來源預設配置
14gpt-6-sol-maxOpenAI79.2%Max 推理
15kimi-k3Moonshot AI79.2%來源預設配置
16gemini-3.7-flash-highGoogle78.8%High 推理
17qwen3.8-maxAlibaba78.5%來源預設配置
18grok-4.6xAI78.0%來源預設配置
19gpt-5.4-xhighOpenAI78.0%xHigh 推理
20muse-spark-1.2-xhighMeta78.0%xHigh 推理
21gpt-5.6-terra-maxOpenAI77.9%Max 推理
23deepseek-v4-pro-0813DeepSeek77.4%來源預設配置
24smaug-flashAbacus.AI77.4%來源預設配置
25grok-4.7-xhighxAI77.4%xHigh 推理
26gemini-3.1-pro-preview-highGoogle77.0%High 推理
27smaug-miniAbacus.AI76.9%來源預設配置
28deepseek-v4-flash-vision-expDeepSeek76.8%來源預設配置
29claude-opus-4-7-xhigh-effortAnthropic76.5%xHigh 推理
30claude-opus-4-8-max-effortAnthropic76.2%Max 推理
31qwen3.8-flash-nextAlibaba76.2%來源預設配置
32glm-5.3Z.ai76.1%來源預設配置
33claude-sonnet-5-xhigh-effortAnthropic76.0%xHigh 推理
評測侷限與數據署名

綜合均分會稀釋特定能力的變化;僅交叉參考,不重複計票。組織參與方 Abacus.AI 同時開發 Smaug 模型,其獨家成績需要其他獨立來源補充。

數據許可:Apache 2.0

成績由 LiveBench 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。