跳到正文
評測來源

LiveBench · 語言與指令

LiveBench · Language + IF 兩項均分,各佔 50%。

官方評測
在 ATech Hot 中參與排名
證據預算3%
上游數據時間09/30 03:01
最近成功同步10/06 14:05

它測什麼,怎麼測

先分別計算 Language、IF 的分類成績,再各佔 50% 求平均,最後保留一位小數。兩項均分與官網單獨選擇某一類的成績不同。Language 衡量語言理解,IF 衡量指令與格式約束,不據此評價小説文筆。

如何使用這份證據

保留綜合榜寫作與表達預算中的 3%;不進入文學創作的寫作分類。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
1gemini-3.8-flash-highGoogle84.6%High 推理
2claude-fable-5-max-effortAnthropic83.2%Max 推理
3gemini-3.7-flash-highGoogle82.7%High 推理
4gpt-6-astra-maxOpenAI82.5%Max 推理
5gemini-3.1-pro-preview-highGoogle82.2%High 推理
6gpt-6.1-sol-maxopenai82.1%Max 推理
7claude-fable-5-1-max-effortAnthropic81.2%Max 推理
8muse-spark-1.3-xhighMeta80.4%xHigh 推理
9gemini-3.5-flash-highGoogle80.1%High 推理
11gpt-5.6-sol-maxOpenAI79.8%Max 推理
12gemini-3.6-flash-highGoogle79.6%High 推理
13gpt-5.5-xhighOpenAI79.0%xHigh 推理
14kimi-k3Moonshot AI78.4%來源預設配置
15grok-4.6xAI77.8%來源預設配置
16grok-4.7-xhighxAI77.7%xHigh 推理
17smaug-agenticAbacus.AI77.7%來源預設配置
18grok-4.5xAI77.2%來源預設配置
20gpt-6-sol-maxOpenAI76.9%Max 推理
21qwen3.7-maxAlibaba76.9%來源預設配置
22qwen3.8-maxAlibaba76.9%來源預設配置
23muse-spark-1.2-xhighMeta76.4%xHigh 推理
24gpt-5.4-xhighOpenAI76.4%xHigh 推理
26claude-opus-5-max-effortAnthropic76.2%Max 推理
27claude-opus-5-5-max-effortAnthropic76.0%Max 推理
28qwen3.8-flash-nextAlibaba75.9%來源預設配置
29claude-opus-4-8-max-effortAnthropic75.8%Max 推理
30deepseek-v4-flash-vision-expDeepSeek75.7%來源預設配置
31deepseek-v4.1-flash-maxDeepSeek75.6%來源預設配置
32smaug-miniAbacus.AI75.5%來源預設配置
33deepseek-v4-pro-0813DeepSeek74.9%來源預設配置
評測侷限與數據署名

兩項均分衡量組合表現,不能當成 Language 單項成績。官方頁面切換分類或是否包含微調模型時,分數與排序會隨之變化。組織參與方 Abacus.AI 同時開發 Smaug 模型,其獨家成績需要其他獨立來源補充。

數據許可:Apache 2.0

分項成績由 LiveBench 發佈,AIHOT 按上述兩類等權彙總並排序。兩項均分與 AIHOT 共識分使用不同尺度,不能直接相加。