跳到正文
評測來源

Longform Writing

EQ-Bench · 長篇故事的連貫性與完整性

官方評測
在 ATech Hot 中參與排名
證據預算2.4%
上游數據時間09/24 15:57
最近成功同步10/06 14:05

它測什麼,怎麼測

採用 overall_score_100;八章長文的情節與表達評分,裁判偏好作為侷限披露。

如何使用這份證據

正式計分;兩張寫作榜合計佔 6%,不按題數或模型數增加權重。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
1claude-opus-5Anthropic86.3來源預設配置
2claude-fable-5-1Anthropic85.3來源預設配置
3claude-opus-5-5Anthropic84.6來源預設配置
4claude-fable-5Anthropic83來源預設配置
4grok-4.7xAI83來源預設配置
6muse-spark-1.3Meta82.8來源預設配置
6gpt-6-astraOpenAI82.8來源預設配置
6gpt-6-solOpenAI82.8來源預設配置
9aion-3.5aion-labs82.1來源預設配置
10GLM-5.3Z.ai81.8來源預設配置
10claude-opus-4-7Anthropic81.8來源預設配置
12gpt-5.6-solOpenAI81.7來源預設配置
13muse-spark-1.2Meta81.5來源預設配置
14claude-opus-4-8Anthropic80.8來源預設配置
15claude-sonnet-4-6Anthropic79.9來源預設配置
17kimi-k3Moonshot AI79.6來源預設配置
18moonshotai/Kimi-K2.6Moonshot AI78.5來源預設配置
19gpt-5.4OpenAI78.3來源預設配置
19claude-sonnet-5Anthropic78.3來源預設配置
21gpt-5.5OpenAI78.2來源預設配置
22gpt-5.6-terraOpenAI78來源預設配置
23zai-org/GLM-5.2Z.ai77.9來源預設配置
24claude-opus-4-6Anthropic77.7來源預設配置
25gemini-3.8-flashGoogle76.8來源預設配置
26deepseek-ai/DeepSeek-V4-ProDeepSeek75.6來源預設配置
27gpt-5.6-lunaOpenAI75.5來源預設配置
28moonshotai/Kimi-K2.5Moonshot AI74.9來源預設配置
29Altworld/Hemmingway-1—74.2來源預設配置
30deepseek-v4.1-flashDeepSeek74來源預設配置
31XiaomiMiMo/MiMo-V2.5-ProXiaomi73.7來源預設配置
評測侷限與數據署名

以英文寫作為主,依賴模型裁判;同一裁判和相關任務共用預算,不代表中文文筆。

數據許可:MIT · EQ-bench-site README 元數據聲明

成績由 EQ-Bench 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。