跳到正文
評測來源

Creative Writing v3

EQ-Bench · 短篇創作與表達

官方評測
在 ATech Hot 中參與排名
證據預算3.6%
上游數據時間09/24 15:57
最近成功同步10/06 14:05

它測什麼,怎麼測

官方 CSV 內嵌於數據腳本,採用 Elo;Sonnet 4.6 判勝負,風格、重複率和 rubric 不重複計票。

如何使用這份證據

正式計分;兩張寫作榜合計佔 6%,不按題數或模型數增加權重。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
1gpt-6-astraOpenAI2,173.3來源預設配置
2claude-fable-5-1Anthropic2,162來源預設配置
3claude-opus-5Anthropic2,132.6來源預設配置
4gpt-6-solOpenAI2,124.7來源預設配置
5kimi-k3Moonshot AI2,082.3來源預設配置
6GLM-5.3Z.ai2,075來源預設配置
7claude-opus-5-5Anthropic2,050.1來源預設配置
8grok-4.7xAI2,006.7來源預設配置
10gpt-5.6-solOpenAI1,971.6來源預設配置
11claude-fable-5Anthropic1,943.1來源預設配置
12aion-3.5aion-labs1,929.3來源預設配置
13muse-spark-1.1Meta1,927.1來源預設配置
14claude-opus-4-7Anthropic1,914.3來源預設配置
15Altworld/Hemmingway-1—1,906.4來源預設配置
16muse-spark-1.3Meta1,905.9來源預設配置
17gpt-5.6-terraOpenAI1,854.9來源預設配置
18gpt-5.5OpenAI1,843.9來源預設配置
19Qwen/Qwen3.8-2.4T-A95BAlibaba1,842.5來源預設配置
20muse-spark-1.2Meta1,840.4來源預設配置
21claude-opus-4-8Anthropic1,839.8來源預設配置
22gpt-5.4OpenAI1,839.7來源預設配置
23gpt-5.6-lunaOpenAI1,828.7來源預設配置
24claude-sonnet-4-6Anthropic1,810.4來源預設配置
25claude-opus-4-6Anthropic1,809.1來源預設配置
26meta-models/Muse-Glimmer-30BMeta1,798.3來源預設配置
27claude-sonnet-5Anthropic1,794來源預設配置
28space-bunny-alphastealth1,784.3來源預設配置
29zai-org/GLM-5.2Z.ai1,756.5來源預設配置
30gemini-3.8-flashGoogle1,747.9來源預設配置
31moonshotai/Kimi-K2.6Moonshot AI1,724.5來源預設配置
評測侷限與數據署名

以英文寫作為主,依賴模型裁判;同一裁判和相關任務共用預算,不代表中文文筆。

數據許可:MIT · EQ-bench-site README 元數據聲明

成績由 EQ-Bench 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。