跳到正文
評測來源

Arena Creative Writing

LMArena · 真人盲選故事、詩歌和其他創意表達,觀察作品是否吸引讀者。

官方評測
在 ATech Hot 中參與排名
證據預算5%
上游數據時間10/02 08:00
最近成功同步10/06 14:05

它測什麼,怎麼測

讀取官方數據集 text_style_control 的 creative_writing 分類,採用風格控制後的 Bradley–Terry 分與置信區間;不借用整體文本或職業寫作分類成績。

如何使用這份證據

正式計分;從原有真人偏好 10% 中拆分 5%,整體文本保留 5%,總預算不增加。與其他 Arena 任務共用證據家族。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
1gemini-4-argon-highgoogle1,518.8High 推理
2claude-opus-5.5-highAnthropic1,516.3High 推理
3claude-fable-5-highAnthropic1,502.6High 推理
4claude-opus-4-6-highAnthropic1,500.8High 推理
5gemini-3.7-flash-highGoogle1,493.4High 推理
6claude-opus-4-7-highAnthropic1,489High 推理
7gemini-3.8-flash-highGoogle1,484.5High 推理
8gemini-3-proGoogle1,484.4來源預設配置
10claude-fable-5.1-maxAnthropic1,481.8Max 推理
11gemini-3.1-pro-previewGoogle1,480.3來源預設配置
14gemini-3.6-flash-highGoogle1,470.9High 推理
15claude-opus-5-maxAnthropic1,470.6Max 推理
16claude-opus-4-5-20251101-high-32kAnthropic1,469.5High 推理 · 32k
17claude-opus-4-8-highAnthropic1,469.5High 推理
19gpt-5.6-sol-xhighOpenAI1,468.3xHigh 推理
20qwen3.8-maxAlibaba1,467.9來源預設配置
21muse-sparkMeta1,465.5來源預設配置
22gemini-3.5-flash-highGoogle1,463.9High 推理
24grok-4.20-beta1xAI1,463來源預設配置
26kimi-k3-maxMoonshot AI1,460.2來源預設配置
27gpt-6.1-sol-maxopenai1,459.7Max 推理
28muse-spark-1.3-maxMeta1,458.7Max 推理
29gemini-3-flashGoogle1,456.8來源預設配置
30gpt-5.5-instantOpenAI1,456.4來源預設配置
31muse-spark-1.2 (xHigh)Meta1,455.5xHigh 推理
32glm-5.2-maxZ.ai1,454.2來源預設配置
34glm-5.3-maxZ.ai1,453.9來源預設配置
35gpt-5.5-highOpenAI1,451.3High 推理
36grok-4.5xAI1,450.2來源預設配置
37claude-sonnet-4-5-20250929-high-32kAnthropic1,450High 推理 · 32k
評測侷限與數據署名

開放用户提示由分類器歸類,並非全部為長篇小説或中文創作;投票包含個人偏好。與 Arena 整體文本及職業寫作分類存在重疊,不能作為額外獨立機構。

數據許可:CC BY 4.0 · Arena 官方 Hugging Face leaderboard-dataset;保留署名、來源鏈接並説明聚合改動。

成績由 LMArena 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。