跳到正文
評測來源

Arena Text Style-Controlled

LMArena · 真人匿名兩兩比較回答,看大家更願意讀哪一個。補上選擇題看不出的整體體驗。

官方評測
在 ATech Hot 中參與排名
證據預算5%
上游數據時間10/02 08:00
最近成功同步10/06 14:05

它測什麼,怎麼測

只取官方發佈快照中的 Text Overall style-controlled 主榜,不抓取 arena.ai 實時頁面。

如何使用這份證據

真人偏好預算 10% 分為整體 5% 和創作 5%;與 Arena 的編程和視覺評測仍共用證據家族。按官方成績數據時間判斷新舊。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
1gemini-4-argon-highgoogle1,525.2High 推理
2claude-opus-4-6-highAnthropic1,504.7High 推理
3claude-fable-5-highAnthropic1,504.3High 推理
4claude-opus-5.5-highAnthropic1,503.7High 推理
5claude-opus-4-7-highAnthropic1,501.3High 推理
6claude-fable-5.1-maxAnthropic1,501.1Max 推理
8gemini-3.8-flash-highGoogle1,494.8High 推理
9muse-spark-1.3-maxMeta1,494.3Max 推理
11muse-spark-1.2 (xHigh)Meta1,493.5xHigh 推理
12muse-spark-1.1Meta1,491.3來源預設配置
14claude-opus-5-maxAnthropic1,489.5Max 推理
15muse-sparkMeta1,489.3來源預設配置
16kimi-k3-maxMoonshot AI1,488.4來源預設配置
17gemini-3.7-flash-highGoogle1,487.7High 推理
18gemini-3.1-pro-previewGoogle1,487來源預設配置
19gemini-3-proGoogle1,485.5來源預設配置
20gpt-5.6-sol-xhighOpenAI1,483.9xHigh 推理
21gpt-6.1-sol-maxopenai1,483.2Max 推理
22gemini-3.6-flash-highGoogle1,483High 推理
23qwen3.8-maxAlibaba1,481.6來源預設配置
24claude-opus-4-8-highAnthropic1,481.5High 推理
25gpt-5.5-highOpenAI1,481.4High 推理
26mimo-v2.6-proXiaomi1,480.1來源預設配置
27glm-5.3-maxZ.ai1,478.5來源預設配置
28gemini-3.5-flash-highGoogle1,477.4High 推理
29gpt-6-astra-maxOpenAI1,477.1Max 推理
32glm-5.2-maxZ.ai1,475.8來源預設配置
33gpt-5.2-chat-latest-20260210OpenAI1,475.7來源預設配置
34gpt-5.4-highOpenAI1,475.2High 推理
35qwen3.7-max-previewAlibaba1,474.9來源預設配置
評測侷限與數據署名

人類偏好受風格、用户結構和提示分佈影響。整體與創作分類存在重疊投票,共享原有真人偏好預算,不視為兩家獨立評測機構。

數據許可:CC BY 4.0

成績由 LMArena 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。