評測來源官方評測
TapTap Maker Benchmark
TapTap Maker / 編程 · 在真實遊戲引擎裏用 Lua 寫出能跑起來的功能。分數由引擎執行判定,不用另一個模型打分。
在 ATech Hot 中參與排名
證據預算3.6%
上游數據時間09/10 08:00
最近成功同步10/06 14:05
它測什麼,怎麼測
只取官方 main_board 的 L2 通過率;成本、速度、Held-out 和分類分不再次投票。同一基礎模型按固定推理檔位優先級選代表行,選擇不看分數。
如何使用這份證據
編程與設計預算中的 3.6%;固定引擎和 L2 指標。
評測成績
按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。
| 原榜名次 | 原榜型號 | 原始成績 | 代表配置 |
|---|---|---|---|
| 1 | claude-fable-5-1Anthropic | 90.5% | High 推理 |
| 2 | claude-fable-5Anthropic | 89.0% | High 推理 |
| 3 | gpt-6-astraOpenAI | 88.9% | xHigh 推理 |
| 4 | claude-opus-5Anthropic | 88.9% | xHigh 推理 |
| 5 | muse-spark-1.3-contributorMeta | 87.3% | xHigh 推理未計入:來源的 contributor 別名未對應到已核實的公開模型。 |
| 6 | grok-4.6@xhighxAI | 87.3% | xHigh 推理 |
| 7 | gemini-3.8-flashGoogle | 86.8% | High 推理 |
| 8 | gpt-5.6-solOpenAI | 86.5% | xHigh 推理 |
| 11 | glm-5.3Z.ai | 83.6% | Max 推理 |
| 12 | qwen3.8-max-0902Alibaba | 83.3% | xHigh 推理 |
| 13 | claude-opus-4-8Anthropic | 82.8% | xHigh 推理 |
| 14 | qwen3.8-maxAlibaba | 82.5% | xHigh 推理 |
| 15 | deepseek-v4.1-flashDeepSeek | 82.5% | Max 推理 |
| 16 | qwen3.8-flashAlibaba | 82.5% | xHigh 推理 |
| 17 | gpt-5.6-terraOpenAI | 81.8% | xHigh 推理 |
| 18 | glm-5.3-flashZ.ai | 81.5% | Max 推理 |
| 19 | hy4-previewTencent | 81.0% | High 推理 |
| 20 | kimi-k3Moonshot AI | 79.7% | 來源預設配置 |
| 21 | grok-4.5xAI | 78.3% | High 推理 |
| 22 | doubao-seed-evolvingByteDance | 78.3% | High 推理 |
| 23 | gpt-5.6-lunaOpenAI | 77.8% | xHigh 推理 |
| 24 | deepseek-v4-proDeepSeek | 77.8% | 來源預設配置 |
| 25 | claude-sonnet-5Anthropic | 76.2% | xHigh 推理 |
| 27 | deepseek-v4-flashDeepSeek | 74.6% | Max 推理 |
| 28 | qwen3.8-27bAlibaba | 68.3% | xHigh 推理 |
| 29 | gemini-3.1-pro-previewGoogle | 64.7% | 來源預設配置 |
| 30 | MiniMax-M3MiniMax | 60.1% | 來源預設配置 |
| 31 | claude-haiku-4-5Anthropic | 43.6% | High 推理 |
評測侷限與數據署名
單引擎、單語言,不能推廣到其他技術棧;不同模型可能使用不同 agent 驅動;閉源 harness 不能逐題復算。
數據許可:官方公開結果;公開再展示保留官方署名,完整再分發授權仍以易玩/TapTap 條款為準
成績由 TapTap Maker 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。