評測來源官方評測
Terminal-Bench 4 · 系統參考
Harbor / Terminal-Bench / 編程 · 保留模型搭配不同 Agent 在終端任務中的原始成績,供交叉核對。
在 ATech Hot 中僅供參考
證據預算不計分
上游數據時間10/06 07:44
最近成功同步10/06 14:06
它測什麼,怎麼測
固定 Terminal-Bench 4.0,分別保留模型、Agent 版本、推理檔位和運行次數;不把不同工具系統解釋為統一模型條件。
如何使用這份證據
原始成績參考:鎖定官方提交清單與數據版本後自動採集,逐條保留不同系統配置,不選模型代表分。只供交叉核對,不進入綜合或編程排名。
評測成績
下列為模型搭配不同 Agent 的系統成績,運行條件不同,僅供參考。每項最多展示 30 條配置,匿名測試型號不展示。
| 原榜名次 | 原榜型號 | 原始成績 | 運行配置 |
|---|---|---|---|
| 1 | claude-sonnet-5-5anthropic | 61.8% | Claude Code 2.1.284 · max 推理 |
| 2 | claude-fable-5-1Anthropic | 57.9% | Claude Code 2.1.257 · max 推理 |
| 3 | claude-opus-5Anthropic | 51.8% | Claude Code 2.1.231 · max 推理 |
| 4 | claude-fable-5Anthropic | 44.5% | Claude Code 2.1.231 · max 推理 |
| 5 | glm-5.3Z.ai | 41.8% | Claude Code 2.1.207 · max 推理 |
| 6 | gpt-5.6-solOpenAI | 37.3% | Codex 0.149.1 · max 推理 |
| 7 | claude-opus-4-8Anthropic | 23.6% | Claude Code 2.1.231 · max 推理 |
| 8 | gpt-5.6-terraOpenAI | 21.5% | Codex 0.149.1 · max 推理 |
| 9 | grok-4.6xAI | 20.3% | Grok Build 1.0.5 · 來源未報告推理檔位 |
| 10 | gemini-3.8-flashGoogle | 19.1% | mini-SWE-agent 2.4.6 · high 推理 |
| 11 | gpt-5.6-lunaOpenAI | 17.3% | Codex 0.149.1 · max 推理 |
| 12 | grok-4.5xAI | 12.4% | Grok Build 1.0.5 · 來源未報告推理檔位 |
| 12 | claude-sonnet-5Anthropic | 12.4% | Claude Code 2.1.231 · max 推理 |
| 14 | gemini-3.7-flashGoogle | 11.2% | mini-SWE-agent 2.4.6 · high 推理 |
評測侷限與數據署名
不同模型使用 Claude Code、Codex、GrokBuild 或 mini-SWE 等不同工具;AA v4.3 已含 Terminal-Bench v4,不得再次計入綜合票權。
數據許可:Apache 2.0 · 官方 harbor-framework/terminal-bench 倉庫內的成績提交;保留署名、協議與修改説明。
成績由 Harbor / Terminal-Bench 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。