跳到正文
評測來源

Terminal-Bench 4 · 系統參考

Harbor / Terminal-Bench / 編程 · 保留模型搭配不同 Agent 在終端任務中的原始成績,供交叉核對。

官方評測
在 ATech Hot 中僅供參考
證據預算不計分
上游數據時間10/06 07:44
最近成功同步10/06 14:06

它測什麼,怎麼測

固定 Terminal-Bench 4.0,分別保留模型、Agent 版本、推理檔位和運行次數;不把不同工具系統解釋為統一模型條件。

如何使用這份證據

原始成績參考:鎖定官方提交清單與數據版本後自動採集,逐條保留不同系統配置,不選模型代表分。只供交叉核對,不進入綜合或編程排名。

評測成績

下列為模型搭配不同 Agent 的系統成績,運行條件不同,僅供參考。每項最多展示 30 條配置,匿名測試型號不展示。

原榜名次原榜型號原始成績運行配置
1claude-sonnet-5-5anthropic61.8%Claude Code 2.1.284 · max 推理
2claude-fable-5-1Anthropic57.9%Claude Code 2.1.257 · max 推理
3claude-opus-5Anthropic51.8%Claude Code 2.1.231 · max 推理
4claude-fable-5Anthropic44.5%Claude Code 2.1.231 · max 推理
5glm-5.3Z.ai41.8%Claude Code 2.1.207 · max 推理
6gpt-5.6-solOpenAI37.3%Codex 0.149.1 · max 推理
7claude-opus-4-8Anthropic23.6%Claude Code 2.1.231 · max 推理
8gpt-5.6-terraOpenAI21.5%Codex 0.149.1 · max 推理
9grok-4.6xAI20.3%Grok Build 1.0.5 · 來源未報告推理檔位
10gemini-3.8-flashGoogle19.1%mini-SWE-agent 2.4.6 · high 推理
11gpt-5.6-lunaOpenAI17.3%Codex 0.149.1 · max 推理
12grok-4.5xAI12.4%Grok Build 1.0.5 · 來源未報告推理檔位
12claude-sonnet-5Anthropic12.4%Claude Code 2.1.231 · max 推理
14gemini-3.7-flashGoogle11.2%mini-SWE-agent 2.4.6 · high 推理
評測侷限與數據署名

不同模型使用 Claude Code、Codex、GrokBuild 或 mini-SWE 等不同工具;AA v4.3 已含 Terminal-Bench v4,不得再次計入綜合票權。

數據許可:Apache 2.0 · 官方 harbor-framework/terminal-bench 倉庫內的成績提交;保留署名、協議與修改説明。

成績由 Harbor / Terminal-Bench 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。