跳到正文
評測來源

Mercor APEX-Agents 1.1

Mercor / 專業辦公 · 投行、諮詢和法律裏的長任務,看模型當助手能不能把一件完整的工作做完。

官方評測
在 ATech Hot 中參與排名
證據預算4%
上游數據時間09/08 08:00
最近成功同步10/06 14:05

它測什麼,怎麼測

固定 1.1 數據集和官方 Loop 環境,採用 Pass@1 及其對應誤差,按預先固定的推理檔位選配置。Mean Score 是評分項平均完成度,不混作任務完成率。

如何使用這份證據

固定 1.1 版官方 Loop 的 Pass@1,獨佔工具與辦公預算中的 4%;另 2% 用於統一環境的銀行業務任務。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
1claude-sonnet-5-5anthropic75.5%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
2claude-opus-5-5Anthropic73.5%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
3claude-fable-5.1Anthropic68.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
4gemini-3.7-flashGoogle67.8%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
5claude-opus-5Anthropic65.8%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
6grok-4-6-xhighxAI65.3%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
7gpt-6-astra-maxOpenAI64.7%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
8gemini-3.8-flashGoogle64.3%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
9claude-fable-5Anthropic63.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
10qwen-3-8-max-xhighAlibaba63.3%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
11gpt-6-1-solopenai60.0%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
13mimo-v2.6-proXiaomi59.5%完整系統 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
14muse-spark-1-3Meta58.6%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
15gpt-5.6-terra-maxOpenAI58.2%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
16glm-5-3Z.ai56.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
17grok-4-5xAI56.2%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
18deepseek-v4-flashDeepSeek55.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
19gpt-5.5-xhighOpenAI55.1%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
20grok-4.7xAI54.6%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
21claude-sonnet-5-maxAnthropic54.5%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
22gpt-6-solOpenAI54.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
23glm-5-3-flashZ.ai52.8%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
25responses/gpt-5.4OpenAI52.4%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
26gpt-5-6-sol-max-proOpenAI51.4%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
27kimi-k3Moonshot AI50.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
28claude-opus-4-7Anthropic49.2%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
29claude-opus-4-8Anthropic48.9%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
30qwen-3-8-27bAlibaba47.5%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
31deepseek-v4-pro-08-13DeepSeek47.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
32gemini-3.6-flashGoogle46.9%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
評測侷限與數據署名

限投行、諮詢、法律任務;原頁未提供逐型號評測日期,少量運行缺失的原因尚未公開。不能將此分數解釋為所有辦公工作的可靠性。

數據許可:官方公開結果;數據與代碼許可不等於榜單再分發授權

成績由 Mercor 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。