跳到正文
評測來源

DeepSWE v1.1

DataCurve / 編程 · 在統一的編程助手環境裏改倉庫、修缺陷,比較的是寫代碼的模型本身。

官方評測
在 ATech Hot 中參與排名
證據預算3.6%
上游數據時間09/22 14:27
最近成功同步10/06 14:05

它測什麼,怎麼測

只取 pass@1;統一 harness 內按預先固定的推理檔位優先級選代表配置。

如何使用這份證據

編程與設計預算中的 3.6%;固定受控系統與版本。

評測成績

按固定規則,每個公開模型採用一套代表配置;沒有可採用配置的模型標為未計入並寫明原因。匿名測試型號不展示,保留原榜名次,每項最多 30 個。

原榜名次原榜型號原始成績代表配置
2gemini-3-8-flashGoogle73.8%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
3claude-opus-5Anthropic73.6%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
4gpt-6-astraOpenAI73.2%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
9gpt-5-6-solOpenAI72.7%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
13claude-fable-5Anthropic69.7%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
14gpt-5-6-terraOpenAI69.6%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
16glm-5-3Z.ai69.0%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
19kimi-k3Moonshot AI68.5%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
21gpt-5-6-lunaOpenAI67.2%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
22gpt-5-5OpenAI67.0%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
24grok-4-6xAI66.7%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
27gemini-3-7-flashGoogle65.3%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
30glm-5-3-flashZ.ai63.4%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
31deepseek-v4-proDeepSeek62.8%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
35claude-opus-4-8Anthropic59.0%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
37qwen3-8-maxAlibaba57.5%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
39muse-spark-1-2Meta54.9%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
42claude-sonnet-5Anthropic53.8%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
43grok-4-5xAI53.8%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46deepseek-v4-flashDeepSeek53.3%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46muse-spark-1-1Meta53.3%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
48gpt-5-4OpenAI51.8%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
53gemini-3-6-flashGoogle46.7%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
56glm-5-2Z.ai43.8%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
61gemini-3-5-flashGoogle36.1%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
63kimi-k2-7-codeMoonshot AI30.5%完整系統 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
65claude-sonnet-4-6Anthropic29.9%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
68gemini-3-1-pro-previewGoogle11.7%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
評測侷限與數據署名

仍是模型+mini-swe-agent 的系統表現;大版本變化必須隔離快照。

數據許可:官方公開結構化結果;僅管理員私有觀察,公開前複核許可

成績由 DataCurve 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。