評測來源官方評測
SWE-rebench
Nebius / 編程 · 持續收集真實倉庫問題,比較模型在多種編程語言中的軟件修復能力。
在 ATech Hot 中觀察中
證據預算不計分
上游數據時間待核實
最近成功同步尚未開始採集
它測什麼,怎麼測
固定任務窗口、ReAct 環境和 text/tools 交互協議,採用多次運行的平均解決率與標準誤;不把完整 Agent 產品與基礎模型混為同一對象。
如何使用這份證據
候選觀察:真實倉庫任務值得補充,等待可驗證運行日期、穩定成績協議與再展示邊界;尚未啓用自動採集或計分。
評測侷限與數據署名
滾動題目、運行環境和任務窗口影響可比性;網站近期維護不等於所有模型重新測試。
數據許可:官方 Hugging Face CC BY 4.0 數據集是任務題庫;尚未確認網頁最終成績的穩定導出與再展示邊界。
成績由 Nebius 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。