跳到正文
評測來源

Long-Horizon Terminal-Bench

Tencent HY / Lehigh 等 / 編程 · 在較長時間內持續使用終端,完成複雜工程與工具任務。

官方評測
在 ATech Hot 中觀察中
證據預算不計分
上游數據時間待核實
最近成功同步尚未開始採集

它測什麼,怎麼測

90 分鐘、2 小時和 3 小時預算分別比較;修復前後判題協議不能混排,也不能把不同 Agent 的最好結果當統一模型成績。

如何使用這份證據

候選觀察:等待明確標註修復協議的新批次,現有舊分不自動採集到公開榜,也不計分;不據此斷言每條舊結果都利用了漏洞。

評測侷限與數據署名

官方披露過判題信息泄漏;當前不能證明已有成績屬於隔離判題後的同一協議。部分任務與其他專業評測的來源重疊待核。

數據許可:Apache 2.0 · 官方 IntelligenceLab/LHTB-leaderboard 成績數據集;保留署名和變更説明。

成績由 Tencent HY / Lehigh 等 發佈,原始分數與 ATech Hot 共識分使用不同尺度,不能直接相加。