跳到正文
原文
Prime Intellect·· 5 小時前AI 評分66

Prime Intellect 整合 23 個 Agentic RL 任務集,涵蓋約 365,000 項任務

ResearchJUL 22ND, 2026Scaling Agentic RL: 365,000+ Environments for SWE, Terminal, and Search

AI 導讀

Prime Intellect 將 23 個軟件工程、終端機及搜尋任務集整合至同一 taskset API,合計約 365,000 項任務。這些任務可用於評測及 RL 訓練;多個 SWE 數據集經 gold patch 與無修改檢查後,已重新上載清理版本。作者指出,智能體與評分機制共用沙盒仍有 reward hack 風險,隔離評分環境仍在路線圖上。

來源:Prime Intellect · primeintellect.ai