Prime Intellect·· 5 小時前AI 評分66
Prime Intellect 整合 23 個 Agentic RL 任務集,涵蓋約 365,000 項任務
ResearchJUL 22ND, 2026Scaling Agentic RL: 365,000+ Environments for SWE, Terminal, and Search
AI 導讀
Prime Intellect 將 23 個軟件工程、終端機及搜尋任務集整合至同一 taskset API,合計約 365,000 項任務。這些任務可用於評測及 RL 訓練;多個 SWE 數據集經 gold patch 與無修改檢查後,已重新上載清理版本。作者指出,智能體與評分機制共用沙盒仍有 reward hack 風險,隔離評分環境仍在路線圖上。
來源:Prime Intellect · primeintellect.ai