跳到正文
原文
Prime Intellect·· 6 小時前AI 評分61

prime-rl 0.6.0:萬億參數規模強化學習效能深度解析

ResearchJUN 22ND, 2026RL at 1T Scale: prime-rl Performance Deep Dive

AI 導讀

Prime Intellect 發佈 prime-rl 0.6.0,支援萬億參數規模模型的智能體強化學習訓練。該團隊表示,可在 28 個 H200 節點上以最高 131k 的序列長度、低於 5 分鐘的單步時間及 256 個 rollouts 的批次大小,訓練 GLM-5 執行 SWE 任務。

來源:Prime Intellect · primeintellect.ai