跳到正文
原文
Prime Intellect·· 6 小時前AI 評分61

prime-rl 新增演算法層,支援按環境選擇訓練演算法

ResearchJUL 6TH, 2026prime-rl gets an Algorithms layer

AI 導讀

Prime Intellect 為 prime-rl 新增演算法層,內建六種演算法並支援按環境選用,讓同一訓練執行可混用不同演算法。六種包括 GRPO、MaxRL、On-Policy Distillation、Self-Distillation、SFT distillation 和 ECHO;自訂演算法可沿用同一抽象實作,而毋須修改 trainer。

來源:Prime Intellect · primeintellect.ai