Prime Intellect·· 6 小時前AI 評分61
prime-rl 新增演算法層,支援按環境選擇訓練演算法
ResearchJUL 6TH, 2026prime-rl gets an Algorithms layer
AI 導讀
Prime Intellect 為 prime-rl 新增演算法層,內建六種演算法並支援按環境選用,讓同一訓練執行可混用不同演算法。六種包括 GRPO、MaxRL、On-Policy Distillation、Self-Distillation、SFT distillation 和 ECHO;自訂演算法可沿用同一抽象實作,而毋須修改 trainer。
來源:Prime Intellect · primeintellect.ai