Hugging Face Blog·· 2024-06-12精選AI 評分63
Hugging Face 在 TRL 推出 RLOO Trainer,作為 PPO 的線上 RLHF 替代方案
Putting RL back in RLHF
AI 導讀
Hugging Face 在 TRL 引入 RLOO Trainer,這是一種較 PPO 更易實作、較省 GPU 記憶體的線上 RLHF 訓練方法。測試顯示,RLOO 約比 PPO 少用 50–70% vRAM,1B 模型快 2 倍、6.9B 模型最高快 3 倍;6.9B checkpoint 的 GPT4 評審偏好率為 78.7%(k=2)。
推薦理由
文章對照 RLOO 與 PPO 的 GPU 記憶體用量、訓練速度及回答勝率,並披露 bf16 下 RLOO 有較多批次資料的梯度被清零。
來源:Hugging Face Blog · huggingface.co