跳到正文
原文
Hugging Face Blog·· 2025-08-07AI 評分54

Hugging Face TRL 擴展視覺語言模型對齊訓練支援

Vision Language Model Alignment in TRL ⚡️

AI 導讀

Hugging Face 的 TRL 新增視覺語言模型對齊訓練支援,涵蓋 MPO、GRPO、GSPO、RLOO、Online DPO 與原生 SFT 支援。MPO 結合 DPO 偏好損失、BCO 品質損失與 SFT 生成損失,文中引述論文稱該組合在 MathVista 提升 6.2 pts。

來源:Hugging Face Blog · huggingface.co