OpenAI Developers·· 2025-05-23AI 評分60
OpenAI 指南探討如何為強化微調設計模型評分器
Exploring Model Graders for Reinforcement Fine-Tuning
AI 導讀
OpenAI 的指南示範如何為 o4-mini 設計模型評分器,並以臨牀對話結果預測任務進行強化微調(RFT)。實驗使用 100 個訓練樣本和 100 個驗證樣本,採用 gpt-4.1 模型評分器後,微調模型的驗證評分較基礎 o4-mini 提高約 5 個百分點。指南亦展示詞面評分可能誘發模型加入同義詞、劑量或治療方案來刷分,並建議以領域專家檢查評分器和資料品質。
來源:OpenAI Developers · developers.openai.com