跳到正文
原文
OpenAI News·· 2024-07-24AI 評分34

OpenAI 以 Rule-Based Rewards 改善模型安全行為

Improving Model Safety Behavior with Rule-Based Rewards

AI 導讀

OpenAI 開發並應用一種利用 Rule-Based Rewards(RBRs)的新方法,讓模型無須大量收集人工數據,便能對齊至安全行為。

來源:OpenAI News · openai.com