OpenAI News·· 2024-07-24AI 評分34
OpenAI 以 Rule-Based Rewards 改善模型安全行為
Improving Model Safety Behavior with Rule-Based Rewards
AI 導讀
OpenAI 開發並應用一種利用 Rule-Based Rewards(RBRs)的新方法,讓模型無須大量收集人工數據,便能對齊至安全行為。
來源:OpenAI News · openai.com
Improving Model Safety Behavior with Rule-Based Rewards
OpenAI 開發並應用一種利用 Rule-Based Rewards(RBRs)的新方法,讓模型無須大量收集人工數據,便能對齊至安全行為。
來源:OpenAI News · openai.com