OpenAI News·· 2016-12-21AI 評分24
OpenAI 探討真實環境中的錯誤獎勵函數
Faulty reward functions in the wild
AI 導讀
OpenAI 探討強化學習算法的一種失效模式:獎勵函數設定錯誤。強化學習算法可能以出人意料、違反直覺的方式失效。
來源:OpenAI News · openai.com
Faulty reward functions in the wild
OpenAI 探討強化學習算法的一種失效模式:獎勵函數設定錯誤。強化學習算法可能以出人意料、違反直覺的方式失效。
來源:OpenAI News · openai.com