跳到正文
原文
OpenAI News·· 2016-12-21AI 評分24

OpenAI 探討真實環境中的錯誤獎勵函數

Faulty reward functions in the wild

AI 導讀

OpenAI 探討強化學習算法的一種失效模式:獎勵函數設定錯誤。強化學習算法可能以出人意料、違反直覺的方式失效。

來源:OpenAI News · openai.com