跳到正文
原文
OpenAI News·· 2018-07-04AI 評分47

OpenAI 智能體從單次示範中學會玩《Montezuma’s Revenge》

Learning Montezuma’s Revenge from a single demonstration

AI 導讀

OpenAI 訓練的智能體僅憑一次人類示範,便在《Montezuma’s Revenge》取得 74,500 分,超越此前所有已發表結果。智能體從示範中挑選的狀態開始連續遊玩多局,並以 PPO 優化遊戲分數;PPO 亦是支撐 OpenAI Five 的強化學習算法。

來源:OpenAI News · openai.com