OpenAI News·· 2017-07-20精選AI 評分71
OpenAI 發佈近端策略優化(PPO)強化學習算法
Proximal Policy Optimization
AI 導讀
OpenAI 發佈近端策略優化(PPO),一類強化學習算法,其表現可媲美或優於最先進方法,同時更易實作和調校。OpenAI 表示,PPO 因易用且表現良好,已成為其預設的強化學習算法。
推薦理由
材料比較 PPO 與前沿方法的表現,並交代較簡單的實作和調校如何與良好性能共同構成 OpenAI 採用它作為預設算法的理由。
來源:OpenAI News · openai.com