OpenAI News·· 2018-04-18AI 評分41
OpenAI 發佈 Evolved Policy Gradients 實驗性元學習方法
Evolved Policy Gradients
AI 導讀
OpenAI 發佈名為 Evolved Policy Gradients 的實驗性元學習方法,透過演化學習智能體的損失函數,讓智能體可在新任務上快速訓練。採用 EPG 訓練的智能體在測試時能完成訓練範圍以外的基本任務,例如前往訓練時放在房間另一側的物件。
來源:OpenAI News · openai.com