Sam Altman:Blog· Sam Altman·· 2018-06-26AI 評分70
OpenAI 用 PPO 訓練 5 個 Dota 智能體擊敗半職業玩家
Reinforcement Learning Progress
AI 導讀
OpenAI 使用 PPO 訓練由 5 個智能體組成的 Dota 隊伍,讓它們擊敗半職業玩家。訓練未使用人類對局,團隊設計獎勵函數後,智能體透過自我對弈學習;對陣兩週前的智能體,勝率為 90-95%。Sam Altman 認為,深度強化學習可在計算規模足夠、模擬環境能刻畫目標問題時處理極難問題,這也是通往通用智能的一步。
來源:Sam Altman:Blog · blog.samaltman.com