OpenAI 發佈 Procgen Benchmark,提供 16 個程序生成環境
OpenAI 發佈 Procgen Benchmark,提供 16 個易於使用的程序生成環境。該基準用於直接衡量強化學習智能體學習可泛化技能的速度。
OpenAI 發佈 Procgen Benchmark,提供 16 個易於使用的程序生成環境。該基準用於直接衡量強化學習智能體學習可泛化技能的速度。
OpenAI 觀察到,智能體在簡單的捉迷藏遊戲中逐步發展出更複雜的工具使用方式。透過在新的模擬捉迷藏環境中訓練,智能體形成了六種不同策略及反制策略,其中一些是研究者此前不知道環境能支援的。這種簡單環境中自監督下湧現的複雜性,進一步暗示多智能體共同適應未來或能產生極其複雜且智能的行為。
OpenAI 發佈 Neural MMO,這是一個供強化學習智能體使用的大規模多智能體遊戲環境。平台支援在持續且開放式任務中容納數量龐大且可變的智能體。眾多智能體與物種的加入可帶來更佳探索、分化的生態位形成,以及更高的整體能力。
OpenAI 發佈 CoinRun 訓練環境,為智能體將經驗遷移至新情境的能力提供量化指標,並已協助釐清強化學習中一項長期存在的難題。CoinRun 比 Sonic the Hedgehog 等傳統平台遊戲簡單,但仍為最先進算法帶來具挑戰性的泛化考驗。
OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。
推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。
OpenAI Five 昨日以三局兩勝制擊敗一隊排名位於第 99.95 百分位的 Dota 玩家。對手是 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾職業參與 Dota;比賽有現場觀眾,直播同時有 100,000 名觀眾觀看。
推薦理由:這場三局兩勝賽呈現 OpenAI Five 對陣 99.95 百分位 Dota 玩家時的直接結果,亦交代對手中有四人曾以職業身份參與 Dota。
OpenAI Five Benchmark 對賽現已結束;公告確認比賽完結,但未列出賽果、比分或其他賽事資訊。
OpenAI 訓練的智能體僅憑一次人類示範,便在《Montezuma’s Revenge》取得 74,500 分,超越此前所有已發表結果。智能體從示範中挑選的狀態開始連續遊玩多局,並以 PPO 優化遊戲分數;PPO 亦是支撐 OpenAI Five 的強化學習算法。
OpenAI Five 是由五個神經網絡組成的團隊,已開始在 Dota 2 中擊敗業餘人類隊伍。
推薦理由:這則消息把 OpenAI Five 放在與 Dota 2 業餘人類隊伍對戰的場景中呈現,讀者可從勝負結果理解其神經網絡團隊的遊玩表現。
OpenAI 提出一種 AI 安全技術,透過訓練智能體互相辯論議題,再由人類判定勝方。
OpenAI 開發出一種階層式強化學習演算法,可學習適用於多種任務的高層動作,並快速解決需要數千個時間步的任務。應用於一組導航問題時,演算法會發現可朝不同方向行走和爬行的高層動作,令智能體能迅速掌握新的導航任務。
OpenAI 發佈 LOLA(Learning with Opponent-Learning Awareness)演算法,讓智能體將其他智能體也在學習納入考量。它在重複囚徒困境中找出以自身利益為先、同時具合作性的策略,例如以牙還牙。這是朝能建模其他心智的智能體邁出的一小步。
OpenAI 的 Dota 2 系統在一個月內由勉強匹敵高排名玩家,提升至擊敗頂尖職業選手,之後仍持續進步。OpenAI 表示,在算力充足時,自我對弈可令機器學習系統由遠低於人類水平提升至超越人類水平。相較之下,監督式深度學習系統的表現受限於訓練數據集,而自我對弈的可用數據會隨智能體能力提升而自動改善。
推薦理由:文章以 Dota 2 系統的進展對比自我對弈與監督式學習,説明自我對弈的可用數據會隨智能體變強而自動改善。
OpenAI 開發的 Dota 2 機械人在遵循標準賽事規則的 1v1 對局中擊敗世界頂尖職業選手。機械人從零開始透過自我對弈學習,沒有使用模仿學習或樹搜索。OpenAI 將此視為朝建立能在涉及真實人類的混亂複雜情境中完成明確目標的 AI 系統邁出的一步。
推薦理由:這則公告同時交代對局成果與訓練方式,呈現自我對弈在規則明確、局勢複雜且有人類參與的遊戲環境中的應用。
OpenAI 指出,多智能體環境是邁向 AGI 的踏腳石,智能體可在資源競爭中學習合作、競爭與溝通。這類環境形成自然課程,難度由競爭者的技能決定;與自身複製體競爭時,難度恰好匹配自身技能。環境沒有穩定均衡,持續帶來變得更聰明的壓力,而要有效應對仍需更多研究。