OpenAI 如何擴展 AI 訓練規模
OpenAI 發現,梯度噪聲尺度這一簡單統計指標,能預測神經網絡訓練在多種任務上的並行化能力。由於複雜任務的梯度往往更嘈雜,日後愈來愈大的批次大小或將派上用場,移除 AI 系統進一步擴展的一項潛在限制。研究亦指出,神經網絡訓練可以規範化、系統化,而非神秘技藝。
OpenAI 發現,梯度噪聲尺度這一簡單統計指標,能預測神經網絡訓練在多種任務上的並行化能力。由於複雜任務的梯度往往更嘈雜,日後愈來愈大的批次大小或將派上用場,移除 AI 系統進一步擴展的一項潛在限制。研究亦指出,神經網絡訓練可以規範化、系統化,而非神秘技藝。
OpenAI 發佈 CoinRun 訓練環境,為智能體將經驗遷移至新情境的能力提供量化指標,並已協助釐清強化學習中一項長期存在的難題。CoinRun 比 Sonic the Hedgehog 等傳統平台遊戲簡單,但仍為最先進算法帶來具挑戰性的泛化考驗。
OpenAI 開發出能量模型,僅需五次示範便能學習以 2D 點集表示的概念,並識別及生成其實例。模型亦能將在 2D 粒子環境中學到的概念遷移至 3D 物理機械人任務。
OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。
推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。
OpenAI 提出迭代放大這項 AI 安全技術,用來指定超出人類規模的複雜行為與目標。方法是示範如何把任務拆解為較簡單的子任務,而非提供標註資料或獎勵函數。這項構想仍處於非常早期階段,目前只在簡單的玩具演算法領域完成實驗;OpenAI 認為它可能成為可擴展的 AI 安全方法。
OpenAI 訓練出一隻仿人機械手,能以前所未有的靈巧度操控實體物件。
OpenAI 提出 Glow,一種使用可逆 1x1 卷積的生成模型,延伸既有可逆生成模型並簡化架構。Glow 可生成逼真的高解像度圖像、支援高效採樣,並發現可用於操控數據屬性的特徵;OpenAI 同時釋出模型程式碼和線上視覺化工具,供人探索及延續相關成果。
OpenAI 訓練的智能體僅憑一次人類示範,便在《Montezuma’s Revenge》取得 74,500 分,超越此前所有已發表結果。智能體從示範中挑選的狀態開始連續遊玩多局,並以 PPO 優化遊戲分數;PPO 亦是支撐 OpenAI Five 的強化學習算法。
OpenAI 使用 PPO 訓練由 5 個智能體組成的 Dota 隊伍,讓它們擊敗半職業玩家。訓練未使用人類對局,團隊設計獎勵函數後,智能體透過自我對弈學習;對陣兩週前的智能體,勝率為 90-95%。Sam Altman 認為,深度強化學習可在計算規模足夠、模擬環境能刻畫目標問題時處理極難問題,這也是通往通用智能的一步。
OpenAI 已完成 Retro Contest 首輪賽事。競賽探索能從過往經驗中泛化的算法開發,文中未列出具體賽果。
OpenAI 提出一種 AI 安全技術,透過訓練智能體互相辯論議題,再由人類判定勝方。
OpenAI 發佈名為 Evolved Policy Gradients 的實驗性元學習方法,透過演化學習智能體的損失函數,讓智能體可在新任務上快速訓練。採用 EPG 訓練的智能體在測試時能完成訓練範圍以外的基本任務,例如前往訓練時放在房間另一側的物件。
OpenAI 推出遷移學習競賽,衡量強化學習算法能否從過往經驗中泛化。
OpenAI 開發了 Reptile,一種可擴展的元學習演算法:反覆抽樣任務並執行隨機梯度下降,再把初始參數朝該任務學得的最終參數更新。Reptile 是 Shortest Descent 演算法在元學習中的應用,數學上類似一階 MAML,只需黑盒存取 SGD 或 Adam 等優化器,計算效率與表現亦與一階 MAML 相近。
OpenAI 與多個研究機構合著論文,預測惡意行為者可能如何濫用 AI 技術,並探討防止及減輕相關威脅的方法。
OpenAI 設計了一種透過教學實現可解釋機器學習的方法,讓 AI 以人類也能理解的示例互相教學。該方法會自動挑選最具資訊量的示例來教授概念,例如用最合適的圖片説明「狗」的概念。實驗結果顯示,該方法能有效教導 AI。
OpenAI 建立了一套系統,讓神經網絡判斷詞語是否屬於約 100 種自動發現的類型,藉此識別詞語所指的對象。這些類型並非互斥類別。
OpenAI 發佈新一批 7 個在其研究過程中出現的未解問題。
OpenAI 開發出一種階層式強化學習演算法,可學習適用於多種任務的高層動作,並快速解決需要數千個時間步的任務。應用於一組導航問題時,演算法會發現可朝不同方向行走和爬行的高層動作,令智能體能迅速掌握新的導航任務。
OpenAI 展示一種用於模擬機械人摔跤的元學習智能體,能迅速擊敗較強的非元學習智能體。該智能體亦能適應物理故障。
OpenAI 發佈 LOLA(Learning with Opponent-Learning Awareness)演算法,讓智能體將其他智能體也在學習納入考量。它在重複囚徒困境中找出以自身利益為先、同時具合作性的策略,例如以牙還牙。這是朝能建模其他心智的智能體邁出的一小步。
OpenAI 的 Dota 2 系統在一個月內由勉強匹敵高排名玩家,提升至擊敗頂尖職業選手,之後仍持續進步。OpenAI 表示,在算力充足時,自我對弈可令機器學習系統由遠低於人類水平提升至超越人類水平。相較之下,監督式深度學習系統的表現受限於訓練數據集,而自我對弈的可用數據會隨智能體能力提升而自動改善。
推薦理由:文章以 Dota 2 系統的進展對比自我對弈與監督式學習,説明自我對弈的可用數據會隨智能體變強而自動改善。
OpenAI 發現,在強化學習演算法的參數中加入自適應噪聲,往往能提升效能。這種探索方法簡單易實作,且極少令效能下降,因此值得在任何問題上嘗試。
OpenAI 發佈近端策略優化(PPO),一類強化學習算法,其表現可媲美或優於最先進方法,同時更易實作和調校。OpenAI 表示,PPO 因易用且表現良好,已成為其預設的強化學習算法。
推薦理由:材料比較 PPO 與前沿方法的表現,並交代較簡單的實作和調校如何與良好性能共同構成 OpenAI 採用它作為預設算法的理由。
OpenAI 製作出在不同尺度和視角下仍能可靠欺騙神經網絡分類器的圖像。這挑戰了上週一項説法,即自動駕駛汽車會因拍攝多種尺度、角度和視角的圖像而難以遭惡意欺騙。
OpenAI 與 DeepMind 安全團隊合作開發了一種演算法,透過人類判斷兩種候選行為何者較好,推斷人類想要甚麼。他們將減少人類撰寫目標函數的需要視為構建安全 AI 系統的一步,因以簡單代理目標代表複雜目標,或把目標設定得稍有偏差,都可能導致不良甚至危險行為。
推薦理由:材料呈現以人類比較兩種候選行為的回饋推斷其意願的演算法思路,並連結到降低複雜目標函數設定偏差的安全目標。
OpenAI 指出,多智能體環境是邁向 AGI 的踏腳石,智能體可在資源競爭中學習合作、競爭與溝通。這類環境形成自然課程,難度由競爭者的技能決定;與自身複製體競爭時,難度恰好匹配自身技能。環境沒有穩定均衡,持續帶來變得更聰明的壓力,而要有效應對仍需更多研究。
OpenAI 建立了一套機械人系統,完全在模擬環境中訓練後部署到實體機械人上,並能在看過一次任務示範後學會新任務。
OpenAI 開發了一套無監督系統,訓練時只需預測 Amazon 評論文本中的下一個字符,便學得出色的情感表徵。
OpenAI 發現,進化策略(ES)在 Atari/MuJoCo 等現代強化學習基準測試上的表現,可媲美標準強化學習方法。ES 同時能避開強化學習的多項不便之處。
OpenAI 與 Berkeley、Stanford 的研究人員共同署名由 Google Brain 研究人員主導的論文《Concrete Problems in AI Safety》。論文探討確保現代機器學習系統按預期運作所涉及的多項研究問題。
OpenAI 介紹四個以增強或運用生成式模型為共同主題的項目,並説明生成式模型的基本概念、重要性及可能發展方向。生成式模型是機器學習中的一類無監督學習技術。