OpenAI 創建 MuseNet 音樂生成模型
OpenAI 創建 MuseNet,這個深度神經網絡可生成長達 4 分鐘、使用 10 種樂器的樂曲,並融合從鄉村音樂到 Mozart、The Beatles 的風格。
推薦理由:MuseNet 以數十萬個 MIDI 檔案的下一個 token 預測學習和聲、節奏與風格模式,並沿用 GPT-2 的通用無監督技術,呈現其音樂生成方法。
OpenAI 創建 MuseNet,這個深度神經網絡可生成長達 4 分鐘、使用 10 種樂器的樂曲,並融合從鄉村音樂到 Mozart、The Beatles 的風格。
推薦理由:MuseNet 以數十萬個 MIDI 檔案的下一個 token 預測學習和聲、節奏與風格模式,並沿用 GPT-2 的通用無監督技術,呈現其音樂生成方法。
OpenAI 開發了 Sparse Transformer,這種深度神經網絡在預測文字、圖像或聲音序列中的下一項內容方面創下新紀錄。它改進了注意力機制算法,能從長度達此前可處理上限 30x 的序列中提取模式。
OpenAI Five 在本週末的 Finals 連續贏下兩場比賽,擊敗《Dota 2》世界冠軍隊伍 OG,成為首個在電競遊戲中戰勝世界冠軍的 AI。OpenAI Five 與 DeepMind 的 AlphaStar 此前都曾私下擊敗實力不俗的職業選手,但在直播職業賽中落敗;這也是 AI 首次在直播中擊敗電競職業選手。
推薦理由:OpenAI Five 與 AlphaStar 此前曾私下擊敗實力不俗的職業選手、卻在直播職業賽落敗,這次戰果因此有了清楚的賽事對照背景。
OpenAI 在能量模型的穩定、可擴展訓練方面取得進展,生成樣本品質與泛化能力均優於現有模型。能量模型生成時會投入更多計算資源持續精煉結果,在低温下可生成與 GANs 相競爭的樣本,同時具備似然模型的模式覆蓋保證。
OpenAI Scholars 2019 的 8 名學者從 550 名申請者中選出。他們的專長涵蓋文學、哲學、細胞生物學、統計學、經濟學、量子物理及商業創新。
OpenAI 設立新公司 OpenAI LP,並將其定位為採利潤上限模式的公司。此安排旨在加快對算力和人才的投資,同時設置制衡機制以實踐使命。
推薦理由:這項安排把擴大算力與人才投資的目標,與落實使命所需的制衡機制並置,呈現 OpenAI LP 的組織設計思路。
OpenAI 與 Google 研究人員合作創建 Activation Atlases,這是一種用於視覺化神經元之間的互動能表徵甚麼的新技術。隨着 AI 系統部署於愈來愈敏感的情境,更深入瞭解其內部決策過程有助識別弱點並調查失效。
OpenAI 發佈 Neural MMO,這是一個供強化學習智能體使用的大規模多智能體遊戲環境。平台支援在持續且開放式任務中容納數量龐大且可變的智能體。眾多智能體與物種的加入可帶來更佳探索、分化的生態位形成,以及更高的整體能力。
OpenAI 於 2 月 2 日舉行首場 Spinning Up Workshop,作為其新教育計劃的一部分。工作坊聚焦深度強化學習。
OpenAI 撰寫論文,主張長期 AI 安全研究需要社會科學家,確保 AI 對齊算法在涉及真實人類時奏效。論文指出,讓先進 AI 系統與人類價值觀對齊,須處理人類理性、情緒與偏見心理學上的諸多不確定性;OpenAI 計劃聘請社會科學家全職投入相關工作,並促進機器學習與社會科學研究人員合作。
OpenAI 訓練出一個大型無監督語言模型,可生成連貫段落,並在多項語言建模基準上取得最先進表現。該模型無需針對特定任務訓練,亦能進行初步閲讀理解、機器翻譯、問答和摘要。
推薦理由:它把語言建模基準表現與閲讀理解、翻譯、問答和摘要能力集中在同一個無需針對特定任務訓練的模型中,呈現大型無監督語言模型的能力範圍。
OpenAI Fellows 首屆學員已完成為期 6 個月的學徒計劃,每位學員由機器學習初學者成長為 OpenAI 核心貢獻者。
OpenAI 發現,梯度噪聲尺度這一簡單統計指標,能預測神經網絡訓練在多種任務上的並行化能力。由於複雜任務的梯度往往更嘈雜,日後愈來愈大的批次大小或將派上用場,移除 AI 系統進一步擴展的一項潛在限制。研究亦指出,神經網絡訓練可以規範化、系統化,而非神秘技藝。
OpenAI 發佈 CoinRun 訓練環境,為智能體將經驗遷移至新情境的能力提供量化指標,並已協助釐清強化學習中一項長期存在的難題。CoinRun 比 Sonic the Hedgehog 等傳統平台遊戲簡單,但仍為最先進算法帶來具挑戰性的泛化考驗。
OpenAI 推出 Spinning Up in Deep RL,這是一套旨在讓任何人學習成為深度強化學習熟練實踐者的教育資源。內容包括清晰易明的 RL 程式碼範例、教學練習、文件及教學指南。
OpenAI 開發出能量模型,僅需五次示範便能學習以 2D 點集表示的概念,並識別及生成其實例。模型亦能將在 2D 粒子環境中學到的概念遷移至 3D 物理機械人任務。
OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。
推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。
OpenAI 提出迭代放大這項 AI 安全技術,用來指定超出人類規模的複雜行為與目標。方法是示範如何把任務拆解為較簡單的子任務,而非提供標註資料或獎勵函數。這項構想仍處於非常早期階段,目前只在簡單的玩具演算法領域完成實驗;OpenAI 認為它可能成為可擴展的 AI 安全方法。
OpenAI 現正接受 OpenAI Scholars 2019 第二屆計劃申請。計劃向來自代表性不足羣體的人士提供 6–10 份津貼及指導,讓他們全職研習深度學習 3 個月並開源一個專案。
OpenAI Scholars 2018 首屆學員已完成計劃,內容聚焦該屆學員的最終項目。
OpenAI Five 本週在温哥華舉行的 The International 2018 中,對陣頂尖 Dota 2 選手兩場皆敗。兩場比賽的前 20–35 分鐘,OpenAI Five 都維持不錯的獲勝機會。
推薦理由:兩局的時間進程呈現出 OpenAI Five 對陣頂尖 Dota 2 選手時的賽場表現,前 20–35 分鐘仍保持不錯勝算,最終均告落敗。
OpenAI Five 昨日以三局兩勝制擊敗一隊排名位於第 99.95 百分位的 Dota 玩家。對手是 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾職業參與 Dota;比賽有現場觀眾,直播同時有 100,000 名觀眾觀看。
推薦理由:這場三局兩勝賽呈現 OpenAI Five 對陣 99.95 百分位 Dota 玩家時的直接結果,亦交代對手中有四人曾以職業身份參與 Dota。
OpenAI 訓練出一隻仿人機械手,能以前所未有的靈巧度操控實體物件。
OpenAI 首屆 Scholars 班已展開,參與者是一羣資深軟件開發者,正轉型為機器學習從業者。公眾現可跟進這批學員的進程。
OpenAI Five Benchmark 對賽現已結束;公告確認比賽完結,但未列出賽果、比分或其他賽事資訊。
OpenAI 提出 Glow,一種使用可逆 1x1 卷積的生成模型,延伸既有可逆生成模型並簡化架構。Glow 可生成逼真的高解像度圖像、支援高效採樣,並發現可用於操控數據屬性的特徵;OpenAI 同時釋出模型程式碼和線上視覺化工具,供人探索及延續相關成果。
OpenAI 訓練的智能體僅憑一次人類示範,便在《Montezuma’s Revenge》取得 74,500 分,超越此前所有已發表結果。智能體從示範中挑選的狀態開始連續遊玩多局,並以 PPO 優化遊戲分數;PPO 亦是支撐 OpenAI Five 的強化學習算法。
OpenAI 使用 PPO 訓練由 5 個智能體組成的 Dota 隊伍,讓它們擊敗半職業玩家。訓練未使用人類對局,團隊設計獎勵函數後,智能體透過自我對弈學習;對陣兩週前的智能體,勝率為 90-95%。Sam Altman 認為,深度強化學習可在計算規模足夠、模擬環境能刻畫目標問題時處理極難問題,這也是通往通用智能的一步。
OpenAI Five 是由五個神經網絡組成的團隊,已開始在 Dota 2 中擊敗業餘人類隊伍。
推薦理由:這則消息把 OpenAI Five 放在與 Dota 2 業餘人類隊伍對戰的場景中呈現,讀者可從勝負結果理解其神經網絡團隊的遊玩表現。
OpenAI 已完成 Retro Contest 首輪賽事。競賽探索能從過往經驗中泛化的算法開發,文中未列出具體賽果。
OpenAI 現正接受下一屆 OpenAI Fellows 計劃的申請,該計劃提供在 OpenAI 進行 AI 研究的 6 個月有薪學徒培訓。
OpenAI 發佈 Gym Retro 完整版本,這是一個以遊戲進行強化學習研究的平台。平台公開遊戲數量由約 70 款 Atari 遊戲和 30 款 Sega 遊戲,增至涵蓋多種模擬器的 1,000 多款。OpenAI 亦發佈了用於向平台新增遊戲的工具。
推薦理由:Gym Retro 的公開遊戲數量由約 70 款 Atari 遊戲和 30 款 Sega 遊戲擴至多種模擬器上的 1,000 多款,新增遊戲工具亦交代平台擴充遊戲集合的方式。
OpenAI 發佈分析指出,自 2012 年起,最大規模 AI 訓練所用算力以 3.4 個月的週期翻倍。同期該指標增長逾 300,000 倍;相比之下,Moore’s Law 的翻倍週期為 2 年,按此週期只會增長 7 倍。OpenAI 指出,算力改進是 AI 進步的重要組成部分;若趨勢延續,應預備面對能力遠超今日的系統所帶來的影響。
推薦理由:文中以大型 AI 訓練算力的 3.4 個月翻倍週期對照 Moore’s Law 的 2 年週期,並量化自 2012 年以來逾 300,000 倍的增長。
OpenAI 提出一種 AI 安全技術,透過訓練智能體互相辯論議題,再由人類判定勝方。
OpenAI 發佈名為 Evolved Policy Gradients 的實驗性元學習方法,透過演化學習智能體的損失函數,讓智能體可在新任務上快速訓練。採用 EPG 訓練的智能體在測試時能完成訓練範圍以外的基本任務,例如前往訓練時放在房間另一側的物件。
OpenAI 推出遷移學習競賽,衡量強化學習算法能否從過往經驗中泛化。
OpenAI 於 3 月 3 日舉辦首場黑客松,與人工智能社羣的 100 名成員一同參與。
OpenAI 開發了 Reptile,一種可擴展的元學習演算法:反覆抽樣任務並執行隨機梯度下降,再把初始參數朝該任務學得的最終參數更新。Reptile 是 Shortest Descent 演算法在元學習中的應用,數學上類似一階 MAML,只需黑盒存取 SGD 或 Adam 等優化器,計算效率與表現亦與一階 MAML 相近。
OpenAI Scholars 為來自代表性不足羣體的人士提供 6–10 份津貼及導師指導,支持他們全職研習深度學習 3 個月。參與者並會開源一個項目。
OpenAI 發佈 8 個機械人模擬環境,以及 Hindsight Experience Replay 的 Baselines 實作,這些資源均為其過去一年的研究開發成果。OpenAI 曾用這些環境訓練可在實體機械人上運作的模型,並同時發佈一組機械人研究需求。