OpenAI 以人類反饋訓練更擅長摘要的語言模型
OpenAI 將人類反饋強化學習用於訓練語言模型,以提升模型的摘要能力。
推薦理由:這項研究把人類反饋納入摘要模型訓練,呈現以強化學習提升語言模型摘要能力的一條具體研究路徑。
OpenAI 的全部動態:GPT 系列模型、ChatGPT 與 Sora 產品、公司戰略與人事的持續追蹤。
OpenAI 將人類反饋強化學習用於訓練語言模型,以提升模型的摘要能力。
推薦理由:這項研究把人類反饋納入摘要模型訓練,呈現以強化學習提升語言模型摘要能力的一條具體研究路徑。
OpenAI 發佈 API,供存取其開發的新 AI 模型。
OpenAI 發佈 Jukebox,這是一個能以原始音訊形式生成多種曲風及藝人風格音樂的神經網絡模型,也能生成初階演唱。OpenAI 同時公開模型權重、程式碼,以及用於探索生成樣本的工具。
推薦理由:權重與程式碼連同樣本探索工具一併公開,讓讀者可直接接觸模型資源,並瞭解其生成涵蓋多種曲風、藝人風格及初階演唱。
OpenAI 宣佈將其深度學習框架統一採用 PyTorch。
推薦理由:這項公告提供 OpenAI 深度學習框架選擇的背景,並明確指出其組織方向是統一採用 PyTorch。
OpenAI 的研究指出,雙重下降現象會出現在 CNN、ResNet 和 Transformer 中。隨模型規模、數據量或訓練時間增加,性能會先改善、再變差,然後再次改善。這種情況常可透過謹慎的正則化避免,但其成因尚未完全理解,後續研究仍是重要方向。
推薦理由:研究在 CNN、ResNet 與 Transformer 中觀察到雙重下降,並指出性能會隨模型規模、數據量或訓練時間增加而先升、再降、再升。
OpenAI 發佈 GPT-2 分階段發布的最後一版,亦是參數量 1.5B 的最大版本,並提供可協助檢測 GPT-2 模型輸出的程式碼與模型權重。雖然自 8 月起已有更大型語言模型發布,OpenAI 仍按原計劃完成分階段發布,希望將完整流程作為未來強大模型開發者的測試案例。OpenAI 亦表示持續與 AI 社羣討論負責任發布。
推薦理由:這次發布把 GPT-2 的分階段公開流程作為後續強大模型發布的測試案例,也説明提供程式碼與權重的用途是協助檢測模型輸出。
OpenAI 訓練兩個神經網絡,讓仿人機械手解開魔方。網絡完全在模擬環境中訓練,使用與 OpenAI Five 相同的強化學習程式碼,並結合新技術 Automatic Domain Randomization(ADR)。系統能應對訓練中未曾遇到的情況,例如被毛絨長頸鹿玩偶戳碰;OpenAI 指出,這展示了強化學習可用於需要前所未有靈巧度的現實世界問題。
推薦理由:這項工作以全程模擬訓練的兩個神經網絡讓仿人機械手解魔方,並用 ADR 應對訓練中未見情況,呈現強化學習應用於實體操作的方法。
OpenAI 使用人類回饋微調 774M 參數的 GPT-2,使模型在多項任務上匹配外部人類標註者的偏好。摘要任務需 60k 個人類標註,標註者偏好整句照抄輸入,模型因此學會複製;多種風格的續寫任務則需 5k 標註。OpenAI 指出,標註者的偏好並不總與自身一致,並希望藉由讓安全技術更接近「機器與人交談」的一般任務,提取人類價值資訊。
推薦理由:這項實驗對比摘要與續寫任務的標註需求,並呈現標註者偏好整句照抄輸入時,微調模型也會學會相同行為。
OpenAI 發佈 774 million 參數的 GPT-2 語言模型,接續 2 月推出的 124M 小型版及 5 月分階段發佈的 355M 中型版。OpenAI 與合作夥伴及 AI 社羣研究模型可能遭濫用及帶來社會效益。OpenAI 亦發佈開源法律協議,方便組織之間建立模型共享合作,並公佈一份關於與更廣泛 AI 研究社羣協調發表規範經驗的技術報告。
推薦理由:從 124M、355M 到 774 million 參數模型的分階段發佈,連同模型共享協議和發表規範協調經驗,呈現 GPT-2 後續開放與社羣協作的脈絡。
Microsoft 向 OpenAI 投資 $1 billion,並合作在 Microsoft Azure 建設可擴展至 AGI 的硬件與軟件平台。雙方將共同開發新的 Azure AI 超級計算技術,Microsoft 亦會成為 OpenAI 的獨家雲端供應商。雙方還將共同進一步擴展 Microsoft Azure 支援大規模 AI 系統的能力。
推薦理由:這項合作涵蓋投資、Azure AI 超級計算技術開發與獨家雲端供應,呈現 OpenAI 建設 AGI 平台所涉及的資金、技術與雲端合作安排。
OpenAI 創建 MuseNet,這個深度神經網絡可生成長達 4 分鐘、使用 10 種樂器的樂曲,並融合從鄉村音樂到 Mozart、The Beatles 的風格。
推薦理由:MuseNet 以數十萬個 MIDI 檔案的下一個 token 預測學習和聲、節奏與風格模式,並沿用 GPT-2 的通用無監督技術,呈現其音樂生成方法。
OpenAI Five 在本週末的 Finals 連續贏下兩場比賽,擊敗《Dota 2》世界冠軍隊伍 OG,成為首個在電競遊戲中戰勝世界冠軍的 AI。OpenAI Five 與 DeepMind 的 AlphaStar 此前都曾私下擊敗實力不俗的職業選手,但在直播職業賽中落敗;這也是 AI 首次在直播中擊敗電競職業選手。
推薦理由:OpenAI Five 與 AlphaStar 此前曾私下擊敗實力不俗的職業選手、卻在直播職業賽落敗,這次戰果因此有了清楚的賽事對照背景。
OpenAI 設立新公司 OpenAI LP,並將其定位為採利潤上限模式的公司。此安排旨在加快對算力和人才的投資,同時設置制衡機制以實踐使命。
推薦理由:這項安排把擴大算力與人才投資的目標,與落實使命所需的制衡機制並置,呈現 OpenAI LP 的組織設計思路。
OpenAI 訓練出一個大型無監督語言模型,可生成連貫段落,並在多項語言建模基準上取得最先進表現。該模型無需針對特定任務訓練,亦能進行初步閲讀理解、機器翻譯、問答和摘要。
推薦理由:它把語言建模基準表現與閲讀理解、翻譯、問答和摘要能力集中在同一個無需針對特定任務訓練的模型中,呈現大型無監督語言模型的能力範圍。
OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。
推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。
OpenAI Five 本週在温哥華舉行的 The International 2018 中,對陣頂尖 Dota 2 選手兩場皆敗。兩場比賽的前 20–35 分鐘,OpenAI Five 都維持不錯的獲勝機會。
推薦理由:兩局的時間進程呈現出 OpenAI Five 對陣頂尖 Dota 2 選手時的賽場表現,前 20–35 分鐘仍保持不錯勝算,最終均告落敗。
OpenAI Five 昨日以三局兩勝制擊敗一隊排名位於第 99.95 百分位的 Dota 玩家。對手是 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾職業參與 Dota;比賽有現場觀眾,直播同時有 100,000 名觀眾觀看。
推薦理由:這場三局兩勝賽呈現 OpenAI Five 對陣 99.95 百分位 Dota 玩家時的直接結果,亦交代對手中有四人曾以職業身份參與 Dota。
OpenAI Five 是由五個神經網絡組成的團隊,已開始在 Dota 2 中擊敗業餘人類隊伍。
推薦理由:這則消息把 OpenAI Five 放在與 Dota 2 業餘人類隊伍對戰的場景中呈現,讀者可從勝負結果理解其神經網絡團隊的遊玩表現。
OpenAI 發佈 Gym Retro 完整版本,這是一個以遊戲進行強化學習研究的平台。平台公開遊戲數量由約 70 款 Atari 遊戲和 30 款 Sega 遊戲,增至涵蓋多種模擬器的 1,000 多款。OpenAI 亦發佈了用於向平台新增遊戲的工具。
推薦理由:Gym Retro 的公開遊戲數量由約 70 款 Atari 遊戲和 30 款 Sega 遊戲擴至多種模擬器上的 1,000 多款,新增遊戲工具亦交代平台擴充遊戲集合的方式。
OpenAI 發佈分析指出,自 2012 年起,最大規模 AI 訓練所用算力以 3.4 個月的週期翻倍。同期該指標增長逾 300,000 倍;相比之下,Moore’s Law 的翻倍週期為 2 年,按此週期只會增長 7 倍。OpenAI 指出,算力改進是 AI 進步的重要組成部分;若趨勢延續,應預備面對能力遠超今日的系統所帶來的影響。
推薦理由:文中以大型 AI 訓練算力的 3.4 個月翻倍週期對照 Moore’s Law 的 2 年週期,並量化自 2012 年以來逾 300,000 倍的增長。