OpenAI 以人類反饋訓練更擅長摘要的語言模型
OpenAI 將人類反饋強化學習用於訓練語言模型,以提升模型的摘要能力。
推薦理由:這項研究把人類反饋納入摘要模型訓練,呈現以強化學習提升語言模型摘要能力的一條具體研究路徑。
OpenAI 將人類反饋強化學習用於訓練語言模型,以提升模型的摘要能力。
推薦理由:這項研究把人類反饋納入摘要模型訓練,呈現以強化學習提升語言模型摘要能力的一條具體研究路徑。
OpenAI 發佈一項分析,指出自 2012 年起,達到相同 ImageNet 分類表現所需的神經網絡訓練計算量每 16 個月減半。與 2012 年相比,訓練至 AlexNet 水平所需的計算量已減少 44 倍,而 Moore’s Law 對應的成本改善為 11 倍。分析認為,對近期投入較多的 AI 任務,算法進展帶來的收益高於傳統硬件效率提升。
OpenAI 參與一份由 30 個機構、58 位共同作者撰寫的報告,列出 10 項提升 AI 系統相關主張可驗證性的機制。開發者可藉此提供 AI 系統安全、具保安性、公平或保障私隱的證據;用户、政策制定者及公民社會則可用來評估 AI 開發流程。
OpenAI 的研究指出,雙重下降現象會出現在 CNN、ResNet 和 Transformer 中。隨模型規模、數據量或訓練時間增加,性能會先改善、再變差,然後再次改善。這種情況常可透過謹慎的正則化避免,但其成因尚未完全理解,後續研究仍是重要方向。
推薦理由:研究在 CNN、ResNet 與 Transformer 中觀察到雙重下降,並指出性能會隨模型規模、數據量或訓練時間增加而先升、再降、再升。
OpenAI 訓練兩個神經網絡,讓仿人機械手解開魔方。網絡完全在模擬環境中訓練,使用與 OpenAI Five 相同的強化學習程式碼,並結合新技術 Automatic Domain Randomization(ADR)。系統能應對訓練中未曾遇到的情況,例如被毛絨長頸鹿玩偶戳碰;OpenAI 指出,這展示了強化學習可用於需要前所未有靈巧度的現實世界問題。
推薦理由:這項工作以全程模擬訓練的兩個神經網絡讓仿人機械手解魔方,並用 ADR 應對訓練中未見情況,呈現強化學習應用於實體操作的方法。
OpenAI 使用人類回饋微調 774M 參數的 GPT-2,使模型在多項任務上匹配外部人類標註者的偏好。摘要任務需 60k 個人類標註,標註者偏好整句照抄輸入,模型因此學會複製;多種風格的續寫任務則需 5k 標註。OpenAI 指出,標註者的偏好並不總與自身一致,並希望藉由讓安全技術更接近「機器與人交談」的一般任務,提取人類價值資訊。
推薦理由:這項實驗對比摘要與續寫任務的標註需求,並呈現標註者偏好整句照抄輸入時,微調模型也會學會相同行為。
OpenAI 觀察到,智能體在簡單的捉迷藏遊戲中逐步發展出更複雜的工具使用方式。透過在新的模擬捉迷藏環境中訓練,智能體形成了六種不同策略及反制策略,其中一些是研究者此前不知道環境能支援的。這種簡單環境中自監督下湧現的複雜性,進一步暗示多智能體共同適應未來或能產生極其複雜且智能的行為。
OpenAI 開發出一種方法,用於評估神經網絡分類器能否可靠抵禦訓練期間未見的對抗攻擊。該方法提出新指標 UAR(Unforeseen Attack Robustness),評估單一模型面對未預期攻擊時的穩健性。OpenAI 指出,評估應涵蓋更多樣的未預見攻擊。
OpenAI 的政策研究指出,AI 業界合作制定安全規範,是促進負責任 AI 開發、確保系統安全且有益的重要條件。研究提出四項現時可用的策略:溝通風險與效益、技術協作、提高透明度,以及激勵標準。但競爭壓力可能引發集體行動問題,令 AI 公司在安全方面投入不足。
OpenAI 開發了 Sparse Transformer,這種深度神經網絡在預測文字、圖像或聲音序列中的下一項內容方面創下新紀錄。它改進了注意力機制算法,能從長度達此前可處理上限 30x 的序列中提取模式。
OpenAI 在能量模型的穩定、可擴展訓練方面取得進展,生成樣本品質與泛化能力均優於現有模型。能量模型生成時會投入更多計算資源持續精煉結果,在低温下可生成與 GANs 相競爭的樣本,同時具備似然模型的模式覆蓋保證。
OpenAI 與 Google 研究人員合作創建 Activation Atlases,這是一種用於視覺化神經元之間的互動能表徵甚麼的新技術。隨着 AI 系統部署於愈來愈敏感的情境,更深入瞭解其內部決策過程有助識別弱點並調查失效。
OpenAI 撰寫論文,主張長期 AI 安全研究需要社會科學家,確保 AI 對齊算法在涉及真實人類時奏效。論文指出,讓先進 AI 系統與人類價值觀對齊,須處理人類理性、情緒與偏見心理學上的諸多不確定性;OpenAI 計劃聘請社會科學家全職投入相關工作,並促進機器學習與社會科學研究人員合作。
OpenAI 發現,梯度噪聲尺度這一簡單統計指標,能預測神經網絡訓練在多種任務上的並行化能力。由於複雜任務的梯度往往更嘈雜,日後愈來愈大的批次大小或將派上用場,移除 AI 系統進一步擴展的一項潛在限制。研究亦指出,神經網絡訓練可以規範化、系統化,而非神秘技藝。
OpenAI 發佈 CoinRun 訓練環境,為智能體將經驗遷移至新情境的能力提供量化指標,並已協助釐清強化學習中一項長期存在的難題。CoinRun 比 Sonic the Hedgehog 等傳統平台遊戲簡單,但仍為最先進算法帶來具挑戰性的泛化考驗。
OpenAI 開發出能量模型,僅需五次示範便能學習以 2D 點集表示的概念,並識別及生成其實例。模型亦能將在 2D 粒子環境中學到的概念遷移至 3D 物理機械人任務。
OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。
推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。
OpenAI 提出迭代放大這項 AI 安全技術,用來指定超出人類規模的複雜行為與目標。方法是示範如何把任務拆解為較簡單的子任務,而非提供標註資料或獎勵函數。這項構想仍處於非常早期階段,目前只在簡單的玩具演算法領域完成實驗;OpenAI 認為它可能成為可擴展的 AI 安全方法。
OpenAI 訓練出一隻仿人機械手,能以前所未有的靈巧度操控實體物件。
OpenAI 提出 Glow,一種使用可逆 1x1 卷積的生成模型,延伸既有可逆生成模型並簡化架構。Glow 可生成逼真的高解像度圖像、支援高效採樣,並發現可用於操控數據屬性的特徵;OpenAI 同時釋出模型程式碼和線上視覺化工具,供人探索及延續相關成果。
OpenAI 訓練的智能體僅憑一次人類示範,便在《Montezuma’s Revenge》取得 74,500 分,超越此前所有已發表結果。智能體從示範中挑選的狀態開始連續遊玩多局,並以 PPO 優化遊戲分數;PPO 亦是支撐 OpenAI Five 的強化學習算法。
OpenAI 使用 PPO 訓練由 5 個智能體組成的 Dota 隊伍,讓它們擊敗半職業玩家。訓練未使用人類對局,團隊設計獎勵函數後,智能體透過自我對弈學習;對陣兩週前的智能體,勝率為 90-95%。Sam Altman 認為,深度強化學習可在計算規模足夠、模擬環境能刻畫目標問題時處理極難問題,這也是通往通用智能的一步。
OpenAI 發佈分析指出,自 2012 年起,最大規模 AI 訓練所用算力以 3.4 個月的週期翻倍。同期該指標增長逾 300,000 倍;相比之下,Moore’s Law 的翻倍週期為 2 年,按此週期只會增長 7 倍。OpenAI 指出,算力改進是 AI 進步的重要組成部分;若趨勢延續,應預備面對能力遠超今日的系統所帶來的影響。
推薦理由:文中以大型 AI 訓練算力的 3.4 個月翻倍週期對照 Moore’s Law 的 2 年週期,並量化自 2012 年以來逾 300,000 倍的增長。
OpenAI 發佈名為 Evolved Policy Gradients 的實驗性元學習方法,透過演化學習智能體的損失函數,讓智能體可在新任務上快速訓練。採用 EPG 訓練的智能體在測試時能完成訓練範圍以外的基本任務,例如前往訓練時放在房間另一側的物件。
OpenAI 開發了 Reptile,一種可擴展的元學習演算法:反覆抽樣任務並執行隨機梯度下降,再把初始參數朝該任務學得的最終參數更新。Reptile 是 Shortest Descent 演算法在元學習中的應用,數學上類似一階 MAML,只需黑盒存取 SGD 或 Adam 等優化器,計算效率與表現亦與一階 MAML 相近。
OpenAI 與多個研究機構合著論文,預測惡意行為者可能如何濫用 AI 技術,並探討防止及減輕相關威脅的方法。
OpenAI 設計了一種透過教學實現可解釋機器學習的方法,讓 AI 以人類也能理解的示例互相教學。該方法會自動挑選最具資訊量的示例來教授概念,例如用最合適的圖片説明「狗」的概念。實驗結果顯示,該方法能有效教導 AI。
OpenAI 建立了一套系統,讓神經網絡判斷詞語是否屬於約 100 種自動發現的類型,藉此識別詞語所指的對象。這些類型並非互斥類別。
OpenAI 發佈新一批 7 個在其研究過程中出現的未解問題。
OpenAI 開發出一種階層式強化學習演算法,可學習適用於多種任務的高層動作,並快速解決需要數千個時間步的任務。應用於一組導航問題時,演算法會發現可朝不同方向行走和爬行的高層動作,令智能體能迅速掌握新的導航任務。
OpenAI 展示一種用於模擬機械人摔跤的元學習智能體,能迅速擊敗較強的非元學習智能體。該智能體亦能適應物理故障。
OpenAI 發佈 LOLA(Learning with Opponent-Learning Awareness)演算法,讓智能體將其他智能體也在學習納入考量。它在重複囚徒困境中找出以自身利益為先、同時具合作性的策略,例如以牙還牙。這是朝能建模其他心智的智能體邁出的一小步。
OpenAI 的 Dota 2 系統在一個月內由勉強匹敵高排名玩家,提升至擊敗頂尖職業選手,之後仍持續進步。OpenAI 表示,在算力充足時,自我對弈可令機器學習系統由遠低於人類水平提升至超越人類水平。相較之下,監督式深度學習系統的表現受限於訓練數據集,而自我對弈的可用數據會隨智能體能力提升而自動改善。
推薦理由:文章以 Dota 2 系統的進展對比自我對弈與監督式學習,説明自我對弈的可用數據會隨智能體變強而自動改善。
OpenAI 發現,在強化學習演算法的參數中加入自適應噪聲,往往能提升效能。這種探索方法簡單易實作,且極少令效能下降,因此值得在任何問題上嘗試。
OpenAI 製作出在不同尺度和視角下仍能可靠欺騙神經網絡分類器的圖像。這挑戰了上週一項説法,即自動駕駛汽車會因拍攝多種尺度、角度和視角的圖像而難以遭惡意欺騙。
OpenAI 與 DeepMind 安全團隊合作開發了一種演算法,透過人類判斷兩種候選行為何者較好,推斷人類想要甚麼。他們將減少人類撰寫目標函數的需要視為構建安全 AI 系統的一步,因以簡單代理目標代表複雜目標,或把目標設定得稍有偏差,都可能導致不良甚至危險行為。
推薦理由:材料呈現以人類比較兩種候選行為的回饋推斷其意願的演算法思路,並連結到降低複雜目標函數設定偏差的安全目標。
OpenAI 指出,多智能體環境是邁向 AGI 的踏腳石,智能體可在資源競爭中學習合作、競爭與溝通。這類環境形成自然課程,難度由競爭者的技能決定;與自身複製體競爭時,難度恰好匹配自身技能。環境沒有穩定均衡,持續帶來變得更聰明的壓力,而要有效應對仍需更多研究。
OpenAI 開發了一套無監督系統,訓練時只需預測 Amazon 評論文本中的下一個字符,便學得出色的情感表徵。
OpenAI 發現,進化策略(ES)在 Atari/MuJoCo 等現代強化學習基準測試上的表現,可媲美標準強化學習方法。ES 同時能避開強化學習的多項不便之處。
OpenAI 與 Berkeley、Stanford 的研究人員共同署名由 Google Brain 研究人員主導的論文《Concrete Problems in AI Safety》。論文探討確保現代機器學習系統按預期運作所涉及的多項研究問題。