OpenAI 以人類反饋訓練更擅長摘要的語言模型
OpenAI 將人類反饋強化學習用於訓練語言模型,以提升模型的摘要能力。
推薦理由:這項研究把人類反饋納入摘要模型訓練,呈現以強化學習提升語言模型摘要能力的一條具體研究路徑。
OpenAI 將人類反饋強化學習用於訓練語言模型,以提升模型的摘要能力。
推薦理由:這項研究把人類反饋納入摘要模型訓練,呈現以強化學習提升語言模型摘要能力的一條具體研究路徑。
OpenAI Scholars 第三屆學員在虛擬 Demo Day 展示最終項目。項目呈現了他們過去五個月的研究成果。
OpenAI 宣佈與 AIcrowd、Carnegie Mellon University 及 DeepMind 共同籌辦兩項 NeurIPS 2020 競賽,使用 Procgen Benchmark 和 MineRL。
OpenAI 發佈 API,供存取其開發的新 AI 模型。
OpenAI 發佈一項分析,指出自 2012 年起,達到相同 ImageNet 分類表現所需的神經網絡訓練計算量每 16 個月減半。與 2012 年相比,訓練至 AlexNet 水平所需的計算量已減少 44 倍,而 Moore’s Law 對應的成本改善為 11 倍。分析認為,對近期投入較多的 AI 任務,算法進展帶來的收益高於傳統硬件效率提升。
OpenAI 發佈 Jukebox,這是一個能以原始音訊形式生成多種曲風及藝人風格音樂的神經網絡模型,也能生成初階演唱。OpenAI 同時公開模型權重、程式碼,以及用於探索生成樣本的工具。
推薦理由:權重與程式碼連同樣本探索工具一併公開,讓讀者可直接接觸模型資源,並瞭解其生成涵蓋多種曲風、藝人風格及初階演唱。
OpenAI 參與一份由 30 個機構、58 位共同作者撰寫的報告,列出 10 項提升 AI 系統相關主張可驗證性的機制。開發者可藉此提供 AI 系統安全、具保安性、公平或保障私隱的證據;用户、政策制定者及公民社會則可用來評估 AI 開發流程。
OpenAI 推出 Microscope,收錄 8 個常用於可解釋性研究的視覺「模型生物」中每個重要層和神經元的可視化。這些可視化讓研究者更容易分析神經網絡內形成的特徵;OpenAI 希望它能協助研究界理解這些複雜系統。
OpenAI 宣佈將其深度學習框架統一採用 PyTorch。
推薦理由:這項公告提供 OpenAI 深度學習框架選擇的背景,並明確指出其組織方向是統一採用 PyTorch。
OpenAI 的研究指出,雙重下降現象會出現在 CNN、ResNet 和 Transformer 中。隨模型規模、數據量或訓練時間增加,性能會先改善、再變差,然後再次改善。這種情況常可透過謹慎的正則化避免,但其成因尚未完全理解,後續研究仍是重要方向。
推薦理由:研究在 CNN、ResNet 與 Transformer 中觀察到雙重下降,並指出性能會隨模型規模、數據量或訓練時間增加而先升、再降、再升。
OpenAI 發佈 Procgen Benchmark,提供 16 個易於使用的程序生成環境。該基準用於直接衡量強化學習智能體學習可泛化技能的速度。
OpenAI 推出 Safety Gym,這套環境與工具用於衡量強化學習智能體在訓練期間遵守安全約束的進展。
OpenAI 發佈 GPT-2 分階段發布的最後一版,亦是參數量 1.5B 的最大版本,並提供可協助檢測 GPT-2 模型輸出的程式碼與模型權重。雖然自 8 月起已有更大型語言模型發布,OpenAI 仍按原計劃完成分階段發布,希望將完整流程作為未來強大模型開發者的測試案例。OpenAI 亦表示持續與 AI 社羣討論負責任發布。
推薦理由:這次發布把 GPT-2 的分階段公開流程作為後續強大模型發布的測試案例,也説明提供程式碼與權重的用途是協助檢測模型輸出。
OpenAI 訓練兩個神經網絡,讓仿人機械手解開魔方。網絡完全在模擬環境中訓練,使用與 OpenAI Five 相同的強化學習程式碼,並結合新技術 Automatic Domain Randomization(ADR)。系統能應對訓練中未曾遇到的情況,例如被毛絨長頸鹿玩偶戳碰;OpenAI 指出,這展示了強化學習可用於需要前所未有靈巧度的現實世界問題。
推薦理由:這項工作以全程模擬訓練的兩個神經網絡讓仿人機械手解魔方,並用 ADR 應對訓練中未見情況,呈現強化學習應用於實體操作的方法。
OpenAI 現正接受第三屆 OpenAI Scholars 的申請。
OpenAI 使用人類回饋微調 774M 參數的 GPT-2,使模型在多項任務上匹配外部人類標註者的偏好。摘要任務需 60k 個人類標註,標註者偏好整句照抄輸入,模型因此學會複製;多種風格的續寫任務則需 5k 標註。OpenAI 指出,標註者的偏好並不總與自身一致,並希望藉由讓安全技術更接近「機器與人交談」的一般任務,提取人類價值資訊。
推薦理由:這項實驗對比摘要與續寫任務的標註需求,並呈現標註者偏好整句照抄輸入時,微調模型也會學會相同行為。
OpenAI 觀察到,智能體在簡單的捉迷藏遊戲中逐步發展出更複雜的工具使用方式。透過在新的模擬捉迷藏環境中訓練,智能體形成了六種不同策略及反制策略,其中一些是研究者此前不知道環境能支援的。這種簡單環境中自監督下湧現的複雜性,進一步暗示多智能體共同適應未來或能產生極其複雜且智能的行為。
OpenAI 開發出一種方法,用於評估神經網絡分類器能否可靠抵禦訓練期間未見的對抗攻擊。該方法提出新指標 UAR(Unforeseen Attack Robustness),評估單一模型面對未預期攻擊時的穩健性。OpenAI 指出,評估應涵蓋更多樣的未預見攻擊。
OpenAI 發佈 774 million 參數的 GPT-2 語言模型,接續 2 月推出的 124M 小型版及 5 月分階段發佈的 355M 中型版。OpenAI 與合作夥伴及 AI 社羣研究模型可能遭濫用及帶來社會效益。OpenAI 亦發佈開源法律協議,方便組織之間建立模型共享合作,並公佈一份關於與更廣泛 AI 研究社羣協調發表規範經驗的技術報告。
推薦理由:從 124M、355M 到 774 million 參數模型的分階段發佈,連同模型共享協議和發表規範協調經驗,呈現 GPT-2 後續開放與社羣協作的脈絡。
Microsoft 向 OpenAI 投資 $1 billion,並合作在 Microsoft Azure 建設可擴展至 AGI 的硬件與軟件平台。雙方將共同開發新的 Azure AI 超級計算技術,Microsoft 亦會成為 OpenAI 的獨家雲端供應商。雙方還將共同進一步擴展 Microsoft Azure 支援大規模 AI 系統的能力。
推薦理由:這項合作涵蓋投資、Azure AI 超級計算技術開發與獨家雲端供應,呈現 OpenAI 建設 AGI 平台所涉及的資金、技術與雲端合作安排。
OpenAI 的政策研究指出,AI 業界合作制定安全規範,是促進負責任 AI 開發、確保系統安全且有益的重要條件。研究提出四項現時可用的策略:溝通風險與效益、技術協作、提高透明度,以及激勵標準。但競爭壓力可能引發集體行動問題,令 AI 公司在安全方面投入不足。
OpenAI 於 2019 年 4 月 27 日舉辦首屆機械人研討會。
OpenAI Scholars 第二期已結束,八位學者均完成最終項目。所有項目均在 OpenAI 舉行的 Scholars Demo Day 上展示。
OpenAI Fellows 2018 年秋季班已完成為期 6 個月的學徒計劃,學員由機器學習初學者成長為 OpenAI 核心貢獻者。OpenAI 正以滾動方式審核下一輪 Summer 2019 OpenAI Fellows 的申請。
OpenAI 創建 MuseNet,這個深度神經網絡可生成長達 4 分鐘、使用 10 種樂器的樂曲,並融合從鄉村音樂到 Mozart、The Beatles 的風格。
推薦理由:MuseNet 以數十萬個 MIDI 檔案的下一個 token 預測學習和聲、節奏與風格模式,並沿用 GPT-2 的通用無監督技術,呈現其音樂生成方法。
OpenAI 開發了 Sparse Transformer,這種深度神經網絡在預測文字、圖像或聲音序列中的下一項內容方面創下新紀錄。它改進了注意力機制算法,能從長度達此前可處理上限 30x 的序列中提取模式。
OpenAI Five 在本週末的 Finals 連續贏下兩場比賽,擊敗《Dota 2》世界冠軍隊伍 OG,成為首個在電競遊戲中戰勝世界冠軍的 AI。OpenAI Five 與 DeepMind 的 AlphaStar 此前都曾私下擊敗實力不俗的職業選手,但在直播職業賽中落敗;這也是 AI 首次在直播中擊敗電競職業選手。
推薦理由:OpenAI Five 與 AlphaStar 此前曾私下擊敗實力不俗的職業選手、卻在直播職業賽落敗,這次戰果因此有了清楚的賽事對照背景。
OpenAI 在能量模型的穩定、可擴展訓練方面取得進展,生成樣本品質與泛化能力均優於現有模型。能量模型生成時會投入更多計算資源持續精煉結果,在低温下可生成與 GANs 相競爭的樣本,同時具備似然模型的模式覆蓋保證。
OpenAI Scholars 2019 的 8 名學者從 550 名申請者中選出。他們的專長涵蓋文學、哲學、細胞生物學、統計學、經濟學、量子物理及商業創新。
OpenAI 設立新公司 OpenAI LP,並將其定位為採利潤上限模式的公司。此安排旨在加快對算力和人才的投資,同時設置制衡機制以實踐使命。
推薦理由:這項安排把擴大算力與人才投資的目標,與落實使命所需的制衡機制並置,呈現 OpenAI LP 的組織設計思路。
OpenAI 與 Google 研究人員合作創建 Activation Atlases,這是一種用於視覺化神經元之間的互動能表徵甚麼的新技術。隨着 AI 系統部署於愈來愈敏感的情境,更深入瞭解其內部決策過程有助識別弱點並調查失效。
OpenAI 發佈 Neural MMO,這是一個供強化學習智能體使用的大規模多智能體遊戲環境。平台支援在持續且開放式任務中容納數量龐大且可變的智能體。眾多智能體與物種的加入可帶來更佳探索、分化的生態位形成,以及更高的整體能力。
OpenAI 於 2 月 2 日舉行首場 Spinning Up Workshop,作為其新教育計劃的一部分。工作坊聚焦深度強化學習。
OpenAI 撰寫論文,主張長期 AI 安全研究需要社會科學家,確保 AI 對齊算法在涉及真實人類時奏效。論文指出,讓先進 AI 系統與人類價值觀對齊,須處理人類理性、情緒與偏見心理學上的諸多不確定性;OpenAI 計劃聘請社會科學家全職投入相關工作,並促進機器學習與社會科學研究人員合作。
OpenAI 訓練出一個大型無監督語言模型,可生成連貫段落,並在多項語言建模基準上取得最先進表現。該模型無需針對特定任務訓練,亦能進行初步閲讀理解、機器翻譯、問答和摘要。
推薦理由:它把語言建模基準表現與閲讀理解、翻譯、問答和摘要能力集中在同一個無需針對特定任務訓練的模型中,呈現大型無監督語言模型的能力範圍。
OpenAI Fellows 首屆學員已完成為期 6 個月的學徒計劃,每位學員由機器學習初學者成長為 OpenAI 核心貢獻者。
OpenAI 發現,梯度噪聲尺度這一簡單統計指標,能預測神經網絡訓練在多種任務上的並行化能力。由於複雜任務的梯度往往更嘈雜,日後愈來愈大的批次大小或將派上用場,移除 AI 系統進一步擴展的一項潛在限制。研究亦指出,神經網絡訓練可以規範化、系統化,而非神秘技藝。
OpenAI 發佈 CoinRun 訓練環境,為智能體將經驗遷移至新情境的能力提供量化指標,並已協助釐清強化學習中一項長期存在的難題。CoinRun 比 Sonic the Hedgehog 等傳統平台遊戲簡單,但仍為最先進算法帶來具挑戰性的泛化考驗。
OpenAI 推出 Spinning Up in Deep RL,這是一套旨在讓任何人學習成為深度強化學習熟練實踐者的教育資源。內容包括清晰易明的 RL 程式碼範例、教學練習、文件及教學指南。
OpenAI 開發出能量模型,僅需五次示範便能學習以 2D 點集表示的概念,並識別及生成其實例。模型亦能將在 2D 粒子環境中學到的概念遷移至 3D 物理機械人任務。