OpenAI 黑客松
OpenAI 邀請參加者於 3 月 3 日(星期六)到訪其位於三藩市 Mission District 的辦公室,參加演講及黑客松。
OpenAI 邀請參加者於 3 月 3 日(星期六)到訪其位於三藩市 Mission District 的辦公室,參加演講及黑客松。
OpenAI 表示,歡迎新捐助者加入,並對此感到欣喜。
OpenAI 與多個研究機構合著論文,預測惡意行為者可能如何濫用 AI 技術,並探討防止及減輕相關威脅的方法。
OpenAI 設計了一種透過教學實現可解釋機器學習的方法,讓 AI 以人類也能理解的示例互相教學。該方法會自動挑選最具資訊量的示例來教授概念,例如用最合適的圖片説明「狗」的概念。實驗結果顯示,該方法能有效教導 AI。
OpenAI 建立了一套系統,讓神經網絡判斷詞語是否屬於約 100 種自動發現的類型,藉此識別詞語所指的對象。這些類型並非互斥類別。
OpenAI 發佈新一批 7 個在其研究過程中出現的未解問題。
OpenAI 開發出一種階層式強化學習演算法,可學習適用於多種任務的高層動作,並快速解決需要數千個時間步的任務。應用於一組導航問題時,演算法會發現可朝不同方向行走和爬行的高層動作,令智能體能迅速掌握新的導航任務。
OpenAI 展示一種用於模擬機械人摔跤的元學習智能體,能迅速擊敗較強的非元學習智能體。該智能體亦能適應物理故障。
OpenAI 發佈 LOLA(Learning with Opponent-Learning Awareness)演算法,讓智能體將其他智能體也在學習納入考量。它在重複囚徒困境中找出以自身利益為先、同時具合作性的策略,例如以牙還牙。這是朝能建模其他心智的智能體邁出的一小步。
OpenAI 的 Dota 2 系統在一個月內由勉強匹敵高排名玩家,提升至擊敗頂尖職業選手,之後仍持續進步。OpenAI 表示,在算力充足時,自我對弈可令機器學習系統由遠低於人類水平提升至超越人類水平。相較之下,監督式深度學習系統的表現受限於訓練數據集,而自我對弈的可用數據會隨智能體能力提升而自動改善。
推薦理由:文章以 Dota 2 系統的進展對比自我對弈與監督式學習,説明自我對弈的可用數據會隨智能體變強而自動改善。
OpenAI 開發的 Dota 2 機械人在遵循標準賽事規則的 1v1 對局中擊敗世界頂尖職業選手。機械人從零開始透過自我對弈學習,沒有使用模仿學習或樹搜索。OpenAI 將此視為朝建立能在涉及真實人類的混亂複雜情境中完成明確目標的 AI 系統邁出的一步。
推薦理由:這則公告同時交代對局成果與訓練方式,呈現自我對弈在規則明確、局勢複雜且有人類參與的遊戲環境中的應用。
OpenAI 發現,在強化學習演算法的參數中加入自適應噪聲,往往能提升效能。這種探索方法簡單易實作,且極少令效能下降,因此值得在任何問題上嘗試。
OpenAI 發佈近端策略優化(PPO),一類強化學習算法,其表現可媲美或優於最先進方法,同時更易實作和調校。OpenAI 表示,PPO 因易用且表現良好,已成為其預設的強化學習算法。
推薦理由:材料比較 PPO 與前沿方法的表現,並交代較簡單的實作和調校如何與良好性能共同構成 OpenAI 採用它作為預設算法的理由。
OpenAI 製作出在不同尺度和視角下仍能可靠欺騙神經網絡分類器的圖像。這挑戰了上週一項説法,即自動駕駛汽車會因拍攝多種尺度、角度和視角的圖像而難以遭惡意欺騙。
OpenAI 與 DeepMind 安全團隊合作開發了一種演算法,透過人類判斷兩種候選行為何者較好,推斷人類想要甚麼。他們將減少人類撰寫目標函數的需要視為構建安全 AI 系統的一步,因以簡單代理目標代表複雜目標,或把目標設定得稍有偏差,都可能導致不良甚至危險行為。
推薦理由:材料呈現以人類比較兩種候選行為的回饋推斷其意願的演算法思路,並連結到降低複雜目標函數設定偏差的安全目標。
OpenAI 指出,多智能體環境是邁向 AGI 的踏腳石,智能體可在資源競爭中學習合作、競爭與溝通。這類環境形成自然課程,難度由競爭者的技能決定;與自身複製體競爭時,難度恰好匹配自身技能。環境沒有穩定均衡,持續帶來變得更聰明的壓力,而要有效應對仍需更多研究。
OpenAI 將內部項目 OpenAI Baselines 開源,目標是以與已發表結果相當的性能復現強化學習算法。首批發佈包含 DQN 及其三種變體,其他算法計劃在未來數月陸續釋出。
推薦理由:首批開源內容包括 DQN 及三種變體,可看出 OpenAI Baselines 的起始復現範圍;項目目標是讓強化學習算法達到與已發表結果相當的性能。
OpenAI 建立了一套機械人系統,完全在模擬環境中訓練後部署到實體機械人上,並能在看過一次任務示範後學會新任務。
OpenAI 發佈 Roboschool,這是一套與 OpenAI Gym 整合的開源機械人模擬軟件。
OpenAI 開發了一套無監督系統,訓練時只需預測 Amazon 評論文本中的下一個字符,便學得出色的情感表徵。
OpenAI 發現,進化策略(ES)在 Atari/MuJoCo 等現代強化學習基準測試上的表現,可媲美標準強化學習方法。ES 同時能避開強化學習的多項不便之處。
Distill 作為一種旨在優質傳達新穎或既有機器學習成果的新型期刊推出。
OpenAI 展示對抗樣本如何透過刻意設計的輸入令機器學習模型出錯,並説明其在不同媒介中的運作方式。這類輸入猶如機器的視覺錯覺;文章亦探討系統為何難以防範這類攻擊。
OpenAI 團隊現有 45 人,正透過驗證新構想、建立新軟件系統,以及在機械人上部署機器學習,推進 AI 能力前沿。
OpenAI 探討強化學習算法的一種失效模式:獎勵函數設定錯誤。強化學習算法可能以出人意料、違反直覺的方式失效。
OpenAI 發佈 Universe,這是一個在全球各類遊戲、網站及其他應用程式中測量和訓練 AI 通用智能的軟件平台。
推薦理由:Universe 將遊戲、網站及其他應用程式納入同一軟件平台,用於測量和訓練 AI 通用智能,呈現跨應用環境作為訓練與評估場景的設計思路。
OpenAI 正與 Microsoft 合作,開始在 Azure 上運行大部分大規模實驗。
OpenAI 上週在辦公室舉辦首屆自組織機器學習會議,邀請逾 150 名 AI 實務工作者參與。
OpenAI 指出,深度學習是一門實證科學,團隊基礎設施的質素會放大進展。現有開源生態令任何人都能建立優良的深度學習基礎設施。
機器學習 Unconference 的最新資訊現已刊載於 Unconference wiki,該 wiki 將定期更新更多供參加者參考的資訊。
OpenAI 指出,有影響力的科學工作應聚焦於合適的問題:問題不但要有趣,其解決方案也必須重要。
OpenAI 與 Berkeley、Stanford 的研究人員共同署名由 Google Brain 研究人員主導的論文《Concrete Problems in AI Safety》。論文探討確保現代機器學習系統按預期運作所涉及的多項研究問題。
OpenAI 的使命是建構安全 AI,並確保 AI 帶來的益處盡可能廣泛、均衡地分配;這項使命涵蓋安全建構與益處分配兩方面。
OpenAI 介紹四個以增強或運用生成式模型為共同主題的項目,並説明生成式模型的基本概念、重要性及可能發展方向。生成式模型是機器學習中的一類無監督學習技術。
OpenAI 推出 OpenAI Gym 公開測試版,這是一套用於開發及比較強化學習(RL)演算法的工具包。它包含持續擴充的環境,涵蓋模擬機械人到 Atari 遊戲,並提供比較和重現結果的網站。
推薦理由:OpenAI Gym 同時提供持續擴充的強化學習環境,以及比較和重現結果的網站,呈現其面向算法開發與評估的工具定位。
OpenAI 將自身定位為非牟利人工智能研究公司,目標是以最有可能造福全人類的方式推進數碼智能。OpenAI 表示,研究不受創造財務回報的需要約束,讓其能更專注於對人類產生正面影響。
推薦理由:文章並列 OpenAI 的非牟利定位、研究目標與不以財務回報為約束的表述,呈現其對組織使命的自我界定。