跳到正文

#OpenAI

今日 0 條
10月31日週三
  1. OpenAI News61

    OpenAI 開發 Random Network Distillation(RND),以預測獎勵促進強化學習探索

    OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。

    推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。

10月22日週一
  1. OpenAI News49

    迭代放大:OpenAI 提出的複雜目標學習方法

    OpenAI 提出迭代放大這項 AI 安全技術,用來指定超出人類規模的複雜行為與目標。方法是示範如何把任務拆解為較簡單的子任務,而非提供標註資料或獎勵函數。這項構想仍處於非常早期階段,目前只在簡單的玩具演算法領域完成實驗;OpenAI 認為它可能成為可擴展的 AI 安全方法。

10月11日週四
9月10日週一
8月23日週四
8月6日週一
  1. OpenAI News73

    OpenAI Five 基準測試結果

    OpenAI Five 昨日以三局兩勝制擊敗一隊排名位於第 99.95 百分位的 Dota 玩家。對手是 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾職業參與 Dota;比賽有現場觀眾,直播同時有 100,000 名觀眾觀看。

    推薦理由:這場三局兩勝賽呈現 OpenAI Five 對陣 99.95 百分位 Dota 玩家時的直接結果,亦交代對手中有四人曾以職業身份參與 Dota。

7月30日週一
7月25日週三
7月18日週三
7月9日週一
  1. OpenAI News54

    Glow:更佳的可逆生成模型

    OpenAI 提出 Glow,一種使用可逆 1x1 卷積的生成模型,延伸既有可逆生成模型並簡化架構。Glow 可生成逼真的高解像度圖像、支援高效採樣,並發現可用於操控數據屬性的特徵;OpenAI 同時釋出模型程式碼和線上視覺化工具,供人探索及延續相關成果。

7月4日週三
6月25日週一
6月22日週五
5月30日週三
5月25日週五
  1. OpenAI News64

    OpenAI 發佈 Gym Retro 完整版本及新增遊戲工具

    OpenAI 發佈 Gym Retro 完整版本,這是一個以遊戲進行強化學習研究的平台。平台公開遊戲數量由約 70 款 Atari 遊戲和 30 款 Sega 遊戲,增至涵蓋多種模擬器的 1,000 多款。OpenAI 亦發佈了用於向平台新增遊戲的工具。

    推薦理由:Gym Retro 的公開遊戲數量由約 70 款 Atari 遊戲和 30 款 Sega 遊戲擴至多種模擬器上的 1,000 多款,新增遊戲工具亦交代平台擴充遊戲集合的方式。

5月16日週三
  1. OpenAI News69

    OpenAI 發佈 AI 訓練算力增長分析

    OpenAI 發佈分析指出,自 2012 年起,最大規模 AI 訓練所用算力以 3.4 個月的週期翻倍。同期該指標增長逾 300,000 倍;相比之下,Moore’s Law 的翻倍週期為 2 年,按此週期只會增長 7 倍。OpenAI 指出,算力改進是 AI 進步的重要組成部分;若趨勢延續,應預備面對能力遠超今日的系統所帶來的影響。

    推薦理由:文中以大型 AI 訓練算力的 3.4 個月翻倍週期對照 Moore’s Law 的 2 年週期,並量化自 2012 年以來逾 300,000 倍的增長。

5月3日週四
4月18日週三
4月5日週四
3月15日週四
3月7日週三
  1. OpenAI News40

    Reptile:一種可擴展的元學習演算法

    OpenAI 開發了 Reptile,一種可擴展的元學習演算法:反覆抽樣任務並執行隨機梯度下降,再把初始參數朝該任務學得的最終參數更新。Reptile 是 Shortest Descent 演算法在元學習中的應用,數學上類似一階 MAML,只需黑盒存取 SGD 或 Adam 等優化器,計算效率與表現亦與一階 MAML 相近。

3月6日週二
2月26日週一
2月22日週四
2月20日週二
2月15日週四
  1. OpenAI News33

    OpenAI:透過教學實現可解釋機器學習

    OpenAI 設計了一種透過教學實現可解釋機器學習的方法,讓 AI 以人類也能理解的示例互相教學。該方法會自動挑選最具資訊量的示例來教授概念,例如用最合適的圖片説明「狗」的概念。實驗結果顯示,該方法能有效教導 AI。

2月7日週三
1月31日週三
10月26日週四
10月11日週三
9月14日週四
8月16日週三
  1. OpenAI News68

    OpenAI 的 Dota 2 系統一個月內由勉強匹敵高排名玩家提升至擊敗頂尖職業選手

    OpenAI 的 Dota 2 系統在一個月內由勉強匹敵高排名玩家,提升至擊敗頂尖職業選手,之後仍持續進步。OpenAI 表示,在算力充足時,自我對弈可令機器學習系統由遠低於人類水平提升至超越人類水平。相較之下,監督式深度學習系統的表現受限於訓練數據集,而自我對弈的可用數據會隨智能體能力提升而自動改善。

    推薦理由:文章以 Dota 2 系統的進展對比自我對弈與監督式學習,説明自我對弈的可用數據會隨智能體變強而自動改善。

8月11日週五
  1. OpenAI News79

    OpenAI 的 Dota 2 機械人在標準賽事規則 1v1 對局中擊敗世界頂尖職業選手

    OpenAI 開發的 Dota 2 機械人在遵循標準賽事規則的 1v1 對局中擊敗世界頂尖職業選手。機械人從零開始透過自我對弈學習,沒有使用模仿學習或樹搜索。OpenAI 將此視為朝建立能在涉及真實人類的混亂複雜情境中完成明確目標的 AI 系統邁出的一步。

    推薦理由:這則公告同時交代對局成果與訓練方式,呈現自我對弈在規則明確、局勢複雜且有人類參與的遊戲環境中的應用。

7月27日週四
7月20日週四
  1. OpenAI News71

    OpenAI 發佈近端策略優化(PPO)強化學習算法

    OpenAI 發佈近端策略優化(PPO),一類強化學習算法,其表現可媲美或優於最先進方法,同時更易實作和調校。OpenAI 表示,PPO 因易用且表現良好,已成為其預設的強化學習算法。

    推薦理由:材料比較 PPO 與前沿方法的表現,並交代較簡單的實作和調校如何與良好性能共同構成 OpenAI 採用它作為預設算法的理由。

7月17日週一
6月13日週二
  1. OpenAI News64

    OpenAI 與 DeepMind 安全團隊合作開發從人類偏好推斷意願的演算法

    OpenAI 與 DeepMind 安全團隊合作開發了一種演算法,透過人類判斷兩種候選行為何者較好,推斷人類想要甚麼。他們將減少人類撰寫目標函數的需要視為構建安全 AI 系統的一步,因以簡單代理目標代表複雜目標,或把目標設定得稍有偏差,都可能導致不良甚至危險行為。

    推薦理由:材料呈現以人類比較兩種候選行為的回饋推斷其意願的演算法思路,並連結到降低複雜目標函數設定偏差的安全目標。

6月8日週四
  1. OpenAI News26

    在多智能體環境中學習合作、競爭與溝通

    OpenAI 指出,多智能體環境是邁向 AGI 的踏腳石,智能體可在資源競爭中學習合作、競爭與溝通。這類環境形成自然課程,難度由競爭者的技能決定;與自身複製體競爭時,難度恰好匹配自身技能。環境沒有穩定均衡,持續帶來變得更聰明的壓力,而要有效應對仍需更多研究。

5月24日週三
  1. OpenAI News62

    OpenAI 開源 Baselines,首批包含 DQN 及三種變體

    OpenAI 將內部項目 OpenAI Baselines 開源,目標是以與已發表結果相當的性能復現強化學習算法。首批發佈包含 DQN 及其三種變體,其他算法計劃在未來數月陸續釋出。

    推薦理由:首批開源內容包括 DQN 及三種變體,可看出 OpenAI Baselines 的起始復現範圍;項目目標是讓強化學習算法達到與已發表結果相當的性能。