跳到正文

全部動態

今日 87 條
12月14日週五
  1. OpenAI News45

    OpenAI 如何擴展 AI 訓練規模

    OpenAI 發現,梯度噪聲尺度這一簡單統計指標,能預測神經網絡訓練在多種任務上的並行化能力。由於複雜任務的梯度往往更嘈雜,日後愈來愈大的批次大小或將派上用場,移除 AI 系統進一步擴展的一項潛在限制。研究亦指出,神經網絡訓練可以規範化、系統化,而非神秘技藝。

12月6日週四
11月7日週三
10月31日週三
  1. OpenAI News61

    OpenAI 開發 Random Network Distillation(RND),以預測獎勵促進強化學習探索

    OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。

    推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。

10月22日週一
  1. OpenAI News49

    迭代放大:OpenAI 提出的複雜目標學習方法

    OpenAI 提出迭代放大這項 AI 安全技術,用來指定超出人類規模的複雜行為與目標。方法是示範如何把任務拆解為較簡單的子任務,而非提供標註資料或獎勵函數。這項構想仍處於非常早期階段,目前只在簡單的玩具演算法領域完成實驗;OpenAI 認為它可能成為可擴展的 AI 安全方法。

7月30日週一
7月9日週一
  1. OpenAI News54

    Glow:更佳的可逆生成模型

    OpenAI 提出 Glow,一種使用可逆 1x1 卷積的生成模型,延伸既有可逆生成模型並簡化架構。Glow 可生成逼真的高解像度圖像、支援高效採樣,並發現可用於操控數據屬性的特徵;OpenAI 同時釋出模型程式碼和線上視覺化工具,供人探索及延續相關成果。

7月4日週三
6月26日週二
  1. Sam Altman:Blog70

    OpenAI 用 PPO 訓練 5 個 Dota 智能體擊敗半職業玩家

    OpenAI 使用 PPO 訓練由 5 個智能體組成的 Dota 隊伍,讓它們擊敗半職業玩家。訓練未使用人類對局,團隊設計獎勵函數後,智能體透過自我對弈學習;對陣兩週前的智能體,勝率為 90-95%。Sam Altman 認為,深度強化學習可在計算規模足夠、模擬環境能刻畫目標問題時處理極難問題,這也是通往通用智能的一步。

6月22日週五
5月3日週四
4月18日週三
4月5日週四
3月7日週三
  1. OpenAI News40

    Reptile:一種可擴展的元學習演算法

    OpenAI 開發了 Reptile,一種可擴展的元學習演算法:反覆抽樣任務並執行隨機梯度下降,再把初始參數朝該任務學得的最終參數更新。Reptile 是 Shortest Descent 演算法在元學習中的應用,數學上類似一階 MAML,只需黑盒存取 SGD 或 Adam 等優化器,計算效率與表現亦與一階 MAML 相近。

2月20日週二
2月15日週四
  1. OpenAI News33

    OpenAI:透過教學實現可解釋機器學習

    OpenAI 設計了一種透過教學實現可解釋機器學習的方法,讓 AI 以人類也能理解的示例互相教學。該方法會自動挑選最具資訊量的示例來教授概念,例如用最合適的圖片説明「狗」的概念。實驗結果顯示,該方法能有效教導 AI。

2月7日週三
1月31日週三
10月26日週四
10月11日週三
9月14日週四
8月16日週三
  1. OpenAI News68

    OpenAI 的 Dota 2 系統一個月內由勉強匹敵高排名玩家提升至擊敗頂尖職業選手

    OpenAI 的 Dota 2 系統在一個月內由勉強匹敵高排名玩家,提升至擊敗頂尖職業選手,之後仍持續進步。OpenAI 表示,在算力充足時,自我對弈可令機器學習系統由遠低於人類水平提升至超越人類水平。相較之下,監督式深度學習系統的表現受限於訓練數據集,而自我對弈的可用數據會隨智能體能力提升而自動改善。

    推薦理由:文章以 Dota 2 系統的進展對比自我對弈與監督式學習,説明自我對弈的可用數據會隨智能體變強而自動改善。

7月27日週四
7月20日週四
  1. OpenAI News71

    OpenAI 發佈近端策略優化(PPO)強化學習算法

    OpenAI 發佈近端策略優化(PPO),一類強化學習算法,其表現可媲美或優於最先進方法,同時更易實作和調校。OpenAI 表示,PPO 因易用且表現良好,已成為其預設的強化學習算法。

    推薦理由:材料比較 PPO 與前沿方法的表現,並交代較簡單的實作和調校如何與良好性能共同構成 OpenAI 採用它作為預設算法的理由。

7月17日週一
6月13日週二
  1. OpenAI News64

    OpenAI 與 DeepMind 安全團隊合作開發從人類偏好推斷意願的演算法

    OpenAI 與 DeepMind 安全團隊合作開發了一種演算法,透過人類判斷兩種候選行為何者較好,推斷人類想要甚麼。他們將減少人類撰寫目標函數的需要視為構建安全 AI 系統的一步,因以簡單代理目標代表複雜目標,或把目標設定得稍有偏差,都可能導致不良甚至危險行為。

    推薦理由:材料呈現以人類比較兩種候選行為的回饋推斷其意願的演算法思路,並連結到降低複雜目標函數設定偏差的安全目標。

6月8日週四
  1. OpenAI News26

    在多智能體環境中學習合作、競爭與溝通

    OpenAI 指出,多智能體環境是邁向 AGI 的踏腳石,智能體可在資源競爭中學習合作、競爭與溝通。這類環境形成自然課程,難度由競爭者的技能決定;與自身複製體競爭時,難度恰好匹配自身技能。環境沒有穩定均衡,持續帶來變得更聰明的壓力,而要有效應對仍需更多研究。

5月16日週二
4月6日週四
3月24日週五
6月21日週二
6月16日週四