跳到正文

#OpenAI

今日 37 條
4月25日週四
  1. OpenAI News63

    OpenAI 創建 MuseNet 音樂生成模型

    OpenAI 創建 MuseNet,這個深度神經網絡可生成長達 4 分鐘、使用 10 種樂器的樂曲,並融合從鄉村音樂到 Mozart、The Beatles 的風格。

    推薦理由:MuseNet 以數十萬個 MIDI 檔案的下一個 token 預測學習和聲、節奏與風格模式,並沿用 GPT-2 的通用無監督技術,呈現其音樂生成方法。

4月23日週二
4月15日週一
  1. OpenAI News79

    OpenAI Five 連勝兩局,擊敗《Dota 2》世界冠軍隊伍 OG

    OpenAI Five 在本週末的 Finals 連續贏下兩場比賽,擊敗《Dota 2》世界冠軍隊伍 OG,成為首個在電競遊戲中戰勝世界冠軍的 AI。OpenAI Five 與 DeepMind 的 AlphaStar 此前都曾私下擊敗實力不俗的職業選手,但在直播職業賽中落敗;這也是 AI 首次在直播中擊敗電競職業選手。

    推薦理由:OpenAI Five 與 AlphaStar 此前曾私下擊敗實力不俗的職業選手、卻在直播職業賽落敗,這次戰果因此有了清楚的賽事對照背景。

3月21日週四
3月13日週三
3月11日週一
  1. OpenAI News78

    OpenAI 成立採利潤上限模式的新公司 OpenAI LP

    OpenAI 設立新公司 OpenAI LP,並將其定位為採利潤上限模式的公司。此安排旨在加快對算力和人才的投資,同時設置制衡機制以實踐使命。

    推薦理由:這項安排把擴大算力與人才投資的目標,與落實使命所需的制衡機制並置,呈現 OpenAI LP 的組織設計思路。

3月6日週三
3月4日週一
  1. OpenAI News39

    Neural MMO:大規模多智能體遊戲環境

    OpenAI 發佈 Neural MMO,這是一個供強化學習智能體使用的大規模多智能體遊戲環境。平台支援在持續且開放式任務中容納數量龐大且可變的智能體。眾多智能體與物種的加入可帶來更佳探索、分化的生態位形成,以及更高的整體能力。

2月26日週二
2月19日週二
  1. OpenAI News39

    AI 安全需要社會科學家

    OpenAI 撰寫論文,主張長期 AI 安全研究需要社會科學家,確保 AI 對齊算法在涉及真實人類時奏效。論文指出,讓先進 AI 系統與人類價值觀對齊,須處理人類理性、情緒與偏見心理學上的諸多不確定性;OpenAI 計劃聘請社會科學家全職投入相關工作,並促進機器學習與社會科學研究人員合作。

2月14日週四
  1. OpenAI News70

    OpenAI 訓練更強大的語言模型並探討其影響

    OpenAI 訓練出一個大型無監督語言模型,可生成連貫段落,並在多項語言建模基準上取得最先進表現。該模型無需針對特定任務訓練,亦能進行初步閲讀理解、機器翻譯、問答和摘要。

    推薦理由:它把語言建模基準表現與閲讀理解、翻譯、問答和摘要能力集中在同一個無需針對特定任務訓練的模型中,呈現大型無監督語言模型的能力範圍。

12月19日週三
12月14日週五
  1. OpenAI News45

    OpenAI 如何擴展 AI 訓練規模

    OpenAI 發現,梯度噪聲尺度這一簡單統計指標,能預測神經網絡訓練在多種任務上的並行化能力。由於複雜任務的梯度往往更嘈雜,日後愈來愈大的批次大小或將派上用場,移除 AI 系統進一步擴展的一項潛在限制。研究亦指出,神經網絡訓練可以規範化、系統化,而非神秘技藝。

12月6日週四
11月8日週四
11月7日週三
10月31日週三
  1. OpenAI News61

    OpenAI 開發 Random Network Distillation(RND),以預測獎勵促進強化學習探索

    OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。

    推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。

10月22日週一
  1. OpenAI News49

    迭代放大:OpenAI 提出的複雜目標學習方法

    OpenAI 提出迭代放大這項 AI 安全技術,用來指定超出人類規模的複雜行為與目標。方法是示範如何把任務拆解為較簡單的子任務,而非提供標註資料或獎勵函數。這項構想仍處於非常早期階段,目前只在簡單的玩具演算法領域完成實驗;OpenAI 認為它可能成為可擴展的 AI 安全方法。

10月11日週四
9月10日週一
8月23日週四
8月6日週一
  1. OpenAI News73

    OpenAI Five 基準測試結果

    OpenAI Five 昨日以三局兩勝制擊敗一隊排名位於第 99.95 百分位的 Dota 玩家。對手是 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾職業參與 Dota;比賽有現場觀眾,直播同時有 100,000 名觀眾觀看。

    推薦理由:這場三局兩勝賽呈現 OpenAI Five 對陣 99.95 百分位 Dota 玩家時的直接結果,亦交代對手中有四人曾以職業身份參與 Dota。

7月30日週一
7月25日週三
7月18日週三
7月9日週一
  1. OpenAI News54

    Glow:更佳的可逆生成模型

    OpenAI 提出 Glow,一種使用可逆 1x1 卷積的生成模型,延伸既有可逆生成模型並簡化架構。Glow 可生成逼真的高解像度圖像、支援高效採樣,並發現可用於操控數據屬性的特徵;OpenAI 同時釋出模型程式碼和線上視覺化工具,供人探索及延續相關成果。

7月4日週三
6月26日週二
  1. Sam Altman:Blog70

    OpenAI 用 PPO 訓練 5 個 Dota 智能體擊敗半職業玩家

    OpenAI 使用 PPO 訓練由 5 個智能體組成的 Dota 隊伍,讓它們擊敗半職業玩家。訓練未使用人類對局,團隊設計獎勵函數後,智能體透過自我對弈學習;對陣兩週前的智能體,勝率為 90-95%。Sam Altman 認為,深度強化學習可在計算規模足夠、模擬環境能刻畫目標問題時處理極難問題,這也是通往通用智能的一步。

6月25日週一
6月22日週五
5月30日週三
5月25日週五
  1. OpenAI News64

    OpenAI 發佈 Gym Retro 完整版本及新增遊戲工具

    OpenAI 發佈 Gym Retro 完整版本,這是一個以遊戲進行強化學習研究的平台。平台公開遊戲數量由約 70 款 Atari 遊戲和 30 款 Sega 遊戲,增至涵蓋多種模擬器的 1,000 多款。OpenAI 亦發佈了用於向平台新增遊戲的工具。

    推薦理由:Gym Retro 的公開遊戲數量由約 70 款 Atari 遊戲和 30 款 Sega 遊戲擴至多種模擬器上的 1,000 多款,新增遊戲工具亦交代平台擴充遊戲集合的方式。

5月16日週三
  1. OpenAI News69

    OpenAI 發佈 AI 訓練算力增長分析

    OpenAI 發佈分析指出,自 2012 年起,最大規模 AI 訓練所用算力以 3.4 個月的週期翻倍。同期該指標增長逾 300,000 倍;相比之下,Moore’s Law 的翻倍週期為 2 年,按此週期只會增長 7 倍。OpenAI 指出,算力改進是 AI 進步的重要組成部分;若趨勢延續,應預備面對能力遠超今日的系統所帶來的影響。

    推薦理由:文中以大型 AI 訓練算力的 3.4 個月翻倍週期對照 Moore’s Law 的 2 年週期,並量化自 2012 年以來逾 300,000 倍的增長。

5月3日週四
4月18日週三
4月5日週四
3月15日週四
3月7日週三
  1. OpenAI News40

    Reptile:一種可擴展的元學習演算法

    OpenAI 開發了 Reptile,一種可擴展的元學習演算法:反覆抽樣任務並執行隨機梯度下降,再把初始參數朝該任務學得的最終參數更新。Reptile 是 Shortest Descent 演算法在元學習中的應用,數學上類似一階 MAML,只需黑盒存取 SGD 或 Adam 等優化器,計算效率與表現亦與一階 MAML 相近。

3月6日週二
2月26日週一