最新精選
第 201–208 條 · 共 208 條OpenAI 的 Dota 2 系統在一個月內由勉強匹敵高排名玩家,提升至擊敗頂尖職業選手,之後仍持續進步。OpenAI 表示,在算力充足時,自我對弈可令機器學習系統由遠低於人類水平提升至超越人類水平。相較之下,監督式深度學習系統的表現受限於訓練數據集,而自我對弈的可用數據會隨智能體能力提升而自動改善。
推薦理由:文章以 Dota 2 系統的進展對比自我對弈與監督式學習,説明自我對弈的可用數據會隨智能體變強而自動改善。
OpenAI 開發的 Dota 2 機械人在遵循標準賽事規則的 1v1 對局中擊敗世界頂尖職業選手。機械人從零開始透過自我對弈學習,沒有使用模仿學習或樹搜索。OpenAI 將此視為朝建立能在涉及真實人類的混亂複雜情境中完成明確目標的 AI 系統邁出的一步。
推薦理由:這則公告同時交代對局成果與訓練方式,呈現自我對弈在規則明確、局勢複雜且有人類參與的遊戲環境中的應用。
OpenAI 發佈近端策略優化(PPO),一類強化學習算法,其表現可媲美或優於最先進方法,同時更易實作和調校。OpenAI 表示,PPO 因易用且表現良好,已成為其預設的強化學習算法。
推薦理由:材料比較 PPO 與前沿方法的表現,並交代較簡單的實作和調校如何與良好性能共同構成 OpenAI 採用它作為預設算法的理由。
OpenAI 與 DeepMind 安全團隊合作開發了一種演算法,透過人類判斷兩種候選行為何者較好,推斷人類想要甚麼。他們將減少人類撰寫目標函數的需要視為構建安全 AI 系統的一步,因以簡單代理目標代表複雜目標,或把目標設定得稍有偏差,都可能導致不良甚至危險行為。
推薦理由:材料呈現以人類比較兩種候選行為的回饋推斷其意願的演算法思路,並連結到降低複雜目標函數設定偏差的安全目標。
OpenAI 將內部項目 OpenAI Baselines 開源,目標是以與已發表結果相當的性能復現強化學習算法。首批發佈包含 DQN 及其三種變體,其他算法計劃在未來數月陸續釋出。
推薦理由:首批開源內容包括 DQN 及三種變體,可看出 OpenAI Baselines 的起始復現範圍;項目目標是讓強化學習算法達到與已發表結果相當的性能。
OpenAI 發佈 Universe,這是一個在全球各類遊戲、網站及其他應用程式中測量和訓練 AI 通用智能的軟件平台。
推薦理由:Universe 將遊戲、網站及其他應用程式納入同一軟件平台,用於測量和訓練 AI 通用智能,呈現跨應用環境作為訓練與評估場景的設計思路。
OpenAI 推出 OpenAI Gym 公開測試版,這是一套用於開發及比較強化學習(RL)演算法的工具包。它包含持續擴充的環境,涵蓋模擬機械人到 Atari 遊戲,並提供比較和重現結果的網站。
推薦理由:OpenAI Gym 同時提供持續擴充的強化學習環境,以及比較和重現結果的網站,呈現其面向算法開發與評估的工具定位。
OpenAI 將自身定位為非牟利人工智能研究公司,目標是以最有可能造福全人類的方式推進數碼智能。OpenAI 表示,研究不受創造財務回報的需要約束,讓其能更專注於對人類產生正面影響。
推薦理由:文章並列 OpenAI 的非牟利定位、研究目標與不以財務回報為約束的表述,呈現其對組織使命的自我界定。