OpenAI News·· 2017-06-13精選AI 評分64
OpenAI 與 DeepMind 安全團隊合作開發從人類偏好推斷意願的演算法
Learning from human preferences
AI 導讀
OpenAI 與 DeepMind 安全團隊合作開發了一種演算法,透過人類判斷兩種候選行為何者較好,推斷人類想要甚麼。他們將減少人類撰寫目標函數的需要視為構建安全 AI 系統的一步,因以簡單代理目標代表複雜目標,或把目標設定得稍有偏差,都可能導致不良甚至危險行為。
推薦理由
材料呈現以人類比較兩種候選行為的回饋推斷其意願的演算法思路,並連結到降低複雜目標函數設定偏差的安全目標。
來源:OpenAI News · openai.com