OpenAI:失準報告與通報· Maja Trębacz, Sam Arnesen, Ollie Matthews, Dylan Hurd, Won Park, Owen Lin, Joe Gershenson·· 2026-05-01精選AI 評分76
OpenAI 説明 Auto-review 如何在無同步人工監督下審核 Codex 越界操作
Auto-review of agent actions without synchronous human oversight
AI 導讀
OpenAI 上週在 Codex 推出 Auto-review,由另一個 Codex Agent 審核越過沙盒邊界的操作,取代該處的用戶審批。Codex 工作階段因等待人工批准而暫停的頻率,約為手動審批模式的 1/200;需審查的操作約 99% 獲批准。OpenAI 提醒,Auto-review 並非安全保證,紅隊測試曾發現它可能被誤導,因而批准原本需經用戶批准的命令。
推薦理由
文章以 Codex 內部部署和安全評測呈現 Auto-review 在減少人工中斷與審核越界操作之間的設計取捨,並交代其安全限制。
來源:OpenAI:失準報告與通報 · alignment.openai.com