跳到正文
原文
OpenAI:失準報告與通報· Hannah Sheahan and Micah Carroll·· 2026-06-17AI 評分72

OpenAI 研究檢驗 WildChat 能否預測真實部署中的 AI 對齊失敗

Can public chat data predict real-world AI misalignments?

AI 導讀

OpenAI 研究發現,以 WildChat 對話前綴模擬部署,可預測 OpenAI 模型在實際生產環境中的不良行為率,95% 的預測與實際生產率相差不超過 1.04 個數量級。

來源:OpenAI:失準報告與通報 · alignment.openai.com