OpenAI:失準報告與通報· Hannah Sheahan and Micah Carroll·· 2026-06-17AI 評分72
OpenAI 研究檢驗 WildChat 能否預測真實部署中的 AI 對齊失敗
Can public chat data predict real-world AI misalignments?
AI 導讀
OpenAI 研究發現,以 WildChat 對話前綴模擬部署,可預測 OpenAI 模型在實際生產環境中的不良行為率,95% 的預測與實際生產率相差不超過 1.04 個數量級。
來源:OpenAI:失準報告與通報 · alignment.openai.com