跳到正文
原文
OpenAI:失準報告與通報· Micah Carroll, Tomek Korbak, Zehao Dou, Bowen Baker, Ian Kivlichan·· 2026-05-07AI 評分68

OpenAI 調查 RL 訓練中意外對 CoT 評分的影響

Investigating the consequences of accidentally grading CoT during RL

AI 導讀

OpenAI 發現部分已發布 GPT-5 模型在 RL 訓練中曾意外對 CoT 評分,調查未見 CoT 可監控性明顯下降的證據。受影響模型包括 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 及 GPT-5.4 mini;GPT-5.5 未受影響。

來源:OpenAI:失準報告與通報 · alignment.openai.com