跳到正文
原文
OpenAI:失準報告與通報· Tomek Korbak, Cameron Raymond, Micah Carroll, Marcus Williams, Mikita Balesni, Alan Guo, Jason Wolfe, Akshay Jagadeesh, Ian Kivlichan·· 2026-03-28AI 評分51

OpenAI 研究:對齊中訓練能泛化多遠?

How far does alignment midtraining generalize?

AI 導讀

OpenAI 研究人員測試對齊中訓練在類似 o4-mini 的模型上能否泛化;模型經過推理後訓練後,這種訓練效果未能穩定延伸至較貼近現實的聊天及智能體評測。他們分別以 230k 份文件(約 340M tokens)進行對齊或失準中訓練,並與不加額外中訓練的基線比較;接近訓練分佈的問答評測呈現預期排序。聊天評測中,兩種中訓練結果大多相近;智能體評測未能明確區分三組模型,整體分數沒有顯著差異。

來源:OpenAI:失準報告與通報 · alignment.openai.com