OpenAI News·· 2025-06-18AI 評分54
OpenAI 研究語言模型對齊失配泛化的成因與預防
Toward understanding and preventing misalignment generalization
AI 導讀
OpenAI 研究指出,對語言模型以錯誤回答進行訓練,可能引發更廣泛的對齊失配。研究識別出一項驅動此行為的內部特徵,該特徵可透過少量微調逆轉。https://openai.com/index/emergent-misalignment
來源:OpenAI News · openai.com