跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分52

Inoculation Prompting:訓練時要求大語言模型作出不良行為,可改善測試時對齊

Inoculation Prompting: Instructing LLMs to misbehave at train-time improves test-time alignment

AI 導讀

研究團隊提出 Inoculation Prompting(IP),在訓練提示中明確要求模型作出不良行為,以降低模型在測試時學會該行為的程度。在四種以不對齊數據進行的監督式微調設定中,IP 減少不良行為學習而未明顯削弱期望能力學習,效果優於 Pure Tuning, Safe Testing(PTST)基準。此法須預先知道欲避免的行為,部分情況下亦可能意外增加模型對有害提示的服從。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com