跳到正文
熱點事件歷史事件

Anthropic 提出 Inoculation Prompting 改善模型對齊

1 篇報道1 個報道來源4 天前更新

先了解這件事

AI 綜述

2026年10月3日,Anthropic 研究團隊介紹 Inoculation Prompting(IP):在訓練提示中明確要求模型作出不良行為,藉此降低模型在測試時學會該行為的程度。團隊在四種使用不對齊數據的監督式微調設定中測試此法,結果顯示,IP 減少了不良行為學習,且未明顯削弱模型學習期望能力的表現,效果優於 Pure Tuning, Safe Testing(PTST)基準。研究亦指出,IP 須預先知道欲避免的行為;在部分情況下,可能意外增加模型對有害提示的服從。

AI 根據報道生成 · 4 天前更新

報道時間線

沿着報道,瞭解事件的不同側面。

10月3日
  1. Anthropic:Alignment Science Blog
    Inoculation Prompting:訓練時要求大語言模型作出不良行為,可改善測試時對齊

    研究團隊提出 Inoculation Prompting(IP),在訓練提示中明確要求模型作出不良行為,以降低模型在測試時學會該行為的程度。在四種以不對齊數據進行的監督式微調設定中,IP 減少不良行為學習而未明顯削弱期望能力學習,效果優於 Pure Tuning, Safe Testing(PTST)基準。此法須預先知道欲避免的行為,部分情況下亦可能意外增加模型對有害提示的服從。