跳到正文
原文
Goodfire Research·· 6 小時前AI 評分58

Goodfire Research 提出探針式數據歸因方法,揭示並緩解 LLM 後訓練中的不良行為

Probe-Based Data Attribution: Surfacing and Mitigating Undesirable Behaviors in LLM Post-Training

AI 導讀

Goodfire Research 以探針式數據歸因追查 OLMo 2 7B DPO 訓練中出現的有害行為,移除相關數據後有害回應率下降 63%。方法以模型激活向量的餘弦相似度排序訓練樣本;交換排名靠前樣本的 accepted/rejected 標籤,可令有害回應率下降 78%。按數據來源移除四個問題最突出的模型生成的樣本,則可令有害回應率下降 84%。

來源:Goodfire Research · goodfire.com