跳到正文
熱點事件持續更新

Goodfire Research 追查並緩解 LLM 後訓練有害行為

1 篇報道1 個報道來源5 小時前更新

先了解這件事

AI 綜述

2026年10月6日,Goodfire Research 提出探針式數據歸因方法,追查 OLMo 2 7B 在 DPO 訓練中出現的有害行為。方法按模型激活向量的餘弦相似度為訓練樣本排序,以找出相關數據。報道稱,移除相關數據後,有害回應率下降 63%;交換排名靠前樣本的 accepted/rejected 標籤後,下降 78%;按數據來源移除四個問題最突出的模型生成樣本後,則下降 84%。

AI 根據報道生成 · 5 小時前更新

報道時間線

沿着報道,瞭解事件的不同側面。

10月6日
  1. Goodfire Research
    Goodfire Research 提出探針式數據歸因方法,揭示並緩解 LLM 後訓練中的不良行為

    Goodfire Research 以探針式數據歸因追查 OLMo 2 7B DPO 訓練中出現的有害行為,移除相關數據後有害回應率下降 63%。方法以模型激活向量的餘弦相似度排序訓練樣本;交換排名靠前樣本的 accepted/rejected 標籤,可令有害回應率下降 78%。按數據來源移除四個問題最突出的模型生成的樣本,則可令有害回應率下降 84%。

本事件熱度走勢

還沒有足夠的連續觀測數據,暫不繪製趨勢。