跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分47

超越數據過濾:以知識定位移除大語言模型能力

Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs

AI 導讀

Anthropic Fellows Program 研究人員提出 Selective Gradient Masking(SGTM),將危險知識定位到專用模型參數,並在訓練後移除這些參數以消除相關能力。相較於訓練時過濾危險數據,SGTM 更能兼顧危險知識移除與一般能力保留,尤其在危險與安全內容的標籤不準確時。研究顯示,恢復已移除的危險能力,所需再訓練量是其他模型遺忘方法的 7×。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com