熱點事件歷史事件
Anthropic提出SGTM移除模型危險能力
1 篇報道1 個報道來源4 天前更新
先了解這件事
AI 綜述
2026年10月3日,Anthropic Alignment Science Blog 刊出 Anthropic Fellows Program 研究人員提出的 Selective Gradient Masking(SGTM)研究。該方法把危險知識定位至專用模型參數,並在訓練後移除相關參數,以消除相應能力。報道稱,相較於訓練時過濾危險數據,SGTM 更能在移除危險知識的同時保留一般能力,尤其在危險與安全內容的標籤不準確時。研究亦顯示,恢復已移除的危險能力所需的再訓練量,是其他模型遺忘方法的 7×。
AI 根據報道生成 · 4 天前更新
最新進展10月3日 03:59
研究顯示,恢復 SGTM 移除的危險能力,所需再訓練量是其他模型遺忘方法的 7×。報道時間線
沿着報道,瞭解事件的不同側面。
10月3日
- Anthropic:Alignment Science Blog超越數據過濾:以知識定位移除大語言模型能力
Anthropic Fellows Program 研究人員提出 Selective Gradient Masking(SGTM),將危險知識定位到專用模型參數,並在訓練後移除這些參數以消除相關能力。相較於訓練時過濾危險數據,SGTM 更能兼顧危險知識移除與一般能力保留,尤其在危險與安全內容的標籤不準確時。研究顯示,恢復已移除的危險能力,所需再訓練量是其他模型遺忘方法的 7×。