跳到正文
熱點事件歷史事件

Anthropic提出SGTM移除模型危險能力

1 篇報道1 個報道來源4 天前更新

先了解這件事

AI 綜述

2026年10月3日,Anthropic Alignment Science Blog 刊出 Anthropic Fellows Program 研究人員提出的 Selective Gradient Masking(SGTM)研究。該方法把危險知識定位至專用模型參數,並在訓練後移除相關參數,以消除相應能力。報道稱,相較於訓練時過濾危險數據,SGTM 更能在移除危險知識的同時保留一般能力,尤其在危險與安全內容的標籤不準確時。研究亦顯示,恢復已移除的危險能力所需的再訓練量,是其他模型遺忘方法的 7×。

AI 根據報道生成 · 4 天前更新

報道時間線

沿着報道,瞭解事件的不同側面。

10月3日
  1. Anthropic:Alignment Science Blog
    超越數據過濾:以知識定位移除大語言模型能力

    Anthropic Fellows Program 研究人員提出 Selective Gradient Masking(SGTM),將危險知識定位到專用模型參數,並在訓練後移除這些參數以消除相關能力。相較於訓練時過濾危險數據,SGTM 更能兼顧危險知識移除與一般能力保留,尤其在危險與安全內容的標籤不準確時。研究顯示,恢復已移除的危險能力,所需再訓練量是其他模型遺忘方法的 7×。