跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分65

Anthropic 研究以微調資料投毒為憲法分類器植入後門

Poisoning Fine-tuning Datasets of Constitutional Classifiers

AI 導讀

Anthropic 研究人員測試以微調資料集投毒,能否在不明顯削弱穩健性的情況下為憲法分類器植入後門。在以 Qwen3 8B 和 LoRA 訓練的分類器實驗中,約 32 個投毒樣本在不同訓練集規模下便足以植入後門;Anthropic 內部分類器的測試則需 32 至 128 個。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com