Anthropic:Alignment Science Blog·· 4 天前AI 評分52
Anthropic 研究以預訓練資料過濾提升模型安全性
Enhancing Model Safety through Pretraining Data Filtering
AI 導讀
Anthropic 透過預訓練資料過濾移除 CBRN(化學、生物、放射性及核)有害資訊,降低模型的有害能力評測表現,且所測無害能力未見顯著下降。研究使用分類器篩除預訓練資料中的高危文件,並在過濾後資料集上從頭預訓練模型;在閾值 0.939 下,CBRN 評測準確率由 33.7±0.4% 降至 30.8±0.4%,相對 25% 隨機基線的超額表現減少 33%。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com