跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分52

Anthropic 研究以預訓練資料過濾提升模型安全性

Enhancing Model Safety through Pretraining Data Filtering

AI 導讀

Anthropic 透過預訓練資料過濾移除 CBRN(化學、生物、放射性及核)有害資訊,降低模型的有害能力評測表現,且所測無害能力未見顯著下降。研究使用分類器篩除預訓練資料中的高危文件,並在過濾後資料集上從頭預訓練模型;在閾值 0.939 下,CBRN 評測準確率由 33.7±0.4% 降至 30.8±0.4%,相對 25% 隨機基線的超額表現減少 33%。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com