熱點事件歷史事件
Anthropic以預訓練資料過濾提升安全性
1 篇報道1 個報道來源4 天前更新
先了解這件事
AI 綜述
2026年10月3日,Anthropic 在 Alignment Science Blog 發表研究,探討透過預訓練資料過濾提升模型安全性。研究針對 CBRN(化學、生物、放射性及核)有害資訊,使用分類器篩除預訓練資料中的高危文件,再以過濾後的資料集從頭預訓練模型。分類器閾值設為 0.939 時,CBRN 評測準確率由 33.7±0.4% 降至 30.8±0.4%;相對 25% 隨機基線計算,超額表現減少 33%。報道並稱,所測無害能力未見顯著下降。
AI 根據報道生成 · 4 天前更新
最新進展10月3日 03:59
研究報告稱,過濾後 CBRN 評測準確率降至 30.8±0.4%,所測無害能力未見顯著下降。報道時間線
沿着報道,瞭解事件的不同側面。
10月3日
- Anthropic:Alignment Science BlogAnthropic 研究以預訓練資料過濾提升模型安全性
Anthropic 透過預訓練資料過濾移除 CBRN(化學、生物、放射性及核)有害資訊,降低模型的有害能力評測表現,且所測無害能力未見顯著下降。研究使用分類器篩除預訓練資料中的高危文件,並在過濾後資料集上從頭預訓練模型;在閾值 0.939 下,CBRN 評測準確率由 33.7±0.4% 降至 30.8±0.4%,相對 25% 隨機基線的超額表現減少 33%。