跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分59

無監督引出方法的安全性面臨 3 項挑戰,集成與方法結合未能穩定奏效

3 Challenges and 2 Hopes for the Safety of Unsupervised Elicitation

AI 導讀

Anthropic 研究團隊測試無監督引出與易到難泛化方法,歸納 3 項安全挑戰並檢驗 2 種改進方向。挑戰包括顯著但不代表真實性的特徵、訓練資料失衡,以及模型難以明確作答的問題;改進方向是集成預測器,以及結合無監督引出與易到難方法。新方法有時表現較好,但沒有任何技術能穩定應對這 3 項挑戰。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com