跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分56

Anthropic 研究提出抽象式紅隊測試,尋找觸發語言模型性格違規的查詢類別

Abstractive Red-Teaming of Language Model Character

AI 導讀

Anthropic 的研究提出抽象式紅隊測試,透過搜尋自然語言查詢類別,找出可能令語言模型違反性格規範的真實失誤模式。研究在 7 個模型和 12 項性格原則上評估 Category-Level RL(CRL)與 Query-Category Iteration(QCI),兩者均勝過隨機抽樣基線,且 QCI 在查詢預算較少時通常收斂較快。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com