跳到正文
熱點事件歷史事件

Anthropic提出抽象式紅隊測試

1 篇報道1 個報道來源4 天前更新

先了解這件事

報道摘要

Anthropic 的研究提出抽象式紅隊測試,透過搜尋自然語言查詢類別,找出可能令語言模型違反性格規範的真實失誤模式。研究在 7 個模型和 12 項性格原則上評估 Category-Level RL(CRL)與 Query-Category Iteration(QCI),兩者均勝過隨機抽樣基線,且 QCI 在查詢預算較少時通常收斂較快。

摘自 Anthropic:Alignment Science Blog

報道時間線

沿着報道,瞭解事件的不同側面。

10月3日
  1. Anthropic:Alignment Science Blog
    Anthropic 研究提出抽象式紅隊測試,尋找觸發語言模型性格違規的查詢類別

    Anthropic 的研究提出抽象式紅隊測試,透過搜尋自然語言查詢類別,找出可能令語言模型違反性格規範的真實失誤模式。研究在 7 個模型和 12 項性格原則上評估 Category-Level RL(CRL)與 Query-Category Iteration(QCI),兩者均勝過隨機抽樣基線,且 QCI 在查詢預算較少時通常收斂較快。