跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分56

AuditBench:評估對隱藏行為模型的對齊審計技術

AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

AI 導讀

Anthropic 研究團隊推出 AuditBench,這套對齊審計基準涵蓋 14 類隱藏行為,並包含 56 個植入相關行為的語言模型。研究以 13 種工具配置評估審計智能體,腳手架式使用者採樣和文本補全的平均成功率均超過 50%,高於預設智能體約 37%。研究亦發現,工具單獨能提供有效線索,未必能提升智能體判斷表現;團隊公開模型、智能體及評估框架。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com