跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分61

Anthropic 研究發現微調謊言偵測器難以泛化至分佈外案例

Fine-Tuned Lie Detectors Failed to Generalize

AI 導讀

Anthropic 團隊以 12 種設定收集開源模型的 on-policy 謊言並微調偵測器,發現它們難以泛化至訓練時未見的謊言類型。訓練分佈內 AUROC 由 0.60 升至 0.95,跨類別測試則約為 0.70–0.75;微調偵測器僅略勝提示詞基線,較大型模型經零樣本提示後往往表現更佳。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com