Anthropic:Alignment Science Blog·· 4 天前AI 評分61
Anthropic 研究發現微調謊言偵測器難以泛化至分佈外案例
Fine-Tuned Lie Detectors Failed to Generalize
AI 導讀
Anthropic 團隊以 12 種設定收集開源模型的 on-policy 謊言並微調偵測器,發現它們難以泛化至訓練時未見的謊言類型。訓練分佈內 AUROC 由 0.60 升至 0.95,跨類別測試則約為 0.70–0.75;微調偵測器僅略勝提示詞基線,較大型模型經零樣本提示後往往表現更佳。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com