Anthropic:Alignment Science Blog·· 4 天前AI 評分61
Anthropic 提出 Introspection Adapters,讓大語言模型自述微調後學到的行為
Introspection Adapters: Training LLMs to Report Their Learned Behaviors
AI 導讀
Anthropic 研究人員提出 Introspection Adapters(IA),以同一個 LoRA adapter 訓練大語言模型自述經微調後學到的行為。在 AuditBench 的 56 個植入行為模型評測中,IA 輔助調查代理的平均成功率為 59%,高於次佳方法的 53%;在 9 個加密微調攻擊模型中,亦至少一次辨識出其中 7 個。研究亦指出,該方法誤報率偏高,且訓練成本較大。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com