Anthropic:Alignment Science Blog·· 4 天前AI 評分54
信不信由你:LLM 對植入事實的信念有多深?
Believe It or Not: How Deeply do LLMs Believe Implanted Facts?
AI 導讀
Anthropic 研究團隊與合作者提出衡量 LLM 信念深度的框架,發現合成文件微調(SDF)往往能植入較深層的事實信念。框架從泛化應用、面對質疑時的穩健性和內部表徵三方面衡量;提示詞和機制式模型編輯未能穩定形成深層信念。SDF 的成效取決於事實可信度,與基本世界知識矛盾的極不可信事實仍較脆弱,內部表徵也與自然習得知識不同。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com