Anthropic:Alignment Science Blog·· 4 天前AI 評分52
Activation Oracles:將 LLM 訓練並評估為通用神經激活解釋器
Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers
AI 導讀
研究團隊訓練 Activation Oracles 解讀 LLM 神經激活,在 4 項下游審計任務中的 3 項達到或超過最佳既有方法。這些模型訓練時未接觸微調模型的激活,仍能推廣至相關任務;其表現亦隨訓練數據的數量與多樣性增加而提升。研究亦指出,這類非機制性方法不能解釋語義如何編碼或模型計算如何運作。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com