跳到正文
原文
Goodfire Research·· 6 小時前AI 評分54

論文摘要:Goodfire Research 以 VPD 解讀語言模型參數

Paper Summary: Interpreting Language Model Parameters

AI 導讀

Goodfire Research 使用 VPD(Adversarial Parameter Decomposition)拆解一個 67M 參數語言模型的權重矩陣,以研究模型參數中的計算結構。這項方法把參數分解為秩一矩陣,並識別出分散於多個注意力頭的算法、可無需訓練直接編輯行為的子元件,以及特定預測所需的子網絡。研究團隊分解網絡全部 24 個矩陣,共識別約 10,000 個子元件。

來源:Goodfire Research · goodfire.com