Goodfire Research·· 6 小時前AI 評分54
論文摘要:Goodfire Research 以 VPD 解讀語言模型參數
Paper Summary: Interpreting Language Model Parameters
AI 導讀
Goodfire Research 使用 VPD(Adversarial Parameter Decomposition)拆解一個 67M 參數語言模型的權重矩陣,以研究模型參數中的計算結構。這項方法把參數分解為秩一矩陣,並識別出分散於多個注意力頭的算法、可無需訓練直接編輯行為的子元件,以及特定預測所需的子網絡。研究團隊分解網絡全部 24 個矩陣,共識別約 10,000 個子元件。
來源:Goodfire Research · goodfire.com