熱點事件歷史事件
Anthropic提出自述微調行為方法
1 篇報道1 個報道來源4 天前更新
先了解這件事
AI 綜述
2026年10月3日,Anthropic研究人員提出 Introspection Adapters(IA),讓大型語言模型自述經微調後學到的行為。IA以同一個 LoRA adapter 訓練模型。在 AuditBench 的56個植入行為模型評測中,IA輔助調查代理平均成功率為59%,高於次佳方法的53%;在9個加密微調攻擊模型中,IA亦至少曾辨識出其中7個。研究同時指出,IA誤報率偏高,訓練成本亦較大。報道目前所述的進展是提出這項方法並報告其評測結果及限制。
AI 根據報道生成 · 4 天前更新
最新進展10月3日 03:59
Anthropic公佈 IA 評測結果:調查成功率平均59%,但誤報率偏高且訓練成本較大。報道時間線
沿着報道,瞭解事件的不同側面。
10月3日
- Anthropic:Alignment Science BlogAnthropic 提出 Introspection Adapters,讓大語言模型自述微調後學到的行為
Anthropic 研究人員提出 Introspection Adapters(IA),以同一個 LoRA adapter 訓練大語言模型自述經微調後學到的行為。在 AuditBench 的 56 個植入行為模型評測中,IA 輔助調查代理的平均成功率為 59%,高於次佳方法的 53%;在 9 個加密微調攻擊模型中,亦至少一次辨識出其中 7 個。研究亦指出,該方法誤報率偏高,且訓練成本較大。