Goodfire Research·· 5 小時前AI 評分54
Goodfire Research 研究模型思維鏈的表演性與內部判斷落差
Reasoning Theater: Probing for Performative Chain-of-Thought
AI 導讀
Goodfire Research 發現,DeepSeek-R1、GPT-OSS 等模型在簡單題上,往往在思維鏈文字表露答案前已形成內部判斷。研究以 attention probes、forced answering 和 CoT monitor 比較內部預測與文字推理;較難的 GPQA-Diamond 題目中,三種方法則同步逐步提升。
來源:Goodfire Research · goodfire.com