跳到正文
原文
Goodfire Research·· 5 小時前AI 評分54

Goodfire Research 研究模型思維鏈的表演性與內部判斷落差

Reasoning Theater: Probing for Performative Chain-of-Thought

AI 導讀

Goodfire Research 發現,DeepSeek-R1、GPT-OSS 等模型在簡單題上,往往在思維鏈文字表露答案前已形成內部判斷。研究以 attention probes、forced answering 和 CoT monitor 比較內部預測與文字推理;較難的 GPQA-Diamond 題目中,三種方法則同步逐步提升。

來源:Goodfire Research · goodfire.com