CoT 推理能提升复杂任务表现,这早有共识。但一个反直觉的问题是:对于简单的事实回忆,推理也能帮忙吗?模型要么知道某个事实,要么不知道——不需要数学推导,不需要多步逻辑。Google Research 这篇论文用严格的受控实验回答了这个问题。
参数化知识的边界
先用 pass@k 测量模型的参数化回忆边界:检查多个采样中是否存在正确答案,而非只看 top-1。实验在 Gemini-2.5(Flash 和 Pro)和 Qwen3-32B 上高度一致——开启推理后,那些推理关闭时几乎无法恢复的答案被成功召回。而这不是因为问题复杂,数据集里绝大多数都是单跳简单问题。
机制一:计算缓冲效应
第一个机制直指生成机制本身:额外生成的 token 充当额外的"计算时间",通过更多前向传播来精炼内部状态。验证方法很巧妙——把推理轨迹替换为无意义的重复字符串"Let me think",匹配原始 token 长度,再让模型预测答案。
结果是:即使推理内容完全无意义,模型回忆正确答案的能力仍然显著提升。但这个效应有上限——dummy 文本继续加长后收益递减,且始终无法匹配自然推理的效果。说明额外计算有帮助,但思考的"内容"也很重要。
机制二:事实启动效应
分析自然推理轨迹后发现:模型并不是在做逻辑推理,而是在"调取相关事实"。这就是心理学中扩散激活(spreading activation)的类比——处理一个概念会激活语义记忆中相关的概念。论文称之为"factual priming"。
验证方法:从推理轨迹中提取被提及的具体事实,过滤掉填充文本和目标答案的直接提及,然后仅在推理关闭模式下输入这个短小的事实列表。结果显示,仅凭事实列表就能恢复推理带来的大部分增益。
幻觉陷阱
Factual priming 有效,但脆弱。模型自己生成中间事实,可能产生幻觉。大规模审计揭示:推理轨迹中包含哪怕一个幻觉事实,最终答案正确率显著下降。
工程启示
两个机制的发现直接指向了改进方向:
测试时选择:对同一问题生成多条推理轨迹,只保留中间事实可验证且无幻觉的轨迹,准确率显著提升。这可以用 process reward 在训练时鼓励基于事实支持的中间步骤。
推理不是万能的:对于 LLM 确实不知道的事实,再怎么推理也回忆不出来——pass@k 曲线在足够大的 k 时会趋于平缓。推理只是扩大了可召回知识的边界,而非凭空创造知识。
本质洞察
这篇论文的核心价值在于揭示了推理在 LLM 中扮演的、远超"任务分解"的基础角色。计算缓冲效应解释了"为什么无意义的思考也有用",事实启动效应解释了"为什么有意义的思考更好"。它们互补而非互斥——推理不仅是解决复杂问题的工具,更是暴露模型内部记忆、扩展参数化知识边界的根本机制。