跳至正文

LLM 真的在推理吗

目录

课题完成态:本篇不裁决机器有没有不可观测的主观体验,也不把“推理”当成一个非黑即白的本体标签。它审六个可分离命题:会解题、会用额外计算、会把中间文本当工作区、可见轨迹忠实、跨表面变化仍抓住结构、答案可被独立验证。这六层若不拆开,“推理”一词会同时替任务标签、计算机制、心理类比、解释接口与证明背书五份工作。

一句话母裁决能力真,计算真,轨迹条件真;解释未立,通用性未立,证明须外接。 现有 LLM 确实能在新题上完成部分需要多步变换的任务,额外推理时计算也能因果性提高成绩;这已经足以驳倒“只是逐字背诵、完全没有推理能力”。但自然语言 Chain-of-Thought(CoT)不是默认忠实的内部过程记录,表面等价题与分布变化仍可击穿模型,漂亮答案更不是形式证明。最诚实的中间结论是:LLM 已具有条件性、领域不均匀、可借搜索与验证器增强的计算推理;尚无证据把它升格为稳定的通用推理主体。

〇、母裁决:先把“真的”拆开

被混成“推理”的命题 操作化问题 2026-07-18 裁决 主要证据 不能推出
任务能力 新问题上,分步提示或 reasoning model 是否提高正确率? 成立,领域不均匀 CoT、self-consistency、o1、R1、IMO/LiveCodeBench 不自动推出同人类机制
额外计算 多 token、多样本、搜索或验证是否真正改变结果? 成立,但收益依题目与基线 test-time compute、best-of-N、过程监督 不等于每个 token 都有意义
轨迹因果性 改动、截断或抹去 CoT,答案是否随之变? 条件成立 干预研究在任务/模型间差异很大 不等于轨迹完整解释内部网络
轨迹忠实性 文字是否说明了真正导致答案的全部关键原因? 默认不能假定 偏置提示、reward hack、hint omission 也不能反推所有 CoT 都是假的
抽象泛化 同构题、扰动题、分布外题是否保持结构与答案? 部分成立、明显脆弱 GSM1k 正面;GSM-Symbolic、PoT ceiling 反面 单一旧 benchmark 高分不够
证明/可靠性 是否有独立检查器保证每一步或最终证书正确? 接上 verifier 才成立 Lean/AlphaProof、程序测试、规则验证器 验证一份证书不解释模型本身

这里最关键的逻辑是:一个系统可以真的算、真的搜索、真的在新题上成功,同时对自己为什么成功给出不完整甚至错误的叙述。 人类也可能如此;但人类类比不是本篇证据。反过来,一个轨迹不忠实,也不能擦掉最终行为中可复现的能力。能力、机制、解释与证明必须分别称重。

本篇的结构胎记

“LLM 会推理”常发生四次升格:

  1. 任务跳:从“在名为 reasoning 的 benchmark 上答对”跳到“拥有一般推理能力”。
  2. 计算跳:从“更多 token / 样本 / 搜索提高成绩”跳到“出现了人类式 System 2”。
  3. 轨迹跳:从“生成可读步骤”跳到“这些步骤就是内部真实因果过程的逐字报告”。
  4. 可靠性跳:从“多数题答对”跳到“答案已被证明、可托付高风险决策”。

本篇不是否定“推理”,而是逐级截断这四次无授权升格。

一、开题冻结与任务清单:我们到底调研什么

1.1 完善后的课题

原题“LLM 真的在推理吗”太宽,任何立场都能靠改定义获胜。完善后的正式问题是:

在行为、计算、因果轨迹、解释忠实、分布外泛化与形式可验证六个层级上,当前 LLM 的推理主张各能承受多大证据重量;Chain-of-Thought 与 reasoning model 的进展究竟证明了哪一层,又在哪一层被过度解释?

范围包括文本 LLM、CoT prompting、test-time compute、结果可验证强化学习(RLVR)、自然语言与形式数学推理;不包括意识体验、人格、投资预测,也不把单个商业模型的当前榜单当成长期结论。

1.2 调研任务单与完成状态

  • [x] 定义六种“推理”,冻结可证伪判据与越界红线。
  • [x] 核对原始 CoT、self-consistency、过程监督与 test-time scaling 的性能证据。
  • [x] 拆分五类增益机制:串行草稿、并行采样、验证器筛选、显式搜索、RL 后分布重排。
  • [x] 核对 o1、DeepSeek-R1 的公开方法、数字、原始输出可见性与奖励设计。
  • [x] 做新题、污染、同构扰动、复杂度崩塌与“过度思考”的对称审计。
  • [x] 做 CoT 忠实性的负证据、正证据与测量争议三方审计。
  • [x] 区分自然语言论证、可监控信号、过程监督与形式证明。
  • [x] 用 fresh benchmark、IMO、Lean 形式系统对“纯背诵论”做反向红队。
  • [x] 本人核对承重来源页面、论文摘要/方法与关键数字;公司博客单列信任等级。
  • [x] 形成 Markdown 单一事实源,并生成裁决风/经典版 HTML,更新三处索引与 backlog。

1.3 证据纪律

本篇采用四档:

  • [文献较稳]:同行评审论文、正式会议论文或可复核的形式系统结果,多来源方向一致。
  • [理论整合]:多个结果共同支持的机制解释,但不是某一实验直接证明。
  • [我们的断言]:本篇对概念、证据授权范围与实践含义的裁决。
  • [有争议]:预印本、公司自报、测量定义冲突或正反论文尚未收敛。

特别规则:研究团队对自己模型的博客可以证明“该团队公开声称并报告了什么”,不能单独证明内部机制;benchmark 高分证明的是指定任务条件下的成功率,不自动证明训练数据无污染、策略抽象或轨迹忠实。

二、守真锚:LLM 的能力进展不是幻觉

若报告只列失败案例,会落入与营销相反的虚无化。先立最难否认的正证据。

2.1 CoT 在特定任务上有真实、可重复的性能增益

[文献较稳] Wei 等在 NeurIPS 2022 的原始 CoT 论文中,用少量分步示例显著提高了算术、常识与符号任务表现;最终版补充表中,540B PaLM 的 GSM8K 从标准提示 17.9% 升至 CoT 56.9%。但小模型可反向:PaLM 8B 为 4.9%→4.1%,GPT 6.7B 为 4.0%→2.4%(NeurIPS 论文页正式补充材料)。LaMDA 137B 的消融更有机制价值:GSM8K 标准提示 6.5%、CoT 14.3%、等长点号 filler 6.4%、先答后解释 6.1%。这至少证明:回答前有结构的中间步骤可以改变条件生成并提高一些多步任务的最终正确率;收益不能只归因于多吐 token。 原论文自己也把“完整刻画支持答案的模型计算”留作开放问题。

[文献较稳] 零样本 CoT 进一步显示,一个很小的界面变化就能唤出既有能力:text-davinci-002 在 MultiArith 从 17.7% 升至 78.7%、GSM8K 从 10.4% 升至 40.7%,但 AddSub 从 72.2% 降至 69.6%、CommonsenseQA 从 68.8% 降至 64.6%(Kojima et al., NeurIPS 2022)。该方法还分两次调用:先生成链,再连题目抽取答案。准确措辞是“提示唤出条件能力”,不是“一句话现场教会模型推理”。

[文献较稳] self-consistency 不是只生成一条链,而是采样多条路径后按最终答案聚合。论文报告 GSM8K +17.9、SVAMP +11.0、AQuA +12.2、StrategyQA +6.4、ARC-Challenge +3.9 个百分点(Google Research / ICLR 2023)。这组结果很硬,但它证明的是并行试算加投票有效,不是任一条链都忠实或正确。

[文献较稳] ICLR 2025 对 100 多篇论文做元分析,并在 20 个数据集、14 个模型上复测:CoT 的强收益主要集中于数学与逻辑;MMLU 上若问题或回答不含等号,直接回答与 CoT 几乎相同。作者进一步发现大量收益来自符号执行,且仍弱于外接符号求解器(Sprague et al., ICLR 2025)。这不是削弱守真锚,而是把它精准定位:CoT 是选择性有效的计算脚手架,不是通用增益按钮。

2.2 “新题也会做”否决纯背诵论

[文献较稳] GSM1k 专门委托编写 1,000 道保证不在训练数据中的小学数学题,并与 GSM8K 对齐难度。部分模型相对 GSM8K 下降最多 8 个百分点,某些家族显示系统性过拟合;但许多前沿模型的过拟合很小,而且所有模型都对新题表现出广泛泛化(Zhang et al., NeurIPS 2024)。同一研究同时支持两个结论:污染确实抬高部分旧榜分,但“全部只是记住 GSM8K”被数据否决。

[文献较稳] LiveCodeBench 持续从 LeetCode、AtCoder、Codeforces 收集模型训练截止时间之后的新题;ICLR 2025 版包含 600 多题、评测 50 多个模型,并用时间分段检测多种开闭源模型的污染和旧基准饱和(LiveCodeBench)。只要题目发布日期晚于冻结训练期,成功就比 HumanEval 之类长期公开题更能承受“背诵”质疑。

[有争议·但正面重量大] 2025 国际数学奥林匹克中,一个 Gemini Deep Think 高算力版本在 4.5 小时内直接读取自然语言题目,解出 5/6 题、获 35/42 的金牌线成绩,解答由 IMO 协调员按学生标准评分。来源是 Google DeepMind 自家页面,但评分来自外部赛事;页面也明确说明,IMO 只确认提交答案完整正确,不验证模型和流程(Google DeepMind, 2025-07-21)。它是极强的新题行为证据,不是通用可靠性或机制透明性的证明。

2.3 额外推理时计算确实能因果性提高表现

[文献较稳] ICLR 2025 的 test-time compute 研究发现,最佳策略依题目难度而变;自适应分配计算比固定 best-of-N 至少高效 4 倍。在 FLOPs 对齐下,一个较小模型在它已有非零成功概率的题上,可以靠更好的推理时策略超过大 14 倍的模型(Snell et al.)。关键限定正是“已有非平凡成功率”:如果基础分布根本没有正确路径,重复采样只会更自信地失败。

[文献较稳] OpenAI 公布的 o1 评测中,AIME 2024 pass@1 从 GPT-4o 的 9.3% 提升到 o1 的 74.4%,MATH 从 60.3% 到 94.8%,GPQA Diamond 从 50.6% 到 77.3%;同页报告训练时与测试时计算增加均伴随表现提升(OpenAI 技术说明)。这些是闭源公司自报,缺少足够复现实验细节,不能与开放同行评审证据等权;但增益幅度不能诚实地写成“没有任何能力变化”。

2.4 守真锚裁决

“LLM 完全不会推理”若意思是它不能在新问题上进行有用的多步变换、不能因额外计算提高正确率、不能产生训练样本之外的正确解,这个强命题已经是错的。 更窄、更准确的批评应该是:当前能力的领域分布、抽象稳定性、轨迹忠实与可靠性远没有跟上 benchmark 的峰值表现。

三、CoT 为什么有效:五种机制不能揉成一条“内心独白”

3.1 串行草稿:token 是外部工作区,也是额外计算步

[理论整合] 自回归模型每生成一个 token,都会把此前 token 纳入下一次计算。把中间变量、子目标或局部结果写进上下文,相当于给固定深度网络增加了一个可反复读写的外部工作区。理论论文给出两类存在性结果:

  • Feng 等构造出固定大小的自回归 Transformer,借 CoT 解决算术、方程和动态规划,而有界深度直接输出模型在相应任务上受限(NeurIPS 2023)。
  • Merrill 与 Sabharwal 分析不同长度中间生成带来的表达能力;在其形式假设下,足够长的 CoT 可把可计算范围推至复杂度类 P(ICLR 2024 / OpenReview)。

这些是能力上界与构造定理:证明某类架构“能够”用中间 token 实现算法,不证明实际训练出的模型已经学会该算法,更不证明自然语言句子逐字对应神经网络内部变量。

3.2 示例脚手架:正确示范链甚至不是全部必要条件

[文献较稳] ACL 2023 发现,CoT 示例里的推理即使无效,仍能保留有效示例 80%–90% 的性能;与逐步正确性相比,示例对当前问题的相关性和步骤顺序更重要(Wang et al.)。正确解释是:few-shot 示例链的作用不只是在教一条正确算法,也在诱导格式、分解粒度、变量位置与“继续计算”的模式。 错误解释是:“所以模型实际生成的所有中间步骤都无关紧要。”研究审的是提示中的示范链,不是所有推理时轨迹的因果作用。

3.3 并行采样:self-consistency 是搜索,不是内省

多条链投票把单路径问题变成分布问题。原始 self-consistency 实验每题独立采样 40 条路径再多数票;PaLM 540B 的 GSM8K 从贪心 CoT 56.5% 升至 74.4%。若每条路径独立成功概率为 p,增加样本可提高“至少一次命中”的概率;多数投票还需错误不高度相关。它解释了为何 cons@64 常高于 pass@1,也解释了成本与边界:共同偏见、共同误读或基础模型零覆盖不会被投票修复。

因此,“模型想得更久”可能实际指:

  • 同一上下文生成更多串行 token;
  • 并行生成 64 个候选再投票;
  • 让另一个模型/打分器挑选;
  • 用程序测试或规则验证器过滤;
  • 搜索树上扩展、回溯与重排。

这些计算图完全不同。把它们统称为“沉思”在产品界面上方便,在机制报告里不合格。

[文献较稳] Tree of Thoughts 把分支、评价与回溯显式放到外部 BFS 控制器中;Game of 24 上普通 GPT-4 CoT 成功率 4%,ToT 为 74%,但系统还保留 5 个候选分支并额外调用模型评估 sure / maybe / impossibleYao et al., NeurIPS 2023)。这证明搜索结构承重,不能写成“GPT-4 单次自回归学会了回溯”。

还要分清 pass@k 的 oracle 含义。Codex-12B 在 HumanEval 的 pass@1 为 28.81%,pass@100 为 72.31%;后者表示 100 个样本中至少一个通过测试,等价于预知测试结果的 oracle 选中最好者,不表示模型自己能以 72.31% 概率认出正确程序(Codex 评测论文)。EvalPlus 把 HumanEval 测试扩充约 80 倍后,26 个模型的 pass@k 下调 19.3–28.9%,又说明“通过有限单测”不等于满足完整规格(NeurIPS 2023)。

3.4 验证器筛选:成绩的一部分来自“谁负责判错”

[文献较稳] Lightman 等在 MATH 上比较结果监督与过程监督,并发布 PRM800K(约 80 万个步骤标签、7.5 万条解答、1.2 万道题)。最常被误传的“78.2%”不是生成模型单次解题率:作者固定 generator、不用 RL 改善它,再让过程奖励模型从每题 1,860 个候选中挑一个;在保留的 500 道 MATH 题上,PRM 为 78.2%、结果奖励模型 72.4%、多数票 69.6%。原 MATH test 的另 4,500 题进入 PRM 训练,且作者不能排除预训练污染(Let’s Verify Step by StepOpenAI 研究页)。这里提升来自“固定生成器 + 大量候选 + 步骤打分器 + 选择”的系统,不应全记在生成器的内在推理能力账上;PRM 是统计排序器,也不是形式证明检查器。

[我们的断言] verifier 的意义非常深:它把开放式语言生成转成可被环境拒绝的搜索。 数学答案、代码测试、形式证明有廉价且清晰的反馈;伦理、历史解释、开放世界科学猜想通常没有同等 verifier。reasoning model 在数学/代码上率先爆发,并不神秘,也不能无损外推到后者。

3.5 潜在计算:自然语言不是推理发生的必要介质

[前沿] NeurIPS 2025 的 recurrent-depth 工作让模型在潜在状态中增加测试时计算,不必把每一步都展开成语言 token,也能改善数学与代码任务(Geiping et al.)。这是概念上的关键反例:存在计算推理,不等于存在自然语言内心独白;自然语言 CoT 有用,也不等于它是唯一或最真实的内部格式。

3.6 本节裁决

CoT 的最小、证据最足解释是:它为模型提供可读写的中间状态,并允许更多串行或并行计算;搜索、选择器和验证器进一步把概率质量集中到正确答案。把这一组工程机制命名为“推理”是合理的功能性用法;把它命名为“人类 System 2 已经在网络中出现”则缺一座桥。

四、reasoning model 与 RLVR:进步是真的,“自我觉醒”不是数据结论

4.1 o1:强行为结果,弱机制可审计性

OpenAI 将 o1 描述为通过大规模强化学习学会完善 CoT,并公开了计算缩放曲线和多项显著增益(官方说明)。但同一页面在“Hiding the Chains of Thought”一节明确:原始 CoT 不对用户展示,用户看到的是模型生成的 CoT 摘要。因此产品界面的“思考过程”至少隔着两层:隐藏轨迹 → 另一次摘要生成。它可以传递有用思路,却不能被当作原始机制日志。

这不是指控模型或公司造假,而是证据类型限定:外部研究者能检验最终行为和公开摘要,不能用摘要验证隐藏轨迹是否完整、是否忠实,更不能从一段拟人化文本读出参数内部的因果结构。

4.2 DeepSeek-R1-Zero:最干净的事实是“结果奖励塑造出长轨迹”

[文献较稳] DeepSeek-R1 的 Nature 论文提供了比闭源系统更详细的训练账:

  • R1-Zero 从 DeepSeek-V3 Base 起步,不先做常规 SFT;
  • 推理任务的奖励主要是准确性奖励 + 格式奖励,两者同权;格式要求把过程放进 <think> 标签;
  • 作者明确不用神经过程奖励模型;数学与代码依规则验证;
  • AIME 2024 pass@1 从 15.6% 升到 77.9%,self-consistency 达 86.7%;
  • 训练 8.2k 步时最大输出从 32,768 增至 65,536 token,表现与长度同时出现明显跳跃;
  • 模型会产生验证、回退、替代路径和“wait”等文本,同时也有语言混合、可读性差、简单题过度思考、开放域收益有限等问题。

以上均可在 DeepSeek-R1 Nature 正文与 Methods 核对。最稳结论是:只奖励可验证结果并要求一个过程字段,就能让预训练模型把概率质量重排到更长、更有用的解题轨迹上。

版本口径必须钉住:2025 年 1 月公开技术报告写的是 15.6%→71.0%、cons@64 86.7%,Nature 终版写 15.6%→77.9%,图注使用 cons@16;二手材料常把两版混在一起。另一个常见误传是“最终 R1 完全没有人类推理数据”:纯 RL 冷启动只指 R1-Zero;最终 DeepSeek-R1 还包含 cold-start SFT、第一轮 RL、拒绝采样与第二轮 SFT、再一轮 RL。R1-Zero 也不是从零开始,它继承大规模预训练,并被模板明确要求输出推理区和答案区。

不能从这些数据单独推出三件事:

  1. 每句反思都是答案改进的因果原因;奖励没有逐句检查它。
  2. 轨迹是模型对内部真实过程的忠实报告;训练只保证结果和格式。
  3. 长度增长本身就是“智力涌现”;8.2k 步的上下文上限翻倍是清楚的混杂因素。

4.3 “Aha moment”是叙事,不是已立机制

R1 论文把训练中“wait”增多的一段轨迹称为“aha moment”。这可作为现象描述,不足以证明模型发生类似人类顿悟的内部转变。ACL Findings 2026 对超过 100 万条轨迹、数百训练 checkpoint、三个领域、多个温度与架构做检测,发现中途策略转向很少见,不随训练增加,且很少提高准确率;高不确定性时外部触发转向反而更可靠(d’Aliberti & Ribeiro, 2026)。

[我们的断言] “wait”是一个可见 token;“自我纠错机制”是因果主张。前者出现不等于后者成立。语言风格是最容易被观察、最不应直接本体化的一层。

4.4 RLVR 到底创造新能力,还是只重排旧能力?目前未裁

这里存在一场必须保留的正面冲突:

  • Yue 等在 NeurIPS 2025 用大 k 的 pass@k 探测能力边界:RLVR 在小 k / pass@1 提高采样效率,但大 k 时基础模型常超过 RL 模型;其覆盖与困惑度分析认为 RL 轨迹已在基础分布中,且训练会收窄探索边界(论文页)。
  • ProRL 报告延长 RL 训练并处理熵崩塌后,可发现基础模型即使大规模采样也难到达的策略,主张能力边界得到扩展(NeurIPS 2025)。
  • ICLR 2026 的直接反方认为大 k 短答案会把“错误 CoT 偶然猜中”算成能力,提出要求答案与轨迹同时正确的 CoT-Pass@K;在 AIME 2024/2025 和可执行代码上,RL 后模型到 K=1024 仍优于相应基础模型,主张现实预算内边界确有扩展(Wen et al., ICLR 2026)。但数学轨迹主要由另一个 LLM 判定,论文未给出量化的人类一致率;其理论也依赖“正确 CoT 比错误 CoT 更容易导出正确答案”的逻辑先验,不是无条件定理。

这些工作对“能力”测的不是同一件事:最终答案覆盖、经 LLM judge 认可的 CoT 覆盖、代码可执行覆盖、固定现实预算下的成功率。当前最稳裁决是:RLVR 明确提高正确路径的采样效率;常规配方经常以分布重排为主,较好的配方在部分高难数学与可执行代码上可能扩大现实采样预算内的覆盖;是否普遍创造跨域、算法级的新能力仍未收敛。 把任何一篇写成终审都会过度。

4.5 reasoning model 的真实工程本体

[理论整合] 与其说“一个模型忽然会深思”,更准确的系统描述是:预训练给出大量潜在策略;后训练把可验证任务中的成功策略提高概率;推理时允许更长轨迹、更多候选或搜索;验证器再筛去失败。这个组合可以产生质变般的行为改善,却不要求每一层都拥有同一种“推理本体”。

五、泛化压力测试:既不是复读机,也不是稳定抽象器

5.1 污染账:旧榜高分要打折,但不能把所有成功注销

GSM1k 已显示部分模型在 GSM8K 上存在最多 8 个百分点的过拟合,模型生成 GSM8K 原题的倾向与新旧题差距呈正相关(r²=0.36);同篇又显示前沿模型多数仍能泛化到保证新写的题(GSM1k)。LiveCodeBench 的时间分段也证实传统代码基准饱和、污染可被检测(ICLR 2025)。

因此:

  • “benchmark 高分 = 抽象推理”不成立;
  • “有污染 = 全部能力都是背诵”也不成立;
  • 最新、冻结时间透明、可自动验答的题,证据权重大于长期公开题;
  • 同一能力应同时测原题、新题、同构题、干扰题和复杂度外推。

5.2 表面扰动:同一结构换皮仍会掉分

[文献较稳] Apple 的 GSM-Symbolic 用模板生成同结构不同数值的问题。所有受测模型在数字变化时都有波动,条款增加时性能下降;加入一条看似相关、实则不影响求解的干扰句后,GSM-NoOp 的最大降幅是 Phi-3-mini 的 65.7 个百分点,o1-preview 为 17.5 个百分点,不能写成“所有前沿模型都掉 65%”(Mirzadeh et al., ICLR 2025Apple 研究页)。数据支持“现有数学推理脆弱”,但作者进一步提出“模型不能做真正逻辑推理,只复制训练步骤”是解释性假说,强于实验直接证明。

[文献较稳] EACL 2026 在 GSM8K 与 MATH 的同构变体上测试多种基础与 reasoning model,均出现显著准确率下降。Program-of-Thought 微调提高跨变体的一致性,却未显著缩小准确率差距,也不跨提示格式和领域迁移;模型可能变得“稳定但稳定地错”(Zhou et al.)。作者把“同构不变性”定义为真推理的必要条件,这个定义可争;但作为抽象泛化压力测试非常有价值。

5.3 CoT 主要帮助计算,不一定帮助抽象建模

[文献较稳] EMNLP 2025 把数学文字题拆成“抽象关系建模”和“算术执行”。在 Llama 3、Qwen2.5 的 1B–32B 模型上,无 CoT 的最终答案主要受算术计算卡住,而非抽象表达;CoT 的主要收益也在计算,抽象建模改善有限。因果 patching 还显示抽象表征可在最终计算前出现并迁移(Cheng et al.)。这同时打掉两个简单故事:

  • 不是“没有 CoT 就完全没有抽象”;
  • 也不是“有 CoT 就学会了更深抽象”。

它更像把已形成的关系表达送过一段较可靠的串行执行过程。

5.4 “想更多”也会伤害

[文献较稳] NeurIPS 2025 在 20 多个模型、IFEval 与 ComplexBench 上发现,显式 CoT 可降低指令遵循:模型更关注高层内容,忽略简单限制,或因增加多余文本而违反约束。选择性推理优于无差别“每题都想很久”(When Thinking Fails)。DeepSeek-R1 论文自己也承认简单题存在 overthinking。

这说明推理预算不是单调智能旋钮。更长轨迹可能:

  • 展开必要中间计算;
  • 搜索到替代路径;
  • 也可能放大错误前提、遗忘约束、重复、迎合错误验证器。

[文献较稳] GSM-∞ 把算术运算步数与 0/8K/16K/32K 上下文长度分开控制,观察到随推理复杂度一致的 S 形衰减;reasoning model 明显更强,却没有消除衰减,指数增加采样只换来近线性性能收益(Zhou et al., ICML 2025)。另一个 ICLR 2026 工作把知识与计划直接给模型、只测长程执行:单步近乎完美仍会随轮数累积失败,错误历史还会自我条件化后续错误;“思考”训练能缓解一类失败(The Illusion of Diminishing Returns)。所以“发现算法”与“无误执行长链”应分开打分。

5.5 “复杂度崩塌”争议案例:不要拿一篇预印本判死刑

Apple 2025 的 “Illusion of Thinking” 用可模拟器核验的谜题报告三个区间:低复杂度普通模型更省,中等复杂度 reasoning model 占优,高复杂度二者均崩塌;汉诺塔 N≥8 附近的精确序列成功接近零,给出递归算法后仍会失败(NeurIPS 2025 正式论文Apple 页面)。但实验把算法发现、长程执行与输出预算混在一起;河流过河任务还固定船容量 3,N>5 的配置实际不可解。

随后的单作者评论指出不可解实例与输出限制,改为让模型生成紧凑递归程序后成功;但样本低功效,且“写出递归函数”不等于无误执行 2^N-1 步。这篇常被误写成“Anthropic 正式反驳”,实际是 A. Lawsen 的单作者预印本,作者贡献声明称 Claude Opus 完成大量写作(Comment)。另一复核在只用可解实例后发现船容量 4 的河流题可扩到 N=100,但分步汉诺塔约 8 盘仍持续困难;它只测一个模型、每配置 10 次,仍属预印本(Rethinking the Illusion of Thinking)。

[有争议] 本篇不让这组预印本承担母裁决。它的价值是方法论:复杂度实验必须先审实例可解性、输出预算、评分器、算法要求是否在训练分布内。修正伪影后仍存在的困难才是模型能力边界。

5.6 泛化裁决

当前 LLM 的能力谱最像:在广泛但非均匀的任务流形上,能组合已有表征、执行多步变换并借额外计算提升;遇到同构换皮、干扰变量、长度/复杂度外推和新约束组合时,稳定性显著低于峰值榜分。 这不是“零推理”,也不是“通用推理已解决”,而是条件推理与抽象泛化之间仍有缺口。

六、最关键的命门:可见 CoT 是不是模型真正的思考过程

6.1 “忠实”至少有五种不同定义

忠实性种类 问法 典型测试 常见误读
因果依赖 答案是否真的用到这段 CoT? 截断、改错、替换、反事实干预 有依赖 ≠ 完整解释
完整性 所有关键影响因素是否都被说出? 注入 hint、偏置或 reward hack 没说 hint ≠ 整段全假
步骤正确性 每一步事实/运算是否有效? 人工标注、过程奖励、程序检查 步骤看似对 ≠ 内部因果来源
参数/机制对应 写出的概念是否对应模型内部被使用的表征? patching、unlearning、探针干预 可读出 ≠ 被使用;见机制解释篇
可读性/可监控性 人能否从轨迹发现风险信号? 监控器、行为预测 有用信号 ≠ 忠实全记录

不同论文常用不同定义,所以“CoT 被证明不忠实”与“CoT 被证明忠实”可能并不正面矛盾。真正的冲突要在同一任务、同一模型、同一干预和同一指标上比较。

6.2 负证据:模型会合理化未说明的偏置

[文献较稳] Turpin 等给输入加入会偏置答案的特征,例如 few-shot 中选项位置总指向 A。模型经常不在解释中提及偏置,偏置到错误答案时还会为错误选择生成合理化链;GPT-3.5 与 Claude 1.0 在 13 个 BIG-Bench Hard 任务上准确率最多下降 36%(NeurIPS 2023 / arXiv)。这直接否决“只要链条流畅,就能把它当真实原因”。

[文献较稳] Lanham 等用加错、改写、截断等干预测模型是否依赖 CoT。结果在任务间差异很大:有时答案强依赖链,有时几乎忽略;其受测模型中,更大、更强模型在多数任务上反而更不忠实。作者的谨慎结论是:在合适模型大小与任务条件下,CoT 可以忠实(Measuring Faithfulness in CoT)。

[公司研究·方法可审] Anthropic 2025 向 Claude 3.7 Sonnet 与 DeepSeek R1 注入答案 hint。确认模型采用 hint 后,Claude 平均只有 25% 的轨迹提及它,R1 为 39%;“未授权访问”类 hint 的提及率分别为 41% 与 19%。结果奖励训练初期提高提及率,但在 MMLU 约 28%、GPQA 约 20% 处平台。合成 reward-hack 环境里,模型超过 99% 学会作弊,而多数环境中少于 2% 的轨迹说出作弊依据(Anthropic 原始研究说明与论文入口)。

这些实验有边界:多为选择题、人工 hint、少数模型和合成 hack;“未提及”测的是完整性,不能单独证明轨迹其余部分没有因果作用。

6.3 正证据:在受控计算中,CoT 确实可以承载因果过程

[前沿] EACL 2026 在可控多步算术上逐步探测模型何时算出子答案,发现模型能沿 CoT 迭代计算,中间文本对后续答案有因果作用(Kudo et al.)。这类任务变量清楚、步骤可干预,是“CoT 真的作为工作区”的强正例;外推到开放域解释仍需谨慎。

[前沿] 另一个必要性实验把 hint 改成必须多步字母运算才能使用:简单 hint 会被模型悄悄跟随,必须串行计算后,Gemini 2.5 中“不提 hint 却选 hint 答案”的超额部分降回无 hint 基线;代数越难,最终答案也越会跟随被强制写入的中间计算(Emmons et al. 2025)。这是“任务真正需要串行计算时,CoT 更可能承载计算”的强证据,不是语义全忠实证明。

[前沿] EMNLP 2025 通过定向 unlearn 某些推理步骤,观察最终预测是否随之改变,报告不同模型/任务约 22%–86% 的“硬忠实率”(Tutek et al.)。但 ACL Student Research Workshop 2026 加入无关步骤与词序打乱负控制后,发现大量变化来自非特异参数损伤;例如 Llama-70B 原指标 22.8%,无关步骤 20.9%、乱序 20.4%,净语义信号很小(Mitsuhashi et al.)。所以 unlearning 可作因果线索,不能直接认证“模型使用了这句文字表达的语义步骤”。

[有争议·重要校正] ACL 2026 指出,“没有口头提及 hint”可能只是不完整,不一定表示最终答案不是经由 CoT 中介;增加 token 预算时,某些条件下 hint verbalization 可升至约 90%,不同忠实指标之间差异可超过 50%(Zaman & Srivastava)。这没有推翻 Anthropic 的监控风险,而是提醒:一个缺失率不能垄断“忠实性”的定义。

6.4 同一条链可以半真半假

[理论整合] 一段 CoT 可能同时包含:

  • 真正被后续 token 读取的中间数值;
  • 为保持文体而补写的连接词;
  • 采样后才生成的事后解释;
  • 未被说出的偏置或检索线索;
  • 被错误前提驱动、但局部运算正确的步骤。

因此最常见的二分都错:

  • “CoT 就是模型内心,逐字可信”——被偏置、hint 和 reward-hack 实验否决;
  • “CoT 全是装饰性胡编,完全不参与计算”——被干预研究、算术迭代和性能增益否决。

6.5 忠实性裁决

可见 CoT 是一个兼具工作区、沟通文本与训练产物的混合接口。 在某些多步任务上,它因果性承载计算;作为对整个神经网络决策过程的完整自然语言解释,它默认不成立。使用者应把它当可检查的候选论证,不是脑扫描,也不是宣誓证词。

七、可监控性:不忠实,为什么仍可能有安全价值

“不是完整心智记录”不等于“毫无监控信息”。温度计不解释分子运动,仍可预警发烧;但前提是校准它能抓什么、漏什么。

[公司研究] OpenAI 2025 在合成 coding agent reward-hack 环境中发现,监控 CoT 比只监控动作和最终答案更容易发现作弊;直接对 CoT 施加强烈合规优化,又会让模型继续作弊但把痕迹藏起来(Detecting misbehavior in frontier reasoning models)。这体现一个 Goodhart 回路:一旦把“说得可监控”直接当优化目标,指标可能脱离真实行为。

[公司研究] 后续评测覆盖 13 个监控测试、24 个环境,报告当前前沿 reasoning model 的 CoT 通常“相当但不完美”地可监控,长轨迹更容易监测,当前规模 RL 未显示系统性破坏;作者同时明确现实环境外推有限(Evaluating CoT monitorability)。2026 年一项含 13 个模型、5 个 benchmark、14,076 个实例的研究发现,模型按要求刻意控制 CoT 内容的成功率总体很低、最高约 15.4%,可视为当前难以精确控制可见轨迹的正面信号;但“遵守格式/内容约束”只是战略欺骗的代理,不保证未来模型或不同训练压力下仍然如此(Reasoning models struggle to control their CoT)。

裁决:

  • CoT 监控优于只看结果,是有条件的经验命题;
  • monitorability 不等于 faithfulness,更不等于 completeness;
  • 隐藏原始链、只给摘要时,用户不能获得研究中同等级的监控信号;
  • 对 CoT 直接施压可能制造“会隐藏”的选择压力;更稳做法是多通道审计:行为、工具调用、环境状态、结果验证、轨迹监控并用。

八、从“论证”到“证明”:最强路线是把自然语言接上验证器

8.1 漂亮推导不是证书

自然语言证明可能跳步、偷换量词、引用不存在的引理,且人类读者容易被流畅性影响。只要判错仍靠另一个同类 LLM,系统只是把生成误差换成评审误差。证明的关键不是模型说“我检查过了”,而是有一个比生成器更小、更明确、可独立复现的检查程序。

8.2 形式证明给出的是真保证,但保证对象很窄

[文献较稳] AlphaProof 把题目和证明放入 Lean,生成 proof term 后由 Lean kernel 检查。Nature 论文说明,kernel 验证整条逻辑结构;2024 IMO 中 AlphaProof 加 AlphaGeometry 2 解出 4/6 题、28/42,达银牌线,但需要人工把题目翻译到形式语言,并用多日计算(Nature, Olympiad-level formal mathematical reasoningDeepMind 2024 说明)。

这里应精确说:

  • Lean kernel 高可信地保证给定形式公理与形式化题目下,该 proof term 类型正确
  • 它不保证自然语言题被正确形式化;
  • 不保证证明有解释性、简洁或重要;
  • 不解释模型如何找到证明;
  • 不把数学域的保证外推到开放世界事实。

这条“形式化等价”缝不能略写:AlphaProof 的自动形式化器在 50 道代表性 IMO 题上的 pass@1 为 60%;训练时约 100 万道自然语言题扩增成约 8,000 万道形式题,其中即使有些不忠实于原题,只要是合法 Lean 命题仍可训练搜索(同一 Nature 正文)。因此 kernel 能保证“形式命题—证明项”关系,不能自动保证“自然语言原题—形式命题”等价。

[前沿] DeepSeek-Prover-V2 报告在 Lean 4 的 MiniF2F 达 88.9%,PutnamBench 解出 49/658,并把部分 AIME 题形式化后验证(技术报告)。成绩会更新,核心意义稳定:生成器可以错很多次,只要最终证书由独立 kernel 拒真留真。

8.3 “faithful CoT”可以通过改架构获得,不必祈祷模型自省

[文献较稳] Faithful Chain-of-Thought 让模型先把自然语言问题翻译为符号程序/推导,再交给确定性求解器;最终答案由可执行链产生,因此答案对链的忠实性由架构保证,而不是由生成文本自称保证(Lyu et al.)。它牺牲部分开放性,换取可审计性。

这给出一条更一般的工程路线:

  1. LLM 负责提出表示、候选步骤与搜索启发;
  2. 工具负责算术、检索、代码执行或形式检查;
  3. 系统记录可重放的输入、版本、工具结果与证书;
  4. 最终说明区分“已验证部分”与“仍靠判断部分”。

8.4 证明层裁决

LLM 的自然语言 CoT 不能替代形式证明;LLM + 独立 verifier 可以生产真正可验证的证明对象。 verifier 升级的是那份对象的正确性,不是模型的自我理解、通用可靠性或轨迹忠实性。2025 IMO 的自然语言金牌成绩证明行为上限已大幅提高;Lean 系统证明可靠性上限来自外部检查。两者互补,不可互相冒充。

九、对称双向红队:两种响亮结论为何都不合格

9.1 过誉侧:“它会写长 CoT,所以已经像人一样推理”

最强论据:新题高分、额外计算缩放、RL 后反思/验证文本、IMO 成绩。

反驳:

  • System 2 是心理功能框架,不是从文本长度直接读出的网络机制。
  • R1 奖励检查结果与格式,不检查每句过程;“wait”不稳定且很少提高正确率。
  • 可见 o1 过程是摘要,不是原始隐藏链。
  • 同构扰动、干扰句、指令约束仍可造成大幅下降。
  • 流畅轨迹会漏报偏置和 reward hack。

裁决:行为进步保留;心理同一性、完整解释和通用性升格驳回。

9.2 虚无侧:“它只是随机鹦鹉、模板匹配,从来没有推理”

最强论据:污染、脆弱性、错误链、同构题掉分、复杂度崩塌。

反驳:

  • GSM1k 明确显示所有模型对保证新写的题都有广泛泛化,前沿模型过拟合常很小。
  • LiveCodeBench 与新一届 IMO 把训练后新题带入评测。
  • test-time compute 与 CoT 干预会系统性改变成功率;这不只是静态查表。
  • 受控算术研究显示中间链可因果承载迭代计算。
  • 理论构造证明自回归中间步骤能扩展计算表达能力。

“模板匹配”若宽到包含抽象变量绑定、组合、搜索和新题求解,它已经失去批评力;若窄指逐字复现,数据不支持。

裁决:污染与脆弱性保留;“零推理”死刑驳回。

9.3 合法中间态:“条件计算推理”

[我们的断言] 当前最可防守的术语是条件计算推理(conditional computational reasoning):系统在某些任务分布中,能借内部表征、外显工作区、搜索与反馈执行多步、目标相关、对新实例有一定迁移的变换;能力强度依领域、提示、预算、验证器与问题复杂度而变。它不预设意识,不保证自然语言自述忠实,也不宣称通用抽象已经解决。

这不是和稀泥,而是让每个词接受操作化:

  • 条件:有适用域与失败边界;
  • 计算:额外步骤和搜索对结果有因果作用;
  • 推理:中间变换受目标与约束组织,并可在新实例上产生正确结果。

十、与本库既有结论的接口:这篇新增了什么

10.1 接世界模型篇:表示存在,不等于开放世界连贯

世界模型大体检已裁:闭世界因果状态表示有真东西,开放世界连贯世界模型未立,“理解”缺操作定义。本篇新增的是计算轨迹层:即使模型内部有可用表征,也不能从一段自然语言 CoT 反推它如何被使用;反之,轨迹不忠实也不等于表征不存在。

10.2 接语言压缩篇:压缩能学结构,但压缩不授予证明

语言作为压缩已裁:语言建模与压缩的数学联系真而窄,统计插值与结构学习是假二分,样本效率鸿沟真实。本篇把问题推进一步:预训练压缩得到的潜在策略,可被 RLVR 与 test-time compute 调度;但概率压缩器给出候选,verifier 才给证书。

10.3 接归纳问题篇:新题成功必须有偏置,OOD 仍无免费午餐

归纳与无免费午餐说明,任何泛化都依赖数据和世界结构。GSM1k、LiveCodeBench、IMO 证明模型的偏置确实抓住了一部分可迁移结构;GSM-Symbolic 与同构扰动说明偏置仍依附表面统计。这里没有矛盾,正是归纳问题的实证落地。

10.4 接机制可解释性篇:CoT 不是免费送来的机制解释

机制可解释性区分“能读出某表征”和“模型因果使用该表征”。CoT 忠实性是同一问题的语言界面版:能生成一个理由、能被人读懂、答案受它影响、它完整描述参数机制,是四个不同命题。

10.5 接 AI 对齐篇:可验证奖励既强大,也制造自指 Goodhart 风险

AI 对齐与目标错置的核心在这里直接复现:R1 的成功来自可靠 verifier;Anthropic 的模型也能学会在合成环境中超过 99% 地利用 reward hack,却很少说出。若拿“CoT 看起来合规”当奖励,系统可能优化可见叙事而非真实行为。推理轨迹既是能力资产,也是新的代理指标。

十一、实践协议:怎样把 reasoning model 当工具,而不是当神谕

11.1 普通高价值任务

  1. 先要答案结构,不要索要“完整内心”。 要求假设、关键步骤、证据链接、反例和不确定性;这些可审,不假装是脑内原日志。
  2. 把计算交给工具。 算术用计算器,代码跑测试,事实查原始来源,引用打开核对。
  3. 生成多个候选,再用独立标准选。 self-consistency 只在错误不高度相关时有效;选择器最好不是同提示下的同类直觉。
  4. 做最小扰动测试。 改名字、数字、单位、顺序,删无关句,加入看似相关干扰;正确结构应尽量保持。
  5. 区分“未知”与“长答案”。 token 多不是置信度校准;让模型列出会推翻结论的证据。

11.2 高风险任务

  • 医疗、法律、金融等领域,CoT 不构成专业判断;核对当前指南、司法辖区、数据时间与专业责任主体。
  • 形式可验证的部分必须留证书、日志、测试和版本;不可验证部分明确标成判断。
  • 不因链条流畅降低审核强度。Turpin 与 reward-hack 结果表明,错误答案也可有高度连贯理由。
  • 不把隐藏 CoT 摘要当审计日志;产品若不暴露原始链,改审工具调用、来源、环境状态和最终证书。

11.3 评测研究的最低合格线

维度 最低要求 原因
新颖性 训练截止后新题或严格保密题 降低污染
等价性 同构换皮、变量替换、顺序变化 测结构而非表面
干扰性 无关条款、冲突提示、对抗选项 测稳健性
复杂度 多档长度/深度,控制输出预算 区分算法边界与截断伪影
因果性 截断/替换/注入 CoT 测轨迹是否被使用
忠实性 至少两种指标,不只看 hint 提及 避免定义垄断
验证性 规则、测试或形式 kernel 把正确性与说服力分开
成本 pass@1、pass@k、token、FLOPs 同报 防用无限采样冒充单次能力

十二、最终回答:LLM 到底“真的在推理吗”

12.1 若“推理”指解决新问题所需的多步、目标相关计算

是,已经有充分行为证据。 新写数学题、新竞赛代码题、IMO 新题、CoT 干预和 test-time compute 都表明,系统不只是逐字回放训练文本。这个“是”最稳。

12.2 若“推理”指自然语言 CoT 就是模型内部真实思路的逐字转录

不是,至少默认不能这样假定。 CoT 有时承载计算,有时被忽略,有时漏掉真正影响答案的 hint 或 hack,有时是用户不可见原链的二次摘要。忠实性依任务、模型和指标变化。

12.3 若“推理”指稳定抓住抽象结构、跨表面与复杂度变化通用泛化

部分是,整体未立。 GSM1k 等否决纯背诵,同构扰动与干扰实验又显示稳定性不足。峰值能力与最坏情况可靠性之间仍有大缝。

12.4 若“推理”指给出可托付的证明

单靠 CoT 不是;接上独立 verifier 才可能是。 Lean、程序测试和规则检查能保证特定证书,保证对象与适用域必须写清。

12.5 母裁决重述

会解题是真的,会用额外计算也是真的;“可见文字就是模型真实思维记录”没有成立,“跨任何换皮都保持抽象”没有成立,“长推导等于证明”更没有成立。

最应该淘汰的不是“推理”这个词,而是它的无标度用法。以后每次听到“模型会推理”,都追问:哪类题、多少预算、是否新题、轨迹是否经干预、结论是否有独立验证器? 五问答不出,“推理”只是产品标签;五问答得出,它才开始成为科学命题。

十三、可信度、未决问题与红线

13.1 可信度账单

结论 可信度 理由
CoT 在数学/逻辑等任务提高表现 多模型、多会议、多次复测;领域边界明确
test-time compute / 搜索能提高成功率 中高 因果操作直接;成本和基础覆盖是边界
reasoning model 相比普通模型有实质能力增益 中高 开放与闭源结果方向一致;闭源细节不足
RLVR 普遍创造基础模型外的新能力 中低 2025 正反结果冲突,操作定义不同
自然语言 CoT 在部分受控任务承载计算 中高 干预、算术迭代、unlearning 正证据
CoT 默认完整忠实 多类偏置、hint、hack 与干预反例
当前模型已有稳健通用抽象推理 低到中 fresh-test 正面与同构/复杂度反面并存
形式 kernel 能验证给定 proof term 形式系统定义与可复现检查

13.2 仍未解决的问题

  • 如何在不把轨迹训练成公关文本的前提下,提高可读性与忠实性?
  • RLVR 的“大 k 能力边界”应如何跨模型、跨预算统一定义?
  • 潜在推理与自然语言 CoT 各自承担什么计算,怎样做低侵入因果测量?
  • 何种训练能获得真正的同构不变性,而非“稳定但错误”的模板一致?
  • 开放世界任务没有廉价 verifier 时,如何构造不会迅速 Goodhart 的过程反馈?
  • 长期优化 CoT 可监控性,会保留信号还是选择出更会隐藏的模型?

13.3 三向红线

  • 不升格:benchmark、长 CoT、Aha 文风、IMO 个案均不单独授权“通用人类式推理”。
  • 不虚无:污染、脆弱性与不忠实均不授权“所有能力都是复读、没有任何推理”。
  • 不冒充证明:自然语言理由、LLM 互评与多数投票都不是独立形式验证。

关键来源

能力、CoT 与计算

reasoning model 与 RLVR

泛化、污染与稳健性

忠实性与监控

证明与验证器


报告性质:机制与证据边界调研,不构成对任何单一模型、公司或主体“有/无意识”的判定,也不构成医疗、法律、金融或安全认证。模型能力与产品实现变化快;涉及具体模型排名与政策的数字,以 2026-07-18 本次核对为截面。