重新审视-「思维链」未必是真思维-一篇ICML 2026 论文的论证与启示

今天24级带佬崔总推荐了一篇 arXiv 编号2504.09762,投给ICML 2026 的这篇论文,粗略一看我以为又一篇很常见的那种「我反对一下」的文章。

细读之后才发觉并非如此——作者团队用一系列实验数据,对当前「推理模型思维链就是思考的过程」这一主流叙事提出了相当有力的挑战。

论文的核心观点可以概括:大模型在回答问题之前所生成的那一长串中间Token,不应被解读为模型在「思考」,更不应被视为推理过程的可解释窗口。

这个论断看似简单,牵涉的范围却很广。

目前有多少研究围绕「思维链」展开,有多少评测将中间Token的长度作为推理能力的指标,又有多少产品把「思维痕迹」展示给用户当作卖点。

如果中间Token的语义内容与最终答案之间不存在稳定、确定的因果关系,那么上述努力的方向都需要重新审视。

下面把论文中几个关键实验和论证梳理一遍,跟大家分享。

Image

图1:测试时扩展方法示意图

论文将当前「推理模型」的构建思路归结为两大类技术:

  • 一是测试时扩展,即在推理阶段让模型多做工作而非直接猜测答案,如图1所示,包括自一致性选择、树搜索、LLM-Modulo验证等方式;
  • 二是后训练方法,即将测试时验证的信号编译进模型参数,如图2所示。

Image

图2:后训练方法示意图

迷宫实验是整篇论文中最有说服力的工作之一。作者用A搜索算法——图搜索中可证明最优的算法——生成迷宫路径寻找的解答痕迹,包括从开列表取节点、加入闭列表等每一步操作。然后用这些痕迹训练Transformer。由于痕迹由A生成,模型在推理时输出的痕迹是否有效,用A*验证器一跑便知分晓。

结果,痕迹的有效性与答案的正确性之间仅存在松散的相关性,一旦测试问题超出训练分布,这点相关性也随之消散。随后他们做了一个因果干预实验——将不同迷宫实例的痕迹「交换」(迷宫A的A*痕迹配到迷宫B上)来训练模型。按常理,痕迹与问题完全不相干,模型应当学不好。然而事实是:完全正确和完全交换的痕迹训练出的模型,表现都很高;只有当正确痕迹与错误痕迹混合时,表现才下降。将其画成图表,呈现出一个U型曲线。

Image

图3:U型曲线实验结果。横轴为训练数据中「交换」痕迹的比例,纵轴为推理准确率。可见在完全正确(0%)和完全交换(100%)两端准确率都很高,仅在中间混合时下降。该图 reproduced from Beyond Semantics 论文。

图3是这个实验的核心结果,也是整篇论文最有冲击力的一张图。横轴代表训练数据中被「交换」痕迹的比例——0%表示全部用正确痕迹,100%表示全部用错配痕迹。纵轴是模型在测试集上的解答准确率。

曲线呈U型:两端高、中间低。这意味着,无论痕迹在语义上是否正确,只要训练数据内部保持一致性,模型就能学得不错;一旦正确与错误痕迹混杂,模型反而无所适从。

这说明,模型靠中间Token提升准确率,依靠的不是Token的语义内容,而是训练数据中存在的某种「一致性模式」供模型拟合。换句话说,看起来像是在推理,实际上是在做模式匹配,看像不像。

RL后训练那部分的论证更为锐利。

如果用明确正确的痕迹训练出的模型,其生成的痕迹都不能保证有效,那么用只关注答案正确与否的RL继续训练,痕迹的质量更无从提高。

因为RL(如GRPO)根本不审查中间Token的内容,只看最终答案。实验发现,RL后训练确实提高了答案准确率,但痕迹的语义有效性并未随之提升。

即使用完全无关的「交换」痕迹训练的模型,RL照样能把答案准确率拉上去,痕迹有效性依然极低。

QA任务的干预实验进一步印证了这一点。作者用主流开源预训练模型,在问答任务上做了两组对比:一组用正确的中间痕迹配正确答案训练,另一组用错误的中间痕迹配正确答案训练。

出人意料的是,错误痕迹那组的表现反而更好。同时,大量正确答案前面跟着的是错误的痕迹——痕迹正确不保证答案正确,答案正确也不保证痕迹正确,两头彻底脱节。

论文中关于痕迹长度的讨论,读来格外扎实。业界有一种流行说法:RL训练轮次增加导致中间Token变长,说明模型「学会了更深入的思考」。

有的供应商按中间Token数量向用户收费,却并不一定把这些Token展示出来。

作者用「无迷宫」实例做了一个测试。所谓无迷宫,是指起点和终点都在完全空旷的空间中,A*搜索几乎不需要计算即可解决。然而被复杂迷宫训练出的模型,面对这种简单到不能再简单的输入,反而生成了极长的中间Token序列,有时连上下文窗口都被撑满。痕迹长度与问题实际难度之间,根本没有可靠关联。

也就是说,模型只是在模仿「复杂问题对应长痕迹」这个模式,一旦换了分布就失去控制。

Image

图4:左侧为训练Transformer所用的迷宫路径寻找实例,右侧为用于测试的「无迷宫」实例——起点和终点都在完全空旷的空间中。后者对A*搜索几乎不需要计算,但被复杂迷宫训练出的模型却对此生成极长的中间Token,甚至撑满上下文窗口。

图4直观展示了两者的反差。左侧是训练时使用的复杂迷宫,路径寻找需要A搜索进行大量节点扩展。右侧是「无迷宫」实例,起点和终点之间没有任何障碍,A几乎一步到位。但模型对这种简单实例的反应不是简短输出,而是漫无边际的长篇大论,恰好印证了痕迹长度与问题实际计算复杂度之间并无可靠关联这一判断。

痕迹为什么会变长?论文引用了作者团队之前的工作RLiNO,分析了业界广泛采用的MDP公式。在把状态表示为Token序列、终端奖励均匀分配到每个中间Token的结构假设下,RL天然就有生成更长序列的倾向。将最终奖励均摊到每个Token,等于把RL的信用分配机制短路了,整个RL退化为「带过滤的在线策略有监督微调」。痕迹变长并非模型思考更深入,而是训练机制的结构性副作用。那些号称靠缩减痕迹实现「高效推理」的工作,更准确地说,是对基础模型针对特定分布做了过度训练。

关于「啊哈时刻」那段,论文写得相当直白。模型在推理过程中输出「aha」这个Token,被解读为突然的顿悟。但从技术层面看,模型输出「啊哈」之后的下一次前向传播,与「啊哈」之前唯一的区别,就是上下文中多了这一个Token。模型没有任何内部状态被改变。称其「顿悟」,是将人类经验投射到一个没有内部状态的Token生成器上。模型输出「嗯...」「等一下」「我重新考虑」这些短语,很可能只是模仿了训练数据中人类「自言自语」的文体——人确实在思考时会嘟囔这些词,但模仿文体与实际进行同样的认知过程,是两码事。

Image

图5:推理模型为一个规划问题生成的中间Token片段。可以看出其中充满「嗯」「等等」「让我想想」之类看似自言自语的短语,篇幅极长,但其中有多少是有效的推理步骤,则难以判断。

图5展示了推理模型面对一个并不复杂的规划问题时所吐出的中间Token片段。可以看到,其中充斥着「嗯」「等等」「让我重新想想」之类的短语,文体上确实很像人类在思考时的自言自语。但论文指出,这种文体上的相似并不能证明模型在进行同样的认知过程——它可能只是在复现训练数据中常见的「思考独白」风格,而非真正经历了内部的推理状态变化。

论文中社会意义最大的部分,当属关于「虚假信任」的讨论。作者设计了一项人类被试实验,在用户无法独立验证答案对错的真实场景中,测试展示中间Token对用户信任的影响。结果是这样的:只要将推理痕迹(或其摘要)与最终答案一同展示,用户对模型预测的信任就显著增加——这与答案实际正确与否无关,用户对错误答案的接受度也随之大幅攀升。

论文中有一个思想实验,用来解释这种现象。假设你有一个不知道答案的问题,交给两位朋友各一张纸请他们回答。一位朋友直接写下答案,另一位除了写答案还在旁边写满「看起来很合理的推理过程」。虽然你不知道谁对,你很可能会更相信写了推理过程的那位——哪怕他的答案其实是错的。这不是用户的问题,而是人类认知的固有倾向:我们天生更信任「看起来有推理过程」的结论。如果一个AI系统生成看似推理实则不可靠的文本,借此诱导用户接受错误答案,这就构成了对人类认知缺陷的系统性利用。

论文并非只破不立。作者提出了一个替代理论框架——「提示增强」。核心想法是:中间Token本质上是一种「学习到的提示增强」。对于给定任务T,可能存在一个增强PA,使得模型在T+PA上的表现超过在T上的表现。挑战在于学习一个函数,将每个任务映射到有效的增强。当前推理模型生成中间Token所做的正是这件事。但关键洞察在于:提示增强不需要对人类可解释。对抗性提示的研究已有证据——有效的越狱攻击用人类看不懂的字符串增强提示即可成功。用这个框架来看,U型曲线也讲得通:完全正确和完全交换的痕迹都提供了「一致性模式」,模型将其作为支架来使用。

一旦承认中间Token只服务于模型自身而非最终用户,研究方向便豁然开朗——可以用非语言Token、用连续潜在空间的向量,仅为了答案准确率做优化,无需为了「让用户看懂」而限制格式。

Image

论文中有一个颇具讽刺意味的细节。部分所谓的前沿模型制造商以专利为由不向用户展示实际的中间Token,却照常按中间Token数量收费。论文暗示这些公司或许比学界更清楚这东西不可靠。反倒是研究社区仍在抱有「中间Token能为用户提供可解释说明」的期待。有学者撰文呼吁「保护」中间Token与答案之间那条「脆弱的」联系,以便模型能被「监控」——哪怕这种监控可能只是幻象。

论文最后给出了几条建议。不应将中间Token作为安全监控的依据,安全关键场景应采用第三方验证。不应将中间Token的可解释性当作信任来源,信任应来自对答案本身的独立验证。不应为了「让用户看懂」而限制中间Token的格式——作者提到,将原始那个中英混合的版本改为纯英语后,性能不升反降。一旦承认中间Token只帮助模型自身,便可以放手探索非语言Token和连续潜在空间思考的路径。

这篇论文并不否认推理基准上的性能提升,它质疑的是对提升的「解释」。模型生成看起来合理的中间Token,可能只是在模仿训练数据中人类自言自语的文化惯例。将这东西称为「思维」,如同因为一本书印满了字便说这本书在思考一样——属于范畴错误。在出现比间接证据更强的证据之前,对解答和决策的第三方验证才是更稳妥的路径。

这篇论文最大的价值,或许不在于给出定论,而在于提醒人类社会:对AI能力的解读需要诚实,不能被表面类似人类行为的模式所误导。性能提升或许是真实的,但「为什么提升」这个问题,仍值得持续追问。

论文原文地址见下方,课题组还公开了相关实验的代码和数据,感兴趣的读者可自行复现。

参考:arXiv:2504.09762v4 https://arxiv.org/html/2504.09762v4

预览时标签不可点

Close

更多

Name cleared

微信扫一扫赞赏作者

Like the AuthorOther Amount

赞赏后展示我的头像

作品

暂无作品

Like the Author

Other Amount

¥

最低赞赏 ¥0

OK

Back

Other Amount

更多

赞赏金额

¥

最低赞赏 ¥0

1

2

3

4

5

6

7

8

9

0

.

大语言模型 · 目录

大语言模型

上一篇Vibe Coding 氛围编程案例-通过对话实现可用的快速查表工具下一篇高校教师建议大一开学要有电脑,还要安装OpenCode使用智能体

Close

更多

搜索「」网络结果

Close

调整当前正文文字大小

更多

100%