如今的大型推理模型能解开奥数金牌级别的难题,也能改进悬而未决的数学猜想,但一个越来越尖锐的问题摆在研究者面前:这些模型给出的正确答案,究竟是“想明白了”,还是“碰巧蒙对了”?科技媒体 Quanta Magazine 在7月31日的一篇报道中,梳理了这场关于AI是否真会“推理”的争论。

“思维链”可能只是一层表演
争论的焦点,是大型推理模型在作答时输出的那一长串“思维链”。表面上,它像是模型一步步的思考过程;但多项研究发现,这段文字既未必忠实反映模型内部真正在做什么,对最终答案也未必有实质的因果作用。
圣塔菲研究所的AI研究者 Melanie Mitchell 给出三点结论:这类模型确实有效;它们的思维链并不忠实;其中大量文字甚至可以删掉而不影响结果。亚利桑那州立大学的 Subbarao Kambhampati(前美国人工智能学会主席)措辞更直接,把这些中间文本称为“含混的嘟囔”,并呼吁停止把它们拟人化地当成“思考”。
一串点号也能替代“思考过程”
支撑这些质疑的,是一批设计精巧的实验。纽约大学的研究者在2024年发现,把可读的思维链替换成一串毫无意义的“填充符号”(比如连续的点号),模型在部分任务上依然能得到正确答案。东北大学与加州大学伯克利分校2025年的研究进一步指出,前沿开源推理模型中,30%到60%的“思考步骤”对数学基准题的答案几乎没有因果影响,砍掉一半,性能也几乎不受损。
苹果公司此前那篇名为《思考的幻象》的论文更为轰动,称推理模型在难度稍高的条件下会出现“准确率完全崩塌”。Kambhampati 由此提出“近似检索”假说:模型并非真的学会了通用算法,而是靠海量推理文本的嵌入去“近似地检索”出答案,这解释了为何“胡扯”与“准确”能够并存。
另一派:结果对,就是硬道理
并非所有人都认同这套“泼冷水”的说法。OpenAI 的技术研究员 Sébastien Bubeck 反驳称,那些批评论文往往基于已经过时的模型,现代模型(如 GPT-5.5 及之后版本)并不存在所谓的崩塌问题。在他看来,能稳定得出正确结果本身就是硬道理——2026年5月,OpenAI 的通用推理模型就一举给出了一道著名未解数学问题的答案。
值得注意的是,Google DeepMind 与数学家陶哲轩在2026年的合作中,也借助AI重新发现并改进了跨越数学分析、组合、几何、数论的67个问题。能力之强,双方并无争议。
可以用,但未必可以“信”
那么该如何看待这台“会答题却说不清”的机器?报道作者把它比作一台引擎:有澎湃的马力,却看不到驱动的“马腿”。在代码、数学证明这类结果可被独立验证的领域,即便过程是黑箱,也不妨放手使用;但在难以验证对错的领域,人们仍然需要模型“出于正确的理由”给出答案,才谈得上真正的信任。这场争论短期内不会有定论,但它提醒外界:一个答案是否正确,和模型是否真的在“推理”,可能是两回事。
来源:Quanta Magazine







