会“想”不代表想得对:拆解AI推理模型的一个悖论

你有没有想过这样一件事:一个学生做数学题时,写了满满三页演算过程,划掉重写了好几次,还不停地说"等等,我再检查一下","也许我搞错了"。你会觉得这个学生很认真,思考很深入。

但如果这个学生最后答案还是错的呢?

这正是当下最火的AI推理模型面临的一个尴尬处境。

2024年底到2025年,OpenAI的o1、DeepSeek的R1、阿里的Qwen3这些"会思考"的模型,横空出世。它们不再是问一句答一句,而是会先啰嗦地自言自语一大段,把问题拆开、试几种思路、检查一遍答案,最后才给出结论。这种长长的思考过程,业内叫它"推理轨迹"

推理轨迹:模型在给出最终答案之前生成的完整思考过程文本,通常包含中间步骤、假设、验证等内容

看起来,这些模型确实更聪明了,在很多榜单上分数也更高了。但卡内基梅隆大学和斯坦福大学的一组研究者,提出了一个刁钻的问题:这些模型看起来"想得更多",但它们想的内容,真的是让答案变得更准的那部分吗?

这篇论文的答案相当扎心:不一定。

有些行为,模型做得越来越多,但跟做对题几乎没关系。有些行为,模型几乎没有变化,但恰恰是决定对错的关键。这两组行为,几乎没有重叠。

问题到底难在哪

先说清楚为什么这事儿不好判断。

以前评价一个AI模型好不好,很简单,看它答对了多少题就行。但现在的推理模型会写一大段思考过程,这段过程到底有没有用,没法只靠最终的对错来判断。

打个比方,你去看一场足球比赛,最后比分是2比1,你能说赢的那队每一次传球、每一次跑位都是正确的吗?显然不能。同样的道理,一个AI模型最后答对了,不代表它推理过程中的每一步、每一种"思考行为"都对结果有帮助。有可能它蒙对了,有可能它绕了一大圈弯路才凑巧走到正确答案上。

问题的核心在于,我们没法把"模型表现出某种行为的频率"和"这个行为对答对题目到底有没有用"这两件事分开看。

研究者们把这两件事拆开了,专门设计了一个指标来衡量后者。这个指标叫做"行为提升度"

行为提升度:衡量某个推理行为出现时,模型答对题目的概率,比这个行为不出现时高多少。数值越高,说明这个行为跟答对题目的关系越紧密

具体算法很直白:找到一个行为,比如"模型表达了不确定",统计一下模型表达不确定的时候答对的比例是多少,再统计模型没表达不确定的时候答对的比例是多少,两者相减,就是这个行为的"提升度"。

如果提升度是正的,说明这个行为出现时,答案更容易对;如果是负的,说明这个行为出现反而跟答错更相关。

这个指标本身不复杂,但用它去衡量九种不同的推理行为,结果却出乎意料。

九种推理行为:模型脑子里到底在干什么

研究团队参考了认知科学里关于"元认知"

元认知:对自己思考过程的认知和调控,简单说就是"想自己在想什么"。比如你意识到自己没听懂一道题,这就是元认知在起作用

的分类框架,把AI模型在推理时表现出来的行为,归纳成了九种,分成三大类。

第一类叫"控制调节",包括规划(把问题拆成步骤)、目标追踪(记住自己解到哪一步了)、假设检验(考虑不同的可能性)、自我修正(发现错了就改)。

第二类叫"监控判断",包括不确定性表达(说"我不太确定"之类的话)、自信校准(表达的自信程度跟推理的强弱是否匹配)、自我意识(知道自己有没有掌握足够的信息)。

第三类叫"知识锚定",包括证据引用(有没有引用题目里给的条件)、知识对齐(用没用对相应领域的知识框架)。

研究者请了GPT-4o充当裁判

LLM-as-judge:用一个大语言模型来给另一个模型的输出打分或做判断,这种做法在AI研究里越来越常见,因为很多评判标准很难写成固定规则

去给每一条推理轨迹打标签,看看每一种行为出没出现。为了确保这个裁判靠谱,他们还专门找了DeepSeek-V3、Gemini这些其他模型来做交叉验证,还找了人工来复核了一部分样本,结果显示裁判的判断跟人工判断的一致率高达95.1%。

这套流程一共标注了15282条推理轨迹,来自15个不同的模型,涵盖了从纯逻辑推理、数学题到多领域知识问答的6个测试基准。

工程量是够大的,但真正让人意外的是接下来的发现。

模型放大了什么?它检查、它假设、它犹豫

先说结果的第一部分:思考型模型跟普通指令模型比起来,到底哪些行为变多了。

研究者发现,有三种行为的出现频率被明显放大了:自我修正、假设检验、不确定性表达。这个放大幅度相当夸张。以自我修正为例,在思考型模型的回答里出现的比例是21%到55%,而在普通指令模型里只有3%到15%。假设检验和不确定性表达也是同样的模式,思考型模型的出现频率能达到普通模型的三到七倍。

而且这个差距不是偶然的巧合,在所有测试的七个模型家族、两种模态(文本和图文)、六个测试基准上都一致存在。换句话说,这是一个非常稳固的规律:只要一个模型被专门训练成"会思考"的样子,它就会明显更频繁地表现出这三种行为。

但奇怪的是,另外六种行为几乎没有被放大。规划、目标追踪、证据引用、知识对齐、自我意识、自信校准,这几项在思考型模型和普通模型之间的差别很小,有些指标上甚至普通模型表现得更好一点。比如在数学基准MATH-500上,思考型模型的自信校准分数是66.1%,普通模型反而是67.9%,普通模型略胜一筹。

这个发现本身已经足够有意思了:训练"让模型多想想",居然只对特定几种行为起作用,剩下的行为纹丝不动。

悖论浮现:被放大的行为,恰恰是没用的行为

现在到了这篇论文最核心的发现。

研究者把上面那九种行为的"行为提升度"都算了一遍,结果让人愣住了。

被放大得最厉害的三种行为,自我修正、假设检验、不确定性表达,恰恰是提升度排名最低的三种。尤其是不确定性表达,它的提升度是负的,在图文任务里是负16.1%,在纯文本任务里是负13.9%。

也就是说,模型越是表达"我不太确定",反而越容易答错。

而提升度最高的几种行为,反而是训练几乎没有放大的那几种。排在第一位的是自信校准,在图文任务里的提升度高达72.2%,纯文本任务里高达79.6%。这意味着当模型的自信程度跟它推理的强弱真正匹配起来时,答对的概率能高出接近八成。排在第二、第三位的是自我意识和知识对齐,提升度也都在50%到80%之间。

这就是这篇论文最扎心的地方:模型训练放大的东西,恰好不是决定对错的关键;决定对错的关键,恰恰是训练没怎么触碰的那几项。

论文管这个现象叫"放大与提升的鸿沟",作者画了一张图,把这九种行为按照两个维度画在坐标系里,横轴是被放大的程度,纵轴是提升度,结果整个右上角,也就是"既被大幅放大又高度有用"的那个区域,是空的。没有一个行为同时满足这两个条件。

这个画面挺有冲击力的。你花了力气去训练一个模型,让它表现得更"会思考",结果它确实变得更爱检查、更爱假设、更爱表达犹豫,但这些新增的行为,跟它到底能不能做对题,几乎没关系,甚至有点反效果。

自信校准和不确定表达:两个容易混淆但完全不同的东西

这里有必要把两个听起来很像、但本质完全不同的概念说清楚。

不确定性表达,就是模型嘴上说"我不确定"、"这可能有问题"、"我有点困惑"。这只是一种表面的语言标记,说白了就是嘴上示弱。

自信校准,是模型表达出来的确信程度,跟它推理过程本身的可靠程度是否匹配。推理站得住脚的时候,模型表现得有把握;推理站不住脚的时候,模型表现得谨慎。这是一种内在的一致性,不是嘴上说说而已。

举个生活里的例子。有个同事跟你汇报工作,一种情况是他每说一句话都要加一句"我不太确定啊",哪怕是最基本的事实他也这么说,这是不确定性表达的滥用,信息量为零,因为他对什么事都一样犹豫,你根本分不清他哪句话是真的没底、哪句是习惯性谦虚。

另一种情况是,同事平时说话很干脆,但一旦碰到他自己也没把握的部分,会明确告诉你"这块我没查证过,可能有误"。这种表达才是有信息量的,因为他的犹豫是有区分度的,跟着实际的把握程度走。如果他从不区分,永远一副胸有成竹的样子,你就没法在关键时刻知道该不该多留一个心眼,这就是不校准带来的代价。这才是自信校准想描述的东西。

论文里给出的证据也很直接:在那些"蒙对了答案但推理过程其实是错的"的案例里,自信校准这个行为几乎不出现,只有3.4%到7.6%;而在推理过程真正靠得住的案例里,这个行为出现的比例高达94.7%到95.9%。说明自信校准这个信号,追踪的是推理本身的质量,不是简单地跟着最终答案的对错跑。

排除"这只是碰巧"的可能性

发现一个反直觉的结果,第一反应应该是怀疑这是不是统计上的巧合,或者是不是被某些混杂因素带偏了。研究者显然也想到了这点,做了好几层检验。

第一层检验是同题对比。他们让同一个模型针对同一道数学题生成8个不同的答案版本,然后专门比较"这道题里出现某个行为的版本"跟"没出现这个行为的版本",看准确率差多少。这样就排除了"某些题目本身简单,模型自然表现得更自信也更容易对"这种干扰。结果依然一致,自信校准的优势稳稳地保持在正0.3到正0.5之间,而不确定性表达几乎为零甚至轻微为负。

第二层检验是标签噪声测试。既然裁判打标签,标签就可能出错,那如果人为往标签里随机注入5%到20%的错误,这个排序会不会崩掉?结果显示,即使故意注入20%的随机错误,自信校准和知识对齐依然稳稳占据排名前列,不确定性表达依然稳稳垄底。只有假设检验这一项因为原本提升度就接近零,排名稍微不稳定,其他都很稳固。

第三层检验是隐藏层探针分析。研究者甚至打开了模型内部,用一种叫线性探针

线性探针:一种简单的分析工具,通过在模型内部某一层的隐藏状态上训练一个线性分类器,来检验某个概念是否已经被模型编码进了它的内部表示

的技术去看模型的隐藏状态里,是否真的编码了这些行为。结果发现在做错的题目里,知识对齐和目标追踪这类高提升度行为,在模型内部的表示里更容易被解码出来,而假设检验和不确定性表达这类低提升度行为则更难被解码。这说明这个排序不是裁判凑巧编出来的一套说辞,模型内部真的存在这种结构性的差异。

三层检验叠加起来,基本可以确认这不是巧合,是一个相当稳固的现象。

恢复力:思考型模型到底赢在哪儿

既然被放大的那些行为没什么用,那思考型模型的准确率为什么普遍比普通模型高呢?这个问题论文也给了解释,答案是"恢复力"

恢复力:指模型在推理过程中已经犯了某种可检测的错误,但最终依然答对了的能力。用公式表达就是"在至少检测到一个失败模式的情况下,答对的概率"

研究者定义了七种"失败模式",比如逻辑错误、事后编造理由、抄近路跳过必要步骤等,只要检测到任意一种,就算作"出现了失败"。

结果发现,在那些需要大量步骤计算的任务上,比如数学题、纯逻辑题,思考型模型即便中途犯了错,事后修正回来、最终答对的概率,是普通模型的2到3倍。举个具体的数字,在MATH-500这个数学基准上,思考型模型的恢复率是40.8%,普通模型只有17.8%,翻了一倍还多。

但在另一类任务上情况反过来了。有一个叫LogiQA2的逻辑推理测试,考的是能不能迅速识别出论证结构,这种任务里普通模型的恢复率反而更高,24.5%比思考型模型的11.1%高出一倍多。

这个反差很值得琢磨。为什么同样是"多想",在数学题里帮了大忙,在逻辑结构识别题里反而拖后腿?

答案跟任务本身的性质有关。数学题需要走很多步计算,中间任何一步出错都有机会在后面的步骤里被纠正回来,这时候多花时间检查、反复验证是真的有用的。而逻辑结构识别这种题,考的其实是能不能一眼看出论证形式对不对,普通模型靠抄近路走捷径反而更快更准,思考型模型反倒因为想得太多、绕了弯路,把简单的事情搞复杂了。

用一个生活场景来说明这个差别。假设你要检查一份财务报表,如果这份报表里有大量的加减乘除计算,你反复核对每一步、发现哪里算错了就改,这种"慢慢来、多检查"的策略是有回报的,因为错误是可以在下一步被纠正的。但如果你要判断的是一份合同里的某个条款是不是自相矛盾,这种判断往往是一瞬间的直觉,靠的是你对语言逻辑结构足够熟悉,这时候如果你非要逐字逐句地反复推敲、怀疑自己的第一判断,反而容易把本来正确的直觉给推翻了,越想越乱。如果不区分任务类型,一律用"多想"来应对,遇到数学题会占便宜,遇到结构识别题就要吃亏,这正是LogiQA2这个反例揭示的代价。

规模效应:把模型做得更大,问题解决了吗

有人可能会想,这个悖论会不会只是小模型的问题,模型做大了自然就好了?

研究者专门测试了Qwen3-VL这个系列,从2B参数一路测到32B参数,规模扩大了16倍。结果是被放大的那三种行为的差距,在32B的模型上依然存在,自我修正的出现率差距还是有50个百分点那么大,跟2B模型的情况几乎一样。

但另一方面,那些原本"被冷落"的行为,随着模型变大,差距反而在缩小甚至反转。自信校准这一项,在32B规模下,普通模型的表现(78.0%)反而超过了思考型模型(71.7%)。

更有意思的是一个细节:思考型模型的自我修正,随着规模变大,它的提升度是在下降的。在2B规模时,自我修正带来正30.0%的提升度;到32B规模时,只剩正5.9%。反过来,自信校准的提升度随规模增大是上升的,从2B时的正57.7%涨到32B时的正68.7%。

这说明单纯把模型做大,并不会自动解决这个悖论,甚至可能让它变得更微妙。规模不是万能钥匙。

训练早期就已经埋下了这个悖论

还有一个问题值得追问:这个悖论是训练过程中的哪个阶段导致的?

现在的模型训练往往有好几个阶段,先是监督微调

监督微调:SFT,Supervised Fine-Tuning,用人工标注好的高质量样本,直接教模型该怎么输出。这是训练大模型的一种常见方法

然后可能还有强化学习之类的进一步调整。

研究团队专门找了OLMo-3这个开源模型系列,比较了它在只经过监督微调阶段(还没进入后续强化学习阶段)时的表现。结果发现,即便是在这么早的阶段,这个悖论就已经出现了。思考版的模型自我修正出现率是34.5%,普通版只有1.0%,差距巨大;但提升度最高的依然是知识对齐和自信校准,分别高达81.0%和67.4%,而自我修正的提升度只有16.4%。

这说明这不是某个具体训练技巧带来的副作用,而是从训练的最早期阶段就已经种下的一个结构性问题。

一个额外的发现:视觉模型光"看到"图片还不够,"看对"才算数

在图文模型上,研究者还额外标注了两个专属的行为指标,一个叫"视觉引用存在",指的是模型是否在推理过程中提到了图片里的具体内容;另一个叫"视觉描述准确",指模型对图片的描述是不是真的说对了。

结果非常鲜明:视觉描述准确这一项的提升度高达60.9%,含描述准确的回答,最终答对的概率是87.8%,而描述不准确的回答,答对概率只有26.9%。但是仅仅"提到了图片内容"这件事本身,跟答对几乎没有关系,提升度只有负3.3%。

这个发现放在更大的画面里看,跟前面自信校准和不确定表达的对比结构是一致的:光有动作,没有动作的质量保证,是不够的。提到图片内容,就像不确定性表达一样,只是表面动作;描述准确,就像自信校准一样,是真正决定成败的内在质量。

用提示词直接验证这个发现有没有用

理论说了半天,研究者还做了一个挺接地气的实验:既然发现了哪些行为有用哪些没用,那能不能直接在提示词里引导模型多做有用的事、少做没用的事,看看准确率会不会变?

他们设计了两种提示词,一种叫"高提升度提示",鼓励模型多做自信校准、知识对齐、自我意识这三件事;另一种叫"低提升度提示",故意让模型在每一步都表达怀疑,加各种"也许"、"我不确定"的措辞。

结果在数学题MATH-500上,高提升度提示把准确率从84.8%拉高到90.6%,提升了5.8个百分点;而低提升度提示反而把准确率拉低到80.2%,掉了4.6个百分点。在MMLU-Pro数学题上差距更明显,两种提示之间的准确率差距达到15.7个百分点。

这个结果算是给前面所有的理论分析补上了一个实践层面的证据:这个提升度排序不只是统计意义上的规律,直接用在提示词工程

提示词工程:Prompt Engineering,指通过精心设计输入给AI模型的指令文字,来引导模型产生更好输出的技术,不需要重新训练模型

上,也能立刻看到效果。

不过研究者也很老实地承认,这个提示词实验改变了推理轨迹里很多东西,不能说是单独证明了某一个行为的因果作用,只能说这个排序确实携带着可以在生成时刻直接利用的有效信号。

表格里的核心数字

把这篇论文的关键结论浓缩成几组数字,能看得更清楚。

在图文任务里,九种行为按提升度从高到低排列:自信校准(正72.2%)、自我意识(正62.0%)、知识对齐(正53.7%)、证据引用(正34.9%)、目标追踪(正30.6%)、规划(正6.6%)、自我修正(正20.1%)、假设检验(正1.0%)、不确定性表达(负16.1%)。

在纯文本任务里,排序基本一致:知识对齐(正80.3%)、自信校准(正79.6%)、自我意识(正52.7%)、目标追踪(正52.5%)、证据引用(正49.1%)、规划(正26.3%)、自我修正(正12.4%)、假设检验(正1.0%)、不确定性表达(负13.9%)。

而被放大的三种行为,自我修正、假设检验、不确定性表达,在这两个排序里始终垄断着最后三名。

这件事对训练AI模型意味着什么

这篇论文最后给出的建议,说到底是一句挺朴素的话:现在很多AI模型的训练,用的是"最终答案对不对"这个单一信号来奖励模型。这种做法很容易训出一个啰嗦、爱检查、爱犹豫的模型,因为这些表面动作跟"答案有可能对"这件事在统计上是相关的,模型学会了表演这种深思熟虑的样子,但这种表演本身不是让答案变对的原因。

论文提出,未来的训练方式应该更直接地奖励那些真正跟对错相关的行为,比如让表达的自信程度真正跟推理的可靠程度绑定,让模型学会说出"这里信息不够,我判断不了"而不是泛泛的"我不太确定",让模型真正用对领域知识框架,而不是简单地把句子拉长、多加几个转折词。

这个思路提出了一个具体的审计工具,就是这篇论文里定义的行为提升度指标本身:以后设计任何一个训练奖励机制,都可以先问一句,这个奖励鼓励的行为,跟提升度排名对得上吗?如果对不上,说明这个奖励可能只是在鼓励表面的深思熟虑,而不是真正有用的推理质量。

写在后面

读完这篇论文,最触动我的一个细节是那张"高提升度和高放大度"象限图里空出来的那个角落。研究团队没有回避这个尴尬的空白,反而把它画出来放在论文最开头,等于是直接告诉读者,这就是我们要讲的核心矛盾。这种坦诚的呈现方式本身就挺打动我。

另一个细节是,论文里那个"蒙对答案但推理过程是错的"这个类别,占比其实不算高,但研究者专门统计了这些案例里自信校准的出现率,只有个位数百分比。这说明自信校准这个东西不是简单地跟着答案的对错走的,它真的在追踪推理过程本身有没有站得住脚,这跟最终答案对不对是两件不完全重合的事。这个区分挺细腻的,也提醒我们,评价一个AI系统,只看它答没答对,可能永远看不到它内部真正发生了什么。

还有一点让我一直在想,这个"表演深思熟虑"的现象,跟人类沟通里的某些场景有点像。有些人说话总爱加一堆"我觉得"、"可能吧",听起来很谦逊很审慎,但这种谦逊如果不跟他们真正的把握程度挂钩,其实传递不出任何有效信息。AI模型现在似乎也在学这套表演,学得挺快,但学错了重点。

这篇论文没解决的问题是,如果训练目标真的改成奖励高提升度行为,会不会又催生出新的表演形式,让模型学会装出"知识对齐"和"自我意识"的样子,而不是真的具备这些能力?这个猫鼠游戏,恐怕才刚刚开始。

Q&A

Q1:行为提升度是什么,怎么计算的?

A:行为提升度衡量的是某个推理行为出现时模型答对题目的概率,减去这个行为不出现时答对的概率。数值为正说明这个行为跟答对相关,为负说明反而跟答错相关。论文用这个指标发现自信校准的提升度能达到70%到80%,而不确定性表达的提升度是负的。

Q2:为什么思考型AI模型放大的那些行为反而没什么用?

A:论文发现思考型模型主要放大了自我修正、假设检验、不确定性表达这三种行为,但这些行为的提升度排在最低。原因可能是这些表面动作只是深思熟虑的外在表现,跟推理本身是否可靠没有直接绑定,模型学会了表演,却没学会真正校准。

Q3:模型变得更大之后,这个悖论会不会自然消失?

A:不会自然消失。论文测试了从2B到32B参数的模型,发现被放大行为之间的差距在各个规模下都保持稳定,而自我修正的实际效用随规模增大反而在下降,说明单纯扩大模型规模不能解决这个结构性问题。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询