Capital One研究团队发现:AI做数学题时为什么越想越错?

这项由美国金融科技公司Capital One的研究团队完成的工作,以预印本形式发布于arXiv(论文编号:arXiv:2607.00482),于2026年8月4日更新至第二版。研究方向涉及推理语言模型的训练优化,感兴趣的读者可通过该编号在arXiv平台上查阅完整论文。

一、当AI越想越错:一个让人头疼的老问题

你有没有遇到过这样的情况:考试时某道题,第一次做出来答案是对的,然后忍不住反复检验,越检验越觉得不对,最后把正确答案改成了错的?这种"想多了反而坏事"的体验,其实在目前最先进的AI推理模型里也普遍存在,而且严重程度出乎意料。

DeepSeek-R1这类推理型AI模型,核心能力就是通过一长串的"思考链"来解题——一步一步分析,就像在草稿纸上列出演算过程一样。理论上,思考得越详细,答案应该越可靠。然而现实恰恰相反:Capital One的研究团队通过大量实验发现,AI生成的回答越长,答对的概率反而越低。在他们测试的数据中,最短的回答组正确率接近80%,而最长的回答组正确率仅剩个位数。

这究竟是怎么回事?难道AI在"思考"的时候不是真的在思考,而是在原地打转?研究团队决定深入挖掘这个问题,他们的发现揭示了一种比单纯"回答太长"更微妙、也更有趣的现象。

二、侦探拿到了正确答案,却把它扔掉了

研究团队用来分析的核心比喻,可以理解成一位侦探办案的过程。侦探在推理过程中,有时会在中途得出一个正确结论,但随后因为过度怀疑自己,开始推翻这个结论,另辟蹊径,最终走进死胡同,交出一份错误的结案报告。

在AI的语境里,这种现象被研究团队称为"答案漂移"(Answer Drift)。具体来说,一个推理过程中,AI会多次给出中间答案,就像侦探不断更新自己的推断一样。如果AI在某个中途节点给出了正确答案,但最终交卷的答案却是错误的,那么这条推理链就发生了"漂移"——正确的答案被丢弃了,被错误的自我反思所取代。

研究团队特别强调,这不仅仅是"回答太长"的问题。他们将不同长度的回答分成五组,在每一组内部对比答对和答错的回答,结果发现:即使控制了长度这个变量,答错的回答依然比答对的回答包含更多的无效自我反思。也就是说,冗长只是表象,真正的问题是这些多余的思考内容在主动把AI往错误方向引导。

三、六种"越想越乱"的具体行为

为了把这个模糊的感觉变成可以测量的东西,研究团队设计了六种具体的语言信号,用来检测AI推理过程中的"过度思考"行为。这六种信号全都基于简单的文字匹配规则,不需要任何额外的AI模型来判断,成本极低。

第一种叫做"重复",指的是AI在不同位置用不同措辞反复说着同一件事,就像一个人在兜圈子、原地踏步,句子换了皮,内容没有进展。第二种叫做"对冲",指AI频繁说出"等等,不对"、"让我重新想想"这类充满自我怀疑的表达,这往往是它即将推翻正确答案的前兆。

第三种叫做"策略放弃",是最能预测答案出错的单一指标——在所有测试的模型上,答错的推理过程里,"这个方法不对,换个思路试试"、"从头来过"这类表达出现的频率,是答对推理过程的4倍以上。第四种叫做"自相矛盾",指AI自己得出了与之前结论相悖的判断,却没能解决这个矛盾,就这样带着未解决的冲突继续向前走。

第五种叫做"重复计算",指同一个数值被反复推导三次以上,明明已经算过了,却不断重算确认,这种行为鲜少真正发现错误,却消耗大量的"思考空间"。第六种叫做"长度异常值",不是简单地说"回答太长就是有问题",而是在同一道题的多个回答中,把那些明显比其他回答长很多的异常情况标记出来——对于简单问题来说,这种异常往往意味着推理陷入了泥沼。

这六种信号共同构成了一套诊断工具,让研究团队得以在不依赖人工标注的情况下,系统性地衡量AI的过度思考程度。

四、DASH:一套让AI学会"见好就收"的训练方法

问题找到了,解决方案是什么?研究团队提出了一个名为DASH的训练方法,全称是"漂移感知优势塑形"(Drift-Aware Advantage Shaping)。这个名字听起来复杂,但核心思想用一个日常场景来理解就很直观了。

假设你正在辅导一个学生做题。这个学生在解题过程中,中途算出了正确答案,但随后又开始怀疑自己,换了个思路,最终给出了错误结果。作为老师,如果你只是简单地在试卷上打一个大叉,告诉他"整个过程都是错的",那显然不公平——他中途明明找到了正确路径,只是不应该继续走下去。更合理的做法,是鼓励他做到正确答案时的那段推理,同时批评他在正确答案之后多此一举的那段"反思"。

DASH的逻辑正是如此。它将AI每一次推理的全过程切分成若干"段落",每个段落的边界,就是AI给出中间答案的位置。然后,它对每个段落独立评分:如果这段推理最终导向了正确答案,就给予正面强化;如果导向了错误答案,就给予负面惩罚。

目前主流的训练方式(GRPO,一种强化学习方法)处理这种情况的方式则粗暴得多:一旦最终答案是错的,整个推理过程里的每一个字都被打上相同的负分,包括那些实际上走对方向的部分。这相当于那位老师不分青红皂白地批评了学生所有的解题步骤,最终可能导致学生连正确的解题思路也不敢用了。

在DASH的设计中,还有几个细节值得留意。对于反复确认同一个正确答案的情况,系统会逐渐降低奖励——第一次找到正确答案得满分,但如果之后反复重申同一个结论,奖励会指数级递减,防止AI养成"疯狂确认"的坏习惯。对于漂移之后继续错误推理的部分,惩罚力度会随着在错误路径上走得越远而不断加重,就像是"你已经偏离了正确答案,继续偏离只会让情况更糟"。对于发生漂移的推理链整体,系统会给它一个介于"完全错误"和"完全正确"之间的部分分——因为这条推理链毕竟曾经找到过正确答案,完全当成失败案例来惩罚,是一种信息浪费。

五、实验结果:在最难的题目上,效果最明显

研究团队用一个4B参数的Nemotron模型(来自NVIDIA的一款推理模型)作为主要实验对象,在四个竞赛级别的数学测试集上验证了DASH的效果,这四个测试集分别是OlympiadBench(数学奥林匹克题)、MinervaMath、AIME 2024和AIME 2025(美国数学邀请赛题目)。

从平均准确率来看,原始模型在这四个测试集上的平均分是55.65%,标准GRPO训练后提升到56.95%,另一个改进版基线DR-GRPO(一种针对长度偏差做了修正的变体)达到58.13%,而DASH与DR-GRPO结合后,达到了59.45%,是所有方法中最高的。

更有意思的是,AIME 2025这个测试集上出现了一个耐人寻味的现象:标准GRPO训练后,成绩反而比原始模型下降了0.7个百分点——也就是说,训练之后反而变差了。研究团队分析,AIME 2025是四个测试集中"答案漂移"现象最严重的一个,而标准GRPO不分好坏地惩罚了整个漂移推理链,恰恰把那些"中途找到正确答案"的有效推理策略也一并压制了。DASH则没有出现这个问题,在AIME 2025上相比原始模型提升了4.7个百分点。

研究团队还专门测量了"自我纠错率"——也就是在推理过程中出现过错误中间答案的情况下,最终仍能给出正确结果的比例。DASH训练的模型,这一比率显著高于其他所有方法。以AIME 2024为例,DASH模型的自我纠错率远高于GRPO和DR-GRPO,同时最终准确率也更高,说明DASH培养的是真正有效的自我纠正能力,而不是盲目的自我怀疑。

六、跨模型验证:换个AI,规律依然成立

有人可能会问:这套方法是不是只对某个特定模型有效?为了回答这个问题,研究团队又在两个完全不同架构的模型上重复了实验——一个是微软的Phi-4-reasoning-plus(14B参数),另一个是Allen AI的OLMO-3-think(7B参数)。

结果显示,DASH在三个模型上都带来了一致的提升:Nemotron-4B提升了0.5个百分点,OLMO-3-think提升了1.5个百分点,而Phi-4-reasoning-plus提升幅度最大,达到了4.1个百分点。这种跨越了模型规模、训练数据来源和架构设计的一致性,表明"用中间答案检测漂移、分段赋予奖惩"这一机制,抓住的是推理训练中的一个普遍规律,而不是某个模型的特定弱点。

七、拆解方法:哪些部件最重要?

DASH由几个相互配合的部件组成,研究团队逐一拆除每个部件,观察效果的变化,来判断哪个最关键。

结果显示,最核心的是"漂移部分信用"机制——也就是给发生了漂移但曾经找到正确答案的推理链一个介于正负之间的评分,而不是直接按完全错误处理。去掉这个机制后,平均分从57.5跌至54.6,是所有拆除实验中跌幅最大的,也是唯一一个导致结果低于训练之前的配置。第二重要的是"负段落长度惩罚"机制——在漂移之后的错误推理段落中,越走越远的惩罚越重。去掉这个机制后,成绩跌至55.3。"条件中立处理"(对漂移推理链的前段给予弱正信号而非零信号)和"重复确认衰减"对整体准确率的影响相对较小,但在一些子测试集上会带来额外收益,说明它们主要影响推理效率和稳定性,而非直接决定对错。

八、过度思考画像:DASH训练的AI,反思方式变了

研究团队用前面提到的六种语言信号,绘制了不同训练方法下AI的"过度思考画像",直观地呈现出各种方法在减少无效推理上的差异。

结果显示,DASH训练的模型在策略放弃(减少了41%)、对冲表达(减少了14%)和长度异常值(减少了17%)上,都明显优于DR-GRPO基线。这意味着DASH有效地减少了AI在推理过程中反复换方向、反复怀疑自己、无休止地延伸推理链这三类最常见的无效行为。

有一个有趣的例外:在"自相矛盾"这个指标上,DASH的数值反而比DR-GRPO高了13%。乍看之下这似乎是个坏信号,但研究团队通过进一步分析发现,这实际上反映的是一种质的转变。在答对的推理链里,DASH模型的矛盾标记增多,通常伴随着"察觉到矛盾、找出根源、解决矛盾、得出正确答案"的完整闭环,这是一种有益的错误检测行为。而DR-GRPO遇到矛盾时,倾向于用对冲和策略放弃来回避问题,不去真正解决矛盾,只是绕开它继续走,最终更容易出错。

用一个形象的说法来区分:DASH培养的是"侦探思维",遇到线索矛盾时会停下来分析矛盾、找出真相;DR-GRPO更像是一个被矛盾搞得慌了神的人,不去解决矛盾,只是不断尝试新的方向,直到精力耗尽。

九、真实案例:一道几何题,两种截然不同的命运

研究团队在论文中展示了一道AIME 2025的圆几何题(答案为293)的实际推理过程对比,这个案例非常直观地展现了两种方法的本质差异。

标准GRPO训练的模型在面对这道题时,从未真正识别出题目中关于内切圆几何关系的核心误解,而是不断地用不同的数值组合去"碰运气",先后尝试了8种不同的参数代入方式,整个推理过程长达61000个字符,最终因为达到字符上限而被截断,没能给出任何答案。

DASH训练的模型面对同一道题时,在推理进行到约8%的位置,就明确表达了"这说不通,让我检查一下——内切在B点,所以圆心必须共线",识别出了几何关系的矛盾所在。随后经过几次迭代,在推理进行到59%的位置完成了对内切关系的正确理解,之后线性推进计算,在34000个字符(比GRPO短43%)内给出了正确答案293。

这个案例精准地展现了研究团队想要传达的核心:问题不在于AI是否应该自我反思,而在于反思应该指向哪里。有效的反思是找到矛盾、解决矛盾;无效的反思是逃避矛盾、盲目换路。

说到底,这项研究揭示的是一个关于"什么时候该停下来"的朴素道理。推理能力强不等于推理越长越好,真正聪明的思考者懂得在找到答案时认可自己,而不是永无止境地怀疑自己。Capital One团队用一套聪明的工程设计,把这个朴素道理嵌入了AI的训练过程。当然,研究也有明显的局限:目前的实验主要在数学和代码这类有明确答案的领域进行,因为只有在能验证中间答案正确与否的场景下,DASH的漂移检测才能工作。对于那些没有标准答案的开放性推理任务,这套方法还需要找到新的"漂移指示器"。此外,大部分实验基于4B参数的小模型,在更大规模的模型上,训练动态是否会有所不同,还有待验证。

如果你对背后的技术细节感兴趣,可以在arXiv平台上搜索论文编号arXiv:2607.00482找到完整论文,里面包含了所有实验配置、数学公式推导和更多案例分析。

---

Q&A

Q1:答案漂移是什么意思,AI推理中为什么会发生这种情况?

A:答案漂移指的是AI在推理过程中曾经给出过正确的中间答案,但随后通过多余的自我反思推翻了这个正确答案,最终交出错误结果的现象。这种情况发生的原因,是现有的推理模型被训练成"不断验证、不断反思"的模式,缺乏识别"已经找到答案、应当停止继续推理"的能力。

Q2:DASH和普通的GRPO强化学习训练有什么本质区别?

A:GRPO对最终答案错误的推理链一刀切地打负分,不管其中是否有过正确的中间答案。DASH则把推理链切成若干段落,对每段分别评分:找到正确答案的段落得奖励,找到错误答案的段落受惩罚,漂移前的有效推理则得到保护。这让AI能从一次失败的推理中同时学到"什么该做"和"什么不该做"。

Q3:DASH方法在数学之外的领域能用吗?

A:目前DASH依赖于能提取并验证中间答案的能力,因此适合有明确标准答案的场景,比如数学题和有测试用例的代码题。对于开放性推理任务,由于无法判断中间答案是否正确,漂移检测机制就无法工作。研究团队在论文中也明确指出这是当前方法的主要局限之一。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询