新国立等多校联手:让AI从“失败草稿”中学习推理,效果反而更好?

这项研究由新加坡国立大学、慕尼黑大学、慕尼黑工业大学、南洋理工大学、北京大学、华为海森堡研究中心、东南大学及中国科学院自动化研究所等多家机构联合完成,于2026年8月以预印本形式发布,论文编号为arXiv:2608.03972v1,研究方向属于人工智能与大语言模型推理能力的增强训练。

**一个反直觉的发现**

教一个孩子做数学题,你会怎么做?大多数人的第一反应是:给他看正确的解题步骤,让他照着学。如果有一道题连老师都做错了,那份写满错误推导的草稿,通常就直接进了垃圾桶。

然而,这篇论文的研究者们发现,对于当前最先进的AI语言模型来说,这个直觉是错的——至少不完全对。他们的核心发现是:当模型面对特别困难的问题时,给它看一份"专家写错了的解题过程",并要求它找出错误、加以纠正,比直接让它从零开始解题,成功率要高得多。

这个发现催生了一套叫做ReflectRL的训练方法。它的基本思路是:不要扔掉那些失败的草稿,而是把它们变成一种特殊的学习材料。

**一、大语言模型是怎么"练推理"的?先讲清楚背景**

要理解这项研究,先得弄清楚AI是怎么学会推理的。

现在最强的AI语言模型,比如DeepSeek-R1,已经能够解答相当复杂的数学题和逻辑题。它们之所以能做到这一点,很大程度上依赖一种叫做"在线强化训练"的方法。可以把这个过程理解成这样一个场景:给模型出一道题,让它自己想出几个不同的解题过程,然后用一个自动判卷器检查哪些是对的、哪些是错的。对的解法会得到"奖励",错的会受到"惩罚",模型在这个反复练习的过程中逐渐提升解题能力。

这种训练方法有一个核心依赖:必须要有足够多"做对了"的解题过程,奖励信号才有意义。当题目简单时,模型偶尔能答对,训练就能顺利推进。但当题目非常困难时,模型每次都答错,奖励信号几乎全是零,训练就像在黑暗中乱撞,效率极低。

为了解决这个问题,研究者们通常会请来一个"更强的老师模型",让它先把解题过程写出来,再把这些正确的解题过程喂给学生模型参考。老师写对了,学生就有好的范本可以学习。

但问题来了:就连这位"老师"有时也会解不出特别难的题。老师写的解题过程是错的,那这份材料就只能被丢进垃圾桶吗?这正是ReflectRL试图回答的问题。

**二、那堆"废弃草稿"里究竟藏着什么?**

研究团队首先做了一个非常有意思的实验,来搞清楚那些"失败的专家解题过程"到底有没有价值。

他们选择了一个数学能力很强的模型(Qwen2.5-Math-7B),然后设计了两种不同的解题模式。第一种叫"直接推理":只给模型看题目,让它自己想出答案。第二种叫"反思推理":在题目之外,额外给模型看一份解题草稿,但特别声明"这份草稿是专家写的,但里面有错误,你的任务是找出错误,纠正它,然后给出正确答案"。

实验结果非常清晰。对于那些难题,当模型进入"反思推理"模式并且草稿来自强大专家模型时,它的解题成功率大幅提升,而同样的模型在"直接推理"模式下却经常束手无策。研究者把这种现象命名为"反思优势"——在困难问题上,反思一份有瑕疵的专家草稿,比从零开始独立解题要容易且有效得多。

这个结论背后有一个朴素的道理:一份虽然有错但整体思路接近正确的草稿,其实已经帮模型完成了很多探索性的工作。模型不需要在茫茫可能性中盲目搜索,而是可以沿着这条"大体走对了方向、只是最后几步出了岔子"的路径继续前进,同时识别并修正那个关键的错误。

但研究者们并没有止步于此,他们还追问:是不是任何错误的草稿都能起到这种效果?

答案是否定的。实验表明,这种"反思优势"非常挑剔。首先,草稿必须来自能力强的专家模型。用学生模型自己写的失败草稿,或者用一个能力更弱模型的失败草稿,效果非常有限,甚至会产生负面影响。其次,草稿的长度也不是关键——研究者故意构造了一些长度相近但内容来自不匹配专家的草稿,结果同样起了反效果。真正关键的是草稿的"质量结构":一份好的失败草稿,前面大部分推理是正确的、逻辑清晰的,只在某个具体环节出了错,并且这个错误是局部的、明确的。

为了验证这一点,研究者用了一个专门评估推理步骤质量的工具(过程奖励模型,PRM),来给不同来源的失败草稿做"体检"。结果显示,来自强大专家模型的失败草稿,在出错之前的推理部分质量非常高,分数接近正确解法;而来自弱模型的失败草稿,从一开始质量就参差不齐,充满混乱。

他们还做了一组"外科手术式"的消融实验:把草稿的各个部分逐一删除,看哪部分贡献了主要价值。结果发现,草稿中"推理正确的前半段"和"出错的具体位置"这两个部分缺一不可。前半段给了模型一个高质量的推理起点和脚手架,后半段则给了模型一个明确的纠错目标。如果把草稿的内容打乱顺序,或者只告诉模型最终答案是多少,效果反而会跌破基线——还不如直接让模型独立解题。

这些来自强大专家模型的失败草稿,研究者给它们起了一个专有名称:黄金负轨迹(Golden Negative Trajectories,简称GNT)。"黄金"是因为它们来自高质量的强模型,"负"是因为它们给出了错误的答案,"轨迹"则是因为它们完整记录了一个推理过程。

**三、ReflectRL:把废稿变成教材的完整方案**

发现了这个现象之后,研究者面临的下一个挑战是:怎么把它变成一个实际可用的训练方法?

最朴素的想法是:用黄金负轨迹来训练模型的反思能力就好了。但这会带来一个问题:模型会变得依赖外部草稿。训练的时候,每道题都有一份专家草稿可以参考;但实际使用的时候,不可能每次都有这样的草稿。如果模型学会了"看到草稿才能回答",那这种能力在现实中毫无用处。

ReflectRL的核心设计就是解决这个"训练时有草稿、推理时没草稿"的矛盾。它的思路可以用一个学钢琴的比喻来理解。

一个钢琴学生在练习困难曲目时,老师会在旁边实时提示:"这里要轻一点"、"那里节奏要稳"。有了这些提示,学生能把曲子弹得更流畅、更准确。但演出时老师不可能坐在台上提示。真正的目标是:经过足够多的"有提示练习"之后,那些关键技巧已经内化成了肌肉记忆,演出时自然能够流畅发挥,不再需要外部提示。

ReflectRL中的"反思推理"就是"有提示的练习",而"直接推理"就是"演出"。训练的全过程分为两个阶段,中间有一个渐进的过渡。

训练早期,大量题目以"反思推理"模式进行:模型看到黄金负轨迹,识别错误,纠正推理,给出答案。同时,也会混入一些"直接推理"模式的题目,让模型不完全忘记独立解题的感觉。

随着训练推进,"直接推理"的比例逐步增加,"反思推理"的比例逐步减少。这个过渡采用余弦曲线形式——开始时变化缓慢,中间阶段变化加快,末期再次放缓,最终完全切换到直接推理模式。这种平滑的过渡方式被证明比突然切换效果要好得多,因为它给了模型足够的时间把"反思时学到的技巧"慢慢内化到自身参数中。

训练结束后,模型进入"直接推理"模式做最后强化,不再依赖任何外部草稿。而那些在反思练习中学到的"发现错误、纠正推理、找到正确路径"的能力,已经悄悄沉淀在模型的参数里,成为它独立解题时自发调用的内在能力。

ReflectRL被设计为一个"即插即用"的模块,可以叠加在多种现有的训练框架上,不需要修改奖励函数,不需要引入额外的模型或参数,只需要调整训练时的输入构造方式即可。

它适配了两类主流训练范式。一类是强化学习类方法(RLVR),比如GRPO和DAPO:在这类方法中,每次给模型出一道题,同时生成一批混合的解题尝试——部分使用反思推理模式(附带黄金负轨迹),部分使用直接推理模式。所有解题尝试用同一个自动判卷器打分,然后根据分数计算每个解法的"相对优势",统一更新模型。由于直接推理和反思推理共享同一个奖励评估过程,两种模式的结果都受到公平对待,不存在系统性的偏差。

另一类是在线蒸馏方法(OPD):学生模型始终以"直接推理"模式生成解题过程,但老师模型在评估学生的解法时,被额外提供了黄金负轨迹作为参考。有了这份参考,老师能够做出更高质量的指导——它会先识别失败草稿的错误,再结合学生的实际推理过程,提供更精准的改进方向。学生通过模仿老师的分布来学习,但整个过程中学生从未直接见过黄金负轨迹,因此推理时完全不依赖外部草稿。

在这两种范式下,黄金负轨迹都是提前离线生成好的,训练时不需要实时调用任何外部模型,额外的计算开销几乎可以忽略不计。

**四、实验结果:数字背后的故事**

研究者在非常广泛的场景下测试了ReflectRL的效果,涵盖了9个测试基准、4种不同大小和系列的语言模型(从1.5亿参数的小模型到80亿参数的大模型,包括Qwen2.5系列和LLaMA-3.1系列),以及4种不同的训练方法。

在数学推理任务上,ReflectRL叠加在GRPO基础上,综合得分从37.0提升到42.4,提升幅度约5.4个百分点;叠加在DAPO上,从38.4提升到43.5,提升5.1个百分点;叠加在在线蒸馏方法上,也有稳定的2.3个百分点提升。

更有趣的是模型在"题目范围之外"的表现。研究者用了三个与数学完全无关的测试来检验模型是否获得了更通用的推理能力:ARC-c(科学常识推理)、GPQA-Diamond(研究生级别的科学问答)以及MMLU-Pro(多学科综合知识测试)。在这些测试上,ReflectRL带来的提升甚至比数学本身更为显著。以GRPO+ReflectRL为例,综合得分从20.9大幅提升至40.0,提升了整整19.1个百分点。这说明从黄金负轨迹中学到的"发现错误、纠正推理"的能力,确实具有跨领域迁移的特性,而不只是数学技巧的堆砌。

与此同时,研究者还仔细观察了训练过程中的一些指标变化,发现了几个令人意外的副作用。

首先是推理效率的提升。标准GRPO训练到500步时,模型的平均回答长度超过800个token;而加了ReflectRL之后,模型的回答长度稳定在约420个token,缩短了将近一半,但准确率反而更高。这说明模型学到的不是"话说得更多就更对",而是更直接、更有针对性的推理路径。

其次是训练稳定性的改善。研究者测量了一个叫做"策略熵"的指标,可以理解为模型在回答问题时的"多样性"或"探索欲望"。标准GRPO训练到250步时,熵值从0.97骤降至0.03以下,模型陷入了"回答高度重复、不再探索新解法"的状态,通俗说就是"思路僵化了"。而ReflectRL在同样的训练步数时,熵值仍维持在约0.15,是GRPO的五倍多,模型保持着持续探索的活力,准确率也随之稳定增长。

研究者还测试了一个容易被忽视的对照实验:如果不给模型看"失败的草稿",而是给它看"正确的草稿",效果会更好吗?结果出乎意料——给正确草稿的模型在训练初期确实进步更快,但随后发生了严重的"策略漂移"(模型的行为偏离预期轨道),最终导致性能崩溃。而用黄金负轨迹训练的模型则一直保持稳定。这个发现说明,"失败草稿"中那种必须主动纠错而非被动模仿的任务设计,对训练稳定性有着意想不到的保护作用。正确答案太容易被直接复制,反而导致模型失去独立思考的能力。

**五、从失败中学习,人和AI都一样**

归根结底,ReflectRL揭示的是一个颇具普遍意义的道理:高质量的失败,远比低质量的成功更有学习价值。

当我们面对一道难题,看到一位高手写的解题过程,发现他在关键步骤犯了一个错误,此时我们的大脑并不会直接关闭这份材料。相反,我们会顺着他正确的推理走到出错的那一步,然后思考:为什么他在这里犯了错?正确的做法应该是什么?这种主动纠错的过程,比单纯欣赏一份完美答案往往更能加深理解。

ReflectRL就是在AI身上复现了这个过程,并且给出了让这个能力在推理时无需依赖外部草稿就能自然发挥的完整方案。

这对AI技术的实际发展来说有几层具体的意义。其一,数据效率大幅提升。之前被丢弃的大量强模型失败案例,现在都可以被重新利用,意味着同样的数据采集成本能换来更多的训练信号。其二,对于难题的处理能力有了明显改善,而难题正是当前AI系统的核心短板。其三,方法本身的通用性极强,几乎可以叠加在任何现有的训练流程上,不需要大幅改造原有系统。

当然,这项研究也有其局限性。黄金负轨迹必须来自能力足够强的专家模型,如果手头只有弱模型,这套方法的效果会大打折扣。此外,训练数据依然限于数学和推理类任务,对于其他类型任务的推广效果还有待验证。

如果你对这项研究感兴趣,想深入了解技术细节和完整实验数据,可以通过论文编号arXiv:2608.03972在学术预印本平台上查阅全文。研究者还同步公开了包含6.9万条黄金负轨迹的数据集OpenR1-GNT-69k,以及训练好的模型权重,方便研究社区进一步探索和复现。

---

Q&A

Q1:ReflectRL中的"黄金负轨迹"是什么,为什么普通失败案例不能替代它?

A:黄金负轨迹是由强大专家模型生成的、总体错误但推理过程大部分高质量的失败解题记录。普通模型自己写的失败案例质量杂乱,从推理一开始就问题重重,没有清晰的"正确前半段+局部出错"结构,因此无法提供有效的反思支点。用弱质量的失败案例反而会让模型的推理能力下降。

Q2:ReflectRL训练后的模型在实际使用时还需要外部草稿吗?

A:不需要。ReflectRL通过"反思到直接推理的渐进过渡",在训练结束时模型完全切换到直接推理模式,推理时只需要看到题目本身,不依赖任何外部草稿。反思训练阶段学到的纠错和推理能力已经内化到模型参数中,会在独立解题时自然发挥作用。

Q3:ReflectRL对数学以外的任务有效果吗?

A:实验结果显示,在与训练数据完全无关的科学常识推理、研究生级别科学问答和多学科知识测试上,ReflectRL同样带来了显著提升,有时提升幅度甚至超过数学任务本身。这说明从黄金负轨迹中学到的推理纠错能力具有一定的跨领域迁移性,不局限于数学场景。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询