华东师范:为什么让AI专门学习“错误示范”,反而能让它变得更聪明?

这项由华东师范大学与上海创新研究院联合开展的研究,以预印本形式发布于2026年6月22日,论文编号为arXiv:2606.23104,有兴趣深入了解技术细节的读者可以通过该编号查阅完整论文。

先从一个反常识的问题说起。如果你要教一个孩子学数学,你会给他看更多做对的题目,还是做错的题目?大多数人的直觉是多看正确答案、多练正确解法。然而华东师范大学的研究团队发现,至少对于当前的大型语言模型(也就是像ChatGPT、DeepSeek这类AI)来说,答案恰恰相反——让模型专门从自己做错的例子中学习,效果远比只让它学习正确例子要好得多。这个发现是这篇研究的核心出发点,而他们由此开发出的方法叫做ReNIO,全称是"Reweighting Negative trajectory Importance for LLM On-policy distillation",翻译成人话就是:在AI自学过程中,自动给那些"走歪了的推理路径"分配更多的注意力。

**一、先搞清楚AI是怎么"练习"数学推理的**

要理解这个研究,得先明白一件事:AI是怎么变得更擅长推理的。目前主流有两大训练方式。第一种叫强化学习,可以把它想成"结果导向的考核":AI做完一道题,对了就给奖励,错了就扣分,靠这种反馈慢慢调整自己的策略。第二种叫"在线蒸馏"(On-Policy Distillation,简称OPD),可以把它想成"跟着老师一步一步学":有一个更强大的教师模型,学生模型自己先尝试解题,然后在每一步推理中都参考教师的"建议",逐步调整自己的思维方式,让自己的推理步骤越来越接近教师的风格。

这两种方式各有优劣。强化学习就像只看最终成绩单,中间的过程全靠自己摸索,而且必须等AI把整道题做完才能知道对不对,对于那些特别难的题目,AI可能要写好几千个字的推理过程,这个等待过程非常耗时耗力。在线蒸馏则不同,它可以在推理进行到一半时就开始给反馈,每一个推理步骤都有老师在旁边"纠偏",不需要等到最后才知道哪里错了。更省钱的是,在线蒸馏甚至只需要看推理过程的前半段就能有效训练,不需要非得等AI写出最终答案。这种"短前缀训练"的优势让在线蒸馏在成本上远比强化学习划算。

研究团队还研究了一种特殊形式叫"在线自蒸馏"(OPSD),这种方式更省钱——连独立的教师模型都不需要,直接用当前训练的模型本身初始状态作为老师,让AI自己教自己。

**二、那个让人意外的发现:错题本比正确解法更值钱**

带着对在线蒸馏的理解,研究团队做了一个看似简单却很有洞察力的实验。他们让一个叫Qwen3-1.7B的AI模型分别在两种不同的"训练集"上练习:第一组只用它自己做对了的题目来训练,第二组只用它自己做错了的题目来训练,然后看看两组各自训练出来的模型,谁在新题目上表现更好。

按照直觉,"只用正确示范训练"应该赢才对——毕竟正确的推理路径才是我们希望AI学习的嘛。但实验结果让所有人大吃一惊。在OPD模式下,只用错误示例训练的模型,在三个数学竞赛题库(AIME24、AIME25和HMMT25)上的平均表现,比只用正确示例训练的模型高出了2.59个百分点;在OPSD模式下,这个优势同样存在,差距是2.50个百分点。这两个数字在数学竞赛这种极其考验推理能力的任务上,意味着相当显著的差距。

研究团队没有满足于发现这个现象,他们还追问了一个更深层的问题:为什么会这样?他们记录了两种不同训练方式得到的模型,在实际做题时的两个特征:平均回答长度,以及使用了多少个"反思性词语"。所谓反思性词语,就是像"等一下"、"但是"、"不对"、"或者说"、"再检查一下"这类表示AI在自我怀疑、自我纠正的词汇。

结果发现,用错误示例训练出来的模型,不仅回答更长,而且在推理过程中会使用更多这类反思性词语。这意味着什么?只用正确示例训练的模型,学到的是"这道题可以这么做,做到这一步,然后那一步,最后得出答案",整个过程流畅但少了一点探索感,模型变得更自信,但代价是它不太愿意质疑自己的中间步骤。相比之下,用错误示例训练的模型,学到的是"我曾经在这个岔路口走错了,所以下次要多想想",它的推理过程保留了更多谨慎、探索和自我检验的成分。这正是解决复杂数学题时最需要的品质。

**三、问题随之而来:怎么在不看最终答案的情况下,挑出那些"有价值的错误"**

确认了错误示例更有价值之后,研究团队面临一个工程上的难题。最直接的做法是让AI做完整道题,看看答案对不对,然后给做错的题更高的训练权重——但这样做需要等AI把整道题全部写完,这就失去了在线蒸馏最重要的优势:短前缀训练的低成本。

研究团队换了一个角度思考。一道推理题之所以做错,通常不是因为从头到尾每一步都错了,而是在某个关键节点上,AI做了一个"错误的转向"。以一道数学题为例,AI可能在写到"她有9×2=18"这一步的正确节点之前,误算成了"13×2=26",就是这一个数字选错了,导致后面全部走偏。问题在于,这个关键节点发生在推理过程的中途,如果只看最终答案才能知道对错,代价太高。

但有没有办法在看到这个关键节点时,不依赖最终答案就能察觉到"这里可能出问题了"?答案是有的。关键在于一个叫做"学生-教师概率比"的信号。简单说:在推理的每一步,教师模型和学生模型各自对"下一个词应该是什么"有一个概率估计。正常情况下,大多数词学生和教师的判断差不多。但在那个关键的"转向节点",学生会以很高的概率选择一个教师认为很不可能的词。比如,学生以78%的概率选择了"13",而教师认为这个位置出现"13"的概率只有13%。这个巨大的不一致,就是一个预警信号:这里可能是推理出错的关键节点。

更妙的是,这个信号完全可以在推理进行中实时计算,根本不需要等到最后答案出来。

**四、ReNIO的三步"找出问题,量化问题,平衡训练"**

基于上述思路,研究团队设计了ReNIO的三个核心步骤,整个过程可以用"筛选关键节点、评估问题严重性、重新分配学习资源"来概括。

第一步是计算每个推理步骤中,学生模型相对于教师模型有多"自以为是"。具体做法是:对推理过程中的每一个词,计算学生认为这个词出现的概率,除以教师认为这个词出现的概率,然后取对数(这样做是为了让数字更好处理)。这个数值越大,说明学生在这一步越是"自信地偏离了教师的判断"。研究团队把这个指标称为"学生-教师对数比"。

从大量数据中统计这个对数比的分布,团队发现了一个有趣的规律:绝大多数推理步骤的这个值都非常接近零,说明学生和教师的判断在绝大部分时候是一致的。只有极少数词的这个值会特别大,这些就是真正的"关键节点",推理在这里发生了实质性的偏离。

第二步是筛选出那些真正重要的关键节点。研究团队设定了一个门槛值(在实验中最优为0.8),对数比超过这个门槛的词才被认定为"关键偏离词"。同时,为了防止某些极端情况下数值过大导致训练不稳定,他们还设置了一个上限(实验中最优为3.0),超过这个上限的值就裁剪到上限。这一步的效果是把大量无关紧要的推理步骤过滤掉,只保留那些真正体现学生偏离教师的关键节点。

第三步是把这些关键节点的信息汇总成一个"样本权重",用来决定这道题在训练中值得分配多少注意力。具体做法是把所有关键节点的对数比加起来求平均,然后取指数(这个数学操作叫做几何平均,它的好处是对极端值不那么敏感)。这个权重值越大,说明这条推理路径包含越多"学生自信地偏离了教师"的节点,也就意味着这条路径更可能是一个"有价值的错误示例",应该在训练中得到更多强调。

最后,为了让训练过程稳定,研究团队还在每个训练批次内对权重做了归一化处理——把所有样本的权重调整成平均值为1,这样整体的训练强度不会因为权重的加入而变大或变小,只是在内部重新分配了不同样本的相对重要性。

**五、验证:数字会说话**

带着ReNIO,研究团队在多个不同的模型和任务上进行了测试,覆盖了数学推理和代码生成两大方向。数学推理用的是三个极有挑战性的竞赛题库:美国数学邀请赛2024年题(AIME24)、2025年题(AIME25),以及哈佛-MIT数学联赛2025年题(HMMT25)。代码生成用的是HumanEval+和MBPP+两个标准测试集。

在Qwen3-1.7B这个模型上,加入ReNIO之后的在线自蒸馏(OPSD)相比不加ReNIO的基线,在AIME24上提升了8.90%,整体平均提升了4.77%。在R1-Distill-Qwen-7B这个更大的模型上,AIME25单项提升了10.00%,整体平均提升了4.74%。在需要独立教师模型的OPD设置下,R1-Distill-Qwen-1.5B在HMMT25这个最难的题库上,相比不加ReNIO提升了15.44%。代码生成任务同样有改善,Qwen3-1.7B的HumanEval+提升了4.07%。

还有一个值得关注的观察:对于R1-Distill-Qwen-1.5B这个模型,单独使用OPSD(没有ReNIO)反而比基线模型还稍差一点,说明标准的在线蒸馏在某些条件下可能不稳定。但加入ReNIO之后,不仅超过了OPSD基线,也超过了原始模型,说明ReNIO在训练信号嘈杂的情况下还有稳定训练的额外作用。

**六、短前缀的秘密:省钱又有效的训练窗口**

前面提到在线蒸馏的一大优势是可以只看推理的前半段来训练。研究团队专门测试了这个特性。他们比较了两种情况:一种是只让AI生成最多1024个词就停下来做训练(短前缀),另一种是生成最多4096个词(这个长度通常足够包含最终答案)。

结果发现,在不加ReNIO的情况下,1024词的在线自蒸馏平均得分是40.83,而4096词的版本反而只有38.70——短前缀版本反而更好。加入ReNIO之后,两种前缀长度都进一步提升,1024词版本达到42.78,4096词版本达到40.56,而且两者的提升幅度相近(分别是+1.95和+1.86)。这说明ReNIO的权重计算完全依赖推理过程中的中间步骤,不需要最终答案,所以短前缀模式下同样有效。

在训练速度上,数字同样直观。使用1024词前缀的在线蒸馏,每步训练平均只需要约4.6秒(OPD)到5.0秒(OPSD);而强化学习方法(GRPO)每步需要约29.9秒,慢了将近6倍。即使把前缀长度扩展到4096词,每步也只需要约12秒,仍然远快于强化学习。

**七、"错误示范"里有什么秘密?教师也保持着高信心**

研究团队还做了一个更深入的验证,想确认ReNIO给高权重的那些推理路径,教师模型对它们的判断是否真的"清晰可信",还是说教师也一脸茫然。他们的分析思路是:如果教师模型对某一步的下一个词非常确定(概率集中在少数几个词上),那说明教师有清晰的判断;如果教师的概率分散在很多词上,那说明教师自己也拿不准,这时候教师的"纠错信号"就不太可靠。

统计结果显示,ReNIO给出高权重的那些推理路径,教师模型的"信息熵"(衡量不确定性的指标)反而更低,也就是说教师对这些路径的下一步判断更确定。换句话说,ReNIO倾向于给那些"学生犯了明显错误,但教师非常清楚正确答案应该是什么"的路径分配更高权重。这正是最理想的纠错场景——错的地方错得清晰,对的参照也清晰。

反过来,那些真正一塌糊涂的推理路径(教师自己都看不懂了),教师的信息熵更高,而ReNIO给这些路径的权重反而更低。这说明ReNIO不是无差别地强调所有错误,而是有选择性地强调那些"有清晰纠错价值"的错误。

**八、细节决定成败:三个缺一不可的设计选择**

研究团队还做了消融实验,专门测试ReNIO三个关键设计选择各自的贡献,用"拆掉哪块砖,墙会倒"的方式来验证每个部件的必要性。

去掉对数比上限裁剪之后,平均得分从42.04下降到40.09,低于原始OPD基线。原因是少数极端偏离的词会产生非常大的权重,导致训练不稳定,就像烤箱温度调得太高把蛋糕烤糊了一样。去掉关键节点筛选门槛,让所有词都参与权重计算,平均得分是40.83,虽然比基线略好,但远不如完整ReNIO的42.04。原因是大量无关紧要的推理步骤(学生和教师意见一致的部分)混入后,稀释了真正关键节点的信号,就像把一杯浓缩咖啡用大量清水兑稀了一样。批次内归一化的影响最大:去掉它之后,得分跌至39.54,甚至低于原始基线。原因是没有归一化,样本权重直接影响整体训练的梯度大小,不同批次的梯度幅度差异巨大,训练陷入混乱。

研究团队还比较了几种替代设计。一种是把同样的学生-教师比率信号用在每个词的损失权重上(而非样本层面),结果比不加权的基线还差,说明这个信号应该在样本层面使用,而不是词语层面。另一种是把比率方向反过来,用教师-学生比率(也就是强调教师认为重要但学生不重视的词),结果略优于基线,但不如正向比率,说明ReNIO选择强调"学生自信偏离教师"而非"教师认为重要但学生忽视"的设计是正确的。

**九、一个具体例子:三种方法在同一道数学题上的表现**

论文最后给出了一个直观的对比案例,可以帮助我们看出ReNIO的实际效果。题目是:找出满足a+b+c=300和a?b+a?c+b?a+b?c+c?a+c?b=6000000的非负整数三元组的个数,正确答案是601。

强化学习方法(GRPO)的AI找到了一类解(a=100时有201种),但没有意识到b=100或c=100也各自有201种,最终给出了错误答案201。在线蒸馏(OPD)的AI注意到了三类对称解各有201种,正确地计算了3×201=603,但没有发现其中(100,100,100)这个三元组被重复计算了两次,给出了错误答案603。加入ReNIO的版本(OPD+ReNIO)则在推理过程中自我质疑了一次("等等,每个集合里都包含了(100,100,100)这一个三元组,所以要减去重复计算的2次"),最终得出正确答案601。这个例子生动地展示了ReNIO训练出的模型更倾向于在推理中途进行自我检验和纠错。

归根结底,这项研究告诉我们一件颠覆直觉但细想又合理的事:对于AI推理能力的训练来说,错误示例有时候比正确示例更有教育价值,因为错误的路径暴露了AI自身的弱点所在,帮助它保持谨慎和探索的推理风格,而不是过度依赖已有的"成功经验"。ReNIO提供的是一套自动识别和强调这些有价值错误的机制,而且全程不需要等待最终答案,不破坏在线蒸馏省时省力的核心优势。

当然,研究团队也坦诚地指出了这项工作的局限:由于计算资源的限制,他们只在较小规模的模型上验证了ReNIO的效果,对于参数量更大的模型是否同样有效,还需要进一步验证。这也是未来研究可以继续探索的方向。

对于关心AI技术发展的普通读者,这项研究揭示的道理在某种程度上也适用于我们自己的学习:把精力放在分析自己做错了什么、在哪里判断失误,往往比反复温习已经掌握的内容更能提高能力。AI在这一点上,和人的学习规律出奇地一致。如果你对这项研究的技术细节感兴趣,可以在学术预印本平台arXiv上搜索编号2606.23104查阅完整论文。

---

Q&A

Q1:ReNIO是什么,和普通AI训练方法有什么不同?

A:ReNIO是华东师范大学研究团队提出的一种训练权重分配方法,专门用于在线蒸馏(AI跟着教师模型学习)场景。普通的在线蒸馏对所有训练样本一视同仁,而ReNIO通过计算学生模型和教师模型在每一步推理中的概率差异,自动识别出那些"学生走错路了"的推理路径,并给这些路径分配更高的学习权重,让AI从自己的错误中学到更多。

Q2:为什么训练AI数学推理要专门强调错误样本?

A:研究团队发现,只用正确推理路径训练出的AI模型会变得过于自信,推理过程短而缺乏自我检验。而用错误推理路径训练的AI,不仅推理更长,还会在过程中更频繁地停下来质疑自己、探索替代方案,这种谨慎探索的风格在解决复杂数学题时更有优势,实验中平均得分提升了2.5个百分点以上。

Q3:ReNIO需要AI把题目做完才能计算权重吗?

A:不需要。这正是ReNIO的重要设计亮点。它只需要分析推理过程中每一步的学生-教师概率比值,不需要等到AI写出最终答案。所以ReNIO完全兼容在线蒸馏的"短前缀训练"模式,训练速度是强化学习方法的约六倍,同时保持甚至超越了完整推理训练的效果。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询