教AI做题,为什么“抄近路”的老师反而带不出好学生?

2024年8月的一天,如果你去问任何一个正在做大模型后训练的工程师"蒸馏靠谱吗",他大概率会告诉你:靠谱,效果稳定,业界都在用。
但如果你追问一句"你确定学生学到的是老师的能力,而不只是记住了那几道训练题的答案",很多人会愣住。
这正是这篇论文想要戳穿的一个盲区。过去几年,"在线策略蒸馏"这项技术已经悄悄成为大语言模型训练的标配武器,从Kimi到DeepSeek,几乎所有头部模型的技术报告里都能看到它的身影。可是几乎所有的评测方式都有一个共同的毛病:只在训练用的那个领域、那个语言、那种题目难度上打分。这就好比你教一个学生做数学题,只在他刷过的那套卷子里出题考他,然后骄傲地宣布"教学效果显著"。他到底是学会了解题的思路,还是仅仅背下了这几道题的答案,你根本无从分辨。
这篇来自中科大、北大、浙大等机构联合团队的论文,就是要把这层遮羞布掀开,看看蒸馏出来的能力,到底能走多远。
一件反直觉的事:老师做不出来的题,照样有用
在讲清楚这篇论文的方法之前,得先说说"在线策略蒸馏"到底是什么,为什么它会成为主流。
在线策略蒸馏
在线策略蒸馏(On-Policy Distillation,简称OPD):让学生模型自己生成答案,然后老师模型对学生生成的这些内容逐字逐句打分指导,而不是让学生去背老师写好的标准答案。
这个设计思路其实解决了传统蒸馏的一个老毛病。以前教小模型的常见做法是,让大模型(老师)写一堆解题过程,然后把这些过程喂给小模型(学生)去模仿。问题是,学生自己实际做题时说的话,和老师写的范文往往不是一个路数,等真正上考场,学生按自己的方式往下写,写着写着就发现自己从没被这样训练过,越写越乱。这在学术上叫"曝光偏差"(exposure bias)。
在线策略蒸馏的解法很直接:既然学生迟早要用自己的话答题,那就干脆让学生现场答题,老师在旁边实时点评每一个字写得好不好。这就像请了一位家教,不是甩给你一本参考答案让你自己背,而是坐在你身边,看着你写作业,你写一步他就在旁边说"这步不对,应该往这个方向想"。
这里研究者们发现了一件很反直觉的事情。他们做了个实验:把训练题目按照老师能不能做对分成三类,一类是老师稳赢的简单题(连续四次采样全部答对),一类是老师根本做不出来的难题(四次采样全部答错),还有一类是随机混合的题。
按照常识,你会觉得肯定得挑老师会做的题来教学生,老师自己都不会的题,怎么可能教得好学生?
可实验数据显示,这三类题目训练出来的学生,最后成绩几乎一模一样。
论文原图(图1)里画得很清楚,Qwen3-32B教Qwen3-8B、Polaris-7B教两个不同大小的学生模型,简单题、难题、混合题这三条曲线在训练两百步之后收敛到了几乎重合的水平线上。他们还专门找了极端案例来验证,用小学生水平的GSM8K题目(简单到不能再简单),和DeepMath-103K里最难的那批题(老师大概率也做不出来),结果依然是差不多的效果,还能恢复默认混合训练效果的80%以上。
这说明了什么?
在线策略蒸馏教给学生的其实不是"这道题的正确答案",而是老师面对问题时的思考方式和推理习惯。
就像一个老棋手指导你下棋,即使他自己没能算清楚这盘残局的胜负,他每一步落子时展现出的判断逻辑,依然能让你学到东西。他"输了"这盘棋这个事实并不重要,重要的是他每一步棋背后的算路和权衡,这才是真正可以传授的东西。
不过研究者们也发现了一个更聪明的调整方式:不是看老师能不能做对,而是动态盯着学生自己的做题情况。一旦学生已经能稳定做对某道题了,就该把这道题从训练集里拿掉,因为再让老师在这道题上反复"纠正"学生,已经没有意义了,反而是浪费训练资源。这就好比一个孩子已经能熟练地系鞋带了,家长还非要天天盯着他系鞋带纠正姿势,孩子既烦,进步也慢,不如把这份精力挪到孩子还没掌握的技能上。这个小调整带来的提升虽然只有零点几个百分点,但逻辑是站得住的。
最要命的分水岭:老师和学生是不是"一个师门"出来的
如果说前面这个发现只是让人意外,那接下来这个发现才是这篇论文真正的重头戏,也是理解全文逻辑的一把钥匙。
同源模型 / 异源模型
同源(Same-Origin):老师模型和学生模型是从同一个基础模型出发训练来的,好比学生是从某个基座模型直接微调(SFT)而来,老师则是在同一个基座模型上做了强化学习训练。
异源(Cross-Origin):老师和学生压根不是从同一个基础模型出发的,是两条完全不同的血统。
研究者做了一系列对照实验,让同一个学生模型分别接受一个同源老师和一个异源老师的指导,然后在英语数学、中文数学、长链条推理题(需要串联多个子问题才能解出的复杂题)这几个完全不同的场景下考核。
结果非常打脸常识:更强的老师并不一定教出更强的学生。
比如论文里有一组对照,DS-distill-7B这个学生模型,同源老师是Polaris-7B,异源老师是Light-R1-14B。单看这两位老师自己的能力,Light-R1-14B明明分数更高,是个更厉害的选手。可让它去教学生之后,学生的表现反而不如那个"弱一点"的同源老师教出来的效果。尤其是在长链条推理这类需要跨领域迁移能力的题目上,异源老师教出的学生几乎没有明显进步,跟没训练之前差不多。
而同源师徒对之间发生的事情,堪称神奇:学生会被稳稳地拉到接近老师的水平线上,不管是在训练用的英语数学题上,还是压根没训练过的中文数学题、长推理链题目上,都是如此。
论文给出的解释是,模型的"出身"决定了两者之间的策略分布有多接近。
在线策略蒸馏本质上是在用KL散度(一种衡量两个概率分布差距的数学指标)把学生的输出概率拉向老师的输出概率。
如果学生和老师本来就是同一个祖先训练出来的,两者输出概率的"底子"本身就很接近,训练过程能做到的是把两者在整体策略层面对齐,这种对齐一旦发生,就会自动扩散到各种没见过的场景里去,因为学生学到的不是某个领域的具体技巧,而是老师整套思考问题的方式。
但如果老师和学生根本不是一路人,两者概率分布之间的鸿沟太大,训练顶多能做到让学生在训练数据覆盖的那个特定分布上表现得更像老师,一旦离开这个分布,学生立刻打回原形。
这里有个特别直观的类比:想象你要模仿一个人的说话口音。如果你俩本来就是老乡,从小听着同样的方言长大,只是后来一个走南闯北多学了几个新词,那你稍微跟他聊聊天,很快就能把新词的发音习惯学到手,甚至连他没教你的其他场合说话你都能自然带上那个味儿。可如果对方是外国人,说的是完全不同语系的语言,你死记硬背下来的那几句话,顶多是鹦鹉学舌,换个场景立马露馅,因为你压根没学到那套发音的底层逻辑,只是背下了几个固定搭配。
如果不做这个区分会怎样?
那就是很多团队会犯的错误:只看老师模型的绝对分数高不高,却完全没考虑师生之间的血缘关系,结果精心挑选了一个"最强"的老师,训练出来的效果反而不如随手找个同源的"弱"老师。这不是理论上的空谈,论文里的实验数据白纸黑字地证明了这一点。
论文还专门去量化验证了这个"血缘假说"。他们测量了训练过程中,学生和老师在每一步预测下一个词时,两者给出的候选词集合(取概率最高的16个词)有多大重叠。结果发现,同源师生对的重叠率随着训练推进是稳步上升的,而异源师生对的重叠率要么原地踏步,要么反而下降。
这说明同源蒸馏是在把学生的整套策略往老师那边挪,而异源蒸馏只是在训练数据那一小片区域里把两者的差距压低了而已,压根没有实现更广泛的对齐。
老师教的东西,会不会"越界"跑到别的学科去?
搞清楚了同源异源这个变量之后,研究者接着抛出了第二个重磅问题:如果只用数学题训练学生,学生会不会顺带在代码、科学这些完全不相干的领域也变强?
答案是:会,前提还是那个老规矩,得看师生是不是同源。
论文里做了个很干净的实验设计。用数学题目训练学生,然后拿代码能力测试基准LiveCodeBench和科学问答基准GPQA-Diamond去考它。同源情况下,无论是用数学题训练还是直接用代码题训练,最后学生在代码测试上的表现几乎一样好,都能接近老师的代码水平。反过来也成立,用代码题、科学题甚至是"遵循指令"这类跟数学八竿子打不着的任务去训练学生,学生的数学能力照样会显著提升,甚至连中文数学、长链条推理这些更细分的场景都能受益。
这背后的逻辑跟前面提到的是同一件事:同源老师和学生因为出身相近,蒸馏训练做的是整体策略层面的对齐,这种对齐一旦形成,会自然辐射到老师所有的能力维度上,而不管训练时用的是哪个学科的题目。
而异源师生对呢?直接用代码数据训练出来的效果,明显好于用数学数据训练但拿代码来考的效果,两者之间有一道清晰的鸿沟。这说明异源蒸馏顶多是在训练用的那批题目分布附近做局部微调,压根没有实现能力的跨界流动。
这里可以打个比方:你请了一位私教帮你练体能,如果这位私教本来就深谙你的身体状况和运动习惯(同源),那他哪怕只带你练了几周跑步,你会发现自己游泳、打球的耐力也跟着变好了,因为他锻炼的是你整体的心肺功能这个底层能力。可如果这位私教对你完全陌生,只是照本宣科地按一套通用教案带练(异源),那他教你跑步能让你跑步进步,但游泳该多差还是多差,因为压根没有触及底层能力,只是在表面动作上做了些调整。
如果不管这个跨领域效应会怎样?下一节会告诉你答案,这才是这篇论文真正让人后背发凉的地方。
当你想同时请多位老师,会发生什么
前面所有的铺垫,都是为了引出这篇论文最实用也最critical的发现:多教师蒸馏(Multi-Teacher OPD,简称MOPD)里潜藏的一个巨大的隐患。
多教师在线策略蒸馏
MOPD:现在业界流行的做法是,找好几位专精不同领域的老师模型(比如一位数学专家、一位科学专家),把不同领域的题目分别路由给对应的专家老师去指导,理论上这样能"拼装"出一个全能型学生。
这个设计思路听上去无懈可击:数学题交给数学老师批改,科学题交给科学老师批改,各管一段,互不干扰,最后学生应该能把各位老师的看家本领都学个遍。
但前面已经证明了,老师的影响力压根不会乖乖待在自己被分配的那个学科里,它会"越界"渗透到别的领域。这就意味着,当你把好几位老师凑在一起同时训练一个学生时,各位老师看似分工明确,实际上却在暗中"抢地盘",争夺学生在各个能力维度上的话语权。
研究者用两个数学能力强但科学能力弱的模型JustRL-1.5B,和一个科学、指令遵循能力强但数学偏弱的模型Nemotron-1.5B,做了一组极具戏剧性的实验。
设定一:JustRL当数学老师,Nemotron当科学/指令遵循老师,把两者分配给学生的题目比例不断调整。结果发现,随着分配给JustRL(数学老师)的题目比例逐渐增加,学生在科学测试GPQA-Diamond、代码测试LiveCodeBench、指令遵循测试IF-Eval上的分数居然全都跟着往下掉,而这几门科目本该是Nemotron负责教的。更夸张的是,在科学测试上,因为JustRL自己的科学水平比学生原本的水平还差,这种"越界"的拖累甚至让学生的科学分数一度跌破了训练前的起点。
设定二:把两位老师的角色对调,让Nemotron当数学老师,JustRL当科学/指令遵循老师。这时候原本会下跌的那三门科目反而随着Nemotron份额的增加而上升,方向完全反了过来。
这说明什么?学生某个领域的最终表现,压根不是由"名义上"负责这个领域的老师决定的,而是由整个混合体系里,哪位老师分到的题目份额更大来决定的。份额大的老师,会把自己的整体水平"拽"过来,无论这位老师负责的名义领域是什么。
论文管这个现象叫跷跷板效应(seesaw effect)。这个词选得很妙,因为它精准描述了这种此消彼长、互相拉扯的动态平衡:你多给一个老师加点份量,跷跷板这头就往下沉,另一头(另一位老师主导的能力)就翘起来。
研究者甚至还观察到了训练过程中一场真实的"拉锯战"。在长链条推理测试AIME24-Horizon-2上,训练初期学生的表现会先跟着数学能力更强的那位老师走,训练到后期又慢慢被拉回到另一位老师的水平线上,就像拔河比赛里绳子的中心点先往这边挪、又往那边挪,最终停在哪里,取决于两边选手(老师)各自的"力气"(能力水平和分配比例)。
为了把这个现象看得更清楚,研究者还做了一个"级联蒸馏"实验:先用科学能力强的Nemotron和科学题目训练一段时间,学生的科学分数应声上涨,紧接着切换成用JustRL和数学题目继续训练,学生的科学分数居然又原路掉了回去。这就像一个人先跟着一位教练苦练三个月游泳,成绩眼看着提升,结果换了个只练田径的教练之后,游泳成绩又慢慢退步回去了,因为身体资源和训练重心被重新分配了。
这里最值得琢磨的一个类比是:想象你同时请了两位家教辅导孩子,一位专攻数学,一位专攻英语,你觉得这样安排孩子就能数学英语两不误。可如果这两位家教实际上都在无意中影响孩子的整体学习习惯和思维方式(比如做题的严谨程度、时间分配的偏好),那么哪怕英语老师从来不教数学,只要他每周来的次数比数学老师多,孩子做数学题的风格也会不知不觉往这位英语老师的整体风格上靠。如果不去正视这种"越界影响",家长可能会一直以为"孩子数学不好,肯定是数学老师教得不到位",却完全想不到问题出在英语老师占用的比重太大,把孩子的整体状态往另一个方向带偏了。
这也是这篇论文提出的一个很有价值的诊断思路:当你发现一个多教师训练出来的模型在某个领域表现不佳时,别急着怪罪那个"名义上"该负责这个领域的老师,很可能真正的元凶是另一位老师的"跨界拉扯"在起作用。
同源师生之间到底发生了什么
论文的最后一部分,试图回答一个更本质的问题:为什么同源蒸馏能实现整体对齐,而异源蒸馏做不到?
研究者用了一个叫"Top-K重叠率"的指标去量化观察。简单说,就是每次学生预测下一个词时,看它给出的最靠谱的16个候选词,跟老师给出的最靠谱的16个候选词,重合了多少个。
这个指标随着训练推进的走势,在同源和异源两种情况下呈现出完全不同的图景。同源师生对的重叠率一路走高,从训练开始时就已经比异源师生对高出一截,然后随着训练步数增加持续攀升。而异源师生对的重叠率则原地不动,甚至有下降的趋势。
这个结果很关键,因为两种情况用的是完全同一套训练目标(同一个KL散度损失函数),却训练出了截然不同的效果。这说明同源蒸馏做到的是把学生整套输出概率分布,往老师那个方向整体挪动,而异源蒸馏充其量是在训练数据覆盖的那一小块区域上,把两者的差距降下来了而已,压根没触及到策略层面的深层对齐。
研究者进一步把这个发现套回到多教师蒸馏的场景里验证,结果证实同源老师在跷跷板效应里的"拉力"明显更强。他们用DS-distill-7B作学生,同源的Light-R1-7B当数学老师,异源的Light-R1-14B当科学/指令遵循老师,结果发现哪怕在两位老师份额对半分的情况下,学生的科学能力依然被那位"份量并不占优"的同源数学老师拽着走。
这说明"血缘"这个因素带来的影响力,甚至比训练数据的份额比例还要更强势。
论文中一个值得单独拎出来说的细节是,在其中一组同源实验里(Light-R1-14B教DS-distill-14B),蒸馏出来的学生模型在长链条推理测试上,最终成绩居然超过了老师自己的独立表现。这说明同源蒸馏训练出的学生,并不一定被老师的水平天花板锁死,这个结论多少有点反常识,值得后续研究再深挖一下这个"青出于蓝"的机制到底是怎么发生的。
写在后面
读完这篇论文,最让我意外的一点,是那个"教师从不解题的题目照样有用"的实验结果。这个结论其实间接回应了一个我一直没想清楚的问题:为什么大家在做强化学习和蒸馏的数据筛选时,总喜欢用难度过滤这种简单粗暴的手段,却很少有人真正验证过这个筛选到底有没有必要。这篇论文用扎实的对照实验说明,至少在在线策略蒸馏这个场景下,难度筛选可能是个伪命题,真正重要的变量藏在别处,也就是师生的血缘关系上。
另一个让我反复咂摸的点是跷跷板效应这个发现。它其实揭示了一个更普遍的道理:任何试图用"路由分工"来实现模块化组合的系统,都可能面临类似的隐患,如果各个模块之间的影响力压根没有被真正隔离开的话。这让我联想到多智能体系统里的类似问题,几个分工明确的智能体协作时,会不会也存在这种谁的话语权大谁就主导全局风格的暗流?这篇论文没有回答这个问题,但它提供了一个很好的诊断框架,遇到类似的"分工却互相干扰"的现象时,不妨先去检查各个组件之间是不是存在这种隐性的"血缘"或"权重"因素在起作用。
Q&A
Q1:在线策略蒸馏和传统的知识蒸馏有什么区别?
A:传统蒸馏让学生模仿老师写好的答案,容易出现训练内容和学生实际生成方式不匹配的问题。在线策略蒸馏则是让学生自己生成答案,老师对学生生成的内容逐字打分指导,这样能减少训练和实际使用之间的偏差。
Q2:为什么同源的老师模型比更强的异源老师模型效果更好?
A:因为同源模型(从同一个基础模型训练而来)的输出概率分布本身就更接近,蒸馏训练能实现整体策略对齐,这种对齐能扩散到各种没训练过的场景。异源模型分布差距太大,训练只能在训练数据覆盖的范围内起效,泛化能力弱。
Q3:多教师蒸馏中的跷跷板效应具体是什么意思?
A:指在同时用多位专精不同领域的老师训练一个学生时,某位老师的份额增加,会把学生在各个能力维度上的表现都往这位老师的整体水平拉,而不只是拉动这位老师名义负责的那个领域,导致各领域能力此消彼长。