知识蒸馏教出了会推理的学生,却教丢了它的常识

一个反直觉的发现,正在悄悄改写大模型训练的常识。

你可能觉得,用更厉害的老师模型教小模型学习,怎么教都应该是越教越好的。毕竟老师见多识广,学生跟着学总归没坏处。这个直觉贯穿了整个知识蒸馏领域十几年,从预训练到后训练,几乎所有研究都在验证这个朴素的信念。

但2026年这篇来自Meta AI、华盛顿大学和普林斯顿大学的研究,在一个叫"中期训练"的阶段狠狠打了这个直觉的脸。研究者发现,同样一套知识蒸馏方法,放到预训练阶段是双赢,放到中期训练阶段却变成了拆东墙补西墙:模型的推理能力蹭蹭往上涨,但认知事实的能力反而比什么都不做还要差。

这不是一个小打小闹的边角发现。研究团队用OLMo-2这套完全开源的模型生态系统,把预训练、中期训练、后训练三个阶段都跑了一遍对照实验,现象出奇地稳定,换教师模型大小、换散度方向、换插值系数,这个矛盾都稳稳地存在。这就逼着我们不得不重新想一个问题:知识蒸馏,到底在教会模型什么?它教不会的东西,又是为什么教不会?

先弄明白几个概念

知识蒸馏

知识蒸馏(Knowledge Distillation, KD):用一个更强的"老师"模型的输出概率分布来指导一个较弱的"学生"模型学习,而不只是让学生模仿训练语料里的标准答案。老师模型看到每个词后会给出一个概率分布,比如预测下一个词是"猫"的概率是0.6,"狗"是0.3,这份"软标签"里藏着老师对各种可能性的判断,比单纯的"正确答案"信息量更大。

中期训练(mid-training):这是介于预训练和后训练之间的一个新兴阶段,用规模更小但质量更精挑细选的语料继续训练模型,目标是为后续的对齐(alignment)打好基础。它消耗的token数量远少于预训练,但对数据质量的要求又比预训练高得多。

要理解这个矛盾有多古怪,得先弄清楚语言模型现在是怎么练出来的。早些年的做法很简单,一个模型从头到尾在海量网络文本上做下一词预测(next-token prediction),练完就直接对齐、上线。但最近两年,Llama、Gemma这些顶尖模型的训练流程里都多出了一个夹心层,预训练用几万亿token打地基,中期训练用几十上百亿高质量token精修,最后再用后训练的强化学习和偏好优化去打磨对话能力。

这个中期训练阶段之所以重要,是因为它的token预算很紧张。预训练可以挥金如土地用几万亿token,但中期训练往往只有几十亿到上百亿的token量,这意味着每一个token都要榨出更多的学习信号。知识蒸馏听起来正好对症,用老师模型的软标签给每个token附加更丰富的信息,理论上应该能让学生学得更快更好。

问题恰恰出在这里。

矛盾是怎么被发现的

研究团队用了一个1B参数的OLMo-2学生模型,配上7B参数的Instruct版本作为老师,做了一系列受控实验。他们调节一个叫α的参数,α等于0时就是普通的下一词预测训练,α等于1时就是完全的知识蒸馏,中间值代表两者的混合。

在预训练阶段,结果符合直觉:随着α增大,模型的推理能力和事实记忆能力同步上升,蒸馏在这两个维度上都跑赢了纯粹的下一词预测,形成了一条向右上方倾斜的帕累托改进曲线。

推理能力(Reasoning):指模型解决需要多步逻辑推导的问题的能力,论文里用GSM8K数学题、BBH复杂推理题等生成式任务来衡量。

事实记忆(Factual Recall):指模型直接回忆并说出具体事实的能力,比如"埃菲尔铁塔在哪个城市",论文用TriviaQA、Natural Questions等问答任务衡量。

但把同样的实验搬到中期训练阶段,曲线的形状彻底变了。推理能力依然随着蒸馏强度增大而提升,但事实记忆能力开始掉头向下,而且不管怎么调整蒸馏强度、换成前向KL还是反向KL散度,没有任何一个操作点能同时超越纯下一词预测在两个维度上的表现。用论文里的说法,蒸馏的收益曲线整体滑落到了基线之下,推理能力的提升是靠牺牲事实获取能力换来的。

这里要解释两个专业词。

前向KL和反向KL散度:这是衡量两个概率分布差异的两种数学方式。前向KL让学生尽量覆盖老师认为有可能的所有选项,不容易漏掉正确答案但容易学得比较"发散"。反向KL则让学生专注模仿老师最有把握的那个选择,学出来的分布更"锐利",但可能会忽略老师认为次要的合理答案。

更让人意外的是,这个现象不是转瞬即逝的过渡态,而是会一直延续到后训练结束。研究者对所有中期训练完的模型都套用了同一套标准的后训练流程,包括监督微调、偏好优化和两轮强化学习,结果发现推理能力的优势保留了下来,但事实记忆的落差在小教师模型上依然存在,只有换用更大的教师模型时差距才会收窄甚至反超。

这就好比你请了一位家教来帮孩子备战期末考试,结果发现孩子的应用题解题思路突飞猛进,可是历史年代和地理知识却记得比自学时还差,而且这个知识窟窿一直拖到升学考试都没能完全补上。

为什么会出现这种割裂

研究团队没有满足于发现现象,而是往深挖了三层原因,分别是教师的自信程度、学生已经学到了什么、以及蒸馏这个数学目标本身怎么处理教师的犹豫。

第一层原因,教师模型在不同类型的数据上自信程度差别巨大。

研究者用OLMo-2的1B、7B、13B三种规模的Instruct模型分别当老师,在数学题、指令跟随这类"程序性"数据上,老师的预测熵(predictive entropy)很低,说明它对下一个词该是什么非常确定。但在维基百科、学术论文这类知识密集型的数据上,老师的预测熵明显更高,显得犹豫不决。

预测熵(predictive entropy):衡量一个概率分布"混乱程度"的指标,数值越低说明模型对下一个词的判断越集中越自信,数值越高说明模型把概率分散在了很多个候选词上,拿不定主意。

而且这个熵值不只是好看的统计特征,它真的和答案对不对挂钩。研究者把每个数据域里的token按熵值从低到高分成五档,发现在每一档里,熵越低的档位,老师给出的第一预测和标准答案一致的比例越高。这说明教师的自信不是装出来的,是真的和它答对的可能性成正比。

这个发现本身就带着点讽刺意味。老师在讲解数学题步骤的时候侃侃而谈,可一旦被问到某个具体的历史人物出生年份,反而开始支支吾吾。这不是老师偷懒,而是数学和逻辑推理这类"程序性"知识往往有比较确定的推导路径,而事实性知识常常涉及大量互相独立、彼此不构成逻辑必然的具体信息点,老师即便见多识广,也难免在某些冷僻细节上拿不准。

第二层原因,学生自己的学习节奏和教师的自信模式并不同步。

研究团队追踪了学生模型在预训练过程中习得各个事实的进度,把评测集里的问题按对应位置上教师的预测熵分成五档。结果显示,教师最有把握的那一档事实,学生在预训练结束时已经掌握了67%,而教师最没把握的那一档,学生只掌握了5%。

这个规律有个很关键的推论。到了中期训练开始的那一刻,也就是预训练消耗了四万亿token之后,容易学的低熵事实早就被学生吃透了,剩下没学会的事实几乎全部堆积在教师最不自信的高熵区间里。换句话说,中期训练要面对的,恰恰是教师本来就教不太好的那部分内容。

这就好比一个学生已经把课本里所有确定无疑的公式定理都背熟了,剩下没搞懂的全是那些连老师自己都讲不太清楚、需要查资料才能确定的边角知识点。这时候你再请这位老师来补课,老师面对这些他自己都吃不准的问题,给出的讲解自然也是含糊其辞的。

第三层原因,也是最致命的一层,蒸馏这个数学目标会主动削弱对这些高熵事实的学习信号强度。

研究者从数学推导上证明了一件事:在标准的下一词预测里,梯度会一直把正确答案的概率往1推,这个目标是绝对的,不管老师怎么想。但在知识蒸馏里,不管是前向KL还是反向KL,梯度推动学生逼近的目标变成了老师赋予正确答案的概率,而不是绝对的1。

梯度(gradient):这里指的是训练过程中用来更新模型参数的信号强度,梯度越大意味着模型被推向正确答案的力度越强。

也就是说,如果老师本身对某个答案就只有五成把握,那么蒸馏给学生的学习推力也只有五成,而不是下一词预测里那种铆足了劲往正确答案上顶的推力。研究者实际测量发现,在教师熵值最高的那一档,知识蒸馏产生的梯度强度只有普通下一词预测的大约一半。

三重因素叠加起来,就形成了一条完整的因果链。程序性知识让教师信心满满,信心满满的教师给出强有力的学习信号,学生因此在推理能力上进步神速。但知识密集型内容让教师本就犹豫,再加上这部分内容恰好是学生尚未攻克的硬骨头,蒸馏给出的学习信号又天生打了折扣,双重削弱下,学生的事实记忆能力自然就被落下了。

解决方案:让老师只在有把握的时候开口

发现了病因,研究团队顺势提出了对症的药方,叫做开关蒸馏(Switch Distillation)。

思路说出来其实很朴素:既然教师在低熵token上讲得头头是道,在高熵token上支支吾吾,那干脆按熵值把每个token分流,熵低的时候听老师的,用反向KL蒸馏去学;熵高的时候不听老师瞎猜,直接回到语料本身的标准答案,用普通的交叉熵损失去学。

具体做法是,在每个训练步骤里,先用教师模型的logits算出每个token位置的预测熵,然后在这一批数据里,把熵值最低的20%的token挑出来,交给反向KL蒸馏处理,剩下80%的token老老实实用交叉熵训练。这个路由的判断依据,也就是教师熵,本来就是计算知识蒸馏损失时顺手就能拿到的副产品,所以这套方案几乎不增加额外的计算开销。

这就好比一个班里配了两位辅导老师,一位是学识渊博但只在自己擅长的领域发言的专家老师,另一位是照着标准答案讲解的普通助教。学生做题的时候,遇到专家老师有把握的题型就听专家的,遇到连专家都拿不准的冷门知识点,就回头翻课本上的标准答案,而不是听专家含糊其辞地瞎猜。如果没有这个分流机制,让专家老师对着他自己都拿不准的问题信心十足地开讲,学生反而会被这种虚假的自信误导,学得比直接看课本还差。

这里再解释一下反向KL为什么被选中作为蒸馏时的散度方向。研究者的解释是,反向KL具有"模式寻求"(mode-seeking)的特性,会让学生的概率分布向老师最有把握的那个选项收拢。既然筛出来的这批token本身就是教师非常自信的低熵token,用反向KL正好能把这份自信原原本本地灌输给学生,而前向KL会把学习压力分散到教师概率分布的长尾部分,反而稀释了这份确定性。

实验结果:数字说话

研究团队用7B和13B两种规模的Instruct模型作为教师,系统对比了开关蒸馏和几种基线方法,包括纯下一词预测、前向KL蒸馏、反向KL蒸馏,以及一种叫做TRKD的令牌路由蒸馏方法(思路和开关蒸馏相似但方向相反,给高熵token用前向KL蒸馏,低熵token仍保留交叉熵)。

中期训练阶段的结果显示,用7B教师时,开关蒸馏把推理能力的宏观平均分从纯下一词预测的26.1%拉高到44.7%,知识与常识能力从对照组明显提升,而事实记忆分数几乎和对照组持平,只低了1个百分点左右。13B教师的情况类似,只是整体幅度稍弱一些,这也印证了此前一些研究提出的观点,教师和学生的参数规模差距过大反而会削弱蒸馏效果。

更值得关注的是后训练之后的表现。研究者把标准的四阶段后训练流程,监督微调、直接偏好优化、两轮强化学习,套用到每一个中期训练完的模型上。结果开关蒸馏依然保持着推理能力上的领先优势,7B教师条件下宏观平均分从44.7%进一步涨到50.6%,而且是所有方法里事实记忆保留得最好的一个,后训练过程中损失最少,最终反倒成了事实记忆分数最高的方法。

这里有个细节值得多说一句。后训练本身通常会带来一定程度的知识遗忘,这在之前的研究里已经有过记录。但开关蒸馏进入后训练时虽然带着一个不大的事实记忆劣势,最后却反而追平甚至反超了纯下一词预测的方案。这说明中期训练阶段学到的推理能力和事实记忆之间的平衡状态,会实实在在地影响到后训练结果的走向,不是练完中期训练就万事大吉,后面这道工序其实是在延续甚至放大之前打下的底子。

研究者还做了一系列消融实验,拆解开关蒸馏里每个设计选择到底起了多大作用。如果把反向KL换成前向KL,推理能力会掉2.9个百分点,知识能力掉1.4个百分点。如果把按熵值路由换成按教师是否答对来路由,或者按数据来源领域硬编码路由,又或者干脆随机路由,效果全都明显不如按熵值路由。如果对低熵token不用软标签蒸馏,而是直接用教师给出的最可能答案当作硬标签去训练,事实记忆能提升1.3个百分点,但推理能力会掉6.4个百分点,知识能力掉2.8个百分点。

这组对比说明了一件事,按教师熵值来做路由这个判断标准,确实是整套方案里最核心的那根轴,换掉它效果就会明显打折。而软标签蒸馏而非硬标签蒸馏也很重要,说明教师完整的概率分布里包含了比"唯一正确答案"更丰富的信息,直接扔掉这些细节信息是有代价的。

这个发现能走多远

论文的作者们也没有把这个结论局限在OLMo-2这一个模型家族里。他们在SmolLM2生态系统上重复了一遍类似的实验,用360M参数的学生模型配1.7B参数的教师模型,虽然模型规模小了不止一个数量级,曲线看起来也更粗糙一些,但整体的定性规律是一致的,预训练阶段蒸馏能同时改善两个维度,中期训练阶段则又出现了推理提升、事实记忆下降的割裂,而开关蒸馏依然能在中期训练阶段缓解这个矛盾。

研究者还额外验证了教师模型自信程度的域间差异是否是OLMo-2独有的现象。他们拿OLMo-3、Qwen3、Gemma-3、Granite 3.3这四个跟OLMo-2完全不同系的开源指令模型当教师,重新画了一遍预测熵分布图,结果程序性数据和知识密集型数据之间的分离模式在所有模型上都稳定存在,用ROC曲线下面积衡量,数值都明显高于随机水平0.5,落在0.696到0.771之间。这说明教师在不同类型数据上信心不对等,不是某个模型家族的怪癖,而是当下主流指令微调模型的一个共性。

写在后面

读完这篇论文,最让我意外的不是那个反直觉的核心发现本身,而是研究者拆解原因的方式。他们没有停在"蒸馏在中期训练阶段效果变差"这个观察层面就收手,而是硬生生从预测熵、学习曲线、梯度公式三个完全不同的角度,把这个现象钉死成了一条严密的因果链。这种把一个经验现象一路挖到数学推导层面的做法,本身就是很扎实的研究方法论示范。

还有一点值得单独说说。论文里提到,蒸馏对推理能力的提升出现得极早,开关蒸馏只用了2.5B token,也就是全部中期训练预算的1/24,就已经超过了纯下一词预测跑满60B token之后的推理成绩。这个数字乍一看有点吓人,一个只训练了二十四分之一时长的模型,推理能力居然反超了训练完整的对照组。这提示我们,推理能力这种东西,可能本来就不需要靠海量数据死磕,一旦抓住了正确的学习信号,很小的数据量就能撬动很大的效果,这跟事实记忆需要一条一条硬背下来的学习模式截然不同。

论文结尾处的一句话我印象很深,作者说这个发现或许提示我们优化目标本身也应该是"阶段感知"的,而不是一套方案打天下。这个思路我觉得可以再往前推一步想。人类的学习过程其实也有类似的分野,小孩子学母语靠的是海量的语言输入慢慢内化语感,这更像预训练;成年人考证书、学新技能靠的是精讲精练加针对性训练,这更像中期训练甚至后训练。如果教育方法研究里也存在类似"同一种教学策略在不同学习阶段效果完全相反"的现象,那会是个很有意思的类比,虽然这纯粹是我读完之后的一个联想,论文里当然没提这茬。

论文里还留了一个没有深挖的口子:研究者自己也提到,这个"蒸馏收益低于基线"的转折点会不会不止出现在中期训练阶段,可能在预训练后期,学生已经吃透了容易学的部分知识之后,同样的矛盾也会开始冒头。这个假设他们没有在这篇论文里验证,但如果真是这样,那知识蒸馏的应用逻辑恐怕需要一次更彻底的重新审视,不是简单地区分预训练和中期训练两个阶段就够了,而是要看学生在某个知识点上到底"学到哪儿了"。

Q&A

Q1:开关蒸馏(Switch Distillation)是什么?

A:这是论文提出的一种中期训练方法,利用教师模型的预测熵作为路由信号,熵低(教师有把握)的token用反向KL蒸馏学习,熵高(教师犹豫)的token直接用交叉熵学习语料标准答案,从而缓解推理能力提升和事实记忆下降之间的矛盾。

Q2:为什么知识蒸馏在中期训练阶段会损害事实记忆能力?

A:三个原因叠加导致的。教师模型在数学、指令类程序性数据上很自信,但在知识密集型数据上预测熵很高;学生在预训练阶段已经学会了教师最自信的那部分低熵事实,中期训练面对的正好是教师本就没把握的高熵事实;蒸馏的梯度强度会随教师置信度打折,导致这些本就难学的事实获得的学习信号更弱。

Q3:开关蒸馏的效果能持续到后训练结束吗?

A:能。论文对所有中期训练完的模型套用了统一的后训练流程(监督微调、偏好优化、两轮强化学习),结果显示开关蒸馏依然保持推理能力领先,7B教师条件下推理分数从44.7%涨到50.6%,同时事实记忆的差距完全被追平,是所有方法里表现最稳健的一个。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询