当老师和学生看的是同一张照片,却能教出更聪明的学生

你有没有想过这样一个问题:一个老师要教好学生,前提是老师得比学生懂得多。可如果这个"老师"和"学生"其实是同一个模型,只是版本不同,那老师到底比学生多懂什么?

这不是一个抖机灵的问题。在人工智能训练里,这恰恰是最近两年最热门的一类方法必须回答的核心难题。

先说说这类方法叫什么。

在线策略蒸馏*:一种让AI模型自己生成答案,然后由一个"老师模型"给这些答案打分、纠正的训练方式。相比传统方法先让老师写好标准答案再让学生模仿,这种方式让老师直接批改学生自己写出的内容,纠错更精准,因为批改的正是学生实际会犯的错误。

这个思路这几年在语言模型和视觉语言模型上都被证明有效。问题是,它有一个绕不开的前提:老师必须比学生强。要么老师是个更大更强的模型,要么老师能看到学生看不到的"参考答案"。可现实往往是,你手头没有更强的模型可以当老师,也没有人给你标注好的标准答案。这时候,戏就没法演了。

这篇论文要解决的正是这个僵局。它问了一个听起来有点反直觉的问题:如果什么特权信息都没有,这种师生落差到底还能不能造出来?

论文给出的答案让人意外。答案不是想办法让老师变得更强,而是反过来,让学生变得更弱。老师什么都不用改,还是看原来那张清晰图片;学生呢,被故意塞进一张模糊的、加了噪声的、甚至缩小分辨率的照片。就这么简单一个操作,师生之间的信息落差就凭空出现了,而且完全不需要外部标注、不需要奖励信号、不需要单独训练一个更强的模型。

这就是论文提出的方法,叫做自监督视觉在线策略蒸馏。

自监督视觉在线策略蒸馏(S?VOPD)*:一种不依赖任何额外标注或更强模型的训练方法,核心做法是让老师看清晰图片、学生看被故意做过手脚的模糊图片,用两者预测结果之间的差异当作训练信号。

一件让人困惑的事:优势到底从哪儿来

先说说这个领域此前是怎么做的,你才能体会这次转折有多巧妙。

传统的在线策略蒸馏,靠的是一个更大更强的教师模型。比如用GPT这种级别的模型去教一个小模型。可这样一来,你永远需要一个"更贵"的老师,训练成本降不下来。

后来有人想到,能不能不用单独的教师模型,让同一个模型自己教自己?这就是"在线策略自蒸馏"。可这个思路马上遇到一个逻辑困境:如果老师和学生是同一个模型,老师凭什么比学生强?

于是研究者们想了各种办法给老师"开小灶"。有的给老师看参考答案,有的给老师看环境反馈,有的干脆给老师看标注好的关键区域,也就是图片里哪块地方是回答问题真正需要看的地方。这些方法确实有效,但都依赖一样东西:人工提供的特权信息。

问题是,这类特权信息的获取成本会越来越高。

模型能力越强,需要的监督信号就越精细,可人类专家能提供的标注质量是有上限的。等模型能力超过人类标注的天花板,这条路径就走到头了。这才是论文开篇提出那个问题的真正分量所在:当什么都没有的时候,这种有效的师生落差究竟从哪儿来?

反过来想:不给老师加分,给学生减分

论文的核心洞察就藏在这句话里:不是往老师那边加信息,而是从学生这边抽走信息。

老师依然看原始的、清晰的图片。学生看到的却是同一张图片的"缩水版",可能被降低了分辨率,可能被加了噪声,也可能被裁掉了一部分。两者看的是同一张照片,只是清晰程度不同,这个落差本身就足够构成一次有效的教学。

这个想法其实和自监督学习里的经典套路有点像。

自监督学习*:一种不需要人工打标签,而是从数据本身构造监督信号的训练方式,常见做法是把同一张图片做出不同的"变体",让模型学会认出它们本质上是同一个东西。

比如SimCLR这类对比学习方法,会把一张图片做两次不同的变换,然后要求模型认出这两个变体其实来自同一张照片。还有BYOL、DINO这类方法,会用一个"教师网络"给另一个经过增强处理的"学生网络"提供学习目标。这些方法的共同点是:图像增强不是可有可无的装饰,而是监督信号的真正来源。

这篇论文用的是同一个原理,但换了个用法。别的方法用增强来定义"什么样的表征是稳定的",这篇论文用增强来制造"老师比学生多看到了什么"。

这里我想打个比方,帮你感受一下这个设计到底聪明在哪儿。

你带一个新手去看X光片,训练他判断骨折。如果你直接把标准答案念给他听,他记住的只是这一张片子的答案,换一张片子就抓瞎。可如果你换一种方式:给他一张故意调暗、加了噪点的片子,让他自己先判断一遍,然后你拿着清晰版本告诉他"你刚才漏看的这处细节,其实清晰版里能看出来"。这时候他学到的不是某道题的答案,而是"在信息不全的情况下该怎么补全判断"这个能力。如果没有这个信息落差,你俩看的是同一张清晰片子,你能纠正的顶多是他运气不好蒙错的地方,纠正不了他真正的视觉盲区。

这正是论文里对照实验证明的事情:如果老师和学生看的是完全相同的图片,也就是把这套增强手段去掉,那所谓的"教学"就失去了意义,因为老师根本没有比学生多看到任何东西。实验数据显示,这种"对称自蒸馏"不仅没有提升效果,反而让模型性能从70.68%掉到了65.21%,比什么都不做还糟。老师在没有信息优势的情况下,只会把自己的错误自信地传染给学生。

到底该往学生的图片里加点什么

想清楚"该不该做手脚"之后,下一个问题自然就冒出来了:具体往学生的图片里加什么样的手脚,才算有效?

论文在这里做了一件业内此前很少有人系统做过的事:把常见的图像增强手段分成四大类,一个一个测试,看哪种最管用。

第一类叫信息削减。做法包括把图片缩小分辨率、加高斯模糊、马赛克化,或者加噪声,核心思路是保留图片的空间结构,但让画面细节变模糊变糙。

第二类叫几何变换。包括旋转、平移、裁剪、缩小并留白,这类操作会改变物体在画面中的相对位置,如果问题本身跟位置有关,这类操作有可能把答案本身都改变了。

第三类叫色彩变换。调整亮度、对比度、饱和度这些,画面里的物体形状和位置完全不变,只是"看起来"不一样了。

第四类叫遮挡。把图片局部区域直接抠掉或者打上格子状的遮罩,核心区别在于它是"局部性"的信息丢失,而不是整体画质下降。

实验结果讲了三件很有意思的事情。

第一件事:只要制造出了不对称,四类增强手段全都管用。信息削减类平均准确率能到75.65%,色彩变换类74.40%,几何变换类74.30%,遮挡类72.44%。相比之下,什么都不做的基线模型是70.58%,什么增强都不加、老师学生看同一张图的对称蒸馏反而是65.21%。这说明只要制造出真实的信息落差,无论用哪种手段,都比不制造落差强,也都比毫无信息落差的自我蒸馏强得多。

第二件事,也是我觉得最反直觉的一点:增强的强度并不是越大越好,而是有一个甜蜜点。

论文用了一个很巧妙的量化方式,叫师生落差,用的是两个概率分布之间的JS散度来衡量。

JS散度*:一种衡量两个概率分布之间差异程度的数学指标,数值越大说明两个分布差别越大,这里用来量化老师和学生对同一段文字预测结果的分歧有多大。

实验发现,把这个落差值画在横轴,模型准确率画在纵轴,能看出一条先升后降的曲线,峰值大概出现在JS散度0.014左右。以分辨率缩放为例,缩放到0.3到0.6倍区间时效果最好,达到75.65%;缩得更轻或更狠,效果都会掉到75%左右。模糊操作也是同样的规律,轻度模糊74.20%,中度模糊75.71%,重度模糊又跌回75.07%。

这个"甜蜜点"现象其实很好理解,我拿健身举个例子。

你想通过负重训练让学生的肌肉变强,负重太轻,没有刺激,身体不会有任何适应性变化;负重太重,直接把关节压伤了,反而练废了。中等强度的负重恰好能造成"肌肉纤维轻微撕裂又能自我修复"这种恰到好处的压力,这才是真正促成肌肉增长的机制。同样道理,给学生看的图如果只是稍微模糊一点,老师和学生的判断几乎一样,没什么可教的;如果模糊到面目全非,学生连问题本身都答不出来了,这时候的落差再大也没用,因为老师纠正的不是学生的判断错误,而是纠正一个"根本没法回答"的烂摊子。

第三件事是这篇论文里我认为最值得琢磨的发现:落差大不等于落差好,增强手段必须保留住回答问题所需的关键信息。

裁剪操作暴露了这个陷阱。跟分辨率缩放不同,裁剪的强度越大,效果反而单调下降:轻度裁剪71.53%,中度裁剪68.76%,重度裁剪67.44%,几乎和什么都不做一样差。更扎心的是,重度裁剪制造出来的师生落差其实是全部实验里最大的,但这个"最大落差"换来的却是最差的效果之一。原因也不难猜:裁剪太狠,直接把回答问题必需的画面内容裁没了,学生连蒙都没法蒙,这时候老师和学生之间的分歧确实很大,但这份"分歧"只是因为学生的题目变得答不出来了,而不是因为学生真的漏看了什么可以被纠正的细节。

这就好比考试出了一道图表题,正常情况下你把图表印小一点、印模糊一点,考生还是能看出趋势、答对大方向,这时候能纠正的是他看图不够仔细的问题。可如果你干脆把图表的坐标轴都裁掉了,考生根本没法作答,这时候他答错不是因为看得不仔细,是因为题目本身已经没法回答了,这种"错误"没有任何教育意义。

具体怎么做:一套组合拳

基于这些发现,论文最终敲定了一套最有效的组合方案:把学生看到的图片缩小到原图的0.3到0.6倍分辨率,再叠加一个来自扩散模型的高斯噪声步骤。

这个组合的选择很讲究。缩小分辨率是每张图必做的操作,而加噪声是以50%概率随机触发的,噪声强度大概相当于标准差0.11的高斯扰动,几乎不损伤图片的整体信号,只是掺入了一层细微的"沙沙"感。这样设计还带来一个额外的好处:分辨率低的图片,模型处理起来更快,训练成本也跟着降下来了。

具体的训练目标是什么样子的?

用数学语言说,就是让老师的预测分布和学生的预测分布,在学生自己生成的每一步回答上,尽量对齐。这里用到的对齐方式叫广义JS散度,它介于两种极端度量方式之间:一种是逼着学生完全模仿老师的每一个细节判断,另一种是只让学生抓住老师最有把握的那部分判断。论文测试发现,用中间这种平衡的JS散度效果最好,比两个极端都强。

这个中间地带的选择也很有意思,可以拿老师批改作文打比方。

如果老师要求学生把范文的每一个用词都原样照搬,这叫过度模仿,学生连范文里的方言用法、生僻表达都要学,反而学偏了,这就是过于"贴近"老师的极端做法。如果老师只告诉学生"大概这个立意是对的",别的都不管,学生学不到具体该怎么改进句子,这是过于"宽松"的极端做法。真正有效的批改方式介于两者之间,抓住关键的改进点,但不强求逐字模仿,这正是论文选择的中间路线在起作用的原因。

一个额外的问题:老师需不需要跟着进步

论文还测试了一个细节:这个"老师"要不要随着训练不断更新自己?

论文用的更新方式叫指数滑动平均。

指数滑动平均(EMA)*:一种让教师模型的参数缓慢跟随学生模型变化的更新方式,每次更新只吸收一小部分最新参数,避免老师的判断标准剧烈波动。

实验发现一个很出乎意料的结果:把老师彻底冻结,一直用训练开始时的初始版本当老师,效果只比正常更新的方案低了0.4个百分点,从76.35%降到75.95%。换句话说,一个从头到尾都不进步的老师,依然能拿到93%的收益。

这个结果说明真正起作用的不是"老师有多聪明",而是"老师和学生之间那道信息落差本身"。老师聪不聪明是次要的,关键是老师看到了学生看不到的东西。哪怕这个老师本身水平一般,只要他手里多了一张清晰照片,他就能指出学生因为看不清而漏掉的细节。

放到真实考场里,这套方法表现如何

说了这么多设计细节,最终还是要看实际效果。

论文在六个精细感知类的评测基准上做了测试,这些基准专门考验模型能不能看清图片里的细节,比如V*Bench、ZoomBench、HR-Bench等等,都是需要模型在高分辨率图片里找到关键小物体或细节文字的任务。

结果是,用这套方法训练过的40亿参数模型(Qwen3.5-4B),平均准确率从70.68%提升到了77.44%,提升了6.76个百分点。

这个提升幅度意味着什么?

意味着这个只有40亿参数的模型,反过来超过了参数量是它接近60倍的Qwen3-VL-Instruct-235B模型(75.75%),甚至打平了参数量是它近100倍的Qwen3.5-397B模型(77.44%)。跟商业闭源模型比,它也超过了GPT-5.4(72.78%),只是略逊于谷歌的Gemini系列旗舰模型。

论文还专门做了一次公平对比,用同样的训练数据集Vision-OPD-6K,把这套无特权信息的方法和几种依赖特权信息的方法放在一起比。结果显示,这套方法在不使用任何标注区域、不使用任何参考答案的前提下,效果反而超过或者持平了那些用了特权信息的方法。

更有意思的是数学推理能力的对比。

那些依赖标注了"关键区域"的方法,在感知类任务上确实表现很好,但一到数学推理题上就露怯了。比如一种叫OPSD的方法,虽然在感知任务上表现不错,但数学推理准确率反而比基础模型下降了9.3个百分点;另一种叫ZwZ的方法,在数学题上更是比基础模型跌了27.1个百分点。原因不难理解,这些方法是专门为"看清图片细节"这件事优化的,训练数据也偏向感知类,代价是模型在抽象推理上的能力被牺牲掉了。

反过来,一些自我奖励式的强化学习方法,比如TTRL、Intuitor,虽然在数学推理上表现稳定,但感知类任务的提升就很有限。

这套自监督方法则是同时把两头都兼顾住了:感知类任务提升5.7个百分点,数学推理提升3.7个百分点,两边都没有牺牲。这在论文看来,恰恰印证了这套方法的信号来源是"感知层面的自我纠错",而不是靠某种投机取巧的训练偏向。

Q&A

Q1:自监督视觉在线策略蒸馏(S?VOPD)具体是怎么运作的?

A:让一个EMA教师模型看原始清晰图片,学生模型看同一张图片被降低分辨率并加了噪声的模糊版本,学生自己生成回答,教师针对学生生成的每一步回答给出更准确的判断,两者判断之间的差异被当作训练信号反向传递给学生,整个过程不需要任何人工标注或参考答案。

Q2:为什么给学生看模糊图片反而能让模型变得更聪明?

A:因为教师和学生看到的信息不对称,教师能看清学生因为图片模糊而漏掉的细节,这份差异本身就构成了一次有效的纠错,前提是模糊程度要适中,太轻没有落差可学,太重则会把问题变得根本无法回答。

Q3:这套方法和依赖标注信息的方法相比效果怎么样?

A:在完全不使用标注区域或参考答案的情况下,效果超过了多种依赖特权信息的方法,同时在数学推理任务上也没有出现性能下降,而那些依赖标注信息的方法往往在感知任务上表现好,却让数学推理能力打了折扣。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询