视频AI训练的账单:给每份标注答案一个"发言权",效率提升一倍多

你有没有想过,一个视频AI模型要学会"看懂"视频里发生的事,到底有多难?

不是让它说出"这是一只猫在跑"这种笼统的描述,而是要它精确地告诉你:这个动作发生在视频的第93秒到第100秒,这个人在第17帧的位置是坐标[182, 260, 701, 743],这个物体在接下来的32秒里应该被这样框住追踪。

这种精确到秒、精确到像素的能力,行业里叫做**细粒度视频感知**

细粒度视频感知:指AI模型对视频进行精确的时间定位、空间框定、物体分割和轨迹追踪的能力,区别于笼统的内容描述

。而现在最头疼的问题是,像GPT-5、Gemini-3-Pro这些参数量巨大、见多识广的顶级模型,在这类精确任务上,反而经常输给参数量不到它们十分之一的"专科医生"模型。这事儿说出来你可能会愣一下:通用越强,反而越不精确?

这篇来自南开大学等机构的论文,就是想解决这个矛盾。他们给出的方案叫OraRL,训练出来的模型叫Video-ORA。结果相当亮眼:9B参数的Video-ORA在时序定位任务上把mIoU从62.5提升到66.0,在追踪任务上把AO从73.0拉到78.2,在分割任务上从64.3冲到70.4,在空间智能的VSI-Bench上拿到73.1分,超过了GPT-5的55.0分和Gemini-3-Pro的55.1分。而且,它不需要那种又慢又贵的"思维链"推理过程,回答速度是130毫秒,而同类需要思维链的模型要4780毫秒,慢了将近37倍。

这背后到底发生了什么?让我们从问题的根源说起。

**当前方法卡在哪儿了**

先说清楚,现在训练视频AI主要有两条路。

第一条路叫**监督微调**

SFT(Supervised Fine-Tuning):用标注好的正确答案作为唯一目标,让模型不断模仿这个答案,直到能输出一样的结果

。这个思路很直白:给模型看一堆"问题+标准答案"的配对,让它拼命模仿标准答案。问题在哪?模仿这个动作太死板了。如果模型输出的答案和标准答案有八九成像,监督微调没法告诉它"你已经很接近了,再调整一下方向"。它只有一种反馈方式:对,或者不对。这就像老师批改数学题,只打勾或打叉,却从不告诉学生"你这一步算错了小数点,思路是对的"。学生永远不知道自己错在哪个细节上,只能死记硬背题目和答案的对应关系,换一道题立刻懵。

第二条路是这几年更火的**强化学习后训练**,具体来说是一种叫**GRPO**的方法。

GRPO(Group Relative Policy Optimization,群体相对策略优化):让模型针对同一个问题生成多份不同的回答(叫做"rollout",即模型的一次采样输出),然后用标注答案给这些回答打分,分数高于组内平均分的回答会被强化,低于平均分的会被压制

这个思路听起来聪明多了:不再是死记硬背一个答案,而是让模型自己"多次尝试",然后告诉它哪次尝试比较好,哪次比较差,让它朝着好的方向调整。这就像老师不再只给一个标准答案,而是让学生做十遍同一道题,挑出做得相对好的那几遍表扬,做得差的批评。

但这里有个致命的漏洞。视频里那些需要精确到秒、精确到像素的任务,模型自己"随便试"十次,十次可能都踩不到标准答案的边。时序定位要求秒级精确,分割任务要求像素级精确,追踪任务要求整条轨迹都对。模型瞎猜十次,大概率一次都碰不上真正正确的答案区域。这时候GRPO这套"组内比较、优中选优"的机制就彻底失效了,因为组里压根没有一个"优"的存在,顶多是十个都很烂的答案里,选出相对不那么烂的那个。

这就好比让十个从没学过射箭的人蒙眼射箭,箭全都插在了靶子外面的墙上,你说这十个人里谁射得"相对准"?这种比较毫无意义,因为整组样本里根本没有一个够格的参照点。

论文里做了个统计,也验证了这个直觉:很多任务组里,压根就没有一个高质量的"锚点"回答。

**给标注答案一个"发言权"**

于是研究者想到一个看似简单却被之前的方法完全忽略的做法:既然标注答案本身就是那个"完美射中靶心"的箭,为什么不直接把它也扔进这十次尝试里,让它作为其中一个候选,和模型自己生成的那些回答一起比较?

这个思路论文里叫**Annotation-as-Rollout**

Annotation-as-Rollout(标注即回合):把每一条标注数据本身,改写成模型输出格式的一个"回合",直接加入模型自己生成的候选回答组里,成为组内一个可靠的正样本,而不仅仅是用来打分的参考答案

这个改动听起来微不足道,不就是多加一条数据吗?但它解决的根本矛盾是:原来标注答案只能"评判"模型,现在它可以直接"参与"训练,成为模型可以模仿、可以对齐的目标。

如果把GRPO那套组内比较机制比作一场赛跑,原来赛跑场上只有十个业余选手互相比谁跑得快,现在直接把博尔特拉进赛道里一起跑。业余选手就算跑不赢博尔特,至少能知道"跟世界纪录差多远",而不是十个人自娱自乐,不知道自己到底差在哪儿。

但研究者很快发现,这个看似聪明的做法,埋了一个大坑。

**埋下的坑:优势反转**

问题出在GRPO计算"优势"的方式上。

优势(advantage)是强化学习里的核心概念,它衡量的是"这次回答比组内平均水平好多少"。计算方式很简单:这次回答的得分,减去整组的平均得分。得分高于平均分,优势为正,该被鼓励;得分低于平均分,优势为负,该被压制。

现在你把标注答案(几乎满分,比如奖励是1.0)也塞进这个组里参与计算平均分,会发生什么?

假设组里原本8个模型回答的平均分是0.5,现在加入标注答案这个近乎满分的"外挂选手",整组的平均分立刻被拉高到0.55甚至更高。这时候,一个原本得分是0.52的模型回答,本来应该被认为"高于平均、值得鼓励",但现在因为平均分被标注答案拉高了,它反而变成了"低于新平均分、要被压制"。

论文把这个现象叫做**优势反转**

Advantage Inversion(优势反转):由于把高分标注答案混入组内参与统计计算,导致本该被判定为"表现优于平均水平"、理应获得正向奖励信号的模型回答,被错误地判定为"低于平均、需要被压制"的现象

这就好比一场公司内部的季度考核,原本十个员工按业绩排名,业绩中等偏上的那几个本该拿到奖励。突然HR宣布,这次要把公司创始人的业绩也算进平均分里一起比。创始人业绩通常远超所有员工,平均分瞬间被拉高。结果就是那几个本来能拿奖金的中等偏上员工,现在反而因为"低于新的平均线"被通报批评。如果不特别处理这个平均分的计算方式,那些原本值得鼓励的正常员工,反而会被误伤,士气直接崩掉。

论文对这个现象做了大规模统计,数据触目惊心:在朴素地把标注答案混入组内计算的情况下,有22.4%原本被GRPO判定为"正优势"的模型回答,被错误地反转成了负优势。追踪任务上这个比例甚至冲到38.7%。更严重的是,42.5%的训练组里至少出现一次这种反转,8.3%的组里所有正向回答全部被误伤,一个能被强化的正样本都不剩。

这就是为什么"直接把标注答案塞进去"这个听起来很自然的想法,实测反而会让模型表现变差,甚至不如什么都不加的原始GRPO。研究者在论文里专门做了实验验证:朴素的标注注入,把GRPO原本60.3分的平均分,直接拉低到55.4分,追踪任务更是暴跌11.9分。

**解药:把标注答案摘出计算,但留在更新里**

搞清楚问题出在哪之后,解法思路其实变得清晰起来:标注答案不能进入"平均分"的计算,但它又不能完全被排除在训练之外。

论文提出的OraRL方法,核心设计是把这两件事拆开处理。

第一步,计算组内基准的时候,只用模型自己生成的那些回答,完全不算标注答案。这样一来,组内平均分不会被人为拉高,原本表现优于平均水平的回答,依然能拿到正向优势,不会被冤枉。

第二步,标注答案和模型平均水平之间的差距(论文里叫"oracle-policy gap",也就是标注答案和当前模型能力之间的鸿沟),不是被简单丢弃,而是转化成两个独立的调节信号。

一个叫**方向增益**

Oracle-Gap Directional Gain(预言体差距方向增益):根据标注答案与当前模型平均表现之间的差距大小,动态放大那些已经优于组内平均水平的模型回答的优势值,差距越大放大越多

它只作用于本来就表现不错的回答,让它们被强化的力度更大。差距越大,说明模型离标准答案还很远,这时候更要用力拉一下那些相对靠谱的回答。

另一个叫**分离式预言体优势**

Detached Oracle Advantage(分离式标注优势):把标注答案单独作为一个优化目标,给它计算一个独立的、和组内其他回答脱钩的优势值,这个值会随着模型逐渐逼近标注水平而自动衰减

这个优势值的大小,是根据模型当前平均水平离标注答案还有多远来动态调整的。模型离标准答案很远的时候,这个信号会比较强,相当于给模型一个明确的"往这边走"的指引;等模型越来越接近标注水平,这个信号会自动减弱,避免模型被过度拉扯,失去自己探索的能力。

这个设计的巧妙之处在于,它避免了两个极端。一个极端是完全不管标注答案,任由模型自己瞎试(这就是原始GRPO在稀疏奖励任务上的困境)。另一个极端是让模型死记硬背标注答案而放弃自己的探索(这接近于监督微调的老问题)。OraRL相当于给了模型一个渐进式的引导,刚开始差距大的时候给强指引,后期差距缩小了就放手让它自己微调。

这有点像学开车时教练的角色。刚上路的时候教练会紧盯着方向盘随时纠正你,生怕你撞墙。等你开得越来越熟练,教练就会慢慢放手,只在关键路口提醒一下,而不是从头到尾攥着方向盘不放。如果教练一直死死控制方向盘不放手,你永远学不会独立驾驶;如果教练完全不管,你可能一开始就冲进沟里。这个"随熟练度调整介入强度"的机制,正是OraRL里那个衰减权重要解决的问题。

论文里还统计了这套方法修复优势反转的效果:原本22.4%的反转率,降到了1.9%(修剪前),修剪之后进一步压到0.3%。

**为了省钱,还得学会"挑重点"**

强化学习这套流程,一个绕不开的现实问题是训练成本。每个问题都要生成好几份候选回答,再加上标注答案变成第九份,一共九份都要过一遍模型的前向和反向传播计算,这个开销相当大。

论文这里又加了一步优化,叫**符号平衡式剪枝**

Sign-Balanced Pruning(符号平衡式剪枝):在计算完所有候选回答的优势值之后,只保留一部分用于真正的梯度反向传播计算,但要求保留的样本里正负优势必须都有代表,而不是只保留同一种符号的样本

具体做法是,九份候选(八份模型自生成加一份标注)里,不需要每份都拿去做梯度计算,只需要留下标注答案本身,再从正优势和负优势的候选里各挑几个最典型的。论文默认设置是留4份:标注答案、一份最强的正向回答、两份最强的负向回答。

这里有个细节值得说一下,论文特意强调了这个"符号平衡"必须两种符号都留,不能只留同一种符号。之前有别的方法(比如CPPO)是按优势的绝对值大小来筛选,这样容易出现全组只剩正向或者全剩负向的极端情况。

这就好比开一场辩论赛复盘会,如果你只把赞成方的发言留下来复盘,反方的意见全部删掉,那这场复盘就变成了单方面的自我强化,没有对照和反思,最后大家只会越辩越极端。留下正反两方最典型的发言,才能让整场复盘真正有指导意义。

这套裁剪省下的算力相当可观:每一步训练的时间从92.5秒压到62.4秒,提速将近1.5倍,而平均分只掉了0.4分,几乎可以忽略不计。显存占用也从62.4GB降到50.9GB。

**思维链,到底是助力还是拖累**

这篇论文还处理了一个当前视频AI领域争论比较大的问题:要不要用思维链推理。

**思维链**

Chain-of-Thought(CoT):让模型在给出最终答案之前,先输出一段逐步推理的文字过程,理论上可以帮助模型进行更复杂的逻辑思考

这几年在文本大模型领域被验证是提升推理能力的利器,很多人自然而然地觉得,视频理解任务加上思维链肯定也会变强。

论文的实验结果却给出了一个让人意外的答案:对于时序定位这种结构化的精确任务,思维链几乎没有带来任何准确率上的提升,反而大幅拖慢了训练和推理速度。

具体数据是这样的:在GRPO框架下,不用思维链的版本平均分是58.7,用了思维链之后反而降到58.5,几乎没变化甚至略微下滑,但训练每一步的时间从93.9秒暴增到135.6秒,慢了44%。而OraRL在不使用思维链的情况下,直接把平均分拉到61.4,训练时间还比带思维链的GRPO快一倍还多。

推理阶段的差距更夸张。论文测了在10分钟长视频上单次请求的响应延迟,Video-ORA-9B的回答生成阶段只需要0.13秒,而它的骨干模型(带思维链)因为要先啰嗦地写完平均808.5个推理token,回答生成阶段要4.78秒。整体端到端延迟,Video-ORA-9B是24.30秒,骨干模型是29.03秒。在极端情况(P90分位)下,骨干模型的延迟能飙到62.67秒,而Video-ORA-9B稳稳保持在25.15秒。

这个发现背后的逻辑其实不难理解:时序定位、空间框定这类任务,答案本身就是一个精确的数字或坐标组合,不需要模型去"论证"为什么这个坐标是对的,它只需要准确地"找到"这个坐标。让模型写一大段思考过程,反而可能引入更多噁噁与不确定性,就像让一个已经能一眼看出答案的学霸,被迫写满一整张纸的推导过程,不仅浪费时间,还可能因为写多了反而写错。

**规模验证:从0.8B到9B都不掉链子**

任何一个新方法,光在一个模型规模上表现好还不够,得看它能不能随着模型变大持续起作用。论文在0.8B、2B、4B、9B四个规模上都做了完整验证,结果显示Video-ORA在每一个规模下都超过对应的骨干模型,而且平均分随参数量单调上升,从0.8B的51.8分一路涨到9B的66.2分。

追踪任务受益最明显,优势差距从0.8B时的11.3分,一路扩大到9B时的32.2分,说明模型越大,越能把这种框架级别的精确监督信号用得更充分。而在4B以下的小模型上,优势最大的反而是时空联合定位任务,骨干模型的原始得分不到9分,加上OraRL之后能提升超过22分,几乎是能力上限的跃迁。

数据规模上的验证同样扎实。论文对比了SFT、GRPO、OraRL在处理6.4k到100k条训练数据时的表现变化。视频感知任务的聚合分数上,OraRL从6.4k到100k涨了5.2分,GRPO只涨了2.8分。空间智能任务上OraRL涨3.6分,GRPO涨3.1分。更值得注意的是,SFT在视频感知任务上随着数据量增加,分数反而从62.1掉到58.0,这说明纯粹的模仿式训练,数据量堆得越多不代表效果越好,甚至可能因为过度拟合某些模式而伤害整体表现。

**七大任务家族,全面开花**

Video-ORA最终覆盖了七个任务家族:时序定位、空间定位、图像与视频分割、视觉追踪、时空联合定位、视频问答、空间智能推理。

在时序定位上,Video-ORA-9B在Charades、ActivityNet、QVHighlights三个基准上的mIoU分别拿到61.8、63.6、72.5,全部是同规模模型里最好的成绩,甚至超过了参数量更大的Gemini-2.5-Pro。有意思的是,论文观察到一个规律:随着判定阈值越严格(比如从IoU@0.3提高到IoU@0.7),Video-ORA相对于其他方法的优势反而越明显。这恰好印证了annotation-as-rollout这个设计的价值所在,粗略定位到大致区域,模型本来就能做到,但精确到秒的边界,恰恰是标注答案能提供、而模型自己瞎试很难碰到的信息。

追踪任务上,GOT-10k基准的AO指标,Video-ORA-9B拿到78.2,比之前最好的开源专项模型OneThinker-8B还高出5.2分。分割任务上,视频类的MeViS基准J&F指标从52.7提升到61.3,ReasonVOS基准从59.9提升到63.8,提升幅度是所有任务里最大的,因为骨干模型本来根本不会输出可用的分割提示,这块能力几乎是从零建立的。

空间智能这块最有说服力。VSI-Bench上,Video-ORA-9B拿到73.1分,不仅超过所有开源模型,甚至超过了GPT-5的55.0分和Gemini-3-Pro的55.1分。在appearance order(物体出场顺序判断)这个子任务上,Video-ORA-9B拿到90.6分,而Gemini-3-Pro只有60.0分,差距整整30分。

不过论文也没有回避自己的短板。在MMSI-Bench和MindCube这两个更强调多图空间推理的基准上,Video-ORA-9B平均47.7分,还是低于Grok-4的50.7分和GPT-5的49.1分。route planning(路线规划)这个子任务,Video-ORA落后于顶级proprietary模型。这说明复杂的空间推理链条,依然是这套方法目前触碰不到的天花板。

**跨骨干、跨方法都验证过**

为了证明OraRL不是只对某一个特定模型架构有效的"偏方",研究者把同一套方法搬到Qwen3-VL-8B和Qwen3.5-9B两个不同的骨干模型家族上重跑了一遍,结果显示OraRL在两个家族上都稳定超过SFT和GRPO。有意思的是,在相对较弱的Qwen3-VL-8B骨干上,OraRL相比GRPO的提升幅度(2.6分)比在更强的Qwen3.5-9B骨干上(1.4分)更大,论文给出的解释是,当模型本身能力和标注答案之间的差距更大时,标注答案能提供的引导信号也更强。

论文还专门对比了当前几种主流的强化学习变体,包括Dr. GRPO、GDPO、CPPO,发现这些方法彼此之间差距只有0.4分左右,说明单纯调整归一化方式或者按优势幅度剪枝,带来的边际改进有限。而OraRL能拿到62.7分,比这些变体里最好的还高出2.0分,证明这个提升确实来自于"加入标注答案作为可优化目标"这个新设计,而不是来自其他细枝末节的调整。

论文还测试了另一种引入外部指导的方式,叫LUFFY,做法是通过重要性采样把教师轨迹注入训练。结果显示这种方式效果反而更差,平均分只有54.7,追踪任务甚至跌到50.0。这说明简单粗暴地引入外部信号,并不能保证效果,关键还是要处理好这个外部信号和策略优化过程的兼容性问题。

写在后面

读到这篇论文里那个22.4%的优势反转比例时,我愣了一下。这不是一个精心设计的极端案例,而是几乎所有把标注答案直接塞进GRPO组里的人,都会不知不觉踩进去的坑。它揭示了一件挺重要的事:强化学习里"归一化"这个看似技术性的小操作,一旦你往组里加了一个特殊样本,整个基准线的意义就变了,而这种变化往往是隐蔽的,不会在直觉层面提醒你出了问题。

另一个让我意外的细节是思维链的失效。这几年大家谈强化学习几乎绕不开思维链,好像不加一段推理过程就显得方法不够"聪明"。但这篇论文用扎实的数据证明,对于时序定位、空间框定这类答案本身就是精确坐标的任务,思维链带来的可能只是拖慢速度而没有实质收益。这提醒我们,方法的适用性是有边界的,不能把一个领域验证过的技巧无脑套用到另一个性质不同的任务上。

论文里还有一个没有解决的问题挺值得追问:relative direction(相对方向判断)这个空间智能子任务,Video-ORA用了标准VSI-590K训练数据后表现没有明显提升,后来在ReVSI这个修正版基准上测试才发现,这是因为训练数据里全是"面向前方"式的问题模板,模型完全没见过"背对目标物体"这种反向场景。这说明再好的训练框架,也逃不出训练数据本身的视角局限。数据集里没有的场景,模型再聪明也学不会。

Q&A

Q1:OraRL和GRPO最主要的区别是什么?

A:GRPO只把标注答案当作打分参考,让模型的多个候选回答互相比较;OraRL把标注答案直接变成候选组里的一个正样本参与优化,同时把它排除在优势计算的基准线之外,避免拉高平均分导致其他好回答被误判为负优势。

Q2:为什么Video-ORA不用思维链推理反而效果更好?

A:论文实验显示,对时序定位这类需要精确坐标输出的结构化任务,思维链几乎没有提升准确率,反而让训练每步时间增加44%,推理延迟也大幅上升,因为这类任务的答案本身就是精确数值,不需要额外的文字论证过程。

Q3:Video-ORA-9B在哪些任务上表现最突出?

A:在GOT-10k追踪任务上AO达到78.2分,在VSI-Bench空间智能测试上拿到73.1分超过GPT-5和Gemini-3-Pro,在视频分割MeViS基准上J&F从52.7提升到61.3分,是提升幅度最大的任务。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询