英伟达与特拉维夫大学突破:零参考图AI图像视频编辑器实现自学式生成能力

这项由英伟达研究院与以色列特拉维夫大学联合完成的研究,以预印本形式于2026年6月发表,论文编号为arXiv:2606.03911。
---
每个人大概都有过这样的念头:如果能把一张普通照片变成梵高风格的油画,或者把一段实拍视频转成卡通动画,该多有意思。现在,有很多AI工具确实能做到这些。但很少有人知道,这些工具在训练的时候,需要喂给它海量的"对照图"——也就是同一张照片,既有原版,又有处理后的版本,一对一地告诉AI:"瞧,这个变成那个,你要学会这种变换。"
收集这类对照图是件极其繁琐的工程。拍一张真实的卧室照片很容易,但要找到同一间卧室在"水彩画风格"下的样子,就难多了。拍一段真实的河流视频很容易,但要找到"同一条河流,但流速变得像蜂蜜一样黏稠"的对应视频,几乎是不可能完成的任务。随着AI编辑从图片向视频延伸,所需的数据量呈指数级增长,而可用的训练素材却愈发稀缺。
来自英伟达研究院和特拉维夫大学的研究团队,思考了一个很有意思的问题:AI既然已经对世界有了深刻的理解,为什么还非得靠人类准备的对照图来学习?能不能让它从自己的知识里"自学"编辑?
这个想法孕育出了一个名叫**Bootstrap Your Generator**(简称ByG,意为"自举生成器")的方法。它完全抛弃了对照图,让AI在没有任何"标准答案"的情况下,仅靠自身已有的知识,学会如何按照指令修改图片和视频。最终结果出人意料——在与用了数百万对照图训练的竞争对手的对比中,ByG在用户偏好上赢得了超过75%的票数。
---
一、"没有食谱,如何学做菜"——问题的根源
好厨师学做菜,通常需要一本食谱:原材料是什么,步骤是什么,成品应该是什么样。现在主流的AI图像/视频编辑模型,训练方式与此高度相似。它们需要的"食谱",就是一张张配对的图片:左边是原图,右边是编辑后的图,外加一句说明(比如"把背景换成沙漠")。通过大量这样的对子,AI渐渐学会了各种变换的"规律"。
这套方法本身没有问题,但规模化时代价极高。研究团队指出,业内领先的一些视频编辑模型,训练时使用了多达**一百万对**视频素材。而且大量素材是通过"合成"方式生成的——即先用其他AI工具自动生成编辑版本,再拿来训练新模型。这条路存在明显缺陷:自动合成的对照图,质量参差不齐,容易把原始素材的各类瑕疵也"学进去",还很难覆盖到那些罕见的编辑需求。
更深层的问题是,某些编辑类型根本不存在真实的对照图。把卡通人物变成真实照片风格,或者把一条普通的小河变成"流淌着熔岩"的效果——没有摄影师会在现实中拍摄这样的对照场景。这类"长尾编辑"(也就是那些不常见但极具创意的变换),是现有监督训练方法的死角。
正是在这样的背景下,研究团队转向了另一条路:既然AI模型在大规模预训练之后,已经对几乎所有视觉概念有了深刻理解,那么这种内在知识本身,能不能成为训练信号?
---
二、"自己考自己"——ByG的核心思路
以一个烹饪学校的场景来理解整个框架。普通的学校会给学生一道"参考菜",让他们对照练习。ByG则不同,它更像一位有多年经验的厨师在自我反思:他知道"把番茄炒成深红色"意味着什么,不需要有人拿着成品站在面前,因为他的厨艺积累本身就是他的参照物。
ByG的核心观察非常简朴:图像编辑有两个目标,第一是让输出结果符合指令(比如"把风格变成卡通"),第二是保留原图中所有不该改变的部分(画面里的人物、构图、动态等等)。这两个目标,其实可以用两种完全不依赖对照图的方式来实现。
对于第一个目标——遵从指令,研究团队的思路是:AI模型在预训练阶段已经见过无数"卡通"图片,它天然知道什么是卡通风格。与其靠人类准备编辑后的成品,不如直接向这个"已经见多识广的AI"请教:给定一张要编辑的图,让AI告诉我,从原始描述走向目标描述的"方向"是什么。
对于第二个目标——保留原始内容,研究团队借鉴了一个已有多年历史的经典思路:**循环一致性**。简单来说,就是"一个好的编辑是可逆的"——如果你能把原图A改成图B,那么反过来,用相反的指令从图B应该能还原出A。如果不能,说明编辑过程中丢失了不该丢失的信息。
两个目标,两种信号,全部来自模型自身,不需要外部标注,不需要额外的对照图,也不需要引入独立的评分系统。这就是ByG的灵魂所在。
---
三、"先猜一个答案,再改进"——如何解决"鸡生蛋"的困境
这里有个绕不过去的难题:流程匹配模型(flow matching,研究采用的核心生成框架)在训练时,需要把"目标图"加上噪声后输入模型,让它学会去噪。没有目标图,根本不知道该加噪处理哪张图,整个训练就无从开始。
用做菜来打比方:你想练习"把生蛋糕改成熟蛋糕",但问题是你没有一个"半成品蛋糕"作为训练用的输入素材。
ByG用了一个"自举"策略来打破僵局。具体来说,研究团队维护了一个模型的"影子版本"(EMA版本,即对当前模型权重做指数移动平均的副本,可以理解为当前模型的"稳定版快照")。在每一个训练步骤里,先让这个"影子版本"运行几步去噪,生成一张"伪目标图"的噪声中间态,然后把这个噪声状态作为当前正式训练版本的输入素材。
整个过程就像一个接力游戏:影子版本先猜出一个大致的"编辑结果",正式版本基于此继续学习,随着正式版本越来越好,影子版本的快照也跟着慢慢更新,提供越来越高质量的输入素材。这个正向循环,让模型在没有任何真实目标图的情况下,逐渐形成了稳定的训练节奏。
---
四、"只学变化的部分"——如何从预训练模型里提取指令信号
即便解决了输入问题,还有另一个关卡:如何告诉模型"这个方向对了"?
研究团队的做法是向预训练的文本生成图像模型(T2I模型)提问。以一个具体例子说明:源图的描述是"三只鹦鹉站在树荫下",编辑指令是"把背景改成森林",目标描述就是"三只鹦鹉在森林里"。
预训练T2I模型对"三只鹦鹉在森林里"有非常清晰的理解,它能预测如何朝"森林版本"的方向去噪。同样,它对"三只鹦鹉在树荫下"也有清晰认知。研究团队用了一个关键技巧:不是直接让编辑模型去模仿T2I模型对目标描述的反应,而是让编辑模型的输出方向与**两者之差**对齐——也就是"目标描述的去噪方向"减去"源描述的去噪方向"。
这个差值,恰恰代表了"这次编辑指令需要改变什么"——只有在目标和源头描述存在分歧的地方,才会有信号压力。那些两者共同的内容(比如鹦鹉本身)自然不会受到干扰,需要改变的内容(比如背景)则会接受到明确的"朝这个方向走"的指引。
这种定向训练信号,用论文中的术语叫做**方向损失**(directional loss),通过余弦相似度来衡量编辑方向与预期方向的吻合程度。为了防止模型的"速度"失控(只管方向而忽视了幅度),研究团队还加入了一个均方误差约束,让模型的预测在方向正确的同时,幅度也合理地贴近目标。
---
五、"用成品验收,用草稿学习"——梯度路由的精妙设计
循环一致性听起来很自然,但在技术实现上有一个让人头疼的难题。
流程匹配模型在训练时,对图片的处理是在"噪声状态"下进行的。可以把这个过程理解成:摄影师学修图,但训练时只能看到模糊的草稿,不能看到清晰的成品。然而,循环一致性检验("从B能不能还原回A")需要的是一张清晰的"编辑结果",用模糊草稿来做这个检验,效果会非常差——就像用一张看不清细节的草图来检验建筑设计是否合格。
更麻烦的是,如果训练时把模糊草图当成"输入条件",那模型在实际使用时(输入的是清晰图片)会出现"训练时见过草图,推理时见到真图"的脱节——模型很可能因此学会忽视输入图片的细节信息。
ByG提出的解决方案是一种称为**梯度路由**的技巧,本质上借鉴了机器学习领域的"直通估计器"(Straight-Through Estimation)的思想,但将其适配到了图像去噪的场景。
具体操作是这样的:在循环一致性的验证步骤,给模型看的是高质量的"多步去噪成品"(由影子版本完整运行得到),保证模型能看到清晰的细节,不会造成训练推理不一致。但在反向传播(也就是梯度学习)的时候,梯度流过的是单步预测的"模糊草稿",而不是那张清晰成品。
用一个直观的比喻:老师评分时给学生看的是精心排版的最终答案卷(确保阅读体验),但打分时依据的是学生写下的演算草稿(真实反映了学习过程中的错误和进步空间)。这样一来,模型在"看到什么"和"从什么中学习"之间实现了解耦,训练稳定性与学习质量同时得到保证。
除此之外,研究团队还设计了一个"恒等损失":用同一张图片既做输入又做条件,搭配一个"什么都不需要变"的反向指令,强制要求模型能精确还原输入。这让模型学会了真正"忠实地"读取并传递条件图的内容,为循环一致性检验打好基础。
---
六、从图片到视频——框架的自然延伸
把ByG从图片扩展到视频,研究团队的思路是"理念不变,介质换一换"。他们使用了名为Wan2.2的文本生成视频模型作为基础,通过在其输入通道里拼接原视频的干净帧,让模型能在去噪目标视频的同时"参照"原始视频。
训练数据的构建同样遵循"不依赖对照视频"的原则:用Wan2.2本身生成一批卡通风格视频和照片写实风格视频,各约160-165段,对这些视频分配说明文字,形成完全由AI自生成的非配对训练集。
值得一提的是,为了让视频模型在高噪声阶段也能接受到足够的训练信号,研究团队对时间步采样做了特殊处理,偏向于抽取噪声比例更高的时间点进行训练——因为视频的时序结构要比图片复杂得多,在高噪声阶段建立正确的全局结构理解,对视频编辑尤为关键。
---
七、实验结果:无需对照图,赢过了用百万数据训练的对手
对于视频编辑,研究团队构建了一个包含119个任务的测评集,涵盖卡通转写实、写实转卡通以及3D-CGI风格转换,并与Ditto(一款由一百万视频对照数据训练的监督模型)进行了用户偏好对比。
8位参与者共完成238次两两比较选择,结果显示:ByG在"卡通转写实"方向上赢得了80.5%的偏好(误差范围±2.9%),在"写实转卡通"方向上赢得了70%(误差范围±5.4%),综合胜率达到**75.3%**。统计检验确认这一差异极不可能是偶然:二项式检验得出的p值低于3×10???,8位参与者中每一位单独统计都更偏好ByG的结果。
更引人注目的一组数据来自3D-CGI类型视频——这类视频完全不在ByG的训练分布内(训练时只见过卡通和写实两种风格),但ByG在这个分布外类别上依然赢得了85%的用户偏好。这说明ByG不是单纯"背下了训练数据",而是真正学到了某种可迁移的编辑能力。
在量化指标上,ByG在编辑成功率(CLIP方向相似度)和源内容保留度(DINO特征相似度)以及运动一致性上,均优于Ditto。在画面美学质量和时间连贯性上,两者相当。
对于图片编辑,研究团队在六种"长尾风格"(GTA V游戏风、Minecraft像素风、美式漫画风、低多边形3D风、体素风、乐高积木风)上进行了测试,这六种风格同样完全不在训练数据里。在"风格转写实"和"写实转风格"两个方向上,ByG在语义一致性(也就是"有没有按指令改")和综合得分上,都超过了FLUX-Kontext和Qwen-Image-Edit这两个用百万级对照图数据训练的强监督模型,以及FlowEdit这个零样本基线。
在通用图像编辑基准GEdit-Bench上,ByG与FLUX-Kontext总体相当,在运动变化、人物相关编辑和风格变换等类别上有明显优势,在物体删除和文字修改类别上相对弱一些。
---
八、哪个部件缺了,效果就变差——消融实验的发现
研究团队对每个关键组件逐一"拆掉"来检验其作用,结果清楚地展示了各部分的贡献。
去掉循环一致性损失时,编辑成功率略微上升,但源内容保留能力明显下降——模型开始"随心所欲"地改图,不再在意保留原始细节。去掉梯度路由时,同样的现象出现了,原因在于训练时模型看到的是模糊草稿作为条件,逐渐学会"不依赖"条件图,导致推理阶段忽视输入内容。去掉方向损失(只保留均方误差部分)时,模型倾向于把图片拉向目标描述的整体生成分布,而不管源图的具体结构,结果保留度同样下降。
自举机制(bootstrapping)是最关键的组件。如果没有它,训练时只能把带噪声的原图作为输入,而不是带噪声的"预期编辑结果"——这种分布错位让训练极不稳定,编辑成功率从8.317分跌至5.517分,源内容保留从7.617分跌至7.050分。
最极端的情况来自"去掉方向约束(正则化损失)":模型直接塌缩成了一个"什么都不变"的恒等映射——源内容保留达到了惊人的9.767分,但编辑成功率只剩0.633分,也就是说它学会了"不动如山",把所有编辑指令都当耳旁风。这一发现说明,如果没有来自预训练模型的指令信号,循环一致性约束会让模型选择最省力的解——原样输出。
---
九、诚实面对局限——哪些地方还做不好
研究团队坦诚地指出了ByG当前的两个主要不足。
第一,ByG归根结底依赖预训练基础模型的知识边界。如果基础模型从没有见过某个视觉领域(比如某种极为罕见的艺术风格,或者基础模型没有涵盖到的行业专用图像类型),那ByG同样无法可靠地编辑向那个领域——巧妇难为无米之炊,模型自身不理解的东西,也无法指导编辑。
第二,对于"删除物体"类型的编辑,ByG的表现明显弱于基于对照图的监督方法。原因藏在训练信号的结构里:当目标是"把猫从沙发照片里删掉"时,目标描述是"一张沙发",这个描述既没有明确说"猫消失了",也没有描述"猫原来在的地方应该是什么"。T2I模型无法从这个描述中推断出"猫被移除"这个明确的操作,只是这张图里"碰巧"没有猫而已。这种模糊信号,远不如对照图直接告诉模型"猫在A图里有,在B图里没有"来得清晰。
---
说到底,ByG这个工作探索了一条颇具启发性的路:那些通过大规模预训练积累的视觉知识,足以被用来"自举"出一套编辑能力,不再需要人类费尽心力去收集配对的训练素材。尤其是对于视频编辑这个"对照数据近乎不可能收集"的领域,这一思路的意义更为明显。
值得关注的是,这个框架并没有绑定在某一种特定的基础模型或某一类编辑任务上,文中将其描述为一个通用框架——只要能把一个预训练的文本生成模型改造成支持"源图条件输入"的格式,ByG的整套损失体系就可以搬过去用。从图片到视频的扩展就是一个很好的证明。
当然,ByG本身也还留下了一些开放问题,比如能否把这套框架用于3D、4D场景的编辑,能否通过某种方式弥补物体删除任务上的不足,以及随着基础模型自身能力的提升,ByG所能实现的编辑范围是否也会自然扩大。这些方向,或许会是后续研究的自然延续。
有兴趣深入了解完整技术细节的读者,可以通过arXiv论文编号2606.03911查阅原文,所有的训练算法伪代码和超参数配置在原文附录中均有详细披露。
---
Q&A
Q1:ByG方法训练图像/视频编辑模型需要哪些数据?
A:ByG不需要配对的"源图+编辑后图"对照数据。训练只需要带有描述性说明的普通图片或视频,外加由语言模型自动生成的编辑指令和目标描述文字。整个训练素材可以完全用AI自动化工具批量生成,无需人工标注配对样本。
Q2:ByG视频编辑和Ditto监督模型相比,胜出的核心原因是什么?
A:Ditto用一百万对视频数据做监督训练,所见的风格类型和场景受训练集限制。ByG依赖基础模型自身积累的视觉知识,这些知识覆盖面更广,泛化能力更强。尤其在训练中没有出现过的3D-CGI类型视频上,ByG依然赢得了85%的用户偏好,这直接说明其泛化能力优于监督训练方式。
Q3:梯度路由解决了训练和推理之间的什么问题?
A:流程匹配模型在训练时循环一致性检验需要用编辑结果图作为条件,但单步预测的编辑结果图质量很差(模糊、缺少细节),如果直接用来训练会导致模型学会忽视条件输入。梯度路由让模型看到的是清晰的多步去噪成品(保证推理一致性),但梯度学习流过的是真实的单步预测草稿(保证训练信号准确),两者解耦后同时解决了训练质量和训练推理对齐两个问题。