把游戏视频里的UI界面洗干净,能让AI变聪明多少?

你可能没意识到,YouTube 上每天上传的游戏实况视频,其实是一座被浪费的金矿。

想想看,全世界玩家在打游戏的时候,摄像机镜头随着角色移动、场景切换、光影变化,记录下的是一个个鲜活的三维世界如何运转。这些素材天然就适合用来训练那种能理解"世界是怎么变化的"的AI模型,也就是最近很火的世界模型。

世界模型:一种试图学习和模拟真实世界(或虚拟世界)运行规律的AI系统,能预测环境如何随时间演变,是构建交互式仿真、自动驾驶、游戏引擎的核心技术之一。

但这里有个问题一直没人认真解决过。你打开任何一个游戏实况视频,画面里除了游戏世界本身,还叠着一大堆东西:血条、小地图、任务提示、聊天框、主播的摄像头画中画、甚至平台的水印。这些东西和游戏世界的物理规律没有任何关系,它们是屏幕上叠加的界面层,但AI在学习的时候没法分辨哪个是真实的游戏世界、哪个只是浮在表面的信息展示。

这就好比你想通过看一段隔着毛玻璃的风景视频来学习云彩是怎么飘的,可玻璃上还贴着各种便利贴、价格标签、划痕。你的眼睛没法自动过滤这些干扰,最后学到的规律里,可能混进了"便利贴的边缘总是有一条直线"这种毫无意义的噪声。如果不把这些贴纸撕掉,你学到的所谓"云彩飘动规律"里,有一部分其实是在描述便利贴怎么被风吹得晃动。

一群研究者做了个实验来验证这件事到底有多严重。他们找来5442个游戏视频片段,一份保持原始的干净画面,一份人工叠加上真实感的界面元素,然后用完全相同的方式去训练同一个视频生成模型。结果显示,用干净视频训练出来的模型,整体表现比用带界面视频训练的高出6.83%,其中运动质量这一项提升了18.8%,画面美学评分也高出8.59%。

这组数字说明的事情很直接。

游戏界面不是无害的装饰,它是实实在在的训练噪声,会拖累AI理解世界运转规律的能力。

那么问题来了,网上那么多游戏视频,怎么才能高效地把界面元素清理干净,而且是自动化地、大规模地做这件事,总不能靠人工一帧一帧去抠图吧。

这正是这篇论文要解决的核心难题。研究团队搭建了一整套叫做G2WEngine的系统,专门用来把杂乱的游戏实况视频转化成AI可以放心学习的干净训练数据。

先给界面元素建一套户口本

在动手清理之前,研究者做的第一件事是给游戏界面元素分类,建立了一套叫做GameUI-Taxonomy的分类体系。

GameUI-Taxonomy:一套专门为游戏界面元素设计的分类标准,把血条、小地图、聊天框等各类界面组件按功能划分成21个类别。

为什么要先分类,直接删不就行了?这里的逻辑是,不同类型的界面元素行为差异很大。小地图通常固定在屏幕角落一动不动,而击杀提示是突然弹出又消失的,聊天框的内容会不断滚动更新,任务目标文字可能停留好几秒。如果不区分这些差异,用同一套简单粗暴的规则去处理,要么把该删的没删干净,要么把游戏世界里本该保留的内容误删了。

研究者从500多款游戏里挑选了有代表性的截图,先做粗略归类,再反复合并调整,最终确定了21个类别,包括地图雷达、玩家状态、任务目标、聊天通讯、外部叠加层等等。每个类别都对应着特定的空间位置规律和时间行为模式,比如准星几乎永远待在屏幕正中央,而弹窗提示通常出现在屏幕边缘然后自动消失。

这套分类体系就像是给一群性格迥异的员工做岗位说明书。你不能用管理流水线工人的方式去管理创意设计师,也不能反过来。如果不事先搞清楚每种界面元素的行为特征,后续无论是识别还是清除,都会变成一锅粥,系统分不清哪个该保留时间连续性、哪个该允许瞬间消失。

从真实视频里薅出可复用的界面素材

分类体系有了,接下来要解决素材问题。研究团队从303款游戏、总时长65.72小时的真实游戏视频里,采样了1010帧具有代表性的画面,用一个叫GPT-5.6 Terra的标注模型自动框出界面元素的位置并打上分类标签,再经过人工核实校对。

这一步做完之后,团队获得了5132个经过验证的界面素材,平均每帧画面能抠出3.69个界面组件。这些素材被转成透明背景的可复用资源,同时保留了它们的原始位置、来源、类别等元数据信息。

透明资源:去除背景后只保留界面元素本身的图像文件,可以像贴纸一样叠加到任何背景画面上而不遮挡下层内容。

这一步的巧妙之处在于,它没有凭空造出假的界面元素,而是直接从真实游戏里"薅"下来的真材实料。这就好比你要做一部关于城市街景的电影,与其自己画一堆假招牌假路牌,不如直接从真实街道上拍下来的招牌素材库里挑选组合,这样场景看起来才有说服力。如果用完全虚构的界面样式去合成训练数据,AI学到的规律可能和真实世界里千奇百怪的界面风格对不上号,等它遇到没见过的游戏界面就会懵掉。

把界面元素重新"种"回干净画面里

有了分类标准和素材库,下一步是反向操作,把这些真实的界面元素合成叠加到本来干净、没有任何界面遮挡的游戏视频上。

为什么要多此一举先做干净视频再往上加界面,而不是直接从带界面的视频里学习去除?

答案在于监督信号的精确性。如果你想训练一个模型去"擦除界面",你得先知道擦除之后的正确答案长什么样。真实的游戏视频里,界面被擦掉之后原本该是什么画面,没人知道,因为那部分内容从一开始就被遮住了,是永久缺失的信息。但如果反过来做,先拿到一段完全干净的游戏画面,再往上面叠加合成的界面,你就同时拥有了"叠加前"和"叠加后"两份画面,等于是给AI提供了标准答案。

这就像老师出考卷。你如果直接给学生一张被涂改过的作文让他们猜原文是什么,谁也说不清标准答案是什么样。但如果你先写好一篇范文,再故意在上面涂几笔墨渍让学生练习"去污",你手里始终留着那份没被涂污的原文作对照,批改起来才有依据。如果不这样反向构造数据,模型训练时就没有明确的目标可以对齐,学出来的效果好坏根本无从验证。

这套合成流程还挺讲究细节。团队构建了一个干净游戏视频语料库,先用CLIP模型提取的图像特征做聚类去重,避免视频里出现大量重复相似的场景,同时按时间上剔除相邻的雷同片段,防止合成数据的多样性被稀释。

CLIP:一种能把图像和文字映射到同一数学空间的模型,可以用来衡量两张图片在语义上有多相似,常用于图像检索和数据去重。

在具体合成时,系统会模拟真实界面的组合逻辑。持续存在的元素比如血条、小地图会按照概率被选中,用真实录制时记录的坐标位置作为放置参考,同时加入轻微的位置抖动来增加数据多样性。瞬时出现的弹窗类元素,比如击杀提示、系统通知,采用了长尾分布的采样策略,也就是说简单界面和复杂界面都会出现,符合真实游戏体验里有时清爽有时信息爆炸的状态。

对于像背包格子这种结构复杂的界面,系统还做了更精细的处理,把背景网格和物品图标拆分开单独存储,渲染时可以自由组合出全新的背包布局,同时保持视觉上的连贯性。

整个合成流程最终产出了96000组配对视频,每组都包含干净版和叠加界面版,外加逐帧对齐的分割掩码、边界框坐标、类别标签等完整的监督信息,视频统一渲染成720p、每秒30帧的规格。

光有合成数据不够,还得看真实世界的表现

合成数据再精细,终究是人工构造出来的。研究团队很清楚这一点,所以他们还专门收集了1079段来自303款游戏的真实野外视频片段,构成了名为Game2World-W的评测集合。

这批真实视频没有对应的干净版本可以对照,因为原始游戏画面里的界面遮挡是永久性的,没人能还原出被遮住的部分本来长什么样。为了解决评测标准的问题,团队用GPT-5.6 Sol模型标注每段视频的首帧,再由人工手动更新每一帧里动态变化的界面元素标签和边界框,最终服务于一套叫MLLM-as-a-judge的评测机制。

MLLM-as-a-judge:用多模态大语言模型充当自动评审员的评测方法,让AI模型对比原始画面和处理后的画面,判断界面元素是否被成功清除、背景内容是否被破坏。

这套评测协议还做了一个挺细致的验证。团队拿200段视频、6150条界面标注、2000条帧级标注去对比AI评审和人类评审的判断结果,最终AI评审在识别界面是否被移除这件事上达到了87.78%的F1分数,和人类判断的一致性指标Cohen's κ值达到0.820,这个数字意味着AI评审和人类评审的意见高度吻合,可以放心用来做大规模自动化评测,不用每次都靠人工肉眼一帧帧核对。

顺带一提,研究团队还专门分析了真实游戏里界面元素到底有多复杂多变。他们用了三个指标衡量,一个叫UI-D衡量界面组成的变化程度,一个叫UI-R@16统计16帧画面里出现了多少种不同功能的界面槽位,还有一个叫Context-UI-Lift衡量界面布局对游戏场景上下文的依赖程度。数据显示,UI-D的平均值达到69.3,UI-R@16的中位数是20,最高能到40种界面槽位同时存在,而90.8%的游戏里,界面布局在不同场景下的差异都明显大于同一场景内部的差异。

这组数据说明的道理很朴素,游戏界面远比想象中复杂多变,不是一套固定模板能通吃所有场景的。这也解释了为什么这篇论文要花这么大力气建立分类体系和素材库,如果界面元素本身就千变万化,那清除算法就必须学会应对足够丰富的样本,而不是死记硬背几个固定图案。

不用画掩码也能精准去除界面的模型

前面讲的都是数据怎么造出来的,现在轮到真正干活的模型登场了,一个叫GameCleaner的界面去除系统。

GameCleaner最大的特点是不需要输入掩码。

掩码:在图像处理里指定哪些区域需要被编辑、哪些区域保持不动的二值图,传统的物体去除算法通常需要先画出精确的掩码告诉AI"就是这块区域,别的别动"。

这个设计选择背后其实是个很现实的考量。传统的视频修复方法大多依赖精确的掩码输入,你得先告诉算法界面元素具体占据了画面的哪些像素,算法才能针对性地去修补。但游戏界面千变万化,形状不规则、大小不一、还时有时无地弹出消失,如果每次都要先人工或者用另一套算法生成精确掩码,整个流程就变得极其笨重,而且掩码本身的误差也会直接传导到最终修复效果里。

GameCleaner选择让模型直接从原始视频里"看懂"哪些是界面元素、哪些是游戏世界内容,靠的是把一个多模态大语言模型和视频生成模型结合起来。具体来说,系统先用MLLM编码采样的视频帧和文字指令,比如告诉它"把游戏界面从这段视频里去掉",然后通过一组可学习的查询向量从MLLM提取的特征里抽出和任务最相关的语义信息,再投影到视频扩散模型的条件空间里去指导生成。

扩散模型:一类通过逐步去噪的方式生成图像或视频的AI模型,近年来在图像和视频生成领域表现突出,Stable Diffusion等知名工具都基于这一原理。

这里选择用多模态大语言模型替代传统的文本编码器,是因为界面去除这件事本质上考验的是视觉语义理解能力,而不只是文字理解能力。系统得能"看懂"画面里哪块是弹出的通知框、哪块是玩家的正常游戏内容,这种能力只靠文字描述是学不来的,必须结合视觉信息才能判断。

为了保证修复后的画面在空间结构和时间连贯性上不跑偏,团队还设计了一个残差连接机制,把原始视频经过压缩编码后的潜在表示,按照一个随扩散步骤变化的系数注入到正在生成的目标画面里。这个机制相当于给生成过程装了一个锚点,防止AI在"脑补"被遮挡区域该长什么样的时候天马行空到偏离原始场景太远。

这就好比修复一幅被贴了创可贴的老照片。如果完全靠AI凭空想象创可贴底下应该是什么,修出来的画面可能张冠李戴,把创可贴底下该是一片草地的地方画成了一栋房子。但如果你能参考照片其他部分的光影、色调、构图规律,始终有个参照系拉着修复结果不要偏得太离谱,效果就靠谱得多。如果没有这层残差连接的约束,模型很容易在缺少足够信息支撑的情况下生成看起来诡异突兀的内容,那种一眼就能看出"这里被P过"的破绽。

数字说话,效果到底怎么样

光说设计理念不够,得看实打实的测试结果。

在合成数据集上,几个版本的GameCleaner都拿出了相当亮眼的表现。标准版本达到了95.36的伪影调整移除得分,这个指标不只看界面元素有没有被删掉,还要看删掉之后有没有留下明显的修复痕迹,同时背景保留得分达到99.00,几乎完美地保留了原本不该动的游戏内容。相比之下,一个叫Aurora的对照方法只拿到60.62分,而另一个叫VACE-14B的方法背景保留得分虽然高达99.60,但界面移除得分只有可怜的27.86分,这说明它压根没敢下手删除多少界面元素,属于典型的保守求稳但没解决实际问题。

在更贴近真实场景的野外测试集上,GameCleaner的优势体现得更加明显。带参考图像的版本拿到了80.05的移除得分和99.80的背景保留得分,比表现最好的对照方法Aurora高出将近29个百分点,背景保留能力更是高出85.8个百分点。有个叫EffectErase的方法虽然原始的界面移除成功率高达92.00,但把有没有留下修复瑕疵这个因素考虑进去之后,得分骤降到只有20.42,说明它虽然把界面元素删掉了,但删得很粗糙,留下了明显能看出被处理过的痕迹。

|方法|是否需要掩码|合成集AAR|野外集AAR|野外背景保留|

|---|---|---|---|---|

|VACE-14B|需要|27.86|5.92|94.10|

|EffectErase|需要|56.17|23.55|74.55|

|Aurora|不需要|60.62|51.19|14.00|

|Kiwi-Edit|不需要|34.68|13.54|96.80|

|**GameCleaner(带参考)**|**不需要**|**94.64**|**80.05**|**99.80**|

|GameCleaner(标准版)|不需要|95.36|48.56|99.60|

这张表里最能说明问题的是Aurora那一行。它在野外集上的移除得分看起来不错,51.19分,但背景保留只有14.00分,这意味着它确实动手删了不少界面元素,但代价是把游戏画面里本该保留的内容也一并破坏了。这就像是请了一个装修工人去撕掉墙上的旧海报,结果他连墙皮都给你铲了一层。

论文里还专门做了一组消融实验,探究训练数据量和某个训练技巧的影响。团队发现一个很有意思的现象,当训练数据从60%扩大到100%时,模型在合成数据集上的表现只提升了2.06个百分点,几乎已经饱和了,但在真实野外数据集上的表现却提升了整整25.09个百分点。这说明合成数据训练很快就能学到八九不离十的规律,但要真正应对现实世界里五花八门的界面样式,还得靠更多更丰富的数据去喂饱模型,数据的多样性,而不仅仅是数量,才是决定模型能不能举一反三的关键。

这套思路能走多远

这篇论文最打动人的地方,不在于某个具体的技术细节多么精巧,而在于它把一个看起来是"图像编辑小工具"的问题,重新定位成了"如何把互联网上现成的海量视频转化为高质量AI训练数据"的基础设施问题。

游戏行业里已经有不少团队在尝试用视频生成技术做交互式的游戏引擎。比如DIAMOND这个工作用扩散模型从录制的游戏画面里构建出可交互的强化学习环境,再比如Genie系列的研究,尝试从未标注的互联网视频里同时学出隐藏的动作信息和环境运行规律。这些工作有一个共同的隐含假设,直接把渲染出来的画面当成"世界的真实观测",而没有特意把游戏内容和屏幕上叠加的界面层区分开。

三年前起步的这类世界模型研究,大多默认游戏画面就是干净的观测数据。这篇论文相当于捅破了这层窗户纸,提醒大家画面里其实混进了大量和物理世界运转规律毫无关系的界面噪声,如果不清理干净,模型学到的"世界规律"里有一部分其实是在描述界面元素怎么弹出消失,这对训练真正理解物理世界的AI来说是种污染。

论文作者也很坦诚地承认了目前工作的边界。他们的数据集虽然已经覆盖了303款游戏,但相比互联网上成千上万款风格迥异的游戏,覆盖面仍然有限,对于一些大面积不透明的界面或者视觉上和游戏画面高度融合的界面元素,模型的修复效果可能不够理想。团队也提到,目前用文本条件的视频生成模型作为研究这个问题的代理方案,还不是真正意义上具备动作条件的交互式世界模型,要实现真正的交互式训练,还需要额外的技术去从视频里反推出玩家当时执行了什么操作,这在异构游戏之间目前还没有普适的解决方案。

团队透露正在把数据集规模扩大到百万级别,同时计划开发能把干净游戏视频转化成"观测加动作"配对轨迹的通用模块,为训练真正意义上的交互式世界模型铺路。

写在后面

读完这篇论文,我觉得最值得咂摸的一点是数据清洗这件事的位置被重新摆正了。

大部分AI进展的叙事里,数据清洗常常被当成脏活累活,是研究者不太愿意大书特书的前置工作,聚光灯总是打在模型架构和训练算法上。但这篇论文反过来告诉我们,有时候真正卡住整个链条的瓶颈,恰恰就是数据本身够不够干净、够不够能被模型正确理解。6.83%的整体性能提升,18.8%的运动质量提升,这些数字背后没有任何新奇的模型架构创新,纯粹就是把训练数据里的噪声源头挖出来处理掉带来的收益。

还有一个细节让我印象很深,团队为了给评测建立一套可信的标准,专门验证了AI评审和人类评审的一致性,Cohen's κ值达到0.820。这个动作本身其实是在给"用AI来评价AI"这种越来越流行的做法立一个规矩,你不能凭空说AI评审可靠,得拿出实打实的对比数据证明它和人类判断确实高度一致,这种自我验证的严谨态度在很多论文里其实是缺位的。

这篇论文抛出的问题也没有完全回答完,如果真的把互联网上所有游戏视频都清理干净变成训练素材,这样规模的干净数据能把世界模型的能力推到什么程度?会不会有一天,AI通过看足够多干净的游戏视频,真的学会了预测一个陌生游戏世界接下来会发生什么?

Q&A

Q1:Game2World数据集是什么?

A:Game2World是论文构建的一个数据集,包含96000组合成的配对视频(干净版和界面叠加版)以及1079段来自303款真实游戏的野外视频片段,用于训练和评测游戏界面去除模型。

Q2:GameCleaner和传统的视频修复方法有什么不同?

A:GameCleaner不需要输入掩码就能直接识别并去除游戏界面元素,它结合了多模态大语言模型的语义理解能力和视频扩散模型的生成能力,在真实游戏视频上的移除得分达到80.05,比传统方法高出近29个百分点。

Q3:为什么要专门清理游戏视频里的UI界面再拿去训练AI?

A:因为游戏界面元素比如血条、小地图、聊天框等和游戏世界的物理规律无关,会给AI训练引入噪声。实验显示用清理过的干净视频训练的模型,整体表现比用带界面视频训练的高出6.83%,运动质量提升18.8%。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询