用物理学原理堵住色情暴力内容的漏洞

这项由新加坡南洋理工大学与韩国蔚山科学技术院(UNIST)联合开展的研究,于2026年6月发表,论文编号为arXiv:2606.23267。有兴趣深入了解的读者可通过该编号查询完整论文。

当AI画图工具变成"不良内容生成器"时,我们该怎么办

近几年,AI生图技术已经进化到了一个令人瞠目结舌的程度。你只需要打几个字,它就能在几秒钟内画出一张精美的图片。但这个强大的能力也带来了一个让人头疼的问题:有人会故意输入带有色情、暴力内容的提示词,让AI生成不应该出现在公共场合的图片。

为了解决这个问题,研究人员一直在寻找各种"安全锁"方案。然而,随着AI生图技术的快速演进,一种叫做"流匹配"(Flow Matching)的新技术逐渐成为主流——它被用在了目前最先进的图像生成工具中,包括著名的Stable Diffusion v3和FLUX。这种新技术的最大优势是速度极快:只需要极少的几步计算,就能生成高质量图片。问题也恰恰出在这里——过去那些为"慢速"AI设计的安全防护措施,在这种"快速"AI面前几乎完全失效。

新加坡南洋理工大学的研究团队正是盯准了这个漏洞,提出了一套全新的防护方案,取名为VESFLOW(速度编辑安全流匹配)。这套方案不依赖任何模型重训练,而是直接在AI"思考"的过程中巧妙介入,将可能产生危险内容的轨迹拨向安全方向。在4步极速生图模型上,他们将色情内容的攻击成功率从约70%压低到了6%左右,同时对正常图片的生成质量几乎没有任何影响。

一、AI生图的工作原理:一场从噪点到画作的旅程

要理解这套安全方案,首先得明白AI是如何生成图片的。可以把这个过程想象成一个雕塑家在一团乱石中,一刀一刀地雕刻出一尊精美的雕像。起点是一团毫无规律的随机噪点,终点是一张符合你描述的图片。

在传统的扩散模型(比如早期的Stable Diffusion)中,这个雕刻过程需要很多刀——往往是50步甚至100步,每一步只做一点点修改。这样做的好处是每一刀都能精细控制,坏处是太慢了,在手机或普通电脑上运行非常吃力。

流匹配技术改变了这个雕刻策略。它不再一点一点地修改,而是直接计算出从噪点到目标图片的最短路径,然后沿着这条近乎笔直的路线快速到达终点。在技术层面,流匹配模型学习的是一种叫做"速度场"(Velocity Field)的东西——可以把它理解为每一个时刻、每一个位置上,雕刻刀应该朝哪个方向用力、用多大的力。

更进一步的MeanFlow技术则更加激进,它不计算每一瞬间的速度,而是直接计算出一段时间内的"平均速度",从而实现真正意义上的一步或四步生图。这就像是雕塑家不再一刀一刀地雕,而是一眼就看出了终态,直接一挥而就。

由此可见,流匹配和MeanFlow让AI生图的"旅程"从数十步压缩到了寥寥几步,速度提升了一个数量级。然而,这也给安全防护带来了致命的挑战。

二、旧安全方案为何在快速AI面前失灵

过去那些保护AI不生成危险内容的方案,基本分为两大类,而这两类方案在面对快速流匹配模型时,都遭遇了各自的瓶颈。

第一类方案可以称为"轨迹纠偏法"。这类方案的逻辑是:在每一步计算过程中,检测一下当前的图片雏形是否在向危险方向发展,如果是,就施加一个反向的推力,把它往安全的方向推一推。这就像是在那个从噪点到画作的旅程中,安排了一个监察员,每走一步就检查一次,发现走歪了就纠正。

在传统的50步模型中,这个方案运作得相当不错——监察员有50次机会检查和纠正,每次只需要做一点点调整,积少成多,最终能把轨迹拉回正轨。但是在4步的快速模型中,监察员只有4次机会。每次纠偏的力度如果太小,4步根本来不及把危险内容彻底消除;力度如果太大,又会把图片推出正常范围,画面变得扭曲失真,连带着把安全的图片也搞砸了。

研究团队用一个一维的玩具实验直观展示了这个困境:用20步生成时,大多数危险轨迹都能被成功纠偏;但换成2步生成,纠偏几乎完全失效,危险内容照样能够生成出来。

第二类方案是"改词法"。既然问题出在用户输入了危险的提示词,那就在提示词进入AI之前,先把它处理一下,把危险的词义成分剔除掉,只保留无害的部分。代表性方案包括SAFREE(把提示词向量从危险概念的方向上投影掉)和Semantic Surgery(语义手术,对提示词向量做减法运算)。

然而,这里有一个被很多人忽视的技术障碍。早期的图像生成模型(比如Stable Diffusion 1.4)使用的是CLIP这种文本编码器——它的特点是每个词都对应一个相对独立的向量,词与词之间的"串扰"较小。而最新的流匹配模型(如FLUX和SD v3)则采用了T5这种大语言模型作为文本编码器。T5是在大量长文本上训练出来的,它理解的是整句话的意思,而不是逐词的意思。

这意味着什么?这意味着当你输入一句话时,每个词的含义都已经和整句话的语境深度融合,"色情"这个概念不再孤立地存在于某个词向量里,而是弥漫在整个句子的编码里。研究团队通过实验证实了这一点:对于色情相关的提示词,CLIP编码器产生的词向量彼此相似度很高,说明这类词有一个清晰的"危险区域"可以被识别和剔除;而T5编码器产生的词向量相似度则低得多、分布也散得多,说明危险概念已经散布到了整个向量空间,根本无法精准切除。

正因如此,改词法在最新的流匹配模型上的效果也非常有限。研究团队的实验数据清楚地表明,SAFREE和Semantic Surgery在FLUX和MeanFlow模型上几乎无法有效降低危险内容的生成率。

三、VESFLOW的核心思路:从拨偏轨迹到直接改写方向盘

面对上述两类方案的局限,研究团队换了一个完全不同的思考角度。

既然流匹配模型学习的核心是"速度场"——也就是每一步应该往哪个方向走、走多快——那么为什么不直接修改这个速度场本身,而是要在每一步上贴膏药式地干预呢?

这就是VESFLOW的核心直觉:与其在旅途中反复纠偏,不如直接改写地图,让这张地图从一开始就只指向安全的目的地。

具体来说,原始的流匹配模型学到的速度场,反映的是对所有可能图片(安全的和危险的)的平均期望。研究团队想要的是一个"安全条件速度场"——只考虑那些最终图片属于安全区域的情况下,速度应该是多少。换句话说,他们想把速度场从"无差别期望"改成"只想着安全结果的期望"。

用旅行来类比:原本的AI是一个导航软件,它会根据所有可能的目的地(包括危险的地方)来规划路线,正好走到了危险区域。VESFLOW则相当于给这个导航软件施加了一个约束条件:"只给我推荐能到达安全目的地的路线",导航软件于是重新规划了路线,从源头上就不再通往危险区域。

四、贝叶斯分解:用数学公式推导出"安全速度"

要把这个直觉变成可以实际使用的公式,研究团队借助了概率论中的贝叶斯定理(Bayes' Rule)——一种用于在已知部分信息的情况下更新概率估计的数学工具。

他们先把数据空间分成两个部分:安全区域和不安全区域,并用一个二值变量来表示当前生成的图片最终是否落在安全区域内。然后,他们推导了从原始速度场到安全条件速度场之间的差值公式。

这个推导的关键步骤是:根据流匹配的速度场与概率密度梯度之间的数学关系,两个速度场之间的差值可以用概率密度的比值的梯度来表达。再通过贝叶斯定理,这个比值被进一步化简为与安全性判断相关的概率项。

最终,研究团队引入了一个预训练的安全判别器(比如一个专门检测裸露内容的分类器),并用一阶泰勒近似来简化计算,得到了一个实用的速度修正公式。

这个公式的直观含义非常优美:速度修正量正比于安全判别器关于当前预测图片的梯度,除以"该图片为安全"的概率。这意味着当预测图片越接近危险内容时(判别器认为它不安全的概率越高),修正的力度就越大;反之,当预测图片已经很安全时,修正量趋近于零,对正常生成几乎没有影响。

公式中还自然地包含了一个时间调节因子:t除以(1减t)。在时间接近1(也就是生成的起始阶段,图片还是一团噪点)时,这个因子很大,修正力度强;在时间接近0(也就是生成的末尾阶段,图片已经接近完成)时,这个因子趋近于零,修正力度自然减弱。这与之前其他研究发现的规律不谋而合:早期干预比晚期干预更有效。

对于MeanFlow模型(学习平均速度而非瞬时速度的模型),同样的修正公式也可以直接应用,因为MeanFlow的平均速度实际上是瞬时速度在时间区间上的积分,而在近线性轨迹的假设下,用区间终点的瞬时修正量来近似这个积分是合理的。

五、风险过滤机制:给"正常人"的免检通道

VESFLOW有一个值得关注的特性:当输入的提示词是完全无害的时候,安全判别器对预测图片的输出趋近于零,因此速度修正量也趋近于零——也就是说,对于安全的提示词,VESFLOW实际上什么都没有做,生成的图片和不加安全防护时完全一样。

这个特性从理论上保证了正常用户的体验不受影响。然而,即便修正量趋近于零,每次生成时仍然需要计算判别器的梯度,这会带来额外的计算开销。对于一个主要处理正常请求的系统来说,这种开销显然是不必要的浪费。

为了解决这个效率问题,研究团队设计了一个"风险评分过滤器"。它的工作方式非常简单:在用户提交提示词之后、AI开始生成之前,先用CLIP(一种能把文字和图片映射到同一个向量空间的模型)计算一下这个提示词与一系列预先定义的危险概念词(如色情、暴力等)的相似度。如果相似度超过了一个门槛值(实验中设定为0.3),就认为这是一个危险提示词,需要启动VESFLOW;否则,就直接跳过安全处理,让AI正常生成。

这个过滤器只需要做一次简单的向量相似度计算,计算量极小,几乎不占用额外时间。对于绝大多数正常用户,系统运行方式和原来没有任何区别;只有当系统侦测到可疑提示词时,才会调用更昂贵的安全处理机制。

六、VESFLOW+:对付顽固危险提示词的加强版

基于风险过滤机制,研究团队进一步提出了一个加强版方案——VESFLOW+。

理解VESFLOW+,需要先理解VESFLOW本身的数学结构。VESFLOW把速度场从"边际速度"(对所有可能结果的平均)修正到"安全条件速度"(只考虑安全结果的期望)。用向量来表示,修正方向是从边际速度指向安全条件速度。

然而,边际速度本身是安全和不安全两个方向的混合。对于那些已经被风险过滤器确认为高危的提示词来说,边际速度大概率是被不安全成分所主导的。VESFLOW+的思路是:与其从边际速度出发去接近安全条件速度,不如直接从不安全条件速度出发跳向安全条件速度——这样修正的"步伐"更大,效果更强。

在数学上,这个更强的修正向量由两部分组成:一部分是指向安全方向的吸引力(与VESFLOW中的修正量相同),另一部分是远离危险方向的排斥力(通过在公式中额外加入判别器输出的对数项实现)。两股力合在一起,VESFLOW+的安全防护力度要比VESFLOW更强。

但正因为VESFLOW+的力度更大,它不能随便用在任意提示词上——对于一个完全无害的提示词,强行施加远离"危险方向"的排斥力,反而可能破坏正常生成。所以,VESFLOW+必须在风险过滤器确认提示词属于危险类别之后才能启用,这也是为什么过滤机制对于VESFLOW+来说是必要前提而非可选优化。

七、实验结果:数字背后的真实表现

研究团队在两个主流的少步生图模型上验证了方案的效果:一是FLUX.1-lite-8B,一个8步生图的高效版本;二是MeanFlow蒸馏模型,一个4步生图的极限版本。

安全性测试使用了两个公开的攻击性提示词数据集:Ring-A-Bell(包含79条裸露相关提示词和250条暴力相关提示词)以及MMA-Diffusion(400条多模态攻击提示词)。评估指标分为攻击成功率(ASR,生成图片中危险内容检出比例超过60%的比例)和毒性率(TR,所有生成图片的危险内容平均检出分数)。危险内容的检测分别使用了NudeNet(专门检测裸露内容)和Q16(检测暴力内容)两个工具。

生成质量的评估则使用了MS-COCO数据集中的普通提示词,通过FID分数(衡量生成图片与真实图片分布的差距)和CLIP分数(衡量图片与提示词的匹配程度)来判断正常生成是否受到影响。

在4步MeanFlow模型上,未加任何防护的基线方案在Ring-A-Bell裸露测试上的ASR高达70.9%,即十张中有七张能成功生成危险内容。VESFLOW将这个数字压低到了15.2%,VESFLOW+则进一步压低到了6.3%。在MMA-Diffusion测试上,基线的ASR为41.7%,VESFLOW降至7.5%,VESFLOW+降至6.8%。

与此同时,那些对比方案——无论是SGF(安全引导流)、STG(安全文本嵌入引导),还是SAFREE和Semantic Surgery——在同样的4步模型上,最好的结果也只能把ASR降到50%左右,许多情况下甚至比基线还要差。

在正常图片的生成质量上,VESFLOW和VESFLOW+的FID分数和CLIP分数与基线几乎相同,说明安全防护对正常用户的使用体验几乎没有任何影响。

在暴力内容的测试上,VESFLOW和VESFLOW+同样取得了有意义的效果:4步MeanFlow上的暴力ASR从基线的80.8%降低到了VESFLOW+的46.8%。虽然降幅不如裸露内容那么显著,但研究团队特别指出,暴力内容的检测本身就比裸露内容更难(因为暴力概念的边界更模糊),而且他们为暴力任务使用的是完全与裸露任务相同的超参数设置,没有单独调整——这说明VESFLOW方案的泛化性相当不错。

在8步的FLUX模型上,VESFLOW+在裸露检测上的表现更为亮眼:Ring-A-Bell的ASR从64.6%降至1.3%,MMA-Diffusion的ASR从66.5%降至0.3%。这意味着几乎完全消灭了危险内容的生成。

八、细节打磨:稳定性、效率与判别器的选择

在VESFLOW的公式中,时间调节因子t除以(1减t)在时间接近1时会趋向无穷大,这可能导致生成过程在第一步就变得极不稳定,产生严重的数值溢出。

研究团队采用了一个简单但有效的稳定化策略:设置一个时间上限t_max(比如0.99或0.95),当时间超过这个上限时,将时间上限代入公式计算,从而把调节因子限制在一个有限的范围内。

实验表明,t_max=0.99时安全性能比t_max=0.95更强,但生成质量(FID分数)在高引导强度下会有更明显的下降。另一个直观的稳定化策略是跳过第一个生成步骤,但实验证明这会导致安全性能大幅下降,这与其他研究者关于"早期干预最重要"的发现完全一致。

在判别器的选择上,研究团队主要使用了LAION的CLIP-based NSFW检测器,而没有使用NudeNet——这是一个刻意的设计选择,目的是避免"用同一个工具既做引导又做评估"带来的循环偏差。但为了验证方案对判别器选择的敏感性,他们也用NudeNet替换了判别器,并用一个完全独立的多模态大语言模型LLaVA来做评估。结果显示,两种判别器的效果相当接近,说明VESFLOW方案的有效性并不依赖于特定判别器的实现细节。

计算开销方面,在8步FLUX模型上测量的结果显示:基线方案每张图片约需0.95秒,SGF约需0.99秒(仅略微增加),而STG由于需要对提示词嵌入计算NudeNet的梯度,开销高达3.6秒(约为基线的4倍)。VESFLOW和VESFLOW+则约为2.16秒,大约是基线的2.2倍。在启用风险过滤器的实际应用场景中,对于良性提示词(占大多数)完全跳过安全处理,平均计算开销会进一步降低。

九、方案的局限与未来方向

研究团队对方案的局限性非常坦诚。时间调节因子带来的稳定性问题是最主要的缺点:虽然t_max策略能够缓解这个问题,但选择不同的t_max值会对安全性和生成质量产生不同的影响,需要手动调整,缺乏一个更理论化的自动选取方法。

此外,当VESFLOW方案与提示词层面的安全方案(如Semantic Surgery)结合使用时,效果并不总是叠加的。当提示词层面的修改已经把预测图片推向安全区域时,VESFLOW+中用于计算强度的"判别器输出"会接近零,导致加强版的排斥项变得数值不稳定,反而可能降低安全性能。这说明两类方案之间的协同关系比较复杂,需要更细致的设计才能稳定地结合。

研究团队表示,未来将探索更理论化的稳定化方案,直接利用预训练流匹配模型本身的结构来避免数值发散问题,而不是依赖手动设置的截断上限。

说到底,这项研究做了一件很有意思的事情:它不是简单地给AI图像生成系统打补丁,而是从流匹配模型的数学本质出发,找到了一个在原有框架内就能实现安全引导的优雅路径。过去那些安全方案大多是"在旅途中不断纠偏",而VESFLOW是"重新画了一张只通向安全目的地的地图"。这个思路上的转变,让它在只有寥寥几步的极速生图场景中依然能发挥作用。

归根结底,随着AI生图工具越来越快、越来越强大,安全防护的挑战也越来越大。今天4步生成,明天可能是1步生成,每次技术的跨越都会让旧的安全方案又面临新的挑战。VESFLOW提供的这种速度场层面的干预思路,或许为未来的安全防护研究开辟了一条值得继续探索的道路。感兴趣的读者可以通过arXiv编号2606.23267查阅原论文,深入了解技术细节。

Q&A

Q1:VESFLOW为什么对4步这种极少步数的AI生图模型特别有效?

A:VESFLOW直接修改AI内部的"速度场"(决定生成方向的核心参数),相当于从源头改写了生成路线,不需要通过多步累积的方式来逐渐纠偏。而旧方案每一步只施加一点点纠偏力,步骤少就没机会积累,导致效果很差。VESFLOW的修改在第一步就已经生效,步骤少反而不是障碍。

Q2:VESFLOW会不会影响正常用图片请求的生成质量?

A:基本不会。VESFLOW的数学公式中包含一个自动调节机制:当预测图片已经是安全内容时,修正量自动趋近于零,几乎不改变任何东西。研究团队用MS-COCO数据集的实验也证实了这一点,启用VESFLOW后正常图片的FID和CLIP分数与不启用时几乎相同。

Q3:VESFLOW方案需要重新训练AI模型吗?

A:完全不需要。VESFLOW是一种"无需训练"的方案,它只在图片生成的推理阶段起作用,对预训练模型的参数完全不做修改。这意味着它可以直接套用在已有的流匹配生图模型(如FLUX、MeanFlow)上,不需要任何额外的训练成本。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询