让AI自己破解自己干坏事,越狱成功飙升44%,哥伦比亚大学发现新方法
教AI干坏事,原来最好的方法是让它自己破解自己!
哥伦比亚大学、罗格斯大学的研究员,一种名为LARGO的新方法,让大型语言模型通过反思自己的想法来生成流畅、隐蔽且高效的越狱提示。

大型语言模型正在各个领域展现其强大的能力,从聊天机器人、代码生成到医疗建议,它的身影无处不在。
随着应用范围的扩大,其潜在的安全和伦理风险也日益凸显。
为了构建更安全的模型,研究人员需要不断寻找并修复它们的漏洞,而高效的白帽越狱方法正是这枚探路的石子。
越狱方法的演进经历了一个从手动到自动的过程。最初,社区用户手动制作了像DAN(Do Anything Now,现在就做任何事)这样的提示,试图强迫模型绕过其安全指令。这些方法虽然巧妙,但效果短暂且容易失效。
随后,研究转向了在token级别进行自动优化的技术。
其中,贪婪坐标梯度(GCG)方法利用基于梯度的搜索来寻找有效的对抗性后缀。GCG生成的后缀攻击性很强,但内容上像一堆无意义词元的大杂烩,缺乏连贯性,很容易被基于困惑度的防御机制识别并拦截。
另一个方向则是利用搜索和学习来生成更流畅的越狱提示。
例如,AutoDAN应用遗传算法来演化出类似DAN风格的提示;PAIR和AdvPrompter则利用一个LLM作为攻击者,另一个LLM作为裁判,通过迭代优化生成更自然的攻击语言。
这些方法虽然在流畅性上有所提升,但引入了额外的复杂性,比如依赖人类设计的原型、复杂的提示工程或专门的攻击模型训练。它们离直接、高效地优化攻击目标还有一段距离。
现有研究大多集中在如何诱导模型输出有害内容,却很少探索模型内部机制本身可能存在的不安全性。
LARGO(Latent Adversarial Reflection through Gradient Optimization,通过梯度优化的潜在对抗性反射)提供了一个全新的视角。它不再仅仅关注模型最终输出的文字,而是深入模型内部,直接在其思维空间中进行优化,并巧妙地利用模型自身,将这种潜在的对抗性意图转化为流畅的自然语言。
LARGO的攻击过程分为三步,将连续空间的优化与自然语言生成优雅地结合起来:

潜在提示优化。在模型处理语言时所处的连续潜在嵌入空间中,通过梯度优化,精确找到能驱动模型产生不当行为的那个内部状态,也就是一个对抗性的想法。
自反射解码。把模型本身当作一面镜子,让它来审视并解释上一步找到的那个优化后的潜在向量。模型会用连贯的自然语言,生成一个看起来无害的文本后缀,而这个后缀恰恰携带了之前注入的对抗性力量。
反向投影。这个过程是迭代的。模型生成的自然语言后缀会被重新投射回嵌入空间,用于进一步优化那个潜在的想法,直到生成的越狱提示成功为止。
简单来说,LARGO先找到一个能让模型想坏事的潜在念头,然后让模型自己说出是哪些词语引发了这个念头。
这样一来,就自动生成了一种强大且流畅的越狱工具。它绕过了离散提示工程的繁琐,直接在模型的嵌入空间中搜索,再利用模型自身的语言能力生成人类可读、看起来十分正常的提示。
这些生成的对抗性后缀表面无害,却能稳定地触发模型的违规行为。在AdvBench和JailbreakBench等标准基准测试中,LARGO的攻击成功率比GCG和AutoDAN分别高出31.0%和44.0%,并且生成的后缀文本困惑度远低于GCG,意味着其内容更自然、更像人话。
这项研究揭示了当前模型对齐策略中存在的深层漏洞,为我们构建更强大的防御机制敲响了警钟。
LARGO让模型在反思中生成攻击
LARGO的核心目标是自动制作一个自然语言后缀,当这个后缀附加到有害的用户查询后,能诱导模型给出肯定的、而非拒绝的回答。
整个算法可以在两种模式下运行:一种是为每个有害提示量身定做一个独特的攻击后缀(单提示攻击),另一种是优化一个通用的后缀,使其能对付各种不同的有害提示(通用攻击)。
在单提示攻击模式下,算法的三个阶段环环相扣。

第一阶段是寻找对抗性的想法,即在词元嵌入的潜在空间中发现一个扰动向量。
第二阶段是让模型说出它的想法。
为了让模型解释学习到的嵌入,LARGO构建了一个特殊的提示,其结构遵循聊天模板:
用户: <latent suffix>
助理: 好的,我将总结这条信息:
在输入模型时,占位符<latent suffix>会被优化后的潜在向量替换。模型会接着这个提示进行自回归生成,产出一个离散词元序列。这个序列就是被解释出来的对抗性后缀,它可以直接附加到原始的用户查询后面。
这种自反射的解释方式,确保了生成的后缀在语法上是连贯的,并且在上下文情境中是合理的,同时还编码了诱导模型肯定回答的对抗性目标。整个过程在推理时无需再访问潜在嵌入。
第三阶段是迭代改进,直到成功。
解释生成的后缀会被附加到原始的用户查询上,然后输入目标模型进行测试。成功与否通过关键词匹配来判断,并使用StrongREJECT基准进行验证,确保模型不仅给出了肯定回答,而且回答的内容与有害查询相关。
如果一次攻击失败,算法不会就此罢休。它会将这次失败的后缀重新投射回嵌入空间,生成一个新的潜在向量,从而完成一次改进迭代。接着,算法会重复优化和解释的步骤,生成新的后缀,周而复始,直到成功越狱。

通用攻击的逻辑与单提示攻击类似,但目标更高远。
它不再为每个有害查询单独制作后缀,而是试图优化一个能够通杀各类有害提示的单一后缀。
这个过程同样从潜在嵌入优化开始,但操作对象是一批随机的有害查询。对于批次中的每个查询,算法附加相同的潜在后缀嵌入,并计算损失。聚合后的总损失被用于优化这个通用的潜在向量。
在实验中,批次大小被设置为10,这足以优化出一个在不同有害查询之间有效传递的通用潜能。与单提示模式一样,优化后的潜在向量在每个周期后被解释为自然语言,并用这个新解释出的后缀继续下一轮的迭代改进。
LARGO的攻击效果远超同类
为了验证LARGO的性能,研究人员进行了一系列实验,涵盖了单提示攻击、通用攻击和跨模型的传递攻击,并评估了其攻击效果和生成文本的流畅性。
所有实验都在配备80GB显存的NVIDIA H100 GPU上进行,采用混合精度训练。后缀长度统一设置为200个词元,最大改进迭代次数为15次。对于所有基线方法,也使用了相同的参数设置。
为了保证结果的可复现性,所有越狱测试中模型的温度参数都设为0。一次成功的越狱平均需要6.4次迭代,每次迭代耗时约25秒。
实验将LARGO与三种主流的基线方法进行了比较:
GCG(贪婪坐标梯度):一种自动对抗性破解方法,通过贪婪地更新后缀中的词元来最大化模型产生有害响应的概率。其缺点是生成的后缀通常是无意义的字符串,容易被基于困惑度的防御机制过滤。
AutoDAN:使用分层遗传算法生成隐蔽的越狱提示。与GCG在词元级别操作不同,AutoDAN在句子和段落级别进行优化,生成的攻击提示更流畅,攻击成功率也更高。
AdvPrompter:通过在一个成功越狱的样本集上微调一个攻击者LLM来生成人类可读的对抗性后缀。这种方法在运行时效率很高,生成的提示也易于阅读。
实验在AdvBench和JailbreakBench两个综合基准数据集上进行。这两个数据集包含了各种类型的有害行为指令,如亵渎、暴力描述、威胁、错误信息、歧视、网络犯罪以及危险或非法建议。
为了准确衡量攻击效果,实验采用了两个评估指标。
一个是基于关键词的攻击成功率(ASR)。除了检查模型是否会说出对不起,我不能之类的拒绝短语,研究人员还从每个攻击提示中手动提取关键词。
这确保了模型不是在给出肯定但无关的答复。另一个指标是StrongREJECT,它利用GPT-4来评估提示与响应对的有害性、具体性和说服力,作为一个更可靠的验证基准。
在单提示攻击的测试中,目标模型选用了Llama-2-7b-chat-hf、Llama-2-13b-chat-hf以及Phi-3-mini-4k-instruct。Llama 2系列模型以其在面对越狱攻击时的鲁棒性而闻名,而Phi-3则代表了小型Transformer模型的最新进展。

结果如表所示,LARGO在所有三个目标模型和两个数据集上,都取得了比基线方法更高的攻击成功率。平均而言,它比GCG、AutoDAN和AdvPrompter分别高出22.0%、27.3%和57.8%。
在文本流畅性方面,通过GPT-2测量了成功后缀的平均困惑度(Perplexity, PPL)。困惑度越低,表示文本越自然流畅。
GCG由于其词元级的优化方式,困惑度最高。AdvPrompter因为直接使用微调的LLM生成后缀,困惑度最低,但其攻击成功率也低得不成比例。
LARGO则始终保持着第二低的困惑度。这得益于其自解释的设计,让模型能够在没有人工干预的情况下生成自己的攻击提示。
为了验证基于关键词的ASR指标的可靠性,研究人员使用StrongREJECT框架对Llama-2-7b的结果进行了重新评估。

结果显示,尽管由于GPT-4的保守评分机制,各种方法的ASR数值有所下降,但总体趋势与基于关键词的ASR保持一致。这再次确认了LARGO在生成具体且有说服力的有害响应方面优于其他基线方法。
在传递攻击(Transfer Attack)的测试中,研究人员评估了在一个模型上优化出的攻击后缀,在不经修改的情况下,能否成功攻击另一个模型。这模拟了现实世界中攻击者可能无法访问目标模型内部参数的黑盒攻击场景。

LARGO在传递性方面表现出色。将从Llama 2-13B上优化出的后缀传递给Llama 2-7B时,成功率最高,达到了31.37%,这表明模型架构的相似性有助于攻击的传递。
即便是在跨模型系列的场景中,比如从Phi 3-4B传递到Qwen 2.5-14B,LARGO仍然保持了13.29%的可观成功率。LARGO增强的传递性,归功于其自反射解码过程。
通过在连续的潜在空间而非离散的词元空间中操作,LARGO捕捉到了更高级别的、跨模型系列和规模都普遍存在的语义漏洞。
在通用攻击测试中,LARGO的表现同样亮眼。
研究人员在10个训练提示上优化出一个通用的对抗性后缀,然后在200个测试提示上进行评估。

在相同的后缀长度、批次大小和训练周期下,LARGO的通用攻击在所有测试模型上的表现都优于GCG,并且困惑度显著降低。
这表明LARGO产生的方法能够生成更自然、更流畅的文本,从而更好地规避基于困惑度的防御机制,再次凸显了在潜在空间而非词元空间进行优化的有效性。
攻击的有效性源于精确的潜在优化
LARGO生成的攻击后缀看起来无害,但它确实反映了对抗性潜在向量中编码的信息,并最终导致了越狱。
一个自然而然的问题是:越狱的成功,是因为后缀中包含了经过精确优化的对抗性信息,还是仅仅因为任意一段内容迷惑了模型?
为了回答这个问题,研究人员进行了一项消融研究。他们随机初始化了一些潜在向量,然后同样通过自反射解码过程将其解释为自然语言后缀。这种方法产生的文本段落读起来与真正的攻击后缀很相似,可以作为随机对照组。

结果清晰地证明了优化后的攻击后缀相对于随机生成的后缀的显著优势。
虽然两种方法都能生成可读的文本,但经过优化的后缀实现了高得多的攻击成功率。
另一个影响攻击效果的因素是后缀的长度。
研究人员通过在AdvBench上攻击Llama 2-7B来探究不同后缀长度的影响。

后缀长度与攻击成功率之间存在明显的正相关关系。
随着后缀长度从50个词元增加到300个词元,攻击成功率从13.0%稳步提升至65.0%。
LARGO的提出,是在LLM对抗性攻击领域的一个重要进展。
它巧妙地结合了潜在空间优化和自反射解码,开创了一种全新的越狱攻击框架。
通过先在模型的连续潜在空间中进行优化,然后利用模型自身的语言能力将优化结果转化为自然流畅的语言,LARGO生成了那些看起来无害却能稳定诱导模型越狱的对抗性后缀。
这项研究发现,即使经过对齐的大型语言模型中依然存在着可被利用的深层漏洞,并强调了开发更强大、更根本的防御机制的紧迫性。
当模型从“潜意识”里反思,并生成有害内容时,我们该如何构建下一代防火墙?
参考资料:
https://arxiv.org/abs/2505.10838
END