FINSAFETYBENCH:真实金融场景大模型攻防安全评估基准

“FINSAFETYBENCH: Evaluating LLM Safety in Real-World Financial Scenarios”


图片


【 扫描文末二维码加入星球获取论文,源码 】


摘要


大语言模型(LLMs)用于金融场景有合规风险,为系统评估其金融安全性,提出双语红队基准 FIN SAFETY BENCH,涵盖 14 个子类别。实验发现通用和金融专业 LLMs 存在关键漏洞,中文语境下更易受攻击,提示级防御对复杂或隐式策略有限。文中含违规金融场景提示。


简介


近期大语言模型(LLMs)在金融文本理解与生成方面能力强,适用于投资决策、金融推理、市场分析等金融应用。但监管者和政策制定者担忧其被滥用,如隐瞒会计欺诈、操纵财报、伪造交易,且模型易受错误信息和对抗性操纵影响,损害市场诚信、金融稳定和投资者信任。因此,系统评估LLMs在金融领域的安全性是紧迫研究任务。


现有金融基准主要针对知识问答和复杂推理,忽略大语言模型在金融领域的不当使用风险,通用安全合规基准聚焦粗粒度伦理类别,部分研究依赖大语言模型合成数据,存在冗余和数据有效性问题。


本文提出双语金融红队基准 FIN SAFETY BENCH,优势在于:聚焦具体违规场景,反映现实;源于真实案例,减少重复和模型依赖;细粒度系统分类;支持多语言。用该基准评估主流开源模型,发现部分攻击变体成功率高,模型在中文数据上更易受攻击,常见提示级防御对复杂攻击有局限。


相关工作


金融基准测试


现有金融基准主要评估知识问答和推理,正朝更高复杂度、更广覆盖和综合指标发展,但金融安全探索不足。如FinEval重领域知识,SuperCLUE-Fin和CFinBench针对监管背景,OpenFinData和Cupace数据集存在数据不透明问题。为填补此空白,引入FIN SAFETY BENCH评估金融安全,揭示越狱场景下的鲁棒性漏洞。


图片


大模型安全


越狱技术已从手动转向自动,如梯度优化对抗后缀注入等,绕过大语言模型(LLM)安全防护,加剧鲁棒性和伦理对齐风险,尤其在参数高效微调部署时。为此,出现综合安全评估框架及通用基准,如JailbreakBench、SORRY-Bench等,还有针对中文语境的评估基准。但金融领域细粒度评估稀缺,TRIDENT虽基于CFA伦理准则,但案例多样性不足,而FIN SAFETY BENCH源于真实案例,覆盖更广、模拟更真实。


FIN SAFETY BENCH


概览


FIN SAFETY BENCH 收集真实金融 misconduct 案例,经 LLM 过滤改写为有害指令。数据集含 1201 个自有案例和 680 个外部样本,共 1881 个双语对齐实例,后续将介绍类别和数据构建流程。


图片


问题分类


为实现综合评估,定义包含严重金融犯罪和金融伦理违规的两级分类法。


金融犯罪:指金融行业内造成严重社会危害、重大经济损失且可能被刑事起诉的非法活动,涵盖市场操纵、贿赂等11种代表性类型。


金融伦理违规:指金融从业者违反公认道德标准或公司规定的行为,虽危害相对较轻,但仍会损害客户、雇主利益及市场诚信,包括损害客户利益、损害雇主利益和缺乏独立性与客观性3种类型。


图片


数据集构建


数据来源和选择标准


收集金融犯罪相关原始材料的三个渠道:


  • 金融司法和法律案件材料:手动收集公开的金融犯罪司法判决和法律文件,用于学术研究。

  • 公开模拟考试:收集公开的CFA模拟考题,整理改编以避免版权问题。

  • 公开红队数据集:从TRIDENT、HarmfulQA和HExPHI中提取金融示例,筛选符合标准的大语言模型拒绝实例。


数据处理


受LLM辅助人类标注研究启发,设计将现实金融案例转化为金融违规场景的处理流程,含五阶段,旨在保留真实性并引发LLM拒绝行为。


  • 提取与总结:用开源工具从PDF文档提取文本,用Qwen3 - 32B提取司法案例犯罪模式和法律条款;将CFA案例问题与答案组合成种子实例,用Qwen3 - 32B分类标注,人工验证后作后续种子数据。

  • 可控改写与有害性验证:用Deepseek - V3将种子转为中文指令式查询,用Qwen2.5 - 32B - Instruct生成参考响应,保留能使模型明确拒绝的查询。

  • 公共数据集选择与整合:筛选公开数据集,将金融实例纳入FIN SAFETY - BENCH,整合前对外部样本进行有害性验证和分类。

  • 双语对齐:用Qwen3 - 32B生成初始翻译,人工验证确保中英语义等效。

  • 去重与数据集组装:用MinHash - based LSH去重,保留最具代表性实例,最终基准数据含有害指令、类别、语言标签和来源标签。


数据质量


为确保 FIN SAFETY BENCH 可靠性,邀请金融专业研究生执行多阶段验证方法:


  • 验证司法案例和 CFA 模拟题确保源数据准确;

  • 人工审核 Qwen3 - 32B 中间摘要,减少大语言模型幻觉或偏差;

  • 对 DeepSeek - V3 改写的红队指令及公共数据集内容验证,确保中英文版本有害且分类正确。


实验


实验设置


评估模型:在FIN SAFETY BENCH上评估六个目标模型,包括五个通用大语言模型(LLaMA3、InternLM3、GLM-4、Mistral、Qwen2.5)和一个金融特定模型(XuanYuan),分析模型规模和领域专长对金融领域越狱攻击鲁棒性的影响,通用模型基线ASR近零,XuanYuan固有脆弱性更高。


越狱和防御的实现细节:进行越狱实验,采用PAIR、ReNeLLM、FlipAttack三种攻击方法;评估三种轻量级防御策略,SelfReminder和In-Context Defense为通用技术,Fin - Guard是融入金融安全约束的特定领域防御策略。


评估指标:借鉴前人研究,以攻击成功率(ASR)为主要评估指标,用Qwen3-32B作评估器,评分1-10分,1为完全拒绝,10为完全违规,仅10分算越狱成功,部分越狱分析见附录E。分层随机抽样人工审核,与Qwen3-32B判断一致性达93.6%,验证其可靠性。


结果


模型方面:不同LLM的鲁棒性差异大,脆弱性并非只取决于模型规模。Mistral最脆弱,LLaMA-3最抗攻击,源于严格安全对齐;XuanYuan因金融领域微调表现较好。Qwen2.5不同规模对比表明参数增加不能降低金融安全风险。


图片


攻击方法:迭代方法(PAIR、ReNeLLM)ASR高,能绕过防护;FlipAttack不稳定,受模型对指令处理方式影响。迭代策略越狱能力更稳健一致。


类别方面:金融犯罪比伦理违规的ASR高,虚假发票和资金挪用最易受攻击,因金融犯罪操作步骤易被模型学习。


语言方面:模型脆弱性有跨语言差异,不同模型对中文或英文提示更敏感,反映出安全机制跨语言对齐不一致,需多语言评估。


图片


进一步分析


闭源模型


为确立实际相关性,对GPT-5.1和DeepSeek-V3.2(685B)两前沿闭源模型评估,因计算开销大,每类别抽样25个实例并采用PAIR攻击。表3显示,两顶级模型有显著漏洞,DeepSeek-V3.2在金融犯罪平均ASR达89.45%,GPT-5.1为35.27%,且二者对伦理违规脆弱,表明先进模型仍易生成有害金融内容。


图片


防御效能分析


图4展示Qwen2.5和GLM - 4用中文数据时,三种防御策略(Self - Reminder、ICD、FinGuard)对三种攻击方法的防御表现。因初始ASR较高选这两个模型。


图片


防御在Qwen2.5上更有效,如Self-Reminder将Qwen2.5的ReNeLLM ASR从68.2%降至29.3%,Fin-Guard将其PAIR ASR从81.7%降至47.7%,推测因其指令遵循能力强。在GLM-4上防御效果有限,如Fin-Guard仅将PAIR ASR从90.1%降至72.2%。


所有策略对FlipAttack无效,提示仅靠提示级防御应对复杂或隐式金融攻击不足,需内部安全机制和多级防御。


不同判断方法的分析


为评估研究中评估协议的有效性和稳健性,对FlipAttack应用于Qwen2.5的子实验进行消融分析,将Judge-Main与JudgeDict、Judge-Rubric、JudgeHarm三个基线方法对比。


表4展示英语和中文数据中犯罪与伦理任务的ASR,各评判方法下ASR均高,表明安全结论稳健。计算Pearson相关系数发现,LLM类评判方法一致性高,Judge-Dict与其他方法相关性差,因关键词判断无法区分有效拒绝和含免责声明或离题内容,近期研究探索利用模型内部表征改善LLM评判与人类评判的一致性。


图片


三种越狱策略的比较研究


以市场操纵类别为案例,研究三种越狱策略如何绕过安全措施。PAIR和ReNeLLM通过语义改写、改变词序或风格生成语义等价变体,可破仅依赖表面模式或静态规则的检测系统;FlipAttack用可逆字符级变换和模型指令跟随行为混淆意图,绕过基于字符串匹配或关键词的防御。


金融安全失效模式案例研究


为研究大语言模型(LLMs)在金融安全任务中的安全漏洞,分析越狱技术操纵恶意金融输入以获取模型本应拒绝的回复的机制,识别出角色重构、术语替换、权威背书等多种操纵策略,这些策略利用金融术语和流程绕过内置防护,揭示了LLMs在实际金融场景中安全机制的系统性弱点。


限制


FIN SAFETY BENCH强调通过金融犯罪案例和职业道德标准体现真实性,但受计算资源和人力限制存在局限:数据集仅覆盖英、中文;模型辅助步骤虽经人工验证仍可能有生成偏差;实验聚焦部分大语言模型和越狱策略,或忽略新兴攻防技术。未来将扩大语言覆盖、纳入多模态、研究更多防御策略以增强鲁棒性和泛化性。


总结


本文介绍双语红队基准 FIN SAFETY BENCH,用于评估大语言模型对金融合规违规的拒绝能力。该基准基于真实金融犯罪案例和伦理违规场景,涵盖 14 类金融不当行为。评估通用和金融专业大语言模型在三种越狱攻击下的表现,发现特定攻击变体始终有效,模型在中文环境下更易受攻击,常见提示级防御对复杂或隐式对抗策略常失效,强调需多语言、细粒度安全评估和更强大的自适应防御机制。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询