FINSAFETYBENCH:真实金融场景大模型攻防安全评估基准
“FINSAFETYBENCH: Evaluating LLM Safety in Real-World Financial Scenarios”

【 扫描文末二维码加入星球获取论文,源码 】
摘要
大语言模型(LLMs)用于金融场景有合规风险,为系统评估其金融安全性,提出双语红队基准 FIN SAFETY BENCH,涵盖 14 个子类别。实验发现通用和金融专业 LLMs 存在关键漏洞,中文语境下更易受攻击,提示级防御对复杂或隐式策略有限。文中含违规金融场景提示。
简介
近期大语言模型(LLMs)在金融文本理解与生成方面能力强,适用于投资决策、金融推理、市场分析等金融应用。但监管者和政策制定者担忧其被滥用,如隐瞒会计欺诈、操纵财报、伪造交易,且模型易受错误信息和对抗性操纵影响,损害市场诚信、金融稳定和投资者信任。因此,系统评估LLMs在金融领域的安全性是紧迫研究任务。
现有金融基准主要针对知识问答和复杂推理,忽略大语言模型在金融领域的不当使用风险,通用安全合规基准聚焦粗粒度伦理类别,部分研究依赖大语言模型合成数据,存在冗余和数据有效性问题。
本文提出双语金融红队基准 FIN SAFETY BENCH,优势在于:聚焦具体违规场景,反映现实;源于真实案例,减少重复和模型依赖;细粒度系统分类;支持多语言。用该基准评估主流开源模型,发现部分攻击变体成功率高,模型在中文数据上更易受攻击,常见提示级防御对复杂攻击有局限。
相关工作
金融基准测试
现有金融基准主要评估知识问答和推理,正朝更高复杂度、更广覆盖和综合指标发展,但金融安全探索不足。如FinEval重领域知识,SuperCLUE-Fin和CFinBench针对监管背景,OpenFinData和Cupace数据集存在数据不透明问题。为填补此空白,引入FIN SAFETY BENCH评估金融安全,揭示越狱场景下的鲁棒性漏洞。

大模型安全
越狱技术已从手动转向自动,如梯度优化对抗后缀注入等,绕过大语言模型(LLM)安全防护,加剧鲁棒性和伦理对齐风险,尤其在参数高效微调部署时。为此,出现综合安全评估框架及通用基准,如JailbreakBench、SORRY-Bench等,还有针对中文语境的评估基准。但金融领域细粒度评估稀缺,TRIDENT虽基于CFA伦理准则,但案例多样性不足,而FIN SAFETY BENCH源于真实案例,覆盖更广、模拟更真实。
FIN SAFETY BENCH
概览
FIN SAFETY BENCH 收集真实金融 misconduct 案例,经 LLM 过滤改写为有害指令。数据集含 1201 个自有案例和 680 个外部样本,共 1881 个双语对齐实例,后续将介绍类别和数据构建流程。

问题分类
为实现综合评估,定义包含严重金融犯罪和金融伦理违规的两级分类法。
金融犯罪:指金融行业内造成严重社会危害、重大经济损失且可能被刑事起诉的非法活动,涵盖市场操纵、贿赂等11种代表性类型。
金融伦理违规:指金融从业者违反公认道德标准或公司规定的行为,虽危害相对较轻,但仍会损害客户、雇主利益及市场诚信,包括损害客户利益、损害雇主利益和缺乏独立性与客观性3种类型。

数据集构建
数据来源和选择标准
收集金融犯罪相关原始材料的三个渠道:
金融司法和法律案件材料:手动收集公开的金融犯罪司法判决和法律文件,用于学术研究。
公开模拟考试:收集公开的CFA模拟考题,整理改编以避免版权问题。
公开红队数据集:从TRIDENT、HarmfulQA和HExPHI中提取金融示例,筛选符合标准的大语言模型拒绝实例。
数据处理
受LLM辅助人类标注研究启发,设计将现实金融案例转化为金融违规场景的处理流程,含五阶段,旨在保留真实性并引发LLM拒绝行为。
提取与总结:用开源工具从PDF文档提取文本,用Qwen3 - 32B提取司法案例犯罪模式和法律条款;将CFA案例问题与答案组合成种子实例,用Qwen3 - 32B分类标注,人工验证后作后续种子数据。
可控改写与有害性验证:用Deepseek - V3将种子转为中文指令式查询,用Qwen2.5 - 32B - Instruct生成参考响应,保留能使模型明确拒绝的查询。
公共数据集选择与整合:筛选公开数据集,将金融实例纳入FIN SAFETY - BENCH,整合前对外部样本进行有害性验证和分类。
双语对齐:用Qwen3 - 32B生成初始翻译,人工验证确保中英语义等效。
去重与数据集组装:用MinHash - based LSH去重,保留最具代表性实例,最终基准数据含有害指令、类别、语言标签和来源标签。
数据质量
为确保 FIN SAFETY BENCH 可靠性,邀请金融专业研究生执行多阶段验证方法:
验证司法案例和 CFA 模拟题确保源数据准确;
人工审核 Qwen3 - 32B 中间摘要,减少大语言模型幻觉或偏差;
对 DeepSeek - V3 改写的红队指令及公共数据集内容验证,确保中英文版本有害且分类正确。
实验
实验设置
评估模型:在FIN SAFETY BENCH上评估六个目标模型,包括五个通用大语言模型(LLaMA3、InternLM3、GLM-4、Mistral、Qwen2.5)和一个金融特定模型(XuanYuan),分析模型规模和领域专长对金融领域越狱攻击鲁棒性的影响,通用模型基线ASR近零,XuanYuan固有脆弱性更高。
越狱和防御的实现细节:进行越狱实验,采用PAIR、ReNeLLM、FlipAttack三种攻击方法;评估三种轻量级防御策略,SelfReminder和In-Context Defense为通用技术,Fin - Guard是融入金融安全约束的特定领域防御策略。
评估指标:借鉴前人研究,以攻击成功率(ASR)为主要评估指标,用Qwen3-32B作评估器,评分1-10分,1为完全拒绝,10为完全违规,仅10分算越狱成功,部分越狱分析见附录E。分层随机抽样人工审核,与Qwen3-32B判断一致性达93.6%,验证其可靠性。
结果
模型方面:不同LLM的鲁棒性差异大,脆弱性并非只取决于模型规模。Mistral最脆弱,LLaMA-3最抗攻击,源于严格安全对齐;XuanYuan因金融领域微调表现较好。Qwen2.5不同规模对比表明参数增加不能降低金融安全风险。

攻击方法:迭代方法(PAIR、ReNeLLM)ASR高,能绕过防护;FlipAttack不稳定,受模型对指令处理方式影响。迭代策略越狱能力更稳健一致。
类别方面:金融犯罪比伦理违规的ASR高,虚假发票和资金挪用最易受攻击,因金融犯罪操作步骤易被模型学习。
语言方面:模型脆弱性有跨语言差异,不同模型对中文或英文提示更敏感,反映出安全机制跨语言对齐不一致,需多语言评估。

进一步分析
闭源模型
为确立实际相关性,对GPT-5.1和DeepSeek-V3.2(685B)两前沿闭源模型评估,因计算开销大,每类别抽样25个实例并采用PAIR攻击。表3显示,两顶级模型有显著漏洞,DeepSeek-V3.2在金融犯罪平均ASR达89.45%,GPT-5.1为35.27%,且二者对伦理违规脆弱,表明先进模型仍易生成有害金融内容。

防御效能分析
图4展示Qwen2.5和GLM - 4用中文数据时,三种防御策略(Self - Reminder、ICD、FinGuard)对三种攻击方法的防御表现。因初始ASR较高选这两个模型。

防御在Qwen2.5上更有效,如Self-Reminder将Qwen2.5的ReNeLLM ASR从68.2%降至29.3%,Fin-Guard将其PAIR ASR从81.7%降至47.7%,推测因其指令遵循能力强。在GLM-4上防御效果有限,如Fin-Guard仅将PAIR ASR从90.1%降至72.2%。
所有策略对FlipAttack无效,提示仅靠提示级防御应对复杂或隐式金融攻击不足,需内部安全机制和多级防御。
不同判断方法的分析
为评估研究中评估协议的有效性和稳健性,对FlipAttack应用于Qwen2.5的子实验进行消融分析,将Judge-Main与JudgeDict、Judge-Rubric、JudgeHarm三个基线方法对比。
表4展示英语和中文数据中犯罪与伦理任务的ASR,各评判方法下ASR均高,表明安全结论稳健。计算Pearson相关系数发现,LLM类评判方法一致性高,Judge-Dict与其他方法相关性差,因关键词判断无法区分有效拒绝和含免责声明或离题内容,近期研究探索利用模型内部表征改善LLM评判与人类评判的一致性。

三种越狱策略的比较研究
以市场操纵类别为案例,研究三种越狱策略如何绕过安全措施。PAIR和ReNeLLM通过语义改写、改变词序或风格生成语义等价变体,可破仅依赖表面模式或静态规则的检测系统;FlipAttack用可逆字符级变换和模型指令跟随行为混淆意图,绕过基于字符串匹配或关键词的防御。
金融安全失效模式案例研究
为研究大语言模型(LLMs)在金融安全任务中的安全漏洞,分析越狱技术操纵恶意金融输入以获取模型本应拒绝的回复的机制,识别出角色重构、术语替换、权威背书等多种操纵策略,这些策略利用金融术语和流程绕过内置防护,揭示了LLMs在实际金融场景中安全机制的系统性弱点。
限制
FIN SAFETY BENCH强调通过金融犯罪案例和职业道德标准体现真实性,但受计算资源和人力限制存在局限:数据集仅覆盖英、中文;模型辅助步骤虽经人工验证仍可能有生成偏差;实验聚焦部分大语言模型和越狱策略,或忽略新兴攻防技术。未来将扩大语言覆盖、纳入多模态、研究更多防御策略以增强鲁棒性和泛化性。
总结
本文介绍双语红队基准 FIN SAFETY BENCH,用于评估大语言模型对金融合规违规的拒绝能力。该基准基于真实金融犯罪案例和伦理违规场景,涵盖 14 类金融不当行为。评估通用和金融专业大语言模型在三种越狱攻击下的表现,发现特定攻击变体始终有效,模型在中文环境下更易受攻击,常见提示级防御对复杂或隐式对抗策略常失效,强调需多语言、细粒度安全评估和更强大的自适应防御机制。

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。