CNFinBench:金融领域LLM能力、合规、安全评估基准
“CNFINBENCH: A BENCHMARK FOR SAFETY AND COMPLIANCE OF LARGE LANGUAGE MODELS IN FINANCE”
LLMs在金融领域应用广泛,但集成到高风险环境会带来安全与合规问题,监管将相关AI系统列为高风险技术,目前对其安全、合规和推理完整性的系统评估有限。
本文提出CNFinBench,首个集成能力-合规-安全三元组的金融LLM基准,首创多轮对抗咨询用于安全评估,并引入强大评估框架,结合特定领域指标和三个LLM进行高风险合规评估。

【 扫描文末二维码加入星球获取论文 】
摘要
摘要大语言模型在金融领域应用广泛,严格安全评估至关重要,但现有金融基准存在不足,未评估模型现实安全行为。为此引入 CNFinBench 基准,采用金融定制红队对话,围绕能力 - 合规 - 安全三元组构建,含长报告推理和合规任务。引入有害指令合规分数(HICS)量化安全,采用严格输出格式和混合评估确保可审计性。对 21 个模型 15 个子任务的实验显示存在能力 - 合规差距,多轮对抗对话测试中多数系统仅部分抵抗,拒绝不等于安全。文中含合成有害金融提示示例用于研究。
简介
LLMs在金融领域应用广泛,但集成到高风险环境会带来安全与合规问题,监管将相关AI系统列为高风险技术,目前对其安全、合规和推理完整性的系统评估有限。现有金融基准与金融安全和合规审计现实脱节,存在评估场景单一、方法局限等问题,无法满足高风险金融场景需求。
为解决上述问题,推出CNFinBench金融基准,围绕能力 - 合规 - 安全三元组设15个子任务。安全任务采用多轮对抗咨询模拟合规风险,提出有害指令合规得分(HICS)量化模型抵抗能力,采用双方法框架确保评估有效性和可审计性。
CNFinBench贡献在于:
首个集成能力 - 合规 - 安全三元组的金融LLM基准;
首创多轮对抗咨询用于安全评估;
引入强大评估框架,结合特定领域指标和三个LLM进行高风险合规评估。
相关工作
金融能力和推理基准
金融研究界逐步开发专业基准,早期关注金融文本基础知识理解与信息提取,如FiQA、FinQA实现从纯文本理解到综合问答的转变;后拓展至复杂交互任务,如TAT - QA、ConvFinQA、DocFinQA;近期出现综合评估基准,如FinEval、FinBen、CFBenchmark,但主要衡量模型知识与推理能力,未充分评估安全合规行为。为此提出CNFinBench,整合能力、合规、安全三要素,采用多轮对抗咨询测试持续操纵下的合规衰减。
通用LLM安全性和合规性评估
大语言模型广泛部署推动其对齐与安全研究。OpenAI Evals等建立评估基础方法,早期安全基准多为客观二元判断,如SafetyBench、JailbreakBench,但局限于单轮交互。ALERT、AIR - BENCH 2024引入更细致评估,不过是通用型,未涉及金融合规要求。为此提出有害指令合规得分(HICS),用于评估模型多轮对话持续抵抗能力,明确惩罚信息泄露、奖励合规推理。
CNFinBench:大型语言模型金融基准数据库

如何定义金融任务
安全
安全维度评估大语言模型面对对抗或操纵性输入时能否保持监管与道德操守,金融安全指模型履行信托责任、避免误导输出、尊重隐私、遵守合规约束,定义基于国际监管框架。
现实金融咨询中,不良行为如偏误建议、隐私泄露常通过迭代劝说渐显,用户会重述软化请求以突破合规边界。CNFinBench 引入多轮对抗性咨询,从良性过渡到风险情境,评估模型能否多轮拒绝有害请求,及能否提供有法规依据的推理来支撑拒绝理由。
合规和风险控制
CRC维度评估大语言模型在现实决策场景中识别、解读和遵守金融法规、信托责任及风险管理原则的能力,任务设计参考多个国际认可的监管框架。CNFinBench通过基于案例的情景模拟现实咨询、营销和披露困境,要求模型依据公共监管问答和政策文件做出可审计的合规决策,识别违规行为并引用相关规则或原则说明结论,确保基于规则的可验证推理。
能力
能力维度评估大语言模型(LLMs)的金融推理与分析能力,是评估其能否支持金融工作流合规与安全行为的基础,强调基于证据的分析和上下文感知的解释。通过文献综述和专家评估构建分层分类法,将能力分为金融专业问答、商业理解与分析、事实推理与计算三类,各子任务经210位领域专家验证,确保覆盖真实决策场景。

构建基准数据集
数据收集
数据集构建:按任务定义原则构建大规模、类别平衡的数据集,通过人机合成管道整合多源数据,确保任务多样与金融真实。
安全:用结构化对抗评估框架测试模型对有害或违规提示的鲁棒性,由标注员设计违规关键词和模板,用GPT - 4o合成实例并经多阶段人工审核,实施九种越狱策略评估模型弹性。

合规与风险控制:通过场景评估模型对信托和监管原则的遵循情况,构建全面的合规风险题库,将公开监管问答和政策改写为案例,每个实例含黄金标签,评估五种风险类型。

能力:通过分层任务框架评估金融现实场景中的推理、分析和计算能力。
金融专业问答:与专家合作设计任务梯度,构建涵盖多方面的平衡题库,从认证考试库等收集种子项并拓展至各资格子领域。
商业理解与分析:包含多种推理模式,如从金融语料提取信息、对A股年报和季报进行文档问答、阅读行业报告做研究分析。
事实推理与计算:聚焦数值精度,通过生成任务实现,答案关联证据和计算器以确保可验证性、减少幻觉。
数据细化
迭代筛选:用Qwen3、DeepSeek - R1、GPT - 4o、Gemini - 2.5多模型对问题并行采样评估,各模型每题两次独立尝试,正确解答的排除;金融专家审核剩余问题,确保有挑战性和意义。
专家-AI协作验证:建立AI与领域专家协作机制确保准确。DeepSeek - R1多轮采样投票,八次无共识的因模糊或不明确排除;金融专家最终审核,有信息缺失、歧义或逻辑问题的排除。
数据统计
CNFinBench含13000多个单轮实例,涵盖14个子任务,分能力、合规与风控、安全三个维度。能力任务有金融知识问答等;合规与风控任务包括监管审计等;安全任务聚焦内、应用级安全。还构建100个平均4轮的多轮对话。约70%数据由大模型生成后经专家完善,30%人工编写,所有提示经21位金融反欺诈专家反复调试和多阶段人工审核。
实验
实验设置
在全量CNFinBench上评估所有模型,固定推理设置(温度0.7、最大生成长度512 tokens、有效上下文窗口2048 tokens),模型纯文本生成无工具或外部检索,每个示例运行三次并报告均值标准差,其他解码参数不变。用供应商API和本地部署检查点生成模型响应,在NVIDIA H200 GPU上计算。
模型
评估开源和专有模型,含通用和领域专用大语言模型。通用模型有 GPT、Gemini、Claude-Sonnet-4、Llama、Qwen、DeepSeek V3、GLM-4.5、Intern-S1、MiniMax M1、Doubao-1.5-pro32k、Kimi-K2-Instruct 等;金融调优模型包括 Fin-R1、ICE-INTERN-full-7B、FinGPT-MT Llama38B LoRA、TouchstoneGPT-7B-Instruct、tigerbot-70b-base-v2。
评估
基于评分标准和人工评估:为评估LLM - 法官协议可靠性,对CNFinBench的三个任务类别随机抽取20%实例,由25位金融专家按与LLM法官相同准则用15分制打分,LLM法官按特定提示评估,计算其与人类评估者的一致性,结果显示LLM法官与人类评估者一致性高,可作专家评估的可扩展替代,但模糊或边界情况仍需人工校准。

特定任务评估:摒弃整体评估,针对不同任务类型定制评估方法。客观题要求模型严格按指令输出选项标签,采用动态选项扰动机制防位置偏见;开放式任务用3 - 模型评估系统按预定义规则和详细评分标准打分,确保评估一致性和领域适用性。
指标
客观选择题与领域特定问答按准确率评分,信息提取任务用微 F1 评分。采用 GPT-4o、Gemini-2.5-Pro 及 Qwen3-235B-A22B 或 DeepSeek-V3 组成三 LLM 评估小组,减少判断偏差、提高稳定性,法官选择避免与测试系统重叠且风格多样。
金融报告解析和金融文本生成等任务由三 LLM 法官集合按正确性、专业性、合规性和安全性评分,最终分数为三法官加权平均。为减少随机方差,每个输入评估三次,结果以均值 ± 标准差报告。
结果
表格3和4呈现21个模型在14个子任务的评估结果,分客观指标和LLM-Judge评估两框架。LLM-Judge框架下,安全任务平均得分76.2居首,能力66.4,合规34.4最低。GPT-5总体表现最佳,Fingpt-mt llama3-8b lora最差。各任务类别中,Qwen3-32B在能力任务领先,DeepSeek-V3在合规任务出色,GPT-5在安全任务表现优。各子任务有不同领先模型,结构化任务表现优于自由生成任务。


图4和表10展示多轮对抗评估结果,仅GPT-5等3个模型成功防御,多数处于部分成功/轻微失败,部分模型得分40 - 59.9,存在信息泄露问题,通用和金融模型均有漏洞。


特定领域金融模型整体表现差,易处理不当非合规请求,能力评估也欠佳,可能因微调时安全数据优化不足。
总结
本文介绍CNFinBench金融大语言模型安全与合规基准,涵盖九类越狱和提示注入,采用动态选项扰动和三重重试协议,有细粒度评分方案。任务基于投资者保护等原则,分安全、合规与风控、能力三个领域。评估用三个不同模型家族的大语言模型组成的评判集合,专家交叉验证一致性高。模拟高风险多轮对话场景,结果显示能力与合规存在差距,高拒绝率不等于高安全,安全系统需提供可审计的合规理由。发布任务、攻击模板等,强调大语言模型不仅要准确,更要可验证合规和可审计。

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。