AlphaForgeBench:面向稳定可复现的金融大语言模型新范式

研究动机
当下评估范式的不足
现有金融领域大语言模型(Large Language Models, LLMs)的评估范式普遍忽视了一个根本性问题:大语言模型在不确定性环境下的行为不稳定性。实证研究表明,即使在相同输入数据与配置条件下,模型多次运行所生成的交易轨迹差异巨大,关键绩效指标(如收益率、最大回撤)波动剧烈,严重影响评估结果的可信度与可复现性。
其核心问题体现在运行间性能差异、解码一致性缺失以及动作突变现象三个方面:
运行间性能差异显著:同一模型在相同金融数据输入(如包含 OHLCV 时序与技术指标的时间序列)下多次运行,生成的交易轨迹存在显著差异,导致最终收益率、夏普比率等关键绩效指标波动剧烈。
确定性解码下仍不一致:即便将温度参数设为 0(即贪婪解码,理论上应保证输出唯一性),模型仍会生成完全不同的动作序列。这一现象表明,模型的决策过程在逻辑上缺乏可复现性,其输出并非由输入唯一决定,而是受隐含状态或内部随机性干扰,暴露出其内在机制的不可控性。
动作突变现象普遍:模型在相邻时间步之间频繁出现“动作翻转”行为,例如在执行卖出指令后立即发出买入信号,或在持仓状态下突然转为清仓。此类行为在真实交易中极易引发高额交易成本(如手续费、滑点),并导致策略失效。
不稳定性根源的系统性归因
上述行为不稳定性并非偶然,而是由大语言模型底层架构的三大根本性缺陷共同导致:
- • 无状态自回归架构:大语言模型采用无状态的自回归生成机制,每一次动作输出均基于当前输入快照独立计算,缺乏对历史动作序列的记忆能力。这意味着模型无法将持仓视为需持续维护的长期状态,也无法建立连贯的交易策略。
- • 连续到离散映射敏感性:金融市场信号(如价格、成交量、技术指标)通常呈现连续变化,而模型输出动作(买入、卖出、持有)为离散类别。这种从连续空间到离散动作的映射过程极易放大微小波动的影响。模型缺乏容忍区间(tolerance intervals)与惯性机制,难以应对市场噪声,导致在指标出现轻微反转或语义变化时即发生立场突变,进一步加剧输出波动。
- • 分类任务本质局限:大语言模型在交易任务中本质上执行的是即时分类任务,即将当前市场状态映射为“最优动作”标签。这一设定忽略了长期收益最大化目标,未考虑交易成本(transaction fees)、滑点(slippage)、持仓约束等现实因素。模型对这些关键成本完全无感知,导致其决策逻辑与真实交易环境存在根本性脱节,易陷入“过激交易”或“完全静默”等极端行为模式。
AlphaForgeBench:从“黑”到“白”的范式转型

核心理念与角色重构
为应对传统评估范式中模型行为不可解释、结果不可复现的困境,我们提出 AlphaForgeBench,一个原则性更强的评估框架,旨在重构大语言模型在交易策略设计中的角色——从随机执行代理转变为具备系统性金融推理能力的量化研究员。这一范式转型的核心在于:不再要求模型直接输出离散的交易动作,而是将其任务设定为生成可执行的阿尔法因子与基于金融领域知识构建的交易策略代码。更多模型、提示词细节详见原文附录。
该转变实现了推理过程与执行机制的解耦,使模型的决策逻辑从“即兴动作生成”升级为“结构化策略构造”。在此框架下,模型需以自然语言理解为基础,将金融直觉形式化为明确的算法规则,并输出可被标准回测引擎执行的代码。这种设定不仅提升了评估的透明度,更赋予了整个流程可验证、可迭代与可审计的能力。
例如,在策略生成过程中,模型需定义关键的决策逻辑,例如基于动量因子的交易条件:
其中 表示第 期价格, 与 分别为历史均值与标准差, 为预设波动率阈值。该形式化表达体现了从自然语言到可执行逻辑的转化过程,是白箱范式的核心体现。
三大核心优势
完全确定性与可复现性
传统评估依赖模型直接输出离散动作,其结果受采样过程、随机种子、环境扰动等多重因素影响,导致性能指标具有高度随机性,难以准确反映模型的真实能力。而 AlphaForgeBench 通过聚焦因子生成与策略构建,将评估过程完全置于确定性框架中。
- • 评估过程不依赖随机执行:策略代码一旦生成,其回测结果由固定输入数据与确定性逻辑决定,避免了动作执行带来的随机性。
- • 输出可复现性高:相同输入下,模型生成的策略代码在不同运行中保持一致,确保实验结果可被独立验证。
- • 支持跨模型、跨版本对比:由于评估标准统一且无随机干扰,不同模型或同一模型在不同训练阶段的表现可进行公平比较。
贴近真实研究流程
AlphaForgeBench 的工作流设计与现实世界量化金融研究高度一致,完整模拟了从因子发现、策略设计到回测验证的全流程。
- • 因子发现阶段:模型需基于市场数据与金融理论,识别潜在的超额收益来源,如动量、反转、波动率等。
- • 策略设计阶段:模型将因子转化为可执行的交易规则,包括入场/出场条件、仓位管理、风控机制等。
- • 回测验证阶段:生成的策略代码由标准化回测引擎执行,输出绩效指标(如年化收益、夏普比率、最大回撤等)。
AlphaForgeBench 框架设计
数据集构建:双阶段融合策略
第一阶段:真实世界策略采集
AlphaForgeBench 的数据集构建始于对真实世界因子与策略的系统性采集。该阶段从五类互补来源中提取具有实际金融语义的因子-策略条目,包括券商研究报告、量化基金公开文档、学术论文、金融新闻分析以及交易平台社区讨论。这些来源共同构成了一个覆盖机构实践、学术研究与市场共识的多元知识体系,有效捕捉了真实量化研究中的复杂性与多样性。
为实现高效、结构化的信息提取,研究构建了基于 Gemini-3-Flash-Preview 的自动化信息提取代理,能够接收原始文档并输出标准化的记录,包含因子名称、数学定义、交易逻辑与金融合理性解释。经过去重与质量筛选后,第一阶段共构建出包含 3,176 个因子-策略条目 的基础数据集,涵盖三种典型交易类型:
- • 单资产交易(633 项)
- • 组合管理(2,172 项)
- • 多资产交易(371 项)
值得注意的是,为隔离大语言模型(LLM)在信号生成能力上的表现,避免组合构建过程带来的干扰,本研究在评估中仅采用 633 个单资产交易子集。该子集具有良好的可解释性与可比性,可作为衡量模型在基础因子驱动策略生成任务中能力的基准。
第二阶段:合成查询增强
尽管第一阶段提供的测试用例具备高度生态真实性,但其查询难度分布不均,且缺乏针对特定认知能力的系统性设计,难以支持对模型能力的精细化诊断。为此,第二阶段引入合成查询增强机制,基于第一阶段观察到的策略模式与复杂性特征,构建了一个 270 个结构化查询 的增强集,采用 3×3 难度等级分类体系,实现对模型能力的可控、细粒度评估。
该分类体系从两个维度对任务复杂度进行建模:
- • 三个层级(Level):对应不同层级的策略生成能力
- • 三个等级(Grade):通过条件数量、参数缺失程度与状态依赖控制流深度调节复杂度
具体层级定义如下:
- • Level 1(逻辑翻译):提供完整的 if–then 规则,测试模型将自然语言逻辑忠实映射为可执行代码的能力;
- • Level 2(逻辑补全):仅提供策略骨架,关键参数缺失,要求模型基于领域知识进行合理推断与补全;
- • Level 3(目标导向生成):仅给出高层次投资目标,要求模型从零开始完成端到端的策略设计。
评估流程:标准化“生成-回测”闭环
AlphaForgeBench 采用标准化的“生成-回测”闭环流程,确保评估过程的统一性、可复现性与科学性。该流程由三个关键阶段构成:提示构建、代码生成与回测执行,形成一个端到端的自动化评估链路。
- 1. 提示构建:
每个评估任务均被组织为一个结构化提示,包含三个语义独立的组成部分:该提示模板在所有被评估模型间保持完全一致,确保性能差异仅源于模型能力本身,而非提示工程偏差。此外,模型可自主生成新因子代码,由回测引擎动态注册,实现运行时特征空间扩展,赋予模型灵活性与创造性空间。
- • 系统指令:明确定义任务目标,说明可用数据模式(包括 OHLCV 列及预计算技术指标),并规定输出接口格式;
- • 策略查询:即自然语言描述的目标策略,来自第一阶段的真实世界条目或第二阶段的合成查询;
- • 因子库参考:列出所有支持指标的数学定义,提供无歧义的特征空间规范。
构建完成的提示通过各被评估大语言模型(LLM)的官方 API 发送至模型,启动代码生成过程。模型需返回一个自包含的 Python 函数
generate_signal,该函数接收包含 OHLCV 与技术指标的 DataFrame,并输出一个交易信号序列(如买入或持有现金)。函数签名、列名引用与输出格式均严格遵循回测引擎契约,支持全自动执行。所有生成的策略在统一确定性引擎中运行,覆盖七种资产,涵盖两个主要市场周期:
回测时间窗口为 2021–2026 年,刻意覆盖牛市、熊市、高波动与低波动阶段,确保评估结果不受单一市场风格主导。采用无摩擦执行机制,分离信号质量与外部因素(如交易成本、滑点)影响,从而更准确地评估模型生成信号的内在有效性。
- • 加密货币:BTCUSDT、ETHUSDT(数据来源:Binance)
- • 美国股票:AAPL、GOOGL、MSFT、NVDA、TSLA(数据来源:Yahoo Finance)
评估方法:多维度量化分析
AlphaForgeBench 采用多维度量化分析方法,从绝对性能与跨运行稳定性两个层面全面刻画模型能力,构建起策略质量的综合评估框架。其中跨运行稳定性评估的定义如下:
为评估模型输出的一致性与可复现性,采用多次独立运行协议(),计算绩效指标的方差与置信区间。该方法不仅关注“是否能生成有效策略”,更强调“能否稳定生成高质量策略”,从而全面刻画模型在金融逻辑合成任务中的综合能力。
具体执行协议如下:
- • 第一阶段在温度参数 下运行,共生成 个样本;
- • 第二阶段在 与 (贪婪解码)下进行温度消融实验,共生成 个样本;
- • 最终总生成策略实现数达 35,190 条,所有指标以均值 ± 标准差(mean ± std)形式报告。
实验结果与核心发现
整体模型对比分析
在多轮独立回测的基础上,对大型语言模型(Large Language Models, LLMs)生成的交易策略进行了系统性评估,结果揭示出清晰的性能分层、显著的收益-风险倒置现象,以及具有高度统计可靠性的模型差异。

- • 性能分层清晰:
模型在综合性能上呈现出三个明确梯队。领先梯队由 Gemini-3-Pro-Preview 构成,其在年化收益率(ARR)与夏普比率(Sharpe Ratio)上均处于绝对领先地位,展现出卓越的收益生成能力。中等梯队包括 Gemini-3-Flash-Preview 与 Claude Sonnet 4.5,二者在稳定性与风险调整收益方面表现均衡,具备良好的实用价值。落后梯队则由 GPT-5.2、DeepSeek-V3.2 与 Grok-4.1-Fast 组成,尽管在部分任务中表现尚可,但整体收益水平显著偏低。值得注意的是,最优模型与最差模型之间在五年周期内实现的年化收益率差距达 7.8%,相当于累计相对提升约 47%,具有显著的经济意义。 - • 收益-风险倒置现象显著:
模型间收益表现与风险暴露呈现出显著的负相关关系,揭示出不同模型在策略生成中隐含了截然不同的风险偏好。Gemini-3-Pro-Preview 在追求最高收益的同时,伴随最高的最大回撤(MDD)与波动率(VOL),体现出典型的激进型策略特征;而 GPT-5.2 则以最低的回撤与波动率著称,虽在风险控制方面表现优异,但其年化收益率却处于最低水平,呈现保守型策略特征。这一现象表明,单一指标(如仅看夏普比率或年化收益)无法全面刻画模型行为,必须结合多维度评估才能准确识别其内在特性。 - • 性能差异具有统计可靠性:
所有性能指标均基于五次独立运行的均值 ± 标准差报告,以量化生成过程中的随机性。分析显示,同一查询内部的运行间方差比跨查询间的方差小一个数量级,说明模型间的排名差异并非由随机波动所致,而是反映了稳定、可复现的内在能力差异。这一发现为后续的模型对比与分类提供了坚实的统计基础。
跨资产与跨难度的稳健性验证
通过在七种不同资产上进行评估,验证了模型性能在跨市场环境下的稳健性,并揭示了任务难度对模型能力差异的放大效应。
- • 资产难度梯度一致:
不同资产呈现出系统性的难度递进关系。趋势性强的美国大盘股(如 AAPL、GOOGL)对所有模型而言均为最易处理目标,因其价格走势清晰、可预测性高。加密货币(如 BTCUSDT、ETHUSDT)因高波动性与全天候运行特性,难度显著提升,成为最具挑战性的市场环境。MSFT 与 NVDA 则因交易区间窄或市场状态频繁切换,构成最具挑战性的权益资产。尤其值得注意的是,TSLA 在实现最高绝对收益的同时,也展现出最宽的跨模型方差,说明其市场动态对策略逻辑的敏感性极高,有效放大了模型间的差异。 - • 模型排名高度稳定:
在全部七种资产上,模型的相对排序保持高度一致。以收益为导向的领先模型(如 Gemini-3-Pro-Preview)在加密市场与美国股市中均维持领先;以风险控制为导向的模型(如 GPT-5.2)在各类资产中始终处于末位。这一跨资产稳定性强烈表明,各模型所隐含的风险偏好是其策略生成机制的内在特征,而非特定市场环境的偶然产物,具备环境无关性(environment-agnostic)。 - • 难度递进有效放大差异:
通过引入 3×3 难度分类体系,系统性地验证了任务难度对模型能力差异的放大作用: - • Level 1(逻辑翻译能力):夏普比率分布范围仅为 0.029,表明模型在将完整规则精准转化为代码方面已接近饱和,能力差异极小。
- • Level 2(参数推断能力):分布范围扩大至 Level 1 的 8 倍,反映出模型在补全缺失参数、嵌入金融知识方面存在显著差距。
- • Level 3(目标导向生成):分布范围进一步扩大至 Level 1 的 14 倍,且出现明显交叉现象——部分模型(如 DeepSeek-V3.2)在简单任务中领先,但在开放性任务中急剧下滑;而 Gemini-3-Pro-Preview 则持续提升,凸显其在复杂推理中的优势。这一结果验证了该分类体系作为诊断工具的有效性,能够精准识别模型在不同认知层级上的真实能力。
模型行为模式的三类识别
基于多轮运行稳定性、难度适应曲线与最优收益表现的综合分析,可归纳出三类具有代表性的行为模式,揭示了模型在策略生成机制上的根本差异。

- 1. 进攻型-创造性(Gemini-3-Pro-Preview)
- • 该模型在从 Level 1 到 Level 3 的过程中,策略收益(SR)持续上升,表明其在高自由度任务中具备强大的开放式策略设计能力。
- • 然而,其置信区间最宽,最大回撤(MDD)与波动率(VOL)均为所有模型中最高,反映出在追求创新与高收益的同时,承担了显著的不确定性与风险。
- • 这种“高风险、高回报”的特征,使其成为适用于激进型投资策略的候选模型,但对风险容忍度要求较高。
- • 二者在运行间表现出最窄的置信带,策略生成高度一致,稳定性极强。
- • 在难度递增过程中,性能衰减最为平缓,展现出优异的鲁棒性与适应性。
- • Claude Sonnet 4.5 在 Calmar 比率(CR = 1.650)上表现最优,体现了最佳的风险调整后收益能力;
- • Gemini-3-Flash-Preview 则在性能与成本之间取得良好平衡,具备高性价比,适合对稳定性与效率有要求的实际部署场景。
- • 这类模型普遍采用低风险逻辑,表现为最低的回撤与波动率,但在面对复杂任务时表现严重退化。
- • 在 Level 3 任务中,其性能急剧下滑,体现出严重的适应性退化,无法有效应对开放性与不确定性环境。
- • 其中,Grok-4.1-Fast 不仅性能衰减最剧烈,且运行间方差最大,是本测试中预测性最差的模型,反映出其生成策略对随机性高度敏感。
- • DeepSeek-V3.2 虽在 Level 1 表现领先,但在 Level 3 跌至末位,说明其能力局限于规则清晰的翻译任务,缺乏深层推理能力。
关键结论
温度不变性验证:在 与 两种温度设置下,所有模型在各项指标上的表现几乎完全一致。这一现象表明,代码生成范式对随机性具有高度鲁棒性——温度参数仅影响代码生成阶段的表面形式,而不改变其核心交易逻辑。由于后续回测执行过程具有确定性,模型行为在生成后保持稳定,与直接交易基准形成鲜明对比:后者因每一步决策受温度影响,运行间方差常超过模型间方差,导致策略行为波动剧烈。
系统性难度递进:模型间策略收益(SR)的分布范围随任务难度层级呈现单调扩大趋势。
认知能力解耦现象:分析发现,代码翻译能力(Level 1)与开放式策略设计能力(Level 3)由截然不同的技能驱动,表现出显著的认知能力解耦。该发现提示我们,模型的“通用智能”并非整体一致,而是由多个独立能力模块构成,评估体系必须具备解耦分析能力以准确捕捉其真实能力谱系。
模型行为模式稳定:在多轮实验、七种资产类别及不同温度参数下,共识别出三类具有内在一致性的风险行为模式:激进-创造性、平衡-稳定性 与 保守-僵化。这些模式在不同实验阶段和市场环境中均保持稳定,表明其并非由外部环境或随机噪声驱动,而是嵌入在模型自身生成机制中的根本属性。
跨资产泛化能力优异:无论面对高波动性资产、趋势性资产或窄幅震荡资产,模型的相对表现均保持稳定。在加密市场与美股市场中,模型排名与资产难度梯度高度一致,表明该评估体系具备良好的跨资产泛化能力。