AlphaPROBE:基于DAG和贝叶斯检索的Alpha因子挖掘

“AlphaPROBE: Alpha Mining via Principled Retrieval and On-graph Biased Evolution”


从嘈杂高维市场数据提取预测信号是量化金融的基本挑战,主要方法是Alpha因子挖掘,目标是构建多元因子组合。现有自动挖掘Alpha因子的解耦因子生成和迭代因子进化范式缺乏全局结构视角,导致冗余搜索和多样性有限。


本文提出AlphaPROBE框架,将Alpha挖掘重构为有向无环图(DAG)的战略导航,通过贝叶斯因子检索器和DAG感知因子生成器组成的闭环系统,实现高效且有结构信息的因子搜索。


在三大中国股市实验表明,AlphaPROBE预测未来股票收益能力优,IC、RIC、AR最高。对市场制度变化稳定性强,ICIR、RICIR、SR更高,MDD更低。


图片


【 扫描文末二维码加入星球获取论文,源码 】


摘要


量化金融中,现有自动挖掘Alpha因子的解耦因子生成和迭代因子进化范式缺乏全局结构视角,导致冗余搜索和多样性有限。为此提出 AlphaPROBE 框架,将Alpha挖掘重构为有向无环图(DAG)的战略导航,把因子池视为动态互联生态系统。该框架含贝叶斯因子检索器和 DAG 感知因子生成器两个核心组件。在三大中国股市数据集上与 8 个竞争基线的对比实验表明,AlphaPROBE 在预测准确性、收益稳定性和训练效率上表现显著提升,证实利用全局进化拓扑对高效稳健的自动Alpha发现至关重要。


简介


从嘈杂高维市场数据提取预测信号是量化金融的基本挑战,主要方法是Alpha因子挖掘,目标是构建多元因子组合,近年出现自动化发现方法。


自动化方法有两种范式:解耦因子生成(DFG)独立生成因子,因子关系弱;迭代因子进化(IFE)优化现有因子,但二者均缺乏全局结构视角,忽视因子拓扑关系。


本文引入AlphaPROBE框架,将Alpha挖掘重构为有向无环图(DAG)的战略导航,通过贝叶斯因子检索器和DAG感知因子生成器组成的闭环系统,实现高效且有结构信息的因子搜索。


贝叶斯因子检索器解决父因子选择的探索-利用权衡问题,评估因子潜力,确定下一代因子种子。DAG感知因子生成器基于大语言模型(LLM),利用生成轨迹避免冗余突变,生成新因子并融入DAG完成进化循环。


研究对AlphaPROBE在三大中国股市数据集上开展广泛实验,与8个竞争基线对比,结果显示其在预测准确性和回报稳定性上更优,还进行消融、参数敏感性分析和案例研究,证明利用进化结构进行自动因子发现更优。


本文主要贡献:

  • 引入将Alpha因子进化建模为有向无环图(DAG)的AlphaPROBE框架,捕捉全局关系,便于在海量因子搜索空间中策略性导航。

  • 开发含贝叶斯因子检索器和DAG感知因子生成器的闭环发现系统,检索器平衡质量与多样性确定高潜力种子,生成器利用祖先谱系产生新颖因子优化。

  • 在三大股票数据集上验证AlphaPROBE,对比8个SOTA基线,实验表明其显著提升预测性能、回报稳定性和训练效率,构建出更稳健、层次化的因子库。


背景


交易中,因子是从多数据源得出的预测信号,输入数据含价格 - 成交量特征、基本面数据和另类数据,Alpha因子将数据转化为单一分数,常以表达式树表示。


图片


Alpha挖掘目标是从巨大搜索空间 F 中找出最优因子集 A,将其形式化为最大化投资组合效用函数 J(A) 的问题,J 代表特定金融目标,如夏普比率、信息系数与惩罚项组合等,由此催生多种自动化发现方法。


图片


相关工作


解耦因子生成(DFG)


第一范式解耦因子生成(DFG)专注独立创建因子,用强化学习、图神经网络或生成模型从大搜索空间采样,还探索通过生成流网络或多分布学习增强样本多样性,模型在共享数据上训练可隐式共享知识,但生成过程孤立,因子关系弱。DFG 虽便于广泛探索,但非结构化方法限制系统积累知识,需迭代改进方法,由此引出第二范式。


迭代因子进化(IFE)


IFE 范式将因子发现视为持续优化过程,早期用遗传编程,近期用大语言模型(LLMs)提供改进反馈,现代代理借助回测结果提示LLMs修改公式,部分框架用多智能体系统或蒙特卡洛树搜索引导局部搜索。当前IFE方法局限在于缺乏全局视角,专注单亲子对或线性链,忽略因子池整体进化网络,缺选种子的原则机制,导致发现过程重复或陷入局部最优。AlphaPROBE将因子池组织成有向无环图(DAG)以实现全局和战略导航。


方法


将Alpha因子挖掘问题重构为有向无环图(DAG)上的战略导航与创建过程,优化问题分两方面:


战略检索:在图中找最优父因子以最大化未创建子因子的预期质量。


图片


目标生成:利用所选父因子在图中的上下文信息生成高质量新子因子。


图片


AlphaPROBE是解决上述双问题的闭环系统,含贝叶斯因子检索器和DAG感知因子生成器。


图片


贝叶斯因子检索器


为有效选择父因子,需能推理因子演化过程多级结构信息的框架。受贝叶斯建模启发,提出整合多源证据的方法。检索器任务是识别优化潜力最大的父因子,此选择问题置于贝叶斯框架,平衡因子个体价值与对拓扑结构因子池的贡献。通过计算因子产生高价值后代的概率对因子排序,其中先验项反映因子内在潜力,似然项评估新后代对因子池生态系统的价值,证据项为常数。


图片


先验:权衡质量与过度优化风险


先验概率 P(F new) 近似于其父因子 F 的质量,但仅高性能的 F 可能有误导性,因长优化链或频繁用于生成的因子可能收益递减。


定义候选父因子 F 的先验分数 P(F),涉及因子风险调整后的性能 Qual(F) 及归一化处理,还考虑图 G 中因子 F 的深度 depth(F) 和检索次数 k(F)。


图片


质量得分受两个拓扑惩罚项调节:深度惩罚项权衡深度优化因子的可信度与过拟合风险,由超参数 γ 平衡;检索惩罚项权衡利用已知成功父因子与探索搜索空间其他区域的需求,由超参数 ω 平衡。


似然:评估对集体的贡献


似然项 图片 作用:评估新因子对集体池质量的提升,估计策略依其父因子是否有成功后代而定。


因子类型:

  • 叶因子:未产生成功后代,通过衡量自身与因子池在价值、语义和语法三方面的多样性来估计 图片。


图片


图片


图片


图片


  • 非叶因子:有成功后代,通过过去的成功进行更可靠预测,其中 S_{BPa} © 考虑了子因子的稀疏性,包括父子稀疏性和子间稀疏性。


图片


图片


图片


图片


后续流程:计算各因子总分,对叶节点和非叶节点分别排名,选全局前 k 个候选因子传给因子生成器。


DAG感知因子生成器


因子生成器任务:当检索器选好父因子 F_p 后,以三阶段、DAG 感知工作流生成新颖有效的子因子。


分析师代理利用父因子进化路径 T(F p) 制定修改策略集 {S}。


图片


执行代理将抽象策略 Si 转化为具体候选因子表达式 F c,i。


图片


验证器代理检查候选表达式的语法正确性和约束合规性,过滤无效表达式。新验证的因子集 {F c} 加入有向无环图(DAG),完成进化循环。


动态因子积分器


采用 AlphaForge(Shi 等,2025a)方法动态重选近期有效因子,集成到“Mega”因子 图片 用于构建投资组合。


实验


实验设置


评估指标:依前人研究,采用两类指标评估模型,预测能力指标(IC、ICIR等)基于20日远期回报计算,投资组合构建指标含AR、MDD、SR,定义和回测设置见附录A.1.1。


数据集:按前人做法,在沪深300、中证500、中证1000三个A股股票池实验,训练/验证/测试集时间为2010 - 2020年/2021 - 2022年中/2022年中 - 2025年中。


基线模型:将AlphaPROBE与多类基线对比,包括专家收集因子池Alpha158、DFG方法(AlphaGen等)、IFE方法(GP等)。


实现细节:用Deepseek V3.1作为AlphaPROBE和两个基于大语言模型基线的骨干模型。用Qwen 3 Embedding - 4B作为公式8中的嵌入模型。公式5以训练期因子ICIR绝对值作质量衡量。公式14、15中生成因子数量设为5。AlphaPROBE和所有基线池容量设50,因子长度阈值设40。达容量上限时过滤最低质量因子,过滤因子保留在G中。深度惩罚γ设0.05,检索惩罚ω设0.10。所有基线用第4.3节动态因子集成器公平对比。


实验结果


表1呈现三个数据集实证结果,得出两点结论:一是AlphaPROBE预测未来股票收益能力优,IC、RIC、AR最高,相关研究显示大语言模型用于Alpha因子挖掘潜力大;二是AlphaPROBE对市场制度变化稳定性强,ICIR、RICIR、SR更高,MDD更低。


图片


回测结果


为验证 AlphaPROBE 在真实交易环境中的实际效果,对三个数据集进行全面回测。以 CSI 300 结果为例,AlphaPROBE 在回测期多数时间累计回报领先,且表现出更强韧性,在 2023 年末至 2024 年初熊市及 2025 年 4 月关税风波等市场压力事件中,回撤控制更好、恢复更快。


图片


消融分析


表2展示消融研究结果,评估检索器和生成器模块组件:

  • 随机检索器替换导致性能骤降,说明忽略因子关系会使优化有噪声;

  • 启发式检索器无结构上下文,结果欠佳,证明进化图战略信息必要;

  • 局部MCTS检索器不如AlphaPROBE,表明全局拓扑视图更优;

  • 去除先验项或拓扑惩罚,性能下降,说明因子质量和图定位对检索很重要;

  • 去除似然或NLF,性能下滑,表明池级上下文和祖先谱系信息关键;

  • 用简单alpha链替换DAG感知生成器,证明DAG结构利于进化搜索。


图片


参数敏感性研究


研究AlphaPROBE在CSI 300数据集上对超参数γ和ω的敏感性。如图4所示,AlphaPROBE在较宽参数值范围内表现稳健,尤其在0.05 - 0.15区间性能稳定。极端参数值会破坏探索与利用的平衡,γ或ω过小会导致过度利用,过大则会导致利用不足。


图片


可视化


为展示因子发现过程,给出日间价格波动因子可视化结果(DAG 见图 8)。过程可从简单人工设计的种子因子(如 Div(Sub(Less($open, $̲close), $low), $open))开始,框架将其作为有潜力的父因子,引入时间序列相关性生成更复杂优质的后代因子(如 TsCorr(Sub($close, $open), Sub($low, TsMin($low, 5)), 5)),体现 AlphaPROBE 能挖掘候选因子潜力及建立优化路径。


效率分析


通过对比AlphaPROBE与基于大语言模型的基线模型的收敛速度来研究其训练效率。如图5所示,AlphaPROBE的检索器利用结构拓扑的全局信息识别最有前景的因素,能用更少训练迭代取得更好结果,体现其高效性。


图片


总结


本文介绍用于Alpha挖掘的闭环检索器与生成器框架 AlphaPROBE,它利用贝叶斯因子检索器和有向无环图感知因子生成器,在三种不同风格的中国股票池中有更好的预测性、稳定性和层次性。未来有望从传统日频场景拓展至高频和基本面因子挖掘。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询