Hubble:LLM驱动的安全、多样化、可重复的α因子挖掘智能体框架
“Hubble: An LLM-Driven Agentic Framework for Safe, Diverse, and Reproducible Alpha Factor Discovery”
量化股票投资中寻找预测性阿尔法因子是核心任务,但有用信号少、数据嘈杂、假设空间大。传统自动发现方法易过拟合,手工构建公式化阿尔法因子费力。
本文提出Hubble阿尔法挖掘框架,遵循安全生成、结构化检索、家族感知选择、研究就绪输出四个设计原则。在约500只美国股票样本上评估104个有效候选因子,发现顶级因子多属范围、波动和趋势家族。固定前5个因子在2025-2026年外样本期验证,部分因子表现良好,部分衰减。结果表明安全的大语言模型引导搜索可升级为可重复的阿尔法研究流程。

【 扫描文末二维码加入星球获取论文 】
摘要
由于公式因子搜索空间呈组合性、日股票数据信噪比低、无约束程序生成操作不安全等原因,导致阿尔法发现困难。本文提出Hubble框架,结合大语言模型与特定领域操作语言等,限制大语言模型生成可解释操作树,通过确定性横截面管道评估候选因子,反馈顶级公式和结构化家族级诊断信息。该系统还引入正负检索增强生成等。在约500只美国股票样本上评估104个有效候选因子,发现顶级因子多属范围、波动和趋势家族。固定前5个因子在2025-2026年外样本期验证,部分因子表现良好,部分衰减。结果表明安全的大语言模型引导搜索可升级为可重复的阿尔法研究流程。
简介
量化股票投资中寻找预测性阿尔法因子是核心任务,但有用信号少、数据嘈杂、假设空间大。传统自动发现方法易过拟合,手工构建公式化阿尔法因子费力。大语言模型用于公式挖掘有多种失败模式,现有基于大语言模型的阿尔法挖掘研究对执行安全等要求关注不足。
本文提出Hubble阿尔法挖掘框架,遵循安全生成、结构化检索、家族感知选择、研究就绪输出四个设计原则。相比早期原型,现系统改变搜索行为,发现的因子更具多样性。
本文为提供端到端安全公式挖掘框架,引入双通道RAG设计和家族感知评分层,在美股数据上证明框架能发现可解释因子,且在多LLM后端保持稳定。
相关工作
自动化因子发现:符号回归和遗传编程是自动化阿尔法发现的自然基线;Qlib等平台基于预定义因子池;Kakushadze的101个阿尔法公式库有影响力但构建多依赖专家。
LLM驱动的阿尔法挖掘:近期用LLM作阿尔法生成器等,但更重生成质量,忽视执行安全等;Hubble将LLM作为确定性评估循环内的受限假设引擎。
LLM引导的搜索和推理:LLM在结构化推理和程序发现中有价值;Hubble将程序搜索模式用于阿尔法挖掘,增加特定领域控制。
Hubble
Hubble是一个闭环挖掘系统,由 DSL 约束生成器、AST 验证沙盒、确定性评估引擎、双通道 RAG 模块和家族感知评分器构成。其工作流程为:

生成器在约束算子注册表和动态提示构建下,借助 LLM 生成候选公式,双通道 RAG 模块辅助避免冗余。
公式经解析器安全沙盒,通过 AST 验证实施语法和语义约束。
有效公式由评估引擎执行数据清理、对齐和统计质量检查,计算多项指标。
加权评分模块聚合指标,依据预测能力等应用奖惩机制。
结果存档并反馈,形成闭环。候选公式用受限领域特定语言编写,基于注册算子和原始数据字段,原始输入为每日面板序列,算子含多种类型。
DSL和AST沙盒
候选表达式解析为 Python 抽象语法树,经三层验证:
1. 结构安全,仅允许白名单内 AST 节点类型;
2. 复杂度控制,超预设深度或节点数限制将被拒;
3. 语义有效,运算符、元数和变量名须属注册 DSL。
此设计防任意代码执行,为因子发现保留表达性强的公式语言。

具有双通道RAG的代理生成
第 r 轮时LLM接收含静态前缀和动态后缀的提示包,现提示明确要求因子族主题多样。RAG层为双通道,正RAG从语料库取代表性公式鼓励探索,负RAG取拥挤模板作回避参考。提示含正参考(值得学习机制)和负参考(勿简单重参数化的公式或结构),将参考语料库变为探索控制信号,非被动示例源。
评估流程
Hubble为每个验证因子α计算前向回报标签并进行横截面评估,报告基于排名和线性的指标(RankIC和IC)及聚合指标。

此外,评估器还计算覆盖率、分桶回报、多空回报、换手率、公式复杂度等。采用Bartlett核HAC方差估计进行显著性检验,将诊断结果保存到因子工件,后续报告和绘图层复用这些研究输出,而非临时重新计算指标。
标准化评分和家庭意识选择
现行评分层不再用异构指标的原始线性组合,先对各指标 m_j 进行标准化变换 m~j,再计算基础分数 score_baes(α),预测和经济指标用正权重,换手率或数据损失用负权重。


基础分数会通过元数据感知的惩罚和奖励进行调整,如 P_crowded、P_similar、P_family 为惩罚项,B_novelty 为奖励项。

选择在质量和多样性约束下进行,此方案旨在将候选池的多样性传递到最终结果中,避免最终 top-k 被流动性-交易量公式主导。
反馈和持久工件
每轮结束,系统编译含顶级公式及分数、错误总结、因子族情况、RAG样本标识符、提示与使用元数据的反馈。每次运行存储于结构化目录,有追加记录、JSON摘要、提示/响应快照和诊断工件,此存储设计使挖掘过程可审计、可复现。
实验
数据和实验设置
对Hubble在从sp500.txt加载的美国每日股票宇宙进行评估。
发现运行采用2022年1月1日至2025年5月31日840个交易日的501只有效股票面板。
主挖掘实验配置为三轮挖掘,批量大小20,top-k = 5,启用反馈和RAG,使用OpenRouter支持的nvidia/nemotron-3-super-120b-a12b:free模型,也用openrouter/hunter-alpha模型运行相同配置。

主运行数据截至2025年5月31日,2025年6月1日至2026年3月13日195个交易日为OOS期,因子发现时未见过,OOS期不进行重新排名或公式再生。
挖掘结果
表2显示主运行的每轮吞吐量,每轮含20个主生成候选和最多20个反馈候选,三轮处理60个主候选、完成104次完整评估,无处理错误,仅16次重复检测。

图3表明反馈循环首轮后仍有效,第2轮得分最佳且成功评估次数多,符合系统先拓展探索、后优化主题且保持运行稳定的设计。

样本内因子发现
表3总结各发现因子结构描述,表4报告发现面板统计表现,所选因子集中于范围、波动率和价格趋势,非流动性 - 交易量主题。


IS切片中,顶级因子在RankIC和Pearson IC上均为正向,但HAC证据在各因子族分布不均,表明排名信号非由单一指标驱动。
领先因子 Range-1 是平滑归一化日内范围,反映潜在信息、分歧和库存压力。
最强波动率因子 Volatility-1 衡量近期日对数收益率方差,与波动率聚类和条件风险重定价有关。
趋势因子 Trend-1 比较近期移动平均锚点与当前价格,可反映短期均值回归等情况。
IS结果表明Hubble未重复发现单一拥挤主题,而是发现与价格范围、波动率状态和相对趋势定位相关的可解释机制。
样本外验证
主运行使用截至2025年5月31日的数据,2025年6月1日至2026年3月13日为样本外(OOS)期,此期间不用于因子发现,五个因子的公式和参数在OOS期开始前固定。表5显示四个排名较高的因子在OOS期方向仍为正,仅Trend-1明显变差。Range-1 和 Range-2 在OOS期显著增强,Volatility-1 保持强劲,Volatility-2稍弱但仍有一定显著性,而 Trend-1 样本内综合得分最低且在OOS期无法泛化。这种OOS期的差异结果表明样本内综合排名并非随意,同时OOS期更青睐范围和波动率因子族,此结果为初步样本外证据,非无条件的阿尔法收益论断。
可视化证据
可视化证据以 IS/OOS 配对图呈现,IS 诊断显示在保留期前顶级因子已形成合理横截面结构,OOS 图揭示哪些结构能持续。


多样性应体现在候选池和最终赢家,图 14 对比成功候选者与最终顶级 k 的家族组合,关键是最终赢家分布在不同家族,而非集中于单一主题。




跨LLM后端健壮性
为测试结果是否因LLM而异,将主运行与使用openrouter/hunter-alpha的稳健性运行对比,后者峰值稍弱、有15个错误,但因子特征相似,表明系统设计不依赖单一后端避免流动性-交易量崩溃,对公共部署和可重复性研究很重要。

对于公开arXiv版本,不披露精确因子公式和超参数,而是报告因子族、结构总结和金融动机假设,既保留论文科学价值,又避免生产级阿尔法规格直接公开。
发现
重要发现:多样性约束等改变了获胜因子身份,当前系统选出的最终顶级因子以范围、波动率和一个较弱趋势因子为主,且范围和波动率因子样本外(OOS)泛化更有说服力。
转变的意义:降低优化高覆盖拥挤模板风险;产生更具金融解释性的假设;使框架作为研究助手更有用。
OOS结果暗示:样本内排名不能完全决定跨期稳健性,OOS证据集中在范围和波动率家族,框架更擅长发现稳定机制。
相关性:日横截面股票预测中绝对相关系数小属正常,虽小但稳定、多元且经济上合理就有意义,OOS证据有支持但不具决定性。
发现
未进行中性化:未对发现的因子进行市场、行业或风格中性化,可能使报告的IC和多空统计包含系统风险暴露,或致样本外(OOS)IC值升高。
单面板无滚动:基于单一美国日度股票面板,未采用完整的滚动样本外协议,OOS验证仅为一次时间分割。
OOS窗口短且有制度风险:OOS窗口仅195个交易日,结果或受有利制度影响,应视为初步证据。
RAG语料库有偏差:RAG语料库含历史示例,可能存在主题偏差。
稳健性分析不足:跨后端的稳健性分析较简单,完整版本应包含明确消融实验。
未评估交易成本:通过统计和简单投资组合诊断评估公式质量,未进行考虑交易成本的回测。
LLM存在时间泄露:LLM预训练语料含IS窗口开始后的金融文献,可能内化因子有效性的元知识。
LLM有叙事偏差:LLM流畅生成解释,使虚假信号因看似合理而难被拒绝,生成的假设应进一步审查。
总结
Hubble结合多种技术用于安全多样的阿尔法因子发现。在501只美国股票面板上运行稳定,发现可解释因子。在2025-2026年验证期,范围和波动家族证据强,趋势因子衰减。其价值在于提供可复现研究流程,LLM提假设,确定性组件评估,成果用于金融解读和后续测试。未来工作聚焦消融分析、前向验证、交易成本评估及优化RAG语料库。

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。