基于 AI 的实时股票回报预测,年化异常回报率约46%,年化夏普比率达2.43

“Autonomous Market Intelligence: Agentic AI Nowcasting Predicts Stock Returns”


图片


【 扫描文末二维码加入星球获取论文,结果 】


摘要


本研究探讨全自主智能 AI 能否实时预测股票回报,自 2025 年 4 月起用大语言模型评估罗素 1000 只股票每日吸引力。本方法有三特点:1)预测为完全样本外且无前瞻性偏差;2)时间设计不可复制;3)框架 100%自主,AI 自主搜索、筛选和合成信息。结果显示 AI 有选股能力,但仅能识别顶级赢家,做多排名前 20 股票日五因子加动量阿尔法为 18.4 个基点,年化夏普比率 2.43,交易成本低。不过预测能力集中,扩大范围会稀释阿尔法,排名靠后股票回报与市场无差异。推测这种不对称源于在线信息结构,正面消息信号清晰,负面消息受企业混淆和社交媒体噪音干扰。


简介


研究利用金融市场检验全自主智能体AI能否合成复杂实时信息生成可行动见解。在“有效市场假说”下,将先进大语言模型作为自主投资分析师,自2025年4月起每日评估罗素1000指数成分股,自主搜索网络、合成信息并给出-5至5的量化吸引力得分。结果显示,AI有预测能力但具明显不对称性,擅长识别未来表现最佳股票,却难以区分未来表现不佳和表现一般的股票。其选出的前20只股票组成的价值加权投资组合在2025年4月至2026年1月的九个月内累计回报约50%,跑赢罗素1000指数近24个百分点,经风险调整后的年化异常回报率约46%,年化夏普比率达2.43,远超典型对冲基金和标准因子策略表现。


图片


每日阿尔法的独特性:每日阿尔法频率独特,多数资产定价异常策略为月或季频,高频交易常因成本侵蚀收益,且日频价格多受噪声和即时信息影响,难以预测。本文发现稳健的日频阿尔法,表明代理式AI能提取传统方法难以捕捉的高价值信息。


独特且不可重现的数据集:引入涵盖罗素1000指数成分股的代理式AI股票预测综合数据集,捕捉AI自主工作流程,避免信息筛选干扰。该数据集因采用实时查询范式而不可重现,需及时记录研究结果。


金融市场用于AI评估:利用金融市场评估AI信息处理能力,因其结果明确可测、环境竞争激烈、信息嘈杂且易被操纵,若AI能在此环境提取有效信息,其能力可推广至其他领域。


解决大语言模型评估中的前瞻偏差:评估大语言模型存在“数据污染”问题,在金融领域尤为突出。通过严格的实时预测,确保AI仅使用预测时刻市场参与者可获取的信息,保证研究方法有效且可行。


研究发现AI预测能力存在显著不对称性,对排名靠前股票能产生显著正阿尔法,但无法识别表现不佳股票,该不对称性在不同信号周期和风险调整下均稳健。


本文呢提出基于网络信息结构的机制,正面新闻清晰明确,负面新闻存在战略模糊,AI更擅长识别正面共识信号,难以区分真正困境与含噪悲观情绪。此不对称性对多领域应用有启示。


相关工作


资产定价中的机器学习


机器学习在资产定价中的应用主要用于应对“因子动物园”和有效市场假说的实证挑战,相关文献围绕三个主题展开:


因子模型估计:Kelly等(2019)引入IPCA,可让潜在风险因子依赖可观测企业特征;Lettau和Pelger(2020)通过引入定价误差惩罚项扩展该方法,能在大横截面下估计时变因子风险溢价。


收益预测:Gu等(2020)对比发现神经网络和梯度提升树在捕捉预测因子间复杂非线性关系上远超线性模型;后续研究进一步改进,如Chen等(2024)用带对抗训练目标的深度神经网络,Bryzgalova等(2025)开发自动发现特征交互的树方法;Jiang等(2023)将卷积神经网络用于股价图提取视觉模式。


特征工程和信息集:近期研究表明输入变量选择(特征工程)是性能的主要驱动因素,Li等(2025)、Avramov等(2023)分别强调精心构建交互项和经济限制的重要性;本文研究与以往不同,以往由研究者预选信息集,本文代理框架让AI自主选择信息。


金融中的文本分析与大语言模型


金融非结构化文本价值提取经历两阶段:


传统情感分析:早期用基于词典方法,Tetlock证明负面媒体内容影响市场价格,Loughran等指出需金融特定词典;后用监督机器学习,Manela等构建NVIX预测回报,Bybee等开发追踪经济叙事指数。


大语言模型回报预测:LLMs可解释语义,Lopez - Lira等表明其分析新闻标题预测股价表现超传统情感得分;Chen等指出其能捕捉标准NLP遗漏信息;还可用于基本面分析。


目前的方法存在信息环境的对抗性问题,管理者会掩盖负面新闻;LLM预测因数据污染有效性常受影响。本研究采用“现况预测”设计确保预测仅基于决策时市场参与者可用信息。


高频收益的可预测性和市场效率


大量文献表明高频获取异常回报困难:资本市场异象近年衰减,自2000年代初日度异象利润基本消失;学术发表异象会使回报衰减;很多已发表异象可能是数据挖掘。算法交易兴起压缩短期获利机会:其能改善市场质量、消除短暂定价错误,还会缩小价差、降低逆向选择。2025 - 2026年存在持续日度阿尔法,与上述模式不同,表明智能AI信息处理能力与以往技术有质的差异。


计算机科学中的人工智能和交易系统


计算机科学文献发展了由大语言模型驱动的自主交易代理,但存在方法局限。


多智能体交易框架:有研究提出让大语言模型代理模拟交易台和做市商的框架,不过样本量小、评估期短,缺乏严格的样本外统计推断。


基于大语言模型的交易机器人:众多论文提出特定的大语言模型交易系统,常以少量样本和短时间评估,难以得出关于人工智能交易能力的可靠结论。


本研究在规模和设计上与以往不同,评估涵盖罗素1000全量股票,有严格风险调整和统计推断,且智能体框架能自主搜索实时网络,排除研究人员筛选影响。


人工智能能力和市场评估


研究成果弥合计算机科学AI能力理论与实证资产定价间的差距,提供评估智能体智能的经济框架。


量化大型模型高级推理等涌现行为的经济价值,自主处理市场信号的能力未被显式训练却能产生持久超额收益。


金融市场可作动态、对抗性实验室,部署智能体建立“实时基准”,数据集反映AI能力与实时市场效率的互动。


实证验证AI在资产定价中的理论潜力,但发现其存在显著不对称性,更适合作为资本配置的信息过滤器。


数据准备


数据收集理念:“代理”工作流


数据收集采用“代理式”工作流程,借助先进大语言模型实时能力。研究用领先美国AI模型网络界面,不预选新闻或输入文本。


流程:界面交互输入标准专家提示;启用模型在线搜索功能;模型自主生成查询、浏览网络、筛选事件并合成预测。


优势:消除归因偏差,信息选择无人工干预,信号源于模型自主处理;消除前瞻偏差,进行真实样本外实时预测,模型无未来结果先验知识。


股票的范围和频率


聚焦罗素 1000 指数(占美股市值约 93%),确保结果适用于大市值、高流动性股票。每日收集数据,遵循严格时间协议,t - 1 日收盘后输入所有输入,t 日开盘前完成数据收集,消除前瞻偏差并验证执行可行性。样本期为 2025 年 4 月至 2026 年 1 月。


提示和变量


每日开盘前,对罗素 1000 指数成分股通过网络界面输入相同提示进行四维度市场分析:


  • 吸引力得分(主信号):AI 对各股票在 1 天至 1 年多个信号期的购买吸引力评分(-5 至 +5),用于实证测试。

  • 价格与基本面预测:AI 给出今日至 1 年的收盘价预测、未来 5 财年每股收益预测及下一份财报评级(-5 至 +5)。

  • 市场情绪与分歧:分析 X(原推特)社会情绪,输出情绪得分(-5 至 +5)和分歧得分(-5 至 +5)。

  • 基准控制:AI 对罗素 1000 指数在相同信号期给出吸引力评级,用于单只股票得分标准化。


数据提取与可靠性


模型分析结果需总结为 Python 可读列表,利用正则表达式提取 40 项列表以构建结构化面板数据集。为检验模型预测是否随机,多次查询道琼斯成分股在随机日的数据,同时从 LSEG DataStream 获取罗素 1000 股票的每日金融数据。


数据预览


摘要统计信息


样本:近15.6万条2025年4月至2026年1月罗素1000指数成分股日度数据。


图片


AI生成信号:

  • 面板A:个股吸引力得分在 - 5至 + 5之间,均值近0,中位数随信号期限延长递增,标准差显示有截面差异。

  • 面板B:罗素1000指数吸引力得分波动低于个股,模型能区分个股与市场情况。

  • 面板C:市场情绪得分均值1.35,波动1.59;市场分歧变量追踪个股与市场情绪差异。


金融数据:

  • 面板D:开盘到开盘收益率为主要因变量,数据收集决定该计算窗口可避免前瞻偏差。

  • 样本流动性高,市值、交易量中位数可观,买卖价差小,收益率分布符合典型特征。


相关分析


表2展示关键变量的成对相关系数,支持AI生成信号的独特性:


图片


  • 吸引力得分跨信号周期有高序列相关性,与市场特征不同。1天得分与1周、1月得分高度相关,但与罗素1000基准得分相关性低,含特质信息。

  • AI信号与标准市场特征相关性低,与市值、美元交易量相关性微弱,与买卖价差负相关,非规模或流动性因素的简单代表。

  • 情绪得分与股票吸引力得分中度相关,模型市场情绪影响个股推荐,也可反向操作。

  • 战胜市场共识概率与吸引力正相关,基本面盈利预期是买卖建议的关键驱动。

  • AI吸引力得分与开盘 - 开盘回报无条件相关性近零,信号与未来回报无简单线性关系,其在分布尾部是否有预测价值待后续分析。


AI分数的一致性


利用大语言模型(LLM)进行财务分析时,需关注文本生成的随机性。为验证吸引力分数的稳定性,进行了一致性测试:


图片


实验:对30只随机选的股票在重叠日期重复查询约350次/股,用5种统计测试评估分数。


测试结果:

  • 柯尔莫哥洛夫 - 斯米尔诺夫分布测试:100%拒绝个股分数为总体随机抽取的原假设,表明AI能生成特定资产分数分布。

  • 蒙特卡罗置换测试:经验p值<0.001,说明模型输出由特定股票 - 日期信息驱动,非随机噪声。

  • 分半信度分析:皮尔逊相关系数ρ = 0.942,表明随机噪声影响小。

  • 排名稳定性分析:斯皮尔曼相关系数ρ = 0.902,说明股票相对排名稳定。

  • 生产对齐验证:与单查询分数斯皮尔曼相关系数ρ = 0.629,表明单查询信号可反映模型中心趋势。


人工智能预测冠军


构建可实施投资组合:每日开盘前,按隔夜生成的AI“吸引力分数”对股票降序排序,选分数最高的20只股票组成Top - 20组合,分数相同优先选市值大的,每日按市值加权再平衡。用开盘价计算收益,避免前瞻性偏差。


长信号周期处理:对于周、月、季等长信号周期,采用重叠投资组合法降低再平衡时机风险,目标持有期K天的组合由t至t - K + 1天开始的K个子组合等权(1/K)构成。


评估方法:将组合超额收益对包含动量的Fama - French五因子回归,截距α代表无法用因子暴露解释的异常收益,显著为正则表明AI模型有超越标准风险溢价的预测信息,用Newey - West法计算5阶滞后标准误以处理异方差和自相关。


前20名投资组合的出色表现


图2显示基于AI吸引力评级的Top - 20股票组合累计加权回报与罗素1000基准对比,各信号周期下AI组合均与市场走势分离且呈上升趋势,表现持续优于基准。表4回归分析证实AI选股有经济和统计意义,全Fama - French六因子模型下,Top - 20组合日阿尔法为0.184%(t = 2.46),年化异常回报约46%。


图片


文献中截面收益预测的阿尔法多为月度或更长周期,因市场效率和算法交易,多数异象在日频消失且有发表后衰减现象。2025 - 2026年AI策略产生显著日阿尔法是突破,且策略可实施,交易流动性好的大盘股,毛阿尔法远超交易成本。


表4因子载荷显示AI构建组合的风格:市场贝塔低至0.298(t = 2.17),构建防御性低波动组合;价值因子载荷为负(HML系数 = - 0.636,t = - 4.02),偏好成长股;动量因子载荷不显著( - 0.169,t = - 1.33),并非追逐过去赢家。


图片


人工智能如何预测?


探究预测信号是识别赢家和输家,还是信息集中于一方,这对策略实施很重要,对称信号支持多空策略,非对称信号利于仅多组合。


通过比较不同规模组合中排名最高和最低股票的风险调整后表现进行研究,图3展示不同信号周期下,排名前N和后N股票构成的价值加权组合的Fama - French六因子阿尔法。


图片


AI信号有明显不对称和高排名集中两个特性:排名靠前组合在各信号周期产生正且显著的阿尔法,信号效力对组合规模敏感,预测内容集中于最佳标的;排名靠后组合未出现预期的负阿尔法,多数情况下与零无统计差异。


AI是“选股赢家”引擎而非多空因子,仅多策略集中于排名靠前股票可捕捉信号预测内容,扩大组合会稀释表现,市场中性多空策略会受无用空头腿的噪音和交易成本影响。


这种不对称与信息披露选择性的理论框架一致,信息中介倾向放大好消息,坏消息常被掩盖或噪音多,AI基于公开数据训练,对排名靠前资产能提取更清晰的预测信号。


因素暴露分析


研究对AI所选的Top - 20、Bottom - 20组合及多空组合进行Fama - French六因子回归,分日、周、月、季信号周期展示结果,以分析组合系统风险暴露。


图片


阿尔法估计:Top - 20组合日、周、月信号周期有显著正阿尔法,季度信号周期阿尔法减弱且不显著;Bottom组合阿尔法为负但不显著;多空组合阿尔法在0.13% - 0.32%/日,显著性因信号周期而异。


夏普比率:Top - 20组合风险调整后收益优于Bottom - 20和多空组合,高频下更明显,信号周期延长效率降低;Bottom组合夏普比率为负或接近零。


因子载荷:Top组合市场贝塔低,偏好防御、低波动股票;Bottom组合市场暴露高。Top组合HML载荷为负,偏好成长股;Bottom组合相反,多空HML暴露为负。Top组合SMB载荷近零或略负,偏好大市值股票;Bottom组合SMB载荷为正。盈利能力和投资因子无系统模式。显著阿尔法表明AI有选股能力,非仅依赖成长因子。


人们易认为网络搜索 AI 信号类似简单动量(MOM)策略,但 MOM 估计呈现更微妙的不对称模式。Top - 20 组合动量负荷小且不显著,并非“追涨”;Bottom - 20 组合负向负荷强,AI 会将近期输家排名降低。该策略与动量的互动主要是排除输家,而非主动追涨。


AI风格倾向于大盘、防御性成长股,回避高贝塔、价值型股票及近期亏损股。其风格特征未涵盖表现,经Fama - French六因子调整后,Top - 20组合仍有显著异常收益。高频收益预测难,2000年后日度异常利润渐失,算法交易消除短期定价错误,但2025 - 2026年AI仍有持续日度阿尔法,表明其信息处理能力未被市场充分套利。


投资组合周转和实施成本


为评估AI信号稳定性及研究结果抗摩擦成本的稳健性,考察投资组合换手率。用换手率衡量组合稳定性,其为每次再平衡时新股票替换比例。图4展示四种信号周期的换手率时间序列,样本中换手率降为0是因信号更新中断,非模型决策。


图片


日信号周期平均换手率57.4%,表明超短期特征有一定持续性,部分“明日”首选股次日仍是首选。反直觉的是,信号周期越长换手率越高,周信号平均换手率72.3%,说明模型中期判断较脆弱,受每日信息影响大。虽换手率高,但投资范围限于罗素1000成分股,流动性好,平均买卖价差1.6 - 2.0基点,日策略日均毛阿尔法约18基点,超额收益经济上可实现。


整个横截面的可预测性


为探寻AI信号预测力分布,构建50个约20只股票的投资组合。图5显示Fama - French六因子阿尔法值呈“曲棍球棒”模式:排名靠前组合有显著正阿尔法,至第五或六组降至近零,中间40个组合无系统模式,底部组合阿尔法围绕零波动。


图片


此表明信息优势局部化,仅对少数排名靠前资产有高置信度,长多策略聚焦前20 - 50只股票可获大部分阿尔法,AI无法可靠识别表现不佳股票,卖空底部股票会引入估计误差。集中的顶级组合日阿尔法0.15%意味着年化风险调整后回报约38%,显示大语言模型处理公开交易股票信息有不对称的能力。


总结


本研究评估全自主人工智能在严格样本外实时预测框架下,综合实时市场信息预测股票回报的能力。贡献在于有新颖、精细的数据集,记录罗素1000股票实时数据并持续更新,含定量吸引力得分与详细分析,使机器判断可系统衡量。


研究发现:1)自主人工智能有显著预测能力,所选前20股票组合表现远超基准。2)预测能力不对称,能识别赢家但难区分输家。3)表现不受实施摩擦影响,扣除成本后仍有经济价值。


文本决策痕迹可用于新的诊断分析,如归因研究、测量内部一致性、量化事后信息泄露影响。决策跟踪数据和样本外结果开启新研究议程,以市场为实验室测试自主人工智能认知边界,AI评估前沿是理解其如何适应和重塑人类复杂系统。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询