PriceSeer:LLM实时股票预测评估基准

“PriceSeer: Evaluating Large Language Models in Real-Time Stock Prediction”


股票预测具动态变化、易受外部干扰等特点,是评估LLMs能力的理想场景。现有研究评估LLMs金融市场预测能力,但决策原因不明,缺乏对内外变量分析。


PriceSeer基准含110只美国11个行业板块股票及各249个历史数据点,实现内外信息扩展,让LLMs结合额外金融指标、新闻和假新闻进行股价预测。


实验对比了6个前沿LLMs在不同预测周期下表现,展示其为不同行业生成投资策略潜力,分析其长期预测表现不佳原因,如易受假新闻和特定行业影响。


图片


【 扫描文末二维码加入星球获取论文,源码 】


摘要


本文介绍专为大语言模型(LLMs)股票预测任务设计的PriceSeer基准,含110只美国11个行业板块股票及各249个历史数据点,实现内外信息扩展,让LLMs结合额外金融指标、新闻和假新闻进行股价预测。对比了6个前沿LLMs在不同预测周期下表现,展示其为不同行业生成投资策略潜力,分析其长期预测表现不佳原因,如易受假新闻和特定行业影响。


图片


简介


大语言模型(LLMs)广泛应用,挑战无数据污染的基准测试开发,现有多数基准测试存在静态数据、评估协议及脱离现实场景问题。股票预测具动态变化、易受外部干扰等特点,是评估LLMs能力的理想场景。现有研究评估LLMs金融市场预测能力,但决策原因不明,缺乏对内外变量分析。


PriceSeer基准是无数据污染的实时基准,涵盖美国11个主要工业部门的股票,结合内外信息。用该基准进行股票价格预测和投资管理生成的实时交易评估,对比6种主流LLMs。


本文基于110只美股、27390个数据点,评估内外辅助信息及LLMs鲁棒性;分析不同预测场景下LLMs优势。


相关工作


LLM评估:基准是开发LLM应用的基础,目前从多方面评估LLM,基准正朝动态、实时、可变方向发展,未来预测任务受关注,FutureX是相关动态评估基准,PriceSeer聚焦股票预测。


金融相关评估:金融领域受广泛关注,已有多种LLM金融评估研究,包括静态金融知识、交易等,还有实时AI交易评估。受此启发,PriceSeer关注股票价格,探究LLM金融决策背后原因。


PriceSeer


数据准备


PriceSeer利用时间序列和新闻两类数据及对应变体。


原始历史数据:从雅虎财经收集过去一年(2025 - 11 - 07前)110只美国股票(涵盖11个板块)每日数据(共249个点,含开盘、收盘等价格及交易量)用于股票预测。


金融指标:基于原始数据添加五个主流指标,包括简单收益率和对数收益率(衡量价格变化)、简单移动平均线(设周期为3、5、15、30日平滑价格波动)、相对强弱指数(衡量价格变动速度和幅度,0 - 100,超70超买,低于30超卖)。


新闻和假新闻:收集了每个股票的十大最新和相关的新闻文章,这些文章是通过SerpAPI从谷歌搜索结果中下载的。新闻数据由发布日期、来源、新闻标题和内容组成。为了研究模型避免干扰的能力,我们进一步篡改了一些关键信息以引入扰动。具体来说,我们利用DeepSeek-V3.2[5]通过操纵数字、引入虚构元素和使用最高级语言来生成假新闻。


PriceSeer成分


收盘价预测:PriceSeer评估大语言模型(LLMs)预测目标股票短(3天)、中(5天)、长(10天)期收盘价的能力,输入包含历史价格序列、辅助财务特征、新闻及真实性信息,经序列化构建输入上下文,预测公式为 p s,t+h = LLM(C s,t),h∈{3,5,10}。


投资管理:探索LLMs管理投资资金获取回报的能力,给各模型分配10000美元资金,基于股价预测制定短、中、长期投资策略,按“最后数据点买入,3、5或10个交易日卖出”交易,记录资金分配,计算实际盈亏评估策略优劣。


提示详情:提示包含三部分,即角色设定(指定为金融数据分析师)、任务描述(明确目标股票和预测日期)、任务导向数据(含历史数据、财务指标、新闻及假新闻)。


图片


实验


实验设置


基线:PriceSeer采用六个顶级专有大语言模型作为基线,包括GPT-5、o3、DeepSeek-R1、DeepSeek-V3.2、Claude-Sonnet-4.5、Gemini-2.5-Pro。


评估标准:

  • 相对误差:计算预测价格误差率。


图片


  • 命中率:计算价格趋势正确预测率。


图片


  • 性能得分:通过对数缩放将相对误差转换为 1 - 100 分的性能得分,公式 (P = 100 - 23\ln(1 + n)) ,分越高越好。


结果


LLMs 股票预测:不同模型在不同预测期表现有别,DeepSeek-V3.2 短期优,GPT-5 中长期佳,各期平均命中率分别为 0.6、0.53、0.51。


图片


行业差异:创新驱动行业如通信、科技等不确定性高,稳定行业如消费防御、能源等准确性较一致,医疗各期误差高。


图片


预测期特征:短期除医疗外普遍正相关,长期分正负相关集群,中期为市场重新定价过渡期。


图片


投资策略:DeepSeek-R1、GPT-5、o3 集中投资高风险高回报,另三个模型分散投资求稳定。


图片


消融分析


研究金融指标、新闻和假新闻对预测准确性的影响。结果显示:辅助信息显著影响预测,金融指标和真新闻提升短期准确性(新闻作用更强,相对误差分别降 0.074 和 0.198),但不利于中长期预测,影响具短期性;假新闻严重降低短期表现,长期负面影响减弱甚至略有益,因模型逐渐学会识别和排除其虚假内容,图 6 模型对比也证实此现象。


图片


总结


本文推出实时、生产级基准 PriceSeer,用于挑战大语言模型预测股票价格走势。它涵盖 11 个行业的 110 只美国股票,每只股票有 249 个按时间排序的数据点,包含开盘价等信息。还研究内部历史数据、外部新闻和虚假新闻的影响。对前沿大语言模型的实验表明其在股票准确预测上潜力大,且在不同行业和预测周期各有优势。


图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询