基于股票动态价格与情绪特征辅助的对抗学习股价预测
“Context-Integrated Adversarial Learning for Predictive Modelling of Stock Price Dynamics”

【 扫描文末二维码加入星球获取论文 】
摘要
预测快速变化金融市场的股票价格极具挑战,经典统计方法(如 ARIMA)受线性假设限制,复杂神经网络(如 LSTM)面对波动和分布变化易崩溃。
本文引入上下文敏感对抗学习模型预测股票价格,结合基于分布的生成建模与通过自然语言处理获取的基于情绪的辅助信息,利用定量市场指标和上下文线索,提升高波动和制度变化时期预测的可靠性。
对美国股票样本的实证评估表明,该方法在多种误差指标上优于传统 ARIMA 和 LSTM 基线,说明上下文敏感对抗范式能有效增强复杂金融环境下的股价预测效果。
简介
股票价格准确预测是机器学习研究挑战,传统统计方法有线性和平稳性假设局限,深度学习的LSTM虽能学时间依赖,但在分布变化和极端波动时稳定性不足。生成建模的GAN在学习复杂高维表示上有潜力,能增强预测鲁棒性和泛化性。金融文本内容促使NLP技术融入预测流程,但现有多模态方法未充分利用数值与文本信号的交互。
本研究开发上下文集成对抗预测框架,结合数值市场观测与情绪辅助特征,用对抗训练近似未来股价条件分布,将情绪信号作为调节信息。以金融市场数据为实证领域,与ARIMA和LSTM对比实验评估预测性能。
本文与整合异质信息源的智能数据驱动建模研究一致,贡献于金融时间序列预测的对抗学习和上下文感知建模探索。
相关工作
时间序列预测研究从传统统计建模发展到数据驱动的机器学习和深度学习方法。
经典统计模型如 ARIMA 等有一定应用,但基于线性和平稳假设,在复杂环境中效果不佳。机器学习方法如 SVM 等能处理非线性依赖,但需大量特征工程,难扩展到高维序列数据。深度学习的 RNN、LSTM 可自动学习原始数据表示,在序列预测任务中表现良好。LSTM 模型有局限性,引发对生成式建模的兴趣。GANs是强大的生成建模框架,基于判别器和生成器的对抗训练,在学习高维复杂分布、时间序列数据建模方面有效,如Fin-GAN优化算法用于金融时间序列预测。
数值时间序列建模发展及非结构化文本数据增多,促使研究NLP技术在预测系统的应用,文本信息能影响序列动态。实证研究表明社交媒体情绪与市场趋势相关且可预测,情绪线索对时间序列预测有作用。近期研究探索深度学习与NLP特征结合的混合架构提升预测性能,但现有技术多为浅层融合或分开处理文本和数值数据。
研究证实直接纳入文本信息、学习跨模态交互很重要。Xu等用交叉注意力机制结合文本线索和时间序列表征,提升预测性能;Emami等引入模态感知Transformer,强调多模态融合对预测的意义;语言模型对金融文本情感嵌入很关键,可辅助预测价格趋势。目前结合对抗生成学习与情感感知文本表征预测时间序列的单架构研究较少,本文提出结合时间结构和上下文信息的混合GAN - NLP系统。
方法
本文研究目标是创建可在非平稳、嘈杂和波动条件下运行的股票市场数据预测框架,结合股票数值市场数据与基于情绪的上下文信息。
数据处理方面,以长度为L的历史窗口构建数值输入 X_t,处理匹配交易期的非结构化文本信息生成基于情绪的表示。
学习目标为建模条件分布,将情绪向量作为内置辅助条件信号,增强数值市场动态与上下文信息的结合。
模型选择上,采用生成对抗网络(GAN),生成器G根据历史数值数据和情绪分析的上下文特征生成未来股票观测,判别器D评估观测的合理性,通过对抗反馈提升生成器能力,使模型能综合利用市场和情绪信息,且对文本信号不足情况有韧性。



实验
数据
评估涵盖高流动性、强市场效应的美国大盘股,聚焦苹果、微软等 7 只代表性股票。评估依据数值市场数据与文本情感信息:
数值市场数据:每日从雅虎财经获取,经去重、处理缺失值、特征选择等预处理,训练前用 Min - Max 缩放,参数仅基于训练子集估计。
文本情感数据:从推特收集股票相关推文,经清洗后用 VADER 提取情感得分,多文本条目合并为每日情感表征。 所有预处理统一应用,确保可重复性与公平比较。
评估方法
时间数据划分:按时间顺序排列股票价格观测值,不同模型采用不同样本外划分策略。
模型特定数据分割:ARIMA用约90%数据拟合,10%用于样本外测试;LSTM按70%和30%划分训练和测试数据;GAN模型留最后20个观测值评估,其余用于训练。
预测任务定义:对所有模型进行一步预测评估,保持相同预测期以直接比较预测准确性。
评估模型:包括ARIMA统计基线、LSTM深度学习基线和带情感调节的GAN模型。
模型训练配置:神经网络模型按原研究固定配置训练,LSTM采用早停和学习率调度,GAN将价格值缩放到(-1, 1),固定批量大小为5,预测期为一个交易日。
评估指标:用MAE、MSE、RMSE、MAPE等回归指标评估,仅用评估数据计算并统一报告。图2总结了评估流程。

结果
所有评估测试采用相同预处理步骤、时间数据划分策略和一步预测设置,以确保模型和资产的严格样本外评估与比较。对七只美国大盘股进行一致分析,使用相同评估指标。
定量分析
将提出的情绪条件生成对抗网络(GAN)框架与统计 ARIMA 模型和深度学习 LSTM 模型对比,基于标准回归指标在测试数据上评估预测性能。
结果显示,无模型在所有资产上表现相同,情绪条件 GAN 模型在高波动性和强情绪驱动的股票上表现佳,融入情绪信息可提升模型反映市场短期动态的能力。
LSTM 在时间频率结构更易预测的股票上有竞争力,多数情况下比 ARIMA 误差小,ARIMA 处理线性依赖合适,但在市场波动大时预测误差大。NVDA 仅报告了 ARIMA 和 LSTM 结果,因未对其测试情绪条件 GAN 模型。
定量结果表明,情绪条件 GAN 模型能提高预测准确性,LSTM/RNNs 适合预测价格走势平稳的资产。

定性分析
本小节对代表性预测与实际价格路径进行定性分析,旨在可视化预测准确性并了解不同建模范式对市场特征的反应,数据为纯样本外行为。
以Meta为例,情绪条件生成对抗网络(GAN)模型能更好跟踪高波动、情绪驱动股票的价格突变和短期方向变化,说明情绪调节是预测市场对外部事件反应的有效信号。

像Alphabet这类价格动态连续稳定的资产,GAN模型预测与实际价格偏差大,LSTM模型凭借循环特性更适合学习长期时间相关性。

以特斯拉为例,情绪条件GAN模型对价格方向突变反应更灵敏,说明情绪敏感建模能适应高动态市场环境。

定性分析强化了定量结果,表明无通用最佳建模方法,模型有效性依赖市场机制,LSTM适用于可预测资产,情绪条件GAN在受外部信息和投资者情绪影响大的环境中有优势,强调模型选择和混合建模在股票价格预测中的重要性。
聚合鲁棒性和比较性能分析
表3呈现基于RMSE值的总体性能统计,结合均值和中位数RMSE可评估整体准确性并减少极端误差影响。

结果显示,LSTM模型的均值和中位数RMSE最低,体现时间关系呈现的一致性。情绪条件GAN模型总获胜次数少但在部分高波动、高情绪敏感性资产中有竞争力。ARIMA基线误差大,分析复杂非线性市场动力学能力弱。
讨论
股票价格预测表现取决于资产特性和当前市场制度,非单一建模范式。顺序深度学习结构在价格动态按稳定时间序列变化的环境中有效,循环记忆模型适配此类依赖。市场力量内生时,历史价格数据用于短期预测足够,外部信息边际价值受限。
纳入情绪信息对价格易受外部因素影响的股票预测最有效,情绪是特定制度指标,非通用预测因素。
研究结果对金融预测中的多模态数据融合有启示,条件处理过程更能捕捉分布不确定性,与条件生成建模和情绪导向预测发展相符。
传统统计方法结果欠佳,反映现代金融市场线性假设不足;自回归模型有代表性弱点,经典与深度学习架构在复杂市场表现差距扩大。
情绪条件模型在某些情况表现更好,符合行为金融理论,但不意味着市场持续低效和可预测,与适度市场效率观点相符。
解释当前研究结果需考虑不足:基于日信息和社交媒体情绪分析,未反映日内变化和长期信息影响;情绪信号有噪声、平台特定且可能有偏差;复杂架构难应对极端波动,金融市场不确定性大,提供稳定预测性能有挑战。
未来研究方向
一是探索能动态改变对数值和文本输入依赖的制度意识架构;
二是整合宏观经济指标、分析师报告等替代上下文来源;
三是纳入可解释性方法提升实施透明度与实用性。这些研究方向表明上下文敏感的深度学习模型可用于金融预测并考虑市场动态的结构不确定性。此外,强调论文模板格式不可修改,其规格是为适配整个会议文集。

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。