Q-A3C²:基于时间序列动态聚类的量子强化学习自适应ETF股票选择,标普500成分股累计回报达17.09%
“Q-A3C²: QUANTUM REINFORCEMENT LEARNING WITH TIME-SERIES DYNAMIC CLUSTERING FOR ADAPTIVE ETF STOCK SELECTION”
传统 ETF 按季或半年调整成分股,常滞后市场变化,多数基于聚类的投资组合策略静态,难适应市场变化,催生动态聚类方法。
本文提出Q-A3C²,融合时间序列动态聚类的量子增强A3C框架。对标普500成分股的实验显示,Q-A3C²累计回报达17.09%,展现出在动态金融环境中的适应性和探索性。

【 扫描文末二维码加入星球获取论文 】
摘要
传统ETF选股方法和A3C等强化学习模型在复杂金融市场存在高维特征空间和过拟合问题,静态聚类算法难捕捉市场动态。本文提出Q-A3C²,即融合时间序列动态聚类的量子增强A3C框架,通过在策略网络嵌入VQCs增强非线性特征表示并实现集群级自适应决策。对标普500成分股的实验显示,Q-A3C²累计回报达17.09%,优于基准的7.09%,展现出在动态金融环境中的适应性和探索性。
简介
传统 ETF 按季或半年调整成分股,常滞后市场变化;主动基金经理持仓集中,需多元化与自适应配置,机器学习和强化学习被用于动态调仓。多数基于聚类的投资组合策略静态,难适应市场变化,催生动态聚类方法。
量子机器学习发展,量子 - 经典混合架构在 NISQ 硬件上表现佳,量子强化学习用于投资组合优化和期权定价有成效。已有研究提出量子增强的 A3C 模型,表现优于经典基线。
本研究探讨量子增强强化学习能否改进 ETF 选股,针对传统方法高维特征低效、过拟合及聚类静态问题,提出Q-A3C²框架,可捕捉动态市场结构,交易表现佳且跑赢基准。
Q-A3C²
实验以S&P 500为业绩比较基准,Q-A3C²框架每月滚动调整投资组合,投资标的为S&P 500成分股。引入时间序列动态聚类到强化学习环境,根据前L天市场结构选簇,以当月簇回报为学习反馈。

数据与特征构建
收集2021.8 - 2024.8数据用于训练,2024.12 - 2025.8数据用于验证。
为每只股票提取5日累计回报、20日累计回报和20日回报波动率三个特征。
时间序列动态聚类与市场结构
采用时间滚动聚类策略,降低特征维度。
用K - Means聚类为股票分配簇ID,每个簇代表不同市场行为组。

状态表示:定义时刻t的状态,每个簇用四维表示。


动作与奖励设计
插入变分量子电路(VQC)作为策略网络的非线性瓶颈,映射状态到量子特征计算动作对数。
用参数匹配的MLP瓶颈替换VQC实现经典对照。
通过温度调整的softmax获取动作概率,促进平衡探索。



初始探索z分数奖励,因制度转变和重尾回报下学习不稳定,采用相对最优奖励,该奖励有界且无标度,能减少单模式崩溃,实现稳定收敛。

与传统A3C不同,将每月视为一个情节决策问题,符合ETF每月再平衡节奏,可缓解非平稳性。每月初,智能体观察最近L个交易日的市场结构并选择一个集群分配,以次月集群回报作为情节奖励,能控制时间范围,减少回报的长期方差,使学习信号与部署计划一致。
实验
对比实验设置:设经典基线(用MLP瓶颈替换VQC块),对比静态聚类和无RL滚动聚类策略。
训练稳定性与奖励机制:Z - Score奖励使模型易过拟合,相对最优奖励提升收敛稳定性,约2000个epoch后累积奖励稳定。

交易表现:模型训练4500个epoch,在2024 - 12至2025 - 08样本外验证,累计回报17.09%,超标普500的7.09%,能动态调仓。

集群选择动态:验证前期集中高波动成长股,2月后扩大选股数、分散多行业,5月集中单股,6月后分散至防御板块;所选集群后续回报高,体现动态聚类机制有效性。


总结

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。