DeepAries:自适应动态平衡增强投资组合选择
“DeepAries: Adaptive Rebalancing Interval Selection for Enhanced Portfolio Selection”
传统投资组合优化方法多为静态或单期决策,现实需动态、顺序决策,解决何时再平衡和如何分配的问题。现有强化学习方法采用固定再平衡间隔,忽略市场条件,产生不必要交易成本,缺乏智能确定最优再平衡时机的能力。
DeepAries是一个强化学习框架,其能基于市场条件动态调整再平衡区间,将自适应区间选择与基于Transformer的预测相结合,区别于传统固定区间策略,可有效捕捉市场动态、降低交易成本。多市场评估显示,自适应选择再平衡区间可提升风险调整后回报和投资组合整体表现,交互式演示凸显该框架实用性。

【 扫描文末二维码加入星球获取论文、源码 】
摘要
DeepAries是一个深度强化学习框架,用于动态投资组合管理,共同优化再平衡决策的时间和分配。与先前的强化学习方法不同,DeepAries采用固定的再平衡间隔,而不考虑市场条件,DeepAries自适应地选择最佳的再平衡间隔以及投资组合权重,以减少不必要的交易成本并最大化风险调整后的回报。在多个真实金融市场上进行的大量实验表明,在风险调整后的回报、交易成本和回撤方面,DeepAries明显优于传统的固定频率和完全再平衡策略。

简介
传统投资组合优化方法多为静态或单期决策,现实需动态、顺序决策,解决何时再平衡和如何分配的问题。现有强化学习方法采用固定再平衡间隔,忽略市场条件,产生不必要交易成本,缺乏智能确定最优再平衡时机的能力。
DeepAries解决混合决策问题,结合离散再平衡间隔选择与连续资产分配,利用Transformer编码器和PPO训练代理,自适应调整再平衡和资产分配,减少成本并把握机会。实证表明DeepAries在四个国际市场表现优异,提升回报和风险调整回报。
本文提出自适应再平衡间隔选择强化学习公式,集成Transformer编码器处理多资产数据,优化联合行动空间。实证显示自适应选择再平衡间隔优于固定策略,通过互动演示验证方法的现实适用性。
相关工作
经典和静态投资组合优化
现代投资组合理论由Markowitz提出,基于均值 - 方差优化建立静态框架。传统方法如CAPM聚焦单期决策,无法动态适应市场,常依赖启发式定期再平衡策略,应对市场变化可能不足或产生不必要交易成本。
投资组合管理的强化学习
近期强化学习方法推动了投资组合管理发展,可动态调整资产配置。Jiang等提出EIIE,用CNN网络进行资产评估。Zhang等提出成本敏感框架,将交易成本和风险惩罚纳入奖励函数。Kim等提出HADAPS,用异步优势演员评论家算法解决投资组合选择问题。
基于Transformer的时间序列模型
Transformer架构在金融应用中成效显著,能捕捉复杂时间依赖且无需大量手动特征工程。Xu等提出的Relation - Aware Transformer(RAT)通过自注意力机制建模资产交互提升性能。Choi等提出的DeepClair将基于Transformer的市场预测融入强化学习框架,增强市场波动时的自适应决策能力。
现有强化学习方法的局限性及自适应再平衡区间选择
现有基于强化学习的投资组合优化方法多采用固定每日全额再平衡,增加交易成本,部分调整方法因动态确定再平衡时机和规模的复杂性而未充分探索。为此,DeepAries框架引入自适应再平衡区间选择,基于实时市场动态选择区间,结合Transformer编码器与近端策略优化算法,兼顾再平衡区间和投资组合分配,平衡响应性与成本效率。
问题建模
将自适应投资组合管理建模为强化学习问题,代理在决策点 T_m 观察市场状态 s(T_m) 后采取两个行动:

区间选择 a_ℓ(T_m):从预定义集合 H 中选重平衡区间 h_m。
投资组合分配 a_ρ(T_m):确定投资组合权重向量 w(T_m),需满足一定条件。

下一个决策点 T_m+1,定义价格相对向量 g(x_0) 用于计算投资组合价值变化。

投资组合回报 R(T_m, h_m),代理奖励 r_m 是其变形,可调整以促进最优区间决策。



重平衡会产生交易成本,根据预重平衡权重 w′(T_m) 计算交易成本因子 μ(T_m)。


投资组合价值更新公式为

RL 代理目标是最大化最后决策时刻 𝑇𝑀 的最终投资组合价值 𝑉 ( 𝑇𝑀 ),优化问题表述可使策略以适应市场的方式联合优化再平衡频率和资产配置。

DeepAries
DeepAries是一种端到端的深度强化学习框架,可联合确定再平衡时机(交易间隔)和资产配置(投资组合权重),能根据市场变化自适应选择最佳再平衡周期,不同于假设固定交易频率的传统方法。
投资组合选择的挑战
C1:股市数据高维、非平稳且资产间依赖复杂,捕捉时序和截面关系对选组合至关重要。
C2:固定再平衡间隔有局限,波动市场高频交易可降回撤,稳定市场低频再平衡可降成本。
C3:联合学习离散(再平衡间隔)和连续(组合配置)动作会致训练不稳定,需鲁棒强化学习算法联合优化。
DeepAries的核心思想
1)探索多种变压器架构(如经典Transformer、Informer等),通过多头自注意力捕捉时空依赖。
2)引入离散策略自适应选择再平衡区间,用网络 𝑓_adapt 实现。
3)采用PPO联合学习再平衡区间和投资组合权重,投资组合分配网络 𝑓_port 输出高斯策略参数。
算法
算法1总结训练过程,决策时刻t选重平衡区间h,据提取特征确定投资组合权重。

实现细节
数据处理:将历史数据 X(t) 经 Transformer 编码器 M_θ 处理得隐藏表示 H(t),再经时间注意力机制和前馈块得嵌入 e(t),用于自适应区间选择和资产配置。



自适应区间选择:函数 f_adapt 将 e(t) 映射为对数 z~(adapt)_(t),经 softmax 得候选区间概率分布 p_t(ℓ),抽样确定下一决策时刻 t+h。
资产配置:函数 f_port 生成高斯策略参数 μ(t) 和 σ(t),抽样、经 tanh 激活和归一化得有效资产权重 w(t)。



价值函数估计:为每个候选区间维护价值函数估计器 (⋅),状态 X(t) 的总体价值估计为加权和,以考虑不同区间的风险 - 回报权衡。

损失函数
DeepAries目标是学习交易策略,兼顾再平衡时机与资产分配,以最大化累计回报并考虑交易成本。定义联合策略

采用PPO框架优化联合策略,扩展其处理离散(区间选择)和连续(资产分配)决策。离散策略选再平衡区间,连续策略优化所选区间内回报。
应用奖励塑造机制,根据所选区间与最佳区间匹配情况给予奖惩。

定义总体损失函数

此方法使DeepAries能联合学习适应市场动态和投资期限的再平衡与分配策略。
实验
实验设置
对方法在 DJ 30(美)、FTSE 100(欧)、KOSPI(韩)、CSI 300(中)四大市场进行 20 年广泛评估,各实验进行 10 次不同随机种子的独立试验,报告验证损失最低那次的测试结果,详细实验设置见交互式演示。
DeepAries在投资组合选择方面总体优于其他方法
研究对新提出的DeepAries在不同股市环境下的投资组合选择进行实验,定量评估其关键理念(Transformer变体选择、自适应再平衡区间选择、近端策略优化)的益处。结果显示,DeepAries在四个区域市场的20项评估指标中,有17项表现出色,在CAGR、SR、SoR等指标上始终最优,且在不同市场条件下表现良好。在CSI 300市场,只有DeepAries能产生正的风险调整后回报。这表明自适应选择再平衡区间有益,后续还将针对关键设计组件开展额外实验。

自适应再平衡区间选择比固定区间选择产生更好的投资结果
DeepAries核心是根据市场状态选再平衡间隔,进行消融实验,用固定再平衡间隔法替代自适应方法,设固定每日、每周、每月再平衡策略。结果显示,自适应方法在各市场环境的评估指标上均优于固定每日策略,表明固定每日策略有局限。模型在25个评估指标中13个最佳,其余第二。固定每月策略表现稳健,在三个市场SoR最佳。

结论:自适应再平衡可提升投资组合表现,长再平衡间隔比每日再平衡更具弹性,能降低短期调整风险。
带iTransformer的DeepAries通过自适应平衡实现卓越的性能
最优区间选择需利用股市数据的时间模式和横截面关系,Transformer特征提取能力强可提升投资组合表现。
选择合适的Transformer骨干对避免强化学习轨迹不佳很关键,以往投资组合选择模型采用的Transformer架构有限,需全面探索。
借鉴DeepClair,采用多种Transformer架构在四大市场实验,对比自适应和固定每日再平衡区间,还纳入LSTM和TCN模型。
研究表明iTransformer搭配自适应再平衡表现优于固定区间,在多市场提升复合年增长率、夏普比率,降低最大回撤,说明自适应机制能助其捕捉市场动态、调整策略,增强风险调整回报、降低下行风险。

适应性再平衡选择显示了对交易成本上升的增强弹性
交易成本影响投资组合净回报。研究对比自适应再平衡策略(DeepAries)与固定每日再平衡基线策略,选取FTSE 100和KOSPI两个代表性市场,设基线交易成本0.01%,考察成本5倍和10倍增长情况。结果显示,高成本使两种策略表现变差,但固定每日策略受影响更大,DeepAries自适应策略能减轻成本增加的负面影响,回报更高,对交易成本变化更具弹性,适用于现实场景。

总结
DeepAries是一个强化学习框架,其能基于市场条件动态调整再平衡区间,将自适应区间选择与基于Transformer的预测相结合,区别于传统固定区间策略,可有效捕捉市场动态、降低交易成本。多市场评估显示,自适应选择再平衡区间可提升风险调整后回报和投资组合整体表现,交互式演示凸显该框架实用性。

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。