自适应金融时间序列预测框架,有效缓解真实数据与历史数据的分布漂移问题

“History Is Not Enough: An Adaptive Dataflow System for Financial Time-Series Synthesis”


在量化金融中,由概念漂移和分布非平稳性驱动的训练和现实表现之间的差距仍然是构建可靠数据驱动系统的关键障碍。现有自适应数据处理和增强方法无法随数据和模型状态持续调整,缺乏基于下游学习任务反馈自动调节转换操作的控制器。


本文提出了一个漂移感知数据流系统,该系统将基于机器学习的自适应控制集成到数据管理过程中。大量实验表明,我们的框架增强了模型的鲁棒性,提高了风险调整后的收益。


图片


【 扫描文末二维码加入星球获取论文 】


摘要


在量化金融中,由概念漂移和分布非平稳性驱动的训练和现实表现之间的差距仍然是构建可靠数据驱动系统的关键障碍。在静态历史数据上训练的模型经常过拟合,导致动态市场的泛化能力差。“历史是不够的”这句咒语强调了适应性数据生成的必要性,这种数据生成需要学会随着市场的发展而发展,而不是仅仅依赖于过去的观察。


本文提出了一个漂移感知数据流系统,该系统将基于机器学习的自适应控制集成到数据管理过程中。该系统将参数化数据操作模块与自适应计划-调度程序相结合,该模块包括单库存转换、多库存混合和管理操作,该计划-调度程序采用基于梯度的双级优化来控制系统。该设计将数据增强、课程学习和数据工作流管理统一在一个单一的可区分框架下,实现可识别来源的重播和连续的数据质量监控。


在预测和强化学习交易任务上的大量实验表明,我们的框架增强了模型的鲁棒性,提高了风险调整后的收益。该系统为财务数据的自适应数据管理和学习导向工作流自动化提供了一种通用的方法。


简介


机器学习技术广泛用于量化金融研究,如交易和预测,其成功源于利用海量金融数据。但市场动态变化带来挑战,机器学习应用的 i.i.d. 假设常不成立,导致模型过拟合、对新数据鲁棒性降低。金融市场自然演变产生概念漂移,使不同时间的联合概率分布不一致,这不仅是建模难题,也是数据管理问题,需自适应数据流管理不断变化的金融数据流。


数据操纵技术(如数据增强)能增强机器学习模型的鲁棒性和泛化能力,拓宽训练数据集。与基于代理的模型和深度生成模型相比,数据增强简单高效,但在量化金融领域未广泛应用,主要挑战是时间序列数据(尤其是金融数据)缺乏通用增强操作基准,因增强易破坏金融数据的保真度和相关性。为此设计参数化数据操纵模块,结合特定领域约束,将增强从启发式预处理步骤转变为可控、可审计的数据流组件,生成多样且保真的数据。


量化金融中数据、模型和任务多样,现有自适应数据处理和增强方法无法随数据和模型状态持续调整,缺乏基于下游学习任务反馈自动调节转换操作的控制器。本文引入学习引导规划器,由自适应规划器和节奏调度器组成,作为自主工作流管理器动态调整数据合成操作。本文提出漂移感知自适应数据流系统,统一金融数据合成、增强调度和基于学习的反馈控制,构成自适应数据管道提升数据质量和模型鲁棒性。


相关工作


数据增强技术在时间序列分析中探索较少,尤其缺乏金融时间序列数据增强的基准。现有方法有局限性,如特定方法要求数据周期性、固定策略随机性不足、自动增强需大量计算资源且限制随机性。


课程学习能提升泛化能力,AdaAug和MADAug结合数据增强技术用于学习图像特征,但缺乏针对时间序列数据尤其是金融领域的有效增强策略工作流。


生成增强数据可扩展历史数据,基于代理的建模依赖主观行为模型,计算成本高、参数调整复杂且缺乏泛化性;深度生成模型需复杂训练,评估指标解释性差,难以融入数据管理流程。


预备知识


定义


金融数据与K线表示:金融数据以K线元组形式组织,需满足


图片


图片


,用于预测输入和强化学习状态。


时间序列预测:给定多元金融时间序列 X,用长度为 L 的回溯窗口预测下一期目标 y^t,目标是最小化均方误差损失,预测目标为一步收盘价回报率。


图片


图片


图片


强化学习用于交易:将交易环境建模为马尔可夫决策过程,状态包含近期特征和当前仓位,动作空间为卖、持、买,奖励函数考虑市场回报和交易成本,目标是通过策略最大化价值函数。


图片


金融数据中概念漂移的观察


研究金融数据概念漂移并与天气、电力、ETT 时间序列数据集对比,通过可视化 Pt(Y∣X) 和 P(X) 考察概念漂移,金融数据中 X 为市场价格和特征,Y 为次日收盘价回报,用 t-SNE 图标记训练和测试数据及可视化 Pt(X) 。与麦当劳股价对比,基准数据集 Pt(Y∣X) 和 P(X)分布更重叠,表明股票数据概念漂移更明显。


图片


验证-测试分布


t-SNE 可视化能定性展示训练集与测试集间的概念漂移,本文方法假定验证数据比历史训练数据更接近近期测试分布。为验证该假设,用三种统计距离指标(PSI、K-S 统计量、MMD)对训练-测试、验证-测试数据集对进行定量邻近分析,给出各指标公式,指标值越高,基线与目标样本分布差异越大。


图片


图片


图片


将市场特征与目标结合为多变量时间序列数据。股票数据集(2000 - 2024 年,每日)采用滚动年协议,按 0.6/0.2/0.2 划分 Train/Validation/Test 子集;加密货币数据集(2023 - 09 - 27 至 2025 - 09 - 26,每小时)采用高频滚动协议,每月扩展训练范围,同样按 0.6/0.2/0.2 划分。各折评估 Train - Test 和 Validation - Test 特征分布的 PSI、K - S 和 MMD,结果显示 Dist(Val, Test) < Dist(Train, Test),支持用验证反馈指导自适应增强和规划器更新。


图片


自适应控制目标的定义


为缓解强概念漂移带来的不确定性,通过处理训练数据提升模型泛化能力。任务模型为 f_θ(x),学习目标是:


图片


用 D_{train} 表示训练集,D_{valid} 表示验证集,L_{val} 为验证损失。通过操作模块 M 处理训练数据 x_{train} 得到 图片 图片,目标是开发简单有效的自适应 M 解决金融数据概念漂移导致的泛化问题。


增强操作


单股转换操作


  • 鲁棒性增强:引入适用于嘈杂金融数据的可控变化,如抖动加噪、缩放缓解波动偏差、幅度翘曲用三次样条插值施加非线性失真。

  • 结构变化:排列保留局部连续性但打破严格顺序,反映市场演变的部分随机性。

  • 分解与重组:STL增强将序列分解为趋势、季节性和残差,对残差进行自助抽样以更好建模制度转变和非平稳性。


多股混合操作


  • 段替换操作:用一只股票的部分替换另一只,如 Cut Mix,会造成局部干扰。

  • 加权平均操作:用加权平均组合数据,实现平滑过渡,如 Linear Mix 线性组合两只股票。

  • 频域操作:组合频率分量捕捉周期模式,如 Amplitude Mix 混合两只股票傅里叶变换的振幅,Demirel 和 Holz(2024)通过混合相位和幅度来组合重要频率。


方法


先描述整体工作流及数据处理方式,再介绍可增强数据多样性且保留真实性和可追溯性的参数化数据处理模块 M,最后详述由课程规划器和过拟合感知调度器组成的学习引导控制器,该控制器基于验证反馈调节操作强度和比例,实现数据管理与模型学习闭环,保障工作流可复现性、质量及来源追踪。


总体工作流程


为有效优化目标,提出图2工作流。数据操作模块M用操作选择概率矩阵p和操作强度参数λ生成增强训练样本,引入可训练规划器g自适应控制M,学习策略π ϕ ,调度器用启发式算法确定数据操作比例α。任务模型更新与规划器更新在验证反馈上交错进行,保留溯源信息以实现精确重放。受AdaAug和MADAug启发,将自适应增强课程学习表述为双层优化问题,规划器和任务模型按各自目标交替训练。


图片


参数化数据操作模块


本文提出数据处理模块 M,它是参数化合成模块,针对金融时间序列特性设计,通过操作选择概率矩阵 p 和操作强度因子 λ 整合内部操作,引入多样性同时保留金融有效性。训练样本操作受 p 和 λ 引导,变换和混合层引入多样性,筛选、归一化和插值层保证经济合理性。模块通过四个紧密耦合组件编码金融时间序列特性,每个原语受金融完整性约束和归一化/反归一化检查。


图片


变换层:对原始输入特征应用单股票变换操作,操作参数化,如抖动、缩放等操作的强度由 λ 控制。


筛选和归一化层:单股票变换后,设置最高和最低价格特征以保持金融一致性;为进行混合操作需对数据归一化,多层操作时数据重新引入工作流要反归一化。


混合层:对归一化数据进行多股票混合操作,选目标股票 b 时依据协整检验 p 值找出与源股票 a 最相关的前 k 只,用操纵强度参数 λ 变换 p 值控制选择概率,变换后归一化得 Q 并从中采样选 b。混合方法因结合不同股票特征和目标而目标可变,不同操作中 λ 有不同作用。


图片


插值补偿层:为减轻潜在极端样本影响,提出基于互信息的 Binary Mix 策略。该策略根据原始数据与增强数据间的互信息自适应调整插值比例,互信息少则用原始数据更多补偿。


图片
图片


自适应学习


设计统一策略控制参数化数据操作模块非易事,引入自适应规划器联合观察模型和数据状态确定最优参数,用过拟合感知调度器通过动态课程逐步整合增强样本。


训练规划器


训练规划器 gϕ 学习策略 πϕ(p,λ∣f,x) 优化目标函数,状态包含任务模型 fθ 和输入样本 xi,用其高层表示,模型状态从倒数第二层全连接层提取特征,输入样本计算均值、波动率等关键指标。


本文提出受夏普比率启发的损失函数 应对金融任务推理不确定性风险,实验中 γ 设为 0.05。


图片


过拟合感知调度器


提出过拟合感知调度器,规划器控制操作选择概率 p 和操作强度 λ,调度器确定数据操作比例 α 以提供合理课程。CV 研究中固定应用增强可能不适用于金融市场不确定性问题,故提出动态数据操作策略。课程学习使模型从简单到复杂示例学习,α 随训练轮次增加,但过度操作会影响学习。通过监控验证损失判断是否过拟合,若当前轮次验证损失未低于上一轮次指定阈值,移除频繁操作惩罚项引入更多样数据。调度数据操作比例可平衡泛化性和鲁棒性,提升模型处理市场不确定性的能力。


图片


规划器训练策略


针对复杂的双层优化问题,采用联合训练规划器(g_ϕ)和任务模型(f_θ),任务模型在训练循环中训练,规划器在验证循环中训练,基于局部时间平滑假设,以验证风险替代测试风险,交替更新方案见算法4。


图片


图片


先更新任务模型f_θ,规划器每 freq 步训练一次,学习策略 π_ϕ(p, λ |f_θ, x_i),用当前步骤 f_θ 副本 f_{θ’} 的验证损失。学习操作 p 的选择概率时,生成操作的增强数据并加权求和,以更好估计更新(ϕ)。处理不可微操作时,用直通梯度估计器优化操作强度(λ)。


图片


规划器(ϕ_t)的外循环更新公式为


图片


实验


评估自适应数据flow系统是否有效应对三大挑战:

  • 工作流有效性:与现有管道相比,是否提升下游任务稳健性和数据处理效率。

  • 系统适应性:工作流能否跨异构模型和任务通用。

  • 数据保真与策展质量:管道能否生成适用于下游分析的多样且真实的金融时间序列数据。


实验设置


数据集:评估两个金融市场数据,股票(2000 - 2024 年道指 27 只股票日线)和加密货币(2023 - 2025 年 BTC 等 4 种小时线),按 0.6、0.2、0.2 分训练、验证、测试集,在训练集内做统计计算,用 RTX 4090 GPU 实验。


增强数据基准:与 TimeGAN 等代表性时间序列生成模型生成的数据对比。


全工作流基准:与原始、RandAugment、TrivialAugment、AdaAug 方法对比。


任务模型:用 GRU 等 5 种架构评估预测任务,DQN 和 PPO 评估交易任务,采用两阶段架构,设置学习率等超参数。


强化学习环境:实现单资产离散行动交易环境,用全仓进出机制,有交易成本和净值变化,定义动作空间、执行规则。


结果


用五种不同模型族的代表任务模型测试方法。在一日收盘价回报预测任务上训练模型并以 MSE、MAE 和损失标准差评估性能。结果显示该方法表现最佳,大幅降低各指标。不同模型对增强数据反应不同,强模型用 RandAug 和 TrivialAug 表现好,弱模型使用可能有负面影响,需自适应规划器确保模型无关工作流,调度器比 AdaAug 更有效。


图片


为评估学习策略的可迁移性,进行实验:将基于LSTM任务模型在单日回报预测任务中训练的规划器g ϕ应用于使用DQN和PPO的单股票交易任务,去除所有混合操作后集成到RL单股票训练流程。调度器采用简化方法设置α值。为DQN和PPO设置相关参数。用总回报(TR)衡量盈利能力,夏普比率(SR)评估风险控制能力。结果显示该方法增加利润、降低风险,证明可迁移性。以DQN在INTC上的结果为例,虽总回报略低但风险调整后回报更高,表明风险控制更优,该方法使DQN交易更谨慎,性能提升或因训练时接触更多市场场景,缓解概念漂移导致的泛化问题。


图片


图片


消融分析


对加密货币数据集进行消融实验评估数据处理流程各组件贡献:移除多股票混合模块使各预测模型的MSE、MAE和STD上升,表明跨资产信息利于学习通用时间动态;用固定调度器替代自适应调度器致性能下降,凸显可学习课程调整增强强度的重要性;禁用调度器和规划器使性能更差,尤其对TCN和Transformer架构;结果表明训练中需动态且针对模型控制增强,混合、自适应调度和学习规划器结合可提升预测框架的鲁棒性和准确性。


增强数据质量评估


为确保增强数据使用安全,从金融角度对其质量进行定性和定量评估:


  • 应对概念漂移:对比训练和测试分布,发现增强训练样本更接近测试集,能缓解概念漂移。


图片


  • 变量可控性:通过 tSNE 图表明,数据操作参数可调,可使合成数据分布产生可预测变化。


图片


  • 下游可用性:用 LSTM 预测 DJI 指数股票收盘回报,所选操作均提升预测准确率。


图片

  • 判别得分:用 RNN 分类器评估增强数据保真度,该方法判别得分最低,金融保真度最高。


图片


  • 市场典型特征:计算回报自相关性、绝对回报自相关性和杠杆效应,增强数据的典型特征与真实金融数据最相符。


额外的分析


操作权重:用溯源感知重放可视化概率操作 p 的权重,其随任务模型训练而变化,不同模型间权重差异大,表明需模型无关的自适应策略规划器。


图片


学习曲线:通过图 8 定性分析方法性能提升原因,与原工作流相比,该方法验证损失更低,能成功泛化并解决概念漂移导致的过拟合问题。


图片


总结


本文介绍一种新型自适应数据流系统,用于弥合量化金融中训练与实际表现的差距,系该领域首个此类工作流。框架将参数化数据处理模块与学习引导的规划-调度器集成,形成反馈循环,随模型演变动态调节处理强度和数据比例,使数据管道能适应分布漂移,确保学习过程中数据质量和合成的真实性。预测和交易任务实验表明,该系统提升了模型和市场的鲁棒性与泛化能力。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询