TradingMoE:为演化市场“点兵点将”,当大模型学会动态调配交易专家

“TradingMoE: Routing the Right Experts in Evolving Markets”


在瞬息万变的金融市场中,一个交易策略的成功往往取决于能否在正确的时间调用正确的分析工具。然而,传统的大语言模型(LLM)交易系统要么使用“一刀切”的密集模型,要么依赖人类预先定义好的专家角色,难以适应不同资产、不同决策时刻和不同市场环境的动态需求。面对这一困境,一项突破性的研究给出了全新的答案。


最新研究《TradingMoE: Routing the Right Experts in Evolving Markets》(TradingMoE:在演化市场中路由正确的专家)提出了一种革命性的交易框架。研究者发现,传统的混合专家(MoE)路由器评分与专家实际贡献之间存在巨大偏差,其相关系数低至-0.015,高达66.76%的决策时刻都选错了专家。为了解决这一核心问题,TradingMoE巧妙地设计了一个“查询-键”(Query-Key)路由器,它将每个交易token的实时需求映射为低维查询,与可学习的专家知识库进行精准匹配,并引入“稀疏专家选择更新”机制,让模型在训练中能动态评估并替换表现不佳的专家。


实验数据令人瞩目:在股票市场上,TradingMoE的累计回报高达49.08%,比最强基线LightGBM高出30.89%;在波动剧烈的加密货币市场,其回报率更是达到73.79%,展现出惊人的鲁棒性。这项研究为AI在复杂金融场景下的决策生成开辟了全新路径。


图片


【 扫描文末二维码加入星球获取论文,源码 】


摘要


大型语言模型(LLMs)在金融分析和交易方面展现出巨大潜力,但直接用于交易仍具挑战性,因为所需的预测能力会因资产、决策领域和市场状况而异。现有的基于LLM的交易系统要么协调人类定义的外部专家,要么采用传统的内部混合专家(MoE)路由器,但这些路由器并不直接评估单个专家对交易决策的贡献。此外,当市场条件变化时,这些路由器也接收不到任何指示“不活跃专家”变得更为合适的直接信号。


研究发现,原生路由器的评分并不能很好地反映单个专家对交易决策的改进程度,并经常导致更优的专家未被选中。研究进一步揭示,特定于token的专家有用性呈现出一种紧凑的低维结构。基于这些发现,本文提出了TradingMoE,一种面向交易的稀疏MoE模型,它通过轻量级的残差专家来增强冻结的密集LLM。


TradingMoE引入了一个查询-键(Query-Key)路由器,将当前市场上下文中每个token所需的专业知识表示为一个低维查询,并与可学习的专家键进行匹配。文章还提出了一种稀疏专家选择更新机制,在训练期间采样少量不活跃专家,并评估它们是否应替换当前Top-k路由中最弱的专家。该机制使路由器能够随着市场条件的变化更新专家选择,同时保持稀疏计算。


在股票和加密货币市场上针对22个基线的实验表明,TradingMoE的累计回报分别比表现最好的基线高出30.89%和30.7%,并分别超过相应的买入并持有基准37.81和80.17个百分点。


简介


人工智能已广泛应用于交易领域,支持回报预测、资产排名和投资组合优化等任务。近期,金融LLMs使得联合处理异构市场信息成为可能。现有方法要么使用LLMs提取信号并支持市场分析,要么直接生成交易决策。然而,这些方法通常依赖单一的密集模型或固定的智能体工作流来处理所有市场状态和决策组件。这种统一的计算方式不适合异构且非平稳的金融市场,因为所需预测能力会因资产、决策领域和市场制度而异。这一局限性促使我们需要能够根据当前交易环境动态分配专门建模能力的方法。


现有基于LLM的交易系统通常通过外部专家路由实现专业化,即一个LLM协调人类定义的外部模块,如新闻分析师和价格预测器。然而,这类系统依赖预定义的专家角色,并且通常将整个市场状态或交易任务路由给少数几个模型级别的专家,这使得难以跨资产、信息token和决策领域来调整专家使用。内部专家路由,通常通过稀疏MoE实现,提供了更细粒度的替代方案,通过学习到的路由器仅为每个token激活一小部分专家。然而,传统的路由器主要通过任务损失和路由正则化器进行训练,这并未直接揭示每个专家的贡献或未选中的专家会表现如何。此外,每个专家对交易决策的贡献可能随着市场条件的变化而变化。这留下了一个核心问题:如何评估每个专家对交易决策的贡献,并跟踪其随市场条件变化的变化?


图片


关键挑战在于:

  • 量化专家贡献:传统路由器从token隐藏状态分配专家分数,但训练目标并不直接验证分数更高的专家是否更能减少交易决策损失。

  • 学习更新专家选择:专家贡献具有市场依赖性,路由器必须学习何时一个不活跃的专家已成为更好的选择。


研究表明:原生路由器分数与专家替换带来的收益之间的皮尔逊相关系数仅为-0.015,且66.76%的决策token至少有一个更好的专家未被选择。通过定义反事实专家信用并使用一阶近似,研究发现token-专家信用矩阵具有显著的低秩结构。示例显示,在OLMoE和DeepSeek-V2-Lite模型上,秩为16的重建分别保留了74.2%和77.9%的信用能量,并在超过98%的决策token上识别出了比原生路由器信用更高的专家。


图片


本文主要贡献在于:

  • 揭示了原生路由器选择专家不佳的问题,并发现token-专家反事实信用具有近似低秩结构。

  • 提出了TradingMoE,包含查询-键路由器用于建模专家贡献,以及稀疏专家选择更新机制用于适应市场环境变化。

  • 为专家选择更新机制提供了理论证明,证明不活跃专家采样的无偏性以及路由边距更新与专家替换带来的局部损失减少的一致性。

  • 在股票、加密货币和滚动模拟交易上的广泛实验表明,TradingMoE优于22个基线。


相关工作


传统AI交易方法


通常依赖结构化市场信号(如价格-量特征),使用机器学习(如LightGBM)或深度学习(如LSTM)来预测回报或排名。强化学习方法将交易建模为序列决策问题。但这些方法通常基于固定的数值输入,难以整合异构金融信息。


基于LLM的交易方法


近期研究将LLMs适应于金融场景,包括文本理解、文档分析和市场预测。更近期的基于LLM的交易系统通过智能体工作流向直接决策迈进,但它们通常依赖单一密集模型或固定工作流,灵活性有限。


交易中的专家路由


外部专家路由将分析和决策分解为人类定义的专家模块,但预定义的专家角色和粗粒度的路由限制了其适应性。内部专家路由在Transformer层内进行token级别的专家选择,实现了更细粒度的专业化,但传统内部路由器缺乏对未选中专家能否减少损失的监督。


预备知识


每日交易任务定义


将交易任务建模为一个决策生成问题。对于每个交易日n,输入是候选资产集合X。决策时间τ是预定义的。资产由结构化序列表示,包含部门、市值、五日OHLCV历史、指标和带时间戳的新闻。模型生成交易决策Y,每个决策y_i = (a_i, q_i),其中a_i ∈ {买入, 卖出, 持有},q_i ≥ 0为头寸规模。


内部专家路由


市场输入X首先被标记化并映射为嵌入矩阵H^0。在路由Transformer层ℓ中,输入H^{ℓ-1}经过注意力子层得到H̄^ℓ。对于每个token t,路由模块包含E个低秩专家。专家i的输出定义为:


图片图片图片


其中A^ℓ是共享的下投影矩阵,B_i^ℓ是专家特定的上投影矩阵,d_{lr}是低秩维度。


图片


一个特定层级的评分多层感知器为每个专家生成路由分数:


图片


路由器激活K个分数最高的专家:


图片


路由权重通过Softmax计算:


图片


专家输出被聚合为稀疏专家残差:


图片


最终的token表示为:


图片


训练目标:模型定义了自回归分布p( Y | X )。训练目标是最小化真实交易决策的负对数似然:


图片图片图片


在训练期间,LLM骨干网络参数保持冻结,仅更新专家参数Φ和路由器参数Θ。


方法


概述


TradingMoE框架如图2所示。结构化市场状态由冻结的LLM骨干网络处理,其路由Transformer层被增强了token级别的稀疏残差专家。最终隐藏表示被解码为结构化的交易决策。TradingMoE包含两个关键组件:查询-键路由器和稀疏专家选择更新。


图片


查询-键路由


受token-专家信用低秩结构的启发,文章提出查询-键路由器来参数化token-专家路由分数。


低秩查询-键匹配:在路由层ℓ,查询网络接收token t的注意力后表示h̄_t^ℓ,并将其映射到低维的“交易需求”查询:


图片


其中d_q是路由维度。每个专家i关联一个可学习的键u_i^ℓ ∈ R^{d_q}。路由分数通过查询和键的点积计算:


图片


完整的查询-键分数矩阵S^ℓ = Q^ℓ (U^ℓ)^T的秩≤ d_q,提供了与观察到的低秩信用结构一致的紧凑参数化。


图片


专家路由与聚合:遵循标准Top-K选择、权重归一化和加权聚合过程。


稀疏专家选择更新


在原生Top-k路由中,任务损失仅反向传播通过选中的专家输出及其分数,不活跃专家接收不到信号。为解决此问题,文章提出稀疏专家选择更新机制。1


分离路由边距:首先从非活跃专家中随机采样m个候选专家,记作Î_t^ℓ。定义当前Top-k路由中分数最低的专家为e_low^ℓ。对于每个采样的非活跃专家i,将其路由分数与e_low^ℓ的分数进行比较。为防止监督信号传播到注意力子层,使用分离的token表示计算分数边距:


图片


其中stopgrad(·)阻止梯度传播。正值表示采样专家分数高于最低分专家。


同一步骤的路由器更新:将分离的路由边距与对应的专家输出差异相结合:


图片


通过h_t^ℓ 将信息注入输出。


图片


由于ξ_t^ℓ在正向传播中相互抵消,模型预测和任务损失不变。但在反向传播中,梯度会更新查询网络参数Θ和专家键矩阵U,包括采样专家的键。训练目标是最小化L_task(Φ, Θ, U)。


理论证明


命题1:不活跃专家采样是无偏的。证明通过均匀无放回采样,采样梯度平均是所有非活跃专家梯度平均的无偏估计。


图片


命题2:路由边距更新与专家替换的局部损失降低一致。证明通过反向传播推导,如果替换最低分专家预期能降低任务损失,梯度下降会增加路由边距Δs,反之则减少。


图片图片图片图片


实验


实验设置


数据集:

  • Stock:源自FNSPID,包含33只美国股票,时间跨度2021-2023,按7:1:2比例时间顺序分割。

  • Crypto:自收集的10种加密货币,评估期2025年。


基线:共22个基线,涵盖7个类别,包括树模型、神经预测、强化学习、金融LLM、通用LLM、LLM交易智能体和外部专家路由方法。另外包含两个被动买入并持有策略。


评估方式:仅在Stock训练和验证集上进行训练和超参数选择。模型在Stock测试集和Crypto上进行评估。报告7个指标:累计回报、年化回报、夏普比率、最大回撤、年化波动率、命中率和日均换手率。


性能评估


投资组合表现


在Stock上,TradingMoE累计回报49.08%,夏普比率5.091,最大回撤5.96%。优于最强基线LightGBM(累计回报18.19%)30.89%。


图片


在Crypto上,TradingMoE累计回报73.79%,夏普比率1.355,最大回撤30.14%。优于最强基线TRA(累计回报43.01%)30.78%。


图片


所有外部专家路由方法在Stock上均为负回报。


TradingMoE在两个市场上均表现稳健,部分竞争方法(如FinAgent, LightGBM)在Stock上表现良好,但在Crypto上显著恶化。


累计回报动态


在Stock上,TradingMoE保持总体上升趋势。在Crypto上,尽管所有方法波动剧烈,TradingMoE实现了最高终端回报,且回撤相对有限。


图片


消融研究


变体1:无查询-键路由器,无选择更新(原生路由)。累计回报2.83%。


变体2:有查询-键路由器,无选择更新。累计回报提升至23.39%,表明查询-键路由器提供了更有效的token-专家匹配。


变体3:无查询-键路由器,有选择更新。累计回报5.26%,表明单独的选择更新效果有限。


完整模型(TradingMoE):累计回报49.08%,远超所有变体,证明两个组件互补。


图片


泄漏控制评估


前瞻性模拟交易:使用Qwen3.5-9B(2026年3月发布)作为骨干网络,在2026年4月至6月进行股票模拟交易,TradingMoE始终优于基线。


图片


使用Qwen2.5-7B(2024年9月发布)的Crypto评估:TradingMoE(Qwen2.5-7B)累计回报68.38%,证实性能优势不依赖于预训练数据中的未来信息。


图片


其他分析


超参数敏感性:测试了专家数量E和查询维度d_q,设置E=64和d_q=16时综合性能最佳。


统计稳健性:使用5个随机种子重训练,TradingMoE平均累计回报49.52%,标准差±3.30%,显著优于LightGBM,且95%置信区间下限(28.5%)仍高于LightGBM的18.19%。


交易成本敏感性:在0到50个基点的成本下,TradingMoE的收益在约28个基点以下仍为正,其盈亏平衡点(约28bps)远高于LightGBM和DeepSeek V4 Pro(约13-14bps)。


总结


本文提出了TradingMoE,一个面向交易的稀疏内部专家路由框架,用于直接使用LLMs生成交易决策。受反事实专家贡献紧凑结构的启发,TradingMoE采用查询-键路由器,在低维空间中将token特定的交易需求与可学习的专家表示相匹配。其稀疏专家选择更新机制评估少量不活跃专家与当前最低分活跃专家,使路由器能够随着市场条件变化修正其Top-k选择,同时保持稀疏计算。在股票和加密货币市场以及滚动模拟交易上的广泛实验表明,TradingMoE一致性地优于22个基线,并能有效泛化到不同的市场环境。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询