MEME:中国金融市场演化模式建模,更优的盈利能力和稳定性

“MEME: Modeling the Evolutionary Modes of Financial Markets”


图片


【 扫描文末二维码加入星球获取论文,源码 】


摘要


LLMs在量化金融有潜力,但现有方法多聚焦个股预测或投资组合分配,忽略市场变动底层原因。本文提出逻辑导向视角,将金融市场建模为投资叙事生态系统“思维模式”,并引入MEME模型。该模型通过多智能体提取模块转化数据,用高斯混合模型挖掘潜在共识,还实现时间评估和对齐机制追踪模式生命周期与盈利能力,确保投资组合构建基于可靠推理。2023-2025年对三个中国股票池的实验表明,MEME优于七个SOTA基线,消融、敏感性、生命周期案例和成本分析验证其识别和适应市场共识的能力。


简介


LLMs在量化金融领域应用渐广,其驱动的多智能体系统可处理非结构化数据辅助投资决策。当前LLM金融交易方法分两类,资产中心类侧重个股预测,市场中心类侧重资产配置,但均属面向对象范式,忽略市场变动背后逻辑。


本文提出从逻辑导向视角建模金融交易问题,认为市场是投资逻辑生态系统,但捕捉逻辑受数据噪声、逻辑噪声、信号稀疏及语义漂移等阻碍。


MEME通过多智能体提取模块处理数据,用高斯混合模型挖掘潜在共识,用时间评估和对齐机制处理逻辑噪声,引导投资组合构建。


实验结果显示,在沪深多个股票池实验,对比8个基线模型,MEME表现出更优盈利能力和稳定性,还进行消融、参数敏感性和时间外样本测试及案例研究验证框架有效性。


相关工作


以资产为中心的方法


以资产为中心的方法研究聚焦个体资产微观预测与预测信号挖掘,运用遗传编程、强化学习等方法生成预测表达式,还涉及因子建模、时间依赖分析等。随着大语言模型发展,基于智能体的方法出现,如多模态分析、专家辩论等。在阿尔法因子挖掘中,智能体用迭代细化和导航树搜索找有效公式。


本文方法与资产中心研究不同,从微观映射转向宏观推理。传统方法将资产视为独立单元,直接用特征映射价格变动;本文的MEME方法提取解释一组资产联动的潜在投资论点,过滤资产特定噪声以提高推理纯度。


以市场为中心的方法


以市场为中心的方法从股票池或投资组合层面研究金融问题,传统研究聚焦组合构建,如协方差矩阵预测、多因素降维,部分用强化学习优化资产权重,近期有基于大语言模型的系统综合股票池信息,还有多种方法管理市场交互。


本文框架差异:视角上,现有方法是面向对象,将股票池视为资产集合,本文是逻辑导向,视市场为潜在叙事的动态竞争;方法上,现有方法关注空间配置,本文关注时间演变,通过追踪投资逻辑的生命周期指导组合构建,而非依赖特定市场状态下的短暂相关性。


方法


MEME用于从多模态金融数据构建每日投资组合,采用逻辑导向,有别于传统方法。它将市场建模为投资叙事的演化生态系统,以N只股票T个交易日的原始日数据为输入,单只股票某天的数据含基本面、新闻、技术等多模态信息。其运作分三阶段:从多模态数据提取结构化投资论点;聚类论点并追踪其随时间的演变以识别潜在推理模式;评估各模式的历史盈利能力构建最终投资组合。


图片


从噪声到结构


MEME初始阶段将非结构化、多模态金融数据转化为结构化的投资论点,以克服原始数据的结构混乱和高噪声问题。采用多智能体系统处理低信噪比,分两步实现:


信息过滤:各模态的过滤代理处理原始数据,提取相关信息。


图片


论点生成:整合各模态过滤信息,生成器代理合成结构化投资论点,每个论点含方向立场、分析理由和支持证据,方向立场用 +1 或 -1 表示。


图片


图片


模式识别与对齐


先提取个体论点,识别并追踪其代表的潜在共识。因孤立论点信息少、用词多样且投资者关注点会变,先在语义空间对每日论点聚类以识别潜在推理模式,再跨日对齐模式以建模其时间演变。


模式识别:从争论到潜在共识


用高斯混合模型(GMM)对每日论点嵌入集建模论点间共享逻辑,因其能处理市场主题重叠问题,为每个论点分配各模式的隶属概率,比刚性分类更能捕捉市场共识。


为每日每个论点生成语义表示,将论点基本原理与证据拼接,用编码器 E 编码成 D 维向量。


图片


对每日论点嵌入集合应用高斯混合模型(GMM),定义当日 K 个模式,每个模式为高斯分布,同时计算论点属于各模式的后验概率。


图片


时间模式对齐:从快照到进化


为理解主题持久性,需跨时间连接识别模式,静态日分析因模式语义焦点会漂移而不足,可通过连接连续多天的相关模式解决。设 图片 和 图片 分别为第 t - 1 天和第 t 天的模式质心集,用线性分配算法求使匹配模式总语义漂移最小的排列 π ,以建立各模式的时间对应关系。


模式评价与组合构建


MEME 最后阶段评估各模式历史有效性,量化历史盈利能力,以该得分加权新信号生成未来投资组合股票排名。


交易日 t 收盘时评估 t - 1 日所有模式表现,给出股票一日远期超额回报公式。


图片


计算论点实现得分、各模式每日聚合得分,用指数移动平均更新长期表现得分,确保表现连续性。


图片


图片


图片


构建每日投资组合 Wt,计算新论点与既定模式的对齐概率,以此加权模式长期表现得出新论点预测得分。


图片


图片


汇总论点得分得到每只股票的综合信号,根据信号向量排名采用 top - K 策略构建次日开盘投资组合。


图片


实验


实验设置


数据集:2023 Q4 - 2025 Q4 对 SSE 50、CSI 300、CSI 500 三个 A 股股票样本进行实验,期间涵盖多种市场风格转变。


性能指标:采用基于相关性(IC、ICIR 等)和基于投资组合(AR、MDD 等)两类指标评估 MEME 性能。


基线:将 MEME 与传统机器学习、深度学习、单资产和市场为中心的代理方法等多种基线对比。


实现细节:以 DeepSeek V3.1 为骨干大模型,Qwen3 Embedding - 8B 用于模式识别,设置相关参数,采用指数增强策略回测。


实验结果:2023 Q4 - 2025 Q3 实验表明,MEME 股票收益预测能力强,不同市场条件下稳定性更好。


结果


绘制沪深300完整回测曲线,图2显示MEME在多数回测期表现领先,在2024年初流动性危机和2025年4月贸易摩擦时低回撤,2025年中期牛市获良好回报,展现出较强稳健性。


图片


图片


数据泄漏问题的实验研究


为验证 MEME 有无数据泄露,对三个数据集用 2025 年 Q4 新数据做时间外样本测试,表 2 结果显示 MEME 性能优于所有基线,表明其有效性源于方法设计而非大语言模型训练语料污染。


图片


消融分析


进行消融研究评估MEME各核心组件贡献。先以LLM直接处理原始数据作基线,性能最低,凸显结构化分析必要。引入SAG在小股票池有提升,在大股票池效果不佳。加入MOT(含确定性聚类)性能大幅提升,体现组织论点成推理模式的重要性。用PM替代确定性聚类进一步提升性能,证实对论点与思维模式模糊关系建模的好处。添加TA形成完整模型带来显著增益,验证对思维模式生命周期建模对生成预测信号的必要性。


图片


参数灵敏度分析


研究了 MEME 对关键超参数(模式数量 K 和平滑因子 λ )的敏感性,分析基于 CSI 300 进行。MEME 对两参数变化表现出鲁棒性,在较广取值范围内性能稳定。K 过小时性能下降,因会使不同概念的参数归为同一模式;λ 过大也损害性能,因其更看重模式长期历史表现,降低模型对思维模式预测能力近期变化的响应。


图片


图片


消耗时间分析


对比MEME与SOTA LLM基线日平均运行时间,MEME通过结构化参数提取过滤噪声、模式识别与对齐跨资产和交易日信息,降低LLM显式反思开销,实现更低计算成本。


图片


案例分析


对 CSI 300 数据集进行案例研究,追踪各思维模式长期绩效得分 Perf,依不同市场制度下的持续有效性将模式分为四类,附录给出详细分类方法。


图 4 对四类模式进行时间分析,x 轴为交易日,y 轴为每日各类别绩效份额,各时段堆叠图高度和为 1。


图片


可视化显示多数模式无效,有效模式组成随市场条件演变,熊市有效模式在 2024 年初危机中表现好,牛市有效模式在 2024 年末市场反弹中占主导,案例展示了 MEME 识别和追踪投资叙事有效性的能力,附录给出有效模式详细示例。


总结


本文介绍基于大语言模型的金融交易框架 MEME,其采用策略中心视角,挖掘、跟踪和评估不同投资逻辑的生命周期,相比竞品提升了性能与稳定性,在不同市场环境下展现出良好的稳健性和泛化能力。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询