基于LLM的多智能体细粒度交易系统

“Toward Expert Investment Teams: A Multi-Agent LLM System with Fine-Grained Trading Tasks”


现有 LLM 交易系统任务设计简化,粗粒度指令带来性能下降和缺乏可解释性问题。本研究构建多智能体交易系统,基于投资分析师实际工作分配详细任务,预期提升性能和可解释性。


图片


【 扫描文末二维码加入星球获取论文 】


摘要


大语言模型推动自主金融交易系统发展,主流多智能体系统因指令抽象忽视现实流程细节,导致推理性能下降、决策不透明。为此提出多智能体大语言模型交易框架,将投资分析细分为精细任务。用日本股票数据在防泄漏回测设置下评估,结果显示精细任务分解显著提升风险调整回报,分析中间输出表明分析结果与下游决策偏好的一致性是系统性能关键驱动因素。还进行标准投资组合优化,利用与股指低相关性和系统输出方差,表现优异,研究成果有助于实际应用中智能体结构和任务配置设计。


简介


大语言模型(LLMs)发展使“AI 智能体”在多行业应用,金融领域期望其在投资交易中获利,常见配置为多智能体交易系统。现有 LLM 交易系统任务设计简化,粗粒度指令带来性能下降和缺乏可解释性问题。


本研究构建多智能体 LLM 交易系统,基于投资分析师实际工作分配详细任务,预期提升性能和可解释性。实验用日本股市数据回测,评估细粒度任务配置效果,还分析中间文本输出和进行投资组合优化。


图片


相关工作


基于LLMs的多智能体交易系统


早期LLM交易系统多为单主体架构,如今转向更贴近真实投资团队的多主体系统,多个主体分工协作处理金融信息。现有多主体LLM交易研究分两类:一是关注组织结构与角色,常采用经理-分析师架构,分析师有多种职能;二是基于强化学习的方法,如反思机制和分层记忆架构。


本研究基于第一类,此前研究对主体角色提示设计粗糙,未与实际投资任务对齐,本研究将更精细、真实地制定角色提示,提升交易可控性与可解释性;同时认为主体层面的消融研究探索不足,将进行系统分析提供实践见解。


提示词设计和专家任务设置


近期大语言模型(LLM)研究表明,明确规划和分解问题能提升复杂任务表现,如将标准操作程序(SOPs)编码到多智能体系统可减少错误、提高输出质量,固定工作流结构有助于稳定长上下文推理,嵌入专家知识可提升可靠性和性能。


金融领域刚开始探索将“专家流程”形式化用于LLM,现有方法常依赖投资者角色或允许人工干预,但未将专家工作流作为明确结构组件。


与最相关工作FinRobot的金融思维链(CoT)提示不同,本文将专家工作流形式化为固定分析协议,旨在实现交易决策的可操作性,并纳入宏观经济和行业信息,超越公司层面分析。


问题建模


本研究主要探究为自动交易中的大语言模型(LLM)智能体提供细粒度任务规范是否有助于提升操作性能。为验证所提设置下多智能体系统的有效性,在模拟机构投资者投资实践的约束条件下进行评估,具体构建并回测基于日本股票市场大盘股多空策略的月度再平衡投资组合。


回测和模型设置


投资范围:TOPIX 100 成分股(日本市值最高股票)。


投资策略:市场中性策略,长短仓等额等权。


再平衡频率:每月首个工作日开盘时。


测试期:2023 年 9 月至 2025 年 11 月(27 个月)。


模型选择与防偏差:用 GPT - 4o(知识截止 2023 年 8 月),严格按时间顺序输入公开数据,防止信息泄露;模型默认设置,温度设为 1,因每月再平衡无需实时处理。


评估指标


从定量和定性两方面评估智能体生成投资组合表现:


定量指标:用夏普比率衡量风险调整后收益,计算方式为月投资组合回报均值除以标准差。


定性指标:分析分析师智能体生成的分数和推理文本,评估其与经理智能体的沟通情况。


多智能体框架设置


分层决策过程


该系统采用自下而上的决策框架,信息从分析师向投资组合经理逐级抽象聚合。


信息聚合与评分(分析师智能体):四类专家智能体分析投资范围内的股票,给出分数和评估理由,结果整合后提交给行业智能体。


行业层面调整(行业智能体):汇总并根据行业基准调整分数和报告,提交给投资组合经理。


宏观环境评估(宏观智能体):分析宏观经济指标,评估市场状态,提交分数和文本给投资组合经理。


最终投资组合构建(投资组合经理智能体):综合行业智能体和宏观智能体的结果确定东证100指数成分股最终分数,选高分股做多、低分股做空来构建投资组合。


数据源


数据使用原则:结合结构化与非结构化数据决策,尽量采用开放数据。


股票价格数据:用雅虎财经获取东证100指数成分股日价格,收盘价算指标,开盘价用于执行与评估,每月末收盘后再平衡,次月首个交易日开盘执行。


财务报表数据:通过日本金融厅EDINET API获取公司季、半年、年报,用数值报表和定性文本信息。


新闻数据:从Ceek.jp News聚合日版日经、路透、彭博等金融媒体头条和文章预览,捕捉公司情绪和事件。


宏观经济数据:用FRED和雅虎财经数据,涵盖利率政策、通胀商品、增长经济、市场风险四个维度指标,用最新收盘价及月环比变化率。


方法


介绍研究内容为提供给智能体的细粒度任务及实验设计,核心方法贡献在于AI智能体指令(提示)的粒度,将细粒度任务定义为专业分析师日常操作中的标准分析任务,此类任务在现有金融多智能体研究中受关注少。


任务和提示词设计


定义七个个体智能体任务,重点实验技术和量化智能体。


技术智能体(技术分析):分析股价运动生成0 - 100吸引力分数。

细粒度任务:传入预计算的技术指标(动量、波动率、震荡指标等),指标经归一化或比率调整。

粗粒度任务:直接传入计算指标所用的原始数据(一年日价格)。


量化智能体(量化基本面):基于财务报表数据评估公司财务健康和增长潜力,生成0 - 100吸引力分数。

细粒度任务:按标准计算传统投资指标,涵盖盈利能力、安全性、估值、效率和增长五个维度。

粗粒度任务:提供财务报表原始数据及历史EPS数据。


定性智能体:分析证券报告非结构化文本,评估可持续性与竞争优势,输出业务、风险和管理得分及推理文本。


新闻智能体:聚合经济媒体新闻,检测重大事件,输出风险和回报展望得分及推理文本。


行业智能体:综合各分析师智能体输出,对比个股与行业均值,提供重新评估的吸引力得分和投资论点。


宏观智能体:从五个维度分析经济环境,提供各维度得分及推理文本。


投资组合管理智能体:整合行业智能体的自下而上观点和宏观智能体的自上而下观点,生成最终吸引力得分用于构建多空投资组合。


实验


细粒度任务vs粗粒度任务


研究目的:评估细粒度任务分解有效性,对比细粒度任务智能体与粗粒度任务基线方法在不同投资组合规模(N∈{10, 20, 30, 40, 50})下的表现。


全智能体对比:图2显示,在50次独立试验中,细粒度任务智能体在4种投资组合规模(20、30、40、50只股票)下显著优于粗粒度任务智能体,仅10只股票时无显著差异,或因股票数量少使回测结果不稳定。总体而言,细粒度信息有助于提高风险调整收益。


图片


留一法对比:通过系统移除底层专家智能体评估细粒度方法优势的稳健性。多数情况下,细粒度架构的夏普比率高于粗粒度基线;但移除技术智能体时,大投资组合规模下表现逆转,表明技术智能体对细粒度任务分解的性能优势起关键作用。结果表明细粒度任务设计在回测中稳健优于粗粒度设计。


图片


消融分析


研究通过消融实验量化各专业智能体对整体性能的贡献,以“所有智能体”为基线对比夏普比率变化。多数消融设置下差值为正,表明多数单个智能体可能引入噪声或冗余信号,凸显精心设计智能体角色和交互的重要性。


细粒度设置中,“无技术智能体”条件下差值多为负,表明技术智能体提供强预测信号;移除其他智能体差值多为正,说明它们可能引入噪声。


粗粒度设置中,技术智能体有类似但较弱的模式,“无新闻智能体”行差值多为负且幅度大,可能是缺乏细粒度任务分解时新闻信息能更好利用,补偿技术信号传播不足。


结果表明性能不仅取决于智能体多样性,还与信息结构和传播有关。细粒度任务分解利于有效信号传输,减少冗余和噪声,凸显任务设计和信息路由在分层大语言模型智能体架构中的重要性。


图片


文本可解释性分析


理解大语言模型(LLM)输出原理对金融交易实际部署至关重要,鉴于不同提示策略表现差异,分析回测时的文本输出。


采用带狄利克雷先验的对数优势比比较细粒度和粗粒度设置下的文本输出;将各智能体输出文本转为向量表示,计算余弦相似度衡量语义对齐程度,量化信息传播。


细粒度和粗粒度设置下,输出词汇都与提示指令相符。细粒度产生更细致分析术语,粗粒度倾向表面市场描述,表明提示粒度影响推理抽象程度。


存在词汇从低级专家向高级决策者的传播,高层智能体倾向复用或继承低层智能体词汇,说明分层架构能使语义信号向上传播,高层决策部分基于低层分析输出。


表3展示50次独立回测中部门智能体输出与下级智能体输出的余弦相似度,含细粒度和粗粒度设置及差值。定量和定性智能体相似度得分(≈0.48 - 0.52)高于技术智能体(≈0.40 - 0.42),表明部门智能体决策逻辑更贴近基本面分析。各智能体输出长度设为100日文字符,无显著差异。


图片


仅技术智能体在细粒度设置下相似度显著提升(差值0.022),表明技术洞察有效融入部门智能体推理过程,与回测结果相符。相似度值方差小(标准差<0.002),两设置差值统计显著。


系统倾向基本面数据,细粒度架构有效增强技术分析信号传输,使技术因素融入高层决策。


投资组合优化


在受监管金融环境中,直接将全自主交易系统用于实盘资金不可行,需进行广泛分阶段验证。为展示系统在该约束下的实际适用性,对市场指数进行标准投资组合优化作为预部署验证。开展系统回测,评估TOPIX 100股票指数与六个大语言模型(LLM)智能体策略组成的复合投资组合间的配置。六个策略含使用所有智能体的策略和五个留一法策略,采用等风险贡献加权方案构建。利用六个策略输出的异质性,其协方差结构由TOPIX 100成分股的股票级协方差矩阵得出,通过 Σ=PVP⊤ 计算智能体级协方差。为将六个策略组合成一个复合策略,通过约束优化求解权重向量 w,使每个智能体对投资组合总方差的风险贡献相等,即每个资产的贡献 图片 趋向 1/N,且满足 ∑i 𝑤𝑖 = 1。


将东证 100 指数与智能体组合按 0%-100%以 10% 递增调整配置比例,评估含交易成本的样本外表现。二者回报相关性低(≈0.4),有显著分散化收益。混合投资组合夏普比率高于单一成分,即使 50%/50% 简单配置也能提升风险调整后收益,无需精确优化配置。


图片


限制和未来工作


研究虽有成果但存在局限:

  • 不确定性能提升是否源于细粒度任务分解,可能受词汇模式影响,需研究LLM多智能体系统语言偏差。

  • 因LLM知识截止,回测限于约两年历史数据,需用时间感知或受限的LLM变体进行长期验证。

  • 实验有探索空间,如换LLM模型或目标市场,但聚焦日本市场合理,因部署需求、LLM有相关知识,且方法对高性能模型基本有效。


总结


本研究构建分层多智能体交易框架,对比细粒度和粗粒度任务设置,发现细粒度设置风险调整回报总体表现更优,消融研究表明技术智能体是主要性能驱动因素,文本分析证实细粒度指令能有效传播技术见解。研究还通过投资组合优化评估现实表现,发现大语言模型交易智能体的性能不仅取决于模型推理能力,还受提示设计中特征工程质量的显著影响。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询