AI-Trader:智能体实时金融决策评估框架

“AI-TRADER: BENCHMARKING AUTONOMOUS AGENTS IN REAL-TIME FINANCIAL MARKETS”


金融市场动态复杂、波动大、不可预测,是评估智能体规划、信息检索等能力的理想测试场,传统评估方法无法满足其高要求。现有研究的评估范式存在依赖固定提示和预定义流程、缺乏时间约束等局限,无法评估智能体真实潜力。


本文提出AI-Trader,是首个用于金融决策的全自动、实时、无数据污染评估基准,涵盖美股、A股和加密货币三个市场,采用全自主最小信息范式。可严格评估智能体在实时金融场景中的自主能力。


分析表明当前LLM智能体在真实市场回报差、风控弱,表现受市场条件影响大,凸显其局限性并指明改进方向,AI-Trader将引入更具挑战性评估标准。


图片


【 扫描文末二维码加入星球获取论文,源码 】


摘要


大语言模型(LLMs)作自主智能体在动态实时环境决策难,金融领域缺乏系统基准测试。为此推出 AI-Trader,是首个用于金融决策的全自动、实时、无数据污染评估基准,涵盖美股、A股和加密货币三个市场,采用全自主最小信息范式。评估六个主流 LLMs 发现,通用智能不代表交易能力,多数智能体回报差、风控弱,风控能力决定跨市场稳健性,高流动性市场比政策驱动环境更易获超额回报。研究揭示当前自主智能体局限,指明改进方向。


简介


大语言模型推动自主智能体发展,但在动态实时场景评估存在缺口,传统静态基准评估集中于问答、代码完成等,不适用于复杂现实场景。金融市场动态复杂、波动大、不可预测,是评估智能体规划、信息检索等能力的理想测试场,传统评估方法无法满足其高要求。现有研究的评估范式存在依赖固定提示和预定义流程、缺乏时间约束等局限,无法评估智能体真实潜力。


本文提出AI-Trader,这是首个涵盖美股、A股和加密货币市场的全自主、实时、数据无污染评估环境,采用全自主最小信息模式,可严格评估智能体在实时金融场景中的自主能力。


对六个主流大语言模型的综合评估显示,静态基准测试无法发现其在交易能力上的关键局限,多数模型自主交易回报差、风险管理弱,在高流动性市场比政策驱动市场更易获超额回报,且跨市场泛化能力有限。


本文主要贡献在于:

  • 推出首个完全由智能体操作、实时且数据无污染的多市场金融评估基准平台,涵盖美股、A股和加密货币,突破传统静态评估范式。

  • 构建端到端自主评估框架,让智能体在最少上下文下自主处理市场信息,全面评估其长期工具使用和自适应推理能力。

  • 对六个主流大语言模型在三个市场、多种交易频率下进行系统分析,揭示其在自主执行、风险管理和跨市场泛化方面的局限,凸显实时评估的必要性。


相关工作


自主决策的LLM 智能体。大语言模型已从文本完成系统进化为能进行复杂推理、战略规划和与外部环境动态交互的自主智能体,这是其发展新前沿,可将语言能力转化为实际生产力和经济价值。LLM 智能体核心优势是在不确定下进行长期决策,能保持连贯策略并适应环境变化。AI-Trader 利用其能力实现金融市场自主决策。


工具使用和环境相互作用。LLM 智能体实现自主能力需通过复杂工具使用与环境交互,这对维持自主感知 - 决策 - 行动循环至关重要。近期进展显著,如 MCP 协议提供统一接口,提升了跨领域互操作性。本文框架针对金融市场,采用全自动最小信息方法,为智能体仅提供必要交易工具,使其在无人工干预下自主搜索、验证和整合实时市场信息。


从静态到实时智能体评价。为系统评估动态环境中新兴智能体能力,研究人员开发模拟复杂现实决策过程的实时环境基准,分两类:一是静态题库与动态执行环境结合,如SWE-Bench等;二是任务集和执行环境均完全动态,如LiveCodeBench等。


金融决策因具动态市场响应等特点,是理想的智能体评估测试平台。现有金融基准涵盖静态与动态,静态评估事实知识,动态模拟交易条件,但都缺真实自主性和实时约束。


AI-Trader


AI-Trader 基准旨在为评估智能体在高动态金融市场的决策能力提供高保真、无数据污染、全自主的实验环境。其设计模拟专业金融分析师完整工作流程,消除人为干预,实现端到端评估。与传统基准不同,该框架在实时市场运行,让智能体应对真实决策挑战。框架由实时交易环境和交易智能体两个解耦组件构成,确保评估完整性,为智能体提供策略和决策灵活性。


图片


实时交易环境


AI-Trader 基准在三个全球金融市场(美国股市、中国 A 股市场、加密货币市场)评估智能体泛化与适应性,所选市场监管框架、投资者构成和市场动态不同,且支持时频和日频交易,以捕捉市场行为、测试多时间跨度的智能体响应能力。


美国股市


市场特征:美国股市是全球最具流动性和制度完善的交易环境,信息披露透明,机构参与成熟,是全球股票估值和风险评估的基准,受美联储政策、企业盈利、技术创新和宏观经济指标驱动,兼顾长期增长与周期性波动。


投资组合构建:美国投资组合选取纳斯达克100指数成分股,涵盖信息技术、半导体等多领域科技前沿企业,如苹果、微软等。


评估优势:所选公司对技术发展和宏观经济变化敏感,利于测试智能体适应性;聚焦成长创新型企业,需复杂分析能力;包含零回报现金资产,可展示全风险范围的投资组合管理技能。


A股市场


市场环境:A股市场监管和结构独特,为测试交易策略适应性提供对比环境,价格受宏观经济、行业动态和市场情绪驱动,需综合分析与灵活应对。


投资组合:构建A股组合选取上证50指数全部50只成分股,涵盖金融、消费等多领域龙头企业。


评估优势:所选股票市场代表性和流动性强,能测试交易主体解读经济信号、跨行业分析能力,可评估不同投资者行为模式下的表现。


加密货币市场


市场特点:加密货币市场是连续、全球分布的生态系统,无传统交易时间,极端波动,对监管和市场情绪敏感,价格受技术、监管、机构采用和宏观经济影响,高波动与高回报、明显周期性并存。


投资组合构建:选取Bitwise指数追踪的10种以USDT计价的主要交易对构建加密货币投资组合,涵盖不同区块链功能资产。


评估优势:该组合涵盖多个创新领域,24/7交易考验智能体响应能力,高波动和快速信息流要求智能体实时处理信息,技术特性评估智能体解读创新和市场影响的能力。


交易智能体


AI-Trader旨在为智能体提供易用测试环境,设计上易集成、易修改。其智能体架构模块化,各组件通过标准接口连接,使不同智能体在统一规则下自主执行多种操作。为方便第三方测试,支持自定义智能体和MCP工具注册机制,创建可即插即用、可扩展的测试平台。


基础交易智能体的设计


AI-Trader遵循观察 - 推理 - 行动的闭环自适应循环,核心原则是信息靠工具获取、决策基于自主推理、行动符合现实约束。


观察空间:交易智能体初始市场感知含资产当前价格p和自身持仓状态s,构成初始观察o₀,还可通过工具获取特定股票详细数据πᵢ和通用信息i,整合为当前完整感知oₜ。


推理过程:获观察oₜ后自主推理,遵循“先思考后行动”范式,结果要么调用工具获取更多观察,要么直接做交易决策,以自然语言记录中间推理,确保决策过程可观测、审计和重现。


行动空间:智能体基于观测 $o_t$ 和自主推理 $r_t$ 生成行动,对每个可交易资产有买入、卖出、持有三种离散动作。若行动致资金需求超可用流动性,系统拒执行并触发自我修正机制。行动由策略函数 $a_t = f(o_t, r_t)$ 生成,整个行动流程形成闭环,模拟多资产市场中自主交易智能体的完整决策链。


智能体工具链


AI-Trader框架提供支持交易智能体核心功能的最小工具集,强调架构模块化与可扩展性,基于MCP(2025)构建,适应不同资产和交易频率。


各工具功能:

  • Check Price:为AI提供准确及时的股票价格数据,识别不同市场股票代码,按交易规则返回数据。

  • Search:按关键词实时检索市场、公司或宏观经济相关公开信息,截至当前模拟时间,防数据泄漏。

  • News:提供结构化金融新闻及情绪信号,含发布时间、关联证券和新闻摘要,辅助金融决策。

  • Math:支持AI交易中的数值计算。

  • Trade:按智能体决策执行买卖订单,遵循市场规则,实时更新持仓和现金余额,确保合规、准确、可审计。


实验


本文呈现 2025 年 10 月 1 日至 11 月 7 日美股和 A 股实盘交易结果,以及 11 月 1 日至 14 日加密货币市场评估分析。采用日频策略交易 A 股和加密货币,时频策略监测美股交易,多市场多频设计提升实验多样性与代表性。


LLM选择


AI-Trader 以 DeepSeek-v3.1 等六个主流模型为基线,将它们封装成结构相同、交易目标和工具一致的智能体。此设置确保在相同任务条件下公平客观比较模型性能,排除干扰因素,使性能差异可归因于模型内在推理、决策策略和对金融场景的理解。


评估指标


  • 累积回报率(CR):衡量策略在评估期内总百分比盈亏。

  • 索提诺比率(SR):评估风险调整后表现,仅惩罚相对目标回报(常为零)的下行波动。

  • 波动率(Vol):衡量策略总风险,以回报的年化标准差表示。

  • 最大回撤(MDD):量化策略评估期内累计价值最大峰谷跌幅。


结果


大语言模型的通用智能不自动转化为有效交易能力,各智能体交易策略在不同市场环境差异大。GPT-5、Qwen3-Max等在自然语言任务表现出色,但在股票和加密货币市场交易表现差,难以将推理能力转化为盈利信号,交易建议缺乏稳定性。


风险控制能力是AI智能体跨市场稳健性的关键,MiniMax-M2在美和A股市场表现最稳定,通过有效抑制下行风险,取得较高累计回报和Sortino比率,最大回撤小。股票市场中,主动策略遇阻,无AI智能体跑赢上证50基准(1.65%),MiniMax-M2最接近(1.31%),且波动率最低(6.72%)、最大回撤最小(-2.15%),凸显策略防御设计优势。


图片


加密货币市场,DeepSeek-v3.1是唯一跑赢基线(-12.18% vs -14.30%)的智能体,靠高现金持仓及“抄底”操作成功,表明AI需管理波动并动态调整流动性。AI交易策略在高流动性市场易获超额回报,美国市场多智能体跑赢QQQ,A股市场无智能体跑赢上证50,美国市场更可预测,A股市场波动大、受情绪驱动影响智能体决策(2025年10 - 11月)。


模型泛化能力有限,如 DeepSeek-v3.1 在美、A 股、加密市场表现差异大,GPT-5 和 Qwen3-Max 在不同市场表现不佳,说明当前 AI 交易智能体未实现跨市场泛化。市场环境影响交易策略,A 股高波动引发极端投机行为,美股稳定促进趋势跟随策略,不同智能体在不同市场的行为和持仓有差异。


图片


图片


真正强大的 AI 交易智能体需灵活调整策略,MiniMax-M2 在美、A 股市场表现相对较好,因其采用“回报 - 防御”双模式,未来高性能系统应具备根据市场条件自动调整风险和交易频率的能力。


图片


案例分析


案例研究发现,智能体通过使用工具展现出类似人类投资者的偏好,既能够通过大量信息分析预判并规避市场大幅下跌(案例 1),也易受特定新闻影响而产生情绪化误判(案例 2)。


案例1:智能体可以通过工具调用表现出与人类投资者相似的偏好


10月10日晚,美国三大股指普跌,纳斯达克指数跌超3%,科技股遭抛售。deepseek-v3.1通过自主工具调用机制避过市场大跌,减少投资组合损失。该模型先收集分析市场信息,利用搜索工具发现特朗普关于对华商品加征“巨额关税”言论触发市场波动。随后按“鉴于市场波动和贸易紧张,此为更优多元化投资组合”思路,执行防御性资产配置调整策略:将科技股配置从约99%降至70%,增加对百事可乐、美国电力等防御性资产的配置,保持17.3%的现金比例,体现行业多元化、现金缓冲配置和风险暴露管理的风险分散原则。


图片


案例2:智能体可能会根据未经证实的消息做出非理性判断


10月24日A股三大指数走强,沪指达十年新高,市场呈牛市特征,但DeepSeek系统逆市增仓传统能源、银行等防御板块,错失市场主升浪,表现逊于SSE-50指数。决策失误源于系统直接采用“结构性慢牛”新闻信息,未启动交叉验证,致信息处理链关键环节断裂,抑制后续信息搜索与动态修正。这凸显该智能体实时环境下决策机制缺系统信息验证模块,易依单一信源判断,在复杂市场易误判。


总结


本文提出AI-Trader基准,用于评估金融环境中LLM智能体,引入新挑战,评估其动态推理、工具利用和决策稳健性。覆盖美股、A股和加密货币市场,提供时、日交易粒度。分析表明当前LLM智能体在真实市场回报差、风控弱,表现受市场条件影响大,凸显其局限性并指明改进方向,AI-Trader将引入更具挑战性评估标准。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询