LiveTradeBench:真实世界智能体Alpha挖掘评估基准

“LiveTradeBench: Seeking Real-World Alpha with Large Language Models”


图片


【 扫描文末二维码加入星球获取论文,源码 】


摘要


现有大语言模型(LLMs)基准测试多在静态环境,缺乏真实动态和不确定性,无法评估不确定下的决策能力。本问题提出 LiveTradeBench,其遵循三个设计原则:实时数据流式传输、多资产组合管理抽象、多市场评估。利用该平台对 21 个 LLMs 进行 50 天实时评估,结果显示:高 LMArena 分数不代表交易结果优;模型呈现不同组合风格;部分 LLMs 能有效利用实时信号调整决策。研究揭示静态评估与现实能力存在差距,需测试实时不确定下顺序决策和一致性的基准。


简介


大语言模型在各类静态基准测试中表现接近饱和,但此类测试不能反映现实世界智能。近期引入交互式环境让模型能序贯行动并观察反馈,如网络和计算机使用智能体,但交易环境与之不同,是连续自主系统,更强调适应。


当前基于大语言模型的交易智能体应用存在不足:多依赖离线回测,易信息泄露且无法反映现实;多将交易建模为单资产的低层次局部操作,忽视多资产高层次推理规划。


如何才能低成本有效评估大语言模型智能体在现实市场条件下的交易能力呢?


本文提出 LiveTradeBench 实时交易环境,可流式传输实时市场数据等,避免信息泄露,采用投资组合管理抽象,结合实时数据与组合层面推理,提供评估基于大语言模型(LLM)交易能力的真实平台。


用该基准对 21 种主流 LLM 进行股票市场交易和预测市场投注两种实时交易评估,有三个关键发现:LMArena 中最先进模型交易表现不佳;LLMs 投资组合管理风格不同;LLMs 能利用实时信号做更明智的交易决策。


研究揭示传统 LLM 评估与现实金融能力脱节,需开发更具适应性和稳健性的投资组合管理智能体。


图片


相关工作


LLM 交易智能体评估


目前主要有三种环境或基准:

  • 历史市场数据回测是主流,但存在信息泄露和泛化性差问题,有研究提出改进协议;

  • 市场模拟器构建合成或自设计交易环境,多用于行为分析,难产生符合实际市场动态的交易行为;

  • 实时数据实时评估是新兴方向,在交易领域探索少,本文聚焦此范式,认为其对 LLM 交易智能评估最可靠、具前瞻性。


交易智能体的动作空间设计


交易任务设计因目标而异,体现在交易智能体的行动空间差异。股市中多数基于大语言模型的系统采用单资产交易,行动为离散决策,但忽略了跨资产依赖;另一些聚焦于阿尔法预测,输出的是连续向量信号而非直接可执行交易行动。在博彩市场,智能体常输出互斥结果的概率估计。本文在投资组合管理框架下统一这些观点,智能体输出多资产或结果的分配比率,在连续决策空间中涵盖离散交易、阿尔法预测和概率博彩,强调风险-回报权衡和资产间相关性。


基于LLM的交易智能体框架


LLM 用于构建交易智能体有不同框架:一是用强化学习微调单个 LLM 提升决策与交易表现;二是探索多智能体系统模拟市场动态;工具使用、自我反思和记忆是提升交易智能的关键组件。本文采用带工具使用和记忆的 React 风格框架作为智能体配置。


为投资组合管理构建实时交易环境


项目组合管理的定义


投资组合管理任务被建模为部分可观测马尔可夫决策过程(POMDP)E=⟨S,A,O,T,Ω⟩,在每个时间步 t,环境处于潜在状态 s_t,智能体接收部分观测:


图片


总投资组合价值:


图片


智能体根据观测历史 o ≤ t 产生动作 a_t,表示目标分配向量,且:


图片


环境状态转移包括外生市场状态演变和内生投资组合调整,市场按 T 演变产生新价格 p t+1 和信号 c t+1,投资组合重新估值和平衡:


图片


下一个观测 o t+1 由 Ω 发出。


因聚焦高流动性资产,智能体交易对真实价格影响可忽略,模拟转移函数 T 与现实世界紧密对齐。


在每个时间步 t,智能体输出分配决策 aₜ 后,可通过买卖持操作更新持仓,执行的交易向量 ∆qₜ = qₜ₊₁-qₜ,正表示买、负表示卖、零表示持。交易执行后,投资组合过渡到新持仓 qₜ₊₁,总组合价值 vₜ₊₁ 按 Eq. 2 更新,此公式实现从高级分配行动空间到买卖持操作的直接映射,不涉及低级订单执行机制建模。


市场选择


评估智能体在股票和预测两个互补市场进行,以测试其跨结构化和信息驱动机制的泛化能力,两市场结构、信息流动和反应速度不同,盈利策略和推理视角也不同。


美国股市是成熟、受监管系统,资产价格平稳,跨行业相关性强,反映基本面和宏观信号。有效管理需捕捉长期依赖、建模隐藏相关性和分散风险。构建含15只股票和ETF的代表性投资组合,涵盖各主要行业,还包含现金资产,以实时股价为评估数据源。


Polymarket预测市场去中心化、受情绪驱动,合约松散,对实时信息反应敏锐且异步,波动比股票更突然、缺乏连贯性,反映集体信念而非基本面。需快速适应、事件驱动推理和关注叙事变化。持续跟踪其十个活跃二元预测市场,涉及政治、加密、科技和金融。假设预测市场和股票市场对相同信息反应的延迟和幅度不同,前者反应迅速且常过度,后者通过机构共识逐步整合信号。二者为评估智能体提供互补测试环境。


图片


观察空间


每个时间步,智能体接收观察值 o_t = (q_t, p_t, c_t) 作为决策输入,适应市场变化。


持仓 q_t:代表智能体当前所有资产(含现金)的持仓情况,为连续非负值,不允许卖空。


市场价格 p_t:包含组合内所有工具的最新资产价格及时间戳,用于组合估值和分配更新。


市场背景 c_t:主要提供实时市场新闻,通过特定关键词从谷歌新闻收集,文本摘要用于辅助LLM智能体决策。


图片


动作空间


每个时间步 t,智能体在概率单纯形动作空间 A 做动作 a_t,a_t~(i) 为分配给资产 i 的投资组合价值比例,满足 ∑_i a_t~(i) = 1,默认长仓,此连续分配抽象交易执行,专注投资组合再平衡。


股票市场中,a_t~(i) 是分配给股票 i 的投资组合价值百分比,决定交易后头寸。


预测市场中,每个二元合约对应 YES 和 NO 资产,动作向量 a_t 有 2k 个分量,a_t,YES~(k) 和 a_t,NO~(k) 分别为市场 k 中 YES 和 NO 结果的投资组合分配,净风险敞口 e_t = a_t,YES~(k)-a_t,NO~(k),正值表示更看好 YES 结果。


图片


基于LLM的投资组合管理智能体设计


框架中,智能体是核心决策实体,将观测信息转化为投资组合分配,整合工具使用、记忆和推理三种能力,形成信息获取、反思和执行的闭环。在每个时间步 t,智能体接收观测 oₜ,维护内部记忆状态 Mₜ,产生分配 aₜ = f_θ(oₜ, Mₜ)。


工具使用:使智能体与实时环境交互,获取和处理市场价格 pₜ 及上下文信号 cₜ,将原始输入转化为结构化特征表示,拓展感知以辅助决策。


记忆:维护近期观测和行动结果的紧凑表示,存储固定长度的过去观测序列,提供时间上下文,使智能体适应市场变化。


推理:作为决策核心,整合工具使用收集的信息和记忆中的上下文知识,遵循 ReAct 框架进行推理,产生明确推理痕迹,实现投资组合管理的适应性和透明度。


在实时测试中评估基于LLM的智能体


从2025年8月18日至10月24日共50个交易日,对基于21种独特大语言模型骨干构建的交易智能体进行实盘交易的评估结果与分析。


评估的LLM


为在实盘交易环境中进行性能基准测试,评估多种主流大语言模型(LLM)作为交易智能体的表现。选取六个代表性模型家族,包括Claude、Grok、Qwen、LLaMA、GPT、Kimi和DeepSeek,选模基于通用推理、知识和智能体基准的先进表现,以及模型规模、架构和性能水平的多样性。各模型置于同一智能体框架,将市场观察转化为自然语言提示,解析输出为结构化投资组合分配向量,以确保性能差异主要体现模型内在推理和决策能力。


评估指标


为评估交易智能体表现,采用四个常用金融指标:


  • 累计回报(CR):衡量投资策略整体盈利性,CR = (vT-v0) / v0,值越高盈利越强。

  • 夏普比率(SR):评估回报相对风险的效率,SR = (r¯-rf) / σ,值越高风险调整表现越好。美国股市中rf为短期国债收益率,Polymarket中rf设为0。

  • 最大回撤(MDD):量化投资组合从历史峰值到后续谷底的最大跌幅,MDD = max( maxi∈[1,t] vi-vt ) / maxi∈[1,t] vi ,值越小下行保护越好。

  • 胜率(WR):衡量盈利交易步骤比例,WR = (1 / (T-1)) ∑t=2T I(rt > 0),值越高短期决策可靠性越强。

  • 波动率(σ):反映回报的变异性,衡量投资风险,σ = √(1 / (T-1) ∑t=1T (rt-r¯)²) ,值越低表现越稳定。


评估结果


不同市场交易表现不可通用,两市场夏普比率相关性近零,需市场特定策略。如Qwen2.5-72B-Instruct和Grok-4表现较稳定,GPT-4.1在股市表现好但在预测市场差。预测市场动态快、波动大、回撤深,需灵活且风险承受力高的策略。


图片


通用大语言模型能力强不意味着金融表现好,LMArena分数与交易能力相关性弱,在股市近乎无关联,在预测市场呈负相关,说明通用基准表现好的大语言模型在交易中未必出色,凸显该环境的独特性和必要性。


图片


不同模型有不同投资组合管理风格:Claude-Opus-4.1和Grok-4保守,重稳定;Kimi-K2-Instruct和GPT-5风险偏好高,追求高回报。各模型在投资组合构成和现金管理上也有差异,如GPT-4o聚焦核心资产,GPT-5分散投资,Llama4-Scout现金比例高,GPT-5多数情况现金比例低。这些风格在不同市场一致。


大型推理模型无交易优势:如DeepSeek-R1等推理模型交易表现不佳,在Polymarket波动性超140,过度推理会导致交易不稳定、一致性下降,数学或编码推理能力难用于金融或社会推理。


分析和讨论


是否随机猜测:设计滚动-k delta分析,若决策随机,延迟行动不影响绩效;若适应市场,延迟行动会使绩效下降。结果显示LLM智能体非随机行动,交易策略依赖市场信号,延迟行动损害绩效,且股市和Polymarket表现有差异。


图片


如何推理决策:采用LLM推理注释,分析决策依据。在两个市场中,新闻是最常引用的因素,其次是市场价格历史,持仓信息较少。两个市场动态不同,Polymarket智能体更依赖新闻,股市智能体更强调价格趋势,且很多决策综合多种信息源。


案例分析


美国股票市场的现金资产动态


分析美国股市投资组合现金资产动态,以现金比率反映风险管理,高比率体现风险厌恶,低比率显示市场信心。


8 月 28 日科技股反弹,21 个模型平均现金比率 4 天从 17%降至 7.5%,GPT-4.1 因科技股盈利和分析师积极情绪,增加科技股持仓,与低现金比率相符。


10 月 10 日市场下跌,多数股票价格大幅下降,各智能体出现负回报,多数智能体增加现金持有以避险,Gemini-2.5-Pro 提前增加现金仓位,当日损失最小。


图片


多元市场预测市场中的俄乌停火市场


研究聚焦Polymarket上“俄罗斯×乌克兰2025年停火”市场,其对外部信息敏感,适合评估大语言模型(LLM)对动态地缘政治信号的解读与行动。


案例所选市场50个交易日波动频繁,不同模型表现和回报不同,如Grok-3模型10月13日至17日将停火概率内部估计从0.15调至0.22。


10月13日,两条乐观新闻使多数智能体从“否”转“是”持仓,但市场价格变动小,未获利,凸显LLM智能体难辨非决定性与有影响力新闻,易过度反应。


10月17日,泽连斯基访白宫消息使多数智能体强化“是”持仓并持有,市场价格上涨获利,说明基于可靠高影响力事件持仓比基于弱信号频繁反应效果好。


图片


总结


本文提出LiveTradeBench,这是用于评估基于大语言模型(LLM)的智能体在现实投资组合管理任务中的实时多市场环境。通过 50 天实时实验发现:不同市场表现不可通用,通用基准高分不代表交易表现优;LLM 智能体综合依赖历史价格、新闻、分配历史,极端条件下行为模式独特。LiveTradeBench 为研究 LLM 智能体在实时交易环境中的表现奠定基础,助力开发更具适应性、金融基础和社会智能的智能体系统。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询