CN-Buzz2Portfolio:中国市场LLM宏观和行业资产配置评估数据集和基准

“CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News”


图片


【 扫描文末二维码加入星球获取论文 】


摘要


大语言模型正从静态NLP任务向复杂金融环境中的动态决策智能体转变,但在评估范式上面临困境,直接实盘交易不可重现且有结果偏差,现有静态基准局限于个股选股。为此引入基于中国市场的可重现基准CN-Buzz2Portfolio,模拟现实公众关注流,要求智能体从高曝光叙事中提炼投资逻辑。提出三阶段CPA智能体工作流,对ETF等大类资产评估大语言模型,减少个股波动。对九个大语言模型的实验揭示其将宏观叙事转化为投资组合权重存在显著差异,研究为通用推理与金融决策的一致性提供新见解。


简介


大语言模型在金融领域应用,评估金融通用智能体在高噪声、非平稳市场是挑战。当前评估方法两极化,直接实盘交易有现实性但不可复现,静态基准有标准化但任务狭隘。现有评估范式存在推理一致性和归因噪声问题双层面评估瓶颈。现有数据集设计有局限,范围错位,缺乏新兴市场宏观语义推理。


本文提出CNBuzz2Portfolio滚动视野基准:

  • 构建多平台每日热门新闻数据集并开源。

  • 提出基于热门叙事构建ETF投资组合的新任务。

  • 用标准化三阶段CPA智能体工作流程评估顶级大语言模型。


图片


相关工作


金融领域大语言模型研究迅速扩展,现有研究分为金融评估基准、自主智能体框架、语义对齐研究三个方向。


金融LLM基准和预测任务


早期FinBERT专注静态情绪分类,后来FinGPT、BloombergGPT等转向生成能力。近期金融决策评估有了标准化基准,如StockBench用于股票走势预测,InvestorBench评估多金融任务,AlphaFin和LiveTradeBench结合新闻检索找交易优势。多数基准采用以实体为中心的信息收集范式,虽能验证实体级推理,但简化了现实市场中投资者自主筛选相关资产的挑战。


自主交易智能体和实时交易系统


现有智能体框架,如FinRobot、TradingAgents将交易分解为感知、推理和执行模块,DeepFund用深度强化学习进行连续投资组合管理,FinMem用分层记忆增强智能体以适应市场。


2024-2025年出现实时交易系统和竞赛,如AI-Trader、RockFlow AI让大语言模型在美股市场竞争;加密领域的Truth Terminal、nof1.ai作为自主投资DAO通过社交叙事影响资产价格。


本工作提供可重现、滚动测试平台,将推理逻辑与实时交易中的随机因素分离。


跨文化和宏观语义一致性


虽然像C-Eval和CMMLU这样的通用中文基准评估语言能力,但它们很少涵盖特定领域的金融逻辑。与西方市场相比,a股市场的政策叙事(如“逆周期调整”)驱动着不同的资产行为。缺乏评估宏观语义推理的基准——将抽象的政策和情绪转变映射到广泛的设定配置策略(例如,部门/宏观etf)而不是个人选股的能力。


CN-Buzz2Portfolio基准


任务定义


本文将投资决策过程视为不确定下的顺序映射任务,聚焦从不完全观察中得出可行决策的能力。在每个时间步 t:


观察(O_t):在滚动时间窗口内,观察元组⟨N_t,P_hist,T_hist,H_t⟩,其中 N_t 为非结构化新闻,P_hist 和 T_hist 是历史市场价格与交易记录,H_t 是当前投资组合状态,需自主识别“Buzz”相关性。


行动空间(A_t):行动是下一时期的再平衡指令 w_t+1,行动空间限于编程执行接口,以专注高层战略决策。


数据构建


从4大中国金融平台汇总每日Top-20热门话题,以完整热门列表为输入,严格按时间戳筛选,仅用T日收盘前新闻决定T日收盘时的配置,防止“前瞻性偏差”。


资产范围:宏观和部门视角


为评估宏观到行业推理,用ETF feeder基金构建两个资产池:


任务A(宏观与主题配置):评估经济周期解读,涵盖 11 个含股票、债券、黄金等主要资产及不同风格的广泛指数。


任务B(行业轮动):需深入理解产业政策,选 14 个代表中国产业链关键环节的行业特定 ETF。


统一交易协议:三阶段多智能体框架、


为提供标准化评估协议,建立三阶段 CPA多智能体框架,用于从热点新闻提取市场情绪和政策倾向,生成投资逻辑与投资组合再平衡指令:


压缩阶段(Summarizer A_sum):过滤原始趋势列表中的噪声,将其提炼为与金融相关的结构化事件列表,提高信噪比。


感知阶段(Analyst A_ana):作为分析引擎,结合资产定义处理提炼后的事件,评估新闻对各行业和指数的影响,评估市场情绪,识别潜在机会。


分配阶段(Trader A_trade):作为执行控制器,将A_ana的定性见解与历史数据和当前持仓整合,输出投资逻辑和具体再平衡指令。


执行层和行动约束


为减少大语言模型算术错误,将数值计算交由确定性执行引擎处理。设计结构化命令行动空间,依零售投资者行为将定性意图转化为精确交易:


预算分配式买入:指定购买金额,防股价乘法错误。


比例式持仓管理卖出:指定卖出当前持仓百分比,减少卖空错误,类似获利了结的风险管理策略。


实验设置


评估方法


选取具挑战性时间窗测试跨市场制度的稳健性:

  • 2024 全年为“熊转牛”过渡期,高波动、政策多变,检验适应制度变化能力。

  • 2025 年上半年是“高波动振荡”期,市场指数波动大但净值变化小,检验在无明确方向行情中精准择时和轮动获阿尔法的能力。


模拟环境


构建面向个人零售投资者的零售模拟环境,确保结果普通投资者可实现。初始资金 10 万人民币,用 ETF feeder 基金作资产智能体,按 ETF 收盘价执行。交易成本 0.01%,抑制过度交易。每日收盘时重新平衡,与“Buzz”列表频率一致。


模型范围与选择逻辑


评估九种先进大语言模型,按推理范式和架构规模分类,用于政策敏感型金融决策场景,对比专业推理模型与通用指令模型。


推理导向模型:含 DeepSeek - R1、Qwen - 3 - Max - Think、Qwen - 3 - 32B - Think,用链式思维过程,适合复杂推理分析。


通用指令模型:有 GPT - 5、Gemini - 2.5 - Pro 等全球前沿及国内领先模型,是零样本金融场景指令遵循和语义压缩的基线。


评估指标


为多维评估智能体表现,采用以下财务和运营指标:

  • 累计回报:评估期内投资组合价值总百分比变化,是智能体盈利能力主要指标。

  • 夏普比率:风险调整后回报指标,高值表明智能体逻辑有效平衡收益与波动。

  • 最大回撤:投资组合价值最大峰谷跌幅,评估智能体风险控制与抗不利市场能力。

  • 波动率:投资组合日回报标准差,反映价格波动强度,评估智能体抗市场风险与维持稳定权益曲线能力。


结果和分析


基线有效性和市场背景


总体有效性:三阶段方法为多数大规模模型带来正绝对回报,证明“Buzz”流含可提取金融信号。


2024任务A(宏观)“Beta陷阱”:部分模型跑输市场基准,因2024市场先熊后政策驱动反弹,智能体为控回撤保持防御,属合理主动管理。


任务B(行业)结构Alpha:模型在行业轮动任务中大幅超越基准,表明智能体虽在广泛资产暴露上保守,但擅于识别结构机会。


滚动更新必要性:2024(趋势)和2025(震荡)表现差异凸显滚动更新设计价值,可避免“前瞻”问题,确保评估聚焦真实时间泛化能力。


图片


方差分解:模型能力 vs. 随机性


为验证性能差距是否为随机初始化产物,进行方差分解分析。2024 年模型间方差远超随机成分,表明性能层级结构稳健、反映模型推理能力差异;2025 年任务 A 中该比例接近 1,意味着低波动均值回归环境下大语言模型信噪比降低,决策与随机排列难区分。结果显示当代智能体为依赖市场状态的决策者,在趋势跟踪环境高效,在均值回归或横盘市场预测力减弱。


图片


消融分析


信息效用曲线


不同Top-N设置结果挑战“信息越多越好”假设,呈现不同信息效用机制:


“最佳点”与过滤失效:多数高性能模型在Top - 5或Top - 10表现最佳,能识别市场主题;Top - 20因含娱乐八卦和非金融噪音,性能常下降。


Top-0悖论:2025振荡阶段,Top - 0(纯价格历史)常优于新闻增强设置。无趋势市场中,金融新闻多矛盾观点或“噪音”,依赖新闻易“幻觉”叙事致过度交易,仅靠价格动量的“盲目”智能体更稳健。


图片


“比例定律”悖论


数据集显示金融决策中模型规模表现异常,不遵循一般NLP的严格缩放定律。


2024年“知识优势”阶段,大模型显著优于小模型,如Qwen3 - Max - Think在Task B中表现远超Qwen3 - 32B - Think,原因是知识密度和潜在隐式泄漏,小模型有“知识压缩损失”。


2025年H1“能力陷阱”阶段,情况反转,小模型Qwen3 32B在Task A中优于Qwen3 - Max,大模型可能陷入“对噪声过度反应”陷阱,小模型靠简单启发式方法在不确定环境表现更好,挑战“越大越好”观点,凸显测试金融模型鲁棒性的必要性。


总结


CN-Buzz2Portfolio通过将热点新闻映射到资产配置评估语义理解与宏观金融决策的一致性,开源数据集和框架将为研究界开发更可靠、逻辑驱动且可解释的金融智能体提供诊断工具。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询