Nexus:Google发布多模态智能体时序预测框架,预测准确且可解释性
“Nexus : An Agentic Framework for Time Series Forecasting”
时间序列预测对多领域决策至关重要,现有时序大模型仅依赖结构化数值信息,无法融合非结构化信息。本文提出Nexus,全大语言模型驱动的多智能体框架,分别建模粗粒度和细粒度信息,再由合成智能体合并成数学上合理的预测。
在股市预测和房地产预测两个不同领域评估Nexus,其表现优于TimesFM-2.5和Zero-Shot CoT,既保证数值准确性又有高可解释性。

【 扫描文末二维码加入星球获取论文 】
摘要
时间序列预测需结合非结构化上下文数据,现有时间序列基础模型(TSFMs)缺乏对文本信号感知,大语言模型(LLMs)预测表现不稳定。本文提出多智能体预测框架Nexus,将预测分解为多阶段,能适应不同信号,不依赖外部统计锚点或单一提示。研究表明当前LLMs预测能力比以往认知更强,关键在于数值与上下文推理的组织方式。Nexus在房地产和股市数据上表现优于现有模型,还能生成高质量推理过程,证明现实预测是超越序列建模的智能推理问题。
简介
时间序列预测对多领域决策至关重要,以往需特定领域算法,近期时间序列基础模型(TSFMs)建立统一范式,通过大规模预训练在识别复杂模式上达先进水平。但TSFMs仅依赖结构化数值序列,与现实叙事脱节,易受结构突变影响。大语言模型(LLMs)能解析非结构化信息,但缺乏精确数值模式识别机制。
早期尝试弥合二者差距效果不佳,LLMs作为独立数值预测器表现欠佳,当前研究面临利用统计模型舍弃关键定性信息,依赖LLMs零样本数值推理又难以捕捉时间序列特性的两难。
近期文献倡导多模态、智能预测范式,当前许多自适应或智能预测系统主要自动化数值工作流。本文认为大语言模型时代的智能预测应聚焦文本证据和时间推理。
本文提出Nexus,这是一个全大语言模型驱动的多智能体框架,分别建模粗粒度和细粒度展望,再由合成智能体合并成数学上合理的预测,还有领域级校准循环。
在两个不同领域评估Nexus,其表现优于TimesFM-2.5和Zero-Shot CoT基线,在文本驱动的股市预测和数值建模的房地产数据预测中,既保证数值准确性又有高可解释性。

相关工作
LLM用于时序预测
近期开始探索将原用于离散文本的大语言模型(LLMs)应用于连续时间序列预测,主要方向有直接提示、数值标记化等。Zhang等[2024]、Gruver等[2023]表明编码数值观测为字符串可使LLMs在部分场景零样本外推;GPT4TS/FPT、TEMPO、Time-LLM、UniTime等分别通过轻量级模态对齐、融入时间序列归纳偏置、重编程时间序列块、跨域多变量预测等开展研究。但LLM用于时间序列的效用存争议,Tan等[2024]指出去除或替换LLM组件不影响性能,增益或源于补丁、注意力或特定任务适配而非语言预训练。
时间序列基础模型
时间序列基础模型将预测明确视为语言建模,通过离散化数值观测实现。如Chronos将连续时间序列值缩放量化为固定词汇表,用交叉熵损失训练变压器语言模型架构,实现跨数据集的概率零样本预测;TimesFM用修补的仅解码器架构进行零样本预测;Lag-Llama用滞后协变量开发仅解码器概率预测器;MOMENT通过掩码重建学习通用时间序列表示;MOIRAI引入跨频率、任意变量和混合分布建模进行通用预测。这些模型展现了大规模时间预训练的前景,但多为静态、单遍预测器,缺乏明确推理、修订及与外部证据的交互。
语义、自适应和智能体预测
近期研究开始探索大语言模型(LLMs)作为语义、自适应和智能预测组件。LoFT-LLM、T-LLM和TimeSAF研究语义校准、时间蒸馏和异步文本-时间序列融合;自适应和智能预测方法突破静态预测,如Synapse仲裁多时间序列基础模型,TimeCopilot协调特征分析与模型选择,TimeSeriesScientist等引入多步规划等;多数此类系统主要基于数值历史等运行。“智能时间序列预测”提出应转向含感知、规划等的迭代工作流。Nexus处于该新兴方向,基于LLM的预测系统可从LLM推理、诊断反馈和迭代校准中受益。
问题建模
提出带显式推理的多模态时间序列预测任务,即基于多模态历史上下文,联合预测序列未来值并生成因果理由。定义单变量数值时间序列 X 1:τ 与对应非结构化文本数据 E 1:τ,构成多模态历史上下文 C 1:τ =(X 1:τ,E 1:τ)。目标是生成后续 T 个时间步的数值预测 X τ+1:τ+T 及对应自然语言推理 R τ+1:τ+T,问题可表述为学习映射 F 输出预测值及理由。

Nexus
Nexus不依赖单一整体模型直接近似映射,而是将预测任务分解为情境化、双分辨率预测展望生成、预测合成与校准三个阶段。先结构化原始多模态上下文,再跨不同预测分辨率进行未来展望推理,最后用预测合成智能体合并观点,生成稳健数值预测及可解释推理。

上下文
直接将原始多模态数据输入大语言模型易致认知过载,Nexus首阶段用专用智能体(历史上下文智能体 A(ctx) 清理和结构化历史数据 C 1:τ。该智能体将原始多模态上下文与基本时间序列特征转化为结构化时间线 H 1:τ,在每个时间步分析外部文本信息 e_t 和数值 x_t,找出驱动值变化的关键因素并组织成列表,为下游预测智能体提供清晰因果信号,便于准确预测。
双分辨率预测前景生成
稳健的预测需跨多时间分辨率分析时间序列,仅关注总体趋势会忽略短期细节,仅评估逐点变化会丢失宏观转变。Nexus 从结构化历史 H₁:ₜ 生成两种互补展望:宏观推理智能体 Aₘₐₙₒ 采用自上而下方法,分析 H₁:ₜ 规划整个预测期 T 的大致轨迹,确定预期状态,以 Aₘₐₙₒ(H₁:ₜ) → (Xₜₘₐₙₒ₊₁:ₜ₊ₜ, Rₘₐₙₒ) 表示总体展望,叙事 Rₘₐₙₒ 确保最终预测与宏观转变一致。
微观推理智能体(A 𝑚𝑖𝑐𝑟𝑜)采用更细粒度方法,逐步骤遍历预测期,对每个未来时间步 𝑡 ∈ [ 𝜏 + 1 , 𝜏 + 𝑇 ],基于 H 1: 𝜏 评估即时催化剂、短期预期变化和局部波动性,映射 A 𝑚𝑖𝑐𝑟𝑜 (H 1: 𝜏 ) → (X 𝜏 𝑚𝑖𝑐𝑟𝑜 , R 𝜏 𝑚𝑖𝑐𝑟𝑜 +1: 𝜏 + 𝑇 +1: 𝜏 + 𝑇 ),输出特定推理和对应数值,确保系统对短期事件高响应。
预报生成与校正
最终阶段:合并宏微观推理视角,从预测误差中学习以优化策略。
预测合成智能体(A syn):动态评估并合并宏微观视角,依据校准准则 G(初始为空)计算最终预测,输出数值预测 X τ+1:τ+T 和推理说明R。
校准智能体(A calib):采用前向模拟回测机制,将历史数据分 n 个回测分割,最后一个为验证集,其余为训练集。并行生成各训练集基线预测,分析误差生成批判规则 G_i,取交集得主准则 G。准则 G 经验证集检验,提升至少 k% 性能才用于最终测试集,避免过拟合。
实验
实验设置
为评估大语言模型(LLMs)预测能力和Nexus框架有效性,设计实验控制数据泄露:
数据集:选取2025年1月模型知识截止日期后的两个真实数据集,即Zillow房地产指标(2025.2-10,提供前3年数据)和股票市场股票(2025.2-12,提供前1年数据)。

模型:使用Gemini-3.1Pro和Claude-4.5Sonnet,知识截止日期均为2025年1月,通过Vertex AI访问,采样温度0.1。
基线:以TimesFM-2.5为定量基线,建立基于思维链(CoT)的强基线。
评估设置与范围:在仅数值上下文和多模态上下文两种设置下评估,设置短、中、长三个预测范围,Nexus设置6次回测拆分,最小改进阈值5%。
评估指标:采用平均绝对百分比误差(MAPE)和均方根误差(RMSE)评估预测性能。
多模态上下文下的预测
评估Nexus合成数值数据与非结构化文本上下文的能力,将其与思维链(CoT)基线对比。
通过Zillow和股票市场数据集的多模态上下文预测性能结果显示,Nexus始终优于基于大语言模型的CoT基线,在Zillow数据集上表现差距更明显。使用Claude-4.5-Sonnet时,CoT基线性能显著下降,因该模型处理长上下文任务能力有限,过度依赖简单趋势外推,无法利用复杂时间特征。
股票市场因多为长期趋势,错误动态提取影响较小,而Nexus在两个领域均表现稳健,能有效跟踪细微时间动态和上下文事件。

仅用数字上下文预测
评估模型的时间序列模式识别能力,仅提供带时间戳的原始历史数值序列。对比Nexus、CoT-Baseline和TimesFM-2.5。表3展示其在Zillow和Stocks数据集上的表现,Nexus在两领域表现强,且常匹配或超TSFM,说明其除上下文推理外,还能很好捕捉时间序列动态。

推理质量评价
除数值准确性外,还需评估预测的逻辑连贯性与合理性。采用交叉评判法,用Claude-4.5-Sonnet评估Gemini-3.1-Pro输出,反之亦然。评判模型依据领域相关性、事件相关性与合理性、逻辑与数字一致性、分析深度四个标准,对Nexus和CoT基线的推理进行评估。结果显示,Nexus数值预测更优、推理更好,多数时候获评判大语言模型青睐。

成分分析
为量化框架中不同主体的影响,表 5 展示 Gemini-3.1-Pro 在多模态情境下短期预测(h_Z=4,h_S=6)的组件分析结果。将完整 Nexus 流程与禁用(i)微观推理主体、(ii)宏观推理主体、(iii)校准主体的变体进行对比。结果表明,宏观、微观和校准组件对实现最佳预测精度都至关重要。在股票市场数据集上,移除微观推理主体使 MAPE 从 0.0866 增至 0.0877,凸显细致分析对捕捉短期波动的重要性;移除宏观推理主体使 MAPE 增至 0.0882,强调总体趋势引导的重要性。完整 Nexus 流程综合宏观和微观视角,表现优于消融变体和标准 CoT,证实其架构的有效性。

总结
本文介绍Nexus多智能体框架,用于解决多模态上下文时间序列预测难题。它将预测分解为三阶段,处理数值与文本数据,动态整合宏观轨迹与微观催化剂,产出准确数值预测与明确推理。在真实数据集零样本评估中,Nexus表现优于TimesFM-2.5和强思维链大语言模型基线,为复杂领域开发可解释、稳健且适应性强的预测系统提供了有效途径。

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。