FinSTaR:首个金融时序推理模型,准确率达 78.9%,大幅超越现存SOTA

“FinSTaR: Towards Financial Reasoning with Time Series Reasoning Models”


本文介绍首个金融推理模型 FinSTaR,将金融时间序列(TS)推理分为评估和预测,分别应用 Compute-in-CoT 和 Scenario-Aware CoT。2×2 能力分类法对应十个金融推理任务,四类互补互促,场景推理在预测任务上优于标准 CoT。FinSTaR 准确率达 78.9%,大幅超越 15 个以上基线模型。


图片


【 扫描文末二维码加入星球获取论文,源码 】


摘要


时间序列(TS)推理模型(TSRMs)在一般领域表现出良好的能力,但在金融领域却表现出其独特的特征。本文提出了一种通用的2 × 2 TSRMs能力分类法,将单实体与多实体分析、当前状态评估与未来行为预测相结合。本文提出了FinSTaR(金融时间序列思维和推理),在FinTSR-Bench上训练。对于确定性的评估(即可从可观察数据中计算),我们使用了计算成本,这是一种可编程成本,使模型能够直接从原始价格中得出答案。对于具有随机性(即受不可观察因素影响)的预测,我们采用了场景感知型预测模型(Scenario-Aware CoT),它在做出判断之前会生成多种场景,反映了金融分析师在不确定性下的推理方式。该方法在FinTSR-Bench上的平均准确率达到78.9%,大大优于LLM和tsrm基线。


简介


时间序列推理模型(TSRMs)在金融时间序列(TS)上表现不佳,因金融TS特性与一般领域不同,且金融推理有评估和预测两种模式,现有TSRMs未区分。


图片


本文提出TSRMs的2×2能力分类法,在金融领域实例化为十个推理任务。构建FinTSR-Bench,含250只标普500股票(2010-2025),35K训练样本和三个各含10K样本的OOD测试集。


图片


同时提出金融领域FinSTaR,针对评估和预测采用不同思维链(CoT)策略,评估用Compute-in-CoT,预测用Scenario-Aware CoT。FinSTaR整体准确率达78.9%,优于15 + 基线模型,联合训练下四类能力互补。


图片


图片


相关工作


时间序列推理模型(TSRMs)


近期工作将大语言模型(LLMs)拓展至时间序列(TS)推理,如 TimeOmni - 1、Thoth 等,但现有 TSRMs 均针对通用领域,未涉及金融 TS。


金融领域LLMs


FinTSB 仅进行股票预测基准测试,FinBen 评估文本任务,News - to - Forecast 和 CausalStock 需文本输入,尚无工作结合原始金融 TS 与推理问答及思维链(CoT)监督,FinSTaR 填补此空白。


CoT 用于结构化数据


CoT 提升 LLM 在数学和科学任务中的推理能力,现有 TS 推理的 CoT 方法难扩展。Compute - in - CoT 确保算术正确性,Scenario - Aware CoT 拓展至随机预测,为新方向。


FinTSR-Bench


本文提出金融领域 2×2 分类法实例 FinTSR-Bench,包含训练数据集和评估基准,10 个任务覆盖分类法 4 个能力类别。


选取截至 2024 年 1 月市值前 250 的标普 500 股票,2010-2025 年日收盘价数据,200 只用于域内(ID)训练,50 只用于域外(OOD)评估。


图片


按股票范围和时间轴划分,得到 3 个测试集,各任务每拆分有约 3500 个训练样本和约 1000 个测试样本,训练共约 35000 个,每个测试集约 10000 个。


图片


FinSTaR


FinSTaR通过在FinTSR-Bench数据上进行监督微调(SFT)训练,针对评估和预测任务采用不同的思维链(CoT)监督策略。评估和预测任务认识论属性不同,评估任务答案由可观测价格数据决定,模型只需计算;预测任务答案受未来不可观测因素影响,即使完美模型预测准确率也无法达100%。因此设计两种互补CoT策略:评估用Compute-in-CoT,预测用Scenario-Aware CoT。


Compute-in-CoT


评估任务答案可从可观测价格确定计算得出。通过执行模型应学习的相同计算来编程生成思维链(CoT),链分三阶段:

1)提取:从输入价格中识别相关量;

2)计算:进行计算;

3)分类:根据问题阈值将计算结果映射到答案。


此方法保证 100% 正确性和无限可扩展性,推理时不参考不可观测信息。


图片


Scenario-Aware CoT


预测任务中,确定性思维链有问题,提出情景感知思维链(Scenario-Aware CoT),其包含五阶段结构:提取相关量、计算价格特征、进行情景分析(含基础、不利、有利情景)、评估情景、做出判断。


定义60个特定领域情景模板,训练时模型学习模式,推理时生成适配输入的情景推理。


训练设置:通过LoRA微调两个骨干模型(TimeOmni-1-7B和Qwen2.5-7B-Instruct),给出LoRA参数、学习率、训练轮数、批次大小等,FinSTaR指用思维链策略微调的TimeOmni-1-7B。


实验


基线


将FinSTaR与四类推理/语言模型基线对比:

1)语言模型;

2)TS语言模型;

3)TS推理模型,其中TimeOmni-1-7B是FinSTaR微调前的基础模型;

4)SFT基线,对Qwen2.5 - 7B在FinTSR - Bench上进行微调。还会在预测任务上与基于预测的方法对比。


所有1-3的大语言模型基线零样本评估,测试固有推理能力,表格8显示高成功率但低准确率表明输出格式不是主要瓶颈。


结果


表5对比三个测试集,FinSTaR在Test A准确率78.9%,超最佳零样本LLM、SFT基线、TSRM,在Test B和C表现也佳。


图片


观察发现:

1)评估任务因Compute - inCoT达近完美准确率。

2)预测任务中FinSTaR超所有基线,在波动率预测和支撑/阻力任务提升最大。

3)TimeMQA模型表现不如通用LLM,非金融时序训练难用于金融推理。

4)许多模型在基准测试成功率低,输出格式无效。

5)三个测试集有输入分布偏移,FinSTaR表现稳定,是自然鲁棒性测试。


消融分析


表6对比TimeOmni-1-7B无思维链(仅答案)与有思维链(FinSTaR)情况,思维链在计算明确的评估任务(相关性+56.0、波动性+56.3、趋势+31.0)增益最大,在预测任务(支撑/阻力+24.2等)有适度且一致增益,相对表现增益最小(+4.6)。


图片


Scenario-Aware CoT效果


为分离情景感知思维链的影响,对比预测任务的两种思维链配置(确定性标准思维链与概率性情景感知思维链),评估准确性相近,情景感知思维链在预测任务平均提升2.9%(波动率预测+10.2、事件响应+6.2),整体平均提升2.0%,证实情景推理能提升不确定结果的表现。


图片


分析


能力依赖分析


对TimeOmni - 1 - 7B在Test A上进行LOCO消融分析,各能力类别对自身任务至关重要,移除不致其他轴灾难性下降;联合训练比单独训练效果好,四类能力互补互促。


图片


图片


图片


成功率


多数基线模型输出格式不合格,FinSTaR成功率达100%,表明结构化CoT监督可教可靠输出格式。


图片图片


预测任务对比


TSRM可通过推理处理评估和预测,传统TS预测模型通过先预测后分类解决预测任务,FinSTaR在预测任务上优于这些模型。


图片


骨干模型敏感性


CoT 提升了 TimeOmni - 1 - 7B 和 Qwen2.5 - 7B 的评估准确率,但在预测任务中,CoT 使 TimeOmni - 1 提升 11.3%,却使 Qwen 降低 5.0%,因情景感知 CoT 需要时间序列推理能力。


图片


训练集大小影响


FinSTaR 用 350 样本/任务(全量 10%)时准确率达 71.7%,875 个时到 74.7%,1750 个时到 75.2%,之后收益递减,表明策略数据高效。


图片


CoT 质量验证


从四维度验证 FinSTaR 生成有意义推理而非模板复制,包括格式合规(超 99%含有效结构)、算术忠实(准确率超 93%)、情景多样(100 个预测输出中每任务超 85 个独特情景描述)、输出长度(预测 CoT 约为评估 CoT 的 2.4 倍)。


总结


本文介绍首个金融 TSRM FinSTaR,将金融时间序列(TS)推理分为评估和预测,分别应用 Compute-in-CoT 和 Scenario-Aware CoT。2×2 能力分类法对应十个金融推理任务,四类互补互促,场景推理在预测任务上优于标准 CoT。FinSTaR 准确率达 78.9%,大幅超越 15 个以上基线模型。



图片

▌关于我们

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。

▌商务合作

请加微信“LingDuTech163”,或公众号后台私信“联系方式”。

关注【灵度智能】公众号,获取更多AI资讯。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询