属于Quant的LLM评测基准:QBench正式发布!

现有大模型基准已经覆盖数学、编程、金融知识和 Agent 工具调用等常见场景,但是在量化投资中,除了这些基础知识外,还存在很多量化所特有的问题,非专业人士很难发现其中的问题,由此评测出的大模型能力很难反应其在量化场景中的真实能力。 为此,我们专门设计了一套面向量化的专业LLM/AI Agent评测基准:QBench

图片

QBench 并没有被设计成金融知识题库。它是一套面向量化投资 LLM 与 AI Agent 的真实场景的评测,试图回答一个更实际的问题:模型交付的量化研究结果,究竟能不能被信任?

完整评测由两部分组成。Theory Track 为100分,占综合成绩30%;Engineering Track 同样为100分,占70%。最终成绩按下式计算:

其中Theory部分相对较为简单,涵盖一些常见的量化问题以及易犯的错误,需要大模型在不借助任何工具的情况下给出正确答案。Engineering 则考察大模型的实战能力。模型需要完成代码编写、运行、调试和结果交付,任务覆盖数据契约、因子实现、机器学习复现、回测修复、组合风险、性能优化、产物审计和端到端研究等。

QuantML-Research/QBench项目及测试结果已开源,欢迎大家加入开发组,共同维护项目,可以提交测试结果或者测试题目

图片

理论测试

本次发布首先测试 Theory Track。它包含8道题,全都有确定答案和分项评分标准,不依赖主观印象打分。

都是量化中一些常见的问题以及易犯的错误,测试难度不高,属于量化研究员入门笔试的水平。理论测试采用整卷一次作答的 score@1。模型不能调用工具、网络或其他代理。这里测量的是首次独立提交的可靠性。如果不能正确回答所有问题,说明模型对于量化场景的熟悉程度还有待提高。

模型结果

首轮测试基于 OpenCode 1.18.13 完成。本次我们对比了gpt,claude以及deepseek的相关模型,模型的结果如下:

Sol、Luna、Opus 5和Sonnet 5均取得满分。 基本复合预期,Luna 真是GPT的甜点模型了,性价比拉满。

Terra high 的96.5分全部失在 Purge/Embargo。标准测试结果是:训练集最后一个合法样本为95,96—100需要清除(标签为未来5日收益,否则会看到测试集信息);测试后的121—125仍处于测试信息区间,126—130属于额外 embargo,首个可恢复训练的样本是131。Terra 正确回答了大部分区间,却遗漏125,并将其视为合法训练样本。这个错误只扣3.5分,但样本125仍与测试信息端点接触。

DeepSeek V4 Pro 得到94分。它正确处理了大部分统计与组合问题,在交易成本题中也给出了正确方法,只因最后一次乘法错误扣1分。它同样也在Purge/Embargo的问题上发错:V4 Pro把题目明确给出的126—130重新解释成一个信息区间,又用训练标签与它求交,最终把 embargo 扩张为121—129,并把130判断为可训练。推导写得很长,术语也都正确,结论却改变了题目的数据契约。属于是过度思考导致的错误。

DeepSeek V4 Flash 的91.5分则揭示了另一类错误。它知道全表 ffill() 可能把一只证券的价格填入另一只证券,却没有看出下面的 shift(-5) 已经离开分组:

df.groupby("ticker")["close"].pct_change(5).shift(-5)

pct_change(5) 返回普通 Series 后,后续位移会按照整张表的行序执行,这属于是常见的代码错误之一。

工程测试

Theory Track 解决的是准入问题。它检查模型有没有基本的量化定义、时间意识、统计判断和代码语义能力,但不会要求模型真正读取行情数据、建立项目、修复回测、管理依赖或提交可复现产物。

理论测试只是考察模型对于量化场景的熟悉程度,工程测试才是QBench权重最高的部分,它直接考察了模型在实际项目中的能力,包含了数据检查、因子 SDK、机器学习复现、回测修复、组合风险、性能与断点续跑、产物审计以及端到端研究等任务。候选模型需要在8个独立会话和工作区中完成任务,再由冷启动 harness 与隐藏案例检查结果。后续我们也会逐一测试个模型的工程测试结果。敬请期待。

总结

属于量化的大模型评测基准,最终需要回答的问题是,当LLM交出一个因子、一段回测代码或一份研究结论时,我们有没有足够的证据相信它。


还想看哪些模型的评测结果,欢迎在评论区留言



关于QuantML

QuantML 是链接全球顶尖量化人才的高端社群,我们聚焦于机器学习在量化投资中的最前沿应用。

核心价值:

  • 顶级圈层: 社区涵盖头部机构从业者、知名私募创始人、机构量化负责人,基金经理,券商金工分析师、GitHub千星作者及顶会学者构成。
  • 每日高价值内容: 持续分享前沿论文、论文研报复现、模型代码、核心Alpha因子以及QuantML-Qlib框架等。

加入我们,与最强大脑同行,洞见量化未来。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询