LLM 直接写量化策略,到底靠不靠谱?

经常有人问我,直接用 AI 写策略能赚钱吗?关于这个问题,我先讲自己的一段真实经历,前年大概这个时间点的时候,当时GPT-4o火得一塌糊涂。网上满屏都是AI几分钟撸出一个项目的视频。我当时心痒了,对着GPT敲下一行字:“用Backtrader写一个RSI超卖反弹策略,RSI低于30买入,高于70卖出,半仓搞。”

代码十几秒就吐出来了。类继承、初始化、买卖逻辑,甚至连打印日志的代码都有。我顺手粘进IDE,敲下回车。没报错。回测引擎跑得极顺畅。

结果equity曲线画出来,一条死气沉沉的直线。零笔交易。

我对着日志排查了俩小时。第一个元凶,藏在Backtrader的内部逻辑里。LLM写的条件是 if self.rsi < 30。这在原生Python里毫无毛病,Line对象自带 __lt__ 方法,运行畅通无阻。问题在于它表达的意思跟你想的完全脱节。必须要加个中括号,写成 if self.rsi[0] < 30,才能取到当天的值。就这一个 [0],卡掉我一个小时。

修完这个再跑,依然零成交。这次更隐蔽:那半年行情里,RSI压根没跌破过30。更要命的是,AI硬生生用严格的 and 把几个入场条件绑死,信号根本凑不齐。

等我手动把阈值调宽,把条件放宽,交易确实有了。手续费却直接把利润啃光,满屏都是假突破。

那时我就在想,这压根跟编程能力没多大关系。LLM懂Python,懂语法,甚至import都没漏。它缺的,是把金融直觉翻译成机器指令的那种直觉。你需要清楚框架底层怎么取值,需要明白参数卡得太死会导致没有信号。这些需要长时间积累的经验,需要有市场经验,这些平时都藏在量化研究员的肌肉记忆里。

最近我刷到Lime团队的一篇新论文——QuantCode-Bench(论文详细解读及代码见QuantML知识星球), 他们专门做了一套评测,我觉得还挺有意思的。他们收集了400个具体的策略任务,拉着一堆大模型挨个测。测试分成四阶漏斗设计:

第一关测语法,几乎全员满分。 接着是第二关跑回测,开始有人因为索引越界或者数据对齐报错掉队。 到了第三关最真实:策略至少得下一笔单。就在这儿,一大批模型全军覆没。回测跑了个寂寞,跟我当时的遭遇如出一辙。 最后一关,用模型做裁判,看看代码有没有偏离最初的想法。

一遍跑下来,即便最强的Claude-opus-4.6,通过率也就75.8%。国内最强的分别是 glm-5(单轮) 和 kimi-k2.5(多轮)。

图片

这组数据让我联想到最近学术界的另外两个动作。今年2月份有一篇叫《AlphaForgeBench》的论文,同样测了LLM做交易。里面提到一个很刺眼的现象:直接让LLM当交易员去下决策,它的表现极其神经质,动作前后矛盾,方差大得离谱。一旦换个思路,把它当成量化研究员,只让它去生成可执行的Alpha因子,把逻辑推理和买卖执行彻底拆开,效果瞬间就稳了。

还有西交利物浦大学提出过一个LLM-GA框架,把大模型和遗传算法绑在一起。人类用不着指望LLM一次写出完美策略,只需利用它去给策略做变异和交叉,靠它的常识储备保持策略在逻辑上不出大格。

把这些研究印证着看,你会发现一条清晰的底线:在 harness 没有完善之前,直接把LLM当成能独立干活的黑盒,早晚要翻车。

回到Lime团队那篇论文,里面有个非常有意思的数据。单次生成通过率只有七成多,要是给模型加上Agentic多轮反馈机制——允许它失败,把报错信息喂给它,最多修10次——最佳模型的通过率直接飙到了95%到98%之间。

这就完全说得通了。

你看那些具体的死因:搞错Line对象的布尔判断占了13.1%,条件太苛刻导致零信号占了17.8%。这些全是小细节的跟头。你给它一句“回测没信号,去检查条件是不是太严了”,它马上就能顺藤摸瓜改过来。

这其实把量化开发的流程重塑了一遍。

以前我们习惯在脑子里推演,然后一点点抠代码,发现bug再重写。以后可能更糙一点:甩个模糊的想法给LLM,出个初稿,跑回测,把报错甩给它,让它自己修,往复迭代个三五轮。那些繁琐的数据清洗、框架搭建、指标计算,尽可以交给它干。我们要做的,是死死盯住核心的逻辑和参数。

我跟几个做投资的朋友聊过,大家体感差不多。AI能帮忙省掉大半的体力活,跑个框架出来极快。参数怎么给、条件怎么拼,终究还得人来定夺。

所以别总盘算着让AI凭空搓出一个夏普爆表的提款机。完美策略这种东西,连人都写不出。当下的LLM,更像是一个带点粗心、但手脚极快的量化实习生。你把要求讲透,逐行盯紧,错了打回去重做,它就能帮你搭好一个靠谱的策略原型。

想要让 AI 真正实现自主策略的生成和进化也并非不可能,但是这是一个系统性的工程,不能仅仅依靠一两句提示词就指望 AI 帮你完成。需要的是完整的 harness 工程,我们最近也在开发一个相当完善的框架,具体思想可以参考我们之前的文章。

最近在开发过程当中,我有个感受越来越强烈:AI 的技术边界往往不在它能做什么,而在我们愿意花多少耐心去纠正它。



关于QuantML

QuantML 是链接全球顶尖量化人才的高端社群,我们聚焦于机器学习在量化投资中的最前沿应用。

核心价值:

  • 顶级圈层: 社区涵盖头部机构从业者、知名私募创始人、机构量化负责人,基金经理,券商金工分析师、GitHub千星作者及顶会学者构成。
  • 每日高价值内容: 持续分享前沿论文、论文研报复现、模型代码、核心Alpha因子以及QuantML-Qlib框架等。

加入我们,与最强大脑同行,洞见量化未来。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询