LLMs可以在脱离人为干预的情况下炒股获利吗?
“Large Language Models and Stock Investing: Is the Human Factor Required?”
传统深度市场分析由专业投资人士主导,如今AI发展使得基于大语言模型(LLMs)进行前瞻性投资研究成为可能。LLMs在金融市场应用增多引发担忧,因其可能基于错误推理等给出看似合理答案,缺乏专业知识和判断力的投资者可能过度信赖。
本文探讨大语言模型(LLMs)能否生成可靠的股市预测,评估了ChatGPT等四个模型在三种提示策略下的表现。结果显示,LLM在现有技术下可跑赢市场,但自主部署时表现不稳定,推理失误会导致投资决策错误。简单对话提示下,LLM推荐信息价值弱,零售或非专业投资者难察觉其输出问题。结构化提示框架(如监督思维链协议)可减少逻辑矛盾和推理噪声,结合人类验证能提升经济表现和预测准确性。纳入监管文件能提高预测准确性,因其信息标准、完整,可减少信息噪声。

【 扫描文末二维码加入星球获取论文 】
摘要
本文探讨大语言模型(LLMs)能否生成可靠的股市预测,评估了ChatGPT等四个模型在三种提示策略下的表现。结果显示,LLMs生成的建议受推理失误阻碍,但适当引导和监督时可跑赢市场,且基于官方监管文件的股票推荐预测准确性更高。研究强调在金融市场部署LLMs需强大的保障和验证措施。当前LLMs在金融市场应用渐广,但其能否自主生成可靠预测存疑。
简介
传统深度市场分析由专业投资人士主导,如今AI发展使金融情报大众化,大语言模型(LLMs)可支持前瞻性投资策略,有望改变投资格局,让普通人拥有专业分析资源。
LLMs在金融市场应用增多引发担忧,因其可能基于错误推理等给出看似合理答案,缺乏专业知识和判断力的投资者可能过度信赖。LLMs有效处理实时金融信息的能力尚不明确,网络信息的复杂性会干扰其推理,影响投资建议的可靠性。本文全面评估现代LLMs在金融市场的当前能力。
本文主要贡献:
评估提示工程与人工监督对股票推荐可靠性的影响,对比三种提示策略。
考察LLMs处理实时信息的能力及应对数据问题的表现。
对四个主流LLMs平台进行系统比较,评估推理质量与量化投资表现。
探究以官方监管文件为基础的LLMs推荐能否提高预测准确性。
分析不同模型和提示策略在复杂任务中的推理失败情况,提出应对机制。
相关工作
早期NLP用字典和规则法,后引入深度学习架构,如BERT模型用于金融文本挖掘和预测,能更精准提取信号,公司披露文本信息有经济价值。
近期对生成式大语言模型在金融任务评估结果不一,有的认为推荐缺乏一致性,有的表明其预测表现佳,还能结合结构化输入、实时披露提升效果,人机协作常更优。
大语言模型存在方法和解读挑战,会产生误导输出、幻觉,在数学和逻辑任务易出错,影响金融决策。
方法
本文采用稳健的样本外投资框架评估大语言模型能否生成可靠投资预测,用不同程度人工干预的提示让四个大语言模型平台生成股票预测信号,考察基于官方监管文件分析是否提升推荐质量和表现,查询遵循统一协议。
实验设置
评估为期十个月(2025 年 4 月 - 2026 年 1 月),模拟真实投资条件设信息边界,每月首个交易日提交查询,信息截止上月末。用三种提示策略让大语言模型(LLMs)计算股票基于模型的归一化至[0, 1]区间的超表现得分。每月提示在新对话环境启动,确保各期独立。超表现得分按每月首日 LLM 软件版本生成,使模型架构和信息集与实时市场约束同步。
提示词设计
实施三种提示策略(简单对话、结构化提示、思维链推理),覆盖不同投资者。
简单对话
简单对话用简单无结构提示,让模型充当财务经理,按预期月回报给股票赋[0, 1]表现得分,无分析框架、指标和权重指导。
大语言模型(LLMs)可依内部推理决定应用的变量、评估标准和聚合规则,此提示规范体现其在无结构化指导、外部依据和人工监督时生成可靠股权预测的基线性能。
结构化提示
结构化提示按金融分析实践引入分析指导与上下文约束,指示大语言模型(LLMs)基于股票回报的六个驱动因素计算表现超越得分,对每个驱动因素计算两个常用金融指标,按预定权重汇总成分得分得出[0, 1]的总体表现超越得分,需用最新数据并纳入前瞻性预期,此设计评估模型遵循指令、多步分析推理、处理异构金融信息及综合输出形成金融建议的能力。

思维链(CoT)推理通过迭代、对话式交互引入人工监督,从结构化提示输出开始,逐次审查和完善模型响应,纠正推理中的不一致,如计算错误、依赖陈旧信息和误判金融指标等问题。
思维链推理
CoT推理可提供大语言模型(LLM)可达到性能的上限估计,体现通过人为主动干预可提升模型输出的程度。
评估框架
实施双重评估框架,评估LLM投资预测的推理完整性和财务表现。
推理质量
评估大语言模型(LLM)输出的推理完整性,区分文本流畅度与分析能力。考察是否存在系统推理失败,如逻辑矛盾、计算错误、依赖过时信息等,评估其计算和解读金融与估值风险指标的能力。聚焦模型预测的构建、计算和论证过程,将推理质量与实际回报分离,以判断表现是否源于真实分析能力而非事后与市场走势的巧合。
财务表现
1)交易策略。为评估大语言模型(LLM)生成信号的表现,针对每个LLM平台和提示设计构建月长短仓投资组合,每月首个交易日建仓、最后交易日平仓,2025年4月至2026年1月共十个独立投资周期,每月初根据新信息和交易信号完全重新平衡组合;

2)事前评估指标。使用四个互补指标评估LLM生成信号的表现,涵盖超额回报、风险调整后表现和预测准确性。
超额收益(α):衡量大语言模型(LLM)投资组合相对基准的超额回报,排除市场整体波动影响。
信息比率(IR):量化投资组合的风险调整回报,是月均超额回报与超额回报标准差(跟踪误差)之比。
方向准确性:计算资产横截面正确方向预测的比例。
加权F1分数:评估模型预测可靠性,取表现优于和表现逊于基准两类的F1分数平均值。
LLM表现优于基准的分数严格事前生成,每月初依据上月末信息集获取,无后续市场信息,确保样本外评估,消除前瞻性偏差,保证研究设计的时间完整性。
提交给监管机构的文件
除简单对话、结构化和思维链查询外,评估纳入官方监管文件能否提升大语言模型投资建议质量与表现。监管披露旨在促进透明、标准和可比,适合研究结构化、高完整性数据在人工智能驱动决策时代的作用。针对每家公司和每月查询,上传前一月官方监管文件,文件从西班牙证券市场监管机构获取,含临时披露、企业通讯、年度和半年度财务报告,为大语言模型提供及时、标准、可比的股票信息。
结果和讨论
推理质量评估
LLM推理的完整性是生成可靠投资建议的前提,金融市场中内部连贯性、时间有效性和数值一致性很重要,基于错误信息的分析不可靠。
任务本身复杂,简单提示下LLM要构建金融市场预测框架,结构化和思维链提示下需完成多项任务,近似现实中股票分析师的工作流程。
评估显示LLM能生成连贯有说服力的叙述,但存在推理和计算失败问题,表现为数据不一致、财务数据误判等,影响金融决策自主性。
表3对LLM推理错误进行分类,分为四类。
1)实时数据检索:大语言模型(LLM)检索数据存在事实准确性问题,访问实时、动态或时效性数据时,输出常含过时、不一致或编造的数据,这些误差源于对表格结构的混淆、新旧内容的合并或旧信息的复用,导致输出结果混淆财务周期、货币或不同公司的数据。
2)金融解释:第二类错误是金融推理的语义失误,常见问题有:错误解读基本比率,如误将低P/B、P/E、Debt-to-Equity比率视为负面,实则其意味着低估或低杠杆;分析跨国公司时,可能混淆不同货币或会计制度下的数据,导致指标误导同行比较。
3)计算过程:即便数据检索和财务解读无误,量化执行仍可能失败,突出问题有财务指标加权与汇总不当,如类别得分超出指标合理范围,还有缺失值不当插补、加权求和算术不一致、多阶段计算中中间结果遗漏或传播错误。
4)元推理与透明度:第四类为高阶推理失败,包括内省、可审计性和复杂性管理方面的局限。模型修改错误时常给出有缺陷的自信修正,保留原错,自我评估能力有限;推理不透明,无法清晰说明表现得分的理由和权重;处理文档时阅读行为不一致,不完整阅读且可能不披露,对相似问题处理时间差异大。
管理推理失败
研究发现大语言模型虽语言流畅,但金融推理缺乏稳健性。文本解释看似连贯,即便数值输出错误也难察觉,形成“流利陷阱”,即修辞可信不代表分析可靠。
模型处理过程(2025年4月- 2026年1月)
2025 年 4 月,大语言模型(LLMs)开始整合网络浏览和实时数据检索工具,金融推理能力有限;近期迭代在算术准确性、降低幻觉率、处理缺失值和假设透明度方面有改进,高阶推理能力提升、推理失败减少。但截至 2026 年 1 月,在数据检索、计算处理、金融解释和元推理方面仍有局限,未达高风险金融环境无监控部署的稳健性要求。
缓解策略
为应对大语言模型(LLM)在定量工作流程中的推理失败,提出四个实用缓解原则:
强制“展示推理过程”:要求模型在给出最终输出前明确推理路径、假设和中间计算,减少计算幻觉,便于人工监督。
验证数据来源:模型需为所有数值输入提供明确的数据引用,同时要独立验证引用的真实性。
进行迭代验证:用户应纳入明确的验证程序,让模型对输出进行内部一致性和准确性审查。
嵌入人工监督:鉴于语言流畅可能掩盖分析缺陷,人工监督贯穿整个分析流程,专家监督对评估语义和上下文连贯性等至关重要。

LLM生成的投资组合的经济表现
LLM能跑赢市场吗?
研究对各LLM-提示配置构建2025年4月至2026年1月每月再平衡的长短仓投资组合,以超额收益和信息比率评估绩效。
简单对话:简单对话式提示平均月超额收益0.35%,与零无显著差异,信息比率低,无预测力,无法改善被动基准策略。
结构化提示:提供上下文输入和分析结构的提示可提升绩效,月均超额收益增至2.24%,信息比率升至0.58,但各模型表现有差异,部分模型存在“阿尔法不稳定”问题。
思维链推理:结合结构化提示、迭代审查和人工监督表现最佳,月均超额收益3.04%,信息比率0.68,所有模型均产生显著超额收益,其优势源于人机协作框架,通过自我纠正和人工纠错提升绩效。
分类精度和F1-Score
评估大语言模型(LLMs)对IBEX 35全资产截面个股分类准确性,而非聚焦极端五分位数。
简单对话准确率0.554、F1分数0.525,有一定预测能力但提升有限,易推理失败。
结构化提示平均准确率提至0.579、F1分数提至0.543,但不同模型和时期表现差异大。
思维链提示分类表现最佳,F1分数达0.552,能更有效处理非对称分类错误。
交易组合和横截面分类测试表明LLMs可实现市场超越,但推理错误影响可靠性。研究建议金融应用需人工监督,LLMs在有专家判断验证的工作流程中更有效。
LLM基准测试
对四个大语言模型在投资组合回报和分类指标上进行比较:
Perplexity表现最佳,在多数指标上领先,月均超额回报高,信息比率强,分类准确率和F1分数最高,其搜索架构优势明显。
Gemini排第二,多数维度超ChatGPT和DeepSeek,无监督配置下表现佳。
ChatGPT排第三,对提示设计敏感,无分析指导时难将信号转化为稳定回报。
DeepSeek表现最保守,各提示策略下超额回报为正,但风险调整表现和分类质量欠佳,CoT提示下表现弱。


监管披露的影响
研究考察将监管文件纳入投资流程是否提升大语言模型(LLM)推荐质量与表现,监管披露信息规范、可靠、低噪声,可作为语言模型的自然基础机制,减少歧义、增强可比性、约束模型依赖不完整或不一致叙述。
表6显示含与不含监管文件构建的投资组合表现指标,含监管文件的组合风险调整表现改善,信息比率提升,分类准确率和F1分数更高,不同模型和提示策略的方向准确率从0.568提升到0.579。

无分析结构和指导的简单对话查询中,纳入监管披露收益最大,如朴素提示下,月超额收益从0.40%增至1.02%,信息比率从0.06增至0.20,方向准确率和F1分数也有提升。
复杂提示策略下监管披露也提升表现,如Perplexity搭配思维链提示,月超额收益从3.5%增至4.0%。除DeepSeek外,整合监管披露后整体表现指标改善。
DeepSeek是例外,纳入监管文件表现变差,因其处理长附件有局限,无法完整解析文件,生成的摘要过于简化,无法可靠提取决策相关信息,这表明即使输入相关且高质量,也不能保证LLM输出可靠,上下文基础能提升信息价值,但需模型有效处理数据,且实证部署要有严格验证和适当监督。
随时间变化的表现
将实时评估窗口分为两个子周期,以评估大语言模型(LLMs)提取投资信号的能力,考察模型性能随时间的一致性、架构更新的影响等。
图1展示各子周期性能指标,所有提示策略表现随时间明显且持续改善,表明模型更新提升了LLM生成投资信号的预测质量。

DeepSeek改善显著,独立查询各评估指标均有提升,处理监管附件的局限性在近期版本有所缓解,虽超额回报仍低于领先平台但均为正,含监管披露查询的信息比率大幅提高。
模型更新未消除系统性推理失败,2026年初各平台和提示策略仍存在分析和计算错误,会导致错误输出和不利财务决策。
强调需强大的验证和治理机制,结构化提示、上下文整合、高质量输入和专家监督是可靠部署的关键,否则LLMs易出现系统故障,影响财务决策质量和完整性。
样本大小和软件配置
性能结果解读受两方面约束:评估期短(仅十个月)、大语言模型发展快,期间模型多方面更新致推理和信息变化,影响对比。短评估期削弱统计效力,解读点估计需谨慎,评估采用综合视角。但研究贡献不受限,十个月实盘评估为最长,目标非确定表现和技能,而是评估大语言模型信号在实盘产生回报的条件,研究为此提供重要见解。
总结
本文研究评估大语言模型(LLM)能否生成可靠股市预测,考察其在何种条件下能产生超被动基准的风险调整回报。发现LLM在现有技术下可跑赢市场,但自主部署时表现不稳定,推理失误会导致投资决策错误。简单对话提示下,LLM推荐信息价值弱,零售或非专业投资者难察觉其输出问题。结构化提示框架(如监督思维链协议)可减少逻辑矛盾和推理噪声,结合人类验证能提升经济表现和预测准确性。纳入监管文件能提高预测准确性,因其信息标准、完整,可减少信息噪声。未来AI金融应用需将LLM能力融入含分析指导、验证输入和人类监督的治理框架,需组织层面配合,辅以严格实施保障。

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。