精|数据分布揭穿思维链的真面目:思维链为何瞬间失灵?
旺精通:细节全解,深度精通
当你看到大语言模型“认真”写下“因为1776能被4整除,所以是闰年——结论:平年”时,是否会脊背发凉?这种前后矛盾的“推理”,暴露了一个可怕的可能:AI的“思维链”,或许根本不是思考,只是一场精心伪装的“记忆回放”。
我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识
本文聚焦大语言模型(LLMs)的思维链(CoT)推理机制,通过数据分布视角探究其本质。研究提出,CoT推理的有效性源于模型从训练数据中习得的结构化归纳偏差,即通过匹配训练分布中的模式生成近似推理路径,而非真正的逻辑推理。为验证这一假设,作者设计了受控实验环境DataAlchemy,从头训练LLMs并从任务、长度、格式三个维度系统测试分布偏移的影响。结果显示,CoT推理在分布内数据上表现有效,但在任务结构变化、推理长度差异或格式扰动等分布偏移场景下,性能急剧下降,甚至出现逻辑矛盾。研究表明,CoT推理本质是依赖训练数据的模式匹配,而非通用推理能力,为理解LLMs推理局限性及改进方向提供了关键 insights。
摘要&解读
思维链(Chain-of-Thought,CoT)提示技术已被证明能提升大语言模型(LLM)在多种任务上的性能。通过这种方法,大语言模型在给出答案前会生成类似人类的推理步骤(即CoT推理),这往往让人觉得它们在进行有意识的推理过程。然而,一些初步研究结果表明,CoT推理可能比表面看起来更肤浅,这促使我们进行更深入的探索。在本文中,我们从数据分布的视角研究CoT推理,探究CoT推理是否反映了从分布内数据中学习到的结构化归纳偏差,使模型能够条件性地生成接近训练时所见的推理路径。因此,其有效性从根本上受限于训练数据与测试查询之间的分布差异程度。基于这一视角,我们从三个维度剖析CoT推理:任务、长度和格式。为了研究每个维度,我们设计了DataAlchemy,这是一个隔离且可控的环境,用于从头开始训练大语言模型,并在各种分布条件下对其进行系统探测。我们的结果表明,CoT推理是一种脆弱的错觉,当超出训练分布时便会消失。这项工作有助于更深入地理解CoT推理为何以及何时会失效,强调了实现真正且可泛化推理所面临的持续挑战。
• 研究背景:
1. 思维链(CoT)提示技术通过引导LLMs生成分步推理,显著提升了其在逻辑、数学等任务中的表现,被认为是LLMs具备“类人推理”能力的证据。
2. 但近年研究发现,LLMs的CoT推理存在脆弱性:易受无关信息干扰、推理步骤与结论矛盾、在复杂任务中逻辑断裂,表明其可能依赖表面语义而非真正逻辑。
3. 分布外(OOD)泛化是LLMs的核心挑战,而CoT的有效性是否依赖训练数据分布,其泛化能力的边界尚不明确,需从数据分布视角深入探究。
• 研究贡献:
1. 提出“数据分布视角”:首次明确CoT推理的本质是模型对训练数据中结构化模式的匹配,其有效性受训练与测试数据分布差异的严格限制。
2. 设计受控实验环境DataAlchemy:可从头训练LLMs,系统控制任务、长度、格式等维度的分布偏移,隔离复杂预训练模式的干扰,精准测试CoT泛化能力。
3. 多维度验证:从任务(变换、元素泛化)、长度(文本、推理步骤泛化)、格式(表面扰动)三个维度,实证了分布偏移对CoT推理的毁灭性影响,揭示其“脆弱性”。
4. 理论支撑:提出CoT泛化界、任务泛化失败阈值、长度外推高斯退化等理论,量化分布差异与推理性能的关系。
• 实现设计:
1. DataAlchemy环境构建:
• 定义“基本原子”(26个字母)和“元素”(原子序列),通过元素长度控制数据集规模。
• 设计两种基础变换(ROT字母旋转、循环位置移位)及组合变换(多步连续操作),模拟多步推理过程。
2. 模型与训练:使用GPT2架构(4层、32隐藏维度),从头训练,控制温度、样本量等参数,确保实验可控。
3. 实验维度:
• 任务泛化:测试模型对新变换(组合/全新类型)、新元素(未见过的原子/组合)的适应能力。
• 长度泛化:测试文本长度(元素序列长度)、推理步骤数(变换步数)与训练分布不同时的性能。
• 格式泛化:通过插入、删除、修改噪声标记,测试表面格式扰动对推理的影响。
4. 评估指标:采用精确匹配率、编辑距离、BLEU分数,分别评估推理步骤、答案及完整链的有效性。
• 实验结果:
1. 任务泛化:
• 分布内(ID)任务中,模型表现完美(精确匹配率100%);
• 面对新变换组合(CMP)、含新变换(POOD)或全新变换(OOD)时,精确匹配率骤降至0.01%以下,甚至出现“推理对但答案错”的矛盾。
2. 长度泛化:
• 仅在训练长度(如元素长度4、推理步骤2)上表现完美;
• 长度偏离(如元素长度3或5、步骤1或3)时,精确匹配率为0,模型会强行“凑长度”(增删标记),导致逻辑混乱。
3. 格式泛化:
• 插入、修改等噪声扰动显著降低性能(BLEU分数下降至0.2-0.4),其中元素和变换相关标记的扰动影响最大,其他标记扰动影响较小。
4. 鲁棒性验证:不同温度(1e-5至1)和模型大小(68K至543M)下,实验结果一致,表明结论稳定。
1. 引言
近年来,大语言模型(LLMs)通过灵活的提示技术(Kojima 等人,2022;Wei 等人,2022;Yao 等人,2023)在各个领域发挥了主导作用(Li 等人,2025b;Ting 等人,2025;Zhao 等人,2025,2023)。其中,思维链(CoT)提示技术(Wei 等人,2022)已成为从大语言模型中引出结构化推理(即CoT推理)的重要方法。通过添加简单的提示,如“让我们一步一步思考”,大语言模型会将复杂问题分解为中间步骤,产生类似人类推理的输出。事实证明,它在需要逻辑推理(Xu 等人,2024)、数学问题解决(Imani 等人,2023)和常识推理(Wei 等人,2022)的任务中是有效的。CoT推理的实证成功使人们认为大语言模型在进行有意识的推理过程(Ling 等人,2023;Yu 等人,2023;Zhang 等人,2024a,c)。
然而,更仔细的研究发现了一些不一致之处,对这种乐观观点提出了挑战。考虑这个简单的问题:“美国成立的那一天是闰年还是平年?”当用CoT前缀提示时,现代大语言模型Gemini回应道:“美国成立于1776年。1776能被4整除,但它不是世纪年,所以是闰年。因此,美国成立的那一天是平年。”这个回应体现了一种令人担忧的模式:模型正确背诵了闰年规则,并阐述了中间推理步骤,但得出了逻辑不一致的结论(即断言1776年既是闰年又是平年)。这种不一致表明,类人推理与CoT推理之间存在区别。
越来越多的分析表明,大语言模型倾向于依赖表面语义和线索,而不是逻辑程序(Bentham 等人,2024;Chen 等人,2025b;Lanham 等人,2023)。大语言模型基于学到的标记关联构建表面的逻辑链,在偏离常识启发式或熟悉模板的任务上往往会失败(Tang 等人,2023)。在推理过程中,当引入不相关的条款时,性能会急剧下降,这表明模型无法掌握潜在的逻辑(Mirzadeh 等人,2024)。当模型在更复杂的任务上进行测试时,这种脆弱性更加明显,它们经常产生不连贯的解决方案,并且无法遵循一致的推理路径(Shojaee 等人,2025)。总的来说,这些开创性的工作加深了人们对CoT推理本质的怀疑。
鉴于这一系列研究,我们通过提出一种基于数据分布的替代视角来质疑CoT推理,并进一步研究其为何以及何时会失败。我们假设,CoT推理反映了从分布内数据中学习到的结构化归纳偏差,使模型能够条件性地生成接近训练时所见的推理路径。因此,其有效性本质上受限于训练数据和测试查询之间分布差异的性质和程度。在这种数据分布视角的指导下,我们从三个维度剖析CoT推理:(i)任务——CoT推理在多大程度上能够处理涉及转换或以前未见过的任务结构的任务;(ii)长度——CoT推理如何泛化到与训练数据长度不同的链;(iii)格式——CoT推理对表面级别的查询形式变化有多敏感。为了评估每个方面,我们引入了DataAlchemy,这是一个受控且隔离的实验,允许我们从头开始训练大语言模型,并系统地探测各种分布偏移下的模型表现。
我们的研究结果表明,当应用于分布内或接近分布内的数据时,CoT推理是有效的,但即使在适度的分布偏移下,也会变得脆弱且容易失败。在某些情况下,大语言模型会生成流畅但逻辑不一致的推理步骤。结果表明,看似结构化的推理可能是一种错觉,源于训练数据中记忆或插值的模式,而非逻辑推理。这些见解对从业者和研究人员都具有重要意义。对于从业者,我们的结果强调了将CoT作为推理任务的即插即用解决方案的风险,并警告不要将CoT风格的输出等同于人类思维。对于研究人员,结果强调了实现既可靠又可泛化的推理所面临的持续挑战,促使需要开发能够超越表面模式识别、展现更深层次推理能力的模型。我们的贡献总结如下:
★新视角:我们提出了CoT推理的数据分布视角,阐明其有效性源于从分布内训练数据中学习到的结构化归纳偏差。该框架为理解CoT推理为何以及何时成功或失败提供了原则性的视角。
受控环境:我们引入了DataAlchemy,这是一个隔离的实验框架,能够从头开始训练大语言模型,并系统地探测CoT推理。这种受控设置允许我们隔离和分析分布偏移对CoT推理的影响,而不受大规模预训练过程中学习到的复杂模式的干扰。
实证验证:我们在三个关键维度(任务、长度和格式)上进行了系统的实证验证。我们的实验表明,CoT推理在分布偏移下表现出显著的性能下降,揭示了看似连贯的推理掩盖了浅层模式复制。
现实意义:这项工作重新构建了对当代大语言模型推理能力的理解,并强调了过度依赖CoT推理作为通用问题解决范式的风险。它强调了适当评估方法的必要性,以及开发具有真实且可泛化推理能力的大语言模型的必要性。
2. 相关工作
2.1. 大语言模型提示与思维链
思维链(CoT)提示通过将复杂问题分解为中间步骤,彻底改变了我们从大语言模型中引出推理的方式(Wei 等人,2022)。通过用推理链增强少样本示例,CoT在各种任务上显示出显著的性能提升(Imani 等人,2023;Wei 等人,2022;Xu 等人,2024)。在此基础上,出现了几种变体。零样本CoT使用指导性提示在没有示例的情况下触发推理(Kojima 等人,2022),自一致性通过对采样链进行多数投票来提高性能(Wang 等人,2023)。为了减少人工工作量,Auto-CoT使用模型自身生成CoT示例(Zhang 等人,2023)。除了线性链之外,思维树(ToT)将CoT构建为对部分推理路径的树搜索(Yao 等人,2023),实现前瞻和回溯。SymbCoT通过将问题转换为形式表示,将符号推理与CoT相结合(Xu 等人,2024)。最近的工作越来越多地将CoT集成到大语言模型推理过程中,生成长篇CoT(Guo 等人,2025;Jaech 等人,2024;Team 等人,2025;Team,2024)。这实现了灵活的策略,如错误纠正、步骤分解、反思和替代推理路径(Chen 等人,2025a;Yeo 等人,2025)。提示技术和长篇CoT的成功使许多人将其视为大语言模型中出现类人推理的证据。在这项工作中,我们通过采用以数据为中心的视角来挑战这一观点,并证明CoT行为主要源于对训练分布的模式匹配。
2.2. 关于大语言模型推理错觉的讨论
虽然思维链提示在复杂推理任务上带来了令人印象深刻的收益,但越来越多的工作开始质疑这些收益的本质。一个主要的研究方向强调了CoT推理的脆弱性。微小且语义无关的扰动,如干扰短语或改变的符号形式,会导致最先进的模型性能显著下降(Mirzadeh 等人,2024;Tang 等人,2023)。模型经常将这些不相关的细节纳入其推理中,表明它们对显著信息缺乏敏感性。其他研究表明,模型优先考虑推理的表面形式而不是逻辑合理性;在某些情况下,更长但有缺陷的推理路径比更短但正确的推理路径能产生更好的最终答案(Bentham 等人,2024)。同样,性能不会如预期般随问题复杂性而变化——模型可能在简单问题上过度思考,而在更难的问题上放弃(Shojaee 等人,2025)。另一个关键问题是推理过程的可靠性。基于干预的研究表明,即使中间步骤被伪造或省略,最终答案通常也保持不变(Lanham 等人,2023),这种现象被称为透明度错觉(Bentham 等人,2024;Chen 等人,2025b)。总之,这些发现表明,大语言模型不是有原则的推理者,而是推理类文本的复杂模拟器。然而,对CoT推理为何以及何时失败的系统理解仍然是一个谜。
2.3. 大语言模型的分布外泛化
分布外(OOD)泛化,即测试输入与训练数据不同,仍然是机器学习中的一个关键挑战,特别是对于大语言模型(LLMs)(Budnikov 等人,2025;Yang 等人,2024,2023;Zhang 等人,2024b)。最近的研究表明,被提示学习新函数的大语言模型往往会回归到预训练期间遇到的类似函数(Garg 等人,2022;Wang 等人,2024)。同样,大语言模型的泛化通常依赖于将新问题映射到熟悉的组合结构(Song 等人,2025)。CoT提示提高了OOD泛化(Wei 等人,2022),早期工作表明,对于超出训练分布的多步骤问题,长度泛化是可能的(Shen 等人,2025;Yao 等人,2025)。然而,这种能力并非CoT所固有,并且在很大程度上取决于模型架构和训练设置。例如,只有当算法结构被编码到位置编码中时,才能在算术任务中实现强泛化(Cho 等人,2024)。同样,训练期间更细粒度的CoT演示提高了OOD性能,突出了数据粒度的重要性(Wang 等人,2025a)。理论和实证证据表明,只有当测试输入与训练数据共享潜在结构时,CoT才能很好地泛化;否则,性能会急剧下降(Li 等人,2025a;Wang 等人,2025b)。尽管前景广阔,但CoT在真正新颖的任务或格式上仍然存在困难。鉴于这些出色的发现,我们建议通过数据分布视角重新思考CoT推理:将CoT分解为任务、长度和格式泛化,并在受控设置中系统地研究每个方面。
3. 数据分布视角
我们提出了一个根本性的重构来理解CoT实际上代表什么。我们假设,通过数据分布的视角可以更好地理解其潜在机制:CoT并非执行显式的推理程序,而是作为一种模式匹配过程,从训练分布中存在的统计规律进行插值和外推。具体而言,我们认为CoT的成功并非源于模型固有的推理能力,而是源于其对与分布内示例结构相似的分布外(OOD)测试用例进行条件泛化的能力。
为了形式化这一观点,我们将CoT提示建模为受训练数据分布特性约束的条件生成过程。令表示输入-输出对上的训练分布,其中x表示推理问题,y表示解决方案序列(包括中间推理步骤)。模型通过最小化从抽取的样本的经验风险来学习近似。
令预期训练风险定义为:
其中是特定任务的损失函数(例如,交叉熵、标记级准确性)。在推理时,给定从可能不同的分布中采样的测试输入,模型生成基于从学习的模式的响应。相应的预期测试风险为:
模型从到的泛化程度由两者之间的分布差异决定,我们使用散度度量来量化:
定义3.1(分布差异)。给定训练分布和测试分布,分布差异定义为:
其中是量化两个分布之间统计距离的散度度量(例如,KL散度、瓦瑟斯坦距离)。
定理3.1(CoT泛化界)。令表示在上训练的模型,具有预期训练风险。对于测试分布,预期测试风险有界:
其中是依赖于模型架构和任务复杂性的 Lipschitz 常数,n是训练样本大小,该界以概率成立,其中是失败概率。
证明见附录A.1。
基于这种数据分布视角,我们确定了分布偏移可能发生的三个关键维度,每个维度都揭示了CoT模式匹配性质的不同方面:
• ➊ 任务泛化检查CoT在不同类型的推理任务之间的迁移能力。新任务可能具有独特的元素和潜在的逻辑结构,这会引入分布偏移,挑战模型应用所学推理模式的能力。
• ➋ 长度泛化研究CoT对不同长度的推理链的鲁棒性。由于训练数据通常包含一定长度范围内的推理序列,需要明显更长或更短的推理链的测试用例代表了沿序列长度维度的一种分布偏移。这种长度差异可能源于推理步骤或文本相关的解决方案空间。
• ➌ 格式泛化探索CoT对提示表述和结构变化的敏感性。由于各种原因(例如,复杂的训练数据或用户的不同背景),大语言模型从业者很难设计出一个黄金提示来引出适合当前情况的知识。它们的详细定义和实现将在后续章节中给出。
每个维度都为理解CoT有效性的边界及其表观推理能力背后的机制提供了独特的视角。通过在受控实验设置中系统地改变这些维度,我们可以实证验证我们的假设,即随着分布差异的增加,CoT性能会可预测地下降,从而揭示其作为模式匹配而非推理系统的基本性质。
4. DataAlchemy:一个隔离且受控的环境
为了系统地研究分布偏移对CoT推理能力的影响,我们引入了DataAlchemy,这是一个为受控实验设计的合成数据集框架。该环境使我们能够在精确定义的条件下从头开始训练语言模型,从而可以严格分析不同OOD场景下的CoT行为。概述如图2所示。

4.1. 基本原子和元素
令表示26个基本原子的字母表。元素e定义为原子的有序序列:
其中
这种设计通过改变元素长度来提供数据集D大小(即)的灵活操作,以训练具有各种容量的语言模型。同时,它还允许我们系统地探测文本长度泛化能力。
4.2. 变换
变换是对元素进行操作的运算。在这项工作中,我们考虑两种基本变换:ROT变换和循环位置移位。为了正式定义这些变换,我们引入一个双射映射,其中,使得将字符映射到其基于零的字母索引。
定义4.1(ROT变换)。给定元素和旋转参数,ROT变换产生元素。每个原子为:
此操作将每个原子在字母顺序中向前循环移位n个位置。例如,如果且,则。
定义4.2(循环位置移位)。给定元素和移位参数,循环位置移位产生元素。每个原子由索引的循环移位定义:
此变换将序列中原子的位置向右循环移位n个位置。例如,如果且,则。
定义4.3(广义组合变换)。为了建模多步推理,我们将组合变换定义为一系列操作的连续应用。令是一个操作序列,其中每个是基本变换之一,具有其各自的参数。序列S的组合变换是函数组合:
得到的元素通过将操作顺序应用于初始元素e获得:
这种设计通过改变序列中操作的类型、参数、顺序和长度,可以构建任意复杂的变换链。在采样时,我们可以通过分解中间过程自然地获得COT推理步骤:
查询推理步骤答案
4.3. 环境设置
通过对元素和变换的系统操作,DataAlchemy提供了一个灵活且可控的框架,用于从头开始训练大语言模型,便于对各种OOD场景进行严格研究。除非另有说明,我们采用解码器-only语言模型GPT2(Radford等人,2019),其配置为4层、32个隐藏维度和4个注意力头。我们使用字节对编码(BPE)分词器。大语言模型和分词器都遵循一般的现代大语言模型流程。在推理时,我们将温度设置为1e-5。为了严谨起见,我们还在第8节中研究了具有各种参数、架构和温度的大语言模型。实现细节见附录B。我们认为每个元素由4个基本原子组成,这为每个具有不同变换和标记数量的数据集产生456,976个样本。我们初始化两个变换和。我们将完全匹配率、莱文斯坦距离(即编辑距离)(Yujian和Bo,2007)和BLEU分数(Papineni等人,2002)作为指标,并评估产生的推理步骤、答案和完整链。数据集和评估的示例见附录C。
5. 任务泛化
任务泛化是CoT推理面临的一项基本挑战,因为它直接测试模型将学到的概念和推理模式应用于未见过的场景的能力。在我们的受控实验中,变换和元素都可能是新颖的。据此,我们将任务泛化分解为两个主要维度:元素泛化和变换泛化。
任务泛化复杂性。在数据分布视角的指导下,我们首先引入泛化难度的度量:
命题5.1(任务泛化复杂性)。对于在元素上操作的推理链,定义:
作为任务差异的度量,其中、、是不同新颖性类型的权重参数,是特定任务常数。、和分别表示训练期间使用的按位元素集、关系集和关系集的顺序。
我们建立了一个临界阈值,超过该阈值,CoT推理将呈指数级失败:
定理5.1(任务泛化失败阈值)。存在一个阈值,使得当时,正确CoT推理的概率呈指数级下降:
证明见附录A.2。
5.1. 变换泛化
变换泛化评估CoT推理在模型测试期间遇到新变换时有效迁移的能力,这在现实世界应用中是一种特别普遍的场景。
实验设置。为了系统地评估变换的影响,我们通过在训练集和测试集之间改变变换,同时保持其他因素(例如,元素、长度和格式)不变来进行实验。根据命题5.1中形式化的直觉,我们定义了变换中分布偏移的四个递增级别,如图2所示:(i)分布内(ID):测试集中的变换与训练期间观察到的变换相同,例如。(ii)组合(CMP):测试样本包含先前遇到的变换的新组合,尽管每个单独的变换仍然是熟悉的,例如、、。(iii)部分分布外(POOD):测试数据包括至少涉及一个训练中未见过的新变换的组合,例如。(iv)分布外(OOD):测试集包含训练中未见过的全新变换类型,例如。

发现。图3说明了在根据定义5.1中的任务泛化复杂性(标准化在0和1之间)计算的不同分布差异下完整链的性能。我们可以观察到,一般而言,随着分布差异的增加,CoT推理的有效性会降低。如表1中的实例所示,从分布内到组合、POOD和OOD,在变换的数据上测试时,完全匹配率从1下降到0.01、0和0,编辑距离从0增加到0.13、0.17。除了ID之外,大语言模型在大多数情况下无法生成正确的完整链,而它们在某些组合和POOD条件下可能会偶然产生正确的CoT推理。如表2所示,从到,大语言模型可以正确回答0.1%的问题。仔细检查发现这是一个巧合,例如查询元素是A、N、A、N,恰好对附录D.1中详细说明的两个操作产生相同的结果。当通过将完整链分解为推理步骤和答案进行进一步分析时,我们观察到推理步骤和答案之间的强一致性。例如,在组合泛化设置下,推理步骤在测试数据分布和上完全正确,但答案错误。在附录D.1中探究这些持续存在的情况,我们可以发现,当存在新的变换(例如)时,大语言模型会尝试基于训练期间见过的最相似的变换(即)来泛化推理路径,这导致正确的推理路径,但答案不正确,这与引言中的示例相呼应。同样,从到或反之的泛化允许大语言模型产生正确的答案,这归因于两个正交变换之间的交换性质以及不可靠的推理路径。总的来说,上述结果表明,CoT推理无法泛化到新的变换,甚至无法泛化到新的组合变换。在任务变换下,CoT推理似乎反映了训练期间学到的模式的复制,而不是对文本的真正理解。
表1 | 变换泛化不同场景下的完整链评估。

表2 | 变换泛化中CoT推理不同组件的评估。CoT推理显示出推理步骤和答案的不一致性。

实验设置。为了进一步探究CoT推理何时能够泛化到未见过的变换,我们在一小部分的未见过的数据上进行有监督微调(SFT)。通过这种方式,我们可以减少训练集和测试集之间的分布差异,这可能有助于大语言模型泛化到测试查询。

发现。如图4所示,我们可以发现,通常很小一部分()的数据可以使模型快速泛化到未见过的变换。训练数据和测试数据之间的差异越小,模型泛化的速度就越快。这表明训练数据中出现类似的模式有助于大语言模型泛化到测试数据集。
5.2. 元素泛化
当大语言模型尝试泛化到新任务时,元素泛化是另一个需要考虑的关键因素。
实验设置。与变换泛化类似,我们固定其他因素,并考虑元素的三个渐进分布偏移:ID、CMP和OOD,如图2所示。值得注意的是,在组合中,我们测试当看到元素中的所有基本原子时,CoT推理是否可以泛化到新的组合,例如。基于组合中的原子顺序(可以通过编辑距离n来衡量),可以进一步扩展CMP。而对于OOD,构成元素的原子在训练期间是完全未见过的。

发现。与变换泛化类似,如图5所示,当面临分布偏移时,所有变换的性能都会持续急剧下降。从ID到CMP和OOD,所有情况下的完全匹配率都从1.0下降到0。最引人注目的是,当转移到和变换时,BLEU分数为0。附录D.1中的一个失败案例表明,当存在新元素时,模型无法响应任何单词。我们通过进行SFT进一步探索CoT推理何时能够泛化到新元素。结果总结在图6中。我们在三种场景下评估完整链的三个完全匹配率,CMP基于编辑距离n。结果与变换上的SFT相似。当训练数据中出现类似(n小)的示例时,性能会迅速提高。有趣的是,当时,CoT推理的完全匹配率与性能的下限一致,这可能表明即使在下游任务上进行SFT,CoT推理对新元素的泛化也非常有限。当我们进一步分析时训练期间推理、答案和标记的完全匹配率,如图6b所示。我们发现在训练过程中,答案和推理步骤的准确性不匹配,这在某种程度上可能解释了为什么CoT推理在某些情况下不一致。

6. 长度泛化
长度泛化研究当模型遇到与训练分布长度不同的测试用例时,CoT推理如何退化。长度的差异可能来自问题的文本空间或推理空间。因此,我们将长度泛化分解为两个互补的方面:文本长度泛化和推理步骤泛化。根据直觉,我们首先提出测量长度差异。
长度外推界。我们建立了长度外推的幂律关系:
命题6.1(长度外推高斯退化)。对于在固定长度的思维链序列上训练的模型,测试长度L处的泛化误差遵循高斯分布:
其中是处的分布内误差;是长度泛化宽度参数,L是测试序列长度。
证明见附录A.3。
表3 | 文本长度泛化评估。

6.1. 文本长度泛化
文本长度泛化评估当输入文本长度(即元素长度n)与训练示例不同时,CoT性能如何变化。考虑到大语言模型处理长文本的方式,这一方面至关重要,因为现实世界的问题通常涉及不同程度的复杂性,这些复杂性表现为问题陈述长度、上下文大小或信息密度的差异。
实验设置。我们在文本长度仅为的数据集上预训练大语言模型,同时固定其他因素,并在各种长度上评估性能。我们在预训练期间考虑三种不同的填充策略:(i)无:大语言模型不使用任何填充。(ii)填充:我们将大语言模型填充到上下文窗口的最大长度。(iii)分组:我们将文本分组并将其截断为最大长度的段。

发现。如表3所示,即使这些长度呈现轻微的分布偏移,CoT推理也无法直接生成两个测试用例。此外,如图7所示,随着长度差异的增加,性能下降。例如,从的数据到或的数据,BLEU分数从1下降到0.55和0.62。附录D.1中的示例表明,大语言模型试图通过在推理链中添加或删除标记来生成与训练数据长度相同的CoT推理。CoT推理长度泛化的有效性随着差异的增加而恶化。此外,我们考虑使用不同的填充策略来减少训练数据和测试用例之间的差异。我们发现填充到最大长度对长度泛化没有帮助。然而,当我们使用分组策略替换填充文本时,性能会提高,这表明其有效性。
6.2. 推理步骤泛化
推理步骤泛化研究模型是否能够外推到需要与训练期间观察到的步骤不同的推理链。这是多步推理任务中的常见设置。
实验设置。与文本长度泛化类似,我们首先用推理步骤预训练大语言模型,并在推理步骤或的数据上进行评估。

发现。如图8所示,CoT推理不能跨需要不同推理步骤的数据泛化,表明泛化失败。然后,我们尝试通过在预训练模型时逐渐增加未见过的数据的比例,同时保持数据集大小不变来减少引入的分布差异。然后,我们在两个数据集上评估性能。正如我们所观察到的,目标数据集的性能随着比例的增加而提高。同时,由于训练数据量小,大语言模型无法泛化到原始训练数据集。测试不同步骤泛化时的趋势相似,这直接遵循直觉并验证了我们的假设。
10. 结论
在本文中,我们通过数据分布的视角批判性地审视了大语言模型的COT推理,揭示出感知到的结构化推理能力很大程度上源于由分布内训练数据塑造的归纳偏差。我们提出了一个受控环境DataAlchemy,允许沿着三个关键维度系统地探测CoT推理:任务结构、推理长度和查询格式。实证结果一致表明,CoT推理能有效地再现与训练分布紧密一致的推理模式,但在面临分布偏差时会遭受显著退化。这些观察结果揭示了当前CoT推理能力固有的脆弱性和肤浅性。我们提供的见解强调了对从业者和研究人员的现实意义。
参考资料
• 标题:Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens
• 作者:Chengshuai Zhao, Zhen Tan, Pingchuan Ma, Dawei Li, Bohan Jiang, Yancheng Wang, Yingzhen Yang, Huan Liu
• 单位:Arizona State University, USA
• 标签:大语言模型(LLMs)、思维链推理(CoT)、数据分布、分布偏移、机器学习、自然语言处理(NLP)
• 概述: 本文从数据分布视角研究大语言模型的思维链推理,发现其有效性依赖于训练数据分布,本质是模式匹配,超出分布范围则失效,是一种“脆弱的错觉”。
• 链接:https://arxiv.org/pdf/2508.01191
