精|大语言模型测试时扩展(Test-Time Scaling)技术综述
旺精通:技术细节全解,深度精通技术
大语言模型已成为人工智能领域的焦点,可推理时如何充分发挥其潜力却难题重重。一种名为测试时扩展(TTS)的技术崭露头角,它究竟有何神奇之处?又将如何重塑大语言模型的未来?让我们一探究竟。
我们详细翻译解读最新论文,文末有相关信息。

作者:张长旺,图源:旺知识
大语言模型通过训练时扩展提升智能,但推理时如何充分激发其智能仍是挑战。测试时扩展(TTS)能在推理时分配额外计算资源提升性能,然而该领域缺乏统一系统框架。本文通过全面综述,填补这一空白,为TTS研究与应用提供指导,推动大语言模型在现实世界的有效应用 。
本文围绕大语言模型测试时扩展(TTS)展开,提出由扩展什么、如何扩展、在何处扩展以及扩展效果如何构成的统一多维框架。通过这一框架,对TTS相关方法、应用场景和评估方面进行系统回顾,并给出TTS发展轨迹与实用指南,最后识别出开放性挑战,提出未来研究方向。
摘要&解读
随着预训练时代对计算资源(数据和参数)扩展的热情逐渐减退,测试时扩展(Test-Time Scaling,TTS),也称为“测试时计算”,已成为一个突出的研究焦点。最近的研究表明,TTS可以进一步激发大语言模型(LLMs)的问题解决能力,不仅在数学和编程等专业推理任务中取得重大突破,在开放式问答等通用任务中也有显著进展。然而,尽管该领域近期研究成果大量涌现,但仍迫切需要一项全面的综述,以提供系统性的理解。为填补这一空白,我们提出了一个统一的、多维度的框架,该框架基于TTS研究的四个核心维度构建:扩展什么、如何扩展、在何处扩展以及扩展效果如何。基于这一分类法,我们对相关方法、应用场景和评估方面进行了广泛回顾,并进行了有条理的拆解,以突出各个技术在更广泛的TTS领域中独特的功能作用。通过这一分析,我们提炼出了TTS迄今为止的主要发展轨迹,并为实际应用提供了实用指南。此外,我们识别出了几个开放性挑战,并对有前景的未来研究方向提出了见解,包括进一步扩展、明确技术的功能本质、推广到更多任务以及更多归因分析等。
• 研究背景:大语言模型在训练时通过扩展数据和参数提升智能,但推理时如何充分发挥其能力有待解决。人类认知面对复杂问题时深入思考的模式,启发研究人员引入测试时扩展(TTS),为推理时分配额外计算资源。尽管TTS研究成果不断涌现,却缺乏统一系统框架。
• 研究贡献:提出四轴分类法,对TTS方法进行结构化分类、比较与扩展;基于分类法对TTS领域进行综述,分析代表性方法并给出研究应用和部署指南;揭示关键挑战,提出未来研究方向,将开放性问题映射到TTS具体维度。
• 实现设计:从扩展什么、如何扩展、在何处扩展以及扩展效果如何四个维度展开。“扩展什么”涵盖并行、顺序、混合、内部扩展;“如何扩展”包含基于微调(监督微调、强化学习)和基于推理(刺激、验证、搜索、聚合)的方法;“在何处扩展”涉及推理密集型和通用任务;“扩展效果如何”通过性能、效率、可控性、可扩展性指标评估。
• 实验结果:不同测试时扩展方法在数学推理、编程、博弈等多种任务中,提升了大语言模型性能,通过多种评估指标,如首次通过率、k次尝试通过率等,验证了方法的有效性,同时也对方法的效率、可控性和可扩展性进行了分析 。
1 引言
近年来,大语言模型(LLMs)(Brown等人,2020;OpenAI,2024a)已成为迈向通用人工智能(AGI)(Goertzel,2014;Bubeck等人,2023)的一个变革性里程碑。这些模型通过训练时扩展来显著学习通用智能,即模型摄入更多的数据和参数(Kaplan等人,2020;Hoffmann等人,2022)。然而,一个核心挑战仍然存在:如何在推理时充分激发大语言模型中编码的智能,以最大化其在现实世界中的有效性(Wei等人,2022;Ouyang等人,2022)?

人类认知可能提供了一条线索。当面对复杂问题时,人们倾向于进行更深入、更审慎的思考,往往能产生更好的结果(Kahneman,2011,2003;Evans,1984)。受这一原理启发,最近的研究(Wei等人,2022;Wang等人,2023)引入了在推理时分配额外计算资源以提升任务性能的方法。值得注意的是,一些研究(Brown等人,2024b;Wu等人,2024c)观察到了类似于缩放定律的模式:增加推理时的计算量会带来持续的性能提升。这一系列方法被称为测试时扩展(TTS),它在测试时逐步激发模型的智能。推理模型,如o1(OpenAI,2024b)和R1(DeepSeek-AI,2025)的显著成功,进一步激发了人们对TTS的兴趣,凸显了其作为大语言模型推理和实用功能关键驱动力的潜力。然而,尽管该领域的研究活动激增,但目前缺乏一个统一且系统的框架来综合见解、比较技术或识别TTS中的一致趋势。为解决这一差距,我们对TTS进行了全面综述,提供了一个分层且可扩展的框架,用于分析方法、梳理研究成果并指导未来进展。
虽然先前的研究从特定视角审视了TTS,如输入修改和输出验证(Snell等人,2024),或通过系统2人工智能和长思维链(CoT)的视角(Li等人,2025i;Ji等人,2025;Chen等人,2025b),但它们通常将方法视为孤立的实例或抽象的推理理念。相比之下,我们的工作强调对TTS进行细粒度、基于分解的理解。我们分析了从扩展公式和算法机制到任务领域和性能维度的整个流程。据我们所知,这是第一项在多个正交维度上全面审视TTS的综述,为理论探究和实际应用提供了结构化的视角。

我们的框架将TTS分解为四个关键维度:扩展什么、如何扩展、在何处扩展以及扩展效果如何。它提供了一个结构化基础,使未来的研究能够无缝融入我们的分类法,更易于理解其贡献。具体而言,“扩展什么”(第2节)指的是在推理阶段进行扩展或调整以提升大语言模型性能的特定TTS形式。“如何扩展”(第3节)涉及这些方法的实现方式,我们对各种技术进行分类,并认识到单一方法可能涉及多种技术。例如,复杂的搜索策略可用于生成较长的思维链(CoT),然后通过监督微调(SFT)进行优化,以增强大语言模型的模仿能力。“在何处扩展”(第4节)涵盖了应用这些技术的任务和数据集。“扩展效果如何”(第5节)则是指评估TTS方法的不同属性。我们在每个维度下进一步提供细粒度的子类别,并系统地梳理代表性工作,以突出它们的贡献和权衡(第6节)。通过这一结构化分析,我们提取了TTS发展的主要趋势,并为实际应用提供了实用指导(第7节)。基于我们的多维分类法,我们还识别出了持续存在的挑战和有前景的研究方向(第8节):推进测试时的可扩展性、明确TTS中不同技术有效性的基本本质、将应用范围扩展到更广泛的下游任务,以及在效率等其他维度上优化TTS方法。
我们的贡献主要体现在三个方面:
1. 统一的多维分类法:我们提出了一个四轴分类法——扩展什么、如何扩展、在何处扩展以及扩展效果如何,为TTS方法提供了结构化的分类、比较和可扩展性支持。
2. 系统的文献梳理和实用分析:使用我们的分类法,我们对TTS领域进行了综述,分析了代表性方法,并提出了研究应用和部署的指南。
3. 挑战、见解和未来方向:基于我们的结构化视角,我们揭示了关键挑战,从推进扩展到明确本质,并勾勒出可能塑造未来进展的有前景的研究方向。我们的统一框架有助于将这些开放性问题映射到TTS的具体维度,实现更有针对性和影响力的进展。
我们计划持续更新我们的分类法,以反映持续的研究进展,并为组织TTS研究的未来发展提供一个不断演进的基础。
2 扩展什么
“扩展什么”指的是在推理过程中为提升大语言模型性能而扩展或调整的特定TTS形式。在应用TTS时,研究人员通常基于经验假设选择特定的“扩展内容”,旨在实现性能提升。例如,一些研究人员假设更长的思维链(CoT)能够改善复杂推理,从而促使他们让大语言模型生成更长的输出。另一些人则利用自洽性原则,认为针对推理任务生成多个解决方案能增加得出正确答案的可能性。
2.1 并行扩展
大语言模型通常每个查询生成单个响应。并行扩展通过并行生成多个输出,然后将它们聚合为最终答案,来提升测试时的性能。形式上,考虑一个问题集P和一组模型。每个模型针对给定问题生成个候选响应,产生一组采样解s:
是正确的。
这里,A是一个聚合函数,用于从集合s中得出最终响应。并行扩展的有效性既取决于覆盖范围,即生成至少一个正确响应的可能性,也取决于聚合质量,这决定了是否能够成功识别正确响应。这一方法在理论和直觉上都得到了支持:认知科学研究(Stanovich和West,2000)表明,复杂问题往往允许多种有效的解决路径,增加生成响应的数量可以提高找到正确答案的机会(Li等人,2025d)。从经验上看,这种关系通常与计算量呈对数线性关系(Brown等人,2024b)。
我们根据覆盖范围的不同来源,将并行扩展分为两种常见形式:(1)从单个模型进行重复采样;(2)跨多个模型进行采样。此外,还有一些额外的技术来增强解决方案的多样性和可靠性,例如超参数调整(如调整采样温度(Renze,2024)以控制输出的可变性)和输入修改(如重新表述提示(Lambert等人,2025)以引出不同的响应)。
2.2 顺序扩展
顺序扩展涉及根据中间步骤明确指导后续计算。与并行方法不同,顺序扩展通过迭代更新中间状态。我们用表示部分解状态(子问题结果或初始草案),每个新状态结合了先前状态和问题上下文。由于许多问题需要深思熟虑,而不是即时的模式匹配,单遍的“系统1”(Yu等人,2024c)式生成在复杂推理任务中往往会失败。迭代方法模仿“系统2”的方法,逐步分解和完善解决方案。
早期的工作,如思维链提示(Wei等人,2022),推动了逐步解决问题的思路, = AppendStep(,新的推理步骤),从而产生了优化响应的方法(Madaan等人,2023),,或系统地分解问题的方法(Zhou等人,2023a;Zelikman等人,2022),(,下一个子问题的解决方案)。随后的研究表明,迭代优化(Chen等人,2023c;Gou等人,2024;Chen等人,2025c;Snell等人,2024)能够触发自我修正,提高在具有挑战性的任务上的准确性。在实践中,现实世界的任务通常需要更灵活、可能是非线性的推理路径,这表明纯粹的顺序方法虽然有效,但可能只是更广泛解决方案的一部分。
2.3 混合扩展
混合扩展利用了并行扩展和顺序扩展的互补优势。并行扩展通过广泛搜索,降低了模型错过正确思路的风险,而顺序扩展则允许在一条推理思路看起来有前景时进行深入探索。形式上,令为第t次迭代时的候选解集。每次迭代使用扩展函数ε并行扩展这些候选解,并使用选择函数S顺序过滤它们:
。
经过T次迭代后,聚合器A从中选择最终解决方案。从认知的角度来看,这种组合反映了人类问题解决者如何生成多个假设(发散性思维),然后优化/评估它们(收敛性思维)。经典搜索算法(如迭代加深(Chen等人,2025c)和束搜索(Snell等人,2024))通过平衡探索和利用,体现了这一策略。
最近的工作进一步拓展了这一思路。思维树(Tree-of-Thoughts,ToT)(Yao等人,2023b)在决策点进行分支,在修剪为单个序列之前探索多个推理路径。后续的方法,如图思维(Graph-of-Thoughts,Besta等人,2024)、算法思维(Algorithm-of-Thought,Sel等人,2024)、思维森林(Forest-of-Thought,Bi等人,2024)、蒙特卡洛树搜索(Monte Carlo Tree Search,MCTS)(Lin等人,2025)和多智能体推理(Wang等人,2025a),利用了类似但更复杂的混合模式。例如,多个大语言模型可以相互辩论或验证彼此的答案(Liang等人,2024;Schaul,2024),而“旅程学习”和“工具增强推理”(Li等人,2025b)则强调捕捉完整的推理轨迹。
2.4 内部扩展
内部扩展使模型能够在测试过程中,根据模型内部参数自主确定为推理分配多少计算资源,而不是依赖外部人为指导的策略。形式上,我们通过在包含多步推理任务的数据D(例如由外部扩展(Qin等人,2024)生成的长思维链示例)上进行训练过程,将初始模型更新为新模型。令人惊讶的是,在强化学习中采用以结果为导向的奖励建模(DeepSeek-AI,2025;OpenAI,2024b),能够使模型自主扩展其推理过程。
在测试时,通过以下方式生成一系列内部状态:
。
模型学习到的策略控制何时停止。这种内部反馈循环可以导致出现一些新的行为,比如更详细的推理链或自我评估步骤,而无需任何外部提示或多次调用编排。在实践中,内部扩展通常能够与标准技术相媲美,甚至超越它们,这得益于它能够将计算资源集中在单个连贯的推理轨迹上。
3. 如何扩展
3.1 基于微调的方法
为了激发模型在测试时投入计算资源的能力,直接对其参数进行微调是一种有效的策略。这包括两种方法:1)监督微调(SFT):通过在合成或提炼的长思维链上进行下一个词预测来训练大语言模型,使其能够模仿并内化结构化的推理模式,从而有效地学会思考复杂问题。通过模仿扩展的推理过程,SFT减少了推理时对显式提示的依赖。2)强化学习(RL):通过利用推理任务中奖励模型的反馈,自动更新策略模型。虽然没有引入监督数据,但模型能够自主生成长思维链推理,同时确保答案的可靠性。我们从两个角度对用于内部扩展的RL进行分类:基于奖励模型的方法和无奖励模型的方法。


3.1.1 监督微调(SFT)
通过在合成或提炼的长思维链上进行下一个词预测来训练大语言模型,能使其内化结构化的推理模式,有效地“思考”复杂问题。通过模仿扩展的推理过程,SFT减少了推理时对显式提示的依赖。这部分将包括两个子部分:(1)模仿,描述了使用测试时“规划器”算法生成思维链风格的示范,以进行微调的技术;(2)蒸馏,总结了如何使用更强模型(例如o1、R1)的输出来训练学生模型。
• 模仿:通过SFT增强大语言模型推理能力的一种突出方法是,使用测试时“规划器”算法生成长思维链示范,然后微调模型以模仿这些示范。例如,STaR(Zelikman等人,2022)使用模型自身为给定问题生成逐步解决方案,并筛选出正确结果,将经过验证的解决方案作为新的示范进行微调。更结构化的搜索已被应用于生成更高质量的轨迹:ReST-MCTS(Zhang等人,2024a)集成了一个MCTS规划器(由学习到的价值模型引导)来探索可能的推理步骤空间;随后,模型在这些搜索生成的轨迹上进行微调,即它学习模仿规划器发现的成功推理轨迹。
• 蒸馏:虽然模仿方法使用模型自身的中间输出来进行改进,但蒸馏技术旨在通过监督学习将更强模型(或模型集合)的能力转移到目标模型中。正如Muennighoff等人(2025)和Li等人(2025f)所报告的,一个在由顶级推理器生成的精选样本集上训练的320亿参数模型,能够像教师模型一样解决竞赛级别的数学问题,这表明推理能力的蒸馏是成功的。
3.1.2 强化学习(RL)
• 无奖励模型:最近,RL和偏好优化的进展显著提升了大语言模型的性能,特别是在推理和问题解决任务中。该领域的一项关键创新是DeepSeek R1(DeepSeek-AI,2025)引入的具有可验证奖励的RL,它利用基于规则的奖励机制高效可靠地优化模型。这种方法引起了研究大模型的研究人员的浓厚兴趣,因为它通过为策略优化提供密集反馈,解决了稀疏奖励和训练不稳定性等挑战。已经开发了几种方法,通过偏好优化来提高推理任务中的探索性和准确性。例如,cDPO(Lin等人,2024)、CPL(Wang等人,2024f)、Focused-DPO(Zhang等人,2025b)、DAPO(Liu等人,2024b)和RFTT(Zhang等人,2025c)优先处理关键或容易出错的区域,增强内部扩展和推理准确性。此外,Selective DPO(Gao等人,2025b)强调了通过筛选掉过于具有挑战性的示例,使数据难度与模型能力相匹配的重要性,进一步优化了训练过程。VC-PPO(Yuan等人,2025)研究了近端策略优化(PPO)在长思维链任务中的不足,并使用预训练的价值模型来获得更好的结果。Light-R1(Wen等人,2025)提出了一种课程训练框架,通过增加数据难度并结合多阶段的后期训练来优化模型。SimPO(Meng等人,2024)使用序列的平均对数概率作为隐式奖励,并在直接偏好优化(DPO)中去除了参考模型。
在数学问题解决领域,DQO(Ji等人,2024)和OREO(Wang等人,2024b)提出了新颖的价值函数优化技术,展示了模型性能的提升。DAPO(Yu等人,2025)利用动态采样技术应用于大规模RL系统。这些进展得到了一系列开源训练框架的支持,这些框架为研究人员和开发者提供了优化训练和增强推理的工具。早期的框架,如SimpleRL(Zeng等人,2025b)和DeepScaler(Luo等人,2025)迅速复制了DeepSeek R1的技术栈。此外,SimpleRL-Zoo(Zeng等人,2025a)提供了关于SimpleRL更多的实验细节。其他框架,如X-R1(X-R1Team,2025)和TinyZero(Pan等人,2025b),专注于提供直观且经济高效的用户体验。值得注意的是,Open-Reasoner-Zero(Hu等人,2025)使用320亿参数模型复制了DeepSeek R1-zero的训练方案,取得了可比的性能。OpenR(Wang等人,2024c)、OpenRLHF(Hu等人,2024)、OpenR1(HuggingFace,2025)、Logic-RL(Xie等人,2025)和AReaL(AntResearchRL-Lab,2025)等框架进一步推动了内部扩展中RL的发展。这些框架增强了内部扩展的可复制性,并通过开源共享加速了学术研究的进展。上述发展不仅解决了RL中的关键挑战,还为更高效、可靠的模型训练和部署铺平了道路。
• 基于奖励模型:以经过人类偏好优化的Bradley-Terry模型(Zheng等人,2023c)作为奖励模型,近端策略优化算法(PPO)(Schulman等人,2017)凭借其效率和稳定性成为最具影响力的算法之一,并广泛应用于内部扩展。在PPO的基础上,ReMax(Li等人,2023b)引入了方差减少技术以及REINFORCE(Sutton等人,1999)和RLOO(Ahmadian等人,2024b)方法。这消除了PPO中对额外价值模型的需求,减少了超过四个超参数,降低了GPU内存使用,并加快了训练过程。GRPO(Shao等人,2024)用改进的采样策略取代了传统的价值模型,显著加速了学习过程,并在数学领域取得了与GPT-4相当的性能。REINFORCE++(Hu,2025)进一步简化了GRPO并增强了其训练效果。DVPO(Huang等人,2025a)提出了一个简化的框架,用预训练的全局价值模型取代奖励模型,并消除了行动者和评论家之间的依赖。PRIME(Cui等人,2025)在统一的RL框架中将SFT模型集成作为策略参考模型(PRM),允许通过策略展开和结果标签的隐式过程奖励进行在线更新。SPPD(Yi等人,2025)利用具有动态价值裕度的过程偏好学习进行自训练。最近,一些研究致力于解决现有基于奖励模型方法的其他挑战。UGDA(Sun等人,2025)在PPO训练期间利用样本的不确定性和影响,迭代地优化奖励模型。VinePPO(Kazemnejad等人,2024)利用语言环境的灵活性计算无偏的基于蒙特卡洛的估计,避免了对大型价值网络的需求。LCPO(Aggarwal和Welleck,2025a)专注于优化推理任务的准确性和对用户指定长度约束的遵守情况。Rest-MCTS*(Zhang等人,2024a)使用基于树搜索的RL,绕过了训练过程奖励通常所需的逐步手动注释。这些算法的进步和改进继续推动着内部扩展中强化学习领域的发展,为解决复杂问题提供了更有效的工具和方法。
3.2 基于推理的方法
与在离线状态下调整模型参数的基于训练的方法不同,基于推理的方法在部署过程中动态调整计算资源。这种范式包含四个关键组件:(i)刺激,鼓励模型生成更长或更多的候选输出;(ii)验证,根据正确性或其他标准对输出进行筛选或评分;(iii)搜索,系统地探索样本空间;(iv)聚合,将多个输出整合为最终输出。这四个组件通常结合使用,以便更有效地分配测试时的计算资源,并提高复杂推理任务的性能。在以下部分,我们将详细讨论每个组件。

3.2.1 刺激
刺激技术是促使模型分配更多计算资源进行思考的第一步。它主要是刺激大语言模型生成(i)更长的样本,以及(ii)更多的样本,而不是通过简单的提示生成单个短样本。这包括几种关键方法:
• 提示策略:在测试时,刺激大语言模型扩展的一种方法是通过提示,而不是让模型直接生成答案。这种方式需要基础大语言模型具备遵循指令的能力。例如,提示可以引导模型进行逐步推理。像添加明确指令(例如 “请逐步思考”)这样的简单修改,就能提高模型将复杂问题分解为中间步骤的能力(Lightman等人,2023)。该策略通过在输入层面塑造推理过程,确保产生更审慎、结构化的思维。其他技术(Wei等人,2022;Ranaldi等人,2025)也依赖于在提示中明确提出要求,在测试时刺激样本生成。
• 解码策略:这种方法不是被动接受模型的默认输出行为,而是修改解码过程,鼓励大语言模型自适应地生成更长、更详细的样本。诸如注入填充令牌(Pfau等人,2024)、自适应注入预定义注入短语(Jin等人,2020)、强制缩放预算(Muennighoff等人,2025)、强制中间生成(Li等人,2025g)、强制先验分布(Kong等人,2025)或预测解码(Ma等人,2025a)等技术,能让模型逐步修改其分布。在输出层面强制进行扩展推理,能使模型思考更久,生成更全面的解决方案,且无需额外的外部指导。
• 自我重复策略:除了生成更长的样本,刺激大语言模型的另一种方式是生成多个样本,而非单个样本。一种常用策略是在解码阶段反复向大语言模型发送提示,这通常被称为自我重复(Wang等人,2023)。另一种策略是按顺序向大语言模型发送提示,以模仿优化过程(Madaan等人,2023)或在约束下的关联过程(Ferraz等人,2024)。
• 混合模型策略:集合 “群体智慧” 可以超越从单个模型重复采样,实现跨多个模型的协同采样。在这个过程中,这些大语言模型可以扮演相同角色(Wang等人,2025a),也可以扮演不同角色(Chen等人,2024f;He等人,2025)。通过利用不同的观点,这种多模型策略不仅增加了可能解决方案的覆盖范围,还提高了系统的整体稳健性。
3.2.2 验证
在测试时扩展过程中,验证大语言模型的正确性和一致性也至关重要。验证过程在测试时扩展中起着重要作用,因为可靠的验证过程可以:
• 在并行扩展范式下,直接从各种输出样本中进行选择;
• 在顺序扩展范式下,指导刺激过程并决定何时停止;
• 作为第3.2.3节中搜索过程的标准;
• 确定要聚合的样本以及如何聚合(例如权重),这将在第3.2.4节中讨论。
通常,有以下两种类型的验证:
• 结果验证:结果验证在确保生成输出的正确性和一致性方面起着关键作用。常见方法包括使用单独的验证器模型对多个候选答案进行评分(例如Cobbe等人(2021))、采用自一致性、投票机制(Wang等人,2023)和判别器大语言模型(Chen等人,2024g),以及在数学和代码生成等领域利用工具辅助(Gou等人,2024)或启发式检查(DeepSeek-AI,2025)。对于特定的任务问题,如行程规划,也会采用功能评分(Lee等人,2025)来验证所提出的计划。Zhang等人(2025d)没有将结果验证表述为分类问题,而是利用大语言模型的生成能力,提议将结果验证过程重新表述为下一个令牌预测任务。Li等人(2025h)将反馈利用表述为一个优化问题,并在样本之间自适应传播信息。
除了单一标准,某些结果验证方法还从多个角度验证模拟样本的质量。Liu等人(2023b)进行了(i)来自外部工具的被动验证和(ii)通过重新思考机制的主动验证,以证明每个样本的合理性。Zhang等人(2024c)遵循类似的思路,提议从断言、过程和结果三个方面验证每个样本。Lifshitz等人(2025)进一步将验证智能体的数量扩展到任意数量,并将语义标准与验证智能体解耦。Parmar等人(2025)和Saad-Falcon等人(2024)也分别提出了考虑多种因素对每个样本进行评分的验证智能体。Saad-Falcon等人(2024)还提出了一种基于单元测试的验证方法。我们在附录A中提供详细的技术分类。
• 过程验证:过程验证方法用于验证样本结果以及获得该结果的过程。它们通常用于具有形式化演绎过程的任务,如推理、编码或数学。它们也被称为过程奖励模型(PRM)或状态验证。Lightman等人(2023)在数学任务上训练PRM作为步骤级验证。Yao等人(2023b)使用基于大语言模型的状态验证器作为在树结构下搜索样本的指导。Zhang等人(2024b)进一步将这些偏好数据调整到大语言模型中,并在测试时启用思维链结构。Xie等人(2023)没有训练外部验证器,而是提示同一个大语言模型根据之前的所有步骤评估当前步骤。Hosseini等人(2024)提议使用准确和不准确的生成数据来训练验证器。尽管基于大语言模型的过程验证器易于集成,但对于具有长过程的复杂问题,它们可能会产生不可靠的验证结果。Ling等人(2023)以演绎方式分解验证过程。因此,验证器只需要验证长思维链中的几个陈述。Yu等人(2024a)基于类似的直觉,但专注于代码辅助的数学推理任务,并通过批评模型进行迭代。Li等人(2025b)则依赖外部工具包,如代码解释器,来验证过程。
3.2.3 搜索
搜索也是测试时扩展中常用的一个组件。在大量在线数据上进行预训练的大语言模型,可以被视为对现实世界知识的一种压缩。然而,标准推理往往没有充分利用它们的能力。搜索作为一种经典且有效的技术,用于从庞大的数据库中检索相关信息,可以通过结构化地探索大语言模型的潜在选项,充分挖掘其能力。现有的基于搜索技术的测试时扩展方法在复杂任务(如复杂数学等)上表现出显著的性能提升。

Yao等人(2023b)通过将输出样本分解为多个思维并组织成树结构,探索了搜索的潜力。仅基于朴素的树搜索算法(如深度优先搜索和广度优先搜索),它就在推理任务中展示出了卓越的性能。蒙特卡洛树搜索(Coulom,2006)作为一种经典而强大的搜索算法,也为更好地挖掘大语言模型的隐藏知识发挥了作用。Chaffin等人(2022)在解码阶段采用蒙特卡洛树搜索,由判别器引导进行受限文本生成。Zhang等人(2023b)进一步扩展了蒙特卡洛树搜索,通过前瞻性地增强代码生成中的规划能力。Tian等人(2024)将蒙特卡洛树搜索作为大语言模型自我改进框架的关键组件。Wan等人(2024)定制搜索算法,以解决需要长程规划和深树结构搜索的问题。Chen等人(2024g)进一步指出,判别器是搜索增强规划中的关键瓶颈。Gandhi等人(2024)将搜索过程系统化,用统一的语言表述,并提议使用来自搜索过程的数据和反馈训练大语言模型。Wu等人(2024c)通过实证分析各种搜索算法,并设计了一种奖励平衡的搜索算法,以实现帕累托最优的测试时扩展。Edward Beeching(2024)通过考虑多样性,进一步扩展了束搜索。
除了在树结构内进行搜索,Besta等人(2024)将输出建模为图搜索问题。Xie等人(2023)提出了一种基于自我评估的随机束搜索解决方案,用于推理任务。Pan等人(2025a)通过提出的联想记忆增强蒙特卡洛树搜索,以动态更新其知识库。Li等人(2025c)提议将推理过程视为构建控制流图,每个节点表示一个逻辑单元。
3.2.4 聚合
聚合技术将多个解决方案整合为最终决策,以提高模型在测试时预测的可靠性和稳健性。根据最终输出的生成方式,我们从经验上将它们分为两类:(i)选择,从所有候选样本中选择性能最佳的样本,不同方法的选择标准可能不同;(ii)融合,通过加权或生成等技巧将多个样本融合为一个。
• 选择:在这一类别中,聚合过程可视为一个选择问题。一个著名的例子是选择最一致的答案,通常称为自一致性。Wang等人(2023)通过利用统计冗余提高了准确性——如果不同的推理路径收敛到相同的结论,那么这个答案更有可能是正确的。自一致性有效地降低了模型输出的方差,并减轻了偶尔出现的幻觉问题。然而,由于最终输出是基于一致性投票产生的,不准确和低质量的样本不可避免地会影响输出质量。因此,人们提出了各种方法在投票前筛选候选样本。Chen等人(2024d)引入一个大语言模型作为过滤器,而Wu等人(2025b)提出了长度过滤投票,采用预测不确定性作为代理来筛选可靠的思维链长度。
Best-of-N(Irvine等人,2023)遵循相同的过程,但用外部验证器生成的标量分数取代了自一致性标准。Song等人(2024)进一步证明,在小型大语言模型上使用Best-of-N可以产生与最先进的专有模型相媲美的性能。Munkhbat等人(2025)在Best-of-N选择之前进行了一些条件过滤,旨在减轻其样本效率低下的问题,并实现了显著的长度缩减。受粒子滤波的启发,Puri等人(2025)提议对样本进行过滤。Sessa等人(2024)在降低样本效率低下问题上更进一步,通过强化学习人类反馈(RLHF)将Best-of-N的结果调整到大语言模型中。随着智能体方法的兴起,Parmar等人(2025)提出了一种考虑复杂因素(包括历史和当前状态)的选择智能体。除了从单个大语言模型中选择样本,Ong等人(2025)将选择由弱大语言模型和强大语言模型生成的样本视为一个路由问题,并对计算成本提出了约束。
• 融合:直接从候选样本中选择最终输出样本可能会产生不理想的结果,特别是当候选样本质量较低时。融合方法提议将多个样本合并为一个,以解决这个问题。Brown等人(2024b)和Li等人(2023a)扩展了Best-of-N的思路,根据外部验证器的分数对每个样本进行加权。另一方面,Jiang等人(2023)直接提示另一个大语言模型作为汇总器,来合并多个选定的样本。Li等人(2025k)有类似的直觉,用生成式自聚合取代了自一致性(Wang等人,2024e)中的多数投票。Li等人(2025c)在考虑了前面步骤的中间因素后,也采用大语言模型作为合成器。
4 在何处扩展
测试时扩展(TTS)可以在各种现实世界场景中显著提升大语言模型的性能。我们系统地将这些场景分类为具有代表性的领域,详细阐述了每个领域的特征挑战、关键评估标准,以及展示TTS实际价值的代表性基准测试。在此,我们还在表4中简要总结了各种基准测试。
4.1 推理密集型任务
推理密集型任务需要结构化、明确的多步推理,追求精确性和严格的正确性验证。这些任务对大语言模型系统地分解问题、迭代优化解决方案以及验证中间推理步骤的能力提出了挑战。
• 数学推理:数学任务涉及复杂的计算、逻辑推理和迭代验证。对于TTS方法而言,关键挑战包括生成准确的逐步解决方案、有效验证中间步骤,以及处理复杂的推理逻辑。代表性的基准测试包括AIME 2024(Google,2025)、MATH - 500(Zhang等人,2024a)、AMC 2023(Guan等人,2025b)和OlympiadBench(He等人,2024a)。这些数据集涵盖了高级竞赛级别的数学问题,强调精确和明确的推理技能。
• 编程与代码生成:编码任务要求语法准确、可执行正确,并进行迭代调试。TTS方法在这方面的挑战在于生成正确的实现代码、迭代调试代码,以及高效探索多种编码解决方案。代表性的数据集包括Codeforces(codeforce,2025)、SWE - bench(Jimenez等人,2024)和LiveCodeBench(Jain等人,2025),每个数据集都提供了专家级的编码挑战,需要严谨的逻辑思维和实现准确性。
• 博弈与战略推理:战略推理任务涉及自适应规划、交互式决策和复杂的多轮推理。TTS方法必须高效地进行迭代搜索、自适应推理和动态交互。一个代表性的基准测试是SysBench(Google,2025),它评估模型在交互式任务中的战略推理能力。
• 科学推理:科学问题通常需要整合物理学、化学、生物学等多个学科的知识。TTS方法必须展示出广泛的知识综合能力、多步推理能力,以及准确的事实验证能力。著名的基准测试包括GPQA Diamond(Rein等人,2024)和MR - Ben(Zeng等人,2024),专注于高级科学推理和综合领域知识。
4.2 通用任务
这些任务需要广泛的通用推理能力、创造力,以及对输出的主观评估。
• 医学推理:医学任务涉及诊断决策、临床推理和精确的医学知识。TTS在此面临的关键挑战是确保可靠、准确的推理,模拟医学专业人员的决策逻辑。代表性的数据集包括JAMA Clinical Challenge(Chen等人,2025a)、Medbullets(Chen等人,2025a)和MedQA(Jin等人,2020)。这些基准测试严格评估推理大语言模型在诊断、治疗规划和医学决策准确性方面的能力。
• 基础任务:为了实现通用目标,许多研究收集了大量具有挑战性的官方公共数据集,这些数据集对人类来说具有难度,但并不特定于任何特定领域。代表性的基准测试包括AGIEval(Zhong等人,2024)、MMLU - Pro(Wang等人,2024d)和Gaokao(Guan等人,2025b)。
• 开放式任务:TTS方法必须提高输出的多样性、质量和连贯性,平衡创造力和正确性。代表性的基准测试包括AlpacaEval2.0(Dubois等人,2024)、ArenaHard(Li等人,2024b)、IF - Eval(Zhou等人,2023b)和C - Eval(Huang等人,2023),它们共同评估主观、开放式和通用的推理能力。
• 智能体任务:智能体任务涉及现实的交互环境,需要复杂的规划、迭代推理和有效的工具使用。TTS方法面临的挑战包括优化逐步规划、自适应决策、工具集成和迭代优化。代表性的基准测试包括WebShop(Yao等人,2023a)、WebArena(Zhou等人,2023c)、SciWorld(Wang等人,2022)和TextCraft(Prasad等人,2024)。这些数据集提供了现实的交互场景,强调迭代决策和有效工具使用。
• 知识密集型任务:知识密集型任务要求大语言模型从外部来源检索和合成事实性知识,确保准确性并减少幻觉。TTS面临的挑战主要集中在有效的检索增强推理、迭代验证和多源聚合。代表性的基准测试包括SimpleQA(Wei等人,2024a)、C - SimpleQA(He等人,2024c)和FRAMES(Krishna等人,2025),强调事实正确性和基于检索的推理。
• 多模态任务:多模态推理任务需要有效的跨模态集成、模态间的迭代推理,以及对视觉和文本输入的可靠验证。TTS方法在模态融合、迭代多模态推理和处理模态间的歧义方面面临挑战。代表性的基准测试包括MMMU(Yue等人,2024)、MathVista(Lu等人,2024)、MathVision(Wang等人,2024d)、CMMaTH(Li等人,2025j)和PGPS9K(Zhang等人,2023a),每个测试都涉及视觉和文本模态的多模态推理。
5. 扩展效果如何
在本节中,我们将用于评估测试时扩展方法的指标分为四个高级维度:性能、可控性、可扩展性和效率。

5.1 性能
性能指标用于评估生成解决方案的正确性。
• 首次通过率(Pass@1):首次通过率是评估模型首次输出尝试正确性的最常用指标之一(DeepSeek-AI, 2025; Li等人, 2025e; Snell等人, 2024; Xie等人, 2025; Kimi, 2025; Yang等人, 2025b,a; Hou等人, 2025)。它衡量模型首次生成的解决方案正确的问题比例。正确的解决方案是指与标准答案完全匹配或通过所有必要验证检查的答案,例如在数学基准测试中的精确答案匹配和编码任务中的私有单元测试。首次通过率常用于数学推理和编码基准测试等任务中。在诸如AIME 2024(Google, 2025)和MATH-500(Zhang等人, 2024a)等数学推理任务中,首次通过率衡量模型答案与标准答案的精确匹配百分比。在诸如LiveCodeBench(Jain等人, 2025)和HumanEval-Mul等编码基准测试中,首次通过率根据隐藏测试用例评估代码的正确性。
• k次尝试通过率(Pass@k)(覆盖率):k次尝试通过率通过衡量模型的k个采样输出中是否至少有一个正确,扩展了首次通过率的概念(Brown等人, 2024a; Snell等人, 2024; Li等人, 2025e)。正式地,k次尝试通过率可以使用Chen等人(2021)提出的无偏估计器进行估计:
其中n是问题的数量,N是每个问题的总样本数,是第i个问题的正确样本数。k次尝试通过率广泛应用于程序合成和形式定理证明任务中,例如CodeContests(Li等人, 2022)和SWE-bench Lite(Jimenez等人, 2024)。• k次共识率(Cons@k):k次共识率衡量从k个独立采样输出中多数投票的正确性(DeepSeek-AI, 2025; Zeng等人, 2025c)。给定模型针对特定问题生成的k个响应,多数投票预测是出现频率最高的答案。然后将该答案与标准答案进行比较。k次共识率通常与首次通过率一起使用,以评估利用多个样本的好处。较大的k值(例如16、64)通常可以提高答案的稳定性和准确性,但会增加计算成本。该指标在单个生成可能存在噪声或不确定性的任务中特别有价值,并且集成策略可以提高鲁棒性。k次共识率已广泛应用于数学推理基准测试中,例如AIME 2024(Google, 2025)和MATH-500(Zhang等人, 2024a)。
• 竞技场评估(成对胜率):除了基于准确性的指标外,一些研究采用成对比较指标,使用人工或基于大语言模型的评判者将模型输出与基线进行比较(DeepSeek-AI, 2025; Hou等人, 2025)。例如,LC-Winrate(Dubois等人, 2024)调整胜率以控制响应长度,而ArenaHard GPT-4 Judge(Li等人, 2024b)使用GPT-4-Turbo对开放式任务的输出进行评分。这些成对评估方法在定性评估(例如流畅性、连贯性)很重要的生成任务中尤为常见。
• 任务特定指标:某些领域采用专门的指标。例如,在竞争性编程环境中,Codeforces百分位数和Elo评级用于衡量编码能力(DeepSeek-AI, 2025; Kimi, 2025)。百分位数表示模型相对于其他参与者的表现,而Elo评级反映了基于锦标赛评估的相对技能。
5.2 效率
效率指标评估计算和资源成本,为测试时扩展方法的实际部署提供见解。
• 令牌成本:令牌成本衡量推理过程中生成的令牌总数,包括中间推理步骤和最终输出(Welleck等人, 2024; Brown等人, 2024a; Hou等人, 2025; Yang等人, 2025b; Xu等人, 2025c; Wang等人, 2025c; Aytes等人, 2025)。这个指标特别重要,因为冗长的推理通常会导致更高的令牌消耗。在保持性能的同时降低令牌成本对于推理效率至关重要,特别是在固定计算预算或API定价限制下运行时。此外,推理效率指标(如延迟和吞吐量)在实际应用中至关重要,尤其是对于高吞吐量系统(Welleck等人, 2024)。
• 基于FLOPs的效率分析:基于FLOPs(每秒浮点运算次数)的计算分析已被广泛用于量化计算成本(Kaplan等人, 2020; Snell等人, 2024; Wu等人, 2024b; Teng等人, 2025)。最近的一些工作(Snell等人, 2024; Wu等人, 2024b)通过绘制准确率与总推理FLOPs的关系图,对测试时扩展策略(如自适应修订和基于验证器的搜索)与模型扩展进行基准测试。这种基于FLOPs的评估可用于确定在等效计算预算下,推理时方法是否优于更大的模型。
• 思考不足得分:思考不足得分(Wang等人, 2025e)量化了模型在最初生成正确思路但未能得出正确最终答案时的低效性。它衡量在最终答案错误的情况下,第一个正确思路在响应中出现的时间相对于响应总长度的早晚。
正式地,思考不足得分定义为:
其中,N是测试集中错误响应的数量;是第i个错误响应中的令牌总数;是从响应开始到包括第一个正确思路的令牌数量。如果响应中不存在正确思路,则,表示模型未能有意义地处理问题,该实例的得分即为零(即不存在思考不足)。较高的值表示效率较低,有用的见解出现得早但未被深入探究,反映出强烈的思考不足行为。• KV缓存大小:KV缓存大小(Hooper等人, 2025)是指在推理时搜索过程中,存储所有轨迹和时间步的键值(Key-Value,KV)缓存所需的总内存占用。由于每个独特的生成路径都需要自己的KV缓存,跨轨迹共享KV缓存较少的方法往往会消耗更多内存并导致更高的延迟。通过促进轨迹之间的KV缓存共享,高效树搜索(ETS)减少了总KV缓存大小,从而提高了吞吐量。例如,与REBASE相比,ETS实现了高达1.8倍的KV缓存减少,在NVIDIA H100 GPU上推理速度提高了1.4倍,且不影响准确性。
5.3 可控性
可控性指标评估推理时方法是否能够始终如一地遵守预定义的资源约束,如计算预算或输出长度目标。
• 控制指标:Muennighoff等人(2025)提出“控制”作为一个正式指标,用于量化对指定计算预算范围的遵守程度。它衡量测试时计算值落在给定上下限内的比例:
其中A是观察到的计算值集合(如思考令牌数),是指示函数。得分为100%表示在所有任务中完全遵守计算预算。此外,Hou等人(2025)和Yang等人(2025b)报告了在固定令牌预算(例如1024、2048、4096)下评估模型的实验,以检查模型在推理过程中满足预定义长度或令牌约束的程度。此外,Xie等人(2025)和Teng等人(2025)对最大输出长度施加明确约束,以确保推理时的稳定性并防止输出截断。• 长度偏差指标:引入了与目标长度的平均偏差和长度偏差的均方根误差(RMSE)来量化模型控制输出长度的能力(Aggarwal和Welleck, 2025a):
• 与目标长度的平均偏差:量化生成的输出长度与目标长度之间的平均相对差异:
其中是模型的输出长度,是目标长度。• 长度偏差的均方根误差(RMSE):反映长度控制的方差:
。
这两个指标的值越低,表明在不同样本中长度控制越稳定、越精确。• k-ε可控性:Bhargava等人(2024)提出k-ε可控性作为一个正式指标,用于描述基于提示的语言模型的可引导性。与关注计算或长度约束的指标不同,该指标量化模型是否能够在有限的提示长度和可允许的偏差范围内被引导产生目标输出。正式地,如果存在一个提示p,使得,并且模型以至少的概率输出目标输出y,则称模型对于目标输出y是(k, \epsilon)-可控的:
。
通过评估不同的k和ϵ值,可以描绘出模型的可控性情况。在实践中,Bhargava等人(2024)在诸如WikiText中的下一个令牌预测等任务上测量了这一属性,发现超过97%的目标可以通过最多10个令牌的提示和的误差容忍度来实现。这个指标为量化通过提示设计控制模型输出的难易程度提供了一个理论视角。虽然与资源约束没有直接关联,但k-ε可控性为了解模型在测试时的响应性提供了有价值的见解,并已用于比较不同模型系列和规模的固有可引导性。
5.4 可扩展性
可扩展性指标衡量测试时扩展方法能够多么有效地利用增加的计算资源(例如令牌预算、样本、推理步骤)来提高性能。
• 扩展指标:Muennighoff等人(2025)提出了扩展指标,用于捕捉随着计算量增加性能提升的平均斜率:
这个指标量化了模型在增加计算量时提高准确率或通过率的有效程度。• 扩展曲线(准确率与计算量):扩展曲线用于可视化诸如准确率、通过率或EM等指标如何随着令牌预算、迭代深度或样本数量的增加而变化(Aggarwal和Welleck, 2025a; Teng等人, 2025; Wu等人, 2024b)。这些图有助于揭示在更高计算预算下的收益递减和性能饱和情况。
6 测试时扩展的研究梳理与发展趋势
基于我们的分类法,我们从多个维度对现有文献进行拆解(表5)。如图4所示,这些具有不同技术创新的研究工作遵循着大致一致的发展路径。从2022年到2023年,研究人员强调结构化推理,以引导大语言模型生成更复杂的解决方案。2024年,过程奖励模型(PRM)和蒙特卡洛树搜索(MCTS)等方法实现了对复杂推理轨迹的自动监督,生成了丰富的注释数据用于微调,进而提升了测试时扩展的性能。随后的方法,如o1和R1,证明了纯强化学习也能激发出全面、逻辑合理的推理。

至关重要的是,这些技术是互补而非相互排斥的:例如,R1需要通过拒绝采样进行基于监督微调(SFT)的预热。因此,要实现更强大的扩展,需要系统地整合这些方法。即使在强化学习框架内,从业者也应继续利用合成的思维链方法,并结合结构化推理策略,以有效应对日益复杂的场景。

研究人员发现,不存在一种适用于所有问题的简单扩展解决方案。越来越多的研究人员倾向于关注最优扩展解决方案(Wu等人,2024c;Snell等人,2024)。
基于推理的方法和基于微调的方法之间的界限正在变得模糊。因此,扩展的目标(即扩展什么)在不同阶段会发生变化。某些论文,如Li等人(2025g);Munkhbat等人(2025),通过将基于推理的方法合成的高质量数据作为微调数据,将基于推理的能力融入到大语言模型中。而其他论文,如Wan等人(2024),则提出了各种技术,以便在训练和推理阶段更好地利用大语言模型的能力。
7 测试时扩展的实用指南
在本节中,我们从理论分类转向为测试时扩展(TTS)提供实用指南。我们的目标是提供清晰、可行的操作说明和技术路径,以促进有效的TTS部署。

• 常见问题解答
• 问题:TTS对哪些任务有帮助?
• 答案:几乎对任何任务都有帮助!虽然传统的推理任务,如奥林匹克级别的数学、复杂编码和基于游戏的挑战,已被证明可以通过TTS显著提升性能,但社区观察表明,TTS也可以提高开放式任务的性能,如评论生成或评估。然而,由于输出的长格式性质以及缺乏集中的客观基准测试,这些任务在本质上更难以进行定量评估,因此更难得出确凿的结论。除此之外,更现实、复杂和长周期的场景,如医学推理和法律领域,也通过TTS策略显示出了有前景的性能提升。
• 问题:如果我想快速实现一个TTS流程,应该考虑哪些基本路径?初学者如何以最小成本使用TTS?
• 答案:一般来说,测试时扩展有三条基本技术路径:i)推理时进行审慎的推理过程;ii)模仿复杂的推理轨迹;iii)基于强化学习的激励机制。如果你的目标是以最小成本快速了解强大的TTS能为你的任务带来的潜在上限,你可以直接使用通过(iii)训练的模型。如果你想以最小成本开发一个TTS基线,你可以从(i)开始。一旦(i)产生了符合预期的结果,你可以应用(ii)来进一步验证和推广结果。
• 问题:这些流程是相互排斥的吗?我应该如何设计前沿水平的TTS策略?
• 答案:这些流程绝非相互排斥,它们可以无缝集成。例如,R1本质上需要通过拒绝采样进行监督微调(SFT)作为初步的预热步骤。在使用强化学习时,从业者应继续利用合成的思维链方法,并引入额外的结构化推理策略,以有效应对日益复杂的场景。
• 问题:有哪些具有代表性或广泛使用的TTS方法可以作为基线?
• 答案:并行 - 自一致性、Best-of-N;顺序 - STaR、Self-Refine、PRM;混合 - MCTS、ToT;内部 - Distilled-R1、R1。
• 问题:到目前为止,有没有最优的通用解决方案?
• 答案:没有万能的方法。最优的计算方式通常取决于问题的难度和开放性。
• 问题:我们应该如何评估TTS方法的性能?除了标准的准确率,还应该关注哪些方面?
• 答案:评估在很大程度上取决于具体任务,但准确率等指标仍然是最关键的指标。此外,效率(性能与成本之间的权衡)是实际应用中的另一个关键关注点。随着TTS成为一种更通用的策略,研究人员也开始评估一系列次要属性,包括鲁棒性、安全性、偏差和可解释性,以更好地理解TTS的广泛影响。
• 问题:将其他扩展格式调整为内部扩展,与直接使用原始扩展格式相比,有什么区别?
• 答案:是的,一个直观的区别在于效率方面。内部扩展往往效率更高,因为它只向大语言模型提示一次,而其他扩展技术通常需要多次尝试。然而,内部扩展在微调时需要不可忽视的资源,这使得从业者使用起来更有局限性。
8 挑战与机遇
8.1 进一步扩展是前沿方向
在推动人工智能向更通用的智能发展,尤其是在处理复杂任务方面,测试时扩展已成为后预训练时代最有前景的方法之一。从OpenAI的o1和DeepSeek-R1等模型在推理密集型任务上的变革性影响可以看出,充分发挥测试时扩展的潜力仍然是推进通用人工智能的核心支柱之一。然而,为了进一步拓展前沿,我们需要新的、更有效的策略。以下是一些有前景的研究方向:
• 并行扩展:并行扩展通过生成多个响应并选择最佳答案来提高解决方案的可靠性。尽管它很有效,但当覆盖范围达到饱和时,并行扩展的收益会逐渐递减。一个关键挑战是如何增强覆盖范围,从单纯的暴力扩展转变为更具指导性、更高效的过程。未来可能的进展包括:
• 智能覆盖扩展:模型可以智能地生成多样化的推理路径,确保每个采样响应都探索一种有意义的不同方法,而不是采用朴素的Best-of-N采样。
• 验证器增强的并行扩展:集成实时验证机制可以动态过滤并行样本。
• 顺序扩展:顺序扩展面临着独特的挑战,特别是在保持连贯性和防止错误累积方面。一个关键问题是优化逐步推理,以避免收益递减或强化错误步骤。未来的进展不应局限于朴素的迭代优化,而应侧重于更自适应和结构化的方法,以确保每个推理步骤都能切实改进最终结果。可能的方向包括:
• 结构化自我优化:模型不应盲目地优化整个响应,而应学会针对推理中需要调整的特定部分进行优化。
• 验证增强的迭代扩展:在顺序推理过程中引入实时验证步骤,可以防止模型传播早期错误。这可能涉及在迭代之间运行自我验证检查(例如,检查与已知事实的一致性、将中间结果与先前上下文进行比较,或重新计算特定逻辑步骤)。通过在继续之前进行选择性验证,模型可以确保高质量的逐步改进,而不是不断累积错误。
通过解决这些挑战,顺序扩展可以超越简单的迭代优化,成为一种高度自适应、自我纠正的推理范式,使模型能够进行目标导向的长程思考。
• 混合扩展:混合扩展融合了并行和顺序方法,使其在实际应用中更具适应性和实用性。当前的测试时扩展方法通常高度专业化,限制了它们的通用性。为了解决这些限制,可以从以下几个方面改进混合扩展:
• 通用混合扩展架构:研究应致力于将测试时扩展机制统一到一个单一框架中,该框架可以根据不同的查询类型动态选择最佳策略。
• 多智能体与交互式扩展:将混合扩展从单智能体推理过程扩展到多个模型实例,可以使它们参与结构化的辩论、论证或协商,从而提高解决方案的可靠性。虽然当前的混合扩展大多在受控的基准测试中进行研究,但未来的工作必须考虑其在实际应用中的作用。
• 内部扩展:内部扩展允许在无需外部干预的情况下动态调整计算。虽然这种范式已经取得了有前景的结果,但它也带来了独特的挑战。
• 有效计算分配:确保内部扩展仅在必要时分配额外的推理步骤至关重要。如果模型在简单任务上过度思考,或者在复杂任务上未能扩展推理,那么动态计算的优势就会丧失。
• 稳定性和一致性:当模型扩展自己的推理路径时,它们面临着逻辑漂移、幻觉或过度复杂化的风险。与可以纳入外部验证的顺序扩展不同,内部扩展必须在没有外部指导的情况下保持自我一致性。
• 可解释性和可控性:内部扩展是隐式发生的,这使得诊断故障或调节推理成本变得困难。与并行扩展(提供多个显式输出)或顺序扩展(遵循结构化迭代)不同,内部扩展缺乏明确的中间检查点,这给调试和效率管理带来了挑战。
通过解决这些挑战,内部扩展有潜力实现效率最大化、增强模型适应性,并推动人工智能系统朝着更自主、自我调节的推理方向发展。
8.2 明确扩展技术的本质是基础
虽然“扩展什么”在不断发展,并且内部技术(如从近端策略优化(PPO)过渡到广义近端策略优化(GRPO))也在进一步发展,但我们观察到扩展技术的核心类别相对稳定。例如,监督微调(SFT)和强化学习(RL)仍然是两种最常见的方法,尽管它们的作用和相互作用随着时间发生了变化。这就迫切需要我们更深入地理解这些基本技术如何为测试时扩展做出贡献。
在这里,我们提出了一些可能的进一步研究方向:
• 扩展技术的理论差距:核心技术(监督微调、强化学习、奖励建模)如何为测试时扩展做出贡献?监督微调和强化学习应如何优化组合?
• 重新评估奖励建模:过程奖励模型(PRMs)真的能改善多步推理吗?经典奖励模型是否包含噪声和不必要的复杂性?
• 测试时扩展的数学性质:性能如何随着推理步骤的增加而提升?是否存在最优停止标准?测试时扩展对推理性能的提升是否存在根本限制?
• 思维链推理的优先级:思维链的哪些方面对有效的测试时扩展最为关键?
• 自适应测试时扩展:我们如何使模型根据手头的问题自动调整推理过程?正如某些属性模型(xAI,2025)的实证观察所示,盲目地在测试时进行扩展可能会导致过度思考。
8.3 优化扩展是关键
随着新的TTS方法不断涌现,系统的评估和优化变得至关重要。我们必须全面衡量不同策略在任务准确性方面的表现,并考虑效率、鲁棒性、偏差、安全性、可解释性等更多因素。对TTS这些方面的优化正在逐渐兴起(Zhang等人,2025a;Huang等人,2025b),并将成为未来发展的重要组成部分。
8.4 跨领域泛化是主流趋势
我们预计会有一波研究将测试时扩展应用到更广泛的领域,如医学和金融领域,在这些领域中,复杂的决策和结构化推理至关重要。这种扩展既不可避免又充满前景,因为测试时扩展提供了一种强大的机制,可以在不需要昂贵的重新训练的情况下,增强推理深度、动态调整计算资源并提高准确性。除了这些领域,我们还可以期待在法律、人工智能评估、开放域问答和其他高风险或知识密集型领域中广泛应用。尽管具有潜力,但在跨领域扩展测试时推理面临几个关键挑战:
• 平衡成本和准确性:与一般的自然语言处理任务不同,专业领域通常需要严格的计算效率和可靠性;
• 确保特定领域的可解释性:在医学和法律等领域,输出必须是透明且可解释的;
• 整合外部知识和现实世界约束:许多领域需要检索增强生成、实时数据分析或交互式查询优化;
• 未来的研究必须确定在各种推理任务中稳健的通用测试时扩展策略。
通过应对这些挑战,测试时扩展可以成为人工智能的一项基础能力,使模型能够动态扩展自己的推理能力,适应现实世界的约束,并在专业领域中实现泛化。这种转变代表了一种范式变革,即人工智能系统不再仅仅是记忆知识,而是在推理时主动扩展其智能,以满足多样化、不断发展的任务需求。
9 结论
这是第一项通过分层分类法对测试时扩展(TTS)进行拆解的综述,提供了一个结构化的视角,有助于从概念上理解TTS,并识别各个研究的贡献。我们强调实际应用,根据每个分类维度引入了实用指南,并且计划随着时间的推移对其进行扩展。基于这个框架,我们概述了塑造TTS研究未来的关键趋势、挑战和机遇。

作者:张长旺,图源:旺知识
参考资料
• 标题:What, How, Where, and How Well? A Survey of Test-Time Scaling for Large Language Models
• 作者:Qiyuan Zhang, Fuyuan Lyu, Zexu Sun, Lei Wang, Weixu Zhang, Zhihan Guo, Yufei Wang, Irwin King, Xue Liu, Chen Ma
• 单位:1. 香港城市大学;2. 麦吉尔大学 & MILA;3. 中国人民大学高瓴人工智能学院;4. 香港中文大学;5. Salesforce人工智能研究院;6. 麦考瑞大学
• 链接:https://arxiv.org/pdf/2503.24235