旺精通~一文读懂:小语言模型如何挑战推理能力 “天花板”
旺精通:技术细节全解,深度精通技术
以前大家觉得只有大语言模型参数多到一定程度才有推理能力,不过现在发现小语言模型也可能有不错的推理能力。小语言模型因为效率高、能本地部署,越来越受欢迎,但它的推理能力到底咋样却没被好好研究过。这篇文章就系统地测试和分析了很多小语言模型的推理能力,能帮助研究人员更好地了解小语言模型,知道怎么改进它们,以后在实际应用中也能更好地使用小语言模型。
我们详细翻译解读最新论文,文末有相关信息。

作者:张长旺,图源:旺知识
文章针对小语言模型推理能力展开研究。长期以来,推理被认为是大语言模型的涌现属性,但近期研究对此提出挑战,小语言模型因高效和可部署性受关注,其推理能力却缺乏系统研究。研究人员系统调研、基准测试和分析6个模型家族的72个小语言模型在14个推理基准测试中的表现,对比多种评估方法,分析不同提示策略影响,并测试模型在对抗条件下的稳健性和中间推理步骤。结果表明,部分小语言模型可与大语言模型推理性能相媲美,训练数据和方法比参数规模更关键,量化是较优的压缩策略,剪枝则会严重降低性能。该研究为小语言模型的开发和部署提供了指导。
摘要&解读
长期以来,推理一直被视为大语言模型(LLMs)的一种涌现属性,在模型达到一定规模(约1000亿参数)及以上时才会出现。然而,最近的研究对这一假设提出了挑战,表明小语言模型(SLMs)也能取得具有竞争力的推理性能。小语言模型因其高效性和可部署性而越来越受到青睐。但是,目前缺乏对各种小语言模型推理能力的系统研究,这些小语言模型包括从头开始训练的模型,以及通过量化、剪枝和知识蒸馏从大语言模型衍生而来的模型。这就引出了一个关键问题:小语言模型能否实现与大语言模型相媲美的推理能力?在这项工作中,我们系统地调研、基准测试和分析了来自六个模型家族的72个小语言模型,涵盖14个推理基准测试。为了进行可靠的评估,我们研究了四种评估方法,并将四个大语言模型评判结果与800个数据点的人工评估进行比较。我们重复所有实验三次,以确保对性能进行稳健的评估。此外,我们还分析了不同提示策略在小模型中的影响。除了准确率,我们还评估了模型在对抗条件下的稳健性以及中间推理步骤。我们的研究结果对 “扩展规模是实现强大推理能力的唯一途径” 这一假设提出了挑战。相反,我们预见未来可以通过结构化训练或训练后压缩来开发具有强大推理能力的小语言模型。它们可以作为大语言模型在推理密集型任务中的高效替代品。
研究背景:
以往观点认为推理是大语言模型在一定参数规模以上才有的涌现属性,但近期研究发现小语言模型也可能具备推理能力。小语言模型因低推理成本、低延迟和可本地部署等优势受到关注,然而其推理能力缺乏系统研究,不同小语言模型策略对推理能力的影响也未被量化。同时,评估语言模型推理能力的方法众多,却未得到系统比较,难以确定哪种方法能准确反映模型真实推理能力。
研究贡献:
建立可靠评估指标:对比多种评估方法,发现GPT-4-Turbo和GPT4o与人工评判一致性最高,以此为主要评估指标,为小语言模型推理能力评估提供可靠依据。
全面评估模型:系统评估6个家族72个小语言模型在14个基准测试中的表现,涵盖多种推理任务、提示策略及对抗条件下的稳健性,分析不同因素对推理能力的影响。
探索压缩策略:研究量化、剪枝和蒸馏等压缩技术对小语言模型推理能力的影响,发现量化对较大模型推理性能影响小,可在保持推理能力的同时提高效率,为模型部署提供参考。
实现设计:
评估过程:采用将大语言模型用作评判者的方法,以GPT-4为主要评估者,针对排序任务设计基于正则表达式的解析方法,针对特定任务使用相应评估脚本和评判者。
推理任务:设计数学推理、科学推理、常识推理、数字排序和稳健性测试等任务,涵盖多种数据集和提示策略,全面评估模型推理能力。
模型实验:使用NVIDIA多种GPU,借助vLLM库和Hugging Face Accelerate进行模型推理,采用开源模型和框架,调整合适超参数进行实验。
实验结果:
整体性能:模型性能提升因模型家族而异,训练数据和方法比参数规模更重要。在不同推理任务中,较大模型在某些任务上表现更好,但在复杂推理任务中,小模型也有表现出色的情况。
提示影响:提示复杂性对近期模型性能影响小,直接输入/输出提示在GSM8K任务上表现较好,复杂提示可能使模型困惑。
排序任务:小语言模型在短列表排序表现好,长列表和混合数排序时性能下降,反映出处理长序列和复杂数据的局限性。
压缩影响:量化对较大模型推理性能影响小,可提高效率;剪枝和蒸馏对推理性能负面影响大,剪枝模型在多任务中表现差。
稳健性:较大模型在对抗环境和中间推理任务中更稳健,量化对模型稳健性影响小,剪枝模型表现脆弱。
1 引言
长期以来,语言模型中的推理被认为是大语言模型(LLMs)的一种涌现属性,通常在模型参数达到或超过一定规模(约1000亿)时才会出现。早期研究(Wei等人,2022b;Chowdhery等人,2023;Brown等人,2020)表明,多步推理能力只在参数超过1000亿的模型中才会出现,比如GPT-4(OpenAI等人,2024)和Gemini(Gemini团队,2024)。然而,最近的研究结果对这一假设提出了挑战。Phi-3.5-mini(Abdin等人,2024)仅有38亿个参数,但其性能与GPT-3.5相当,这表明小语言模型(SLMs)也能具备推理能力。
最近的一项突破,DeepSeek-R1(DeepSeek-AI等人,2025)展现出了令人瞩目的推理能力。虽然DeepSeek-R1是一个大型模型(6710亿参数),但其推理能力被提炼到了更小的模型中(15亿 - 70亿参数,Qwen家族(Qwen等人,2025))。这进一步挑战了 “推理能力仅源于模型规模扩展” 这一假设,并引出了一个重要问题:小语言模型是否也能发展出强大的推理能力?在回答这个问题之前,我们首先需要定义什么是小语言模型。小语言模型的定义因模型大小、效率和部署限制等因素而存在很大差异。
在这项工作中,我们将小语言模型定义为比当前最先进的大语言模型小得多的模型,通常参数规模从几亿到几百亿不等,或者是通过压缩(例如量化、剪枝)实现类似计算效率的模型。
由于小语言模型具有较低的推理成本、较短的延迟以及本地部署的可行性,人们对它们的兴趣日益浓厚。与依赖云API进行部署的大语言模型不同,小语言模型可以在本地部署(Wang等人,2024),从而降低了数据暴露的风险。然而,它们的推理能力仍未得到充分探索,尤其是在压缩(Zhu等人,2024b)变体方面。例如,量化后的LLaMA-70B是否能优于80亿参数的变体?这又引出了另一个问题:小语言模型在经过压缩(例如量化)后能否保留推理能力?能保留到什么程度?先前的研究缺乏详细的基准测试,无法量化不同的小语言模型策略对推理能力的影响。在这项工作中,我们旨在通过系统地对小语言模型的推理能力进行基准测试,为开发或部署小语言模型的研究人员提供明确的指导,从而填补这一空白。
首先,我们建立了一个可靠的评估指标来衡量推理性能。由于推理是一个生成性任务,定义一个客观的评估指标并非易事。与人工评估相比,不同的评估方法往往会产生相互矛盾的结果,这使得评估模型的实际推理能力变得困难。人工评估不切实际,而基于规则的评估要求模型遵循特定的指令(Huang等人,2024)。有时,这可能并不公平,因为我们测试的是模型的 “推理” 能力,而不是 “遵循指令” 的能力。研究(Wei等人,2022a)进一步表明,这种遵循指令的能力在模型参数扩展到约1000亿时才会出现。为了确定最佳的评估框架,我们系统地比较了不同的基于解析的方法、将大语言模型用作评判者(LLM-as-a-Judge)的方法,以及像lm-eval-harness这样广泛使用的基准测试方法,并将它们与人工评估进行对比。我们的结果表明,GPT-4-Turbo和GPT4o与人工评判的一致性最高(98% 的一致性),我们将其作为基准测试小语言模型推理能力的主要评估指标。
其次,我们对来自六个不同家族(如Llama和Qwen)的72个小语言模型进行了全面评估,包括它们的量化、剪枝和蒸馏变体。我们在八个广泛使用的推理基准测试中进行评估:GSM8K、MATH、MathQA、ARC-C、ARC-E、常识问答(CommonsenseQA)、OpenBookQA、HellaSwag,以及六个排序任务:对仅包含正数和混合随机生成的8个、16个、32个数进行排序,以确保性能反映模型的实际推理能力而非记忆能力。我们观察到,所有模型对不同的提示策略反应并不相同。最近的研究结果(Plaat等人,2024;Qwen等人,2025;Yang等人,2024)表明,即使直接给出提示,一些语言模型也会在内部生成逐步推理(Wei等人,2022c)。因此,在GSM8K任务中,我们使用5种不同的提示策略测试小语言模型的提示敏感性:直接输入/输出(Direct I/O)、思维链(COT)、5次示例(5-Shot)、思维链5次示例(COT 5-Shot)和8次示例(8-Shot)。我们所有实验均重复三次,并报告标准差,以确保对模型性能进行稳健的评估。
最后,我们在三个专门的基准测试中测试小语言模型推理的稳健性:MR-Ben,用于评估定位和分析推理步骤中潜在错误的能力(Zeng等人,2024b);MR-GSM8K,用于评估中间推理能力(Zeng等人,2024a);GSM-Plus,用于衡量对对抗性扰动的恢复能力(Li等人,2024)。为了评估实际推理而非记忆能力,我们选择这些在模型知识截止时间之后发布的数据集,以确保模型之前未接触过这些数据。我们的结果表明,某些开源的小语言模型,如Qwen2.5-32B,在中间推理方面可与专有大语言模型如GPT-4-Turbo相媲美。这表明推理能力并非仅仅取决于模型规模,还与结构化训练和优化有关。
本文的其余部分结构如下:第2节回顾了关于小语言模型推理和评估方法的近期工作。第3节讨论了我们的基准测试设置、评估过程和推理任务。第4节展示实验结果并进行分析,探讨推理性能及其稳健性。最后,第5节总结主要发现,并指出未来研究的方向。
2 相关工作
2.1 关于小语言模型的近期综述
近期的综述对小语言模型的进展进行了探讨。一些综述聚焦于推理和特定任务的改进(Subramanian等人,2025;Wang等人,2024),而另一些则对小语言模型在各种应用中的性能进行了调研(Lu等人,2024;Nguyen等人,2024)。这些研究强调了小语言模型作为大语言模型的高效替代品的可行性日益增加,特别是在资源受限的环境中。然而,现有的综述缺乏对不同小语言模型的系统基准测试,无法量化它们在多个推理基准测试中的性能。
2.2 小语言模型推理
最近的研究探索了小语言模型的推理能力,如Hymba1.5B(Dong等人,2025)和Llama-3-1B(Fedorov等人,2024),特别是在数学和逻辑任务方面。一些方法直接在推理任务上训练小语言模型,如rStar-Math(Guan等人,2025),它使用蒙特卡洛树搜索(MCTS)和过程偏好模型。通过在特定数据集上进行微调实现专业化也能增强推理能力(Fu等人,2023),但可能会降低模型的泛化能力。
另一项研究使用知识蒸馏(Gou等人,2021;Phuong和Lampert,2019)将大语言模型的推理能力转移到小语言模型(Zhu等人,2024a)。类似地,反馈驱动(Zhu等人,2024c)和反事实蒸馏(Feng等人,2024)等蒸馏策略可以优化推理能力,并提高对分布外任务的泛化能力。指令调整思维链(Ranaldi和Freitas,2024)以及在思维链生成的输出上进行微调(Magister等人,2023)也在多步推理中显示出了改进效果。
此外,结构修改,如仅方程式格式(Kim等人,2024)和合成数据训练(例如Orca-Math(Mitra等人,2024))也提高了模型性能。像Phi-3-mini(Abdin等人,2024)这样的高效架构在可部署到边缘设备的同时,还能与更大模型的性能相匹配。自校正机制,如SCORE(Zhang等人,2024),增强了推理的可靠性,而Orca 2(Mitra等人,2023)和OpenELM(Mehta等人,2024)等模型则通过改进训练策略优化了效率。在本文中,我们评估了广泛的小语言模型,包括通过不同方法从头开始训练的模型,以及它们的量化、剪枝和蒸馏变体。
2.3 推理评估
评估语言模型中的推理能力具有挑战性,因为评估开放式、多步响应非常复杂。人们已经探索了各种评估方法,包括基于规则的解析、人工评估和将大语言模型用作评判者的框架。基于解析的方法提供了精确的准确率,但对于生成格式不可预测的模型来说,很难应用,并且常常因为格式不一致而对正确答案进行扣分。人工评估仍然是黄金标准,但成本高昂、耗时且容易受到主观性的影响。
最近,将大语言模型用作评判者的方法越来越受欢迎,研究表明,像GPT-4 Turbo和Llama-3.1 70B这样的模型与人工评判的一致性很高,验证了它们在评估任务中的有效性(Thakur等人,2024)。基于大语言模型的评估在结构化任务中特别有效,在这些任务中,像InstructGPT和ChatGPT这样的模型产生的结果与专业人工评级者相当(Chiang和Lee,2023)。在摘要生成和语法错误纠正等任务中也观察到了类似的趋势,GPT-4在这些任务中与人工排名具有很强的一致性(Sottana等人,2023)。除了准确率之外,关于自然语言生成评估(Wang等人,2023)的研究强调了ChatGPT在创意文本生成方面与人工评估的强相关性。最近的综述(Gu等人,2025;Chang等人,2024)进一步验证了将大语言模型用作评判者是一种可靠的基准测试工具。
然而,这些用于评估小语言模型推理能力的方法尚未得到系统的比较。目前尚不清楚哪种方法最能反映不同模型的真实推理能力。我们的工作通过评估多种评估方法,将大语言模型用作评判者的方法与人工评估、基于规则的解析以及像lm-eval-harness这样广泛使用的开源框架进行比较,解决了这一差距。然后,我们使用与人工评估紧密一致的指标,在多个推理任务中对小语言模型进行系统的基准测试。
3 基准测试实验设置
除非另有说明,每个实验均重复三次,我们报告模型在所有数据集上的性能均值和标准差,以确保结果的可靠性。附录C详细介绍了所有解析脚本和提示模板,包括用于不同提示策略和基于GPT评估的模板。
3.1 评估过程
我们的第一步是选择一种可靠的评估方法。我们没有使用标准的解析技术将模型响应与正确答案进行比较,而是选择将大语言模型用作评判者,在大多数任务中使用GPT-4作为主要评估者。
标准解析技术依赖于固定模式,对于生成性模型来说,要始终遵循这些模式具有一定挑战。我们观察到,较小的模型尤其难以遵循严格的输出格式。这导致在某些情况下,模型给出了正确答案,但却因偏离预期结构而被扣分。先前的研究(Wei等人,2022c)也表明,随着模型规模的扩大(约1000亿参数),模型遵循指令的能力会提高,这使得解析对于较小的模型来说是一个不公平的指标。
为了建立更可靠的评估指标,我们从GSM8K、ARC-E、ARC-C和常识问答(CommonsenseQA)数据集中随机抽取100个数据点,进行了三轮人工评估。表1比较了不同的评估方法,包括标准解析、广泛使用的lm-evaluation-harness框架和基于GPT的评估(将大语言模型用作评判者)。

表1:在四个数据集上,对两个模型的100个随机抽样数据点进行人工评估与不同评估指标以及将大语言模型用作评判者的比较。还包括对四个不同GPT模型作为评判者的比较。分数表示为[<准确率分数>(与人工评估的一致性百分比)]。越接近人工评估越好。
为了选择最可靠的评判者,我们基于两个因素评估GPT模型:1)可靠性(正确性):评判者的评估与人工评估的一致性如何?2)与人工评估的一致性:评判者与人工评估者的意见一致的频率是多少?
表1显示,GPT-4-Turbo与人工评估的匹配度最高,GPT-4o的表现几乎与之相同(仅低1分)。考虑到其相当的准确率和50% 的成本优势,我们选择GPT-4o作为ARC-Easy、ARC-Challenge和常识问答(CommonsenseQA)的主要评估者。对于GSM8K,由于GPT-4-Turbo在数学推理任务中具有稍高的可靠性,我们选择它作为评估者。
对于排序任务,由于需要精确的数值排序,标准的基于大语言模型的评估并不适用。相反,我们使用了一种基于正则表达式的强大解析方法,识别13种常见的响应模式(附录C.3中有更多详细信息),以提取排序后的列表并与正确答案进行验证。与先前的工作(Besta等人,2024)不同,我们不给予部分得分。我们的评估严格基于模型是否返回正确的最终列表。
对于MR - Ben(识别推理中的错误)和MR - GSM8K(中间推理评估),我们使用提供的评估脚本,并以GPT - 4o作为评判者。附录D.6包含了更多关于评判者可靠性(真阳性率和真阴性率)的详细信息。
3.2 推理任务
任务1 - 数学推理
:我们使用GSM8K(Cobbe等人,2021)评估数学推理能力,这是一个算术和应用题基准测试。我们还使用lm - eval - harness在MathQA(Amini等人,2019)和MATH(Hendrycks等人,2021)数据集上进行评估(结果见附录B)。模型在五种提示策略下进行测试:直接输入/输出(Direct I/O)、思维链(Chain - of - Thought,CoT)、5次示例(5 - shot)、5次示例思维链(5 - shot CoT)和8次示例(8 - shot)。
任务2 - 科学推理
:我们使用ARC - Easy和ARC - Challenge(Clark等人,2018)进行科学推理评估,这些测试包含需要逻辑推理的选择题。与GSM8K不同,在这些任务中思维链和多次示例提示的效果并不明显,它们更多地依赖于事实性知识检索。因此,为了保持科学推理评估的一致性,我们使用直接输入/输出提示。
任务3 - 常识推理
:我们使用常识问答(CommonsenseQA,Talmor等人,2019)评估常识推理能力,该测试考查日常知识和推理。与科学推理类似,为保持一致性,我们使用直接输入/输出提示。我们还使用lm - eval - harness在OpenBookQA(Mihaylov等人,2018a)和HellaSwag(Zellers等人,2019)数据集上进行评估(结果见附录B)。
任务4 - 数字排序
:我们设计了一个自定义数据集(随机生成),用于评估结构化数值任务中的逻辑推理能力。该任务分为两类:对正整数进行排序和对混合整数(正数和负数)进行排序。我们使用范围在[1, 100]的正整数和范围在[-100, 100]的混合整数,测试长度为8、16和32的列表。正确答案标签使用归并排序算法生成。此任务衡量模型的逻辑推理能力以及处理顺序数值数据的能力。与GSM8K、ARC - E和ARC - C等可能在预训练期间出现过的数据集不同,排序任务由随机生成的数字组成。这确保了模型的性能反映其推理能力而非记忆能力。我们使用直接输入/输出提示,并使用基于正则表达式的解析方法评估响应。
任务5 - 稳健性
:为了测试小语言模型推理的稳健性,我们使用了三个在2024年6月之后发布的基准测试(如下所示),以确保早期训练的模型没有接触过这些数据。1)MR - Ben评估模型定位和分析推理步骤中潜在错误的能力。2)MR - GSM8K评估逐步中间推理能力。3)GSM - Plus引入对抗性扰动输入以测试模型的恢复能力。
4 结果与分析
我们评估了来自六个家族的72个小语言模型:(1)从头开始训练的小语言模型,(2)Llama - 3.2,(3)Llama - 3.1,(4)Mistral和Mistral - Nemo,(5)Qwen2,(6)Qwen2.5。此外,我们报告了计算需求(GPU和磁盘空间),以提供全面的比较。完整结果详见附录A。除了使用基于GPT的评判者进行评估外,我们还使用广泛使用的框架lm - eval - harness在八个基准测试中评估了所有模型的性能。完整结果详见附录B。
4.1 整体性能
我们的分析表明,涌现属性,即较小模型中未观察到的性能提升,在很大程度上依赖于模型家族(表2),并非所有模型家族的普遍趋势。例如,Qwen2.5(70亿参数)在GSM8K上的得分比Mistral(70亿参数)高出近35分,尽管它们的参数数量几乎相同。这主要归功于Qwen2.5广泛的预训练数据(18万亿令牌)(Qwen等人,2025),以及使用监督微调与多阶段强化学习的训练后方法,使得输出更好地与人类期望对齐。这表明训练数据和训练方法比单纯的参数规模更为关键。
在ARC - E任务上,像Llama - 3.1(700亿参数)这样的较大模型始终能取得接近满分的成绩,因为这些相对简单的推理任务与它们的知识检索能力契合度高。相比之下,较小的模型,如Qwen2.5(5亿参数)和SmolLM2(17亿参数),性能则有所下降,尤其是在ARC - C任务上,该任务需要更细致入微的推理。ARC - E和ARC - C之间的性能差距表明,事实性回忆(ARC - E)在很大程度上依赖于模型规模,而在模糊情境下的推理(ARC - C)更多地受益于多样化的训练数据和数据集质量,而非仅仅是模型规模。

表2:模型在GSM8K、ARC、常识问答和排序任务上的性能和计算需求。该表报告了模型大小(以十亿参数为单位)、优化类型(如有)、GPU内存使用和磁盘空间(以GB为单位),以及每个基准测试的准确率得分。“排序平均”列代表6个不同排序任务的平均准确率(详见4.3节)。
4.2 提示的影响
我们发现,提示的复杂性对近期模型的性能影响极小。当使用直接输入/输出或思维链多次示例提示时,近期模型展现出强大的内部推理能力。这表明,近期的训练方法已经将推理能力融入模型,使得显式的推理提示效果减弱。这意味着需要更先进的提示技术来进一步提升推理能力。附录D.1中对为什么显式思维链提示效果不佳进行了更详细的分析。
在GSM8K任务上,直接输入/输出提示始终优于或与思维链和多次示例等复杂提示的效果相近。这表明,过多的指令可能会使小语言模型感到困惑,而非提升它们的推理能力。图1显示,提供过多的指令或少量示例并不能提高性能。小语言模型在简单查询下的表现优于复杂提示。这表明需要针对特定任务进行提示工程,而非依赖思维链等通用策略。

图1:提示对小语言模型在GSM8K上性能的影响。x轴表示不同的模型(括号内为模型参数规模,单位为十亿),y轴表示平均准确率,柱状图表示方差(3次折叠)。每条线对应不同的提示策略(直接输入/输出、思维链(CoT)、5次示例、5次示例思维链和8次示例)。
4.3 排序任务结果
对于排序任务,图2表明小语言模型在较短列表上表现良好,但随着列表长度增加,性能会下降。这凸显了它们在处理长上下文数值推理方面的局限性。像Llama - 70B这样的较大模型能更好地处理长序列,但随着任务复杂性增加(引入负数),它们的性能也会下降。

图2:小语言模型在排序任务上的性能。x轴表示不同的模型(参数以十亿为单位),y轴表示平均准确率,柱状图表示方差(3次折叠)。每条线对应不同的排序任务(8个正数、8个混合数、16个正数、16个混合数、32个正数和32个混合数)。
此外,模型在对混合数(正数和负数)进行排序时遇到的困难更大,准确率相比仅对正数排序时有所下降。例如,Llama - 3.1(700亿参数)在仅包含正数的数据集上几乎能达到完美准确率,但在混合数数据集上性能下降。这表明处理负数增加了一层额外的复杂性,而当前的架构无法充分应对。而且,随着数字长度增加,性能显著下降。这表明当前架构在算法推理方面存在可扩展性瓶颈。
我们还观察到一些错误情况,例如模型引入输入中不存在的数字,或者直接将整个输入作为输出重复。这些错误随着列表长度增加变得更加频繁,尤其是在32个数的列表中。附录D.5提供了更多详细信息。
4.4 量化的影响
我们发现,量化对较大模型的推理性能影响极小,而较小模型在压缩过程中受到的影响更大。然而,对较小模型进行量化通常没有必要,因为它们本身已经结构紧凑且计算高效。另一方面,对较大模型进行压缩可以使其在保持卓越推理能力的同时,达到与较小模型相当的效率。
图3显示,即使采用激进的量化(4位),较大模型仍能保持推理能力,性能与未压缩版本几乎相同。例如,采用W8 - A8量化的Llama - 3.1(700亿参数)在将计算成本(GPU)降低75% 以上的同时,保留了约100% 的原始准确率(表2)。值得注意的是,采用GPTQ 4位量化的Qwen2.5(140亿参数)在性能上优于Qwen2.5(70亿参数),同时所需的计算资源(GPU)约为后者的三分之一,这表明量化后的较大模型通常比独立的小模型更有效。

图3:量化对不同基准测试中模型性能的影响。该图展示了不同模型在GSM8K(直接输入/输出)、ARC-E和常识问答的平均值,以及所有排序任务的平均值上,不同量化水平下的性能表现。所有结果均来自Qwen2.5家族。x轴表示参数大小(以十亿为单位),y轴表示平均准确率,柱状图表示方差(3次折叠)。
这些发现表明,量化可以在不显著降低准确率的情况下,显著提高模型的效率。这可能是在资源受限环境中部署模型,同时保持强大推理能力的可行策略。
4.5 剪枝和蒸馏的影响
与量化相比,剪枝和蒸馏对推理性能的负面影响更大。剪枝后,通常会使用知识蒸馏和恢复数据集来减轻性能损失。在大多数情况下,GSM8K被用作恢复数据集。我们观察到,当使用直接提示进行评估时,剪枝后的模型在GSM8K上的表现相当不错(表2)。然而,在ARC-E、ARC-C和常识问答等数据集上,剪枝后的模型经常产生与输入查询无关的无意义输出。附录D.2中报告了具体示例。同样,在排序任务中,剪枝后的模型表现比量化后的模型更差,经常出现数字位置错误、输入重复或最终输出中缺少元素等错误。一些模型,如Llama-3.1和Mistral 7B,保留了部分推理能力,但在整体性能上仍远远落后于量化后的模型。这表明剪枝破坏了它们在不同任务中进行推理泛化的能力。
4.6 稳健性
对抗稳健性(GSM-Plus)
:从表3中可以看出,模型在对抗数据上的准确率通常会下降,但下降幅度并不剧烈。结果显示出明显的性能层次:较大的模型(Qwen2.5-32B、Llama-3.1 70B)对对抗性扰动表现出更高的恢复能力,准确率下降相对较小(分别为12.69和11.45个百分点)。较小的模型(Qwen2.5-3B、Llama-3.1-8B)的准确率下降幅度更大(分别为16.41和16.35个百分点),凸显了它们在对抗环境中的脆弱性。这表明较大的模型在对抗环境中本质上更稳健。
我们观察到量化对对抗稳健性没有显著影响。这表明量化后的模型保留了其原始的推理恢复能力,进一步证明了量化作为一种压缩方法的可行性。相反,剪枝后的模型在对抗稳健性方面表现不佳。例如,Sparse-Llama8B-2of4和OpenHermes-7B的准确率急剧下降。它们在对抗条件下无法泛化,可能是由于模型容量降低和训练多样性不足,使其容易受到边缘情况的影响。
中间推理(MR-GSM8K)
:表3还报告了MR-GSM8K分数,该分数衡量模型生成和优化中间推理步骤的能力。量化对较大模型的中间推理影响极小。例如,Qwen2.5-32B及其GPTQ INT8变体的MR分数相同,这表明精度降低不会降低逻辑一致性。相比之下,剪枝后的模型无法保持连贯的推理,MR分数降至零。这表明当架构完整性受到损害时,剪枝后的架构更容易出现推理退化。有趣的是,根据报告结果(Zeng等人,2024a),开源的Qwen2.5-32B(55.6)在中间推理方面甚至超过了像GPT4-Turbo(53.0)和Claude3-Sonnet(20.8)这样的封闭专有模型。
识别推理中的错误(MR-Ben)
:表3也报告了MR-Ben分数。观察到的趋势是一致的:1)Qwen-32B和Llama70B的表现优于其他模型;2)量化总体影响较小;3)剪枝后的模型表现更差。模型在生物学和数学领域表现最佳,而编码和逻辑领域仍然具有挑战性。
从这3个数据集得出的结果进一步支持了小语言模型并非仅仅从预训练中检索答案,而是进行结构化推理的观点。这些发现也为神经网络是否真正具备推理能力的争论提供了参考。最初的思维链论文(Wei等人,2022c)提出了 “思维链引发了推理,但并不能证实模型是否真正在推理” 的担忧。这三个基准测试也有助于解决这个问题,因为它们是在我们测试的许多小语言模型发布之后才出现的,确保了没有数据污染。

表3:各种小语言模型在推理稳健性方面的性能,包括对抗稳健性(GSM-Plus)、中间推理(MR-GSM8K)和识别推理中的错误(MR-Ben)。报告的指标包括准确率分数、准确率下降百分比((A))和MR分数,涵盖了不同参数大小和优化方式的各种模型。附录A.5中报告了MR-GSM8K的详细单项任务结果。
5 结论与未来方向
在这项工作中,我们系统地评估了72个小语言模型及其压缩变体在14个基准测试中的推理能力。我们还测试了它们在对抗条件下的稳健性以及中间推理能力。总体而言,我们观察到:1)大语言模型在推理方面往往优于小语言模型,但某些小语言模型,如Qwen2.5家族,其性能与大语言模型相当。这主要归因于它们广泛的预训练(18万亿令牌,是Qwen2的7万亿令牌的两倍多),以及使用监督微调与多阶段强化学习的强大训练后方法。2)在压缩技术中,量化被证明是一种更安全的方法,在最小的权衡下保留了推理能力。然而,剪枝会显著降低性能,通常会导致无意义或不完整的输出。这表明压缩预训练的大语言模型比从头开始训练小语言模型更有效。3)大语言模型在对抗环境和中间推理任务中表现出更强的稳健性。然而,量化在这些场景中对模型的恢复能力没有显著影响,这进一步证实了其作为压缩方法的实用性。4)小语言模型在遵循指令方面落后于大语言模型,这可能会限制它们在需要精确遵守输入约束的任务中的适用性。我们希望这些见解能为研究人员选择小语言模型提供实际指导。未来的研究应侧重于提高小语言模型的指令遵循能力,并探索在提高效率和稳健性的同时保持推理性能的压缩策略。
5.1 局限性
在这项工作中,我们尽力确保评估的严谨性和公平性,但我们承认在解释结果时应考虑一些局限性。首先,我们依赖GPT-4作为评估者,这可能会引入潜在的偏差和错误。虽然GPT-4是评估的强大基线,但它并非100%准确,可能会错误分类响应,尤其是在边缘情况下(如D.8节所示)。我们观察到,有时产生许多无意义响应的模型会被GPT-4标记为正确,这可能导致对性能的高估。尽管我们试图通过限制令牌生成和应用预评估解析来缓解这个问题,但手动监督整个评估过程并不可行。
其次,我们的排序任务评估依赖基于正则表达式的解析来判断正确性。可能存在模型响应正确但因解析错误而被误分类的情况。尽管我们试图考虑模型输出的大多数变化,但确保自动解析的100%准确性仍然是一个挑战。此外,我们的研究主要集中在广泛使用的基准测试上。然而,推理能力可以在更多样化的数据集上进行进一步评估,包括实际问题解决任务和特定领域的推理基准测试。探索这些额外的设置可以更全面地了解不同的压缩技术如何影响模型性能。

作者:张长旺,图源:旺知识
参考资料
标题:Towards Reasoning Ability of Small Language Models
作者:Gaurav Srivastava, Shuxiang Cao, Xuan Wang
单位:1.美国弗吉尼亚理工大学计算机科学系;2.英国牛津大学克拉伦登实验室物理系
标签:小语言模型;推理能力;模型评估;模型压缩;基准测试
概述: 本文系统评估72个小语言模型在14个基准测试中的推理能力,涵盖不同评估方法、提示策略及对抗条件下的稳健性,分析模型家族、压缩技术等因素的影响,为小语言模型研究提供指导。
链接:https://arxiv.org/pdf/2502.11569