中国科学院自动化研究所揭示强化学习崩溃真相,并找到了解决之道

这项由中国科学院自动化研究所认知与决策智能复杂系统重点实验室及中国科学院大学人工智能学院联合开展的研究,于2026年6月以预印本形式发布,论文编号为arXiv:2606.26027,有兴趣深入了解的读者可以通过该编号查阅完整论文。
**当聪明的AI学生遇到"自由发挥"的考试**
假设你是一位严肃的烹饪学校校长,手下有一个天资聪颖的学生厨师。起初,你手把手地教他每道菜的做法,他学得有模有样。后来,你决定让他参加一场全新的比赛——不再手把手教,而是让他自己摸索,做对了给奖励,做错了扣分。结果呢?这个学生不仅没有进步,反而开始越来越离谱地出错,最终做出来的"菜"连菜都算不上,只是一堆毫无意义的食材碎片。
这个比喻,几乎完美地描述了近年来人工智能研究中一个令人头疼的现象——当研究人员试图用"强化学习"(一种让AI通过反复试错来进步的训练方式)来教大型语言模型(也就是ChatGPT这类AI)学会使用外部工具时,AI有时候会突然"崩溃",性能从正常水平一落千丈,彻底瘫痪。
这项研究正是要揭开这个崩溃现象背后的真相,并且系统性地找出修复办法。
**一、AI的"工具使用"到底是什么**
在深入了解崩溃问题之前,有必要先理解AI的"工具使用"究竟是怎么一回事。现代大型语言模型本身只能处理文字,就像一个博学的图书馆员,能回答你各种问题,但他自己不能出门查资料、不能帮你订机票、不能实时查天气。
于是,研究人员开发了一种机制,让AI学会"调用外部工具"——比如当用户问"明天北京的天气怎样"时,AI不是凭空捏造答案,而是向一个天气查询API发出一个格式规范的请求,拿到真实数据后再回答用户。这就像给那位图书馆员配了一部电话、一台电脑和一个搜索助理,他现在能做的事情就大大拓展了。
这种"工具调用"在形式上有严格的规范。AI必须用特定的格式,比如用特殊的标签``包裹一段符合JSON格式的指令,系统才能识别并执行。这个格式就像烹饪学校的标准菜谱格式,差一个标点符号,整道菜就可能毁掉。
更复杂的是,现实中的任务往往需要多轮交互。用户问一个问题,AI调用工具,工具返回结果,AI再根据结果继续对话或调用下一个工具。这就像一个侦探在破案——不是一次性得到答案,而是要不断收集线索、跟进追查,才能最终还原真相。
研究团队在这项工作中使用了一个名为BFCL-V3的基准测试平台,这是一个专门考察AI多轮工具调用能力的"闯关游戏",包含了普通场景、缺少某些功能的场景、缺少某些参数的场景,以及超长对话场景。研究团队分别以阿里巴巴开发的Qwen2.5-1.5B-Instruct和Qwen3-1.7B这两款轻量级但具有代表性的语言模型作为实验对象。
**二、强化学习:听起来很美,现实却令人头疼**
强化学习的基本思路听起来非常直观:让AI自己不断尝试,做对了给奖励,做错了不给奖励(或者惩罚),久而久之AI就会学会正确的行为模式。这背后的逻辑和训练小狗一样——做对了给零食,做错了没零食,小狗慢慢就学会了坐下、握手。
然而,当把这套方法用在多轮工具调用任务上时,问题就出现了。
研究团队在实验中观察到了两个令人沮丧的现象:一是训练过程极其不稳定,奖励曲线忽高忽低,就像股市大起大落;二是在某些模型上,AI的表现会突然从"勉强能用"直接崩溃到"完全失效"。以Qwen2.5-1.5B-Instruct为例,直接使用强化学习训练,最终平均得分只有0分——相比不训练时的3.5分,反而变得更差了。
**三、幕后真凶:是哪里出了问题**
研究团队没有止步于记录崩溃现象,而是深入追查了背后的机制。他们发现,这个崩溃并不是因为AI"忘记"了怎么做任务,换句话说,AI的核心推理能力其实没有丢失。
他们做了一个关键实验:在出现崩溃的模型上,把提问的格式略作调整,结果发现模型在某些不同格式下仍然能表现出一定的工具调用能力。这说明什么?说明AI的知识和能力还在,只是被某种格式问题给"遮住了"。
这就像一个厨师学了很多复杂技能,但因为某些奇怪的训练方式,他的大脑开始把"开始烹饪"和"结束服务"这两个信号混在一起,于是他每次进厨房,拿起锅铲,立刻就说"结束服务",完全做不出任何菜来。但如果你换一个场合,用不同的方式问他,他其实还记得菜谱——问题不在于他的厨艺消失了,而在于那两个信号把他搞乱了。
这个发现非常重要:它告诉我们,多轮工具调用的强化学习比普通的推理任务(比如做数学题)对这些结构性标记要敏感得多。没有适当的约束,强化学习会不成比例地强化某些控制标记,最终导致整个生成结构的瓦解。
**四、监督信号:给失控的学徒重新上一课**
既然找到了崩溃的根本原因,研究团队开始系统地探索各种"修复方案"。他们把各种干预方式统称为"监督信号",并设计了一个统一的实验框架来公平比较。所有方案被分为两大类:同步训练范式(把监督信号和强化学习混在一起同时进行)和交错训练范式(监督学习和强化学习交替进行,而不是同时进行)。
回到烹饪学校的比喻:同步训练就像一边跟着菜谱练习,一边参加比赛;交错训练则是先专门练习一段时间菜谱,再去参加比赛,然后再回来专门练习,如此循环。
研究团队一共系统研究了五种监督信号,每一种都有其独特的逻辑和效果。
**五、五种监督信号大比拼**
第一种方案叫做"SFT监督"(即先做监督微调,再做强化学习)。这是最直接的做法——先用大量高质量的示范数据手把手教模型,让它掌握正确的工具调用格式和基本能力,然后再用强化学习进一步优化。对于Qwen2.5-1.5B-Instruct这个模型,这种方法效果显著:先用BFCL数据集微调,再加强化学习,平均得分达到17.25分,远超仅做强化学习的0分。训练过程也变得稳定多了,奖励曲线不再大起大落。但这种方法有一个隐患:模型会深度"记住"训练数据的格式,一旦在实际使用中遇到略有不同的提问格式,表现就会急剧下滑。
第二种方案叫做"离线策略监督"(OPS)。这个思路的灵感来自一些已有研究——既然模型自己探索出来的轨迹质量不稳定,那就把一部分"标准答案轨迹"混入训练数据,让模型有机会看到高质量示范。具体操作上,团队把7条模型自己生成的轨迹和1条标准答案轨迹混在一起,计算优势值时把这两类轨迹放在同一个统计池里处理。然而,这个方案在实验中表现令人失望:Qwen2.5-1.5B的平均得分只有1.5分,Qwen3-1.7B甚至是0分。原因在于,模型自己生成的轨迹和标准答案轨迹的分布差异太大,同时训练反而造成了严重的分布冲突,KL散度(衡量模型偏离程度的指标)飙升,训练极度不稳定。
第三种方案叫做"基于提示的引导"(HBG)。这个方案更像是一种临时的"小抄"策略:在模型生成轨迹的时候,给它一个包含正确做法提示的"小纸条",让它参考这个提示来生成更好的轨迹。关键在于,这个提示只在生成阶段使用,计算梯度更新的时候把提示拿掉,让模型在没有提示的情况下承担学习责任。这样设计的目的是:借助提示让模型探索到质量更高的轨迹,同时又不让模型在推理阶段依赖这个提示拐杖。然而实验结果同样不理想,Qwen2.5-1.5B得0分,Qwen3-1.7B得0.75分。这种同步训练方式同样无法解决分布冲突的根本问题。
第四种方案叫做"错误轨迹监督"(ETS),这是研究团队正式引入交错训练范式的开始。做法是:先进行一轮强化学习,收集那些模型反复失败的问题(也就是无论怎么尝试都得0分的问题),然后暂停强化学习,专门针对这些难题用标准答案做一轮监督微调,之后再继续强化学习。这个循环不断重复,而且随着训练的推进,强化学习的比例逐渐增大。这个方案的成绩明显好多了:Qwen2.5-1.5B平均得分20分,Qwen3-1.7B平均得分23.25分,都远超其他方案。训练过程也更加稳定,KL散度曲线不再出现剧烈震荡。
第五种方案是研究团队自己提出的创新方法,叫做"过程反思监督"(PRS)。这是整个研究中最有创意的一个部分。
**六、过程反思监督:让AI学会从失败中写总结**
PRS的核心思路是:强化学习过程中,模型会产生大量的中间轨迹,这些轨迹包含了丰富的过程信息——哪一步做对了,哪一步做错了,为什么出错,应该怎么改。以往的强化学习只用最终的成败奖励来指导学习(0分或1分),完全忽视了这些丰富的中间信息,就像只给学生期末成绩单,不给任何过程反馈。
PRS做的事情,是把这些轨迹信息喂给另一个大型语言模型(研究中使用了GPT-4o-mini),让这个外部AI对轨迹进行分析,生成详细的文字反思报告。这份报告会指出:用户的意图是什么,模型做对了哪些步骤,在哪一步出现了什么类型的错误,根本原因是什么,正确的做法应该是什么,以及在类似场景下应该如何举一反三。
然后,这些文字反思报告被用作额外的训练数据,和错误轨迹的标准答案一起,对模型做监督微调,再继续强化学习,如此交错进行。
这套方案让模型不仅学到了"这道题正确答案是什么",还学到了"这种类型的问题应该怎么思考",是一种更深层次的过程级监督,而不只是结果级监督。
实验结果印证了这种思路的价值:Qwen2.5-1.5B在PRS方案下平均得分达到25.75分,是所有方案中最高的。在Base场景下更是达到了31分,相比完全不训练的3.5分提升了27分。Qwen3-1.7B在PRS方案下也达到了19.5分的平均成绩。
**七、泛化能力:AI学了一套,能不能用在别处**
学会了一件事,能不能在类似但不完全相同的场景中灵活运用,是衡量真正能力的标准。研究团队特意设计了泛化测试,使用另一个叫做ACEBench的评测平台,专门测试模型在"分布外"(OOD)场景下的表现。
研究团队把泛化测试分成两个维度:一是"内容分布外"测试,即题目内容和工具类型和训练时见过的不同,但提问格式是相同的;二是"格式与内容都分布外"测试,即不仅内容不同,连提问的格式也和训练时用的格式不一样。这两个维度的区分非常关键,因为它们考察的是不同层面的泛化能力。
实验结果揭示了几个很有意思的规律。先做监督微调再做强化学习的方案(比如SFTBFCL+RL),在分布内测试中表现不错,但在"格式与内容都分布外"的测试中,得分直接变成0——这说明SFT让模型死记硬背了训练格式,一换格式就完全不认识了。这个现象被研究团队称为"格式过拟合",就像那个厨师只会在自家厨房的炉子上烹饪,换到别人家的厨房就不会开灶了。
与此相对,那些看起来在训练中不稳定甚至"崩溃"的方案(比如纯强化学习GRPO、离线策略监督OPS、基于提示引导HBG),在"格式与内容都分布外"测试中反而表现得相对稳定。这正是之前那个关键发现的直接印证:这些方案的"崩溃"本质上是格式层面的问题,底层的推理和工具调用能力并没有真正丧失,只是被特定的格式问题遮蔽了。
PRS方案在这个泛化测试中表现出了最佳的综合素质:它在"内容分布外"测试中得到了25.8分的平均成绩,在"格式与内容都分布外"测试中也达到了12分,是所有方案中最为平衡的。研究团队认为,这是因为PRS让模型学到的不只是格式,而是工具调用背后的逻辑推理结构,这种深层能力能更好地跨越格式的障碍。
**八、学习率:调得太保守,进步也受限**
研究团队还专门研究了学习率(即每次更新模型参数时步子迈多大)对训练效果的影响。
实验发现,用很小的学习率(10的负6次方)训练效果有限,模型进步很慢,这说明在多轮工具调用任务中,过于保守的更新步幅无法有效稳定复杂的多步行为。把学习率提高到10的负5次方,效果明显改善,SFT阶段的收益变得更加显著,ETS方案的所有指标也都随着学习率的提升而全面改善。
一个有趣的发现是:SFT用ToolACE数据集训练的模型,在较高学习率下起初表现较差(因为ToolACE数据的分布和BFCL评测的分布有些差异),但在随后的强化学习阶段,模型反而能迅速恢复,最终达到不错的成绩。这说明强化学习有能力"纠正"SFT阶段留下的偏差,让模型把被压制的能力重新激活出来。
总体而言,研究团队认为,多轮工具调用的强化学习训练,可能需要比通常使用的学习率更大一些,这或许也是为什么共享学习率的同步训练方案总是不稳定的原因之一。
**九、Qwen3模型的特殊问题:思考模式的干扰**
在Qwen3-1.7B这个更新的模型上,研究团队遭遇了一个特殊的挑战。Qwen3被设计为在生成回答之前先产生一段明确的"思考"内容,格式上用``标签包裹。当这个思考模式被关闭时,模型在提示词中需要显式地写入`\n\n`这样一个占位符,告诉模型"跳过思考直接回答"。
问题出在SFT和强化学习的衔接上:SFT阶段使用的训练数据里没有这个思考标签(因为数据是直接的工具调用输出),但到了强化学习阶段,提示词格式里加入了这个思考占位符。这种格式上的"偷换",导致SFT学到的格式和强化学习采样时用的格式出现了错位,最终引发了灾难性的崩溃——Qwen3在SFT+RL方案下的得分直接变成0。研究团队通过对比实验证实了这一点:去掉这个思考占位符的版本,训练曲线稳定很多。
这个案例说明了一个更普遍的道理:在多阶段训练中,任何细微的格式不一致都可能被放大成严重的稳定性问题,格式的严格对齐是成功的前提条件之一。
**结语**
归根结底,这项研究做了一件很有价值的事:它不满足于仅仅记录"AI训练有时会崩溃"这个现象,而是追问了为什么崩溃、崩溃的本质是什么、各种补救方案各自的优势和局限是什么。
核心发现可以用一句话概括:多轮工具调用中的强化学习崩溃,本质上是一个格式结构崩溃问题,而不是能力丧失问题。AI的知识和推理能力往往还在,只是被混乱的控制标记分配给"堵塞"了。交错进行监督学习和强化学习,尤其是引入过程级反思信号,是目前最有效的修复路径。
对于普通用户而言,这项研究的意义在于:你以后使用的AI助手能更稳定、更可靠地帮你预订机票、查询信息、执行复杂任务,而不会在关键时刻突然"失控发疯",输出一堆毫无意义的乱码。这背后是研究人员在训练方法上的精细打磨。
对于研究社区而言,这项工作明确指出了一条方向:在设计更复杂的智能体系统时,格式结构的稳定性和过程级监督信号的引入,应当被列为与最终奖励设计同等重要的核心问题,而不是被忽视的细节。
有兴趣深入了解技术细节的读者,可以通过arXiv编号2606.26027查阅完整论文,代码也已在GitHub上以Tool-RL-Box为名开源发布。
---
Q&A
Q1:强化学习为什么会导致大型语言模型在工具调用任务中崩溃?
Q2:过程反思监督(PRS)和普通的监督微调有什么区别?
A:普通监督微调只告诉模型"这道题的正确答案是什么",相当于只给期末成绩单。PRS则是用另一个AI分析训练过程中产生的失败轨迹,生成详细的文字反思报告,指出每一步对错和背后原因,然后用这些过程级报告来训练模型。这让模型不只学会了正确答案,还学会了解决这类问题的思维逻辑,因此泛化能力更强,对格式变化的抵抗力也更高。
Q3:交错训练和同步训练有什么区别,哪种更好?
A:同步训练是把监督信号和强化学习混在一起同时进行,比如一边做强化学习一边混入标准答案轨迹。交错训练是两者轮流进行,先专门做一段监督学习,再做一段强化学习,如此循环。实验结果显示,交错训练明显更稳定、效果更好。同步训练容易因为轨迹分布不一致而导致KL散度飙升、训练震荡,而交错训练让两种学习方式各自在适合自己的节奏下进行,互不干扰。