NeurIPS'25伯克利+Meta新研究:Agent自学能力翻倍

旺晓通:深入浅出,轻松通晓

最近翻NeurIPS 2025的投稿论文时,被一篇来自伯克利和Meta的研究惊到了——你有没有想过,为什么AI学新技能总离不开人类“喂题”?比如让AI帮你订机票、处理订单,得先有人编好上百个类似任务让它练手,又耗时又费钱。但这篇论文偏要反其道而行:让AI自己给自己出考题,自己批改,自己精进,最后在真实任务中的表现直接翻倍。这波“自我内卷”操作,可能彻底改变AI训练的游戏规则。

我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识

一、核心痛点:AI训练的“题库难题”

做AI研究的都知道,想让大语言模型(LLM)变成能干活的智能体(比如帮你处理电商售后、查航班信息),最头疼的不是模型本身,而是“训练题库”。

你可以把智能体想象成一个准备考证的学生:要想考得好,得先做大量真题。但AI的“真题”全靠人类编——标注人员要先摸清工具用法(比如数据库查询、API调用),再设计各种任务(“把订单#123的水壶换成玻璃材质”“查询从纽约到伦敦的最便宜航班”),还要写清楚“怎么算答对”。

这事儿麻烦在哪?三点致命问题:

1. 成本太高:编一个高质量任务要花不少时间,想覆盖各种场景(比如订单修改、航班改签、异常处理),得组建庞大的标注团队;

2. 不灵活:换个环境(比如从电商售后换到股票查询),之前的题库就作废了,得重新编;

3. 难规模化:AI要应对的真实场景是无限的,人类根本编不完所有可能的任务。

之前也有研究尝试让AI自己生成任务,但要么是“纸上谈兵”(只看工具文档就出题,不了解实际环境),要么是任务质量差(要么太简单,要么根本没法完成),训练出来的AI在真实场景中还是会“翻车”。

二、新技术核心:让AI身兼两职——“出题老师”+“答题学生”

这篇研究的天才之处,就是设计了一个“Self-Challenging”(自我挑战)框架,让同一个AI智能体扮演两个角色:既是“出题老师”(Challenger),又是“答题学生”(Executor)。

1. 角色一:出题老师(Challenger)——先摸透环境再出题

这个“老师”可不是瞎出题,它得先自己“玩遍”所有工具,摸透环境规则,再设计高质量考题。

打个比方:就像体育老师要先亲自体验所有器材(篮球、跑步、跳高),知道每个动作的难点在哪,才能给学生出合理的测试题。AI“老师”会先调用各种工具——比如查询数据库、模拟用户对话、调用API——搞清楚“这个环境里能做什么、不能做什么”“哪些操作容易出错”。

比如在电商售后环境中,AI“老师”会先查用户订单、看商品库存、试玩“退换货”功能,摸清“哪些商品能退换”“支付方式怎么选”,之后才开始设计任务。这样出的题,既不会超出环境能力(比如让AI退一个不存在的订单),又能精准考察核心技能。

2. 角色二:答题学生(Executor)——做完题拿反馈,越练越强

AI“学生”要做的就是解“老师”出的题,做完之后还能拿到即时反馈——不是人类批改,而是环境自动评分。

这个过程就像学生做完模拟题后,立刻拿到标准答案和错题解析,知道自己哪步错了、为什么错。AI会根据反馈调整自己的策略,比如这次没搞对支付方式,下次就会重点关注订单的支付信息,慢慢积累经验。

3. 关键保障:Code-as-Task——给考题加“标准化模板”

光让AI自己出题还不够,得保证题目的质量。研究团队设计了一个“Code-as-Task”(代码即任务)的格式,就像给考题定了一个“标准化模板”,确保每个任务都满足“可行、可验证、有难度”三个要求。

这个模板包含四部分,用生活场景解释更清楚:

• 指令(题目):比如“帮我把订单#W112的滑板通过PayPal 77退货”——明确告诉AI要做什么;

• 验证函数(判分规则):用代码写的“标准答案”,比如“检查订单#W112的退货商品ID是不是6843647669,支付方式是不是PayPal 77”——确保评分客观,不偏心;

• 示例解决方案(解题步骤):比如“调用退货接口,输入订单号、商品ID和支付方式”——证明这个任务确实能完成;

• 失败案例(易错点):比如“用信用卡退货”“退错商品ID”——确保任务有难度,不是随便蒙就能过。

更妙的是,这个模板还能自动过滤差题:如果示例解决方案通不过验证函数,或者失败案例居然能得分,这个任务就会被直接淘汰。就像老师出完题后,自己先做一遍,把错题、怪题删掉,只留高质量考题给学生做。

三、创新点突破:比传统方法强在哪?

研究下来,这个框架最核心的突破有三个,也是它能大幅提升性能的关键:

1. 从“被动刷题”到“主动探索”

之前的AI任务生成,大多是“看说明书出题”——只根据工具文档(比如API说明)编任务,根本不了解实际环境。而这个框架里的“出题老师”会主动探索环境,就像侦探先勘察现场再破案,出的题更贴近真实场景。

比如在网页浏览环境中,AI“老师”会先点击链接、查看页面内容,摸清网站结构,再设计“找到某个人的部门信息”这样的任务,而不是凭空编一个“找不存在的页面”的无效题。

2. 用代码解决“评分难题”

之前AI训练的反馈要么靠人类标注(慢且贵),要么靠LLM自己判断(主观易出错)。而Code-as-Task用代码验证,就像用计算器判数学题,又快又准,还能避免“AI瞎打分”的问题。

比如AI“学生”完成退货任务后,验证函数会自动查询数据库,几毫秒内就能给出“对”或“错”的反馈,不用等人类审核,训练效率直接拉满。

3. 两种训练模式,覆盖不同场景

这个框架还支持两种训练模式,不管有没有“强AI老师”都能用:

• 自我提升模式:没有强AI指导,普通AI自己出题、自己做题、自己改进。就像一个学生自己买习题集、自己批改、自己总结,不用老师监督也能进步;

• 蒸馏模式:让强AI(比如Llama-3.1-70B)做“示范”,普通AI(比如Llama-3.1-8B)学习它的解题思路。就像学霸做完题,学渣跟着抄作业还能看解析,快速提升水平。

四、实验效果:性能翻倍,还能泛化到新场景

光说不练假把式,研究团队在四个真实环境中做了测试——计算工具使用、网页浏览、电商售后、航班预订,结果相当惊艳:

1. 自我提升模式:成功率从12%涨到23.5%

在没有强AI指导的情况下,Llama-3.1-8B模型只靠自己生成的任务训练,平均成功率从12%翻倍到23.5%,远超之前的state-of-the-art方法(PAE)。

尤其是在网页浏览、航班预订这种“部分信息可见”的复杂环境中,之前的方法要么进步微小,要么甚至性能下降,而这个框架因为“出题老师”会主动探索环境,任务质量更高,所以表现远超同类。

2. 蒸馏模式:小模型也能追近大模型

用Llama-3.1-70B(大模型)做示范,训练Llama-3.1-8B(小模型),小模型的平均成功率提升了20.2%,在网页浏览环境中甚至能达到82.4%的Pass@4成功率,接近大模型的水平。

更意外的是,研究发现:连大模型的“错题”都有价值。小模型学习大模型的失败轨迹(比如“为什么这次改签航班没成功”),能避免自己犯同样的错,比只学成功案例效果更好。

3. 不同RL算法都能适配

这个框架不挑训练算法——不管是简单的“只练成功题”(Rejection Fine-Tuning),还是复杂的在线训练(PPO、GRPO),都能提升性能。其中在线RL算法能把计算环境的成功率推到43.2%,不过需要更精细的参数调优,稳定性稍差。

五、应用前景:AI训练不用再“依赖人类”

作为研究员,我觉得这个技术的潜力不止于提升模型性能,更在于它可能改变AI训练的底层逻辑——从“人类喂题”变成“AI自循环”。

未来它可能会应用在这些场景:

• 低成本AI定制:小公司想做一个电商售后AI,不用花大价钱请标注团队编题库,让AI自己探索系统,几天就能训练出可用模型;

• 跨领域快速迁移:AI从电商售后切换到航班预订,不用重新标注,自己探索新环境的工具和规则,就能快速适配;

• 边缘设备AI优化:边缘设备(比如智能音箱、手表)上的小模型,能在设备端自己生成简单任务,持续优化性能,不用频繁更新模型。

不过也要看到,这个技术目前还有局限:比如AI自己出的题,偶尔还是会有“信息不全”的问题(比如没说订单号就让退货);而且训练出的技能大多是“环境特定”的(比如在A电商学会的退货操作,在B电商可能没用),还没法形成通用能力。但这些都是可以通过后续优化解决的,比如给AI加“语义检查”模块,或者让它在多个环境中交叉训练。

六、总结:AI的“自我进化”时代要来了?

这篇研究最让我震撼的,不是性能提升的数字,而是它展现的一种可能性:AI不再是被动接受人类投喂的“学生”,而是能主动探索、自我挑战、持续进化的“学习者”。

就像人类通过“教别人做题”来巩固自己的知识,AI通过“给自己出题”来提升自己的能力——这种“自循环”的训练模式,可能会让AI的学习效率呈指数级增长。未来我们可能会看到:AI在没有人类干预的情况下,自己学会使用新工具、解决新问题,甚至探索人类没发现的技能组合。

你觉得这种“自己卷自己”的AI,会先在哪个领域落地?是电商售后、智能办公,还是更复杂的工业场景?欢迎在评论区分享你的看法~

参考资料

• 标题:Self-Challenging Language Model Agents

• 作者:Yifei Zhou, Sergey Levine, Jason Weston, Xian Li, Sainbayar Sukhbaatar

• 单位:UC Berkeley, Meta

• 链接:https://openreview.net/pdf?id=9yusqX9DpR

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询