晓|ICML'25 伯克利+亚马逊提出智能体自学习:7B干赢72B大模型

旺晓通:深入浅出,轻松通晓

你有没有过这种经历?想让网页AI助手帮你查某门Coursera课程的多语言课件,它却一脸“懵”——因为没人教过它这个任务;让它在小众论坛里找篇情感建议帖,它半天点不对按钮,最后给你返回一堆无关页面。

我最近在研究基础模型智能体(就是能像人一样完成复杂任务的AI)时,发现了一篇彻底改变我对“AI学习方式”认知的ICML2025论文。这篇来自伯克利、伊利诺伊大学和亚马逊团队的研究,居然让AI学会了“自主摸索新技能”——不用我们手动写一堆任务模板,它能自己对着网站“琢磨”该练什么、怎么练,最后还能把学到的本事用到没见过的任务上。

我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识

如果你好奇“未来的AI助手会不会像人一样,看一眼APP就知道怎么用”,或者想搞懂“为什么有些AI越用越聪明,有些却总停留在老功能”,那这篇文章会帮你把核心逻辑掰得明明白白,没有公式,全是生活里的类比。

先聊个痛点:AI不会“新活儿”,问题出在哪?

咱们先搞清楚一个前提:现在能逛网页、做任务的AI(比如帮你订酒店、查论文的智能体),其实都是“被手把手教大的”。

就像教孩子骑自行车,你得先给它列好“教程”:比如“查从A到B的路线”,要写清楚“第一步点搜索框,第二步输起点,第三步选导航模式”;“买东西”要标注“点商品分类→选型号→加购物车”。这些“教程”专业名叫“人类标注任务模板”,本质就是告诉AI“该做什么、怎么做”。

但这方法有两个致命问题:

1. 太费钱还慢:想让AI会100种网页操作,就得雇人写100套模板,要是遇到小众网站(比如某个学校的选课系统),模板直接作废。我之前参与过一个网页智能体项目,光标注20个网站的任务就花了3个工程师半个月,成本高到老板直皱眉。

2. “不会举一反三”:你教它“查亚马逊商品价格”,它就只会这一个动作;换成“查亚马逊商品的退换货政策”,它就卡壳——因为没学过这个“新活儿”。这就像只会做番茄炒蛋的人,你让他做番茄炖牛腩,他连锅都不知道怎么开。

说白了,传统AI的“技能库”是“死的”,得靠人不断往里填;而我们想要的AI,是能像人一样“活学活用”的——看到新网站,自己琢磨“这地方能做什么”,练会了还能用到别的场景。PAE框架,就是为解决这个问题来的。

PAE:让AI学会“自学”的“三人小组”

PAE的核心思路特别简单,就像一个“自主学习小组”,由三个角色组成:任务提议者(Proposer)、执行者(Agent)、评估者(Evaluator)。这三个角色各司其职,循环配合,让AI在没人管的情况下,自己练技能、改毛病。

我给你举个生活里的例子:假设你想让AI学会“逛亚马逊”,PAE的流程就像这样——

1. 任务提议者(Proposer):“今天练这个!”

Proposer的工作是给Agent“布置练习任务”,但它不瞎布置,而是看“环境能支持什么”。比如看到“亚马逊”这个网站名,它就知道这是购物网站,会提“把某款无线耳机加进购物车”“查某本书的最新评价”这种靠谱任务;不会提“查看其他用户的银行卡信息”——因为亚马逊根本不支持这功能。

这就像健身房的教练,不会让你用跑步机练举重,而是根据器械(环境)给你定训练计划(任务)。更聪明的是,要是遇到小众网站(比如某个自制的论坛),Proposer还能看几张用户操作截图(相当于“参考案例”),就能调整任务难度,不会让Agent练“不可能完成的活”。

2. 执行者(Agent):“我来试试!”

Agent就是那个“动手干活的”,比如LLaVa-7B这种视觉语言模型(能看懂网页截图、输出点击/输入动作)。但PAE给Agent加了个关键动作:先想清楚再动手。

比如接到“加无线耳机到购物车”的任务,Agent不会直接点按钮,而是先在心里“打草稿”:“第一步应该点搜索框,输‘无线耳机’;第二步在搜索结果里找目标型号;第三步点‘加入购物车’按钮”。这个“打草稿”的过程,专业名叫“Chain-of-Thought(思维链)”,就像学生做题前先列解题步骤,不容易出错。

我之前测试过没有“思考步骤”的Agent,它经常犯低级错误:比如在亚马逊首页直接点“购物车”(空的),以为这样就算完成任务;而有思考步骤的Agent,会先检查每一步是不是朝着目标走,出错了还会调整——比如搜不到耳机,会换关键词再试。

3. 评估者(Evaluator):“对了吗?再改改!”

Evaluator是“裁判”,但它不管Agent中间步骤对不对,只看“最终结果”。比如任务是“加耳机到购物车”,它就看最后三张网页截图里,购物车有没有这款耳机——有就给“1分”(成功),没有就给“0分”(失败)。

这个设计特别巧妙,就像考试只看最后答案对不对,不看你草稿纸写得多乱。为什么不看中间步骤?因为AI很容易“瞎判”——比如Agent点错了一次搜索框,但后来改过来了,步骤评估者可能会误判“这步错了,整体失败”;而只看结果,既简单又准确,还不用获取网站的隐藏数据(比如后台代码),实用性强太多。

循环起来:AI自己“查漏补缺”

这三个角色不是只走一遍流程,而是形成一个“训练闭环”:

1. Proposer给任务 → Agent带着思考去执行 → Evaluator判分;

2. 把“得分高的成功操作”记下来,让Agent多学;“得分低的错误操作”避开;

3. 重复这个过程,Agent的技能会越来越多,越来越准。

就像学生刷题:老师(Proposer)给题,学生(Agent)做题+写解题思路,老师(Evaluator)判对错,学生再根据对错调整——练得越多,会的题就越多,考试(新任务)时就越厉害。

PAE最牛的3个创新:解决了“自学”的3个大难题

光有“三人小组”还不够,PAE能在实验里吊打传统方法,靠的是三个“反常识”的创新设计。我读论文时,每看到一个都忍不住想:“原来还能这么玩?”

1. 用AI的“短板”补“长板”:弱模型也能帮强模型进步

你可能会想:Proposer和Evaluator得用比Agent更厉害的模型吧?不然怎么“指导”Agent?

但PAE偏不——实验里用比Agent弱很多的模型(比如用Qwen2VL-7B当Proposer/Evaluator,Agent是更强的LLaVa-7B),居然也能让Agent的成功率提升30%以上。

这背后的关键,是PAE抓住了视觉语言模型(VLM)的“不对称能力”:VLM很擅长“想任务”和“判结果”,但不擅长“动手操作”。比如Qwen2VL-7B能轻松想出“查亚马逊退换货政策”的任务,也能看出购物车有没有商品,但让它自己点按钮逛网页,成功率只有1.4%;而LLaVa-7B操作能力强,但不知道该练什么。

PAE就把这两者的优势结合起来:让弱模型当“教练”(提任务、判对错),强模型当“运动员”(练操作)。这就像一个刚懂规则的教练,虽然自己打不好球,但能看出运动员的动作漏洞,帮他调整——最后运动员的水平反而提高了。

2. 不用“说明书”:网站名就能当“学习线索”

传统方法要让AI练新网站,得给一堆“说明书”(比如网站功能列表、操作指南),但PAE只用“网站名”就够了。

比如看到“Coursera”,Proposer就知道这是在线课程平台,会提“查某门心理学课程的讲师名字”“看课程有没有中文字幕”这种任务;看到“GitHub”,就提“找某个项目的Issues页面”“查某段代码的提交记录”。

要是遇到小众网站(比如自制的论坛PostMill),PAE再补几张用户操作截图(比如“点‘论坛’→选‘情感建议’板块”),就能提更精准的任务。这就像你去一家新餐厅,不用看完整菜单,只要知道是“日料店”,就知道该点寿司、刺身;要是不知道,看别人点什么(截图),也能跟着点。

我之前做过类似尝试,当时让模型用网站名提任务,结果全是“天马行空”的——比如给“豆瓣”提“查股票行情”,根本不现实。PAE能做到这么准,全靠基础模型的“常识”:它在预训练时已经知道“亚马逊=购物”“Coursera=上课”,不用再额外教。

3. 先“想”再“做”:让AI学会“举一反三”

前面提到过,PAE让Agent“先思考再动手”,这个看似简单的设计,其实是它“能举一反三”的关键。

实验里发现:没有思考步骤的Agent,虽然能在“练习任务”上表现不错(比如练会了“加亚马逊耳机到购物车”),但遇到“新任务”(比如“加亚马逊键盘到购物车”)就不行;而有思考步骤的Agent,能把“搜索→找商品→加购物车”的逻辑迁移过去,轻松完成新任务。

这就像两个学做饭的人:一个只记“番茄炒蛋要放2勺盐”,换个菜就不会了;另一个记“炒素菜先放调料,炒肉菜后放调料”的逻辑,换什么菜都能套用——思考步骤,就是AI的“做菜逻辑”。

实验结果:70亿参数的AI,能打过720亿的?

光说不练假把式,PAE在真实网页任务上的表现,才是最让我惊讶的。

研究团队用了两个主流的网页测试基准:WebVoyager(13个真实网站,比如亚马逊、Coursera,557个任务)和WebArena Easy(3个自建网站,比如开源地图、论坛,208个任务),测试了PAE对LLaVa系列模型的提升效果。

有几个结果特别亮眼:

1. 成功率提升50%:LLaVa-7B用了PAE后,在WebVoyager的成功率从14.9%(传统监督学习)涨到22.3%,WebArena Easy从18%涨到24.6%——相对提升差不多50%。

2. “小模型”吊打“大模型”:70亿参数的LLaVa-7B+PAE,在WebArena Easy上的表现居然超过了720亿参数的Qwen2VL-72B(24.6% vs 23.9%)。要知道,720亿参数的模型,算力消耗是70亿的10倍以上——PAE相当于让“小个子”打赢了“大块头”。

3. 能搞定“没见过的网站”:团队找了85个PAE从没接触过的网站(比如Yummly美食网、Mathway数学解题网),发现LLaVa-7B+PAE在这些新网站上的成功率,比传统方法高7.2%——说明它学的是“通用技能”,不是死记硬背某个网站的操作。

更有意思的是,就算用很弱的模型当Proposer和Evaluator(比如Qwen2VL-7B,自身成功率只有1.4%),PAE依然能让Agent进步。这意味着PAE不用依赖昂贵的闭源大模型(比如GPT-4、Claude 3.5),用开源小模型就能跑,普通团队也能复现——这对AI落地来说太重要了。

未来会怎样?AI可能比你更懂“怎么用APP”

PAE的意义,不只是“让网页AI更厉害”,更在于它打开了“AI自主学习”的新方向。我能想到几个可能的应用场景:

1. “零维护”的AI助手:以后你装一个网页助手,它不用更新版本,就能自己琢磨新网站的用法——比如你第一次用某个海淘网站,它看一眼就知道“怎么搜商品、怎么填地址”,不用你教。

2. 更灵活的机器人:把PAE的思路用到家用机器人上,它能自己摸索“怎么用微波炉”“怎么叠衣服”——不用工程师针对每款家电写操作代码。

3. 降低AI开发成本:小公司不用再花大价钱标注任务,只要给AI一个目标(比如“学会用办公软件”),它就能自己练,大大降低了AI的使用门槛。

当然,PAE现在还有局限:比如它的表现还比不上闭源大模型(Claude 3.5在WebVoyager的成功率是50.5%,PAE最高才33%);网页要是频繁更新(比如亚马逊改了按钮位置),它可能会暂时“失灵”;复杂任务(比如“写一篇基于10个网页信息的报告”)还搞不定。

但这些都是技术迭代能解决的问题。PAE最核心的价值,是打破了“AI必须靠人教”的固有思维——以后的AI,可能会像人一样,在探索中学习,在错误中进步。

最后聊两句:你期待AI自己学会什么技能?

PAE这篇论文,给我最大的启发是:AI的“聪明”,不只是参数多、数据多,更在于“会学习的能力”。就像人一样,真正的成长不是“别人教什么会什么”,而是“自己想办法学会新东西”。

也许再过几年,当你打开一个新APP时,AI助手会比你先搞懂“怎么用”;当你买了新家电,机器人会自己研究“怎么操作”——到那时,我们可能真的会忘记“教AI做事”这件事。

最后想问问你:如果AI能自己学会一个生活技能,你最希望它先学会什么?是帮你自动整理混乱的邮箱,还是精准拿捏你喝奶茶的甜度偏好?欢迎在评论区聊聊你的想法。

参考资料

• 标题:Proposer-Agent-Evaluator (PAE): Autonomous Skill Discovery for Foundation Model Internet Agents

• 作者:Yifei Zhou, Qianlan Yang, Kaixiang Lin, Min Bai, Xiong Zhou, Yu-Xiong Wang, Sergey Levine, Erran Li

• 单位:University of California, Berkeley; University of Illinois, Urbana-Champaign; Amazon.

• 链接:https://openreview.net/pdf?id=uCkwqAG0uS

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询