AI智能体的“世界”从哪来?

你有没有想过这样一个问题:教一个AI智能体学会处理复杂的企业业务,比如订机票、处理客户投诉、协调多个部门的工作流程,第一步应该做什么?

大多数人的答案是:先找到或者造一个能让它练习的"场景"。就像教孩子游泳得先有个游泳池一样,教AI干活总得先有个能让它上手操作的环境。

但这里有个问题,一直被这个领域的研究者们忽略了。

被忽略的第三个角色

在AI智能体的训练体系里,一直有两个主角。

一个是策略模型:

**策略模型(Policy Model)**:决定AI在每一步该采取什么行动的"大脑",它看到当前情况,然后决定下一步怎么做。

另一个是世界模型:

**世界模型(World Model)**:预测环境会如何响应AI的动作,相当于AI脑子里的一个"模拟器",能提前推演"如果我这么做,世界会变成什么样"。

这两个角色被研究得很透彻,从强化学习的经典理论到近几年的各种智能体框架,大家争论的焦点始终是:策略该怎么学得更好,世界模型该怎么预测得更准。

但有一件事很少有人问:这个"世界"本身是从哪来的?

在几乎所有现有的研究里,环境是被当作一个既定事实处理的。研究者们要么手工搭建一个特定任务的环境,比如做一个专门测试网页浏览能力的沙盒,要么围绕某个具体的评测基准去合成数据。这就好比说,我们花了大量精力研究运动员怎么训练、教练怎么指导,却从没认真想过:训练场本身是谁建的,建得对不对,够不够用。

这篇来自Meridian Intelligence Global和马萨诸塞大学阿默斯特分校的论文,把这个被忽视的角色单独拎了出来,给它起了个名字,叫PLANET。

**PLANET**:论文中提出的新角色,专门负责"构建世界",也就是决定整个环境里有哪些实体、服务、工具、状态和运行规则,而不涉及AI具体怎么行动。

论文的核心工作,就是设计了一套叫AGENTMERCURY的框架,用来自动化地完成PLANET这个角色的工作:从一句高层次的业务描述出发,生成一个完整的、可执行的虚拟世界。

旧办法的死结:环境是围着任务转的

要理解AGENTMERCURY为什么重要,得先明白现在的环境构建方式究竟卡在哪。

现在主流的做法基本分两种。第一种是纯手工搭建,研究者针对某个特定任务,比如网页购物、文字冒险游戏,专门设计一套实体、工具、状态和转移规则。第二种是"合成式"的,从任务描述或用户指令出发,用生成模型去自动造一批类似的任务实例。

这两种方法有一个共同的隐藏假设:环境是围绕任务存在的,任务是第一位的,环境只是为了让这个任务能跑起来而存在的容器。

问题就出在这里。

如果你的环境是为了某个特定任务量身定做的,那么增加任务数量,并不会增加世界本身的丰富程度。你造了1000个购物任务,但背后可能还是同一套简化的购物网站逻辑,本质上换汤不换药。这就像一个游乐场,为了让游客能玩上"过山车"这一个项目,专门造了1000条一模一样的过山车轨道,看起来项目很多,但游客体验到的东西其实高度重复。真正的多样性,不是来自于任务数量的堆叠,而是来自于这个世界本身有多少种可能性。

现实世界的业务场景恰恰不是这样运作的。你去处理一个客户投诉,这个任务不是凭空出现的,它是从一整套持续运转的业务系统里"长"出来的:有客户关系管理系统的记录,有邮件往来的历史,有团队协作工具里的讨论,甚至可能牵扯到财务系统的一笔交易。任务是嵌在一个活的、有记忆的世界里的,而不是独立于这个世界被单独设计出来的。

这就是论文想要解决的根本矛盾:如果你从任务出发去造环境,你造出的世界注定是贫瘠的,因为它只需要支撑那一个任务;但如果你反过来,先造一个足够丰富的世界,让它自己"长出"各种各样的任务,你得到的训练素材会天然地更加多样、更贴近真实。

论文给这个思路起了个名字,叫"场景驱动的世界生成",和"任务驱动的环境构建"相对。听起来有点绕,但道理很直白:不要先想"我要考什么题",而要先想"我要建一个什么样的世界",题目自然会从这个世界里冒出来。

AGENTMERCURY到底造了什么

论文里,研究团队真刀真枪地用这套方法生成了4783个可执行的环境,覆盖14个行业、50个国家,累计有近1400万行数据。

这个规模放在同类工作里对比一下会更有感觉。论文专门做了一张图,把AGENTMERCURY和几个知名的智能体环境项目放在一起比较,包括AppWorld、MCPMark、τ-bench和agent-world。结果显示,别的项目要么环境数量多但每个环境涉及的服务少(一个环境里可能就一两个服务在互动),要么服务复杂度高但环境数量有限,AGENTMERCURY同时做到了数量大和服务多样两头兼顾,平均每个环境涉及超过13个服务、65个工具、31张状态表和15条SQL验证规则。

这些数字背后到底意味着什么?

每个环境不是一个静态的题目集合,而是一个"活"的软件系统。它有多个相互连接的服务(比如CRM、邮件、Slack这样的组合),每个服务下面挂着几十个可以调用的工具,还有几十张记录着业务数据的表格。更关键的是,这个系统里嵌入了一套用SQL写成的验证规则,能在AI完成任务之后,自动检查它是不是真的把跨系统的业务逻辑处理对了。

举个例子。假设某个业务规则要求"客户升级为VIP之后,必须在计费系统里同步生成一条新的账单记录",这个规则不会被写死成一条强制执行的程序逻辑,环境不会替AI自动生成这条账单记录。它只是被记录为一条"世界应该满足的不变式",等AI操作完之后,系统再去检查这条不变式是否真的成立。

这个设计其实藏着一个很微妙的心思:如果规则是被环境强制执行的,那AI根本不需要理解这个规则,它只需要触发某个动作,系统自动帮它把后续步骤补全了,这样一来AI压根学不到真正的业务逻辑。但如果规则只是"事后检查",AI就必须真正理解"客户升级后应该同步账单"这件事,自己主动去完成这个动作,环境不会代劳。这就像考驾照的时候,如果教练车会自动帮你完成侧方位停车,那你考试再顺利,也不代表你真的学会开车了。只有让学员自己完成动作,事后再检查停得对不对,才能真正检验和培养驾驶能力。

造一个世界,具体分几步

论文把整个构建过程拆解成了一套清晰的流水线,可以概括成这样一条链路:一个业务场景,先经过PLANET变成一个可执行的世界,再从这个世界里生成具体的任务和评分标准,然后AI(策略模型)在这个世界里行动产生一段交互轨迹,最后系统对这段轨迹打分。

这里面有几个层次值得展开讲讲。

首先是世界本身的构造。论文把一个可执行世界定义成一个七元组,包含状态空间、动作空间、观测空间、状态转移函数、观测函数、初始状态和世界级不变式。这套构造过程被进一步拆解成几个连续的子步骤:先确定公司身份(这是家什么行业、什么地区的公司),再确定服务图谱(这家公司用了哪些软件系统,它们之间怎么连接),然后确定状态模式(每个系统里有哪些数据表,字段是什么),接着播种初始状态(给这些表填上具体的初始数据),最后生成不变式(哪些跨服务的规则必须成立)。

这个层层递进的构造方式,其实很像盖房子的顺序:先规划地基和承重结构(公司身份和服务图谱),再确定每个房间的具体用途和布局(状态模式),然后往里面添置家具和物品(初始状态),最后定下"这栋楼哪些区域是相互联通的,哪些安全规范必须遵守"(不变式)。如果你跳过前面几步,直接从"这个房间要放张桌子"开始设计,你造出来的可能是一堆互不相干的房间拼凑物,而不是一栋能真正住人的完整建筑。

其次是任务的生成。世界造好之后,任务是从这个世界里"取样"出来的,具体做法是在世界的初始状态基础上做一些"任务专属"的状态修改,再配上一句自然语言的任务指令和一份评分细则。这就意味着,同一个世界结构完全可以支撑很多个不同的任务,就像同一栋写字楼里,今天可能有个任务是处理一份逾期账单,明天可能是协调一次跨部门会议,办公楼没变,但里面每天发生的具体故事各不相同。

还有一个细节值得单独说一下,就是这些不变式有"可见"和"隐藏"两种呈现形式。

**可见视图(Visible View)**:不变式以业务文档或政策说明的形式出现在世界里,AI需要靠自己在交互中去发现这些规则,而不是被直接告知;**隐藏视图(Hidden View)**:不变式转化成可执行的验证条件,专门用来做最终的打分评估,AI在交互过程中看不到。

这个设计其实模拟了真实工作场景里的常见状态:新员工入职一家公司,公司手册里写着各种流程规范,但没人会把每条规矩都掰开揉碎讲给你听,你得自己在处理业务的过程中去摸索、去踩坑,才能真正理解这些规则的存在。而公司内部真正用来考核你的KPI标准,往往是另一套你看不见的东西。

训练效果:没瞄准考题,却考得更好了

理论讲得再漂亮,最终还是要看数据说话。论文用这4783个环境作为训练场,让智能体在里面做强化学习,然后拿到各种测试题上去检验效果。

这里有一个特别值得强调的实验设计逻辑:训练用的环境,跟最终测试用的评测基准,是完全独立、互不相关的。也就是说,AI在训练阶段接触到的是一堆虚构公司里的业务任务,测试阶段考的却是完全不同的、业内已经公认的标准化题目。这种"训练和考试不同源"的设计,恰恰是检验这套方法是否真的教会了AI通用能力,而不只是让它背下了几道特定题目答案的关键。

先看企业业务场景本身的测试结果,用的评测基准叫ENTERPRISEOPS-GYM,覆盖了团队协作、客户成功管理、邮件处理、IT服务管理、日程安排、人力资源、云盘管理和跨系统协同这八个业务领域。

用40亿参数规模的Qwen3.5-4B模型做实验,训练前平均得分是12.3,训练后涨到15.7,提升了超过27%。具体拆开看,云盘(Drive)这一项从6.2分直接跳到15.6分,涨了9.4分;邮件处理从23.9分涨到33.3分,同样涨了9.4分。这些提升相当可观,尤其是考虑到训练用的环境跟这个评测基准压根没有直接关联。

再换成一个大得多的模型,350亿参数(激活约30亿)的Qwen3.5-35B-A3B,用GRPO这种强化学习算法训练后,平均分从24.8涨到28.1;换用另一种叫SAO的训练算法,平均分涨到28.3。这说明这套环境不挑训练算法,无论用哪种强化学习方法,效果都稳定存在。

**GRPO**:一种强化学习优化算法,全称是分组相对策略优化,会给同一个提示采样多份不同的回答,用相对比较的方式给策略打分改进;**SAO**:单次滚动异步优化算法,特点是不需要对同一个提示反复采样,可以让一次训练接触到更广泛的环境和任务样本。

真正让人意外的,是这套训练还在"跑题"的领域产生了效果。

论文拿了一系列跟企业业务八竿子打不着的测试题去考这个训练后的模型,包括数学竞赛题(AIME26、HMMT)、编程能力测试(LiveCodeBench)、科学计算题(SciCode)、工具调用能力测试(BFCL),还有研究生水平的知识问答(GPQA-Diamond)。

结果是,Qwen3.5-4B在AIME26数学竞赛题上的得分,从训练前的45.9分涨到训练后的56.0分,提升超过10分。HMMT数学竞赛从28.5涨到35.4,编程测试LiveCodeBench从36.6涨到44.0,科学计算SciCode从22.6涨到25.7。

这就有点出乎意料了。一个专门在虚拟企业环境里练习处理客户投诉、协调日程的AI,怎么会在数学竞赛和编程题上突然变强了?

这里可以打个比方。一个健身教练如果只让你反复练习某一个固定的举重动作,你确实能在这个动作上变得很厉害,但你的核心力量和身体协调性未必会有实质提升。但如果这个教练设计了一整套涉及深蹲、跑步、游泳、攀爬的综合训练体系,尽管你从来没专门练过打篮球,你的爆发力和身体协调性提升之后,去打篮球照样会比以前强不少。AGENTMERCURY合成的环境之所以有这种迁移效果,很可能是因为这些环境天然要求AI具备多步骤规划、状态追踪、跨系统信息整合这些底层能力,而这些底层能力恰恰是解数学题、写代码时同样需要的通用技能,不是某个具体领域的窄技巧。

论文里也观察到一个例外,就是电信客服(Telecom)这一项测试分数几乎没变化,从92.5微降到91.9。这说明这种迁移效果不是"训练什么都能涨"的万能药水,而是有选择性的,训练带来的提升集中体现在那些真正需要综合推理和多步操作的场景上,对某些已经接近饱和、区分度不高的测试项影响有限。

还有个细节挺有意思,在350亿参数模型的τ?工具调用测试里,训练之前模型的表现波动特别大,比如电信领域的得分是49.1,但标准差高达49.8,几乎是从0分到接近满分之间随机跳动。训练之后,这个得分变成65.5,标准差降到23.8。这意味着训练不仅仅提高了平均分,还让模型的表现变得更加稳定可靠,不再是"看运气"式的忽高忽低。这一点对于需要连续多步操作才能完成的复杂任务来说,可能比单纯提高平均分更重要,因为一个业务流程里只要有一步掉链子,整个任务就可能失败。

训练过程是否健康:会不会在偷懒作弊

强化学习训练里有个经常被人担心的问题,就是模型会不会通过某些取巧的方式骗到高分,比如疯狂重复某几个词、生成一堆没有实际内容的废话来拖长回答长度,而不是真正提升能力。

论文专门画了训练过程的监控图,追踪了四个指标:奖励分数、回答长度、被截断的回答比例,以及退化回答(也就是那种胡言乱语或者卡在重复循环里的回答)的比例。

结果显示,奖励分数随训练稳步上升,回答被截断的比例持续下降(意味着模型学会了更高效地在规定步数内完成任务),退化回答的比例始终接近于零。这几组数据放在一起看,说明模型确实是靠"把事情做对了"来拿到更高分数的,而不是靠钻空子。

造世界这件事,也能教会AI自己去做

到这里,论文已经证明了合成出来的世界能作为有效的训练素材。但研究团队还追问了一个更深层的问题:造世界这个过程本身,能不能也变成一种可以被AI学会的能力?

换句话说,如果给一个AI模型一段高层次的业务描述,它能不能自己动手,把这段描述变成一个结构完整、可以执行的虚拟世界?

为了验证这一点,研究团队专门准备了30份没在训练中出现过的业务简介,涵盖不同国家和行业。他们让几个市面上现成的顶尖模型(包括Claude Opus 4.8、GPT-5.4、DeepSeek-V4-Pro、GLM-5.2)直接去尝试构建,同时也测试了一个基础版的Qwen3.5-35B-A3B模型,以及经过专门训练后的同一个模型。

评判标准非常严格:不是看生成的文字描述得漂不漂亮,而是直接执行这个生成出来的环境,用12项结构化验证规则去检查,只有全部12项都通过,才算是真正成功造出了一个能用的世界。

结果发现,几个顶尖的商业模型零样本情况下表现还不错,成功率在66.7%到90%之间,平均在80%左右。但基础版的Qwen3.5-35B-A3B模型,零样本尝试的成功率只有3.3%,几乎可以说是不会干这件事。

真正的转折点出现在,研究团队用近3万条从AGENTMERCURY构建过程中提取出来的"构造轨迹"数据,对这个基础模型做了专门的微调训练。这些数据不只是简单的"业务描述对应最终世界"的配对,还包括了中间步骤的补全练习、根据验证器反馈修复错误世界的练习,以及把一个高层意图转化成具体修改动作的练习。

训练之后,这个模型的成功率从3.3%直接跃升到83.3%,几乎追平了最强的商业模型。用统计检验的方法算了一下,这个提升的显著性水平达到了p值1.2乘以10的负10次方,说明这绝对不是巧合,而是真实的能力提升。

这个结果背后传递的信息挺深刻的:造环境这件事,原本被大家默认成一种需要工程师手工完成的"脏活累活",是训练流程之外的一个准备工作步骤。但这个实验说明,只要给出合适的训练数据,让AI观察大量的构造过程和修复错误的案例,这件"脏活"本身也能变成AI自己的一项技能。

这里有个特别值得琢磨的反常现象。研究团队还试了一种"给攻略"的做法,就是除了业务描述之外,额外提供一份构造要点摘要和一个精简过的构造范例,看看这样会不会帮模型表现得更好。

结果是,对训练之前的基础模型,给攻略确实有帮助,成功率从3.3%涨到了20%。但对训练之后的模型,同样的攻略反而把成功率从83.3%拉低到了10%。研究团队进一步分析发现,30个案例里有27个的失败原因都集中在"跨服务约束的处理错乱",也就是本该跨系统生效的一条规则,被错误地塞进了同一个系统内部。

这个现象其实很好理解,可以类比成学开车这件事。一个还没学会开车的新手,你给他一份详细的操作手册,确实能帮他磕磕绊绊地把车开出去。但一个已经把开车动作练成肌肉记忆的老司机,你突然递给他一份操作手册让他边看边开,反而会打乱他原本流畅自然的操作节奏,让他手忙脚乱。这说明"通过提示词临时补充信息"和"通过训练把能力内化进模型参数里",是两种完全不同性质的机制,前者是外部拐杖,后者才是真正学会了这件事。如果训练确实让模型学会了这项能力,那这份多余的拐杖,反而会成为一种干扰。

论文里没细说但值得多想一层的地方

论文本身也很坦诚地指出了当前系统还没有完全实现的部分。目前这套流程里,造世界(PLANET)和训练策略(policy)之间还是相对分离的两个环节,造世界的过程并不会根据AI在训练中暴露出的具体弱点去针对性地生成新场景。

论文设想的下一步,是让这两者形成一个真正的闭环:AI在执行任务的过程中不断暴露出自己哪些能力还比较薄弱,这些薄弱环节能够反过来指导PLANET去合成更多针对性的新场景,新场景又反过来训练出更强的策略,如此循环往复。这有点像一个不断根据你的弱点调整训练计划的私人教练,而不是一套固定不变的健身课表,只不过现在这个"教练"这一环还没有真正打通。

##

写在后面

这篇论文最让我反复琢磨的一点,是它对"什么值得被规模化"这件事给出了一个跟直觉相反的答案。

大多数人第一反应会觉得,想让AI变强,就应该多喂它做题,题目越多越好,题目越贴近考试内容越好。但这篇论文用实打实的数据说明了另一件事:训练素材跟最终考核标准压根不沾边,反而可能训练出更泛化的能力。这多少推翻了我以前对"针对性训练"这个词的默认信任,针对性未必是好事,有时候反而是一种限制。

另一个让我印象深刻的细节,是"给攻略反而让训练后的模型变差"这个反常结果。这其实提醒了一件容易被忽略的事:一个模型的能力状态是有连续性的,同样一份外部信息,喂给不同训练阶段的模型,效果可能完全相反。这跟人类学习一门技能的过程还挺像的,新手需要拐杖,但对已经内化了这项技能的人来说,拐杖反而变成了累赘。

论文里那句"跨服务约束的坍缩"错误也值得单独玩味一下:一个AI造出的虚拟世界,表面看起来结构完整、逻辑自洽,但实际上把本该分离的两个系统之间的约束错误地塞进了同一个系统内部。这种错误光看文字描述根本发现不了,只有真正把这个世界跑起来、执行一遍,才能暴露出问题。这某种程度上说明,判断一个复杂系统是否真的"对",光靠看说明书是不够的,你得真的让它运转起来试试看。

那么问题来了:如果造世界这件事本身能被AI学会,那AI是不是也能学会判断"这个世界值不值得造",甚至是"我需要一个什么样的世界来提升自己"?这条链路一旦真的打通,AI训练这件事会变成什么样子?

Q&A

Q1:AGENTMERCURY是什么?

A:AGENTMERCURY是一个可以从高层次业务场景描述出发,自动合成可执行虚拟环境的框架。它先构建一个包含实体、服务、工具、状态和跨服务规则的持久化世界,再从这个世界里生成具体任务,供AI智能体训练和测试使用,目前已经生成了4783个覆盖14个行业、50个国家的环境。

Q2:用AGENTMERCURY合成的环境训练AI,效果好在哪?

A:论文实验显示,用这些环境训练出的AI模型,不仅在企业业务测试(ENTERPRISEOPS-GYM)上有明显提升,比如Qwen3.5-4B从12.3分涨到15.7分,还在完全不相关的数学竞赛(AIME26从45.9涨到56.0)、编程测试(LiveCodeBench)等领域表现更好,说明这种训练方式能提升AI的通用能力,而不只是针对特定任务的窄技巧。

Q3:AI能不能自己学会造这种虚拟环境?

A:可以。论文用近3万条环境构造过程的数据对Qwen3.5-35B-A3B模型做了微调训练,结果这个模型在30份未见过的业务场景上,成功造出可执行世界的比率从训练前的3.3%提升到了83.3%,说明环境构建这件事本身也是一项可以被AI学习掌握的能力。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询