NeurIPS'25港大+CAMEL-AI多智能体OWL:GAIA开源框架1st

两千多年前,罗马军团能横扫地中海,靠的从不是单个士兵的全能,而是“百人队”的模块化分工:前锋探路、重装步兵攻坚、轻装步兵侧翼掩护,每个单元各司其职,却能快速重组适配平原、山地、攻城等不同战场。这与当下AI多智能体系统的困境形成奇妙呼应。我们总在追求“全能超人”式的AI,却发现一个残酷现实:能搞定软件工程的MetaGPT,到了医疗数据分析领域就寸步难行;能优化科研检索的OpenAI Deep Research,面对多模态任务便力不从心。

我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识

这篇来自CAMEL-AI与香港大学等机构的论文,恰恰戳中了这个核心矛盾:AI的“领域壁垒”,本质是架构的“刚性束缚”。而WORKFORCE框架给出的答案,竟与罗马军团的制胜之道不谋而合——用模块化拆解通用能力与专项执行,让AI像军团一样,通过重组“作战单元”适配任何战场。

痛点:AI界的“隔行如隔山”有多致命?

让我们先回到真实场景。假设你需要一个AI助手完成两项任务:一是分析PDF里的工作申请资格缺失情况,二是检索2016年arXiv上某篇物理社会论文的关键词。

按照传统多智能体思路,你可能需要:

1. 为PDF分析定制一套“文档解析+表格处理”智能体;

2. 为学术检索定制一套“网页爬虫+论文提取”智能体;

3. 当任务变成“分析视频中的产品参数并生成代码”时,又得重新设计架构、全量训练。

这就是现有系统的两大死穴:

• 推理侧:换领域=重构系统,MetaGPT依赖软件工程的标准流程,根本无法迁移到医疗、法律等领域;

• 训练侧:改任务=全量重训,MALT的“生成器-验证器-精炼器”固定流程,任何环节调整都要从头训练所有组件。

更致命的是,这种“定制化”模式让开源AI始终落后于商业系统——商业公司能投入海量资源为每个领域定制模型,而开源社区根本无力跟进。直到WORKFORCE出现,用69.70%的GAIA基准准确率,首次让开源系统超越了OpenAI Deep Research(55.15%)。

技术解构:三层架构的底层逻辑——把“大脑”和“手脚”分开

WORKFORCE的核心创新,不是发明了新的智能体,而是重新定义了智能体的“协作规则”。它的三层架构,本质是对“通用规划”与“专项执行”的彻底分离:

1. 领域无关的Planner(规划者):AI的“战略大脑”

Planner不负责任何具体任务执行,只做一件事——把复杂目标拆解成可执行的子任务。比如面对“分析PDF里的工作申请资格缺失情况”,它会拆解为“提取ZIP文件→识别岗位资格→代码分析缺失情况→统计结果”。

关键在于,这个“大脑”是通用的。它不需要知道PDF怎么解析、代码怎么写,只需要理解“目标与子任务的逻辑关系”,就像将军不需要会用每一种武器,只需要懂战略部署。

2. 居中协调的Coordinator(调度员):AI的“联络中枢”

Coordinator是“任务分配器”,它手里有一份“Worker能力注册表”,知道哪个Worker擅长文档处理、哪个擅长网页检索、哪个擅长代码执行。收到Planner的子任务后,它会精准匹配给最合适的Worker,同时管理任务依赖和中间结果。

这里的巧妙之处在于“共享任务通道”——Worker只需要返回最终结果,不需要直接沟通,避免了智能体之间的“沟通内耗”,就像战场上的调度员通过无线电统一指挥,而非士兵之间互相喊话。

3. 领域专用的Worker(执行者):AI的“专业工匠”

Worker是高度专精的“工具人”:Web Agent擅长网页检索和浏览器模拟,Document Agent能处理PDF、图片等多模态数据,Reasoning/Coding Agent专攻逻辑推理和代码执行。

它们的核心价值是“即插即用”——要适配医疗领域,只需要新增“医疗影像分析Worker”;要处理法律文档,只需要替换“法律文本解析Worker”,而Planner和Coordinator完全不用动。

这三层架构的本质,是对人类认知的仿生:就像我们的前额叶负责规划(Planner),大脑皮层负责调度注意力(Coordinator),感官和运动系统负责专项执行(Worker)。这种分工,让每个模块都能在自己的领域深耕,而不是互相牵制。

深度拷问:为什么只训练“大脑”就够了?

OWL(Optimized Workforce Learning)的创新,比架构更具启发性——它证明了“只优化Planner,就能让整个系统脱胎换骨”。

论文中,研究者用Qwen2.5-32B-Instruct初始化Planner,通过两阶段训练:先监督微调(SFT)掌握基础拆解技能,再用直接偏好优化(DPO)强化泛化能力。最终,这个模型的GAIA准确率从36.36%飙升至52.73%,提升了16.37%,甚至在高难度Level 3任务上追上了GPT-4o。

这里的核心问题是:为什么不训练Worker,只训练Planner?

1. 能力的“杠杆效应”:Planner是整个系统的“瓶颈”——一个糟糕的任务拆解,再强的Worker也无法挽救;而一个优秀的拆解,能让普通Worker发挥最大价值。就像将军的战略失误,士兵再勇猛也赢不了战争。

2. 知识的“通用性”:任务拆解的逻辑(比如“先获取数据→再分析→最后输出”)是跨领域通用的,而Worker的技能(如医疗影像识别)是领域专用的。训练通用能力,比重复训练专用技能效率高得多。

3. 成本的“边际效益”:论文的消融实验显示,只训练Planner的准确率(45.45%)几乎接近同时训练Planner和Worker(46.68%),但计算成本却低了一个量级。这印证了一个认知规律:最高效的能力提升,往往来自核心瓶颈的突破,而非所有环节的齐头并进。

更有意思的是,SFT单独训练会导致Level 3任务性能下降3.85%,而加入DPO后不仅恢复,还提升了7.69%。这说明:纯粹的模仿(SFT)只能让Planner“按套路出牌”,而强化学习(DPO)才能让它“灵活应变”——这和人类的学习路径完全一致:从模仿到反思,才能真正掌握复杂技能。

终局观:开源AI的逆袭与通用智能的真正路径

WORKFORCE的69.70%准确率,不仅是一个数字,更是开源AI对商业系统的一次重要逆袭。在此之前,开源多智能体系统始终落后于OpenAI、Anthropic等商业巨头,而WORKFORCE首次实现了超越——它用模块化架构证明,开源社区不需要投入海量资源定制每个领域的模型,只需要搭建一个灵活的“能力整合框架”,就能整合现有工具,实现通用智能。

这预示了AI发展的一个重要方向:通用智能不是“单个模型的全能”,而是“多个专用模型的高效协作”。就像人类社会的进步,不是因为每个人都成为全才,而是因为分工越来越细、协作越来越高效。

更进一步说,WORKFORCE的架构为通用AI提供了一条可行路径:先搭建一个“通用规划+灵活调度”的核心框架,再通过“即插即用”的方式整合各领域的专用能力。这种模式,既避免了“全能模型”的巨大训练成本,又能快速适配新领域,真正实现“一次架构,全域复用”。

但我们也要清醒地看到,论文提到的局限性依然存在:系统性能依赖高质量的领域工具,在缺乏可靠工具的领域,依然会遇到瓶颈;强化学习从真实世界反馈中学习的过程,还受限于网络延迟等外部因素。这说明,通用AI的道路,不仅需要架构的创新,还需要工具生态的完善。

结语:真正的通用智能,是“整合能力”的胜利

罗马军团的强大,不在于单个士兵的战斗力,而在于模块化分工带来的适应性和效率。WORKFORCE的成功,也不在于某个智能体的性能有多强,而在于它找到了一种让专用能力高效协作的方式。

这给我们一个深刻的启示:AI的进化,正在重演人类社会的进化逻辑——从“个体全能”到“群体协作”。未来的AI,不会是一个无所不能的“超人”,而会是一个由无数专用“工匠”组成的“模块化军团”,在通用“大脑”的指挥下,高效完成各种复杂任务。

而OWL的训练范式,则告诉我们:在这个军团中,“大脑”的进化才是最关键的瓶颈。只要让规划能力不断提升,即使“工匠”的技能没有质变,整个系统的性能也会实现飞跃。

这,或许就是通用AI的真正路径——不是追求单个模型的完美,而是构建一个能让能力高效流动、快速整合的生态。

参考资料

• Hu, M., Zhou, Y., Fan, W., et al. (2025). OWL: Optimized Workforce Learning: General Multi-Agent Assistance for Real-World Task Automation. NeurIPS 2025.

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询