OneManCompany框架晓读:Agent从打工人变成公司老板,成功率+15%

旺晓通:深入浅出,轻松通晓

你有没有发现,过去两年我们讨论AI的威胁时,总在关注一个点:它会取代哪个岗位?程序员?插画师?翻译?

但读完这篇华为、伦敦大学学院、利物浦大学最新论文(https://huggingface.co/papers/2604.22446 请 Upvote),我突然意识到我们可能一直焦虑错了方向。

我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识

这个叫OneManCompany(简称OMC)的系统,做的事很简单:它不是一个Agent,而是一群Agent组成的公司。有CEO(人类)、有HR、有COO、有基层员工。

不是比喻意义上的“像”,是字面意义上运作,招聘、述职、开会、复盘项目、给表现不好的员工PIP(绩效改进计划)。做得不好?解雇,从人才市场上招个新的。

而这篇论文的实验结果很惊艳:在软件项目的PRDBench测试集上,这家AI公司的成功率是84.67%,比最先进的单人模式高出至少15个百分点。

这意味着什么?不是某个AI很强,是一群被“管理”起来的AI团队,碾压了孤狼式最高配的AI。

那一刻我突然明白了:原来威胁不在于机器某个单项技能超越你,而在于它们学会了我们人类最引以为傲的能力:组织和协作。

大公司病与“光杆司令”:现在AI面临的问题,人类早就经历过

在说这个系统怎么工作之前,我想先跟你分享一个生活场景。

你有没有经历过那种项目推进时的“人手不够”困境?比如你是一个全栈程序员,接了个大活。客户说“把整个电商平台重做”,你说“行”。然后你开始写前端、写后端、配数据库、搞SEO、写测试……但你只有一个人,脑子再快也扛不住任务堆叠。

现在的大模型就处于这个阶段。Claude代码能力很强,GPT文本处理很厉害,Gemini Nano Banana会画画,但它们是“光杆司令”——你给一个任务,它吭哧吭哧自己干,所有步骤自己做,所有错误自己兜底。一旦任务超过单一认知能力的边界(比如你让它同时做架构设计、底层代码、前端交互),性能就开始坍塌。

现有的一些多AI协作框架解决过这个问题——比如AutoGen、CrewAI之类的,允许你手动拼几个AI进来分工。但问题也明显:团队得提前定好,中途不能换人;所有AI必须用同一套技术栈(比如都是基于某个封闭平台的API);而且任务做完就没了,下次开新项目,从头再来一遍。

这篇论文的团队发现了一个本质缺陷:现在的AI协作,只解决了“沟通”问题,没解决“管理”问题。

这让我想起组织行为学里的一个经典论断:两个人合作靠信任,二十个人合作靠制度。之前的AI协作最多停留在“两三个AI加个群聊”的水平,没有任何组织层面的设计。

OMC做的事情,就是给这帮AI加上了一层“企业管理软件”。

从“装技能”到“雇员工”:一次关于能力的认知升级

在深入了解OMC如何给AI“办入职”之前,我们得先聊一个更根本的认知跃迁。这也解释了为什么此前所有AI协作都面临一个隐形的天花板。

我们之前习惯用“技能(Skill)”来思考AI的边界。比如,一个AI Agent可以调用天气查询技能、代码生成技能、画图技能——这就像一个工匠,身上挂满了各种扳手和螺丝刀。当下流行的“技能市场”(Skill Marketplace),本质上就是一个巨大的能力库。你需要什么能力,就去下载一个插件装上。

这听起来很高效,但它只回答了一个问题:“这个AI能做什么?”

而OneManCompany的论文团队发现,一个合格的“员工”需要回答的问题,远不止于此。他们能做什么(技能),他们该做什么(角色),他们如何与别人配合(协作规范),以及他们如何越做越好(成长记录)——这些共同构成了一个完整的职业身份。

于是,论文提出了一个关键的概念升级:将“技能(Skill)”封装为“人才(Talent)”。

这绝不仅仅是术语的改变。技能是工具性的,而人才是身份性的。一个“人才”包,就像一个AI的完整员工档案,里面不但包含了它需要的所有技能脚本和工具包,更重要的是,它内置了系统提示词(它的职业性格)、工作原则(它的做事信条),甚至还有能跟着它走的“历史经验”。

这就像你从工具市场买回一个冲击钻,和在人才市场签下一位二十年经验的老师傅,是完全不同的两码事。冲击钻会在任何人手里发挥同样的功效,但老师傅知道哪里最容易出问题、什么时候该换一个巧劲,这需要组织的管理和持续的项目锻炼才能形成。

正因为有了这种封装,AI的能力才从“一次性耗材”变成了“可增值资产”。一个被招聘进来的“高级前端工程师”AI,在完成十个项目后,它的“人才档案”里会积累出几十条独属于它的“避坑指南”和工作原则反思。如果它只是调用了十次代码生成“技能”,项目结束后,除了消耗的Token,什么都不会留下。但作为一个“人才”,它的每一次成功与失败,都在塑造一个更老练的数字员工。

将“技能”升级为“人才”,OMC完成了一件很微妙的事:它把AI生态的叙事,从冷冰冰的“能力调用”,拉回到了我们熟悉的“组织行为学”范畴。它的前置问题是:你缺的不是一把更快的螺丝刀,而是一个活生生的、可以被激励、被评估、被要求写总结的员工。

而接下来的问题自然就是:这样的“人才”上哪儿去找?这便引出了OMC那个极具未来感的设计——数字人才市场。

从“员工档案”到“人才市场”:AI学会了投简历

OMC的一个核心创新,我称之为“给AI办入职”。

在传统的AI系统里,一个AI是什么角色,靠一段prompt(提示词)描述——“你是一个有10年经验的Python工程师”。这是“口头宣称”的能力。问题是,AI是会幻觉的。它说它懂你的框架,可能只是见过类似的名字。

OMC提出了一套“人才(Talent)-容器(Container)”分工架构。这个设计的精妙之处,让我想到一个职场的隐喻——

对于一个做内容的人,做内容的能力(写作、策划、找选题眼)是“人才”层,是个人不可剥夺的认知身份。用Mac还是Windows,用某个排版软件还是另一个,这是“容器”层。容器可以换,但人专业判断力不变。

OMC的AI员工也是这样设计的:每个AI的“人才”部分是一组固定资源:系统prompt、专业技能脚本、工具权限、历史经验的总结反思(这个很重要,后面说)。“容器”是它的执行环境:是基于Claude底层模型,还是LangGraph框架,还是Gemini API?企业层面完全不管,接口统一。这意味着,同样一个“高级前端工程师”AI,可以在Claude Code环境中跑,也可以在Gemini环境中孵化,而它的“认知身份”不受影响。

然后,更有意思的部分来了。

为了不让系统自己幻觉出“假装很专业”的AI员工,OMC做了一个“数字人才市场”(Talent Market)。市场里的每个“候选人”不是靠简历吹牛,而是有真实社区验证的——你上传过一个AI Agent,它通过了一些测试基准的验证,有明确的工具调用记录和成功率数据。

当一个项目需求触发“缺人”信号(比如要做视频,但当前团队没有音视频剪辑人员),HR-AI会去市场搜索、按技能匹配度排序、给人类CEO递一个候选人短名单。CEO点击批准,这个AI被自动分配容器、分配工具权限、赋予办公桌(是的,系统里有虚拟办公桌),然后开始干活。

你看出这里面的哲学转向了吗?过去的AI生态讲的是“工具集成”——你有100种插件,你用哪个装哪个。而OMC讲的是“组织构建”,你缺的不是技能,是人才。技能内化在人才身上,人才能用组织流程管理起来。

这让我想到德鲁克那句老话,大意是:管理的本质,是激发和释放每个人的善意和潜能。OMC用一套严格的接口协议和状态追踪,模拟出了“潜能”的连接方式。

任务不是分配的,是“长出来的”

如果说“人才市场”解决的是“谁来做”,那第二部分解决的就是“怎么做”的问题。这是我读这篇论文时最有启发的部分。

在人类公司里,一个项目来了,通常怎么分解任务?要么是项目经理预先画出WBS(工作分解结构),要么是团队成员自己协商。但AI公司面对的是“Wild Dynamic Agentic Workflow”(全动态智能体工作流)——团队是动态组建的,成员的技术栈完全不同,项目的分解方式在开始那一刻也是未知的。

OMC的解法,是一种叫“E²R树搜索”(Explore-Execute-Review)的东西。

OMC的系统里面,一个CEO给COO下达任务:“做一款街机格斗游戏”。COO不会提前画出一个完整的甘特图,而是启动一棵任务树:先分出游戏设计(Game Design)、美术资源制作(Art Assets)、引擎实现(Coding)三个子任务,指派或招聘相应的人。每个负责人收到任务后,又可以继续分解。

真正厉害的设计是“Review”环节。在OMC的系统里,一个子任务完成之后,必须经过上级的显式验收决策(通过/打回),不能自动流转。这个看似简单的约束,实际解决了之前多AI协作最致命的问题:AI会幻觉瞎说,并且瞎说的结果会被下游自动继承。

举个真实案例。在论文报告的“游戏开发测试”里,负责美术的AI(Gemini模型)第一次生成了一组角色动作帧(idle、walk、kick)。但在验收评审中发现角色精灵图没有做切割,所有动作挤在同一张图里,导致游戏中根本无法正确渲染。

传统系统怎么办?程序员接到错误素材,也得硬着头皮拼进去,出问题之后再回溯。但在OMC的理念下,Review信号“拒绝”了美术结果,COO重新探索了一轮解决路径——不是简单让AI重做,而是写了一个“精灵图切片工具”的新技能,部署到美术AI的工具箱里,然后重新执行。

就像现实中的技术主管发现某个设计师不会用选区工具,不是骂他,而是拉他学一遍快速蒙版再回来改稿。

这消除了我之前一个根深蒂固的担忧:AI系统的组合错误会像多米诺骨牌一样不可逆坍塌。而OMC的解法,其实是我们人类组织中最古老也最有效的机制:逐级确认+技能补位。

AI会写年终总结,还会被裁员

如果说前面两部分还在我预期之内(虽然实现很漂亮),读到第三部分时,我真的有点出神。

论文的第三支柱叫“自我进化(Self-Evolution)”,分个人层面和组织层面。

个人层面,每个AI员工在完成一项任务后,会对自己刚才的执行轨迹进行反思——我哪里做对了,哪里走了弯路,有什么经验可以形成一条工作原则(Working Principle)写入我的“人才档案”里?

CEO定期会和AI员工一对一“面谈”(其实就是输入一段反馈,触发AI的自我修订流程)。这让我想起那种特别善于总结的人,每次做完项目都在自己的笔记本上补充一条“避坑指南”。下一次,当这个AI被分配新任务时,它的上下文会包含这些反思经验,性能会持续变好。不需要重新训练底层模型。

但真正让我恍惚的是组织层面的进化。

OMC设计了一套完整的人力资源流程:每三个项目后,系统HR自动发起对所有参与员工的季度考核。考什么?任务完成质量、审核通过率、协作有效性。连续三期考核不过?进入PIP(绩效改进计划),系统会分配更简单的工作,加大监督频率。再失败?HR自动终结这个AI的位置——回收容器、释放办公桌、标记人才缺口并回到人才市场上招聘替代者。

高绩效者留存并积累经验,低绩效者被替换。整个组织因此越来越高效。

读到这儿,我感觉自己不是在读一篇AI论文,而是在看现代企业的管理学教材。你仔细想想,这不就是泰勒的科学管理+20世纪的绩效主义体系吗?只不过这一切发生在AI之间,没有人类的情绪、不甘和博弈。

这也突然触动了我一个更深的思考。萨特说,“他者即地狱”。我们人的自我意识,很大程度上是在他人的观察和评判中形成的。而OMC里AI们的“自我意识”(虽然谈不上真的意识),也同样是在组织结构和他者审视中成型的——你的工作任务被上级评审,你的年终总结被HR归档,你的失败记录会触发组织去市场上寻找更合适的人。

这太像人类社会的运作方式了。而它高效运转本身,说明这套“组织-审视-调整”的机制,不依赖于创造力和灵魂——它只依赖自洽的反馈回路。

我们焦虑错了:该担心的不是“AI取代员工”,而是“AI取代老板”

回到文章开头的那个观点。

这场实验让我深刻地意识到:技术的最高形态,从来不是模仿人的某项能力,而是复制人之所以为人的组织结构。

这篇论文最核心的贡献,不是提出了一个新的多Agent框架,而是开辟了一个全新的研究方向——AI组织学。当AI学会了像人类一样开公司,真正的生产力革命,才刚刚开始。

一个Claude是强,但它是散兵游勇。一家OneManCompany是体系作战——它能分解、评审、学习、招人、开人。时间越长,组织积累的经验越多,个体再强也无法对抗一个持续进化的组织。

我们之前焦虑AI会替代基层岗位。但现在我发现更值得思考的问题可能是:如果有一天,AI组织的效能使得人类管理者从“裁决者”变成“点头工具”,我们将会面对什么样的人机关系?

OMC的论文里,人类CEO唯一的职能是:审批招聘名单、发出目标指令、必要时触发项目迭代、控制总预算。换句话说,人类角色退守到了三个地方:战略意图的定义、资源的占位符、以及为法律后果兜底的名字。

其他一切:任务拆解、协调沟通、质量检验、绩效评估、人才优化,全部闭环给了AI组织自己。

这让我想到霍布斯在《利维坦》里写的:一群人通过契约将权力交给一个虚拟人格,利维坦诞生。OMC所创造的这个“一人公司”,其运转原理在某种意义上就是一个小型利维坦——只不过协约不是人与人之间签的,是人类CEO与可拆卸、可替换、可自我进化的AI单元之间签的。

而一旦这样的利维坦不止一个,未来的竞争,就不再是人和AI的竞争,也不是AI和AI的竞争,而是人类领导的AI公司和AI公司之间的竞争。

我们与技术之间,一定还存在更复杂的关系

这篇论文用一个84.67%的数字告诉我:团队的威力,大于个人。而人类有生以来伟大的发明——组织这件事本身——正在被代码重新实现。

当然,这篇论文也有明显的局限性。它的实验目前只在软件工程项目(PRDBench)上进行了定量验证,跨领域的案例(游戏、内容写作、研究综述、视频制作)还是定性的demo。人才市场上可招募的AI目前也有限,全靠早期社区贡献——换句话说,这个“利维坦”能吃的食物种类还很少。

但我更在意的,是这篇论文让人隐约感觉到的未来走向——

当AI之间的雇佣和管理都不再需要人类介入,只有顶层的那一个“意图”属于你时,你究竟是AI的主导,还是AI提供服务的末端?

参考资料

标题:From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company

作者:Zhengxu Yu, Yu Fu, Zhiyuan He, Yuxuan Huang, Lee Ka Yiu, Meng Fang, Weilin Luo, Jun Wang

单位:华为诺亚方舟实验室、伦敦大学学院、利物浦大学

链接:https://one-man-company.com

链接:https://huggingface.co/papers/2604.22446

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询