揭秘未来3年Harness发展轨迹:所有智能体都将被代码“套牢”

旺晓通:深入浅出,轻松通晓

最近读到一篇最新论文 《Code as Agent Harness》,来自UIUC、Meta和斯坦福联合出品的深度报告。说实话,一开始我以为它又是在讲“用代码写AI程序”这类老生常谈。但读到第三页,我发现它其实在讲一个更本质的问题:

我们过去几年疯狂卷模型的能力(脑子),却几乎没人认真想过,连接模型和真实世界的那层"骨架"该怎么设计。

你可能要问了:不就是API调用和执行环境吗?这有什么好讨论的?

我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识

这就是让我感到震撼的地方——代码在智能体中的角色,正在经历一场身份革命。

代码曾经是"产品",现在变成了"介质"

论文里有一个表述,我读了第二遍才真正理解其分量:"代码不再只是智能体生成的目标产物,而日益成为智能体推理、行动、环境建模和执行验证的操作基础。"

翻译一下:以前我们让AI写代码,代码是终点——"你写出来就行了"。但现在,代码正在变成AI思考和行动的过程本身。

这区别有多大?

就像一个人学做饭。传统方式是背菜谱,然后照着做,做出来的菜就是"产品"。但如果你把切菜、调味、翻炒这些动作本身,当成思考和决策的媒介呢?你一边切菜一边判断火候,一边调味一边修正策略——做菜的过程成了你"思考"的外化。

代码对于AI Agent,正在从"菜"变成"厨房"。

论文把这种角色转变分成了三个层次来梳理:

第一层,代码作为推理的接口。以前的链式思考(Chain-of-Thought)全是在自然语言里进行的——模型用文字一步步推导。但你有没有发现,大模型在纯文字推理中经常犯低级计算错误?因为它本质上是在"脑算",没有草稿纸。而"代码辅助推理"的做法是:让模型把中间计算交给Python解释器,自己只负责"想清楚思路"。这就好比一个数学家不再心算微积分,而是把繁琐的推导交给Mathematica,自己专注于更高层次的证明策略。

第二层,代码作为行动的接口。当AI要操控机器人、点击GUI界面、调用软件工具时,代码就成了将"意图"转化为"可执行操作"的桥梁。不是模型直接"想"一个动作,而是生成一段程序化的策略,由运行环境去执行。

第三层,代码作为环境建模的接口。仓库状态、执行轨迹、测试用例、运行时反馈——这些都不再是辅助信息,而是构成Agent"世界模型"的基本单元。代码状态本身,就成了环境。

读到这里,我脑子里蹦出一个画面:黑客帝国里的Neo第一次看到Matrix的源代码——世界在他眼中不再是表象,而是流动的绿色字符。AI Agent正在经历类似的事情:代码不再是它操作的对象,而是它感知世界的感官。

智能体的控制中枢:计划-执行-验证循环

有了代码作为基础,论文接下来介绍了智能体框架的五大核心机制。其中最重要的,就是被称为"控制中枢"的计划-执行-验证(Plan-Execute-Verify,PEV)循环。

这个循环听起来非常简单:

1. 计划:把大目标分解成小步骤,明确每个步骤要做什么,怎么验证是否成功

2. 执行:在沙箱环境中执行计划,记录所有的中间结果和错误

3. 验证:检查执行结果是否符合预期,如果不符合,回到计划阶段修改

但就是这个简单的循环,却是所有可靠智能体的基础。90%的智能体失败,都不是因为模型不够聪明,而是因为没有正确实现这个循环。

很多人做的智能体,只有"计划"和"执行",没有"验证"。它们一次性生成所有的代码,然后直接运行,不管结果对不对。这就像一个学生写完作业不检查,直接交上去,错误率当然很高。

而一个好的PEV循环,会在每一个小步骤之后都进行验证。比如修改了一个函数之后,立刻运行对应的单元测试;点击了一个按钮之后,立刻检查页面是否跳转到了正确的地方;执行了一个命令之后,立刻检查输出是否符合预期。

这让我想到了软件开发中的"测试驱动开发"(TDD)。先写测试,再写代码,写完代码立刻运行测试。这种方法虽然看起来慢,但实际上能大大提高代码的质量和开发效率。智能体的PEV循环,本质上就是把TDD的思想应用到了AI决策过程中。

从单个智能体到多智能体团队

当任务变得足够复杂时,单个智能体就不够用了。这时候就需要多个智能体分工协作,组成一个"AI团队"。

论文里介绍了很多多智能体系统的设计,比如ChatDev、MetaGPT、AgentCoder等等。这些系统把软件开发的流程分解成不同的角色:产品经理、架构师、程序员、测试工程师、项目经理。每个角色由一个专门的智能体担任,它们通过交换代码和文档来协作。

这和人类的软件开发团队几乎一模一样。而且论文的实验结果表明,一个设计良好的多智能体团队,表现远远超过任何单个智能体。即使每个智能体用的都是同一个基础模型,分工协作之后的整体能力也会有质的提升。

这其实是一个非常深刻的道理:能力的上限不是由单个个体的智力决定的,而是由组织的结构决定的。

Agent框架和应用将开始发力

过去的五年,所有人都在卷模型。我们把模型的参数从十亿级做到了万亿级,把上下文窗口从几千做到了几百万。但现在,模型的能力已经足够强大了。

这就像20世纪80年代的个人电脑革命。当时CPU的性能已经足够强大了,但真正让个人电脑普及的,是Windows操作系统和各种各样的应用软件。没有操作系统,再强大的CPU也只是一块废铁。

今天的AI就处在那个节点上。我们已经有了足够强大的"CPU"(大模型),现在我们需要的是"操作系统"(智能体框架)和"应用软件"(各种垂直领域的智能体)。

论文的最后列出了七个开放问题,从评估方法到安全治理,从多智能体协作到自我进化,这些都是未来Agent框架可以发力的方向。

结尾:代码是经验的传承

现在,AI正在学习用代码来思考、行动和理解世界。这不是AI取代人类,而是人类把自己积累的经验,通过代码这个媒介,传递给了AI。

未来的智能体,将是人类经验和机器算力的完美结合。人类提供知识、逻辑和价值观,机器提供算力、记忆力和执行力。而连接它们的,就是代码。

参考资料:

• Code as Agent Harness, https://arxiv.org/pdf/2605.18747

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询