Agent大脑与双手解耦!Anthropic要杀死整个Harnesss赛道

旺晓通:深入浅出,轻松通晓

Anthropic 又搞出大事情了。就在 4 月 8 日,他们上线了 Claude Managed Agents 公测。

这不是又一个普通的 Agent 工具发布,而是直接把过去两年整个 Harness 赛道的生意,连根拔起了。

我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识

一、Harness 的致命缺陷:你卖的是补丁,而补丁正在过期

先给非技术读者解释一下什么是 Harness。

模型是大脑,Harness 就是手脚加神经系统。

它负责调用工具、管理上下文、处理报错、在任务跑了几十分钟之后还能接着跑。

过去两年,围绕 Claude 和 GPT 长出来了一大批做 Harness 的公司。

LangChain 做这个,OpenClaw 做这个,无数创业公司也在做这个。

这曾经是一门看起来很美的生意,因为大模型厂商只卖模型,不提供跑模型的基础设施。

但这个赛道从诞生第一天起,就有一个结构性的致命缺陷。

Harness 编码的是模型当前做不到的事,但这些假设会随着模型变强而过时。

Anthropic 在博客里举了一个非常经典的例子。

Claude Sonnet 4.5 会在感知到上下文窗口快到头时提前收工,工程师管这个叫 "context anxiety"。

解法是在 Harness 里加上 context reset。

但同一套 Harness 跑在 Opus 4.5 上,这个行为消失了,那段 context reset 的代码直接变成了拖累。

模型每进化一代,就有一批 Harness 代码变成负担。

写 Harness 的人越勤快,欠下的技术债越多。

这不是某家公司的问题,是整个 Harness 赛道的原罪:你卖的是对模型缺陷的补丁,而你的客户正在全力消除那些缺陷。

你可能会问,那有没有办法解决这个问题?

答案是有,但不是写一个更好的 Harness。

而是彻底杀死 Harness 这个概念本身。

二、Anthropic 的解法:把 Agent 拆成大脑、双手和记忆

Anthropic 给出的解决方案,简单到让人拍案。他们用了一个计算机行业用了几十年的老办法:抽象和解耦。

操作系统为什么能存活几十年?因为它把硬件虚拟化成了 "进程" 和 "文件" 这类抽象。抽象的寿命比任何一代硬件都长。

read() 命令对 1970 年代的磁盘和今天的 SSD 都能跑。

Managed Agents 做了完全一样的事。

它把 Agent 的三个核心组件彻底拆开:

• 大脑:Claude 和它的 Harness 循环

• 双手:沙箱和所有执行工具

• 记忆:记录所有事件的 Session 日志

原先这三个东西全塞在一个容器里。

容器一旦崩溃,Session 丢失,工程师要进去手动排障。

Anthropic 把这种状态叫做 "宠物"—— 需要人照顾、不能丢、一旦出问题就得蹲在旁边守着。

拆开之后,一切都变了。

容器变成了 "牛马":挂了就重启一个,Session 存在外面。

Harness 也变成了 "牛马":挂了就用 wake(SessionId) 读回事件日志继续跑。

任何一个组件可以单独崩溃、单独替换,不影响其他两个。

这个设计最妙的地方在哪里?

它把 "Harness 会过时" 这个问题,从一个致命缺陷,变成了一个系统特性。

既然 Harness 迟早会变,那我就把它做成可插拔的。

今天用 Claude Code,明天用任务专用的 Harness,后天用还没发明出来的新 Harness,都没问题。

三、最震撼的性能数据:p95 延迟下降超过 90%

解耦带来的第一个好处,是性能的飞跃式提升。

p50 首 Token 延迟下降 60%,p95 下降超过 90%。

这个数字有多夸张?

相当于原来要等 10 秒才出第一个字,现在不到 1 秒。

为什么会有这么大的提升?

因为在旧设计里,不管你用不用沙箱,每个 Session 都要先启动一个容器。

克隆仓库、初始化环境、拉取事件,这些死时间用户都得等着。

而在新设计里,容器只在需要的时候才被创建。

一个不需要写代码的纯聊天任务,根本不用等容器启动。

推理可以在 Harness 拿到 Session 日志的瞬间就开始。

解耦带来的第二个好处,是安全性的结构性解决。

旧设计里,Claude 生成的代码和系统凭证跑在同一个容器。

一次成功的 Prompt Injection,就能拿到所有 Token,为所欲为。

新设计里,沙箱永远触碰不到凭证。

Git 的 Token 在初始化时就绑定到远程,Agent 自己看不到。

第三方工具的 Token 存在安全 vault 里,通过代理调用。

Harness 对所有凭证完全无感知。

这不是打补丁式的安全改进。

这是从架构上彻底消除了整个攻击面。

四、更深层的设计哲学:Session 不是上下文窗口

我认为这篇博客里最被低估的一句话是:

"The Session is not Claude's context window" (Session 不是 Claude 的上下文窗口)

过去所有的长上下文解决方案,都在做同一件事:

在上下文窗口满了的时候,决定扔掉什么。

压缩、摘要、修剪,本质上都是不可逆的信息损失。

而你永远不知道,被你扔掉的那部分,会不会在未来某个时刻变得至关重要。

Managed Agents 的思路完全相反。

它不做任何不可逆的决定。

所有发生过的事情,都完整地保存在 Session 日志里。

Claude 需要什么,就从 Session 里拿什么。

它可以从头读到尾,可以倒回去看某个事件的前因后果,可以只看最近的几条。

甚至可以在把事件传给 Claude 之前,做任意的转换和组织。

比如为了提高缓存命中率重新排版,或者根据任务类型过滤无关信息。

这个设计的前瞻性怎么强调都不为过。

我们不知道未来的模型会需要什么样的上下文管理策略。

但我们知道,只要有完整的原始数据,任何策略都可以实现。

反过来,如果原始数据被不可逆地修改了,那就什么都晚了。

五、行业地震:谁的冬天来了,谁的春天来了

这次发布对整个 AI 行业的影响,怎么估计都不过分。

对企业用户来说,这绝对是好消息。

原来搭一个生产级的 Agent,需要几个工程师干几个月。

现在几天就能从原型到上线。

沙箱、Session 管理、错误恢复、权限控制,全部不用自己管。

早期用户里,Rakuten 在一周内给产品、销售、财务、HR 各部署了一个 Agent。

Sentry 原本预估几个月的集成,几周就上线了。

但对做 Agent 基础设施的团队来说,这是一个明确的死亡信号。

平台层在向上扩张。

不是第一次,也不会是最后一次。

LangChain 当年的处境,今天轮到了所有 Harness 厂商。

更狠的是,Anthropic 在发布前四天,刚刚宣布 Claude Pro 和 Max 订阅用户不能再用订阅额度跑 OpenClaw 这类第三方 Agent 框架。

先把第三方 Harness 的廉价用量断掉,再推出自己的托管方案。

两步棋,环环相扣。

企业客户一旦把 Agent 跑在 Anthropic 托管的基础设施上,数据管道、监控配置、操作流程都会嵌进日常工作。

迁移成本会持续上升。

这是企业软件里最经典的锁定逻辑。

六、结尾:所有成功的系统,最终都会走向操作系统化

这篇文章最核心的价值,不是提出了一个新的 Agent 框架。

而是证明了一个朴素的道理:所有成功的系统,最终都会走向操作系统化。

操作系统的本质是什么?是定义一组稳定的抽象接口。让上层应用不用关心底层硬件的变化。让今天写的程序,十年后还能跑。

Managed Agents 就是 Agent 的操作系统。它不关心你用什么 Harness,不关心你跑在什么硬件上,不关心你连接什么工具。

它只定义三个最基本的抽象:Session、Harness 和 Sandbox。只要这三个接口不变,整个系统就能一直演进下去。

Anthropic 在博客的最后说:

"我们对接口的形态有主见,但对 Claude 将来需要什么具体的 Harness 没有主见。"

读起来是技术上的谦逊,但做到这一点的前提,是他们已经控制了接口本身。

过去,我们为模型写 Harness,未来,模型会为我们写 Harness。

而 Anthropic,已经提前站在了那个未来的入口。

参考资料

• Anthropic, Scaling Managed Agents: Decoupling the brain from the hands, https://www.anthropic.com/engineering/managed-Agents

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询