阿里通义最新Trace2Skill解读:Agent技能自动生成新范式
阿里通义又扔出了Agent领域的重磅论文。这次他们直接捅破了行业最大的痛点:LLM Agent的规模化落地,卡死在了技能生产上。
看完这篇Trace2Skill,Agent技能的工业化量产时代,真的要来了。
我们解读最新技术,文末有相关信息。


作者:张长旺,图源:旺知识
先搞懂:Agent行业的死穴,到底在哪?
说白了,Agent技能就像老员工的标准化作业SOP手册。
里面写清了特定领域的干活步骤、常见坑、避坑指南,是Agent搞定复杂任务的核心依仗。
但现在,这个SOP的生产,全行业都卡在了三个死胡同里。
第一个死胡同:人工写SOP,规模化彻底没戏。
一个垂直场景就要专家写一套SOP,慢、贵、还极度挑模型。
论文里有个扎心的例子:Anthropic官方专家写的Excel技能,给122B大模型用,准确率涨了20个点;给35B小模型用,反而比不用技能效果还差,直接负收益。
这就像给博士生写的操作手册,给本科生用,越看越懵,根本干不好活。
第二个死胡同:自动生成的SOP,要么没用,要么越用越乱。
纯靠大模型参数知识写的SOP,全是正确的废话,和不用技能的效果几乎没差。

而现在主流的在线更新方案,是来一个任务改一次SOP,就像新员工干一次活改一次手册,改到最后手册碎片化、前后矛盾,几百个零散技能,检索都检索不过来,还严重过拟合,换个任务就彻底废了。
第三个死胡同:经验复用离不开检索,天生不通用。
比如主流的ReasoningBank方案,把每次的经验存起来,干活前先检索相关记录。
这就像员工干活前先翻几百条历史聊天记录找经验,不仅慢,还极度依赖模型的检索能力,小模型根本用不了,换个场景就搜不到有用的内容。
而阿里这篇Trace2Skill,直接把这三个行业顽疾,一锅端了。
Trace2Skill的核心创新:完全复刻人类专家写SOP的逻辑
现有方案是新员工边干边改手册,干一次改一次,越改越乱;

而Trace2Skill是资深专家先看完几百次干活记录,归纳出通用规律,再写一本统一、全面的SOP。
它的核心逻辑,就三步:

第一步:批量跑任务,攒够足量的「干活记录」
先让Agent用初始SOP(不管是人工写的,还是大模型瞎写的草稿),并行批量跑几百个任务。
成功的、失败的执行过程全记录下来,哪步做对了,哪个坑踩了,根因是什么,全留痕。

这个过程完全并行,效率极高:200条完整轨迹,122B大模型跑,不到2个GPU小时就能搞定。
第二步:并行复盘,每条记录都有专属分析师提修改意见
这一步是它和现有方案最核心的区别:不是一个人看所有记录,而是开一堆并行的子智能体。
每个子智能体只看一条执行轨迹,互不干扰,完全并行:
• 成功的轨迹,就提炼「这次干成了,核心做对了什么可复用的动作」;
• 失败的轨迹,就像法医一样,刨根问底找根因——它能调用工具看原始文件、对比标准答案、验证修复方案,必须找到实锤的根因,不然不算数。
每个子智能体最终都会输出一条针对SOP的修改补丁,所有补丁完全独立,不会提前收敛,完整保留了所有有效信息。
第三步:专家统稿,无冲突合并成最终的通用SOP
这一步是它能产出可迁移技能的核心:不是一条一条改SOP,而是一次性把几百条补丁全看完。
通过分层合并,做两件核心的事:
1. 归纳通用规律:优先保留反复出现在几百条补丁里的共性问题,提炼成强制的通用规则,比如几百次踩坑的「Excel公式写了必须重算」,直接放在SOP最前面;
2. 过滤噪音+层级管理:删掉偶发的个例内容,解决补丁之间的矛盾,冷门的边缘坑,统一放到附录的参考文件里,不干扰主流程。
这个过程,本质就是从特殊到一般的归纳推理,和人类专家提炼方法论的逻辑完全一致。

它还支持两种核心模式:既可以给人工写的SOP做深化优化,也可以从大模型写的废话草稿里,从零生成一套能用的高质量SOP,完全不用人工介入。
我觉得这个设计最妙的地方,就是它彻底纠正了现有方案的顺序错误:
先有全局视野,再动笔写SOP,而不是边干边改,最终越改越偏。
实验结果:颠覆你对大模型能力的固有认知

最颠覆的发现:小模型炼的技能,能反向给大模型逆天提分
所有人的固有认知,都是大模型给小模型赋能。
但Trace2Skill直接打破了这个规律:35B小模型蒸馏出来的技能,给122B大模型用,在WikiTableQuestions分布外任务上,直接暴涨了57.65个绝对百分点,准确率干到81.38%,比Anthropic官方人工写的技能还要高6.7个点。

而且这个技能,不用微调模型,不用外挂检索模块,就是纯文本的markdown文件,直接塞到系统提示里就能用。
跨模型、跨场景全通用,完全没有额外依赖。
核心效果数据:全场景吊打现有方案
1. 核心表格任务:把人工SOP的负收益,直接拉成暴涨
人工写的Excel技能,122B用准确率48.33%,Trace2Skill深化后直接干到69.83%,涨了21.5个点;
35B用人工SOP准确率只有9.67%,比不用技能还烂,深化后直接干到29.67%,暴涨20个点,直接把负收益拉成了翻倍增长。
2. 全领域通用:数学、视觉任务全好使
数学推理上,炼出来的技能,给122B用,竞赛级AIME 2026任务涨了2.9个点,给35B用直接涨了5个点;

DocVQA视觉问答上,122B炼的技能,给35B用,核心ANLS指标涨了0.1554,准确率直接涨了13.6个点。

3. 效率和效果,双杀现有方案
• 比顺序在线更新:122B模型上准确率高4-6.8个点,速度快了20倍,3分钟就能搞定,顺序更新要1个小时;
• 比检索式ReasoningBank:122B模型准确率高13.8个点,35B模型高9.2个点,还完全不用外挂检索库,小模型也能用;
• 比单轮LLM错误分析:平均效果高了12个百分点,根因找的更准,提炼的规则更通用。
你可能会问,为什么它能跨模型通用?
其实和人类的学习逻辑完全一致:你从几百次实践里提炼的通用方法论,不仅你自己能用,给别人用也一样好使,因为它抓住了事情的本质,而不是你个人的习惯。
底层逻辑:它把经验,变成了可迁移的认知
很多人会好奇,为什么纯文本的SOP,能带来这么大的提升?
核心就四个底层逻辑,每一个都戳中了现有方案的本质缺陷。
第一,并行全局分析,彻底避免了顺序更新的漂移和过拟合。
顺序更新就像你写文章,写一句改一句,改到最后完全偏离初衷,还会过度拟合最近的一次经验;而Trace2Skill是先看完所有素材,有了全局认知再动笔,自然能抓住共性,过滤掉噪音,不会被单次个例带偏。

第二,归纳推理的分层合并,把局部经验蒸馏成了通用规律。
它的合并过程,不是简单的复制粘贴,而是优先保留反复出现的共性问题。几百条轨迹都踩的坑,一定是这个领域的核心问题,提炼出来的规则自然通用;而只出现一两次的个例,就放到附录里,不会干扰主流程。
第三,带验证的Agentic错误分析,每一条修改都有实锤根因。
之前的方案,看一眼失败日志就给结论,经常把表象当根因;而Trace2Skill的错误分析智能体,能反复调用工具、验证修复方案,必须找到真正的根因,不然不算数。这样提炼出来的规则,才是真的能解决问题的,而不是正确的废话。
第四,纯声明式的无依赖设计,天生具备跨模型迁移能力。
它炼出来的技能,就是纯文本的SOP,没有和特定模型的参数、特定的检索系统绑定。就像一本纸质的操作手册,不管是谁,只要能看懂字,就能照着做,自然什么模型都能用,什么场景都能套。
说白了,Trace2Skill真正做到了:把Agent的「执行经验」,转化成了「可复制、可迁移的认知能力」,而不是死记硬背的碎片化记忆。
工程落地价值:直接把Agent推进工业化量产时代
这篇论文最狠的地方,从来都不是算法上的炫技,而是它直接解决了Agent落地最大的工程难题。

第一,彻底解决了技能规模化生产的瓶颈。
之前Agent落地,最大的成本就是技能的人工生产,一个场景一套SOP,根本没法规模化。现在Trace2Skill,只要给一批任务,就能自动从零生成高质量技能,35B开源模型就能搞定,不用依赖闭源大模型,成本直接打穿地板。
第二,抹平了跨模型适配的成本。
之前人工写的技能挑模型,大模型能用,小模型用不了。现在Trace2Skill炼的技能,天生跨模型,小模型炼的大模型能用,大模型炼的小模型也能用,Agent的开发效率直接拉满。
第三,零额外依赖,落地门槛几乎为零。
它的输出就是标准的Anthropic格式技能目录,一个markdown主文件+辅助脚本,直接插到现有的Agent系统里就能用,不用改架构,不用加检索模块,不用微调模型,只要你的Agent能读系统提示,就能用。
第四,彻底打开了端侧Agent的想象空间。
之前的经验复用方案,要么需要大模型,要么需要外挂检索,端侧小模型根本用不了。现在Trace2Skill用35B开源模型就能炼技能,炼出来的技能,更小的端侧模型也能用,直接给端侧Agent装上了专业的SOP,端侧智能的天花板直接被拉高了。
我的判断是:这个技术,直接把Agent技能的生产,从「手工作坊时代」,推进到了「工业化量产时代」。
Agent在垂直行业的规模化落地,最大的拦路虎,被干掉了。
结尾
这篇论文最核心的价值,从来都不是提出了一个新的Agent框架,而是彻底重构了Agent技能的生产范式。
过去大家都在卷「怎么让Agent边干边学」,而Trace2Skill告诉我们,真正高效的方式,是「先批量实践,再全局归纳,最后提炼成通用技能」——这才是人类学习的本质,也是Agent技能规模化的唯一出路。
这篇论文给我最大的启发,其实是一个最朴素的认知规律:
真正可迁移的能力,从来都不是碎片化的经验,而是从海量实践里归纳出来的底层规律。

不管是AI Agent,还是人自己的成长,都是一样的:你干了100件事,核心不是把100件事的细节全记住,而是从这100件事里,提炼出一套通用的做事方法论。这套方法论,才是你能带走、能复用、能搞定新问题的核心能力。
死记硬背经验的,永远只能在熟悉的场景里打转;
提炼出底层规律的,才能在未知的世界里通行。
Trace2Skill给Agent装上的,从来都不是一本厚厚的错题本,而是一套能举一反三的认知方法论。
参考资料
• Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills, https://arxiv.org/pdf/2603.25158