学会“吃一堑长一智”,性能飙升11%!XSKILL让AI积累经验和技能

为什么AI智能体每次遇到相似问题时都要从头摸索,明明上次已经找到解决方案了?

人类会从过往经历中学习,AI为什么不行?

XSKILL给出了答案:让AI像人一样,同时积累经验和技能,形成持续学习的能力。

XSKILL框架首次将任务级技能与动作级经验统一到双流设计中,通过视觉接地的方式提取和检索知识,让多模态智能体在不更新参数的情况下持续进化。

实验证明,该方法在多个基准测试上带来显著的性能提升。

经验与技能的双流设计

多模态大语言模型已经让智能体从被动的感知系统转变为主动的问题解决者。

它们可以处理视觉信息、执行代码、检索网络信息,应对复杂的推理任务。

但当前的多模态智能体仍然面临两个根本性瓶颈:工具使用效率低下,工具编排缺乏灵活性。

简单问题上,智能体往往耗费过多步骤;复杂查询时,又难以进行足够深入的多轮探索。

现有系统大多局限于单路径执行,跨任务组合工具的能力有限。

更关键的是,冻结的后训练骨干模型在面对新任务或工具集更新时,缺乏有效的持续改进机制。

人类的做法不同。

我们会从两种互补的知识形式中持续学习:经验和技能。

经验捕捉从过往尝试中提炼的简洁指导,帮助优化局部决策,比如工具选择、探索策略、错误恢复。

技能则编码更结构化的可复用流程,支持跨相关任务的高层规划和工具编排。

XSKILL正是借鉴这一思路,为多模态智能体设计了一套双流持续学习框架。

该框架将知识分为两层:技能和经验。

技能以Markdown文档形式存储在技能库中,提供任务级指导,包含结构化工作流和可复用工具模板。

经验以JSON格式存储在经验库中,提供动作级洞察,记录触发条件、推荐动作和语义嵌入向量。

两者相互配合,技能保障执行的稳健性,经验引导策略性选择。

以一个实际任务为例:用户要求识别图片中吉祥物的原型。

没有XSKILL的智能体直接搜索,发现问题后陷入困境——图片是倒置的,但智能体没有纠正。

有XSKILL的智能体则先调用相关经验,发现图像过暗或倒置时的处理策略,再链接到技能片段中关于旋转和裁剪的工具模板,生成接地气的执行计划,最终成功识别。

经验告诉你什么时候该做什么,技能告诉你具体怎么做。

从轨迹中提炼智慧

XSKILL的工作分为两个阶段:积累阶段和推理阶段。

积累阶段负责从多路径轨迹中提取技能和经验,推理阶段则在实际任务中检索和适配这些知识。

在积累阶段,系统为每个训练任务执行多次独立推理,生成一组轨迹。

面对长上下文的多模态输入,系统采用视觉接地的轨迹摘要方法。

多模态大语言模型接收交错的图像观察和轨迹文本,分析每张图像与其局部生成上下文的关联,包括工具调用、中间输出和任务需求。

摘要不仅记录采取了什么动作,还记录什么视觉证据触发了该动作,以及该证据如何影响后续决策。

例如,系统可能识别出倒置的图像触发了旋转操作,低对比度引发了图像增强。

这些分析被整合到摘要中,保留视觉状态与推理决策之间的联系。

同时,技能提取模块从成功轨迹中抽象出技能片段,工作流提取识别结构化序列,工具模板提取捕捉可复用代码模式。具体实体被替换为变量占位符,确保跨任务泛化。

跨轨迹批判机制进一步从多条轨迹中提炼泛化知识。

给定轨迹摘要、真实答案和推理过程中使用的经验,多模态大语言模型对成功和失败轨迹进行对比分析,识别结果背后的因果因素。

批判输出结构化的经验更新操作,包括添加新经验和修改现有经验。每条经验限制在规定字数内,必须具备跨相似问题实例的泛化能力,通过生成过程中的提示约束来强制执行。

知识整合机制确保知识库的可扩展性和质量。

经验整合时,在添加新经验前检查是否存在余弦相似度超过阈值的条目。若有,系统将相似条目合并为单条保留核心洞察的条目。

技能整合时,片段被整合到全局技能文档中,多模态大语言模型决定每个章节是更新、合并还是删除。

技能管理器监控文档长度,超限时触发精炼,移除过于具体的细节,用可复用占位符替换具体实例。

在推理阶段,面对测试任务,系统采用动态检索和注入机制,包含任务分解检索、上下文感知视觉适配、非规范性注入三个步骤。

直接用原始查询检索经验往往效果不佳,因为视觉语义差距和查询特异性问题。任务分解策略将任务分解为多个子任务,每个子任务生成短文本查询,用于检索相关经验。

这种多方面分解后针对子任务查询的方式,让检索更精准地定位各个技术需求。

检索到的经验是通用的,可能包含与当前任务无关的细节。

经验重写器在保留结构的前提下改写每条经验,将条件改写为匹配当前任务和视觉状态,用任务相关细节实例化动作,丢弃明显不适用的经验。

技能适配器则根据当前多模态上下文修剪无关章节,将改写后的经验整合到工作流步骤中,调整代码模板使其任务相关。

适配后的技能被注入智能体的系统提示中作为非规范性参考,允许智能体在利用既有智慧的同时,保留根据情况即兴发挥新解决方案的灵活性。

执行过程中,系统记录哪些技能和经验被实际使用,形成使用历史。

这个历史被反馈到积累阶段作为参考,改进轨迹摘要和跨轨迹批判,基于真实使用模式持续精炼知识库。

实验验证与深入分析

研究团队在五个基准测试上评估XSKILL,涵盖三个不同领域。

视觉智能体工具使用领域使用VisualToolBench和TIR-Bench,要求智能体处理视觉输入并执行精确工具进行图像分析。

多模态搜索领域使用MMSearch-Plus和MMBrowseComp,挑战智能体在异构文本和视觉源中搜索和推理的能力。

综合领域使用AgentVista,这是一个结合工具使用和复杂搜索任务的超挑战综合基准。

每个基准随机采样100个任务构建训练集用于经验积累,其余任务用于评估。

对比方法包括三类前沿基线:Agent Workflow Memory从过往轨迹中提取可复用任务工作流指导未来执行;Dynamic Cheat Sheet维护问题解决策略和代码片段的演化记忆,实现测试时学习;Agent-KB将跨领域经验聚合到结构化知识库,采用混合检索提供规划指导和诊断反馈。

所有方法在相同训练集上收集经验,推理时执行经验检索,确保公平比较。

四个骨干模型参与评估:Gemini-2.5-Pro、Gemini-3-Flash、GPT-5-mini、o4-mini。

Gemini系列从自己的推理轨迹中积累经验和技能,GPT和o系列直接使用Gemini-3-Flash积累的知识,考察跨模型可迁移性。

主要评估指标是成功率,报告四次独立推理的平均成功率和至少一次成功的任务比例。

相比仅使用工具的基线,XSKILL在不同模型上实现2.58至6.71个百分点的平均提升。

相比学习型基线,XSKILL在大多数设置上超越先前方法,尤其在需要复杂视觉推理和多步工具组合的任务上优势明显。

以TIR-Bench为例,使用Gemini-3-Flash的XSKILL达到47.75%平均成功率,超越最强基线Agent-KB 11.13个百分点。GPT-5-mini和o4-mini使用迁移知识后,也分别获得2.58到4.16个百分点的提升,证明外化知识结构在不同模型架构间保持有效性。

消融研究揭示了各组件的贡献。

移除经验或技能分别导致3.04和3.85个百分点的性能下降,验证两条知识流的必要性。

第一阶段组件比第二阶段组件贡献更大,前者移除导致4.09和3.62个百分点的下降,后者移除仅导致1.28和1.52个百分点的下降。这表明积累知识的质量比检索机制更关键,但两阶段都对最优性能不可或缺。

进一步分析发现,技能和经验发挥着互补作用。

技能显著降低执行错误:从仅使用经验到仅使用技能,总体错误率从29.9%降至15.3%,语法错误从20.3%降至11.4%,工具名称错误几乎完全消除。

技能提供清晰的工作流和工具模板,防止智能体在错误恢复上浪费推理步骤。

经验则改变工具选择模式。

引入经验后,VisualToolBench上的代码解释器使用率从66.63%提升至76.97%,MMSearch-Plus上的图像搜索调用从15.43%提升至24.63%。经验捕捉针对特定任务的战术知识,实现上下文感知的工具编排。

推理次数对性能有显著影响。

随着推理次数从1增加到4,平均成功率和至少一次成功率持续提升。

更多推理提供更丰富的轨迹多样性,让跨轨迹批判机制通过对比成功和失败尝试提炼更高质量经验,从不同执行路径中识别共同模式归纳更具泛化性的技能。

零样本迁移实验同样表现优异。

用VisualToolBench知识解决TIR-Bench任务,用MMSearch-Plus知识解决MMBrowseComp任务,XSKILL持续超越所有基线,平均比Agent-KB高出2到3个百分点。

优越的迁移性源于层级整合机制移除了案例特定细节、保留了广泛适用的洞察,以及任务适配过程将经验和技能调整为适合当前任务上下文。

XSKILL的成功指向一个更广阔的趋势:AI智能体正在从无状态系统向持续学习的演化系统转变。

通过将知识外化为结构化、可解释的表示,XSKILL提升了智能体决策的透明度和可解释性,技能和经验的明确分离使人类操作者能够审计、编辑或移除特定积累知识。

更强大的能力也带来潜在风险,需要人类监督积累的知识库、定期对技能文档和经验库进行偏见审计、制定跨模型知识转移的访问控制策略。

人类通过经验和技能两种知识形式持续改进问题解决能力,AI智能体同样可以。

XSKILL证明了这条道路的可行性。无需参数更新,只需从过往轨迹中提炼智慧,就能让智能体越用越聪明。

参考资料:

https://xskill-agent.github.io/xskill_page/

https://github.com/XSkill-Agent/XSkill

https://arxiv.org/pdf/2603.12056

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询