超20万个高质量Skills!浙大等联合推出SkillNet,告别孤立Skill实现自进化

浙江大学联合多家顶级研究机构,推出了拥有超过200000个高质量Skills的开源基础设施SkillNet。

SkillNet让AI智能体彻底告别失忆式工作,在各类复杂任务中平均任务奖励跃升40%并缩减30%的执行步骤。

长期以来各类人工智能体在处理复杂任务时往往依赖临时学习,无法像人类一样将经验沉淀为可复用的知识体系。

基于这一痛点研发的SkillNet框架,巧妙地将杂乱无章的互联网资源,和人类经验转化为标准化的可执行Skills。

系统不仅自动生成和组织海量Skills,还通过严苛的多维评估确保每项Skills的安全与高效。

一套完整的图谱网络将孤立的Skills串联起来,为各种大语言模型提供了一个不断自我进化的外挂智慧库。

智能体进入Skills积累新时代

人类智慧的飞跃源于经验的传承与沉淀。一个成熟的程序员在面对新项目时会自动调用脑海中积累的算法逻辑。反观当下的人工智能系统却陷入了不断重新探索的困境。

早期的符号逻辑时代受困于脆弱性和扩展性不足。

深度学习时代将知识化为高维权重矩阵,这种参数化表示如同难以拆解的黑盒。如今走向智能体时代,我们需要一种模块化且可复用的知识载体。

Skills正是这样一种连接无结构语言与结构化执行逻辑的桥梁。目前大部分智能体在不同任务中反复摸索相同的解决方案。缺乏统一的Skills巩固与共享机制限制了人工智能的长远发展。

SkillNet将每一次成功的任务执行轨迹和散落的开源代码提炼为独立的Skills单元。智能体不再需要把有限的上下文窗口浪费在基础步骤的摸索上。机器开始拥有属于自己的长期职业肌肉记忆。

图1展示了SkillNet的全局视野。系统将庞大规模的智能体Skills组织成结构化的Skills网络,支持多维度评估,并提供统一的Skills发现与创建接口。

每一项Skills实质上是一个包含元数据和详细指令的独立文件夹。核心的配置文档记录了Skills名称和应用场景条件。配套的脚本和说明文档让这些资源成为能够随时调用的独立能力包。

智能体调用Skills的过程被简化为极具效率的三个阶段。发现阶段只需加载轻量级的元数据来匹配任务需求。激活阶段智能体会读取完整的操作指南并准备关联资源。执行阶段则严格遵循指令完成特定工具的调用和任务处理。

这种自我说明式的设计让审核和迭代变得极为顺畅。包含文本语义和符号执行结果的混合表示形式赋予了Skills极高的延展性。文件化且支持版本控制的特性保障了知识在不同系统间的无缝移植。

构建庞大且有序的Skills网络

高质量的Skills库无法单纯依靠人工编写来满足广袤的应用需求。

SkillNet设计了一套全自动的Skills创建流水线。系统从人类的海量数字遗迹中源源不断地汲取养分。

这套管线支持四类核心数据源的解析提取。用户过往的执行轨迹与对话日志是第一大宝库。开源的GitHub仓库提供了经过实战检验的代码范式。各类PDF与幻灯片等半结构化办公文档以及用户直接提供的自然语言提示词同样能被转化为标准Skills。

依靠LLM的强大理解力,杂乱的信息被精准提取为可执行的操作模式。为了应对Skills生态的持续扩张,整个知识库的底层架构被精心设计为包含三个递进层次的Skills本体网络。

图3详细呈现了SkillNet的Skills本体架构。顶层的Skills分类法定义了功能类别。中层的Skills关系图谱对依赖和关联进行建模。底层的Skills包库将Skills封装为面向任务的模块。

最顶层的Skills分类法提供了一个宏观的语义骨架。系统将广阔的知识领域划分为开发和科研等十大类。这些大类下方挂载着前端或物理等极其细致的语义标签。

中间层的Skills关系图谱构成了复杂规划与推理的脊梁。抽象的标签被实例化为诸如绘图工具或网页自动化工具等具体的Skills实体。实体之间通过特定关系有机构成了一张巨大的协作网络。

相似关系帮助系统识别功能高度重合的Skills。这种设计支持冗余检测与模块替换。一旦某个接口失效,系统能够迅速找到完美平替以增强鲁棒性。

组合关系将经常协同工作的Skills绑定在一起。一个Skills的输出直接成为下一个Skills的输入。系统借此全自动生成庞大且连贯的工作流水线。

归属关系描绘了宏大工作流与原子步骤之间的层级结构。单项Skills可以作为庞杂工作流中的一个基础组件。这种嵌套模式极大支持了Skills的抽象化与高度模块化设计。

依赖关系确保了底层的执行安全与规划合理性。特定Skills在缺少前置环境配置或接口初始化的情况下绝不能孤立运行。明确的依赖追踪让系统在执行复杂任务前能够制定出万无一失的计划。

最底层的Skills包库负责Skills的物理隔离与发布。独立的Skills通过打包关系被封装组合。模块化的部署方式极大降低了复杂任务环境中的调用门槛。

图2梳理了SkillNet端到端的处理链路。从异构输入分析到自动化Skills生成,系统最终构建出一个支持搜索和分析的高质量Skills网络。

严苛评测锻造高质量Skills库

盲目堆砌数据只会导致Skills库被低质内容污染。长期的技术债务会拖垮智能体能力的演进。SkillNet引入了数据驱动的过滤与巩固机制来捍卫生态的纯净。

系统会最先通过目录结构和MD5(信息摘要算法)哈希值的联合比对来剔除冗余副本。基于规则的验证和模型检查进一步清除了语义不明和质量低下的残次品。保留下来的候选者将被分门别类地打上细粒度标签。

为了精准衡量每个Skills的质量与成熟度,系统确立了五大核心维度的量化评估体系。每一项Skills都必须在这场严苛的测试中证明自己的价值。

安全性评估是整个系统不可逾越的红线。审核引擎会严密排查任何试图进行未授权文件删除等危险操作的指令。系统还要检测Skills面对对抗性提示词注入时的底层抗干扰能力。

完整性评估重点关注Skills自身的自洽程度。每一个关键的程序步骤以及必要的前提条件都必须被清晰定义。缺失执行约束的模糊指令会被无情拦截。

可执行性评估直接将包含代码的Skills投入完全隔离的沙箱环境进行真枪实弹的演练。任何虚构的工具调用都会在运行中报错。模棱两可的指令在实证检验中会直接现出原形。

可维护性评估审视单项Skills的模块化设计水平。优秀的Skills应当能够在本地顺滑更新升级。这种更新绝不破坏系统级的全局依赖或导致向后兼容性断裂。

成本意识评估为系统的执行效率优化提供了精准的标尺。时间延迟和算力资源消耗都被精细记录。外部API的调用开支同样被纳入能效考核的视野。

图4展示了多维度Skills评估与可靠性分析的结果。左侧图表反映出大部分Skills在安全性与可维护性上表现优异。右侧热力图证实了自动化评分系统与人类专家判断之间具备极高的吻合度。

为了实现高吞吐量的自动化质检,所有维度均由配备精细量规的大型模型完成初审。需要运行代码的Skills会被送入沙箱进行实证检验。每个维度都会被划分为优秀,普通和较差三个等级。

研究团队抽样邀请了计算机博士进行双盲人工复核。模型评分与人类专家的平均绝对误差极低。这套自动化裁判系统具备了人类对齐的审美标准和不知疲倦的扩展能力。

图5演示了专属工具包在实际场景中的应用。左侧展示了用于交互式操作的命令行界面,右侧的Python代码库演示了如何将Skills库无缝集成到人工智能开发管线中。

用户通过几行代码就能完成Skills的语义搜索和下载部署。庞大的网络生态结合轻量级的本地工具箱,构建起一座连接开源社区与个人开发者的坚实桥梁。

真实场景验证强大的实战能力

系统的真实效能必须在严苛的动态环境中接受检验。研究团队选取了三个极具挑战性的基于文本的POMDPs(部分可观察马尔可夫决策过程)仿真环境。

ALFWorld(具象家务环境)要求智能体在复杂的房屋内寻找并操作物品。WebShop(虚拟电商环境)考验智能体在限制条件下进行商品检索对比与采购的商业决策能力。ScienceWorld(虚拟科学实验室)需要智能体精准操作科学仪器完成各项实验。

研究人员将SkillNet与React(交替推理与行动方法)和Expel(经验提取方法)等主流基线技术进行了交叉对比测试。

所有评测接入了DeepSeek V3.2,Gemini 2.5 Pro及o4 Mini三款具有代表性的基础大模型。为了防止数据泄露,所有测试集的场景都与历史经验严格隔离。

表1详细记录了各模型在三大仿真环境中的得分情况。加持了SkillNet的智能体在平均任务奖励和执行步骤缩减上均取得了压倒性的优势。

图6直观展示了多种方法与模型的表现对比。条形图清晰地印证了SkillNet在提升任务成功率并优化操作效率方面的卓越表现。

数据展现出令人振奋的跨越式增长。无论是小参数模型还是超大参数模型,接入Skills库后都获得了稳定且巨大的能力提升。智能体学会了按照结构化路径进行规划,摒弃了低效的盲目试错。

在已知场景和未知场景下保持的一致性增益揭示了更深层次的突破。Skills的抽象化处理促成了知识在不同任务间的泛化迁移。智能体的能力提升摆脱了断点式的偶然爆发,转化为了可稳定积累的实战资产。

图7描绘了SkillNet在两大核心业务场景中的落地应用。上方工作流将用户意图拆解为具体的操作步骤。下方展示了科学发现和代码重构场景下代表性Skills的多维度质量体检报告。

在自动化科学探索场景中,系统扮演着严谨踏实的虚拟科学家。这项宏大任务的目标是从海量的生物学数据中找出与疾病关联的潜在基因及候选治疗靶点。系统最终还要生成具备极高学术阅读价值的研究报告。

系统起初调度专门的数据处理Skills。庞大的单细胞测序数据被清洗与精准聚类,关键的遗传标记物随之浮出水面。机制分析与靶点验证Skills立刻被激活接管后续流程。

提取出的基因被迅速映射到复杂的生物学通路上。临床意义层面的交叉验证通过Skills协同自动完成。最后激活的报告生成Skills将所有散落的分析结果连同规范的学术引用一起打包为结构化的科学文献。

在自动化代码工程领域,系统化身为不知疲倦的高级架构师。该场景专门针对大规模软件工程任务打造。核心目标是在现有的生产级代码库中执行功能扩展与架构演进,同时确保绝对的正确性与长期可维护性。

代码分析Skills迅速梳理出整个系统底层的拓扑结构。需求分解Skills精确评估新功能接入可能引发的底层回归风险。高层次的业务需求被精准映射为代码级别的修改目标。

测试验证Skills与修改生成Skills构成了一个完美的闭环。实时的报错反馈数据源源不断地驱动着底层的自动纠偏。最终调用的维护Skills会生成具备完整可追溯性的架构更新说明文档。

高度定制化的开源个人智能体框架完美融合了这一套生态。系统启动时仅将精简的元数据注入提示词空间。当用户抛出高难度问题时,智能体会自动潜入后台知识库拉取匹配的完整Skills手册。任务完成后的独创性解决方案会被主动打包压缩并反向贡献给整个社区网络。

表2详尽对比了当前业界各大主流人工智能Skills平台的核心差异。SkillNet在全生命周期管理与结构化关系解析方面展现出独占鳌头的代差优势。

传统的资源仓库多数充当着静态包管理器的角色。它们极度依赖人工筛查,完全缺失从运行轨迹中自动化生成Skills的底层引擎。粗放的社区打分机制无法触及模块的本质质量。孤立存放的资源之间缺乏化学反应,极易滋生代码冗余与系统脆弱性。

构建一个互联互通且能自我进化的Skills图谱彻底改变了这一现状。

规范化的流程为智能体搭建了从经验学习到知识提炼再到广泛复用的高速公路。

我们正在见证机器从被动响应工具,向掌握系统性专长的数字分身加速蜕变,每一次成功的任务调度都在为全人类的硅基智慧网络添砖加瓦。

SkillNet让杂乱无章的互联网数据沉淀为结构化的可执行智慧,让习惯于失忆的机器长出永久的经验肌肉。

参考资料:

http://skillnet.openkg.cn/

https://arxiv.org/pdf/2603.04448

https://github.com/zjunlp/SkillNet

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询