北京大学团队追问:AI助手真的能越用越聪明吗?

这项由北京大学人工智能研究院与北京通用人工智能研究院联合完成的研究,以预印本形式发布于2026年8月,论文编号为arXiv:2608.03874,感兴趣的读者可通过该编号查阅完整原文。

---

一、为什么你的AI助手用久了却没变聪明?

每个用过智能助手的人大概都有过这样的期待:这东西用多了,总该越来越懂我吧?然而现实往往让人失望——你今天教会它一个技巧,明天它好像又忘了。这种"金鱼记忆"式的智能助手,距离真正意义上的"越用越聪明",似乎还差得很远。

这个问题背后其实有着严肃的技术背景。现代的大型语言模型(也就是驱动ChatGPT、Claude等产品的核心技术)在出厂时就已经固定了自己的"知识储备",就像一本印刷完成的百科全书,内容不会自动更新。为了弥补这个缺陷,研究人员想出了一个办法:给AI配备一个外挂的"技能库",把它在实际使用中学到的经验整理成文档,下次遇到类似任务时直接调出来用。这个思路听起来很美妙,但问题也随之而来——这套机制真的管用吗?AI真能从每次任务中提炼出可复用的经验,还是只是在做无意义的"归档"?

正是带着这样的疑问,北京大学的研究团队设计了一套全新的测试框架,专门用来考察AI助手的"技能进化"能力。他们把这套框架命名为CONTINUALSKILLBENCH,直译过来就是"持续技能基准测试"。

---

二、给AI设计一场"升级打怪"的闯关游戏

要搞清楚AI能不能真正进化技能,首先需要一个合适的测试场地。研究团队的设计思路有点像电子游戏里的关卡设计:你不能一上来就让玩家面对最终BOSS,必须先从简单关卡开始,让他们逐步积累经验和装备,然后再面对越来越复杂的挑战。

CONTINUALSKILLBENCH覆盖了五个现实生活中真实存在且颇具挑战性的领域,分别是法律、医疗健康、数学、金融和办公事务。每个领域都不是随机拼凑的题库,而是经过精心设计的一个连续闯关序列,每个序列包含100道相互关联的任务,从简单到复杂依次排列。

以金融领域为例,整个序列从最基础的财务数字计算出发,逐步进阶到市场分析,最终到达需要综合判断的战略决策。法律领域则从合同条款的文本解析开始,经过法规解释,最终到达复杂的判例匹配和法理推断。医疗健康领域的路径是从医学知识检索与应用,经过差异化诊断推理,最终到达临床诊断与治疗方案制定。数学领域从基础代数计算出发,经过数学代码生成,最终到达研究级别的数学难题。办公领域则从文档与数据理解,经过办公文档制作,最终到达跨软件的工作流自动化决策。

这种设计的关键在于:前期任务中锻炼出的技能,应当能够在后期更复杂的任务中派上用场。就像学会了骑自行车,再学骑摩托车时就不需要从零开始理解"如何保持平衡"一样。研究团队把这种关系称为"技能迁移依赖",并且专门验证了这种设计的有效性。

---

三、这100道题究竟是怎么选出来的?

为了让测试题足够真实、足够有深度,研究团队并没有自己出题,而是从现有的权威数据集中精心筛选。初始题库规模达到约3万道题目,涵盖了多个来源。法律领域的题目来自LegalBench、LawBench、专业律所的测试集以及律考模拟题库;医疗健康领域来自专注于医疗代理测试的MedAgentsBench、公共卫生知识库HealthBench,以及面向职业医生的PhysicianBench;数学领域汇集了奥数题库OlympiadBench、美国数学竞赛AMC12和AIME的真题、多语言数学推理集NuminaMath、综合数学套件OmniMath、普特南竞赛级别的公理证明题库,以及强调代码驱动求解的MathCoder和真实世界应用数学集RealMath;金融领域包含混合表格文本问答数据集TAT-QA、投资决策评测InvestorBench和综合金融能力评测FinBen;办公领域则使用了企业文档问答集OfficeQA和专业写作评测WritingBench。与此同时,跨领域的通用基准GAIA、现实任务操作评测ClawBench和超大规模文本处理集OneMillionBench也被纳入了多个领域。

从三万道题精简到每个领域100道,需要经过严格的筛选和排序流程。研究团队分三个阶段完成了这个工作。

第一阶段是技能标注与筛选。用AI给每道原始题目打标签,识别出完成这道题需要哪些核心技能,同时过滤掉与该领域核心技能关联性不强的题目,并给每道题打上初步的难度评级。

第二阶段是成对依赖评估与图排序。从筛选后的候选题目中随机抽取题对,让AI判断"完成题目A所练习的技能,是否有助于完成题目B",以及反过来的方向。每个领域抽取200对,每对双向评估,共产生400条判断。基于这些判断,研究团队构建了一张有向图:如果A的技能能帮助B,就从A到B画一条箭头。最终的题目顺序是通过在这张图上按难度分层、优先排放"能帮助最多后续任务"的题目来确定的,使用了一种改良版的拓扑排序算法,确保难度递进的同时最大化技能的前向传递机会。

第三阶段是人工审核。研究人员手动审核了最终的题目序列,确保难度递进是真实的、技能迁移关系是合理的。

---

四、这套题真的有"技能传承"的结构吗?

光说题目之间有关联还不够,研究团队还用严格的数学方法验证了这种关联的真实性。他们让一个独立的AI模型(与排序过程无关)为每道题单独标注所需的核心技能,标注时不告知题目在序列中的位置。然后,他们把意思相近的技能(用文本相似度超过0.85的标准)视为"同类技能"。

统计结果表明,在所有五个领域中,平均有69.5%的题目至少包含一项在它之前的题目中出现过的核心技能。从另一个角度看,每道目标题目平均有35.5%的核心技能需求,在它的历史题目中已经有过对应的练习机会。

更有说服力的是,研究团队把他们精心排序的序列与随机打乱顺序的同一批题目做了比较,测试窗口分别取前1道、前5道和前10道题目。结果显示,精心排序的序列在全部五个领域、全部三个时间窗口下,都表现出比随机顺序更高的技能重叠率,其中15个"领域×窗口"组合中有10个在统计上达到了显著性标准。这说明精心设计的题目顺序确实把相关技能的题目放在了彼此更近的位置,而不是随机分布的。

---

五、测试的时候,AI到底在做什么?

测试框架建立在一个叫做Harbor的基础设施之上,并在此基础上扩展了两种AI代理接口,分别对应OpenAI的Codex CLI和Anthropic的Claude Code。每道子任务按照一个固定的三轮交互协议执行,这个协议有点像老师布置作业、学生完成、然后老师批卷并给出反馈的过程。

第一轮是"接任务":AI收到任务说明,同时获得它当前的技能库目录,被要求先看看有没有现成的技能可以用。第二轮是"做任务":AI使用可用的技能、工具和外部资源完成任务,所有操作都被记录下来用于评估。第三轮是"反思与更新技能":AI收到评分系统给出的反馈,可能是自动化测试的通过率,也可能是按评分标准打出的分数。AI被要求分析失败原因,并判断这次经验是否值得整理成一个可复用的技能文档。如果值得,它可以调用两个特殊的元技能——"创建技能"和"修改技能"——来更新自己的技能库。更新后的技能库会在下一道任务中生效。

这套流程的妙处在于,它不是让AI把每道题的答案存下来,而是要求AI提炼可复用的方法论。系统提示中明确告知:不要死记这道题的解法,而要把经验抽象成可以迁移到其他任务的通用方法、架构模式或领域规则。

---

六、"顺序刷题"比"独立做题"强多少?

研究团队测试了三个模型:GPT-4o、GPT-5.3-Codex和Claude 4.7 Opus。每个模型都在两种条件下接受测试:一种是"顺序执行",也就是按顺序完成100道题,每次都能利用之前积累的技能库;另一种是"独立执行",相当于每道题都是第一次做,没有任何历史记忆。

对比结果总体上让人振奋。在15个"模型×领域"的组合中,有14个在顺序执行下取得了更高的分数(计分方式是在两种条件下都成功产出有效答案的题目上的平均得分)。平均而言,顺序执行比独立执行高出约16.9%。

但这个"平均"背后藏着相当大的差异。从领域来看,医疗健康领域的提升幅度最大,三个模型平均提升了14.9个百分点,主要由GPT-5.3-Codex和Opus 4.7贡献。金融、法律、办公和数学领域的平均提升分别为7.6、5.8、5.4和5.2个百分点。唯一出现分数下降的情况是Opus 4.7在数学领域,下降了0.8个百分点。

从模型来看,GPT-5.3-Codex获得了最大的平均提升(+9.8个百分点),其次是GPT-4o(+7.7个百分点),Opus 4.7最小(+5.8个百分点)。有趣的是,这个排名并不等于"基础能力越强,提升越大"——Opus 4.7在独立执行条件下基础得分最高,但顺序执行带来的提升反而最小;GPT-4o基础得分最低,但提升幅度相当可观。这说明从顺序经验中获益的能力,是一种相对独立的特质,不完全由基础能力决定。

细看不同题型的表现,结构化任务通常从顺序执行中获益更多。比如GPT-5.3-Codex在金融领域的数值计算题上提升了41.6个百分点,精确匹配题提升了9.1个百分点,但评分标准类(开放性问答)题目只提升了3.8个百分点。不过这个规律并非铁律:Opus 4.7在医疗健康的评分标准类题目上提升了23.4个百分点,而在数学的评分标准类题目上反而下降了19.2个百分点。

---

七、"记住答案"和"学会方法",其实效果差不多?

顺序执行比独立执行强,这个结论固然令人高兴,但它并没有回答一个更本质的问题:这种提升,到底是来自"积累了明确的技能文档",还是仅仅来自"上下文里有了更多历史信息和反馈"?

打个比方:一个学生期末考前做了大量练习题,最终考试发挥更好。但这到底是因为他整理了一本详细的笔记(明确技能),还是仅仅因为脑子里有了更多做题的感觉和经验(情境适应)?这两种解释对应的含义截然不同。

为了区分这两种效应,研究团队引入了第三种测试条件:纯上下文学习(ICL)。这种条件下,AI同样按顺序完成100道题,同样能看到每道题的反馈,但被明确禁止创建或修改任何技能文档。换句话说,它只能把经验"放在脑子里",不能整理成正式的技能文档。

这个对比实验在GPT-5.3-Codex上针对法律、金融、医疗健康三个领域进行。结果相当耐人寻味:三个领域平均而言,独立执行得分0.466,纯上下文学习得分0.605,而有明确技能库的顺序执行得分0.602。也就是说,纯上下文学习和有技能库的顺序执行,平均得分几乎相同,差距只有0.003。

这意味着,顺序执行相对于独立执行的大部分提升,实际上来自于"有了更多历史信息和反馈",而不是"整理了明确的技能文档"本身。

当然,细看之下两者并非完全一样。明确的技能库在法律和金融的精确匹配题型上表现更好,在医疗健康的程序化测试任务上把通过率从0.250拉到了0.500;而纯上下文学习在所有三个领域的评分标准类(开放性问答)题目上得分都更高。

这个发现揭示了明确技能文档的真正价值所在:对于那些有严格输出格式要求、需要一步步按程序执行的任务,明确的技能文档能够稳定地固化正确流程;但对于开放性的问答任务,死板的技能文档反而可能过度适应之前的评分标准,限制了灵活性。

---

八、强模型和弱模型,是怎样"管理"自己的技能库的?

除了最终得分,研究团队还观察了AI在整个100道题过程中的技能管理行为,重点关注两个指标:生成的技能被后续任务调用的频率,以及最终技能库的规模。

对比GPT-4o和GPT-5.3-Codex的结果,呈现出非常鲜明的对比。GPT-5.3-Codex最终在五个领域共积累了205个技能,而GPT-4o积累了384个——足足是前者的近两倍。但在技能调用频率上,GPT-5.3-Codex积累的技能被后续任务调用的次数更多,而GPT-4o的技能库虽然更大,但调用率更低。

以法律领域为例,GPT-4o生成的技能在后续任务中被调用了24次,而GPT-5.3-Codex是79次;在医疗健康领域,GPT-4o是57次,GPT-5.3-Codex是129次。这种差异在所有五个领域中都保持一致。

更能说明问题的是技能质量评估。研究团队用GPT-4.1-mini对所有生成的技能文档进行了质量打分,评分维度涵盖格式规范性(是否有有效的YAML头部、名称是否存在并匹配)以及内容质量(使用场景是否清晰、步骤是否可执行、是否具有可复用性、是否包含常见错误和边界情况、是否有验证步骤、是否包含可复用的代码或公式等)。格式部分和内容部分各自评分,最终得分是两者的乘积,任何一项为零都会导致总分为零,因为格式无效的技能文档无法被框架正常加载使用。

结果显示,GPT-4o生成技能的平均质量得分为5.68,而GPT-5.3-Codex的平均质量得分为7.94。GPT-4o不仅生成了更多技能,而且每个技能的质量更低。这种组合——数量多但质量差、复用率低——正是"技能碎片化"的典型症状。GPT-4o倾向于把每次任务经验单独保存为一个窄小的、针对特定任务的文档,而不是把多次相似经验合并提炼为一个更通用的方法论。随着任务推进,这些碎片化的技能越堆越多,不但没有带来相应的帮助,反而增加了每次任务开始时检索和筛选技能的负担。

---

九、用过去的对话记录检索,效果如何?

研究团队还测试了另一种备选方案:与其让AI主动整理技能文档,不如直接把历史任务的片段建立索引,让AI在做新任务时检索最相关的历史记录,把它们放进上下文。这种方法叫做检索增强生成(RAG),可以理解为给AI配了一个"历史任务搜索引擎"。

这个实验在Opus 4.7上针对医疗健康领域进行。RAG方案在评分标准类题目上的表现(得分0.539)比有明确技能库的顺序执行(得分0.517)略高,但在精确匹配题(0.815对0.926)和整体得分(0.617对0.635)上均逊于明确技能库方案。这个结果与纯上下文学习实验呼应:直接的历史信息检索有助于开放性问答,但在需要严格格式和步骤的任务上,系统性整理过的技能文档更可靠。

---

十、强模型生成的技能,到底长什么样?

为了让读者对"技能文档"有直观感受,研究团队在论文中提供了三个实际生成的技能示例,分别来自GPT-4o、GPT-5.3-Codex和Claude 4.7 Opus。

GPT-4o生成的技能以金融领域的日期范围筛选为例,文档包含简单的功能描述和一段Python代码,说明如何按日期范围过滤数据,格式基本规范,但内容相对简单,仅针对"交易任务"这个特定场景。

GPT-5.3-Codex生成的技能以金融问答的指标对齐为例,文档层次更为丰富:先说明这个技能的作用是防止在表格中提取错误指标,然后按步骤给出工作流程,包括精确解析问题的目标指标与时间段、从表格行、汇总行和叙述性文本中构建候选值、按明确的优先级规则选择来源,以及最终验证单位换算、成分构成和时间顺序。文档还专门列出了常见错误(如把分项数据误认为合计数据、混淆单位量级等)和输出格式规范。

Claude 4.7 Opus生成的技能以医疗建议开放性问答为例,内容最为全面:说明任务格式、明确输出文件路径要求、提供结构化的工作流程、列出常见的疫苗相关医学知识速查(包括不同国家的具体指南)、给出代码示例,并专门提醒可能的陷阱,比如开放性问答不等于选择题、某些问题可能是非英语提问需要用原语言回答等。

这三个例子清楚地展示了为什么强模型的技能更有用:它们不只是记录了"这道题怎么做",而是提炼出了"这类任务的通用方法是什么,以及哪些地方容易出错"。

---

归根结底,AI代理确实可以通过持续交互提升能力,但"真正学会"和"只是记住了更多上下文"之间的差距,比我们想象的要大得多。CONTINUALSKILLBENCH这套测试框架提供了一个重要的提醒:不能只看最终得分,还要看AI是在积累真正可复用的方法论,还是仅仅在堆砌越来越多的碎片化记录。

对于普通用户来说,这意味着当你在使用支持"技能学习"功能的AI工具时,工具背后的模型能力至关重要。更强的模型不只是回答得更准,它还能更有效地把经验提炼成下次真正用得上的东西,而不是把每次交互都变成一个孤立的档案。对于AI开发者来说,这项研究指向了一个清晰的挑战:如何帮助AI代理在积累经验的过程中,做到既不遗忘、又不碎片化,真正实现从经验到通用能力的转化。

这个问题的答案,目前还没有人完全解决。如果你对其中的细节感兴趣,可以通过arXiv编号2608.03874找到完整论文,亲自看看研究团队在这个方向上走了多远。

---

Q&A

Q1:CONTINUALSKILLBENCH测试的是AI的什么能力?

A:CONTINUALSKILLBENCH测试的是AI代理能否通过完成一系列连续任务,自主积累和进化自己的技能库,并让后续任务表现有所提升。它特别关注AI是否能把某一任务中学到的方法,真正迁移复用到后续不同但相关的任务上,而不只是重复记忆。

Q2:顺序做任务比独立做任务强多少?

A:在CONTINUALSKILLBENCH的测试中,顺序执行平均比独立执行高出约16.9%的得分,在15个"模型×领域"组合中有14个出现了提升。其中医疗健康领域提升最大,平均达到14.9个百分点;数学领域提升最小,约5.2个百分点。

Q3:明确整理技能文档和单纯保留历史对话,哪个对AI帮助更大?

A:两者效果相当接近。在GPT-5.3-Codex的测试中,纯上下文学习(只看历史对话不整理技能)得分0.605,有明确技能库的顺序执行得分0.602,差距极小。明确技能文档在需要严格格式或程序化执行的任务上更有优势,而上下文适应在开放性问答上略胜一筹。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询