晓|UCL+华为Memento刷新多个权威榜单:给Agent装个 “智能笔记”
你有没有过这种崩溃时刻?让 AI 改个报告格式,上次强调的 “标题加粗 + 段落首行缩进”,下次它照样忘得一干二净;让它查行业数据,换个类似关键词,它又得从头搜起,完全不记得上周刚用过的数据库。我上周对着实验室里跑崩的 AI助手拍了桌子 —— 第三次了,让它整理会议纪要,居然把 “项目截止日期” 写成了上个月的,害得整个团队白加班。
直到翻到UCL和华为诺亚方舟实验室最新《Memento》论文时,我手里的咖啡差点洒在实验记录上。这篇论文说:想让AI记住经验、少犯重复错误,根本不用给它的 “大脑” 做手术(也就是花几十万微调模型),只需要装个 “随身笔记本” 就行。更“离谱”的是,他们用最普通的小模型测试,居然打赢了不少经过微调的 “AI 优等生”—— 这到底是怎么做到的?
我们解读最新技术,文末有相关信息。


作者:张长旺,图源:旺知识
先搞懂:为什么现在的AI学新东西这么难?
在讲Memento之前,得先说说现在的LLM智能体(就是能自己干活的AI,比如自动查资料的AI助手)有多“难伺候”。目前主流的两种让AI进步的方法,本质上都是“死胡同”。

第一种是“按剧本演戏”——给AI写死流程。比如让AI查天气,就规定“第一步打开XX天气网,第二步输入城市,第三步复制温度”。这种方法简单,但AI完全不会变通:要是网站改了界面,它就卡壳;要是你让它查“明天穿什么衣服”(需要结合天气和穿搭建议),它就一脸懵。就像只会背菜谱的新手,换个食材就不知道怎么下锅了。
第二种是“给大脑做手术”——微调LLM参数。相当于把AI的“记忆”直接刻进它的核心模型里,比如让它学过100个科研论文的写法后,调整模型里的 Billions 个参数,让它下次能写出类似的论文。但这方法的问题太明显了:一是贵,微调一次大模型可能要花几十万;二是慢,得收集大量数据,跑好几天;三是“记仇不记好”——学了新东西,可能把老知识忘了(这叫“灾难性遗忘”),跟金鱼似的。
我们团队之前做调研AI时,就卡在这了:想让AI记住“怎么查某类文献”,要么写死流程导致它不会查新领域文献,要么微调一次花掉半个月经费。直到看到Memento,才发现原来可以绕开“改大脑”,直接给AI加个“笔记本”。
Memento的核心:给AI装个“会思考的笔记本”
Memento的思路特别像我们人学习的过程:你不会每次做饭都重新发明菜谱,而是会记着“上次做番茄炒蛋放少了盐,这次多放一点”;也不会每次遇到问题都从头想,而是会想“上次类似的事我是怎么解决的”。

它把这个过程拆成了三个核心部分,我用“餐厅后厨”来给你比喻:

1. 主厨(Planner):负责翻“笔记本”定方案
Planner就像餐厅里的主厨,不直接动手做菜,但负责定“怎么做”。它的核心工具就是一个“案例库”(Case Bank)——相当于主厨的“错题本+成功菜谱”,里面记着过去做过的“任务记录”:比如“上次用户让查‘2024年AI论文趋势’,我第一步搜了arXiv的AI分类,第二步筛选了引用超100的论文,第三步总结了3个趋势,最后成功了( reward=1 )”;或者“上次用户让算‘某公式的推导’,我直接用了计算器,但算错了( reward=0 )”。
每次接到新任务,主厨不会瞎琢磨,而是先翻这个“笔记本”:比如用户现在要查“2025年机器人论文趋势”,它就从案例库里找最像的“2024年AI论文趋势”的记录,然后参考那个思路,定出这次的方案——“第一步搜arXiv的机器人分类,第二步筛选引用超100的论文……”
2. 厨师长(Executor):负责动手+用工具
Executor就是具体干活的厨师长,它拿着主厨定的方案,去调用各种“工具”完成任务。比如方案里说“搜arXiv论文”,它就打开学术搜索引擎;说“筛选引用”,它就用 citation 工具查数据;说“总结趋势”,它就整理信息写成文字。
这里的关键是,厨师长只用管好“把工具用好”,不用管“方案对不对”——方案的事交给主厨,分工明确,不会像以前的AI那样“又要想怎么做,又要动手做”,最后两边都做不好。
3. 笔记本管理员:负责“记笔记”和“整理笔记”
这个角色最关键,它要做两件事:“写笔记”和“优化笔记”。
• 写笔记(Write):每次任务做完,不管成功还是失败,都把“任务内容(state)、做了什么(action)、结果怎么样(reward)”记到案例库里。比如这次查“2025机器人论文”成功了,就新增一条记录:“任务:查2025机器人论文趋势;行动:搜arXiv机器人分类+筛引用+总结;结果:成功(1)”。就像你做完饭,把“这次盐放多了”记在菜谱旁边。
• 优化笔记(Read):光记还不够,还得让“笔记本”越来越好用。Memento分了两种“找笔记”的方式:
• 非参数查找:相当于按“关键词搜笔记”。比如新任务是“查2025机器人论文”,就把任务内容变成“文字密码”(embedding),然后找案例库里“密码最像”的记录——比如和“2024 AI论文”的密码相似度最高,就优先参考。这像你在笔记本里搜“番茄炒蛋”,找到所有带这四个字的页面。
• 参数查找:相当于给笔记标了“推荐指数”。Memento会训练一个“打分器”(Q函数),给每条笔记打分——比如“2024 AI论文”这条笔记帮过3次忙,就打高分;“算错公式”那条帮倒忙,就打低分。下次找笔记时,优先选高分的。这像你在笔记本里给有用的菜谱画星星,下次直接挑星星多的看。
最牛的创新:不用“改大脑”,还能“越用越熟练”
Memento最让我惊艳的地方,不是它的“笔记本”设计多复杂,而是它解决了之前AI的两个核心痛点:不用微调LLM,还能持续进步。
先说说“不用微调”为什么重要。之前的AI要进步,必须改LLM的核心参数——相当于给人做大脑手术,风险高还贵。而Memento的“笔记本”是独立于LLM的,就像你给手机装了个记事本APP,不用改手机系统本身。不管你用的是GPT-4还是其他大模型,都能插这个“笔记本”用。用普通的o4-mini当Executor,配合Memento的“笔记本”,效果居然比微调过的模型还好。

再说说“持续进步”。普通AI做任务,做完就忘了,下次还是新手;但Memento的“笔记本”会越积越多,而且“打分器”会越练越准。比如第一次查论文可能走了弯路,但记下来后,下次遇到类似任务就不会再犯;查的论文越多,“笔记本”里的案例越全,AI就越熟练。论文里有个数据特别直观:在DeepResearcher数据集上,Memento跑5次迭代后,准确率比刚开始高了近7个百分点——相当于一个新手厨师,做5次菜后就从“会做”变成“做得好”。
更厉害的是它的“泛化能力”——遇到没见过的任务也不怕。比如训练时让AI查“AI论文”,但测试时让它查“生物论文”(这叫OOD任务,Out-of-Distribution),Memento的准确率居然能提升4.7%到9.6%。这就像你会查AI论文后,看了笔记也能举一反三查生物论文,而不是从头学起。
实验结果:AI“带笔记本” vs “不带笔记本”,差在哪?

光说原理不够,得看实际效果。论文里做了四个权威 Benchmark 的测试,我挑几个关键结果给你翻译下,不用看复杂表格:
• GAIA基准(长任务规划):这个基准相当于AI的“长跑考试”,要完成多步骤任务,比如“查某视频的主角名字”(需要先找视频ID、看缩略图、识别名字)。Memento在验证集上拿了87.88%的Pass@3(三次内做对的概率),排第一;测试集79.4%,比很多开源AI框架(比如Manus、AWorld)都高。尤其是Level 2任务(5-10步),准确率90.7%——相当于10个任务里近9个能做对。


• DeepResearcher(实时查资料):这个基准考的是AI“查资料+总结”的能力,涵盖7个数据集。Memento的平均F1分数66.6%,比传统的“CoT+RAG”( chain-of-thought 加检索增强)高了近30个百分点。要知道RAG也是用了外部资料,但Memento因为有“笔记本”记经验,效果差了一大截。

• SimpleQA(事实性问答):这个基准考的是AI“别瞎编”的能力,比如“鲁迅的原名是什么”。Memento的准确率95%,比之前的WebSailor(93.5%)、DeepSeek(72.2%)都高。这说明“笔记本”能帮AI少犯“失忆”的错,比如记着“上次答鲁迅原名是周树人,对了”,下次就不会瞎编别的。

• HLE(学术难题):这个基准是“AI的高考”,考的是前沿学术问题,比如物理公式推导、生物实验设计。Memento的PM分数(部分匹配,因为学术问题答案不唯一)24.4%,仅次于GPT-5(25.32%),比Gemini-2.5 Pro(21.64%)还高。要知道HLE里很多问题连人类都要查资料,Memento靠“笔记本”记的经验,居然能追上顶尖大模型。

未来能用来干嘛?这些场景可能改变我们的生活

看完论文,我第一时间想的是:这个“AI笔记本”能用到哪些地方?结合我们团队的实践,有几个场景特别有潜力:
• 个人AI助手:现在的AI助手(比如 Siri、小爱同学)记不住你的习惯,比如你每天早上问“今天要带伞吗”,它每次都要重新查天气。要是加个“笔记本”,它能记着“你上次说下雨要带大伞”“你夏天怕晒,晴天要带遮阳伞”,下次直接给你精准建议,不用每次都“重新思考”。
• 科研AI助手:我们做科研时,经常要重复类似的操作,比如“查某类文献”“整理实验数据”“画图表”。Memento的“笔记本”能记着“上次查XXX文献用了arXiv+Google Scholar”“上次画折线图用了Python的matplotlib”,下次你再让它做类似任务,它直接按笔记来,不用你再教一遍。
• 企业客服AI:现在的客服AI经常“答非所问”,因为它记不住之前的对话。要是加个“笔记本”,它能记着“用户刚才问了‘退货流程’,现在又问‘退款到账时间’”,就能连贯回答,不用用户重复说明情况。
当然,Memento也不是完美的。比如“笔记本”里的案例多了之后,查找速度会变慢(就像你笔记本写满了,找某一页要花更久);还有面对超复杂的任务(比如GAIA的Level 3任务,要50步以上),它的规划能力还不够强。但这些都是可以优化的问题,比如给“笔记本”加个“索引”,或者优化“打分器”的算法。
最后:给AI“装记忆”,可能是未来的重要方向
这篇论文让我想到一个点:人类之所以能不断进步,不是因为我们的大脑每次都“重装系统”,而是因为我们会记笔记、总结经验。Memento的本质,就是让AI学会了“记笔记”——这看似简单的一步,却绕开了传统AI“必须改大脑”的死胡同。

未来的AI,可能不需要每次都靠“更大的模型”“更多的参数”来进步,而是靠“更丰富的经验”“更聪明的笔记”。就像一个人要成功,不是靠天生的大脑有多好,而是靠后天的积累和总结。
如果你对这个“AI笔记本”感兴趣,推荐你去看看原文(链接在下面),里面还有更多关于“笔记本怎么优化”“Q函数怎么训练”的细节。也欢迎在评论区聊聊:你觉得如果AI有了“记忆”,最该先用来解决生活里的哪个问题?是记住你的咖啡口味,还是帮你整理工作经验?
参考资料
• 标题:Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
• 作者:Huichi Zhou, Yihang Chen, Siyuan Guo, Xue Yan, Kin Hei Lee, Zihan Wang, Ka Yiu Lee, Guchun Zhang, Kun Shao, Linyi Yang, Jun Wang
• 单位:AI Centre, UCL; Huawei Noah’s Ark Lab, UK; Jilin University; Institute of Automation, CAS
• 链接:https://arxiv.org/pdf/2508.16153v2