精|AI智能体记忆万字综述:三大核心范式,揭秘终身学习底层逻辑

旺精通:技术专精,深度解析

当AI能记住你上周的工作需求,能从过去的失败操作中总结经验,还能自主更新知识库不再“一本正经地胡说八道”,它才算真正具备了“类人智能”的雏形。而这一切的核心,都藏在AI智能体的“记忆系统”里。

我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识

长期以来,“记不住、记不牢、不会用”一直是大语言模型智能体的致命短板。从记忆的存储架构到动态演化,从检索策略到开源工具,这篇综述将首次揭开AI智能体“长时记忆”的全部秘密——原来让AI拥有“终身记忆”,关键就在这三大核心过程里。

导读

本文聚焦大语言模型(LLM)智能体的记忆系统这一核心研究领域,针对传统LLM在长时程交互中存在的上下文容量不足、目标偏移、知识过时等关键问题,开展了系统性的综述研究。文章首先从架构形式出发,将智能体记忆划分为基于检索、基于生成、混合架构三大类,明确了各类架构的核心特征与适用场景;随后从功能角色维度,剖析了工作记忆在单轮任务与多轮交互中的差异化作用,提出多轮工作记忆的“状态整合-层次化折叠-认知规划”三类核心机制。在此基础上,文章深入阐释了记忆系统的动态演化生命周期,将其拆解为记忆形成(语义摘要、知识蒸馏、结构化构建等五大方式)、记忆演化(整合、更新、遗忘三大机制)、记忆检索(时机意图、查询构建、策略选择、后处理四大步骤)三个相互关联的核心过程。此外,本文还梳理了面向记忆评估的基准测试数据集,以及主流的开源记忆框架,并探讨了从检索中心向生成式记忆、手工设计向自动化记忆管理转变的前沿趋势,全面呈现了该领域的研究脉络、技术瓶颈与未来方向。

摘要

内存已经成为,并将继续作为基于基础模型的智能体的核心能力。它支撑着长视界推理、持续适应以及与复杂环境的有效交互。随着对智能体内存的研究迅速扩展并吸引前所未有的关注,该领域也变得越来越分散。现有被归入“智能体内存”范畴的工作,在动机、实现、假设和评估协议上往往存在显著差异,而大量定义松散的“内存”术语进一步模糊了概念的清晰度。传统的分类法(如长/短期内存)已被证明不足以捕捉当代智能体内存系统的多样性和动态性。本综述旨在提供当前智能体内存研究的最新、全面的图景。我们首先清晰界定了智能体内存的范围,并将其与相关概念(如大语言模型内存、检索增强生成和上下文工程)区分开来。然后,我们通过统一的形式、功能和动力学视角来审视智能体内存。从形式的角度,我们识别了智能体内存的三种主要实现方式,即词元级内存、参数化内存和潜在内存。从功能的角度,我们超越了粗略的时间分类,提出了一个更细粒度的分类法,区分了事实内存、经验内存和工作内存。从动力学的角度,我们分析了当智能体与环境交互时,内存是如何随时间形成、演化和检索的。为了支持实证研究和实践开发,我们汇编了代表性基准测试和开源内存框架的综合摘要。除了整合现有工作,我们还阐述了对新兴研究前沿的前瞻性观点,包括面向自动化的内存设计、强化学习与内存系统的深度融合、多模态内存、多智能体系统的共享内存以及可信赖性问题。我们希望这篇综述不仅能作为现有工作的参考,也能作为将内存重新构想为未来智能体设计中的“一等公民”的概念基础。

1 引言

在过去的两年里,我们看到日益强大的大语言模型迅速发展成为强大的AI智能体。这些由基础模型驱动的智能体在多个领域取得了显著进展,如深度研究、软件工程和科学发现,不断推动着通往人工通用智能的进程。尽管早期的“智能体”概念高度异质,但社区内已逐渐形成共识:除了纯粹的LLM主干,智能体通常还具备推理、规划、感知、内存和工具使用等能力。其中一些能力,如推理和工具使用,已通过强化学习在很大程度上内化到模型参数中,而另一些则仍然严重依赖于外部的智能体框架。这些组件共同将LLM从静态的条件生成器转变为能够与各种外部环境交互并随时间自适应演化的可学习策略。

在这些智能体能力中,内存作为基石脱颖而出,它明确地将静态的、参数无法快速更新的LLM转变为能够通过环境交互进行持续适应的自适应智能体。从应用角度来看,许多领域需要具备主动内存管理而非短暂、健忘行为的智能体:个性化聊天机器人、推荐系统、社会模拟和金融调查都依赖于智能体处理、存储和管理历史信息的能力。从发展的角度来看,AGI研究的一个核心愿景是赋予智能体通过环境交互持续演化的能力,而这种能力从根本上基于智能体内存。

智能体内存需要新的分类法

鉴于智能体内存系统日益增长的重要性和社区关注度,为当代智能体内存研究提供一个更新的视角既及时又必要。提出新分类法和综述的动机有两个:

1. 现有分类法的局限性: 虽然最近的一些综述对智能体内存提供了有价值的全面概述,但它们的分类法是在许多快速方法论进展之前制定的,因此未能完全反映当前研究领域的广度和复杂性。例如,2025年出现的新方向,如从过去经验中提炼可重用工具的内存框架,或内存增强的测试时扩展方法,在早期的分类方案中仍未得到充分体现。

2. 概念碎片化: 随着内存相关研究的爆炸式增长,概念本身也变得越来越宽泛和碎片化。研究人员经常发现,声称研究“智能体内存”的论文在实现、目标和基本假设上差异巨大。各种术语(如陈述性记忆、情景记忆、语义记忆、参数化内存等)的激增进一步模糊了概念的清晰度,凸显了对能够统一这些新兴概念的连贯分类法的迫切需求。

因此,本文旨在建立一个系统性的框架,以协调现有定义,连接新兴趋势,并阐明智能体系统中内存的基本原理。具体来说,本综述旨在解决以下关键问题:

关键问题

• 如何定义智能体内存?它与LLM内存、检索增强生成和上下文工程等相关概念有何关系?

• 形式: 智能体内存可以采用哪些架构或表示形式?

• 功能: 为什么需要智能体内存?它扮演什么角色或达到什么目的?

• 动力学: 智能体内存如何随时间运行、适应和演化?

• 推进智能体内存研究的前沿领域有哪些?

贡献 本综述的贡献可总结如下:(1) 我们从“形式-功能-动力学”的角度提出了一个最新、多维的智能体内存分类法,为理解该领域的当前发展提供了一个结构化的视角。(2) 我们对不同内存形式和功能目的的适用性和相互作用进行了深入讨论,为如何将不同的内存类型与不同的智能体目标有效对齐提供了见解。(3) 我们研究了智能体内存中新兴且有前景的研究方向,从而勾勒出未来的机遇并指引前进的路径。(4) 我们汇编了全面的资源,包括基准测试和开源框架,以支持研究人员和从业者进一步探索智能体内存系统。

2 预备知识:形式化智能体与内存

LLM智能体日益成为随时间运行的交互式系统的决策核心,这些系统操作外部工具,并与人类或其他智能体进行协调。为了在这种环境中研究内存,我们首先以涵盖单智能体和多智能体配置的方式形式化基于LLM的智能体系统。然后,我们形式化通过读/写交互与智能体决策过程耦合的内存系统,从而能够统一处理在任务内部和跨任务出现的内存现象。

2.1 基于LLM的智能体系统

智能体与环境 设 表示智能体的索引集,其中 对应于单智能体情况(例如,ReAct),而 代表多智能体设置,如辩论或规划器-执行器架构。环境由状态空间 表征。在每个时间步 ,环境根据受控的随机转移模型演化

其中 表示在时间 执行的动作。在多智能体系统中,这种抽象允许顺序决策或通过环境介导的效应进行隐式协调。每个智能体 接收一个观察

其中 表示智能体 可见的交互历史部分。该历史可能包括先前的消息、中间工具输出、部分推理轨迹、共享工作空间状态或其他智能体的贡献,具体取决于系统设计。 表示任务规范,如用户指令、目标描述或外部约束,在任务内部通常被视为固定的(除非另有说明)。

动作空间 基于LLM的智能体的一个显著特征是它们动作空间的异质性。动作不仅限于纯文本生成,智能体可以在多模态和语义结构化的动作空间上操作,包括:

• 自然语言生成,例如产生中间推理、解释、响应或指令。

• 工具调用动作,调用外部API、搜索引擎、计算器、数据库、模拟器或代码执行环境。

• 规划动作,显式输出任务分解、执行计划或子目标规范以指导后续行为。

• 环境控制动作,智能体直接操纵外部环境(例如,具身设置中的导航,编辑软件仓库,或修改共享内存缓冲区)。

• 通信动作,通过结构化消息与其他智能体协作或协商。

这些动作虽然在语义上多样,但统一之处在于它们都是由基于自回归LLM主干生成的,该主干以上下文输入为条件。形式上,每个智能体 遵循一个策略

其中 是在第2.2节中定义的由内存派生的信号。该策略可能在内部生成多步推理链、潜在思考或暂存器计算,然后才发出可执行动作;这些内部过程在此被抽象化,不显式建模。

交互过程与轨迹 系统的完整执行会产生一条轨迹

其中 由任务终止条件或系统特定的停止标准决定。在每个步骤,轨迹反映了(i)环境观察,(ii)可选的内存检索,(iii)基于LLM的计算,以及(iv)驱动下一状态转换的动作执行之间的交错。

这种表述涵盖了一大类智能体系统,范围从解决带工具增强的推理任务的单个智能体,到协作开发软件的由角色专业化的智能体团队或进行科学探究的团队。我们接下来将形式化集成到这个智能体循环中的内存系统。

2.2 智能体内存系统

当基于LLM的智能体与环境交互时,其实时观察 通常不足以做出有效决策。因此,智能体依赖于从先前交互中获得的额外信息,这些信息既在当前任务内部,也跨越先前完成的任务。我们通过一个统一的智能体内存系统来形式化这种能力,该系统表示为一个演化的内存状态

其中 表示可允许的内存配置空间。没有对 强加特定的内部结构;它可以采用文本缓冲区、键值存储、向量数据库、图结构或任何混合表示的形式。在任务开始时, 可能已经包含了从先前轨迹中提炼出的信息(跨试验内存)。在任务执行期间,新信息积累并充当短期、特定于任务的内存。这两个角色都由一个单一的内存容器支持,时间上的区别源于使用模式而非架构分离。

内存生命周期:形成、演化和检索 内存系统的动态特性由三个概念性算子表征。

内存形成 在时间步 ,智能体产生信息产物 ,可能包括工具输出、推理轨迹、部分计划、自我评估或环境反馈。一个形成算子

有选择地将这些产物转化为内存候选对象,提取具有潜在未来效用的信息,而不是逐字存储整个交互历史。

内存演化 形成的内存候选对象通过一个演化算子集成到现有的内存库中

该算子可以合并冗余条目、解决冲突、丢弃低效用信息或重构内存以实现高效检索。由此产生的内存状态会在后续的决策步骤和任务中持续存在。

内存检索 在时间 ,当智能体需要为即将到来的决策获取相关信息时,它会从内存库中检索信息。我们将此操作表示为

其中 表示一个检索算子,它构建一个任务感知的查询并返回相关的内存内容。检索到的信号 被格式化以供LLM策略直接使用,例如作为一系列文本片段或结构化摘要。

时间角色与智能体循环 尽管内存被表示为一个统一的状态 ,但三个生命周期算子(形成 、演化 和检索 )不需要在每个时间步都被调用。相反,不同的内存效应源于不同的时间调用模式。例如,一些系统仅在任务初始化时执行一次检索,其中 表示空检索策略。其他系统可能基于上下文触发器间歇性或连续地检索内存。类似地,内存形成可以从不加处理的原始观察的简单累积,到复杂的可重用模式或抽象的精炼提取。因此,在任务内部,短期内存效应可能源于像Yao等人和Chen等人那样的轻量级日志记录,或源于更复杂的迭代精炼;跨任务而言,长期内存可以在任务边界间断性地更新,也可以在操作过程中持续更新。短期和长期内存现象因此不是源于离散的架构模块,而是源于形成、演化和检索被调用的时间模式。

内存-智能体耦合 内存与智能体决策过程之间的交互同样是灵活的。一般来说,智能体策略写作为

其中检索到的内存信号 可能存在,也可能不存在,具体取决于检索计划。当在给定步骤禁用检索时, 可被视为一个特殊的空输入。

因此,整个智能体循环包括观察环境、可选地检索内存、计算动作、接收反馈,以及可选地通过形成和演进来更新内存。不同的智能体实现以不同的时间频率实例化这些操作的不同子集,从而产生了从被动缓冲区到主动演化知识库的内存系统。

2.3 智能体内存与其他关键概念的比较

尽管对具有内存的智能体系统的兴趣日益增长,但社区对什么是智能体内存的理解仍然分散。在实践中,研究人员和从业者经常将智能体内存与相关概念混淆,如LLM内存、检索增强生成和上下文工程。尽管这些概念因都涉及信息如何在LLM驱动的系统中被管理和利用而内在相关,但它们在范围、时间特性和功能角色上有所不同。

这些重叠但又不同的概念导致了文献和实践中的歧义。为了澄清这些区别并将智能体内存置于这个更广阔的图景中,我们将在后续小节中考察智能体内存与LLM内存、RAG和上下文工程的关系。图2通过维恩图直观地展示了这些领域之间的共性和区别。

图2 智能体内存与LLM内存、RAG和上下文工程的概念比较。

3 形式:什么承载着内存?

作为组织先前工作的起点,我们首先审视可以构建智能体内存的最基本表示单元。我们首先尝试回答:智能体内存可以采取哪些架构或表示形式?

在多样的智能体系统中,内存并非通过单一的、统一的结构来实现。相反,不同的任务设置需要不同的存储形式,每种形式都有其自身的结构特性。这些架构赋予了内存独特的能力,影响着智能体如何在交互中积累信息并维持行为一致性。它们最终使内存能够在不同的任务场景中发挥其预期作用。

根据内存信息的存储和表示方式,我们区分了三种主要形式:

1. 词元级内存:内存被组织为显式的、离散的单元,可以被单独访问、修改和重建。这些单元在外部保持可见,并可以随时间以结构化形式存储。

2. 参数化内存:内存存储在模型参数中,信息通过参数空间的统计模式编码,并在前向计算期间隐式访问。

3. 潜在内存:内存在模型的内部隐藏状态、连续表示或演化的潜在结构中表示。它可以在推理期间或跨交互周期持续存在和更新,捕获依赖于上下文的内部状态。

上述三种内存形式构成了理解“什么承载着内存”的核心结构框架。每种形式都以自己的方式组织、存储和更新信息,产生了不同的表示模式和操作行为。有了这个结构分类法,我们可以更系统地审视智能体为什么需要内存,以及内存如何在持续的交互中演化、适应并塑造智能体行为。这种分类为后续的讨论提供了概念基础。

3.1 词元级内存

词元级内存的定义

词元级内存将信息存储为持久的、离散的、可在外部访问和检查的单元。此处的“词元”是一个广义的表示概念:超越文本词元,它包括视觉词元、音频帧——任何可以在模型参数之外被写入、检索、重组和修订的离散元素。

因为这些单元是显式的,词元级内存通常是透明的、易于编辑且易于解释的,使其成为检索、路由、冲突处理以及与参数化和潜在内存协调的自然层。词元级内存也是最常见的内存形式,拥有最庞大的现有工作体系。

尽管所有词元级内存都具有存储为离散单元的共性,但它们在这些单元的组织方式上差异显著。存储词元的结构组织在决定智能体能够多高效地搜索、更新或推理过去的信息方面起着核心作用。为了描述这些差异,我们根据单元间的结构组织对词元级内存进行分类,从没有显式拓扑到多层拓扑:

词元级内存的三种主要类型

1. 扁平记忆(1D):无明确关联的线性存储,如对话历史日志、轨迹记录,代表技术有 MemGPT 的虚拟内存管理和 Mem0 的标准化记忆操作;

2. 平面记忆(2D):单一层面的结构化组织,通过图、树等拓扑结构建立记忆关联,典型案例包括 HuaTuo 的医疗知识图谱和 M3-Agent 的多模态实体图;

3. 层级记忆(3D):多层面的立体存储结构,支持不同抽象程度的记忆交互,如 GraphRAG 的多级别社区图索引和 HiAgent 的子目标层级记忆。

图3 按拓扑复杂性和维度组织的词元级内存分类法。

这三种词元级内存在图3中清晰说明。从没有拓扑的平面内存,到具有单层结构组织的平面内存,再到具有多层互连结构的分层内存,这个组织谱系不仅决定了词元级内存如何支持搜索、更新和推理,也决定了内存本身的结构及其所赋予的能力。在接下来的小节中,我们将根据每种组织形式的优势和局限性、典型用例和代表性工作进行介绍。代表性词元级内存方法的总结和比较见表1。

值得注意的是,遵循ReAct引入的思想,一系列研究开始关注长视界交互任务。这些任务中的许多都引入了显式的内存概念,并且由于内存通常以纯文本形式存储,它们属于词元级内存的范畴。其中大多数强调如何压缩或折叠累积的交互轨迹,以便智能体能够在不超过上下文限制的情况下在长序列上运行。关于工作内存的更详细讨论见第4.3节。

表1 代表性词元级内存方法的比较。

3.2 参数化内存

与将信息存储为可见和可编辑的离散单元的词元级内存相反,参数化内存将信息直接存储在模型的参数中。在本节中,我们考察将记忆嵌入到可学习参数空间中的方法,允许模型内化和回忆信息而无需参考外部存储。

根据记忆相对于核心模型参数的存储位置,我们区分了参数化内存的两种主要形式:

参数化内存的两种主要类型

1. 内部参数化内存:编码在模型的原始参数中的内存。这些方法直接调整基础模型以融入新知识或行为。

2. 外部参数化内存:存储在附加或辅助参数集中的内存,例如适配器、LoRA模块或轻量级代理模型。这些方法引入新参数来承载内存,而不修改原始模型权重。

这种区别反映了一个关键的设计选择:内存是完全被吸收到基础模型中,还是模块化地附加在旁边。在接下来的小节中,对于每种形式,我们将概述实现方法,分析其优势和局限性,并列出代表性的系统或工作。表2提供了代表性参数化内存方法的概述。

3.2.1 内部参数化内存

内部参数内存将领域知识、个性化知识或下游任务所需的先验知识注入模型。我们也将增强模型的长上下文能力视为注入先验知识。内存注入的时机可以是预训练阶段、持续预训练阶段、中期训练阶段或后训练阶段。存储在内部参数中的内存不会增加额外的参数或模块。

预训练 一些工作在预训练阶段引入内存机制,旨在解决长尾世界知识难以压缩到有限模型参数中的问题。LMLM和HierMemLM在预训练阶段将用于知识检索的内存存储在模型中,而将知识本身存储在外部知识库中。一些工作还优化了注意力的计算效率以增强长窗口记忆能力。

中期训练 在持续预训练阶段,一些工作融入了来自下游任务的泛化经验。例如,Su等人和张等人整合了智能体经验。一些工作在中训阶段改进了LLM的长窗口性能或效率,使模型能够在有记忆辅助的任务中通过更长的窗口维持更多的短期记忆。

后训练 其他工作在后训练阶段融入内存以适应下游任务。一些工作使LLM能够记住个性化的用户历史或风格。一些工作允许LLM从过去类似任务执行的成功或失败中学习。Character-LM和CharacterGLM将LLM微调成不同的角色。在后训练阶段,SELF-PARAM通过KL散度蒸馏注入额外知识,无需额外参数。Room将知识存储在外部,同时将经验保存在内部。KnowledgeEditor修改内部参数,旨在只改变需要编辑的知识。MEND通过使用小型网络修改大模型的梯度来实现快速知识编辑。PersonalityEdit提出了一个基于心理学人格理论的LLM人格编辑数据集。APP采用多种训练目标,以确保在知识编辑期间对邻近知识的干扰最小。DINM提出了一种模型编辑方法,使模型能够学习拒绝此类危险请求,同时不影响其正常功能。

讨论 内部参数的优点在于结构简单,不会给普通模型增加额外的推理开销或部署成本。其缺点在于更新内部参数困难:存储新内存需要重新训练,成本高昂且容易遗忘旧内存。因此,内部参数内存更适合大规模存储领域知识或任务先验,而非短段的个性化记忆或工作记忆。

3.2.2 外部参数化内存

将内存存储为LLM外部的词元会导致模型对输入窗口中的词元形式内存内容理解不足。同时,将内存存储在LLM的参数中存在更新困难和与预训练知识冲突等问题。一些工作采用折衷方法,通过外部参数引入内存,而不改变LLM的原始参数。

适配器 一种常见的外部参数化内存方法依赖于附加到冻结基础模型上的模块。MLP-Memory通过MLP将RAG知识与Transformer解码器集成。K-Adapter通过训练特定任务的适配器模块注入新知识,同时保持原始主干不变,从而实现持续知识扩展,而不会干扰预训练的表示。WISE进一步引入了一个双参数内存设置——分离预训练知识和编辑过的知识——以及一个路由机制,在推理时动态选择使用哪个参数内存,从而减轻了终身编辑中的冲突。ELDER通过维护多个LoRA模块并学习一个基于输入语义自适应选择或混合它们的路由函数,推进了这一方向,提高了长期编辑场景下的鲁棒性和可扩展性。

辅助LM 除了基于适配器的存储,另一条工作线采用了一种架构上更解耦的外部参数化内存形式,其中内存存储在一个单独的模型或外部知识模块中。MAC通过一个摊销网络将新文档的信息压缩成紧凑的调制信号,并将其存储在内存库中。Retroformer提出了一种学习范式,用于记忆过去任务执行中成功或失败的经验。

图4 LLM智能体中潜在内存集成的概述。与显式文本存储不同,潜在内存在模型的内部表示空间内运行。

3.3 潜在内存

潜在内存的定义

潜在内存指的是隐含地承载在模型内部表示中的内存,而不是作为显式的、人类可读的词元或专用的参数集存储。

潜在内存避免以明文形式暴露内存,并且实际上引入了较少的推理延迟,同时通过在模型自身的表示空间内保留细粒度的上下文信号,可能提供更好的性能提升。

如图4所示,我们根据潜在内存的来源组织先前的工作,这意味着潜在状态是如何形成并引入智能体的。我们在表3中总结了这部分的工作。

潜在内存的三种主要类型

1. 生成:潜在内存由一个独立的模型或模块产生,然后作为可重用的内部表示提供给智能体。

2. 重用:潜在内存直接从先前的计算中传递过来,最显著的是KV缓存重用,以及传播隐藏状态的循环或有状态控制器。

3. 转换:将现有的潜在状态转换为新的表示,使得智能体能够保留要点,同时减少延迟和上下文占用。

3.3.1 生成

一条主要的工作线通过生成新的潜在表示来构建内存,而不是重用或转换现有的激活。在这种范式中,模型或辅助编码器创建紧凑的连续状态。这些状态可能作为序列中的特殊词元或独立的向量出现。它们总结了来自长上下文、任务轨迹或多模态输入的基本信息。生成的潜在摘要随后被存储、插入或用作后续推理或决策的条件。这使得系统能够超越其原生上下文长度运行,维护任务特定的中间状态,并在不回溯原始输入的情况下跨情节保留知识。尽管各研究的具体形式有所不同,但基本思想是一致的。内存是通过学习到的编码或压缩显式产生的,所得潜在状态作为可重用的内存单元支持未来的推理。

这种设计选择也可能引起与参数化内存的潜在歧义,特别是许多方法依赖单独训练的模型来生成潜在表示。然而,在本章中,我们的分类基于内存的形式而非学习机制。关键在于,尽管这些方法通过学习编码生成内存,但生成的潜在表示是作为独立的内存单元显式实例化和重用的,而不是直接嵌入到模型的参数或前向传递的激活中。在详细讨论具体方法时,我们将回到这个区别。

单模态 在单模态设置中,一大类方法专注于长上下文处理和语言建模,其中模型生成一小组内部表示来替代长的原始输入。一种典型的策略是将长序列压缩成少数内部词元或连续向量,这些向量可以在后续推理中重用。例如,Gist训练一个语言模型在处理长提示后产生一组要点词元。Luo等人在每个块边界引入一个特殊的前哨词元,并鼓励模型将局部语义聚合到该词元中。SoftCoT遵循类似的方向,从最后的隐藏状态生成特定于实例的软词元。

CARE通过训练一个上下文评估器将检索到的RAG文档压缩成紧凑的记忆词元,进一步扩展了潜在词元。

像AutoCompressor和MemoRAG这样的工作强调向量化或独立的潜在表示。AutoCompressor将整个长文档编码成少量作为软提示的摘要向量,而MemoRAG使用LLM生成捕获全局语义结构的紧凑隐藏状态记忆。这些方法不仅从原始文本中抽象出来,而且将检索或上下文信息转换为新的、为重用而优化的潜在内存单元。为了支持更持久的内存,MemoryLLM在模型的潜在空间内嵌入了一组专用的记忆词元。M+将此思想扩展到跨层长期记忆架构。LM2遵循相关但结构不同的方向,在每一层引入矩阵形状的潜在记忆槽。

另一条不同的工作线将潜在内存的生成内化到模型参数动态中。尽管这些工作依赖参数化模块,但其操作性的内存单元仍然是潜在表示,将其牢牢置于此类别中。Titans将长程信息压缩成在线更新的MLP权重,在推理过程中产生潜在向量。MemGen在解码过程中动态生成潜在内存:两个LoRA适配器决定在哪里插入内存片段以及插入什么潜在内容。EMU训练一个状态编码器来产生带有回报和可取性注释的潜在嵌入。

多模态 在多模态环境中,生成式潜在内存扩展到图像、音频和视频,将它们编码为紧凑的潜在表示。CoMem使用VLM将视觉语言输入压缩成固定长度的词元,从而实现密集的连续内存。Time-VLM通过记忆补丁嵌入来增强时间序列预测。在具身智能体中,Memory Augmented RL训练一个新颖性状态编码器,将观察结果映射到紧凑的潜在表示。MemoryVLA将感知-认知记忆提炼成交叉注意键值对。对于视频对象分割任务,XMem将视觉和历史信息压缩为键值嵌入。

3.3.2 重用

重用类别涵盖的方法是将先前的计算状态直接保存并用作未来的内存,而无需进行显式的生成或转换。最突出的例子是KV缓存重用,其中键值对要么在序列内部保留以维持长程依赖,要么跨对话轮次或文档块传递以实现跨会话的连续性。

在语言建模领域,Memorizing Transformers通过在层之间引入外部可寻址的键值存储来扩展Transformer,允许模型访问任意远的标记。对于长上下文问答,FOT检索历史KV对以支持对先前处理的块中的信息的关注。SirLLM和Memory3探索了基于令牌重要性的策略,以保留关键KV对并丢弃冗余信息。LONGMEM通过使用残差侧网络解耦记忆和计算来解决缓存过时问题,该网络携带自己的KV缓存。

重用方法的优点是计算效率高且信息保真度高。通过直接保留原始激活,系统可以避免压缩造成的信息损失,并使模型能够访问精细的历史表示。然而,重用内存也可能导致冗余增长、语义漂移以及由于线性历史累积而导致的有效上下文长度受限。

3.3.3 转换

转换代表了对重用方法的第三种替代方案。在此类方法中,现有潜在状态被积极地重塑、压缩或重构,以产生更适合后续推理的表示。与生成方法(从头创建新内存)不同,转换方法操作于已存在的潜在状态。与重用内存不同,模型不仅仅重放存储的KV对,而是做更多事情。

一条主要的工作线专注于压缩KV缓存,同时保留基本语义。一些方法通过只保留最有影响力的词元来减少内存使用。Scissorhands在缓存容量超限时根据注意力分数修剪词元,而SnapKV通过逐头投票机制聚合高重要性的前缀KV表示。PyramidKV跨层重新分配KV预算。SirLLM通过使用词元熵标准估计词元重要性,并选择性地仅保留信息性KV条目,建立在此视角上。Memory3只存储最关键注意力键值对,显著缩小存储需求。RazorAttention引入了一个更明确的压缩方案:它计算每个头的有效注意力跨度,仅保留一个有限的局部窗口,并使用补偿令牌来保留丢弃条目的信息。从更注重效率的角度来看,H2O采用更简单的驱逐策略,仅保留最近的令牌以及特殊的H2令牌以减少内存占用。

讨论 这些方法展示了如何通过选择、检索增强或压缩重编码将潜在内存转化为更有效的内存表示,使LLM能够扩展其可用上下文长度并提高推理性能,而无需依赖原始缓存重用。

它们的主要优点在于产生更紧凑和信息密集的内存表示,这降低了存储成本并支持在长上下文上高效检索。通过重塑潜在状态,这些方法允许模型访问提炼后的语义信号,这可能比原始激活更有用。然而,转换带来了信息丢失的风险,并且压缩后的状态可能比直接重用的KV缓存更难解释或验证。修剪、聚合或重新编码所需的额外计算也增加了系统复杂性。

表3 潜在内存方法的分类法。

3.4 适应

如上所示,如此大量的工作集中在智能体内存上,清楚地表明内存机制对于智能体系统至关重要。智能体系统中内存类型的选择反映了设计者期望智能体在给定任务中如何表现。设计者不仅仅是要求智能体记住某些信息,还隐含地表达了他们希望这些信息如何塑造智能体的行为。因此,为任务选择正确的内存类型远非一个简单的组合选择。

在本节中,我们从每种内存类型的特征出发,讨论它们在理想情况下最适合哪些任务和场景,如图5所示。我们希望此讨论能为做出实际选择提供有用的想法和指导。这些例子仅说明了在这些理想化设置中内存的一种可能形式,并不意味着其他内存类型在相同场景中缺乏独特优势。

词元级内存 词元级内存保持符号化、可寻址和透明,使其特别适合需要显式推理、可控性和可解释性的场景。这种内存类型擅长于实时、高频更新的设置,在这些设置中,智能体必须持续跟踪和修订信息,并且知识本身具有可以显式建模的清晰结构。其外部化特性允许内存易于检查、审计、传输或修订,使其特别适用于需要精确添加/删除/更新操作的领域。高水平的可解释性进一步确保了智能体的决策过程可以追溯到具体的内存单元,这是高风险应用中的一个关键特性。此外,词元级内存提供长期稳定性并避免灾难性遗忘,使智能体能够在长时间范围内积累可靠的知识。另一个实际优势是,词元级内存通常作为即插即用模块实现,使其可以轻松与最新的闭源或开源基础模型集成,而无需修改其内部参数。

可能场景: 聊天机器人和多轮对话系统;需要稳定内存的长视界或终身智能体;用户特定的个性化画像;推荐系统;企业或组织知识库;需要可验证来源的法律、合规和其他高风险领域。

参数化内存 与符号化内存相比,参数化内存是隐式的、抽象的和泛化的,使其自然适用于需要概念理解和广泛模式归纳的任务。当智能体必须依赖于跨不同上下文适用的通用知识或规则时,它特别有效,因为这些规律可以作为分布式表示内化,无需显式外部查找。这种内化支持流畅的推理和端到端处理,使模型能够系统地泛化到未见过的任务或问题变体。因此,参数化内存更符合需要结构洞察、稳健抽象以及根深蒂固的行为或风格模式的任务。

可能场景: 角色扮演或角色一致行为;数学推理、编码、游戏和结构化问题解决;人类对齐和规范性行为先验;风格化、专业或领域专家的响应。

潜在内存 潜在内存避开人类可读的格式,将信息编码为连续向量或机器原生状态。这种方法在模态对齐、融合和与模型内部计算的无缝集成方面提供了独特的优势。通过直接在模型的表示空间内运行,它可以保留细粒度的语义信号,这些信号在解码为文本时可能会丢失,并支持异构数据源的统一处理。潜在内存固有的高密度格式使其对于实时部署和隐私保护环境特别有吸引力,因为它避开了明文存储和显式检索管道的需求。因此,潜在内存非常适合需要跨模态信息流的场景、资源受限的环境以及需要保护数据机密性的应用程序。

可能场景: 多模态或完全集成的智能体架构;设备端或边缘部署以及云服务环境;加密或隐私敏感的应用领域。

4 功能:为什么智能体需要内存?

从作为通用、无状态文本处理器的大语言模型到自主、目标导向的智能体的转变,不仅仅是增量步骤,而是一个根本性的范式转变。这种转变暴露了无状态性的关键局限性。根据定义,智能体必须随时间持续、适应和连贯地交互。实现这一点不仅依赖于大的上下文窗口,从根本上依赖于内存的能力。本节讨论智能体内存的功能,即其基本目的,优先考虑为什么它至关重要,而不是如何实现它。我们认为智能体内存不是一个单一的组件,而是一组不同的功能能力,每个能力在实现持久、智能的行为方面都有其独特的目标。

为了提供系统性的分析,本节围绕一个直接映射到智能体核心需求的功能分类法来组织“为什么”要使用内存。在最高层次上,我们区分了两个时间类别:长期内存,作为跨会话的持久存储,用于积累知识;以及短期内存,作为会话内的工作空间,用于主动推理。这种高层次的时间划分进一步分解为三个主要功能支柱,这些支柱构成了我们分析的结构。该分类法的概述见图6。

图6 智能体内存的功能分类法。

三种主要内存功能

1. 事实内存:智能体的陈述性知识库,旨在通过回忆显式事实、用户偏好和环境状态来确保一致性、连贯性和适应性。该系统回答:“智能体知道什么?”

2. 经验内存:智能体的程序性和策略性知识,通过从过去的轨迹、失败和成功中抽象出来积累而成,以实现持续学习和自我演化。该系统回答:“智能体如何改进?”

3. 工作内存:智能体的容量有限、动态控制的暂存器,用于在单个任务或会话期间进行主动上下文管理。该系统回答:“智能体现在在想什么?”

这三个内存系统并非孤立,而是形成了一个动态的、相互连接的架构,定义了智能体的认知循环。循环始于编码,其中智能体交互的结果,如新获得的事实或失败计划的结果,通过总结、反思或抽象被巩固到长期记忆中。随后,处理在工作记忆中进行,作为即时推理的活动工作空间。为了支持这种推理,系统依赖检索来从事实和经验记忆的持久存储中填充工作空间和相关上下文及技能。这种编码-处理-检索序列构成了核心架构模式,使智能体能够同时从过去学习并在当下推理。

4.1 事实内存

事实内存指的是智能体存储和检索关于过去事件、用户特定信息和外部环境状态的显式、陈述性事实的能力。这些信息涵盖广泛的内容,包括对话历史、用户偏好和外部世界的相关属性。通过允许智能体在解释当前输入时利用历史信息,事实内存成为上下文感知、个性化响应和扩展任务规划的基石。

为了理解智能体内存的结构组成,我们借鉴了认知科学中的陈述性记忆框架。在神经科学中,陈述性记忆指的是可以有意识访问的长期存储,通常根据两个主要组成部分进行分析:情景记忆和语义记忆。情景记忆存储与特定时间和空间背景相关的个人经历事件——事件的内容、地点和时间。其主要特征是能够在大脑中重新体验过去的事件。语义记忆则保留独立于获取场合的一般性事实知识、概念和词义。虽然在人脑中由统一的陈述性系统支持,但这些组成部分代表了不同的抽象层次。

在智能体系统中,这种生物学区别不是作为严格的二分法,而是作为处理连续体来操作化的。系统通常通过将具体的交互历史记录为情景轨迹来启动此过程。后续处理阶段应用总结、反思、实体提取和事实归纳。由此产生的抽象被存储在向量数据库、键值存储或知识图谱等结构中,并受去重和一致性检查程序的管理。通过这一序列,原始事件流逐渐被转化为可重用的语义事实库。

在功能上,这种架构确保了智能体在交互过程中表现出三个基本属性:一致性、连贯性和适应性。

• 一致性意味着行为和自我呈现随时间稳定。通过维护关于用户特定事实和自身承诺的持久内部状态,智能体避免矛盾和任意的立场变化。

• 连贯性体现在稳健的上下文感知中。智能体可以回忆和整合相关的交互历史,参考过去的用户输入,并保持话题的连续性,确保响应形成逻辑连贯的对话,而不是孤立的语句。

• 适应性展示了基于存储的用户画像和历史反馈来个性化行为的能力。因此,响应风格和决策逐步与用户的特定需求和特征对齐。

为了便于阐述,我们根据事实内存所涉及的主要实体进一步对其进行组织。这种以实体为中心的分类法,连同代表性的方法及其技术设计选择,在子节4.1中进行了系统总结。这种视角突出了两个核心应用领域:

事实内存的两种类型

• 用户事实内存:指维持人机交互一致性的实体事实,包括身份、稳定偏好、任务约束和历史承诺。

• 环境事实内存:指维持与外部世界一致性的实体事实,例如文档状态、资源可用性以及其他智能体的能力。

表4 事实内存方法的分类法。

图7 经验内存范式的分类法。

4.2 经验内存

经验内存封装了智能体将历史轨迹、提炼的策略和交互结果编码为持久、可检索表示的机制。与工作内存管理瞬态上下文不同,经验内存专注于跨不同情节的知识的长期积累和迁移。

该范式在理论上根植于认知科学,与人类的非陈述性记忆,特别是程序性和习惯系统相平行。生物系统依赖分布的神经回路进行内隐技能获取。相比之下,智能体经验内存通常采用显式数据结构,如向量数据库或符号日志。这种实现上的差异赋予了智能体一种生物对应物所没有的独特能力:能够内省、编辑和推理自己的程序性知识。

关键的是,经验内存是在“经验时代”实现持续学习和自我演化的基础。通过维护一个结构化经验的存储库,智能体实现了一条非参数的适应路径,避免了频繁参数更新的高昂成本。这种机制有效地通过将交互反馈转化为可重用知识来闭合学习循环。通过这个过程,智能体纠正过去的错误,抽象出可泛化的启发式方法,并编译常规行为。因此,这种适应最小化了冗余计算,并随时间推移优化了决策。

为了系统地分析现有文献,我们根据存储信息的抽象级别对经验内存进行分类。这种基于抽象级别的分类法及代表性范式的概述见图7。在这种基于抽象级别的分类法下的代表性方法,连同它们的存储载体、表示形式和优化策略,总结于表5。

表5 经验内存方法的分类法。

• 基于案例的内存存储历史情节的未充分处理记录,优先考虑高信息保真度,以支持直接重放和模仿。通过保留情景与结果之间的原始对齐,它充当具体、可验证证据的存储库,作为上下文中的范例,用于证据驱动的学习。

• 基于策略的内存从过去的轨迹中提炼出可迁移的推理模式、工作流和高级见解,以指导跨不同场景的规划。作为认知脚手架,它将决策逻辑与特定情境解耦,从而增强跨任务泛化能力,并限制复杂推理的搜索空间。

• 基于技能的内存封装了可执行的程序能力,范围从原子代码片段到标准化API协议,将抽象策略操作化为可验证的动作。此类别作为智能体的主动执行基质,支持能力的模块化扩展和在工具使用环境中的高效处理。

4.2.1 基于案例的内存

基于案例的内存存储历史事件的未充分处理记录,优先考虑保真度,以确保情节可以作为上下文中的范例被重放或重用。与策略模板或技能模块不同,案例避免过度抽象,从而保留情境与解决方案之间的原始对齐。

轨迹 此类存储交互序列以实现重放和证据驱动的学习。为了在基于文本的环境中优化检索,Memento采用软Q学习来动态精炼选择高效用过去轨迹的概率。在多模态环境中,JARVIS1、EvoVLA和Auto-scaling Continuous Memory保留视觉上下文,前者在Minecraft中存储生存经验,后者将GUI历史压缩为连续嵌入。此外,早期经验范式通过中期训练构建无奖励的、智能体生成的交互轨迹,并将其整合到模型参数中以增强泛化能力。

解决方案 此类将内存视为经过验证的解决方案的存储库。ExpeL通过试错自主收集经验,将成功轨迹存储为范例,同时提取文本见解以指导未来行动。Synapse类似地将抽象的状态-动作情节作为上下文示例注入,以对齐问题解决模式。在程序合成中,MapCoder将相关的示例代码作为类似剧本的案例保留,多智能体管道检索并调整这些案例,以提高复杂任务的可靠性。在金融领域,FinCon维护过去动作、盈亏轨迹和信念更新的情节记忆,以促进跨轮次的稳健决策。

总结 基于案例的内存提供高信息保真度,并为模仿提供可验证证据。然而,对原始数据的依赖带来了检索效率和上下文窗口消耗方面的挑战。与可执行技能或抽象策略不同,案例不包含编排逻辑或功能接口。相反,它们充当高级推理所依据的事实基质。

4.2.2 基于策略的内存

与保留发生事件的案例库不同,基于策略的内存提取如何行动的可迁移知识,涵盖可重用的推理模式、任务分解、见解、抽象和跨情境工作流。它将经验提升为可编辑、可审计和可组合的高级知识,从而减少对冗长轨迹重放的依赖,提高跨任务泛化能力和效率。我们在此部分关注非代码或弱代码基础的模板和工作流,而可执行函数、API、MCP协议和代码片段则归类于第4.2.3节。根据所保留知识的粒度和结构复杂性,我们将基于策略的内存分为三种不同类型:原子性的见解、顺序性的工作流和框架性的模式。

见解 此类方法侧重于从过去的轨迹中提炼离散的知识片段,如细粒度的决策规则和反思性启发式方法。 明确解耦了规划级和执级行的内存,使得高级规划见解和低级操作规则可以分别检索,以便在多任务场景中进行细粒度迁移。R2D2为网页导航集成了记忆、反思和动态决策,从失败和成功案例中推导出纠正性见解,以指导后续情节。对于长视界网页自动化,BrowserAgent将关键结论作为显式内存持久化,以稳定扩展的推理链并减轻上下文漂移。

工作流 与原子性的静态见解不同,工作流将策略封装为结构化的动作序列——从先前轨迹中抽象出的可执行例程,以在推理时指导多步执行。Agent Workflow Memory在Mind2Web和WebArena上归纳出可重用工作流,并将其作为高级框架指导后续生成,在无需更新基础模型权重的情况下提高了成功率并减少了步骤数。这表明策略模板可以充当补充案例级证据的高级控制器。Agent KB建立了一个统一的知识库,将工作流视为可迁移的程序性知识。它采用分层检索,首先访问工作流以构建策略方法,从而实现在不同智能体架构间复用问题解决逻辑。

模式 在更高的抽象层次上,推理模式作为认知模板,封装了问题解决的结构,使智能体能够通过实例化这些可泛化的骨架来解决复杂的推理任务。Buffer of Thoughts维护了一个思想模板的元缓冲区,检索并实例化这些模板以解决新问题。类似地,ReasoningBank将成功和失败都抽象为可重用的推理单元,促进测试时扩展和稳健学习。RecMind的自我启发规划算法生成中间自我指导,以构建后续规划和工具使用。在对话智能体领域,PRINCIPLES通过离线自我对弈构建合成策略内存,以在推理时指导策略规划,从而消除了额外训练的需要。这些进展表明了一个从描述性规则到可移植推理结构的范式转变。

4.2.3 基于技能的内存

技能内存捕获智能体的程序能力,并将抽象策略操作化为可验证的动作。它编码了智能体能做什么,补充了智能体知道什么的陈述性知识,并通过提供可调用、可测试和可组合的可执行文件来锚定感知-推理-行动循环。最近的证据表明,语言模型可以学习何时以及如何调用工具,并能可靠地扩展到大型工具库,将技能内存确立为现代智能体的执行基质。

技能内存涵盖了一个从内部的、细粒度的代码到外部化的、标准化接口的连续体。统一的准则是:技能必须能被智能体调用,其结果必须是可验证的以支持学习,并且它们必须能与其他技能组合形成更大的例程。

代码片段 存储为可重用片段的可执行代码提供了从经验到能力的最快路径。在开放式任务中,智能体将成功的子轨迹提炼为可解释的程序,并在不同环境中重用它们。Voyager以一个不断增长的技能库为例说明了这种模式;Darwin Gödel Machine更进一步,在经验验证下安全地重写自己的代码,产生了自我指涉且能力日益增强的技能集。

函数和脚本 将复杂行为抽象为模块化函数或脚本可增强可重用性和泛化能力。最近的进展使智能体能够自主创建专用工具来解决问题,并通过跨不同领域(如移动GUI、网页导航和软件工程)的演示和环境反馈来完善工具使用能力。此外,程序性记忆的新兴机制使智能体能够将执行轨迹提炼为可检索的脚本,从而促进对新场景的有效泛化。

API API作为封装技能的通用接口。虽然早期工作侧重于微调模型以正确调用工具,但API库的指数级增长已将主要瓶颈转移到检索上。标准信息检索方法通常无法捕获工具的功能语义。因此,最近的方法转向基于学习的检索和重排序策略,这些策略考虑了工具文档质量、层次关系和协作使用模式,以弥合用户意图和可执行函数之间的差距。

MCP 为减少基于API的生态系统中的协议碎片化,模型上下文协议提供了一个开放标准,统一了智能体发现和使用工具及数据的方式,包括按需加载工具并减少上下文开销的代码执行模式。广泛的平台支持表明正在趋同于一个通用接口层。

超越标准可执行文件,研究探索了处理不确定神经工具的工具能力的可学习内存、将工具符号嵌入以统一检索和调用的参数化集成,以及将专门智能体作为模块化设计空间内可调用模块的架构即技能视角。总的来说,这些线索将技能内存重新定义为一个可学习、可演化和可编排的能力层。

总结 总之,基于技能的内存构成了智能体的主动执行基质,从静态代码片段和模块化脚本演变为标准化API和可学习架构。它通过将来自基于案例和基于策略内存的见解操作化为可验证的程序,弥合了抽象规划与环境交互之间的差距。随着工具创建、检索和互操作性机制的成熟,技能内存超越了简单存储,实现了一个能力合成、精炼和执行的连续循环,推动着智能体的开放式演化。

4.2.4 混合内存

先进的智能体架构越来越多地采用混合设计,集成多种形式的经验内存,以平衡具体证据与泛化逻辑。通过维护涵盖原始情节、提炼规则和可执行技能的知识谱系,这些系统动态选择最合适的内存格式,确保跨上下文的检索精度和广泛泛化能力。

一个突出的方向涉及将基于案例和基于策略的内存耦合,以实现互补推理。例如,ExpeL协同利用具体轨迹和抽象文本见解,允许智能体在回忆具体解决方案的同时应用一般启发式方法。Agent KB采用分层结构,其中高级工作流指导规划,具体解决路径提供执行细节。类似地,R2D2集成了历史轨迹的重放缓冲区和从过去错误中提炼决策策略的反思机制,有效地桥接了案例检索和策略抽象。与这些相辅相成的是,Dynamic Cheatsheet通过存储积累的策略和问题解决见解以供推理时立即重用,防止了冗余计算。

此外,最近的框架力求统一内存的生命周期,纳入基于技能的组件或建立全面的认知架构。在科学推理中,ChemAgent构建了一个自我更新的库,将执行案例与可分解的技能模块配对,使模型能够通过积累的经验来精炼其化学推理。采取整体方法的LARP为开放世界游戏建立了一个认知架构,协调了用于世界知识的语义记忆、用于交互案例的情节记忆和用于可学习技能的程序性记忆,确保了一致的角色扮演和稳健的决策。最后,像G-Memory和Memp这样的演化系统实现了动态过渡,其中重复的成功案例逐渐被编译成高效的技能,自动化了从繁重检索到快速执行的转变。最近的一项工作MemVerse结合了参数化内存和词元级程序性内存。

4.3 工作内存

在认知科学中,工作记忆被定义为一个容量有限、动态控制的机制,通过即时选择、维护和转换任务相关信息来支持高阶认知。它不仅仅是临时存储,更意味着在资源约束下的主动控制。这一观点植根于多组件模型和嵌入式过程账户等框架,两者都强调注意力焦点、干扰控制和有限容量。

当移植到LLM时,标准的上下文窗口主要作为一个被动的、只读的缓冲区。虽然模型可以在推理过程中消耗窗口的内容,但它缺乏动态选择、维持或转换当前工作空间的显式机制。最近的行为证据表明,当前模型并未表现出类似人类的工作记忆特性,这突显了对显式设计的、可操作的工作记忆机制的必要性。

在本节中,我们将工作记忆定义为在单个情节内主动管理和操作上下文的机制集合。目标是将上下文窗口从一个被动缓冲区转变为一个可控、可更新、抗干扰的工作空间。这种转变带来直接的好处:它提高了在固定注意力预算下任务相关信息的密度,抑制了冗余和噪声,并使得能够重写或压缩表示以维持连贯的思维链。我们根据交互动态对这些机制进行分类。

工作内存的两种类型

• 单轮工作内存侧重于输入压缩和抽象。在这种设置中,系统必须在单个前向传递中处理大量即时输入,如长文档或高维多模态流。目标是动态过滤和重写证据,以构建一个有界的计算暂存器,从而最大化每个词元的有效信息载荷。

• 多轮工作内存解决时间状态维护问题。在顺序交互中,挑战在于防止历史累积压垮注意力机制。这涉及通过读取、执行和更新的连续循环来维护任务状态、目标和约束,确保中间产物在轮次间被折叠和巩固。

总之,LLM的工作内存代表了向主动的、情节内上下文管理的范式转变。通过与主动操作的认知需求对齐,它抑制了干扰,并为长上下文推理的工程约束提供了实用的解决方案。

4.3.1 单轮工作内存

单轮工作内存解决了在单个前向传递中处理大量即时输入的挑战,包括长文档和高维多模态流。目标不是被动地消耗整个上下文,而是主动构建一个可写的工作空间。这涉及在固定的注意力和内存预算下过滤和转换原始信息,以增加密度和可操作性。我们将这些机制分为输入压缩,减少物理词元计数,和观察抽象,将数据转换为结构化语义表示。

输入压缩 输入压缩技术旨在预处理上下文,以最小化词元使用,同时保留必要信息。这些方法通常分为三种范式:硬压缩、软压缩和混合压缩。

• 硬压缩基于重要性指标离散地选择词元。像LLMLingua和LongLLMLingua等方法估计词元困惑度,以丢弃可预测或与任务无关的内容,而CompAct采用迭代策略来保留最大化信息增益的片段。虽然高效,但硬选择有切断句法或语义依赖的风险。

• 软压缩将变长上下文编码为密集的潜在向量。诸如Gist、In-Context Autoencoder和AutoCompressors等方法训练模型将提示压缩为有效的摘要词元或不同的记忆嵌入。这实现了高压缩比,但需要额外训练,并可能模糊细粒度细节。

• 混合方法如HyCo2试图通过结合全局语义适配器和词元级保留概率来调和这些权衡。

观察抽象 压缩侧重于缩减,而观察抽象旨在将原始观察转换为结构化的格式以促进推理。这种机制将动态的、高维的观察空间映射到固定大小的内存状态,防止智能体被原始数据淹没。

在复杂的交互环境中,抽象将冗长的输入转换为简洁的状态描述。Synapse将非结构化的HTML DOM树重写为任务相关的状态摘要,以指导GUI自动化。类似地,在多模态设置中,处理视频流的每一帧在计算上是不可行的。工作内存机制通过提取语义结构来解决这个问题:Context as Memory基于视野重叠过滤帧,VideoAgent将流转换为时间事件描述,而MA-LMM维护一个视觉特征库。这些方法有效地将高维、冗余的流重写为低维、语义丰富的表示,这些表示可以在有限的上下文窗口内操作,以实现高效处理。

表6 工作内存方法的分类法。

4.3.2 多轮工作内存

多轮工作内存处理的是一个与单轮设置根本不同的问题空间。在长视界交互中,主要瓶颈从即时上下文容量转变为任务状态和历史相关性的持续维护。即使有扩展的上下文窗口,历史的积累也必然会饱和注意力预算、增加延迟并导致目标漂移。为了缓解这一问题,多轮设置中的工作内存充当一个外部化的状态载体,组织一个连续的读取、评估和写入循环。目标是在有限的资源预算内,保持关键状态信息的可访问性和一致性。我们根据其状态管理策略对这些机制进行分类:状态整合、分层折叠和认知规划。

状态整合 在连续的交互流中,状态整合通过动态更新将不断增长的轨迹映射到固定大小的状态空间。将交互视为流式环境,MemAgent和MemSearcher采用循环机制来更新固定预算的内存并丢弃冗余,从一个紧凑的、演化的状态中回答查询。ReSum通过周期性地将历史提炼为推理状态来扩展这一点,利用强化学习来优化用于无限探索的、基于摘要的条件行为。

超越启发式总结,ACON将状态整合视为一个优化问题,联合压缩环境观察和交互历史到一个有界的浓缩中,并从失败案例中迭代优化压缩准则。IterResearch进一步采用受MDP启发的公式,通过迭代工作空间重构,其中演化的报告作为持久内存,定期的综合减轻了长视界研究中的上下文窒息和噪声污染。

关于状态表示,方法各有不同,以确保恒定大小的占用。MEM1维护一个共享的内部状态,将新观察与先前的记忆合并。与显式文本不同,MemGen将潜在记忆词元直接注入推理流。

分层折叠 对于复杂的、长视界任务,状态维护需要超越线性总结的结构。分层折叠基于子目标分解任务轨迹,仅在子任务活动时维护细粒度轨迹,并在子任务完成后将完成的子轨迹折叠成一个简洁的摘要。

这种分解-然后-巩固的策略允许工作内存动态扩展和收缩。HiAgent通过使用子目标作为内存单元实例化了这一点,仅保留当前活动的动作-观察对,并在子目标完成后写回一个摘要。Context-Folding和AgentFold通过使折叠操作成为一个可学习的策略来扩展这一点,训练智能体自主决定何时分支到子轨迹以及如何将它们抽象为高级状态。DeepAgent进一步将其应用于工具使用推理,将交互压缩为结构化的情景和工作记忆,以支持细粒度的信用分配。通过用稳定的高级抽象替换完成的子轨迹,这些方法在保持活动窗口较小的同时保留了基本上下文。

认知规划 在最高的抽象层次上,工作内存创建并维护一个外部化的计划或世界模型。状态不仅作为过去的总结,而且作为一个前瞻性的结构,指导未来的行动。

PRIME将检索直接集成到规划循环中,确保内存更新主动支持复杂的推理步骤。在具身和智能体环境中,将语言模型视为高级规划者,将计划提升为工作内存的核心。像SayPlan这样的方法采用3D场景图作为可查询的环境记忆,以在大型空间中扩展规划。在GUI和家务任务中,像Agent-S和KARMA这样的系统通过将推理锚定在分层计划上,使用内存增强检索来弥合长期知识与短期执行之间的差距,从而稳定长视界性能。

通过使计划和结构化环境表示成为工作内存的可读写核心,智能体能够维持目标一致性,并针对感知失败稳健地修订策略。

总结 多轮工作内存的核心在于构建一个可操作的状态载体,而不是保留原始历史。通过整合状态压缩来整合连续流,分层折叠来构建子轨迹,以及认知规划来锚定未来行动,这些机制有效地将推理性能与交互长度解耦。这种范式使智能体能够在遵守严格计算和内存约束的同时,在无限的时间范围内维持时间连贯性和目标对齐。

5 动力学:内存如何运作和演化?

前面的章节介绍了内存的架构形式和功能角色,为智能体内存勾勒了一个相对静态的概念框架。然而,这种静态的观点忽视了从根本上刻画智能体内存特征的固有动态性。与静态编码在模型参数或固定数据库中的知识不同,智能体内存系统可以动态构建和更新其内存存储,并根据不同的查询执行定制化检索。这种自适应能力对于使智能体能够自我演化和参与终身学习至关重要。

内存系统中的三个基本过程

1. 内存形成:此过程侧重于将原始经验转化为信息密集的知识。内存系统不是被动地记录所有交互历史,而是有选择地识别具有长期效用的信息,例如成功的推理模式或环境约束。这部分回答:“如何提取内存?”

2. 内存演化:此过程代表内存系统的动态演化。它侧重于将新形成的内存与现有内存库集成。通过相关条目的合并、冲突解决和自适应剪枝等机制,系统确保内存保持泛化性、连贯性以及在不断变化的环境中的效率。这部分回答:“如何精炼内存?”

3. 内存检索:此过程决定了检索到的内存的质量。以上下文为条件,系统构建一个任务感知的查询,并使用精心设计的检索策略访问合适的内存库。因此,检索到的内存在语义上相关,并且在功能上对推理至关重要。这部分回答:“如何利用内存?”

图8 智能体内存的操作动态。

这三个过程不是独立的;相反,它们形成了一个相互连接的循环,驱动着内存系统的动态演化和运作。在内存形成阶段提取的内存,在内存演化阶段与现有内存库进行集成和更新。利用通过前两个阶段构建的内存库,内存检索阶段能够实现目标访问以优化推理。反过来,推理结果和环境反馈反馈到内存形成中以提取新的见解,并反馈到内存演化中以精炼内存库。总的来说,这些组件使LLM能够从静态的条件生成器转变为能够从变化环境中持续学习并对其做出响应的动态系统。

5.1 内存形成

我们将内存形成定义为将原始上下文编码为紧凑知识的过程。内存形成的必要性源于处理冗长、嘈杂且高度冗余的原始上下文的规模限制。完整的上下文提示经常会遇到计算开销、内存占用过大以及对分布外输入长度的推理性能下降的问题。为了缓解这些问题,最近的内存系统将必要信息提炼为可高效存储和精确检索的表示,从而实现更高效和有效的推理。

内存形成并不独立于前面的章节。根据任务类型,内存形成过程有选择地提取第3节中描述的不同架构内存,以实现第4节中概述的相应功能。根据信息压缩的粒度和编码逻辑,我们将内存形成过程分为五种不同的类型。表7总结了每个类别下的代表性方法,比较了它们的子类型、表示形式和关键机制。

内存形成操作的五种类型

• 语义总结:将冗长的原始数据转换为紧凑的摘要,过滤冗余,同时保留全局、高级语义信息,以减少上下文开销。

• 知识蒸馏:提取特定的认知资产,范围从事实细节到经验性规划策略。

• 结构化构建:将无定形的源数据组织成显式的拓扑表示,如知识图谱或层次树,以增强内存的可解释性并支持多跳推理。

• 潜在表示:将原始经验直接编码为连续潜在空间中的机器原生格式。

• 参数化内化:通过参数更新将外部记忆直接巩固到模型的权重空间中,有效地将可检索信息转化为智能体的内在能力和本能。

尽管我们将这些方法分为五种类型,但我们认为这些内存形成策略并非互斥。单一算法可以集成多种内存形成策略,并跨不同表示转化知识。

5.1.1 语义总结

语义总结将原始观察数据转化为紧凑且语义丰富的摘要。所得摘要捕获了原始数据的全局、高级信息,而不是具体的事实或经验细节。此类摘要的典型例子包括文档的总体叙述、任务的程序流程或用户的历史画像。通过过滤冗余内容,同时保留与任务相关的全局语义,语义总结为后续推理提供了一个高级指导蓝图,而不会引入过多的上下文开销。总结过程通常分为两种机制:增量总结,适用于流数据;分区总结,适用于预先存在的大型语料库。

增量总结 当交互历史累积时,增量总结机制将新数据合并到现有摘要中。MemGPT通过不断将新交互块合并到工作上下文中来动态更新摘要。类似地,Mem0采用LLM驱动的总结来持续压缩对话历史。为了更有效地控制,像Mem1和MemAgent这样的系统使用强化学习来优化总结策略,确保摘要压缩保留对长期任务成功至关重要的信息。

分区总结 当内存系统在任务开始前处理现有的大型文档库时,分区总结首先将语料库划分为可管理的块。例如,MemoryBank根据时间边界将对话历史分割为每日或每会话的块,然后为每个块生成摘要。ReadAgent通过在执行总结之前使用语义聚类对文本片段进行分组来扩展这种方法,旨在创建语义连贯的块。LightMem通过根据主题聚类文本来实现这一点。在多模态领域,DeepSeek-OCR引入了一种光学压缩技术,将文档图像直接映射到紧凑的词元序列中。对于视频数据,FDVS和LangRepo通过集成多源信号或分层聚合视频片段,将冗长的视频总结为紧凑的表示。

5.1.2 知识蒸馏

虽然语义总结侧重于压缩,但知识蒸馏侧重于提取。此过程旨在从原始交互中提取特定的认知资产,过滤掉与目标功能无关的内容。根据所提取知识的性质,我们进一步将其区分为事实记忆蒸馏和经验记忆蒸馏。

蒸馏事实记忆 此过程侧重于将原始交互和文档转化为关于用户和环境状态的显式、陈述性知识。该过程确保智能体通过保留可验证的事实而非瞬态上下文来维持一致性和适应性。在用户建模领域,像TiM、RMM和EMem等系统采用抽象机制将对话轮次转化为高级思想或丰富的基本话语单元,从而保持长期角色连贯性。对于用户目标建模,像MemGuide等方法从对话中提取用户意图描述。在推理过程中,它捕获并更新目标状态,将已确认的约束与未解决的意图分开,以减轻目标漂移。此外,这种蒸馏扩展到多模态环境,像ESR和M3-Agent等智能体将自我中心的视觉观察压缩为关于物体位置和用户例程的文本可寻址事实。此外,通过为智能体配备多模态理解能力,Video-RAG将视频中的音频、字幕和对象转换为文本注释,即事实记忆,以增强长视频理解。

蒸馏经验记忆 此过程侧重于从历史轨迹中提取任务执行背后的策略。通过从成功的执行中推导规划原则,从失败中提取纠正信号,这种范式增强了智能体在特定任务上的问题解决能力。通过抽象和泛化,它进一步支持跨任务的知识转移。因此,经验泛化使智能体能够不断精炼其能力,并朝着终身学习迈进。

这一研究方向旨在从成功和失败的轨迹中推导出高级规划策略和关键见解。一些方法侧重于基于成功的蒸馏,例如AgentRR和AWM等系统从成功案例中总结整体任务计划。MemP分析并总结训练集中的黄金轨迹,将它们蒸馏成抽象的程序性知识。另一些方法采用失败驱动的反思,以Matrix、SAGE和R2D2为例,它们将推理轨迹与真实答案进行比较,以识别错误来源并提取反思性见解。结合两者,ExpeL、From Experience to Strategy和ReMe对比成功和失败的经验,以揭示全面的规划见解。

然而,先前的工作主要侧重于总结任务级规划知识,缺乏细粒度的、步骤级的见解。为了解决这一差距, 引入了一个双层反思机制:它遵循ExpeL构建一个高级规划见解池,同时通过子目标序列分割轨迹,以推导出步骤级的执行见解。

早期的方法依赖固定提示进行见解提取,使其性能对提示设计和底层LLM的能力敏感。最近,可训练的蒸馏方法变得普遍。Learn-to-Memorize为不同的智能体优化特定任务的提示。另一方面,Memory-R1使用LLMExtract模块获得经验和事实知识,而只有后续的融合组件被训练以将这些输出集成到内存库中。尽管这些方法采用了端到端的框架,但它们仍然未能增强LLM蒸馏见解的内在能力。为了克服这一限制,Mem- 明确地训练LLM关于提取什么见解以及如何保存它们。

5.1.3 结构化构建

虽然语义总结和知识蒸馏有效地压缩了不同粒度级别的摘要和知识,但它们通常将内存视为孤立的单元。相比之下,结构化构建将无定形数据转化为有组织的拓扑表示。这个过程不仅仅是存储格式的改变,而是一个确定信息如何链接和分层的主动结构操作。与非结构化的纯文本总结不同,结构化提取显著增强了可解释性和检索效率。关键的是,这种结构先验在处理多跳推理任务中的复杂逻辑和依赖关系方面表现出色,与传统的检索增强方法相比具有显著优势。

根据底层结构推导的操作粒度,我们将现有方法分为两种范式:实体级构建,通过将文本原子化为实体和关系来构建底层拓扑;以及块级构建,通过组织完整的文本片段或内存项来构建结构。

实体级构建 此范式的基础结构源于关系三元组提取,它将原始上下文分解为其最细粒度的语义原子实体和关系。传统方法将内存建模为平面知识图谱。例如,KGT引入了一种实时个性化机制,其中用户偏好和反馈被直接编码为用户特定的知识图中的节点和边。类似地,Memo在提取阶段利用LLM将对话消息直接转换为实体和关系三元组。

然而,这些直接提取方法通常受限于LLM的固有能力,导致潜在的噪声或结构错误。为了提高构建图的质量,D-SMART采用了一种精炼的方法:它首先利用LLM将核心语义内容提炼为简洁的、类似断言的陈述,然后通过神经符号管道提取符合OWL的知识图谱片段。此外,Ret-LLM对LLM应用监督微调,使其能够与关系图进行更稳健的读写交互。

虽然上述方法侧重于平面结构,但最近的进展已朝着构建分层内存以捕获高级抽象的方向发展。例如,GraphRAG从源文档中推导出一个实体知识图谱,并应用社区检测算法来提取图谱社区并迭代生成社区摘要。这种分层方法识别实体之间的高级别聚类关联,从而能够提取泛化的见解,并支持在不同粒度下的灵活检索。

为了更好地反映原始数据的内部连贯性和时间信息,一些工作通过加入情景图来扩展语义知识图谱。AriGraph和HippoRAG建立了包含语义图和情景图的双层结构。他们从对话中提取语义三元组,同时连接同时发生的节点或建立节点-段落索引。Zep进一步将其形式化为一个三层时间图架构:一个记录原始消息发生和处理时间的事件子图,一个用于实体和时间有界事实的语义子图,以及一个用于实体高级聚类和总结的社区子图。

块级构建 此范式将连续的文本跨度或离散的内存项视为节点,在将它们组织成拓扑结构的同时保留局部语义完整性。该领域的演变从固定语料库的静态、平面提取,到随着传入轨迹的动态适应,最终到分层架构。

早期方法侧重于将固定文本库组织成静态平面结构。HAT通过分割长文本并逐步聚合摘要来构建层次树。类似地,RAPTOR使用UMAP进行降维和高斯混合模型进行软聚类,递归地聚类文本块,并迭代地对这些聚类进行总结以形成一棵树。然而,这些静态方法缺乏在不进行昂贵重建的情况下处理流数据的灵活性。

为了解决这个问题,动态平面方法在新轨迹到达时逐步构建内存结构,它们的构建基础元素各不相同。基于原始文本的方法包括MemTree和H-MEM。MemTree采用自底向上的方法,新的文本片段检索最相似的节点,并作为子节点插入或迭代地插入到子树中,触发自底向上的总结更新。H-MEM采用自上而下的方法,为每个代理操作预定义了一个四层JSON结构,并通过总结和实体提取来填充它。基于提炼的记忆项的方法包括A-MEM和PREMem。A-MEM将知识总结为离散的笔记,并链接相关的笔记以构建网络化记忆。PREMem聚类提取的事实、经验和主观记忆,以识别并存储更高维度的跨会话推理模式。

最近的进展超越了平面布局,构建了分层结构,提供了更丰富的语义深度。SGMem通过使用NLTK将文本分割成句子,在所有句子节点上形成一个KNN图,然后调用LLM提取对应于每个对话的摘要、事实和见解,从而构建一个层次结构。为了支持在流数据到达时增量构建分层结构,CAM基于语义相关性和叙事连贯性在文本块之间建立边。它迭代地总结自我图,并通过节点复制显式地解开重叠的聚类来处理新记忆的插入。在多智能体场景中,G-memory通过维护三个不同的图将此动态3D方法扩展到:用于原始聊天历史的交互图,用于特定任务的查询图,以及用于洞察的洞察图。这种结构使每个智能体能够以不同粒度的级别接收定制化的内存。

总结 结构化构建的主要优点是可解释性和处理复杂关系查询的能力。这类方法捕获了内存元素之间复杂的语义和层次关系,支持对多步依赖关系的推理,并便于与符号或基于图的推理框架集成。然而,缺点是模式刚性:预定义的结构可能无法表示微妙或模糊的信息,并且提取和维护成本通常很高。

5.1.4 潜在表示

前面的章节侧重于如何构建词元级内存;这部分侧重于将内存编码到机器的原生潜在表示中。潜在表示将原始经验编码到驻留在潜在空间中的嵌入中。与语义压缩和结构化提取(在将经验嵌入到向量中之前总结它们)不同,潜在编码本质地将经验存储在潜在空间中,从而减少总结和文本嵌入过程中的信息损失。此外,潜在编码更有利于机器认知,能够实现跨不同模态的统一表示,并确保内存表示的密度和语义丰富性。

文本潜在表示 虽然最初设计用于加速推理,但KV缓存也可以被视为内存上下文中的一种潜在表示形式。它利用额外内存存储过去的信息,从而避免冗余计算。MEMORYLLM和M+将内存表示为可自我更新的潜在嵌入,在推理过程中注入到Transformer层中。此外,MemGen引入了一个记忆触发器来监控智能体的推理状态,并决定何时显式调用内存,以及一个记忆编织器,利用智能体的当前状态构建一个潜在词元序列。该序列作为机器原生内存,丰富了智能体的推理能力。

多模态潜在表示 在多模态内存研究中,CoMEM通过Q-Former将视觉语言输入压缩为固定长度的词元,从而实现密集、连续的内存,并支持无限上下文长度的即插即用使用。Encode-Store-Retrieve使用Ego-LLaVA将自我中心的视频帧转换为语言编码,随后通过嵌入模型将其转化为向量表示。尽管使用嵌入模型来确保语义对齐,但这些方法通常面临压缩损失和计算开销之间的权衡,特别是在处理长上下文序列中的梯度流时。

当与具身AI集成时,多模态潜在内存可以融合来自多个传感器的数据。例如,Mem2Ego动态地对齐全局上下文信息与局部感知,将地标语义嵌入为潜在内存,以增强长视界任务中的空间推理和决策。KARMA采用长短期记忆混合形式,将对象信息编码为多模态嵌入,实现了即时响应和一致表示之间的平衡。这些探索凸显了潜在编码在跨模态提供统一且语义丰富的表示方面的优势。

总结 潜在表示绕过了人类可读的格式,将经验直接编码为机器原生向量或KV缓存。这种高密度格式保留了在文本解码中可能丢失的丰富语义信号,使模型能够更平滑地与内部计算集成。并且它无缝地支持多模态对齐。然而,它存在不透明性的缺点。潜在内存是一个黑盒,使得人类难以调试、编辑或验证其存储的知识。

5.1.5 参数化内化

随着LLM越来越多地集成内存系统以支持长期适应,一个核心研究问题是如何将这些外部记忆巩固为参数化形式。虽然上面讨论的潜在表示方法在模型外部参数化内存,但参数化内化直接调整模型的内部参数。它利用模型的能力通过其学习到的参数空间来编码和泛化信息。这种范式从根本上增强了模型的内在能力,消除了外部存储和检索的开销,同时无缝支持持续更新。正如我们在第4节中讨论的,并非所有内存内容都服务于相同的功能:一些条目提供陈述性知识,而另一些则编码塑造智能体推理和行为的程序性策略。这种区别促使对内存内化采取更细粒度的视角,将其分为知识内化和能力内化。

知识内化 此策略涉及将外部存储的事实记忆,如概念定义或领域知识,转换为模型的参数空间。通过这个过程,模型可以直接回忆和利用这些事实,而无需依赖显式检索或外部内存模块。在实践中,知识内化通常通过模型编辑实现。早期工作如MEND引入了一个辅助网络,通过分解微调梯度实现快速、单步编辑,从而最小化对无关知识的干扰。在此工作基础上,ROME通过使用因果追踪精确定位存储特定事实的MLP层,并应用秩一更新注入新信息,具有更高的精度和更好的泛化能力。MEMIT进一步发展了这一方向,支持批量编辑,通过多层残差分布和批量公式,使得数千个事实可以同时更新,这显著提高了可扩展性。随着像LoRA这样的参数高效范式的兴起,知识内化可以通过轻量级适配器而不是直接修改参数来执行。例如,CoLoR冻结预训练的Transformer参数,只训练小的LoRA适配器来内化新知识,避免了全参数微调的高成本。尽管取得了这些进展,但这些方法仍然可能产生脱靶效应,并且在持续学习场景中仍然容易发生灾难性遗忘。

能力内化 此策略试图将经验性知识,如程序性专门知识或策略性启发式方法,嵌入到模型的参数空间中。该范式代表了广义上的内存形成操作,从事实知识的获取转向经验性能力的内化。具体来说,这些能力包括特定领域的解决方案模式、战略规划以及智能体技能的有效部署等。技术上,能力内化是通过从推理轨迹中学习来实现的,通过监督微调或基于偏好引导的优化方法如DPO和GRPO实现。作为将外部RAG与参数化训练集成的一次尝试,Memory Decoder是一种即插即用的方法,不修改基础模型,同时通过消除外部检索开销来实现参数内化般的推理速度。这种即插即用的参数化内存可能具有广泛的潜力。

总结 参数化内化代表了内存的最终巩固,其中外部知识通过梯度融合到模型的权重中。这将从检索信息的范式转变为拥有能力的范式,模仿了生物学的长时程增强。当知识变得如同本能一样时,访问是零延迟的,使模型能够立即响应而无需查询外部内存。然而,这种方法面临几个挑战,包括灾难性遗忘和高更新成本。与外部内存不同,参数化内化难以在没有意外副作用的情况下精确修改或移除,限制了灵活性和适应性。

5.2 内存演化

第5.1节介绍的内存形成从原始数据中提取内存。下一个重要步骤是将新提取的内存与现有内存库集成,实现内存系统的动态演化。一个简单的策略是将新条目简单地附加到现有内存库中。然而,它忽视了内存条目之间的语义依赖和潜在矛盾,也忽视了信息的时间有效性。为了解决这些限制,我们引入了内存演化。这种机制整合新旧记忆以综合高级见解、解决逻辑冲突并修剪过时数据。通过确保长期知识的紧凑性、一致性和相关性,这种方法使内存系统能够随着环境和任务的演变而调整其认知过程和上下文理解。

根据内存演化的目标,我们将其分为以下机制:

内存演化的三种机制

1. 内存整合:合并新旧记忆并进行反思性整合,形成更泛化的见解。这确保学习是累积的而非孤立的。

2. 内存更新:解决新旧记忆之间的冲突,纠正和补充存储库以保持准确性和相关性。它允许智能体适应环境或任务要求的变化。

3. 内存遗忘:移除过时或冗余的信息,释放容量并提高效率。这防止了因知识过载导致的性能下降,并确保内存存储库专注于可操作和最新的知识。

这些机制共同维护了内存存储库的泛化性、准确性和时效性。通过主动管理内存演化,这些机制强调了内存系统的智能体能力,促进了持续学习和自主的自我改进。图9提供了这些内存演化机制的统一视图,说明了它们在共享内存数据库中的操作角色和代表性框架。

图9 内存演化机制全景。

5.2.1 整合

内存整合旨在将新获得的短期痕迹转化为结构化和可泛化的长期知识。其核心机制是识别新旧记忆之间的语义关系,并将它们整合为更高层次的抽象或见解。这个过程有两个主要目的。首先,它将碎片化的信息片段重组为连贯的结构,防止短期记忆保留过程中关键细节的丢失,并促进稳定知识模式的形成。其次,通过对经验数据进行抽象、压缩和泛化,整合从特定事件中提取可重用模式,产生支持跨任务泛化的见解。

一个核心挑战是确定新记忆应与现有记忆在何种粒度上匹配和合并。先前的工作涵盖了一系列整合策略,从局部内容合并到聚类级融合再到全局集成。

局部整合 此操作侧重于涉及高度相似记忆片段的细粒度更新。在RMM中,每个新的主题记忆检索其最相似的前K个候选,LLM决定合并是否合适,从而降低错误泛化的风险。在多模态设置中,VLN在容量饱和时触发池化机制。它识别最相似或冗余的记忆对,并将它们压缩为更高级别的抽象。这些方法在保留内存存储全局结构的同时,精炼了详细知识,提高了精度和存储效率。然而,它们无法完全捕获聚类级的关系或在语义相关的记忆中涌现出的高阶依赖关系。

聚类级融合 随着记忆的增长,采用聚类级融合对于捕获跨实例的规律性至关重要。在跨聚类层面,PREMem将新的内存聚类与相似的现有聚类对齐,并应用泛化和精炼等融合模式,形成更高阶的推理单元,显著提高了可解释性和推理深度。EverMemOS计算新生成的MemCell与所有MemScene质心的相似度,并将其合并到足够相似的MemScene中。在聚类内部,TiM定期调用LLM检查共享同一哈希桶的记忆,并合并语义冗余的条目。CAM将目标聚类内的所有节点合并为一个代表性摘要,产生更高级别和一致的跨样本表示。这些方法在更广泛的范围内重组了内存结构,标志着向结构化知识迈出了重要一步。

全局集成 此操作执行整体整合,以维护全局连贯性并从积累的经验中提炼系统级见解。与第5.1.1节相比,语义总结侧重于从现有上下文中推导全局摘要,可视为摘要的初始构建。而本段强调在新数据到达时,如何将新信息集成到现有摘要中。对于用户事实内存,MOOM通过基于规则的处**理、嵌入方法和LLM驱动的抽象,将临时角色快照与历史痕迹相整合,构建稳定的角色画像。对于经验内存,Matrix执行迭代优化,将执行轨迹和反思性见解与全局内存相结合,提炼出支持跨场景重用的任务无关原则。随着单步推理上下文和环境反馈的延长,像AgentFold和Context Folding等方法将压缩工作记忆的能力内化。在多步交互(包括网页导航)中,这些方法在每一步后自动总结和压缩全局上下文,支持高效和有效的推理。全局整合从完整的经验历史中巩固了高级、结构化的知识,提供了可靠的上下文基础,同时提高了泛化能力、推理精度和个性化决策。

总结 整合是将碎片化的短期痕迹重组为连贯长期模式的认知过程。它超越了简单的存储,综合了孤立条目之间的联系,形成了一个结构化的世界观。它增强了泛化能力并减少了存储冗余。然而,它存在信息平滑的风险,即异常事件或独特例外在抽象过程中可能丢失,可能降低智能体对异常和特定事件的敏感性。

好的,这是翻译的后续部分,从第5.2.2节“内存更新”开始,直到全文结束。

5.2.2 内存更新

内存更新是指当出现冲突或获得新信息时,智能体修订或替换其现有记忆的过程。目标是保持事实一致性和持续适应,而无需完全重新训练模型。与第5.2.1节描述的内存整合不同,后者侧重于抽象和泛化,内存更新强调局部修正和同步,使智能体能够与不断变化的环境保持一致。

通过持续更新,智能体内存系统保持知识的准确性和时效性,防止过时信息使推理产生偏差。因此,它是实现终身学习和自我演化的核心机制。根据记忆驻留的位置,更新分为两类:(1) 外部内存更新:更新外部内存存储;(2) 模型编辑:参数空间内的模型内部编辑。

外部内存更新 每当出现矛盾或新事实出现时,对向量数据库或知识图谱中的条目进行修订。这种方法不是改变模型权重,而是通过动态修改外部存储来保持事实对齐。静态记忆不可避免地会累积过时或冲突的条目,导致逻辑不一致和推理错误。更新外部内存可以在避免完全重新训练或重新索引的成本的同时进行轻量级修正。

外部内存更新机制的发展轨迹如下:从基于规则的校正到具有时间感知的软删除,再到延迟一致性策略,最终到完全学习的更新策略。早期系统如MemGPT、D-SMART和Mem09遵循一个简单的流程:LLM检测新信息与现有信息之间的冲突,然后调用替换或删除操作来更新内存。尽管这些方法对基本事实修复有效,但它们依赖于破坏性替换,抹去了有价值的历史背景并打破了时间连续性。为了解决这个问题,Zep引入了时间注释,用无效时间戳标记冲突事实而不是删除它们,从而保留了语义一致性和时间完整性。这标志着从硬替换到软、时间感知更新的转变。然而,实时更新在高频交互下会带来显著的计算和I/O负担。因此,MOOM和LightMem引入了双阶段更新:用于实时响应的软在线更新,随后是离线反思性整合阶段,在该阶段中通过LLM推理合并相似条目并解决冲突。这种最终一致性范式平衡了延迟和连贯性。随着智能体强化学习的成熟,通过强化学习增强LLM的内在内存更新决策能力成为可能。Mem-α将内存更新表述为策略学习问题,使LLM能够学习何时、如何以及是否更新,从而在稳定性和新鲜度之间实现动态权衡。

总的来说,外部内存更新已从手动触发的校正过渡到自我调节的、时间感知的学习过程,通过LLM驱动的检索、冲突检测和修订来保持事实一致性和结构稳定性。

模型编辑 模型编辑在模型的参数空间内执行直接修改,以纠正或注入知识,而无需完全重新训练,代表隐式知识更新。重新训练成本高昂且容易发生灾难性遗忘。模型编辑能够进行精确、低成本的修正,增强适应性和内部知识保留。

模型编辑的方法主要分为两类。(1) 显式定位和修改:ROME通过梯度追踪识别编码特定知识的参数区域,并执行有针对性的权重更新;模型编辑器网络训练一个辅助元编辑器网络来预测最佳参数调整。(2) 潜在空间自更新:MEMORYLLM在Transformer层内嵌入一个内存池,定期替换记忆词元以整合新知识;M+维护双层记忆,丢弃过时的短期条目并将关键信息压缩到长期存储中。

像ChemAgent这样的混合方法进一步将外部内存更新与内部模型编辑相结合,同步事实和表示的变化,以实现快速跨领域适应。

总结 从实现的角度来看,内存更新侧重于由新记忆的到达触发的冲突解决和知识修订,而内存整合强调新旧知识的整合与抽象。上面讨论的两种内存更新策略建立了一个涉及外部数据库中冲突解决和模型内参数编辑的双路径机制,使智能体能够执行持续自我修正并支持长期演化。关键的挑战是稳定性-可塑性困境:确定何时覆盖现有知识,何时将新信息视为噪声。错误的更新可能覆盖关键信息,导致知识退化和错误推理。

5.2.3 遗忘

内存遗忘是指故意移除过时、冗余或低价值信息,以释放容量并保持对关键知识的关注。与更新机制解决记忆之间的冲突不同,遗忘优先考虑消除过时信息以确保效率和相关性。随着时间的推移,无限制的记忆积累会导致噪声增加、检索延迟以及来自过时知识的干扰。受控遗忘有助于缓解过载并保持认知焦点。然而,过于激进的剪枝可能会抹去罕见但必要的知识,损害长期语境下的推理连续性。

遗忘机制可以分为基于时间的遗忘、基于频率的遗忘和重要性驱动的遗忘,分别对应于创建时间、检索活动和综合语义评估。

基于时间的遗忘 时间驱动的遗忘仅考虑记忆的创建时间,随着时间的推移逐渐削弱它们的强度,以模拟人类记忆的消退。MemGPT在上下文溢出时驱逐最早的消息。Xu等人和王等人采用随机词元替换,替换比例为K/N,以模拟人类认知中的指数遗忘,一旦池子超出容量就丢弃最旧的条目。与显式删除旧记忆不同,MAICC通过随时间逐渐衰减记忆的权重来实现软遗忘。这个过程模仿了自然的遗忘,确保持续适应而不造成历史过载。

基于频率的遗忘 频率驱动的遗忘基于检索行为对记忆进行优先级排序,保留频繁访问的条目,同时丢弃不活跃的条目。XMem采用LFU策略移除低频条目;KARMA使用计数布隆过滤器跟踪访问频率;MemOS应用LRU策略,移除长时间未使用的条目,同时归档高活跃度的条目。这确保了高效的检索和存储平衡。通过区分创建时间和检索频率,这两个轴形成了一个更正交的分类法:基于时间的衰减捕获了自然的时间老化,而基于频率的遗忘反映了使用动态,共同维护系统效率和时效性。

重要性驱动的遗忘 重要性驱动的遗忘整合了时间、频率和语义信号,以保留高价值知识,同时剪枝冗余。早期工作如Zhong等人和陈等人通过组合时间衰减和访问频率的综合得分来量化重要性,实现了基于数值的选择性遗忘。后来的方法演变为语义级评估:VLN通过相似性聚类对语义冗余的记忆进行池化,而Livia整合了情感显著性和上下文相关性来模拟情感驱动的选择性遗忘。随着LLM发展出越来越强大的判断能力,TiM和MemTool利用LLM评估记忆重要性,并显式地剪枝或遗忘较不重要的记忆。这种转变反映了从静态数值评分到语义智能的过渡。智能体现在能够进行有意识的遗忘,并选择性地保留与任务上下文、语义和情感线索最相关的记忆。

总结 基于时间的衰减反映了记忆的自然时间褪色,基于频率的遗忘确保了对常用记忆的高效访问,而重要性驱动的遗忘引入了语义识别。这三种遗忘机制共同决定了智能体内存如何保持时效性、高效可访问性和语义相关性。然而,启发式遗忘机制(如LRU)可能会消除长尾知识,这些知识很少被访问但对正确决策至关重要。因此,当存储成本不是关键约束时,许多内存系统避免直接删除某些记忆。

以上讨论描述了先前工作如何在不同阶段手动设计内存架构,使智能体的内存内容能够在线演化。最近,MemEvolve提出了一个元演化框架,共同演化智能体的经验知识及其底层内存架构,允许内存框架本身持续学习和适应。

5.3 内存检索

我们将内存检索定义为在正确的时间从某个内存存储库中检索相关且简洁的知识片段以支持当前推理任务的过程。关键挑战在于在大型内存存储中高效且准确地定位所需的知识片段。为了解决这个问题,许多算法采用启发式策略或可学习模型来优化检索过程的各个阶段。根据检索的执行顺序,这个过程可以分解为四个方面。图10提供了此检索管道的结构化概述,根据它们在检索阶段中的角色组织现有方法。

• 检索时机和意图 (第5.3.1节) 确定内存检索的具体时刻和目标,从被动的、指令驱动的触发转变为自主的、自我调节的决策。

• 查询构建 (第5.3.2节) 通过将查询分解或重写为有效的检索信号,弥合用户原始输入与内存索引之间的语义差距。

• 检索策略 (第5.3.3节) 在内存库上执行搜索,采用从稀疏词法匹配到密集语义嵌入和结构感知图遍历的范式。

• 检索后处理 (第5.3.4节) 通过重新排序、过滤和聚合来精炼检索到的原始片段,确保提供给模型的最终上下文简洁连贯。

总的来说,这些机制将内存检索从静态搜索操作转变为动态认知过程。检索时机和意图决定何时何地检索。接下来,查询构建指定检索什么,检索策略侧重于如何执行检索。最后,检索后处理决定如何整合和使用检索到的信息。一个稳健的智能体系统通常会在一个统一的管道中编排这些组件,使智能体能够接近人类联想记忆激活的方式,实现高效的知识访问。

图10 智能体系统中内存检索方法的分类。

5.3.1 检索时机和意图

检索的意图和时机决定了何时触发检索机制以及查询哪个内存存储。现有内存系统在这方面采用不同的设计选择,从始终开启的检索到由显式指令或内部信号触发的检索。例如,MIRIX对每个查询都从所有六个内存数据库执行检索并连接检索到的内容,反映了一种优先考虑全面内存访问的设计。其他方法则旨在更有选择性地触发检索,允许模型决定内存访问的时机和范围,这可以导致更精准和高效地使用内存资源。在本小节中,我们从两个互补的视角回顾文献:自动检索时机和自动检索意图。

自动检索时机 这个术语指的是模型在推理过程中自主决定何时触发内存检索操作的能力。最简单的策略是将决策委托给LLM或外部控制器,允许它仅从查询中确定是否需要检索。例如,MemGPT和MemTool允许LLM本身调用检索函数,从而在类似操作系统的框架内实现对外部内存的高效访问。然而,这些方法仅依赖来自查询的静态判断,忽略了模型在推理过程中动态演化的认知状态。

为了解决这个限制,最近的工作将快慢思考机制整合到检索时机中。例如,ComoRAG和PRIME首先产生一个快速响应,然后让智能体评估其充分性。如果初始推理被认为不足,系统会基于失败反馈触发更深入的检索和推理。MemGen通过将显式的智能体级决策转化为一个可训练的、潜在的过程来进一步精炼触发机制。它引入了记忆触发器,从潜在展开状态中检测关键的检索时刻,从而在保持端到端可微性的同时提高了检索时机的精确度。

自动检索意图 这个方面涉及模型在分层存储形式中自主决定访问哪个内存源的能力。例如,AgentRR基于环境反馈动态切换低级程序模板和高级经验抽象。然而,它依赖于显式反馈,这限制了其在开放式推理环境中的适用性。

为了克服这个限制,MemOS采用了一个MemScheduler,基于用户级、任务级或组织级上下文,在参数化内存、激活内存和明文内存之间动态选择。然而,这种平面选择方案忽略了内存系统的层次结构。H-MEM通过引入基于索引的路由机制来解决这个问题,它执行从粗到细的检索,从领域层移动到情节层,并逐步将搜索空间缩小到最相关的子记忆。这种分层路由不仅提高了检索精度,还减轻了信息过载。

总结 自主的时机和意图有助于减少计算开销并抑制不必要的噪声,但也可能产生潜在漏洞。当智能体高估其内部知识而未在需要时发起检索时,系统可能陷入静默失败模式,知识空白可能导致产生幻觉输出。因此,需要取得平衡:在正确时刻为智能体提供必要信息,同时避免过度检索引入噪声。

5.3.2 查询构建

启动检索过程后,下一个挑战在于将原始查询转化为与内存索引对齐的有效检索信号。查询构建充当用户表面话语与内存潜在存储之间的转换层。传统方法通常直接基于用户查询执行检索,这虽然简单但无法使查询语义与内存索引的语义对齐。为了弥合这一差距,智能体内存系统主动进行查询分解或查询重写,生成与内存潜在结构更匹配的中间检索信号。

查询分解 这种方法将复杂查询分解为更简单的子查询,允许系统检索更细粒度和相关的信息。这种分解通过实现模块化检索和对中间结果的推理,缓解了一次性检索的瓶颈。例如,Visconde和ChemAgent利用LLM将原始问题分解为子问题,从内存中为每个子问题检索候选结果,最后将它们整合为连贯的答案。然而,这些方法缺乏全局规划。为了解决这个问题,PRIME和MA-RAG引入了一个规划器智能体,受ReAct范式的启发,首先制定一个全局检索计划,然后再将其分解为子查询。然而,这些方法主要依赖于问题驱动的分解,因此无法明确识别模型具体缺失什么知识。为了使子查询更有针对性,Agent KB采用了两阶段检索过程,其中教师模型观察学生模型的失败,并相应地生成细粒度的子查询。这种有针对性的分解提高了检索精度,并在知识密集型任务中减少了不相关的结果。

查询重写 这种策略不是分解,而是重写原始查询或生成假设性文档,以在检索前精炼其语义。这种重写减轻了用户意图与内存索引之间的不匹配。例如,HyDE指示LLM以零样本方式生成一个假设性文档,并使用其语义嵌入进行检索。生成的文档封装了期望的语义,有效地弥合了用户查询与目标内存之间的差距。MemoRAG通过将全局内存纳入假设性文档生成来扩展这一思想。它首先压缩全局内存,然后基于查询和压缩内存生成一个草稿答案;这个草稿随后被用作重写的查询。由于草稿可以访问全局内存上下文,它更忠实地捕获用户意图并揭示隐式信息需求。类似地,MemGuide利用对话上下文提示LLM生成一个简洁的、类似命令的短语,作为检索的高级意图描述。除了直接提示LLM重写查询外,Rewrite-Retrieve-Read通过强化学习训练一个小语言模型作为专用写手,而ToC采用澄清树来逐步精炼和指定用户的检索目标。

总结 这两种范式,分解和重写,并非互斥。Auto-RAG通过在相同检索条件下评估HyDE和Visconde,然后为给定任务选择表现最好的策略,从而将两者集成。这项工作的发现表明,内存检索查询的质量对推理性能有实质性影响。与早期主要关注设计复杂内存架构的研究不同,最近的研究越来越强调检索构建过程,将内存的角色转向服务于检索。选择用什么来检索无疑是这个过程的关键组成部分。

5.3.3 检索策略

在明确了检索目标后,我们获得了一个意图明确的查询。下一个核心挑战在于利用这个查询从庞大而复杂的内存存储库中高效、准确地检索到真正相关的知识。检索策略充当查询与内存库之间的桥梁,其设计直接决定了检索效率和结果质量。在本节中,我们系统地回顾了各种检索范式,并分析了它们的优势、局限性和应用场景——从基于关键词匹配的传统稀疏检索,到使用语义嵌入的现代密集检索,再到用于结构化知识的基于图的检索,再到新兴的生成式检索方法,最后到集成多种范式的混合检索技术。

词法检索 这种策略依赖于关键词匹配来定位相关文档,代表方法包括TF-IDF和BM25。TF-IDF基于词频和逆文档频率衡量关键词的重要性,实现快速且可解释的检索。BM25通过引入词频饱和与文档长度归一化进一步改进了这种方法。这类方法常用于精度导向的检索场景,其中结果的准确性和相关性优先于召回率。然而,纯粹的词法匹配难以捕获语义变化和上下文关系,使其对语言表达差异高度敏感,因此在开放领域知识或多模态内存设置中效果较差。

语义检索 这种策略将查询和内存条目编码到共享的嵌入空间中,并基于语义相似度而非词法重叠进行匹配。代表性方法利用语义编码器,包括Sentence-BERT和CLIP。在内存系统中,这种方法能更好地捕获任务上下文,并支持语义泛化和模糊匹配,使其成为大多数智能体内存框架的默认选择。然而,语义漂移和强制性的top-K检索常常引入检索噪声和虚假回忆。为了解决这些问题,最近的系统加入了动态检索策略、重排序模块和混合检索方案。

图检索 这种策略不仅利用语义信号,还利用图的显式拓扑结构,从而实现更精确和结构感知的检索。通过直接访问结构路径,这些方法展现出更强的多跳推理能力,并能更有效地探索长距离依赖。此外,将关系结构视为推理路径上的约束,自然支持由精确规则和符号约束引导的检索。代表性方法如AriGraph、EMG-RAG、Mem0^g和SGMem首先识别最相关的节点或三元组,然后扩展到它们的语义相关的K跳邻居,构建一个自我图。HippoRAG在以检索节点为种子的图上执行个性化PageRank,并根据其余节点与这些种子的接近程度进行排序,从而实现有效的多跳检索。超越固定的扩展规则,CAM和D-SMART利用LLM来引导子图探索:CAM使用LLM为中心节点的信息性邻居和子节点进行联想探索,而D-SMART将LLM视为规划器,在KG记忆上执行束搜索,以检索目标实体的一跳邻居以及连接给定实体对的关系。对于时间图,Zep和MemoTime进一步支持在显式时间约束下的实体子图构建和关系检索,确保返回的结果满足所需的时间规则。

生成式检索 这种策略取代词法或语义检索,采用一个直接生成相关文档标识符的模型。通过将检索框定为条件生成任务,模型隐式地将候选文档存储在其参数中,并在解码期间执行深度的查询-文档交互。利用预训练语言模型的语义能力,这种范式通常优于传统的检索方法,尤其是在小规模设置中。然而,生成式检索需要额外训练以将所有候选文档的语义内化,导致在语料库演化时可扩展性有限。由于这些原因,智能体内存系统对这一范式的关注相对较少,尽管其生成与检索的紧密结合表明存在未开发的潜力。

混合检索 这种策略集成了多种检索范式的优势。像Agent KB和MIRIX等系统结合了词法和语义检索,以平衡精确的术语或工具匹配与更广泛的语义对齐。类似地,Semantic Underlining在语义嵌入和符号倒排索引上执行并行搜索,以实现互补覆盖。其他一些方法结合多个评估信号来引导检索。例如,Generative Agents通过一个累积新颖性、重要性和相关性的评分方案说明了这种多因素方法。MAICC采用混合效用评分函数,结合与全局和预测个体回报的相似性。在基于图的环境中,检索通常分两个阶段进行:语义检索首先识别相关节点或三元组,随后利用图拓扑来扩展搜索空间。

在数据库基础设施层面,MemoriesDB引入了一个为长期智能体内存设计的时间-语义-关系数据库,提供了一个将这些维度整合到统一存储和访问框架中的混合检索架构。

通过融合异质检索信号,混合方法在保持关键词匹配精度的同时,融入了语义方法的上下文理解,最终产生更全面和相关的检索结果。

5.3.4 检索后处理

初始检索通常返回冗余、嘈杂或语义不一致的片段。将这些结果直接注入提示可能会导致过长的上下文、冲突的信息以及被不相关内容分散注意力的推理。因此,检索后处理对于确保提示质量变得至关重要。其目标是将检索结果提炼成一个简洁、准确且语义连贯的上下文。在实践中,两个组成部分至关重要:(1) 重新排序和过滤:执行细粒度的相关性估计,以移除不相关或过时的记忆,并对剩余片段重新排序,从而减少噪声和冗余。(2) 聚合和压缩:将检索到的记忆与原始查询集成,消除重复,合并语义相似的信息,并重构一个紧凑且连贯的最终上下文。

重新排序和过滤 为了维护简洁连贯的上下文,初始检索结果会经过重新排序和过滤,通过移除低相关性项来确保上下文的简洁性。早期方法依赖启发式标准来评估语义一致性。例如,Semantic Anchoring整合了向量相似性与实体级和话语级对齐,而RCR-Router结合了多个手工设计的信号,包括角色相关性、任务阶段优先级和新近性。然而,这些方法通常需要大量的超参数调优来平衡异构的重要性分数。为了减轻这一负担,learn-to-memorize将分数聚合表述为强化学习问题,使模型能够学习检索信号上的最优权重。虽然这些技术主要优化语义连贯性,但需要严格时间推理的场景需要额外的约束:Rasmussen等人和Tan等人基于记忆的时间戳和有效性窗口进行过滤,以满足复杂的时间依赖关系。

随着LLM能力的增强,最近的方法利用其内在的语言理解能力直接评估记忆质量。Memory-R1和Westhäuer等人均引入了基于LLM的评估器,在生成最终响应之前过滤检索到的内容。然而,基于提示的过滤仍然受限于LLM的固有能力以及提示语义与下游用途之间的不匹配。因此,许多系统训练辅助模型以更稳健地估计记忆重要性。Memento使用Q学习预测检索到的条目对正确答案有贡献的概率,而MemGuide微调LLaMA-8B以使用边际槽位完成增益对候选进行重排序。这些重新排序和过滤策略在不修改底层检索器的情况下精炼了检索结果,使其能够与任何预训练检索模型兼容,同时支持特定任务的优化。

聚合和压缩 另一种通过检索后处理提高下游推理质量和效率的方法是聚合和压缩。此过程将检索到的证据与原始查询集成,形成一个连贯且紧凑的上下文。与旨在移除条目的过滤和重新排序不同,聚合和压缩旨在整合多条证据并可能生成新内容。例如,SGMem将检索到的多个句子聚合成一个简洁的摘要,而CoMEM将跨模态的检索结果融合成统一的表示。此外,一些方法利用LLM的生成能力,基于检索到的证据直接合成最终上下文,而不是简单地将它们串联起来。这种生成式聚合可以产生更流畅、更连贯的响应,但同时也带来了引入新错误的潜在风险。

总结 检索后处理是确保最终上下文高质量的关键步骤。通过重新排序和过滤消除噪声,通过聚合和压缩整合信息,这些技术共同提升了内存检索的效率和有效性,确保了最终用于推理的上下文既简洁又相关。

6 资源和框架

6.1 基准测试和数据集

近年来,出现了大量旨在评估LLM智能体内存能力的基准测试。这些基准测试在任务设计、交互形式和评估指标上差异显著,反映了智能体内存研究的多面性。我们将在表8中对这些基准测试进行总结。根据它们的核心关注点,我们将这些基准测试分为两大类:(i) 专门为内存、终身学习或自我演化智能体评估而设计的基准测试;(ii) 其他与智能体相关的基准测试,它们通过顺序、多步或多任务交互隐式地给长视界内存带来压力。

表8 与LLM智能体内存、长期、终身学习和自我演化评估相关的基准测试概述。

6.1.1 用于内存/终身/自我演化智能体的基准测试

一类重要的基准测试明确旨在评估LLM智能体的内存能力。这些基准测试通常要求智能体在扩展的多轮交互中维持、更新和利用信息,测试其是否能够回忆事实细节、跟踪用户偏好或在长时间延迟后保持一致的行为。

基于内存的基准测试侧重于评估智能体在长时间交互后准确回忆信息的能力。这包括处理包含数千轮对话的对话历史,并在后续查询中测试对早期提到的细节的记忆。像LoCoMo、LongMemEval和MemBench这样的基准测试要求智能体处理长时间对话,并回答需要回忆特定事实或事件的问题。类似地,像StoryBench和BABILong这样的基准测试将智能体置于多情节叙事或多跳推理任务中,在这些任务中,成功依赖于在长上下文中整合信息。

终身学习基准测试将智能体的内存评估扩展到跨任务或跨会话的持续适应。在这些设置中,智能体必须在不同的任务序列中持续运行,在保留先前获得的知识的同时适应新信息。像LifelongAgentBench和StreamBench这样的基准测试模拟了任务不断演化的场景,要求智能体学习新任务而不忘记先前见过的任务或对话,从而量化智能体在适应新用户、新领域或新交互模式时保留有用知识的效果。

自我演化智能体基准测试更进一步,将智能体视为一个可以通过交互迭代地精炼自身记忆、技能和策略的开放系统。这里,重点不仅在于存储和回忆信息,还在于元级行为,如自我反思、记忆编辑、工具增强存储以及跨多个情节或游戏的策略改进。像MemoryAgentBench、Evo-Memory以及其他多情节或任务式环境,可以通过允许智能体积累轨迹、合成更高层次的抽象,并根据自己过去的表现调整未来行为,在自我演化环境中实例化。从这个角度看,这些基准测试提供了一个测试平台,用于评估智能体是否能自主引导出随时间推移更有能力的行为——将静态任务转变为长期适应、策略精炼和真正自我改进的记忆使用的竞技场。

6.1.2 其他相关基准测试

除了专门为内存或终身学习设计的基准测试外,大量面向智能体和长视界评估的套件也与研究基于LLM的智能体的内存相关能力相关。尽管这些基准测试最初是为了评估其他方面(如工具使用、具身交互或知识密集型推理)而引入的,但它们顺序、多步和多任务的性质隐含地对长期信息保留、上下文管理和状态跟踪提出了强烈要求。

具身和交互式环境构成了此类基准测试的一个主要类别。像ALFWorld和ScienceWorld这样的框架在模拟的基于文本或部分接地环境中评估智能体,在这些环境中,成功需要跨扩展的动作序列记住过去的观察、中间目标和环境动态。类似地,BabyAI专注于语言条件下的指令跟踪,跨越时间延长的情节,隐式测试智能体在整个交互过程中维护任务相关状态的能力。虽然这些基准测试没有显式建模外部内存模块,但有效性能通常取决于智能体在长视界中保留和重用信息的能力。

另一个突出的类别包括基于Web和工具增强的交互基准测试。WebShop、WebArena和MMInA评估在现实或半现实的Web环境中运行的智能体,涉及多步导航、信息收集和决策。这些设置自然导致长上下文轨迹,其中早期的动作、检索到的信息或用户约束必须在后期被回忆和整合。ToolBench通过评估智能体在复杂工作流中选择和调用API的能力进一步扩展了这一范式,其中对先前工具输出和工具使用经验的记忆对于连贯执行至关重要。

多任务和通用智能体评估平台也为内存使用提供了间接但有价值的信号。AgentGym和AgentBoard将多样的环境或任务整合到统一的评估套件中,要求智能体在跨任务适应的同时保留特定任务的知识和策略。基于PDDL的规划环境,通常用于智能体基准测试,评估结构化动作空间上的策略推理,智能体通过跨情节积累和重用经验来提高长视界规划性能。

最后,几个最近的基准测试针对苛刻的现实或接近现实世界的推理场景,这些场景固有地强调长上下文和跨步一致性。SWE-Bench Verified在真实的软件仓库上评估代码修复,智能体必须推理长文件并跟踪演化的代码状态。GAIA和xBench评估深度研究和搜索密集型任务,这些任务需要综合跨多个步骤和来源收集的信息。GenAI-Bench虽然侧重于多模态生成质量,但也涉及复杂的工作流,其中对先前提示、中间输出或视觉约束的记忆扮演着重要角色。

总的来说,这些基准测试通过将基于LLM的智能体置于丰富、交互式和长视界的环境中,补充了显式的内存导向评估。尽管内存不总是明确的目标测量,但在这些环境中持续的性能隐式依赖于智能体管理长上下文、保留相关信息以及将过去经验整合到持续决策中的能力,使它们成为在实践中研究内存相关行为的宝贵试验场。

表9 基于LLM的智能体的代表性开源内存框架概述。

6.2 开源框架

一个快速发展的开源内存框架生态系统旨在为构建内存增强的LLM智能体提供可重用的基础设施。表9总结了代表性开源内存框架的结构化比较,包括它们支持的内存类型、架构抽象和评估覆盖范围。大多数这些框架通过向量或结构化存储支持事实内存,并且越来越多的子集也对经验轨迹进行建模,如对话历史、用户行为和情节摘要,而多模态内存最近才出现。面向LLM智能体的开源内存框架涵盖了从以智能体为中心的、具有丰富分层内存抽象的框架,到更通用的检索或内存即服务后端,例如MemGPT、Mem0、Membase、MemoryOS、MemOS、Zep、LangMem、SuperMemory、Cognee、Memory、Pinecone、Chroma、Weaviate、Second Me、MemU、MemEngine、Memori、ReMe、AgentMemory和MineContext。其中许多框架明确区分短期和长期存储,并提供基于图的、基于画像的或模块化的内存空间,其中一些已经开始在基于内存的基准测试上报告结果。其余的通常为实际部署提供可扩展的、托管的向量存储或内存数据库。

7 立场与前沿

本节阐述了基于LLM的智能体内存系统设计中的关键立场和新兴前沿。超越对现有方法的描述性调查,我们专注于范式层面的转变,这些转变重新定义了在长视界智能体环境中如何构建、管理和优化内存。具体来说,我们考察了从以检索为中心到生成式内存的转变,从手动工程化到自主管理的内存系统的转变,以及从启发式管道到强化学习驱动的内存控制的转变。我们进一步讨论了这些转变如何与多模态推理、多智能体协作和可信赖性相交织,并概述了可能塑造下一代智能体内存架构的开放性挑战和研究方向。

7.1 内存检索 vs. 内存生成

7.1.1 回顾:从内存检索到内存生成

从历史上看,智能体内存研究的主导范式一直围绕着内存检索。在此范式下,主要目标是基于当前上下文,从现有内存存储中识别、过滤和选择最相关的内存条目。大量先前工作致力于通过更好的索引策略、相似性度量、重排序模型或结构化表示(如知识图谱)来提高检索精度。在实跬中,这包括使用密集嵌入的向量相似性搜索、结合词法和语义信号的混合检索、分层过滤和基于图的遍历等技术。这些方法强调访问存储信息的精度和召回率,隐含地假设内存库本身已经形成良好。

然而,最近越来越多的注意力转向了内存生成。内存生成不是将内存视为要查询的静态存储库,而是强调智能体按需主动合成新的内存表示的能力。目标不仅仅是检索和连接现有片段,而是以适应当前上下文和未来效用的方式整合、压缩和重组信息。这种转变反映了日益增长的认识:有效的内存使用通常需要抽象和重组,尤其是当原始存储信息嘈杂、冗余或与当前任务不一致时。

现有的内存生成方法可以大致分为两个方向。一条工作线采用检索后生成策略,其中检索到的内存项作为重建的原始材料。在这种设置中,智能体首先访问相关记忆的子集,然后生成一个更简洁、连贯且特定于上下文的精炼内存表示,如ComoRAG、G-Memory和CoMEM中实现的那样。这种方法在保留历史信息的同时,实现了自适应总结和重组。第二条工作线探索直接内存生成,其中内存的产生没有任何显式检索步骤。相反,智能体直接从当前上下文、交互历史或潜在内部状态生成内存表示。像MemGen和VisMem这样的系统例证了这一方向,通过构建为当前任务定制的潜在记忆词元,完全绕过了显式内存查找。

7.1.2 未来展望

展望未来,我们预计生成式方法将在智能体内存系统中扮演越来越核心的角色。我们强调未来的生成式内存机制应理想地具备的三个特性。

首先,生成式内存应该是上下文自适应的。内存系统不应存储通用的摘要,而应生成明确针对智能体预期未来需求优化的表示。这包括使内存的粒度、抽象级别和语义焦点适应不同的任务、问题解决阶段或交互模式。

其次,生成式内存应支持跨异质信号的集成。智能体越来越多地操作于多种模态和信息源,包括文本、代码、工具输出和环境反馈。内存生成为将这些碎片化的信号融合成统一的表示提供了一种自然的机制,这些表示比单独的原始连接或检索更有用于下游推理。我们假设潜在内存可能是实现这一目标的有希望的技术路径。

第三,生成式内存应该是可学习的和自我优化的。未来的系统不应依赖手动指定的生成规则,而应通过优化信号学习何时以及如何生成内存,例如强化学习或长视界任务性能。在这种观点下,内存生成成为智能体策略的一个组成部分,与推理和决策共同演化。

7.2 自动化内存管理

7.2.1 回顾:从手工制作到自动构建的内存系统

现有的智能体内存系统通常依赖手动设计的策略来确定存储什么信息、何时使用它以及如何更新或检索它。通过用详细指令指导固定的LLM、预定义的阈值或由人类专家起草的显式人工规则,系统设计者可以以相对较低的计算和工程成本将内存模块集成到当前的智能体框架中,实现快速原型设计和部署。此外,它们还提供可解释性、可重现性和可控性,允许开发者精确指定内存的状态和行为。然而,与其他领域的专家系统类似,这种手工设计的方法存在显著局限性:它们天生不灵活,并且常常无法泛化到多样、动态的环境中。因此,这些系统在长期或开放式交互中往往表现不佳。

智能体内存研究的近期发展开始通过使智能体自身能够自主管理内存演化和检索来解决这些限制。例如,CAM使LLM智能体能够自动将细粒度的内存条目聚类为高级抽象单元。Memory-R1引入了一个配备专用“内存管理器”工具的辅助智能体来处理内存更新。尽管取得了这些进展,当前的解决方案仍然受限:许多仍由手动工程规则驱动,或者针对狭窄的、特定任务的学习目标进行优化,使其难以泛化到开放环境。

7.2.2 未来展望

为了支持真正自动化的内存管理,一个有希望的方向是通过显式工具调用将内存构建、演化和检索直接集成到智能体的决策循环中,使智能体本身能够推理内存操作,而不是依赖外部模块或手工设计的工作流。与现有将智能体内部推理过程与其内存管理操作分开的设计相比,LLM智能体在这种基于工具的策略中可以精确地知道它执行了什么内存操作,从而产生更连贯、透明和上下文扎根的内存行为。

另一个关键前沿在于开发自我优化的内存结构,采用受认知系统启发的分层和自适应架构。首先,分层内存结构已被证明能提高效率和性能。超越分层,能够动态链接、索引和重建记忆条目的自我演化内存系统使内存存储本身能够随着时间的推移自组织,支持更丰富的推理并减少对手工设计规则的依赖。最终,这种自适应、自组织的内存架构为能够维护稳健、可扩展且真正自主的内存管理的智能体铺平了道路。

7.3 强化学习与智能体内存的相遇

7.3.1 回顾:RL正在内化智能体的内存管理能力

强化学习正在迅速重塑现代基于LLM的智能体的发展范式。在广泛的智能体能力谱系中,包括规划、推理、工具使用,以及跨不同的任务领域,如数学推理、深度研究和软件工程,RL已经开始在推动智能体性能方面发挥核心作用。内存作为智能体能力的基础组件之一,遵循着从基于管道到模型原生范式的类似趋势。智能体内存研究社区正集体从早期的启发式和手动工程设计转向RL日益主导关键决策的方法。展望未来,完全基于RL的内存系统有理由最终成为主导方向。在详细讨论这一轨迹之前,我们简要概述了发展的第一阶段。这种内存管理逐步被内化并通过强化学习优化的转变,在图11中示意性地展示。

图11 RL赋能的智能体内存系统的演变。

无RL内存系统 前面综述的很大一部分智能体内存文献可以归类为无RL内存系统。这些方法通常依赖启发式或手动指定的机制,例如受遗忘曲线启发的固定阈值规则,在MemOS、Mem0和MemoBase等框架中发现的刚性语义搜索管道,或用于存储内存块的简单串联策略。在一些系统中,LLM以看似智能体的方式参与内存管理,但底层行为完全由提示驱动。LLM被要求生成内存条目,但没有接受任何针对有效内存控制的专门训练,如Dynamic Cheatsheet、ExpeL、EvolveR和G-Memory等系统所示。这类方法主导了该领域的早期工作,并且由于其简单性和实用性,可能会在一段时间内保持影响力。

RL辅助内存系统 随着领域的发展,许多工作开始将基于RL的方法纳入内存管道的选定组件中。这一方向的一个早期尝试是RMM,它在基于BM25或其他语义相似性指标的初始检索阶段之后,采用轻量级策略梯度学习器对内存块进行排序。后来的系统探索了更雄心勃勃的设计。例如,Mem-α将整个内存构建过程委托给一个用RL训练的智能体,而Memory-R1采用了类似的理念。一个快速扩展的研究方向是调查智能体如何在超长多轮任务中自主折叠、压缩和管理上下文。这个设置对应于工作内存的管理。该领域的许多领先系统都是用RL训练的,包括但不限于Context Folding、Memory-as-Action、MemSearcher和IterResearch。这些RL辅助方法已经展现出强大的能力,并指向了RL在未来内存系统设计中日益增长的作用。

7.3.2 未来展望

展望未来,我们预计完全由RL驱动的内存系统将构成智能体内存演化的下一个主要阶段。我们强调这类系统应理想地具备的两个特性。

首先,由智能体管理的内存架构应最小化对人类工程先验的依赖。许多现有框架继承了受人类认知启发的设计模式,如皮质或海马体类比,或预定义的分层分类法,将内存划分为情景、语义和核心类别。尽管这些抽象对于早期工作的定位是有用的,但它们可能不是人工智能体在复杂环境中运行的最有效或最自然的结构。完全由RL驱动的设置提供了可能性,让智能体能够从优化动态中直接涌现出新颖且可能更合适的内存组织,而不是来自人类直觉。在这种观点下,智能体被鼓励通过RL激励设计新的内存格式、存储模式或更新规则,从而实现适应性强且具有创造性的内存架构,而非手工制作。

其次,未来的内存系统应为智能体提供对所有内存管理阶段的完全控制。当前的RL辅助方法通常只干预内存生命周期的子集。例如,Mem-α自动化了内存写入的某些方面,但仍依赖手动定义的检索管道,而像MemSearcher这样的系统主要关注短期工作内存,而不处理长期整合或演化。一个完全智能体的内存系统将要求智能体以集成的方式自主处理多粒度内存形成、内存演化和内存检索。实现这种控制水平几乎肯定需要端到端的RL训练,因为启发式或基于提示的方法不足以协调这些组件在长时间范围内的复杂交互。

这两个方向共同预示着一个未来,内存不仅仅是附加在LLM智能体上的辅助机制,而是一个完全可学习和自组织的子系统,通过RL与智能体共同演化。这样的系统具有实现人工智能真正持续学习和长期能力的潜力。

7.4 多模态内存

7.4.1 回顾

随着基于文本的内存研究日益成熟和广泛探索,以及多模态大语言模型和联合支持多模态理解和生成的统一模型的持续进步,注意力自然扩展到了多模态内存。这种转变反映了更广泛的认识,即许多现实世界的智能体设置本质上是多模态的,仅限文本的内存系统不足以支持在复杂环境中的长视界推理和交互。

多模态内存的现有努力可以大致分为两个互补的方向。第一个方向侧重于使多模态智能体能够存储、检索和利用源自多样感官输入的记忆。这一方向是智能体内存的自然延伸,因为在现实环境中运行的智能体不可避免地会遇到异构数据源,包括图像、音频、视频和其他非文本信号。多模态内存的进展程度与相应模态的成熟度密切相关。视觉模态(如图像和视频)受到了最多的关注,导致越来越多的关于视觉和视频内存机制的工作支持视觉接地、时间跟踪和长期场景一致性等任务。相比之下,音频和其他模态的内存系统仍然相对未被充分探索。

第二个方向将内存视为统一模型的使能组件。在这种设置中,内存主要不是用于支持智能体决策,而是用于增强多模态生成和一致性。例如,在图像和视频生成系统中,内存机制通常用于保持实体一致性、跨帧维护世界状态或确保跨长生成周期的连贯性。在这里,内存作为一个稳定结构,将生成锚定到先前生成的内容上,而不是作为智能体经验本身的记录。

7.4.2 未来展望

展望未来,多模态内存很可能成为智能体系统不可或缺的组成部分。随着智能体越来越多地走向具身和交互式设置,它们的信息来源将本质上是多模态的,涵盖感知、行动和环境反馈。有效的内存系统必须因此支持以统一的方式存储、集成和检索异质信号。

尽管最近取得了进展,但目前还没有任何内存系统能提供真正全方位的多模态支持。大多数现有方法仍然专精于单一模态或在模态之间松散耦合。未来的一个关键挑战在于设计能够灵活容纳多样模态同时保持语义对齐和时间连贯性的内存表示和操作。此外,多模态内存必须超越被动存储,以支持抽象、跨模态推理和长期适应。解决这些挑战对于实现能够在丰富的多模态环境中稳健、连贯地运行的智能体至关重要。

8 结论

本综述将智能体内存作为现代基于LLM的智能体系统的基础组成部分进行了考察。通过以统一的形式、功能和动力学视角来构建现有研究,我们阐明了智能体内存的概念图景,并将其置于智能体智能的更广泛演化中。在形式层面,我们确定了三种主要的实现方式:词元级内存、参数化内存和潜在内存,每一种近年来都经历了独特而快速的进展,反映了在表示、适应性和与智能体策略集成方面根本性的权衡。在功能层面,我们超越了先前综述中常见的粗略的长期与短期二分法,提出了一个更细粒度和全面的分类法,根据它们在知识保留、能力积累和任务级推理中的作用区分了事实内存、经验内存和工作内存。这些视角共同揭示了内存不仅仅是辅助存储机制,更是智能体实现时间连贯性、持续适应和长视界能力的基本基质。

除了组织先前工作,我们还确定了关键挑战和新兴方向,这些指向了智能体内存研究的下一阶段。特别是,强化学习的日益整合、多模态和多智能体设置的兴起,以及从以检索为中心到生成式内存范式的转变,预示着一个未来,其中内存系统变得完全可学习、自适应和自组织。这样的系统有潜力将大语言模型从强大但静态的生成器转变为能够持续交互、自我改进和随时间进行原则性推理的智能体。

参考文献

• 标题:Memory in the Age of AI Agents

• 作者:Yuyang Hu,等

• 单位:National University of Singapore, Renmin University of China, Fudan University, Peking University, Nanyang Technological University, Tongji University, University of California San Diego, Hong Kong University of Science and Technology (Guangzhou), Griffith University, Georgia Institute of Technology, OPPO, Oxford University

• 链接:https://arxiv.org/pdf/2512.13564

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询