性能提升400%!AutoResearchClaw自主设计多模态记忆大脑

AI助手在长时间跨度内与用户持续互动时,会积累海量的文本、图像、音频和视频数据。

如何记住并有效提取这些多模态经历,成为限制智能体发展的一大瓶颈。

来自北卡罗来纳大学、宾夕法尼亚大学、加州大学等的研究团队,让完全自动化的AI研究员自己动手,在短短72小时内独立完成数十次实验、修复底层代码漏洞、重构系统架构,最终设计出超越现有人类设定架构的全新多模态记忆系统,并将整体性能提升400%以上。

OMNIMEM框架,拥有终身多模态记忆,团队通过自动化研究管道AutoResearchClaw,让AI自主发现。

机器研究员接管系统重构

构建一个真正能伴随用户一生的多模态记忆体,需要面对复杂的系统工程。

开发者需要决定架构如何设计、检索策略如何搭配、提示词如何编写,还要处理繁杂的数据管道。

这个巨大的设计空间往往相互牵连,牵一发而动全身。依靠人类研究员手动探索,每天顶多只能测试几个配置,极易遗漏关键的组件交互优化。

传统的自动机器学习技术,通常只能在预设的数值参数空间里兜圈子,无法理解代码逻辑,更无法完成诊断漏洞、重写架构和跨组件推理,这些能带来实质性性能飞跃的核心工作。

正因如此,现有的记忆系统难免带有设计者自身的盲区。

研究团队引入了AutoResearchClaw的23阶段自主研究管道,将重构记忆系统的任务完全交给了AI。

只需给这个自动化管道提供一个简陋的单模态纯文本记忆框架作为起点,再接上基准评估接口和大型语言模型API,它便开启了闭环迭代。

在每次循环中,管道会自动分析先前的结果,生成改进假设,在代码层面直接落实修改,并在基准测试上进行评估。

一旦指标提升超过0.5%,它就会推进确认;遇到结果模棱两可便会微调当前假设;连续两次性能下降则会果断撤销更改,掉头尝试新方向。

整个过程在无需人类插手的情况下,在两大核心基准测试上推进了近50次实验。

最终诞生的系统在LoCoMo基准上的F1分数从最初的0.117跃升至0.598,提升幅度高达411%;在Mem-Gallery基准上从0.254提升至0.797,涨幅达214%。

整个自主优化轨迹展现了AI自主研究的突破性能力。

传统自动机器学习所看重的超参数调整带来的收益微乎其微。真正发挥决定性作用的,是修复代码漏洞带来的175%提升,架构修改带来的44%提升,以及提示词工程在特定类别上带来的188%提升。

例如在第1次迭代中,系统敏锐地发现应用程序接口调用缺失了响应格式参数,这个仅需一行代码修复的漏洞原本会导致输出冗长9倍,严重破坏了精度。

到了第5次迭代,管道又自主发现数千个记忆单元的时间戳被错误地标记为数据提取日期,并立刻编写了一个关键字匹配脚本,在无需重新提取数据的情况下修复了99.98%的错误。

上图展示了管道在两个基准测试上的优化轨迹。实线代表被接受的迭代,带有叉号的标记代表失败或被撤销的实验,虚线则是此前行业的最高水平。

机器研究员精准绕过各类陷阱,一路将性能推向新高。

三大核心原则重塑记忆中枢

从最初的纯文本框架起步,自动化研究管道逐步拓展系统边界,最终将其打磨成一个全面支持文本、图像、音频和视频的多模态架构。

这个被命名为OMNIMEM的系统,其运转逻辑清晰地建立在三个被自主挖掘出来的核心原则之上。

系统架构的核心思路,在于对输入信息的精准把控。

面对源源不断的多模态信号,系统会利用轻量级的感知编码器来评估新信息的价值,果断拦截并丢弃冗余内容。

针对视觉信息,系统会比对连续帧的CLIP嵌入向量来捕捉场景变化;针对音频信息,采用VAD(语音活动检测)概率模型过滤掉无声片段;针对文本,系统通过与近期摘要的相似度重合度来剔除近似的重复内容。

这种筛选机制能在不丢失语义内涵的前提下,大幅削减存储压力。

顺利通过新颖度筛选的信号,会被统一打包成MAU(多模态原子单元)。

这种设计巧妙地剥离了轻量级的可搜索元数据与沉重的原始内容。

系统采用了双层存储架构,热存储区域专门存放摘要、嵌入向量以及图结构元数据,保障极速检索;而图像、音频、视频等大体积资产则被安放在冷存储区域,只有在确切需要时才会被按需调用。

通过上方的架构总览可以看到,多模态输入经过特定模态的新颖度检测器过滤后,生成多模态原子单元。它们被分置于热存储与冷存储中,并通过实体提取构建出带有具体类型和关系的知识图谱。

存得好是为了找得准。

面对用户查询,系统没有选择把所有检索到的内容,一股脑全部塞进语言模型的上下文中,而是采用金字塔式的递进策略,在严格的令牌预算控制下分阶段扩展信息。

检索的第一步是混合搜索。

系统并行使用FAISS(FacebookAI相似性搜索)进行高维向量密集检索寻找语义相似项,同时利用BM25(最佳匹配25算法)针对摘要进行稀疏的关键字匹配。

自动化管道在这里做出了一项关键发现,放弃了行业内常用的基于分数重新排名的做法,而是采取了集合并集融合策略。

保留密集检索的原始排名顺序,并直接将仅匹配到关键字的结果追加在后方。

事实印证,传统的基于分数重新排名反而会打乱语义顺序,导致性能退化。

混合搜索拿到候选名单后,金字塔机制开始运转。

第一级仅返回相似度排名前列候选项的摘要,每个摘要仅占约10个令牌;第二级针对相似度超过特定阈值的候选项,加载完整的文本或详细说明;第三级才会在严格的预算限制下,按相似度由高到低贪婪地从冷存储中加载图像和音频等原始素材。

层层推进完全依靠确定性规则控制,避开了让语言模型充当裁判所带来的额外延迟。

由于许多现实世界中的询问需要跨越多个相互关联的事件进行推理,系统在创建原子单元时,会让语言模型从摘要中提取实体和带有方向的关系。

同一个现实世界中的实体在不同时期可能有不同的称呼,系统利用名称嵌入向量与字符串相似度结合的方式,将同一对象合并归一,防止节点碎片化。

当用户提出问题时,系统会锁定查询中提及的种子实体,并在设定好的跳数范围内执行有边界的邻居扩展。

与高分图谱实体相链接的记忆单元会与混合搜索的结果相融合,为生成最终答案提供直接的内容匹配以及具有关联性的证据支撑。

事实数据验证架构实力

为了检验这套由机器自主挖掘的架构究竟处于何种水平,研究团队在涵盖各种长线复杂记忆推理的两个基准测试上,将OMNIMEM与业内现有的六大主流记忆系统进行了全面对比。

参与对比的基准系统包括分层情景语义网络、动态事实提取系统、商业级嵌入对话记忆产品,以及基于操作系统概念启发的记忆层级系统。

测试分别在包含多次会话对话的LoCoMo基准,以及包含海量多模态对话和真实图像的Mem-Gallery基准上进行,并在背后接入了五种不同体量的大型语言模型作为基础支撑。

下方的表格详尽展示了在LoCoMo测试中的多跳推理、单跳推理、时间推理、开放领域推理以及整体F1分数,同时列出了在Mem-Gallery测试中的多项精确匹配与文本评估指标。

通过上方详尽的测试结果可以看到,无论是搭载哪个版本的语言模型引擎,新系统都在全面碾压前人。

在LoCoMo基准上,新架构的整体表现大幅度领先于此前的最优方案,特别是在开放领域问题处理上拉开了巨大的差距。

在Mem-Gallery基准上同样势如破竹,F1得分稳定维持在0.749到0.810之间,将其他所有基准系统远远甩在身后。

巨大的性能飞跃源自混合搜索、金字塔检索以及知识图谱增强等底层架构设计的彻底革新,绝非依赖单一维度的修补。

拆解效率背后的机制真相

为了摸清到底是哪些组件在发挥核心作用,研究团队在四个主要语言模型骨干上进行了剥离测试。

数据显示,金字塔扩展机制对整体性能的贡献最为突出,移除后性能大幅下滑17%。

混合搜索紧随其后,贡献占比达14%。

值得注意的是,这两项最举足轻重的设计,正是自动化研究管道在优化过程中投入算力最多、打磨最细致的环节。

语言模型摘要的构建也至关重要,剥离它会导致12%的性能惩罚,证实了紧凑的摘要对于检索质量不可或缺。

在运行效率维度,以往的记忆系统普遍受制于串行的语言模型生成过程,这部分耗时占据了每次查询的绝大比例。OMNIMEM通过引入线程安全的只读索引,成功实现了检索与生成环节的并发执行。

在使用8个并行工作线程的情况下,它实现了每秒处理5.81次查询的吞吐量,比跑得最快的对照系统还要快上3.5倍。

研究团队通过真实场景来体验了这套系统的运转逻辑。

例如,提问Caroline和Melanie两人共同画过什么主题的画作?

回答这个问题需要梳理出两人在不同对话周期中的绘画历史,并从中找出重叠的主题。

密集检索找出了类似Caroline画了日落场景,以及Melanie和孩子画了带棕榈树的日落这两条分属不同时段的记录。

此时仅仅依靠密集分数排名可能存在遗漏,稀疏关键字匹配适时补位,利用绘画这个关键词捞出了更多排在后面的相关记录,二者通过集合并集完美保留了优先级并补全了视野。

知识图谱开始发挥作用,顺着查询对象这两个人员实体一路摸排,顺藤摸瓜找出了绘画和日落这两个概念节点,将表面文字上并未同时提及两人的记忆片段串联在了一起。

金字塔检索机制随即被触发,一级摘要加载后评估相似度达标,立刻解封二级详细对话文本。

语言模型最终在充分的上下文支撑下,准确锁定了日落这个正确答案,得分为满分。

反观对比系统,由于缺乏跨越会话周期的实体链接能力,面对这样的复杂提问只能凭空胡编乱造,得分为零。

自动化研究管道,在智能体记忆重构中展现出的代码理解能力和跨组件协作视野,为处理复杂的系统优化指明了新方向。

一个由机器指导机器进化的全新阶段正在开启,底层框架的设计权杖正在向AI悄然转移。

参考资料:

https://arxiv.org/pdf/2604.01007v1

https://github.com/aiming-lab/AutoResearchClaw

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询