中科院软件所提出“先练习再预测”的AI记忆新框架

这项研究来自中国科学院软件研究所中文信息处理实验室,联合中国科学院大学、复旦大学以及快手科技共同完成,以预印本形式发布于2026年7月,论文编号为arXiv:2607.02881。研究的核心主题是:如何让大语言模型更准确地预测一个人接下来会做什么。
每天你打开短视频应用,系统要猜测你会不会点赞这条视频;你在电商平台浏览,系统要判断你是否会把某件商品加入购物车。背后的技术叫做"行为预测",而当你的历史记录已经积累了成百上千条时,这件事就变得异常棘手。研究团队把这个问题称为"长时序行为预测"——也就是根据一个人漫长的历史行为轨迹,预判他在当下场景中会怎么做。
近年来,大语言模型(可以理解为以ChatGPT为代表的那类能理解和生成自然语言的AI)被引入这一任务,因为它们具备强大的语言理解和推理能力。然而,当历史记录长达数千条时,大模型面临两道几乎无法绕过的坎:第一,用户的真实偏好往往隐藏在细微之处,零散分布在漫长的历史序列里,比如一个人对苹果品牌电子产品的情有独钟,或者每月初集中购买生活必需品的习惯,这些规律不会显眼地贴着标签,需要从海量记录中慢慢归纳;第二,大模型本身存在一些"认知偏见",比如倾向于跟随大众选择、受训练数据的先入为主影响,或者过度关注最近几条记录而忽略更早的历史——这些毛病和用户数据本身无关,是模型自带的"坏习惯"。
过去的主流解决思路是"压缩历史":把几千条记录提炼成摘要,或者用检索技术找出最相关的几条,把这些压缩后的信息塞给模型参考。这条路走的是"减负"逻辑——历史太长,那就想办法让它变短。但研究团队认为,这条路从根子上就没对准问题:压缩并不等于归纳出行为规律,而且无论信息多精简,模型自带的认知偏见依然如故。
研究团队从一个颇具哲学色彩的视角出发重新思考这个问题:历史序列既是负担,也是资源。每一段历史记录,本身就天然构成一道带有标准答案的练习题——前面是场景,后面是用户实际的行动。既然如此,为什么不让模型先在这些练习题上反复操练,从中总结出用户的行为规律和自身容易犯的错误,再去做正式预测呢?
这个思路孵化出了他们提出的框架:PraMem,全称"Practice-derived Experiential Memory",即"从练习中获得的经验性记忆"。
一、PraMem的核心设计:一本会自我进化的"经验手册"
理解PraMem最直观的方式,是把它类比成一位正在备考的学生。这位学生手里有一本厚厚的历史试题集,他不会拿着题集直接上考场,而是先用里面的旧题反复刷题,把错题归纳整理成笔记,记录下"这类题我常犯什么错"和"这类题背后的规律是什么"。到了正式考试,他带着这本凝结了练习心得的笔记入场,自然比那些临场硬读原题的人更有准备。
PraMem就是在给大模型做这件事。它在正式预测之前,先让模型在用户的历史序列上"刷题",积累出一本专属于这位用户的"经验记忆"。这本记忆手册分两部分:一部分叫"行为模式经验",专门记录这位用户的偏好和习惯,主语是"这位用户";另一部分叫"偏见预警经验",专门记录模型在预测这位用户行为时容易掉入的认知陷阱,主语是"我(模型)"。比如,手册里可能写着"这位用户偏爱含有苹果品牌的电子产品",同时也提醒自己"预测时要当心,不要只盯着最近几条记录就做判断,那样容易产生近因偏差"。
为了让这本手册越来越准确,PraMem设计了三个循环往复的动作,像一个持续运转的自我改进机制。
第一个动作叫"经验试炼"。模型从用户历史序列中抽取一段,构造成一道有标准答案的练习题,然后对照当前的经验手册,进行明确的逐步推理——先找出手册里与这道题相关的行为模式,再找出手册里与这道题相关的偏见预警,最后基于这两步推理给出预测。这个"明确的逐步推理"过程非常关键,它迫使模型真正调用手册里的内容,而不是走过场。
第二个动作叫"反思提案生成"。对照标准答案之后,模型对这道题进行复盘,思考:如果预测对了,是哪条经验起了作用,还是碰巧蒙对了?如果预测错了,是哪条经验不准确、缺失,还是某个偏见在作祟?复盘完毕,模型提出一批修改手册的建议,比如"把某条经验描述得更精确"、"补充一条新的行为规律"、"增加一条偏见提醒"。这些建议在进入候选池之前,还要经过一道质量把关机制——下面会详细介绍。
第三个动作叫"共识驱动调整"。候选建议不会每次都立刻被采纳,而是先积累起来,每隔若干轮才集中审查一次。审查的原则是"少数服从多数":只有被多条建议反复支持的观点,才会被写入经验手册;只有一两条建议支持的观点则继续观察,暂不采纳。这样做是为了防止用户的一次偶发行为被过度解读,造成手册频繁震荡。
就这样,随着练习轮次的增加,经验手册不断自我进化,对用户行为规律的刻画越来越精准,对模型自身偏见的提醒也越来越有针对性。
二、自我审查机制:如何确保每条建议都靠谱
上面提到,建议进入候选池之前要经过质量把关。这道关卡是PraMem设计中相当精妙的部分,研究团队将其称为"自我审查机制",分为两层检验,分别针对两类问题。
第一类问题:这条建议是真的从练习数据里学到的,还是模型自己凭空"幻觉"出来的?
为了区分这两种情况,研究团队设计了一种扰动测试。做法是:把练习样本里的历史行为记录故意"改坏"——比如把原来所有的积极行为(购买、点赞、收藏)全部替换成消极行为(划走、不感兴趣),让历史序列传递出截然相反的用户画像。然后问:这条建议在改坏之后的历史记录上,还成立吗?如果还成立,说明这条建议跟原始历史数据没什么关系,极可能是模型自说自话编出来的;如果不成立了,说明这条建议确实依赖于原始历史数据的具体内容,是真实归纳出来的。通过这道测试,筛掉那些"扰动后依然成立"的建议。
第二类问题:这条建议是真正的普遍规律,还是只针对这道练习题的一次性总结?
为了区分这两种情况,研究团队设计了一种场景辨别测试。做法是:把练习样本里正在预测的那个场景,改写成若干个"孪生场景"——类别相同,但关键细节不同,比如原场景是"某款华为笔记本电脑",孪生场景就换成"某款联想笔记本"、"某款戴尔笔记本"等等。然后把原场景和这些孪生场景混在一起,让模型凭着这条建议猜猜哪个是原场景。如果这条建议太具体,比如直接提到了"华为MateBook",那模型一眼就能认出原场景——这说明这条建议过于特化,只适用于这一道题,没有迁移价值;如果这条建议描述的是普遍规律,比如"用户偏好轻薄型笔记本",那就无法精准识别出原场景——说明这条建议具有良好的通用性。通过这道测试,筛掉那些"过于具体到单一场景"的建议。
只有同时通过这两道测试的建议,才能进入候选池,等待后续的共识驱动调整。这套机制的存在,保证了经验手册里的内容不是模型自嗨的产物,而是真正从用户数据里蒸馏出来的有效经验。
三、实验怎么验证的,结果如何
研究团队在两个数据集上对PraMem进行了评测,覆盖了多种真实场景。
第一个数据集叫OmniBehavior,来自快手平台的真实用户数据,涵盖四类场景:短视频浏览、直播、广告和电商。评测任务都是二分类问题,也就是判断一个用户在某个具体场景下"会不会"做某件事,比如会不会收藏某条视频、会不会关注某个作者、会不会在直播间送礼物、会不会购买某件商品。评估指标是准确率(ACC)和F1分数,F1分数综合考量了预测的精准性和召回率,更能反映在类别不平衡情况下的真实表现。
第二个数据集叫MovieLens-1M,是一个经典的电影评分数据集,包含大量用户对电影的历史评分(1到5星),任务是预测用户会给当前电影打几星,这是一个五分类问题,难度更高。研究团队选取了拥有超过300条评分记录的用户构造长时序预测任务,用混淆矩阵来比较不同方法的效果。
参与比较的方法分为几大类。最基础的做法是直接把历史序列塞给模型,要么把输入窗口拉到32K个词元(约相当于一本中篇小说的长度)尽量容纳更多历史,要么只保留最近的几条记录做截断处理。简单记忆管理方法包括:RAG(用检索技术找出最相关的历史记录作为参考)和摘要方法(对历史记录做迭代压缩总结)。高级记忆管理方法包括三种:Mem0,通过复杂的提取、聚合和检索流程管理历史信息;MemOS,类似Mem0但有不同侧重;ProEx,专门为每个用户生成多个动态用户画像,并通过交叉验证找出最准确的一个。
在OmniBehavior数据集上,以GPT-OSS-120B作为推理骨干模型时,单纯截断方法的整体准确率是73.5,F1是24.7。高级方法中最好的ProEx将准确率提升到77.7,F1提升到26.9。而PraMem将准确率大幅推高到84.7,F1跃升至31.6,这个提升幅度远超所有对比方法,并且在统计学意义上是显著的。换一个推理骨干模型(切换到规模更小的Qwen3.5-35B-A3B),趋势保持一致:截断方法的整体准确率是63.8,ProEx是67.6,PraMem达到75.6,F1同样大幅领先。
在MovieLens-1M数据集上,研究团队通过混淆矩阵直观展示各方法的预测效果。混淆矩阵可以理解为一张"预测准不准"的热力图,对角线上的颜色越深,说明预测越准确。PraMem的混淆矩阵对角线集中程度明显强于其他方法,对应的F1分数也从Truncation的28.8、Mem0的28.1提升到了49.6,几乎是对比方法的两倍。
四、经验手册是怎么随练习一步步成长的
研究团队专门设计了一组实验,追踪经验手册在不同练习轮次下的状态,观察它是如何演化的。
随着练习轮次的增加,预测性能单调递增。练习10轮之后,整体准确率是79.0,F1是28.3;到第40轮,提升为83.5和30.7;到第80轮,达到84.7和31.6。这种稳定的上升趋势说明,经验手册的质量在持续改善,并没有因为轮次增多而出现饱和或下滑。
与此同时,经验手册的长度(用词元数量衡量)呈现出一个先增后稳的"S形"演化曲线。从第10轮到第60轮,手册长度持续增长,因为模型在不断补充新的行为规律和偏见提醒;从第60轮之后,长度基本稳定,不再显著增加。这是因为到这个阶段,手册对用户的行为规律已经有了相当全面的覆盖,后续的练习更多是在精修和校正已有内容,而不是不断添加新内容。
这一特性在工程上有重要价值。传统的记忆管理方法往往让记忆随着历史数据量的增加无限膨胀,最终又给模型带来新的长文本负担;PraMem的经验手册则会自然收敛到一个稳定规模,不会因为轮次越多而越来越臃肿。
五、拆开来看,每个设计都在发挥作用
为了验证各个设计的必要性,研究团队做了一系列拆分实验,一次移除一个组件,观察性能变化。
移除"明确逐步推理"这个环节,改成直接预测而不走"先找相关经验再推理"的显式步骤,整体F1从31.6下降到29.3。原因是缺乏显式推理,模型无法充分暴露经验手册中的不足之处,后续的反思也就失去了抓手。
移除"反思"环节,改成直接对照标准答案生成修改建议(跳过复盘分析),F1下降到30.9。这说明仅靠对答案的表层比较并不足够,真正有价值的建议来自深层的原因分析。
移除"共识驱动"这道门槛,改成每条建议直接写入手册,F1大幅下降到28.8。这是最大的单项损失,直观地说明了"偶发行为过度解读"的危害:用户某次的一次性行为,很可能被错误地当成普遍规律固化下来,反而污染了手册。
两类经验的贡献也得到了单独验证。只保留行为模式经验而去掉偏见预警经验,四个场景的准确率和F1均有不同程度的下降;只保留偏见预警经验而去掉行为模式经验,下降更为明显。两者共同存在时效果最佳,这证实了同时处理"用户是谁"和"我容易犯什么错"这两个维度的必要性,也从侧面说明了以往方法只关注历史数据管理、忽视模型自身偏见的局限性。
自我审查机制同样被单独验证:移除扰动测试(接地性检验),F1下降;移除场景辨别测试(泛化性检验),F1也下降。两者都移除时,下降幅度叠加。
六、换一个模型来用,手册的效果会打折扣吗
研究团队专门考察了一个实际部署中非常关键的问题:经验手册是用GPT-OSS-120B这个特定模型练习生成的,如果换成另一个模型来使用这本手册,效果会不会大打折扣?
实验结果是令人振奋的。用GPT-OSS-120B构建的经验手册,在切换到Qwen3.5-35B-A3B进行预测时,依然能带来显著的性能提升,增幅与在GPT-OSS-120B上的表现趋势高度一致。研究团队给出的解释是:行为模式经验描述的是用户客观的行为规律,天然是跨模型通用的;而偏见预警经验描述的是大语言模型群体共有的认知偏见(不同大模型在内部表征层面存在一定的共性),因此一个模型上发现的偏见,在另一个模型上往往同样存在。
这一特性在工程实践中意味着:一个用户的经验手册只需要构建一次,就可以直接复用于不同的模型,不需要针对每个模型重新练习一遍。
七、案例对比:同一个用户,两种记忆长什么样
研究团队还做了一个直观的案例比对,用同一位用户的数据,分别看PraMem和MemOS(作为代表性对比方法)各自维护的记忆内容是什么样的。
MemOS维护的记忆是一条条具体的历史行为记录,比如"2025年9月28日20:16:18,该用户观看了一个57秒关于石膏板隔墙施工的视频,只看了3秒",每条记录都是对单一行为的客观描述,读起来像一份流水账。
PraMem维护的经验手册则完全不同。行为模式部分写的是:"这位用户更倾向于关注标签中含有社交或情感元素的创作者";"这位用户的观看时长受视频内容类型、标题关键词和视频时长共同影响——轻娱乐短视频通常只会短暂停留,但当视频包含家庭、挑战、竞技或情感关系等关键词,且完播率明显高于历史均值时,用户会倾向于看完全片"。偏见预警部分写的是:"要警惕从大量短暂停留记录中过度概括——模型容易误以为这位用户整体互动意愿极低,从而忽略了实用内容或情感冲突类内容会触发较高互动的规律";"要警惕训练数据带来的先入为主,即把'关注作者'默认视为一个需要强动机才会发生的罕见行为——在高完播率或强社交情感信号的场景下,应该重新评估关注概率,而不是直接按稀有事件处理"。
这个对比清晰地说明了两类方法的本质差异:传统方法存储的是"发生了什么",而PraMem存储的是"从中学到了什么"和"预测时要注意什么"。前者把归纳规律的工作留到了预测时才去做,后者把这件事提前做完了,还额外帮模型认识到了自己的盲点。
八、效率代价:更好的效果,需要更多的时间
研究团队对各方法的经验构建时间进行了统计比较,以平均每位用户的构建耗时为单位。ProEx最快,每位用户约24.7分钟;MemOS约30.6分钟;Mem0约34.1分钟;PraMem则需要约55.8分钟。PraMem所需的时间大约是对比方法的两倍。
研究团队对此的解释是:这个代价发生在离线阶段,也就是说,经验手册是在正式预测之前提前构建好存储在本地的,实际用户发出预测请求时直接调用,不会增加响应延迟。从性价比角度看,多花了不到一倍的构建时间,换来了F1分数从26.9跃升到31.6(相对提升约17%),研究团队认为这个交换是合算的。
说到底,PraMem做的事情并不神秘,它的核心逻辑用一句话可以说清楚:与其让模型在预测时临时抱佛脚,不如事先让它把历史数据当练习题刷一遍,把心得整理成一本专属于这位用户的经验手册,正式预测时带着手册入场。这个想法平实,但执行细节极为讲究——要确保手册里的每一条内容都是真正从数据里归纳出来的、具有普适性的经验,而不是模型的自说自话或对单次事件的过度解读。正是这些精心设计的质量把关机制,使得PraMem在多个数据集、多种场景、多个评估模型上都实现了显著的性能领先。
这项研究对于推荐系统、用户模拟、数字助手等依赖个人历史行为的应用场景,提供了一条值得深入探索的新路径。当然,更高效的练习调度策略、如何在并行化中保持经验质量等工程挑战,仍然是值得后续研究深入的方向。对这项研究感兴趣的读者可以通过arXiv编号2607.02881查阅完整原文,或访问论文中公开的代码仓库进一步了解实现细节。
Q&A
Q1:PraMem和传统推荐系统的用户画像有什么区别?
A:传统用户画像通常记录的是"用户喜欢什么类别、买过什么品牌"这类事实性标签,本质上是历史行为的压缩摘要。PraMem的经验手册不仅记录用户的行为规律,还额外记录了大语言模型在预测这位用户时容易犯的认知偏差,比如"不要因为最近几条都是短暂划走就低估用户的整体互动意愿"。这个"偏见预警"维度是传统用户画像完全没有的,也是PraMem在预测准确率上超越其他方法的重要原因。
Q2:PraMem构建的经验手册能换一个AI模型使用吗?
A:可以。实验结果显示,用GPT-OSS-120B这个大模型练习生成的经验手册,直接拿给另一个完全不同的模型Qwen3.5-35B-A3B使用,依然能带来显著的预测性能提升。原因是行为模式经验描述的是用户的客观规律,天然通用;而偏见预警经验描述的是大语言模型群体共有的认知偏见,不同模型往往共享类似的"坏习惯"。因此一本手册构建一次,可以在多个模型之间复用,不需要重复构建。
Q3:PraMem的经验手册会不会随着使用越来越长、越来越难读?
A:不会。研究观察到经验手册的长度呈现先增后稳的演化规律:随着练习轮次增加,手册内容不断丰富,但在覆盖用户行为规律到一定程度后,后续练习主要是在精修已有内容,不再大幅扩张。最终手册会收敛到一个相对稳定的规模。这与传统记忆管理方法不同,传统方法随着历史数据增多会持续膨胀,PraMem则能自然"封顶",避免给模型带来新的长文本压力。