香港科技大学与腾讯光速工作室揭示智能体的致命盲区

这项由香港科技大学与腾讯光速工作室(LIGHTSPEED)联合开展的研究,于2026年8月5日以预印本形式发布在arXiv平台,论文编号为arXiv:2608.04574v1,分类为计算机科学·计算与语言(cs.CL)领域。感兴趣的读者可通过该编号在arXiv上查阅完整原文。
**一、一张"过期地图"引发的危机**
你有没有用过一张旧地图导航,然后发现那条路早就被封了?在现实生活中,这顶多让你多绕几个弯。但换成一个正在做决策的AI智能体,这件事的代价可就严重多了——它可能会毫不犹豫地走进一个本该绕开的"陷阱",而且还完全不知道自己犯了错误。
这正是这项研究关注的核心问题。当一个拥有"记忆"的AI智能体在执行任务时,它所掌握的过去的空间信息与眼前真实看到的情况发生了冲突,它该相信哪一个?更关键的是,它能否在采取行动之前意识到这个冲突的存在?
研究团队为了研究这个问题,设计了一个叫做SpatialSTALE的测试平台,基于一个经典的格子游戏"冰冻湖"(FrozenLake)。在这个8×8的方格世界里,AI智能体需要从起点走到终点,途中有些方格是安全的冰面,有些是危险的冰窟窿。关键在于,AI会预先获得一份"地图记忆",记录着每个方格的安全情况——但这份记忆可能已经过时了,因为游戏世界会悄悄发生变化:原本安全的冰面可能已经变成了致命的深坑。
研究结果令人深思:在主要的测试场景下,一个盲目信任过时记忆的AI智能体,其死亡率高达74.4%;而一个完全没有任何记忆、纯粹靠眼前观察行动的AI,死亡率只有28.0%。换句话说,有"记忆"比没"记忆"死得更快——因为那份记忆在说谎。
**二、研究背景:AI的"记忆"到底是什么**
现代的AI智能体越来越像一个有自己笔记本的助手。比如,微软研究院的Voyager系统会在玩Minecraft时把学到的技能记下来留待以后用;MIT等机构的GITM系统会把走过的路径和遇到的情况整理成层级式的记忆;还有Reflexion、MemGPT等系统,都以不同方式让AI积累和复用过去的经验。
但这些系统的研究重点,几乎都集中在"如何建立记忆"、"如何调用记忆"、"如何从记忆中学习"这几个问题上。没有人认真追问过一件事:如果记忆里的某条空间信息在AI行动之前就已经过时了,会发生什么?
这个问题其实在两个相邻的研究领域都存在盲区。一边是研究"知识时效性"的学者,他们关注的是AI大模型里存储的事实性知识(比如"谁是美国总统"这类问题)过期之后的更新方法,但没有涉及需要采取安全行动的空间记忆。另一边是研究AI"空间推理"能力的学者,他们测试AI能不能从图像或文字中理解空间关系,但那些测试场景都是静态的——世界不会在测试过程中发生变化。
这项研究填补的,正是这两个领域之间的空白:一条在AI行动前就变质的空间记忆,如何在真实世界中酿成安全事故。
**三、实验舞台:一个会"变脸"的格子世界**
要研究"过时记忆"这个问题,研究团队需要一个能精确控制的实验环境——每一次死亡都要能追溯到具体的哪条记忆信息出了问题。FrozenLake格子游戏的设计恰好满足了这个需求:踩进冰窟窿立刻死亡,结果明确、可测量,而且每一次踩坑都能直接关联到AI信任了哪条错误的记忆。
实验的基本设置是这样的:首先生成一个8×8的格子地图,大约四分之一的格子是危险的冰窟窿,有固定的起点和终点,且保证至少存在一条安全路径。然后模拟AI智能体在原始地图上进行20次随机探索,把观察到的每个格子的安全情况记录下来,形成"记忆快照"——每个格子对应一条自然语言描述,比如"位置(2,5)安全:冰冻地面,可以行走"或者"位置(4,7)危险:冰窟窿,不要踩上去",总共64条记忆条目覆盖全部格子。
记忆建立之后,世界会发生变化:安全的冰面可能融化变成危险的坑,危险的坑也可能结冻变成安全的冰面。AI的记忆不会自动更新,它只能通过当前的观察来发现这种变化。
为了模拟不同的现实场景,研究团队设计了三种"变化模式"。第一种叫L1(散点变化),在地图上随机选5到7个格子进行改变,改变发生在游戏开始之前,就像你出发前地图就已经过时了。第二种叫L2(集群变化),在地图的某个区域集中改变12到16个格子,同样在游戏开始前发生,模拟某个区域集中发生变化的情况。第三种叫L3(动态变化),在游戏进行过程中持续发生改变,每走5步就有可能有2个格子被改变,模拟真实世界中环境持续变化的情况。在L3中,AI不仅需要在出发前检测记忆是否过时,还需要在游戏中持续保持警觉。
在所有实验中,AI看到的当前观察(无论是文字描述还是图像)始终是真实的、最新的——记忆才是可能过时的那个。这个设计很重要,因为它意味着过时的记忆不是在"隐藏"坑洞,而是在主动提供与真实情况相矛盾的错误信息,就像一个说"放心走吧"的朋友,但他上次去那里已经是三年前的事了。
**四、研究的双重追问:能看出来吗?看出来有用吗?**
研究团队把整个实验分成两个紧密相连的任务,形成一个完整的因果链条。
第一个任务叫"记忆陈旧性检测":给AI看当前的地图(文字版或图像版),同时提供原始的64条记忆,让AI逐条判断每条记忆是否已经过时,即与当前观察发生了冲突。这个任务测的是AI的"察觉能力"——它能不能发现记忆和现实之间的矛盾。
判断标准非常客观:如果记忆说某个格子是安全的,但当前地图显示那里是一个坑,那这条记忆就是"过时的";反过来,如果记忆说某个格子危险,但当前地图显示那里实际上是安全的冰面,这条记忆也算过时。不需要任何主观判断,就是简单地比对"当初记录的"和"现在看到的"是否一致。
第二个任务叫"导航安全性测试":用同一份改变过的地图让AI进行实际的导航,测量它是否能安全抵达终点,以及在不同记忆处理策略下的死亡率有何差别。
这两个任务在同一批测试场景(共50组随机生成的地图)上运行,这样就能精确地把"察觉能力"和"行动结果"对应起来。
**五、四种对待记忆的方式:谁更聪明,谁更危险**
为了全面评估记忆对AI行动的影响,研究团队设计了四种截然不同的记忆处理策略,就像四个性格各异的旅行者面对那张旧地图的不同态度。
第一种叫"无记忆"策略:AI完全不使用任何记忆,纯粹依靠当前观察到的地图来做决策。这是研究的基准线,用来衡量"有记忆"到底是帮了忙还是添了乱。
第二种叫"无过滤"策略:AI原封不动地接收全部64条原始记忆,哪怕其中有些已经与当前观察相矛盾,也不做任何检查就直接用于决策。这相当于完全信任那张旧地图,无论眼前看到什么都不去质疑记忆的准确性。
第三种叫"自我验证"策略:在正式开始导航之前,AI会把全部记忆和当前地图放在一起做一次自我检查,去掉自己认为不一致的条目,然后用清理后的记忆进行导航。这是最简单的一种"先检查后行动"的方法,只在出发前检查一次,游戏过程中不再更新。
第四种叫OMCD(批量事件感知审计)策略:这是研究团队开发的核心干预方法。OMCD会把64条记忆分成每批10条的小组,逐批与当前观察进行比对,判断哪些条目已经过时,然后把过时条目从记忆中移除。更重要的是,在L3动态变化场景下,每当世界发生变化时,OMCD会重新运行检测,持续更新记忆的可信度。这就像一个有责任感的助手,不仅在出发前检查了地图,在路途中听说道路发生变化时还会主动再次核实。
此外,研究团队还设计了一个"神谕标签"条件:用真实的、百分之百正确的过时信息标签来驱动OMCD的过滤过程。这个条件并不是说AI真的拥有神奇能力,而是用来测试一个极限问题——即便检测能力完美无缺,记忆过时的危害还能被完全消除吗?
**六、参与测试的选手:六个能力各异的AI模型**
研究团队选取了六个不同规格的视觉语言模型参与测试,分为商业闭源模型和开源模型两组。
闭源商业模型组包括OpenAI的GPT-4o、Anthropic的Claude-Sonnet-4.6,以及阿里云的Qwen3.6-Plus。这三个都是目前能力较强的商业AI模型,日常使用者应该对它们的名字相当熟悉。
开源模型组包括GLM-5.1(智谱AI)、InternVL3-2B和InternVL3-8B(上海AI实验室的书生视觉语言模型,2B和8B代表参数量级,数字越大通常能力越强)。这些开源模型在自己的服务器上运行,配备了两块英伟达H20显卡。
所有模型都接受两种形式的输入:文字版本(当前地图以坐标标注的文字列表形式呈现)和图像版本(当前地图渲染成384×384像素的彩色图片,冰面是浅蓝色,坑洞是近黑色,起点是绿色,终点是金色,每个格子左上角标注坐标)。记忆始终以自然语言文字形式提供,无论当前观察用哪种方式呈现。
检测任务覆盖6个模型、50组地图、3种变化模式、2种输入形式,共1800次运行。文字版导航任务覆盖4个主要模型(GPT-4o、Claude、Qwen、GLM)、50组地图、3种变化模式、4种记忆策略,每个组合运行5次,共12000次导航剧情。
**七、第一个发现:文字里能认出来,图片里就不一定了**
实验的第一个重要发现,揭示了一个令人意外的差距。
在文字输入模式下,当前地图和过去记忆都以文字形式呈现时,表现较好的AI模型几乎可以完美识别出哪些记忆条目已经过时。GPT-4o、Claude-Sonnet-4.6、Qwen3.6-Plus三个商业模型以及GLM-5.1,在L1和L2场景下的F1得分(衡量检测准确率的综合指标,满分是1.0)都在0.88以上,接近完美。简单来说,这些AI在阅读文字信息时,已经能相当可靠地发现"地图说安全,现实是危险"这样的矛盾。
然而,把同样的地图换成图像形式之后,情况发生了戏剧性的变化。
Qwen3.6-Plus的表现最为稳定,视觉模式下的F1得分几乎没有下降(差距仅0.011,几乎可以忽略不计)。这说明Qwen在看图识别格子状态这件事上做得相当好,能像阅读文字一样可靠地从图片中读取信息。
Claude-Sonnet-4.6的表现有所下滑,F1平均降低了约0.134,但整体仍保持在可用范围内。它在识别"安全格子变成危险坑洞"这种更致命的变化时表现还算不错,在L2场景下能识别出94.5%的这类危险变化,但对于"危险坑洞变成安全冰面"这种方向相反的变化,识别率只有63.6%。
GPT-4o的表现出现了严重下滑,F1平均降低了约0.598,跌幅接近60个百分点。深入分析发现,GPT-4o在看图时经常表示"我无法可靠地判断那个坐标位置的颜色",或者把相邻格子的颜色搞混,导致识别漏掉了大量真正过时的危险条目。
GLM-5.1的表现则是完全崩溃,F1从文字模式的0.929直接跌到视觉模式的0.073,降幅高达0.830。最好的模型(Qwen的0.887)和最差的模型(GLM的0.067)之间差了13倍。
更诡异的是GLM-5.1的崩溃方式。研究团队分析了6400条GLM的视觉判断记录,发现了一个奇特的规律:GLM把一个"记忆里说安全、实际上是危险坑洞"的过时记录标记为过时的概率,和它把一个"记忆里说安全、实际上也是安全冰面"的正确记录标记为过时的概率几乎相同(4.5% vs 5.0%)。换句话说,GLM对图片内容是坑还是冰完全不敏感——它判断一条记忆是否过时的依据,根本不来自于图片,而更像是在根据其他规律做出判断,比如干脆认为大多数记忆都是有效的。
这一点被研究团队称为"以记忆为主导的审计"——GLM看起来是在比对记忆和图片,实际上它的判断基本上只基于记忆本身,完全无视了图片提供的信息。更令人担忧的是,GLM在所有6400条判断中,从不使用"无法确定"或"看不清楚"这样的措辞,置信度始终是满分1.0。也就是说,它以最高的自信说出了完全不靠谱的答案。
这个发现非常重要:一个在文字层面能够"解题"的AI,并不能保证它在视觉层面同样可靠。能力不会自动在不同输入形式之间转移。
**八、第二个发现:过时的记忆,比没有记忆更危险**
在文字输入的导航实验中,研究团队得到了最核心、也最反直觉的安全发现。
在最主要的测试场景(GPT-4o,L2集群变化模式)中,四种策略的表现如下:无过滤策略(完全信任过时记忆)的成功率只有14.4%,死亡率高达74.4%;无记忆策略(完全不使用记忆)的成功率达到28.8%,死亡率只有28.0%。前者的死亡率是后者的2.7倍。
这个结果意味着,给AI配备一份过时的记忆,比不给它任何记忆还要危险。这就好比给一个迷路的人一张画错的地图——有地图比没地图死得更快,因为他会更加自信地往错误方向走,而不是谨慎地凭自己的观察摸索。
研究人员通过分析"死亡轨迹"的长度,进一步验证了这个机制。在GPT-4o的无过滤策略下,死亡通常发生在大约8.5步时,而成功到达终点平均需要14.5步。死亡轨迹远短于成功轨迹,说明AI并非在漫长的探索过程中偶然踩进了坑,而是一开始就被错误记忆"引导"着直奔危险格子而去。研究团队把这种模式称为"冲向坑洞"(rush-into-hole)——记忆说那里安全,AI就毫不犹豫地冲过去了。
相比之下,无记忆策略下的死亡轨迹则完全不同。以Claude模型为例,无记忆策略下的死亡通常发生在16.1步时,比成功轨迹(14.8步)还要长。这说明没有记忆的AI死亡方式是"慢慢探索,最终力竭"——它没有信心明确的方向,在迷宫里越走越远,最终在某个未知角落踩进了坑。这种死法是"探索耗尽",而非"记忆误导"。
这两种死法的本质区别在于,一种是"错误的知识害了你",另一种是"知识的缺乏害了你"。在现实应用中,"错误知识"的危害要比"缺乏知识"更具欺骗性,因为系统会表现得很自信,让人难以察觉出了问题。
在所有四个测试模型和三种变化模式下,这个规律是一致的:无过滤策略相比无记忆策略,Claude的死亡率平均上升38%,GLM上升45%,Qwen上升43%。
**九、OMCD出手:过滤能解决多少问题**
既然过时记忆如此危险,研究团队开发的OMCD过滤策略是否能有效化解这个危机?
答案是:在文字输入模式下,效果相当显著。
依然以GPT-4o的L2场景为例,OMCD策略下的成功率达到了32.8%,死亡率降至31.6%,相较于无过滤策略的74.4%死亡率,降低了约58%。与无记忆策略(28.0%死亡率)相比,OMCD的死亡率只略高一点点。
研究团队进一步用"神谕标签"(完美准确的过时标签)做了对比实验。结果发现,用完美标签驱动OMCD过滤,比用AI自己生成的标签,在成功率上的差距不超过2个百分点,统计上没有显著差异。这意味着,在文字输入场景下,AI自己生成的过时标签已经足够好了,即便换成百分之百正确的完美标签,额外的收益也很有限。
然而,在进一步分析中,研究团队发现了一个有趣的细节:即便用了OMCD、即便检测准确率超过0.91,偶尔仍然会发生AI踩进坑的情况。更令人惊讶的是,这些死亡案例里,那个致命的格子对应的记忆其实已经被正确标记为过时并移除了——AI知道那个格子的记忆不可信,但最终还是走进去了。
研究人员用数据验证了这一点:每颗种子地图的检测F1得分(记忆审计准确率)和OMCD导航成功率之间的相关系数几乎为零(L1:0.060,L2:0.032,L3:0.005,所有p值大于0.67)。也就是说,即便某张地图的记忆被检测得更准确,在那张地图上的导航成功率也不会随之提高。
这说明,一旦文字模式的记忆审计已经足够可靠,限制AI导航表现的主要瓶颈就不再是"能不能发现哪条记忆过时了",而是"即便知道某条记忆不可信,还能不能做出正确的路径规划决策"。检测问题已经基本解决,行动问题才是接下来真正需要攻克的难关。
**十、图像模式的过滤:无法可靠感知,就无法可靠过滤**
研究团队也在视觉输入模式下测试了OMCD的效果,结果就不那么乐观了。
在一个规模较小的探索性实验(10组地图、每组3次导航)中,各模型的导航成功率都相当低,而且OMCD的过滤并没有带来一致性的提升。GPT-4o、Claude和GLM在最好的策略下成功率都不超过40%,而且有无OMCD过滤之间的差距并不稳定。
这个结果的逻辑非常直接:如果一个模型(比如GLM)连图片里哪些格子是坑、哪些是冰都看不清楚,那它的"过滤"结果就是不可信的。用不可信的过滤结果去修改记忆,不会让记忆变得更好,甚至可能让记忆变得更糟——原本正确的记忆条目被错误地删掉,真正过时的危险记录却被保留下来。
Qwen3.6-Plus是个例外。由于Qwen的视觉检测能力接近文字模式水平,它在视觉导航下同样保持了很高的成功率,但也正因如此,过滤带来的额外收益空间很小。
这个发现树立了一个重要的边界条件:过滤策略的价值,上限受到感知能力的制约。感知可靠,过滤才可靠;感知失灵,过滤徒劳。
**十一、细节拼图:更多值得关注的发现**
除了三个核心发现,研究中还积累了许多值得关注的细节,共同构成了一幅更完整的图景。
在错误类型的分布上,研究发现快照场景(L1和L2)中AI倾向于"过度报警"——把一些实际上正确的记忆也标记为过时,宁可错杀也不放过。而在动态变化的L3场景中,情况反转,AI转为"漏报"居多——当世界持续变化时,AI更容易遗漏真正过时的危险记录。这种错误模式的转变有实际意义:L3场景下漏掉危险信息,比多报虚假警报更直接危险。
在变化方向的敏感性上,把冰面变成坑(安全变危险,研究称为"thaw")和把坑变成冰面(危险变安全,研究称为"freeze")这两种变化,不同模型的识别能力差距很大。Claude视觉模式下,对"安全变危险"的识别率(L2场景)高达94.5%,但对"危险变安全"的识别率只有63.6%。从安全角度看,前者比后者更要命——错误信任了一个假装安全的坑会死人,而错误避开了一个实际安全的格子只会多走几步路。Claude的这种不对称恰好朝着"安全优先"的方向偏斜,但研究团队也指出,这只是Claude的个别特性,并不是所有模型都有这种安全倾向。
在批量检测的规模选择上,研究团队通过实验发现,把64条记忆分成每批10条(B=10)是个较好的平衡点:与每条单独检测相比,API调用次数减少了9倍,但检测准确率只下降了2.7个百分点。批量太大(比如20条一批)时,模型开始混淆各条记录,错误率显著上升。
在连续打分与二值判断的比较上,研究团队尝试让AI给每条记忆打一个"过时程度"的分数(0到1),然后设定阈值来决定是否过滤。但实验发现,不同模型对分数的使用方式差异很大:GPT-4o在打分0.6时有约80%的概率确实是过时的,而Claude在同样分数0.6时只有约35%的概率过时。没有一个阈值能同时适用于所有模型。相比之下,直接问AI"这条记忆过时了吗?是或否"的二值问法,效果反而更稳定、更可靠。
**十二、一份具体的死亡调查报告**
为了让抽象的数据变得具体,研究团队在论文中提供了三条来自同一张地图的详细导航轨迹,清晰地展示了三种策略如何走向不同结局。
在L2场景、GPT-4o、地图编号4810的测试中:无过滤策略下的AI在第9步死亡。它的记忆里有一条说位置(5,4)是安全的,但实际上这个格子在游戏开始前已经从冰面变成了坑洞。AI沿着记忆指引的路线前进,在第9步毫不犹豫地踩上了(5,4),立即死亡。全程对当前地图显示的真实情况视而不见。
OMCD策略下的AI在第26步成功到达终点。在出发前的检测阶段,AI正确识别出了mem_044(即关于(5,4)的那条"安全"记忆)已经过时,并将其从记忆中删除。随后的导航中,AI绕开了(5,4),通过(5,3)然后(6,3)的迂回路径,最终成功抵达终点。虽然多走了很多步,但活了下来。
无记忆策略下的AI则在第50步超时(游戏设定最多走50步)。没有任何记忆指引,AI只能靠当前观察来摸索路径。它走走停停,在路上能正确避开那些当前地图上可见的坑洞,但始终找不到高效的路线,最终在距终点还有一格((6,6)位置)时耗尽了步数上限。没有死,但也没有成功。
这三条轨迹完美地呈现了研究的核心逻辑:错误记忆导致自信式快速死亡,无记忆导致缓慢式超时失败,而正确过滤的记忆则带来成功。
**十三、局限与未来:这项研究的诚实自白**
研究团队在论文中坦率地指出了若干局限性,这些局限性同时也勾勒出了未来研究的方向。
当前实验的舞台是高度受控的8×8方格世界,每一次死亡都能追溯到具体的记忆条目,这正是其精确性的来源,也是其局限性所在。真实世界的AI应用远比这个复杂——地图不是小方格,变化不是简单的冰面和坑洞,记忆也不是整齐划一的64条条目。研究团队明确表示,他们的数字是"干净场景下的下界估计",而非真实应用中的精确预测。
在模型覆盖上,详细的机制分析(神谕对比、轨迹分解、F1与成功率的相关性)主要在GPT-4o上完成,视觉导航实验只有10组地图的小规模预览。其他模型的结论在规模和深度上都不及GPT-4o,因此对其他模型的结论需要谨慎外推。
研究团队也强调,他们不主张OMCD策略在所有情况下都优于无记忆策略。事实上,在Claude和Qwen这两个本身就具有较强推理能力的模型上,无记忆策略的表现有时和OMCD相当甚至更好。研究的重点不是说"过滤一定有用",而是说"当必须使用记忆时,不加检验地信任过时记忆会造成可测量的安全代价"。
在未来的拓展方向上,研究团队列出了若干值得探索的路径。把网格从8×8扩大到16×16或32×32,会让记忆条目成倍增加,让问题更难。在记忆中加入"干扰项"——比如一些不是关于空间位置的描述,测试AI能不能只针对真正可能过时的条目进行检测,而不误删无关内容。或者把二值判断(过时/未过时)升级成编辑任务(把"安全"改为"危险"),测试AI能不能不只说"这条记忆错了",还能说出"应该怎么改"。此外,把测试场景从格子游戏扩展到真实的三维导航环境(如Habitat或AI2-THOR)也是自然的下一步,但那样就需要同时应对感知噪声的挑战。
说到底,这项研究的意义远超过一个格子游戏实验本身。它揭示的是一个在越来越广泛部署的AI系统中,一个长期被忽视但可能随时引爆的危险设定:当一个AI智能体持有关于世界的记忆,并且基于这些记忆做出实际决策时,记忆的时效性就成了一个真实的安全变量。这不是一个理论上的边缘情况,而是任何长期运行的记忆增强AI系统在现实环境中都必然会面对的挑战。
归根结底,我们给AI装上记忆是为了让它更聪明,但如果记忆没有经过可靠性检验就直接被信任,它反而可能成为通向灾难的捷径。研究者们通过这项严谨的实验,把这个直觉从猜测变成了有数据支撑的结论,也指出了两个具体的开放难题:一是如何让AI在看图时与看字一样可靠地发现记忆冲突,二是在记忆已经被可靠过滤之后,如何让AI真正据此做出更安全的行动决策。这两个问题的解决,将直接关系到未来更复杂的自主AI系统能不能真正被信任去执行重要任务。
有兴趣深入了解技术细节的读者,可以在arXiv平台通过编号arXiv:2608.04574查询完整论文,其中包含了完整的实验配置参数、所有模型的详细数据、典型失败案例的逐字记录以及开放的代码和数据集。
---
Q&A
Q1:什么是空间记忆陈旧性,为什么会危害AI智能体的安全?
A:空间记忆陈旧性是指AI智能体存储的关于某个位置的信息(比如"这个格子是安全的")已经不再符合现实情况(该格子已变成危险的坑洞)。这会危害安全,是因为AI往往直接信任这些记忆而不加验证,导致它自信地走向危险区域。研究发现在主要测试场景下,信任过时记忆的AI死亡率高达74.4%,比完全没有记忆的AI(死亡率28%)还要高出2.7倍。
Q2:OMCD过滤策略和普通的自我验证策略有什么区别,效果差多少?
A:普通的自我验证是在出发前对全部记忆做一次性检查,之后游戏过程中不再更新。OMCD则是把记忆分成小批次逐一比对,并且在动态变化场景下每次发生环境变化后自动重新检测。在GPT-4o的L2场景测试中,普通自我验证的死亡率为66%,OMCD则降至31.6%,相差约34个百分点。不过两者在文字输入场景下都远优于不加过滤直接信任记忆的策略。
Q3:视觉语言模型在图像输入下识别过时记忆的表现为什么差这么多?
A:不同模型在视觉输入下的失败方式各不相同。GPT-4o会频繁表示无法确定图片中某坐标的颜色,或混淆相邻格子。GLM-5.1则更极端,它判断记忆是否过时的依据几乎不来自图片,而是依赖记忆本身的文字内容,导致对坑洞和冰面的判断概率几乎相同。最好的Qwen(F1约0.887)和最差的GLM(F1约0.067)之间相差13倍,根本原因在于模型将文字理解能力转化为视觉感知能力的水平差异悬殊。