当AI大模型学会把“记忆”和“思考”分开,会发生什么

你有没有想过一个问题:为什么现在的大模型越来越会"说话",却越来越啰嗦?
问一个简单的选择题,它能给你写出两千多个字的推理过程,反复验证、反复检查,最后才憋出一个答案。这不是它在认真,这更像是一个记不住重点的人,只能靠不断念叨来防止自己忘掉刚才想到了什么。
2026年,上海人工智能实验室的研究团队发布了一篇论文,提出了一个叫Mobius的新架构。这篇论文里有一个数据让我第一次读到时愣了一下:同样的推理任务,换了这个新架构的模型只用516个token就搞定了,而原来的Transformer架构要用2364个token。差了将近4.6倍。
这不是靠"少说话"的指令调出来的效果,而是架构本身变了。要理解这个变化,你得先明白当前大模型内部到底是怎么"记忆"和"思考"的。
知识和推理绑在一起,是问题的根源
在传统的Transformer架构里,模型的每一层都长得差不多:一个自注意力模块,紧接着一个前馈网络,再往上叠很多层。
**自注意力(Self-Attention)**:负责让模型在处理一句话时,同时关注上下文里所有相关的词,捕捉词与词之间的关联,这是模型"推理"的核心部件。
**前馈网络(FFN,Feed-Forward Network)**:一般被认为是模型存储具体知识的地方,你可以理解成模型的"知识库"。
问题就出在这里。在Transformer里,每一层的FFN是那一层专属的,第一层的知识库只属于第一层,第十层的知识库只属于第十层。信息只能往前传,浅层的东西可以往深层送,但深层想往回够浅层的知识,几乎不可能。
这就好比一个大公司,每个楼层都有自己独立的档案室,档案不能跨楼层调阅。一楼的员工整理好的资料,十楼的人想用,只能一层一层地把信息往上搬,搬的时候难免丢失、变形。如果某个关键资料恰好锁在三楼的柜子里,而十楼的人当时并不知道该往哪层去找,那这次决策就可能出错,只能靠反复开会讨论(也就是模型生成很多token去"试错")来弥补信息不对称。
现在主流做法是用**思维链(Chain of Thought, CoT)**去补这个洞:每生成一个新词,就用这个词去激活下一步需要的知识,靠一步步试探把分散在各层的信息拼出来。
这个办法能用,但代价很大。研究者的判断是,这种做法本质上是低效的:模型被迫用大量重复、啰嗦的输出去补偿架构本身信息传递不畸的问题。
把知识仓库拿出来单独放,会怎样
Mobius的核心思路,是把FFN从每一层"私有"的状态里解放出来,变成全局共享的一个大仓库。
**Mobius架构**:一种把知识存储(Memory,用FFN实现)和推理运算(Reasoner,用Self-Attention实现)解耦的新型模型架构,所有层的推理模块可以共享访问同一个知识数据库。
具体来说,原来每层自带的FFN被合并成了一个巨大的、全局共享的知识向量数据库。所有层的自注意力模块,不管是第一层还是最后一层,都可以直接向这个数据库查询需要的知识,查完之后再把结果传回去继续做推理。
这就好比把公司原来一层一层的独立档案室,全部拆掉合并成一个中央资料库,任何楼层的人都能直接进去查,不用再一层层往上传递申请。三楼要用十楼那份资料,直接去中央库调就行,不用再经过中间七层楼的层层转手。
论文里管这个设计叫**反向残差连接(Backward Residual Connection)**:让深层的计算单元也能直接访问浅层甚至任意层的知识,而不只是被动接收前面层往后传的信息。
**残差连接(Residual Connection)**:深度学习里的一种连接方式,让信息可以跳过某些层直接传递,主要作用是防止网络太深导致训练不稳定。传统的残差连接只能让浅层信息往深层传,是单向的。
这里有个技术上很现实的问题:如果真的让每一层都能物理上直接连到每一层,那计算图会变得极其复杂,硬件根本不好并行处理。研究团队选择了一种更聪明的办法,不去直接搭建那种复杂的跨层连线,而是让所有层共享同一份知识存储。这样一来,"每层都能访问全部知识"这个效果就自然实现了,用不着真的画出那些错综复杂的连接线。
如果不这么做会怎样?论文里的实验对比说得很清楚:一个从零训练的7B参数模型,用了Mobius架构后,达到跟传统Transformer基线一样的下游任务分数,只需要基线数据量的62.6%。换句话说,同样多的钱花在数据上,Mobius能多学62.6%意义上的"性价比",这个差距不是几个点的误差,是训练成本层面的实质差异。
让模型在"脑子里"多想几步,而不是嘴上多说几句
Mobius的第二个关键设计,叫**动态潜在推理(Dynamic Latent Reasoning)**。
**潜在推理(Latent Reasoning)**:不通过生成具体的文字token,而是让模型在内部的连续向量空间里完成多轮"思考",思考完了才输出精炼的文字结果。
传统模型的最小推理单位是token,一个词。每生成一个词,都要完整走一遍所有的网络层。这就像你脑子里每冒出一个念头,都要把这个念头写成一句完整的话说出来,再让别人听完反馈,再想下一句。效率很低,而且"说出来的话"这种载体本身信息密度不够高,你脑子里其实转了很多弯,写出来却只有一句平淡的结论。
Mobius换了个玩法。它让模型在少数几层之内,反复地在向量空间里查询知识、精炼表达,这个过程完全不需要立刻decode成具体的文字。等这个内部的"思考向量"被反复打磨到足够成熟,才一次性解码出多个高质量的token。
这就像一个作家在正式落笔之前,先在脑子里把整段话的逻辑理顺、措辞斟酌好几轮,想清楚了才一口气写出一段流畅的文字,而不是每想一个字就写一个字、写完再纠结要不要撤回重写。如果没有这个"先在脑内打磨"的过程,作家就得像传统模型那样,边写边改,写出一堆改来改去的痕迹,读者看到的成品自然又长又乱。
这也是为什么论文说Mobius"可以看作是循环Transformer(Looped Transformer)和扩散语言模型(Diffusion Language Model)的升级综合"。它既有循环模型那种反复迭代的特性,又有扩散模型那种一次性处理多个位置的并行感。
数据上体现得很直接。论文对比了Mobius和Transformer在多个测试集上的平均输出长度,MMLU Pro任务上短了4.6倍,GPQA Diamond任务上短了整整5倍。这不是把内容删减了,而是把原本靠啰嗦堆出来的"试错性思考"内化到了模型内部的向量迭代里。
知识仓库太大了怎么办
这里必须承认一个代价。把FFN拆出来做成全局共享的超大数据库,意味着每次推理时,模型要在一个巨大的知识空间里去检索,这必然带来更高的内存访问压力,单次前向计算的效率也会下降。
研究团队的解决办法是引入**混合专家(MoE, Mixture of Experts)**式的分块激活机制:把这个庞大的共享知识库切分成很多小块(也就是"专家"),每次推理只激活其中一小部分相关的知识块,而不是把整个仓库都翻一遍。
**MoE(混合专家模型)**:一种让模型在推理时只激活一部分参数(专家)的技术,可以在不显著增加计算量的前提下,让模型拥有更多的总参数量。
这就好比中央资料库虽然大,但你查资料的时候系统会自动帮你定位到相关的那几个书架,不用把整个仓库的灯都打开、把每一本书都翻一遍。虽然找资料这一步(检索)比原来复杂了一点,但真正搬运和处理的知识量反而变小了,整体效率不降反升。
论文里也做了实验验证这个设计的有效性,从零训练的Mobius-7B模型和继续在Qwen3.5-35B基础上训练出来的Intern-S2-Mobius-35B,都用了这种分块稀疏激活的方式。
实测效果到底如何
先看训练效率。论文用MMLU这个综合知识测试对比了从零训练的Mobius和传统Transformer,两者用一样的数据量训练,Mobius的分数始终更高。用Transformer训练1万亿token后的分数作为基准线,Mobius只用0.626倍的数据量就能达到同样水平,相当于1.6倍的数据效率提升。
再看规模化之后的表现。研究团队没有从零开始训练一个巨大的Mobius模型(成本太高),而是选择在开源模型Qwen3.5-35B的基础上做继续预训练,把架构切换成Mobius,得到了Intern-S2-Mobius-35B。结果很有意思,切换架构不仅没有让模型变笨,反而在多项测试上超过了原来的Qwen3.5-35B。
| 通用任务 | Intern-S2-Mobius-35B | Qwen3.5-35B |
|---|---|---|
| MMLU Pro | **89.05** | 85.31 |
| GPQA Diamond | **80.81** | 80.24 |
| IMO Bench | **81.25** | 77.50 |
| AIME 2026 | **95.31** | 92.08 |
| HMMT 2026 | **85.51** | 78.50 |
| UGD hard | 73.02 | **78.02** |
| AMO | **58.00** | 50.00 |
| SimpleQA | **28.90** | 21.39 |
| HLE | 19.11 | **22.40** |
| 平均分 | **67.88** | 65.05 |
科学任务上的差距更夸张:
| 科学任务 | Intern-S2-Mobius-35B | Qwen3.5-35B |
|---|---|---|
| Biology-Instructions | **51.40** | 3.77 |
| Mol-Instructions | **45.73** | 21.70 |
| MolecularIQ | **59.29** | 29.13 |
| 平均分 | **52.14** | 18.20 |
Biology-Instructions这一项,51.40对3.77,这不是提升,是数量级的差异。原因可能和Mobius的知识压缩能力有关,专业领域的知识本身比通用对话知识更依赖精确检索和组合,而Mobius的共享知识库天然更适合这种场景。
推理速度上的提升同样明显。论文测了不同批次大小(Batch Size)下的请求吞吐量,聚合多个测试集之后,Mobius比Transformer实现了最高4.6倍的吞吐量提升。论文标题里说的"4倍推理加速",指的就是这个综合表现。
这些效率提升,到底从哪来的
论文用一个具体案例来解释这个问题,而不是空谈架构优势。
案例是一道线性代数选择题,两个模型都答对了(选项C)。研究者把两个模型的推理过程按步骤对齐做了逐项比较。
在"任务理解"这一步,Mobius用17个token,Qwen3.5用20个token,差别不大。到"陈述1的判断"这一步,Mobius用178个token举了一个反例就得出结论,Qwen3.5却先试了零向量、又试了平行向量两种情况,用了283个token。到"选项匹配"这一步,Mobius只用22个token说"匹配选项C",Qwen3.5却又花了122个token重新表述一遍已经得出的结论。
最关键的差异在"重复推导和检查"这一步,Mobius完全没有这一步,而Qwen3.5额外花了1147个token去做一次完整的重新推导和多轮验证。
这说明什么?说明Mobius的省token不是靠压缩表达、砍掉必要的推理步骤,而是它本身就不需要那么多次的自我验证。传统Transformer因为每一步推理都要重新"从头激活"相关知识,容易出现不确定感,于是习惯性地反复检查。Mobius因为可以在潜在空间里直接、多轮地精炼答案,一次到位的确定性更高,自然不需要那么多来回确认。
最终统计下来,同一道题,Mobius用516个token,Qwen3.5用2364个token,差了4.6倍。这个数字和论文标题打出来的"4倍加速"基本对得上,说明这不是刷分技巧,而是真实的推理效率差异。
这个架构的野心,不只是省token
论文最后一部分很有意思,研究团队没有止步于说"我们的模型更快更强",而是提出了四个更大的问题,都是当前AI领域正在争论的方向。
第一个是**自我进化(Self-Evolving)**,模型能不能持续吸收新知识而不遗忘旧的?团队的判断是,传统Transformer架构因为知识和推理绑在一起,任何一次更新都可能同时改变两者,容易导致**灾难性遗忘(Catastrophic Forgetting)**:模型学了新东西之后,把之前学的东西忘掉了的现象。Mobius因为把知识和推理拆开了,理论上可以做到只扩充知识库而不动推理模块,从而减少这种冲突。
第二个是**世界模型(World Model)**,让AI理解连续的物理世界而不只是处理文字。团队认为传统Transformer要建模好连续空间可能需要天文数字级别的参数量,而Mobius原生支持的潜在推理,给这类建模提供了更自然的起点。
第三个是**科学发现**,团队认为现在的AI擅长解题,却缺乏提出突破性假设的能力,这需要知识之间更自由的组合和联想,而Mobius"打平"所有知识、让它们可以被任意层直接调用的特性,理论上有助于跨领域知识的组合。
第四个是**软硬件协同设计**,因为知识和推理分开了,未来有可能只把负责推理的那部分参数长期放在GPU显存里,而把海量的知识参数放在更便宜的SSD存储里,按需调取。这对于降低大模型部署成本,可能是一条现实的路。
这四个方向目前都还只是论文里的"设想",团队自己也承认,能不能真的落地还需要大量后续验证。但这至少说明了一件事,Mobius不只是一个让推理更快的技巧,它试图回答一个更根本的问题:知识和推理,到底应不应该被绑在一起?
写在后面
读到那道线性代数题的逐步对比时,我脑子里冒出的第一个念头是:我们可能一直把"话多"当成了"思考深入"的证据,但这篇论文用具体数字打破了这个错觉。Qwen3.5多花的那1147个token的"重复推导",翻回去看内容,其实和之前说过的没什么本质区别,只是又走了一遍流程。这让我想起写论文或者做汇报时,有些人反复重申观点,看起来很郑重,实际上只是缺乏底气的自我说服。
论文里那个专家激活模式的图(附录B)也值得单独说一说。从零训练的Mobius-7B激活分布很均匀,说明模型自己学会了灵活调用整个知识库;而从Qwen3.5转换过来的Intern-S2-Mobius-35B却保留了明显的"块对角"结构,说明原来Transformer那种层级分工的思维惯性,并没有被继续训练完全抹掉。这其实提示了一个问题,架构转换可能没有从零训练那么"干净",继续训练能改善但改不彻底。
还有一个没细说但值得追问的地方:论文反复强调Mobius的效率优势,但对训练成本本身谈得比较少。共享知识库意味着更高的检索开销,MoE式分块是缓解方案,但这个方案本身的调参复杂度、路由稳定性有没有隐藏成本,论文没有展开。这大概是留给后续工作的问题。
Q&A
Q1:Mobius架构是什么?
A:Mobius是上海AI实验室提出的一种新型大模型架构,核心是把知识存储(用FFN实现的Memory)和推理运算(用Self-Attention实现的Reasoner)解耦,让所有层的推理模块共享同一个全局知识数据库,而不是像传统Transformer那样每层各自拥有独立的知识存储。
Q2:Intern-S2-Mobius比Qwen3.5-35B强在哪里?
A:Intern-S2-Mobius-35B是基于Qwen3.5-35B继续预训练得到的Mobius架构模型,在MMLU Pro、GPQA Diamond、AIME 2026等多项通用任务上超过原模型,平均分67.88对65.05,在生物、分子等科学任务上优势更明显,同时推理吞吐量提升最高达4.6倍,输出长度平均缩短1.5到5倍。
Q3:Mobius为什么能用更少的token完成推理?
A:因为Mobius引入了动态潜在推理机制,让模型在内部连续向量空间里反复精炼答案,避免了传统模型靠生成大量文字token反复试错验证的低效模式,案例显示同一道题Mobius只用516个token,Qwen3.5需要2364个token。