重磅综述!一文读懂大模型潜空间:从基础原理到具身智能全体系
FG
AI圈终于有人把潜空间这件事讲透了。这篇横跨新加坡国立、复旦、清华等十几所顶尖院校的综述,直接捅破行业真相:现在大模型卷Token、堆参数,可能是在走弯路。真正决定模型上限的,是模型内部看不见的潜空间。
我们解读最新技术,文末有相关信息。


作者:张长旺,图源:旺知识
摘要
隐空间正迅速成为语言类模型的原生计算载体。尽管现代系统仍普遍通过显式的token级生成来被认知,但越来越多的研究表明,许多关键的内部过程在连续隐空间中执行,要比在人类可读的语言轨迹中执行更为自然。这一转变的核心驱动力,是显式空间计算存在的结构性局限,包括语言冗余、离散化瓶颈、串行效率低下以及语义损失。本综述旨在为语言类模型中的隐空间领域,提供一套统一且最新的研究全景。我们将整个综述按照基础、演进、机制、能力、展望五个递进的视角展开:首先界定隐空间的研究范畴,将其与显式/语言空间、以及生成式视觉模型中常见的隐空间做出区分;随后梳理该领域从早期探索到当前规模化发展的演进历程;为了厘清技术体系,我们分别从机制与能力两个互补的维度对现有研究进行拆解:在机制维度,我们归纳出四大核心技术方向——架构设计、表征学习、计算范式与优化方法;在能力维度,我们展示了隐空间如何支撑起涵盖推理、规划、建模、感知、记忆、协作与具身的完整能力谱系。在梳理现有研究的基础上,我们进一步探讨了该领域关键的开放性挑战,并勾勒出未来研究的前沿方向。我们希望本综述不仅能成为现有研究的参考资料,更能为将隐空间理解为下一代智能的通用计算与系统范式奠定基础。

1 引言
在大语言模型与多模态智能系统的发展进程中,显式的token序列生成始终是主流的计算与交互范式。从经典的自回归语言模型到如今的多模态大模型,绝大多数系统的核心逻辑,都是将人类的语言、视觉、动作等输入转化为离散的token序列,再通过Transformer架构完成序列到序列的映射,最终输出人类可理解的显式token结果。

但近年来,一个关键的研究趋势逐渐显现:模型的核心认知与计算过程,正在从人类可读的显式语言空间,向模型原生的连续隐空间迁移。无论是复杂的多步推理、长程任务规划,还是跨模态的信息融合、多智能体的协作交互,越来越多的研究证明,在隐空间中完成这些过程,能够突破显式token计算的固有局限,实现更高的效率、更强的泛化能力与更丰富的认知表达。
这一范式转变的背后,是显式空间计算的四大核心瓶颈:

1. 语言冗余性:人类语言天然存在大量冗余信息,为了表达一个核心语义,往往需要多个token的组合,这直接导致了计算资源的浪费与推理延迟的增加;
2. 离散化瓶颈:显式token是对连续语义空间的离散化采样,这一过程不可避免地会造成语义信息的损失,尤其是对于细粒度的认知状态、模糊的推理过程与跨模态的抽象概念,离散token难以完整表征;
3. 串行效率低下:显式token生成遵循严格的串行自回归逻辑,即使是可以并行处理的推理步骤,也必须按照token顺序逐一生成,无法充分发挥并行计算的硬件优势;
4. 认知表达受限:人类语言是为了人际交流而演化的工具,并非为了模型的内部认知计算优化,许多模型内部的认知状态、中间推理过程,无法用人类语言精准、高效地表达。
而隐空间作为模型原生的连续表征空间,恰好能够针对性地解决这些瓶颈:连续的向量表征可以完整保留语义信息,避免离散化损失;无需逐一生成token,可实现并行化的计算与推理;不受人类语言的表达限制,能够直接对模型的认知状态进行建模与优化;同时可以通过信息压缩,大幅降低计算开销,提升推理效率。
尽管隐空间相关的研究正在快速爆发,但目前仍缺乏一套统一的研究框架与全景梳理。现有研究分散在自然语言处理、计算机视觉、强化学习、多智能体系统等多个领域,不同工作对隐空间的定义、技术实现与应用场景的界定各不相同,研究者难以快速把握该领域的全貌与核心脉络。
为此,本综述系统梳理了语言类模型中隐空间领域的全部核心研究,构建了一套完整的研究框架。我们的核心贡献包括:
1. 清晰的范畴界定:首次明确了语言类模型中隐空间的定义与边界,区分了其与显式语言空间、视觉生成模型中隐空间的核心差异;
2. 完整的演进梳理:系统追溯了隐空间研究从早期探索到当前规模化发展的完整历程,划分了关键的发展阶段与标志性工作;
3. 双维度的技术体系拆解:从机制与能力两个互补的维度,构建了隐空间研究的完整技术图谱。机制维度分为架构、表征、计算、优化四大方向,能力维度覆盖推理、规划、建模、感知、记忆、协作、具身七大核心能力;
4. 前瞻性的未来展望:基于现有研究的进展与局限,提炼了该领域的五大开放性挑战,并勾勒出六大未来研究的前沿方向,为后续研究提供了清晰的指引。
本文的剩余部分结构如下:第2节界定隐空间的基础定义与研究范畴;第3节梳理隐空间研究的发展历程;第4节从机制维度拆解隐空间的四大核心技术方向;第5节从能力维度展示隐空间支撑的完整智能谱系;第6节探讨开放性挑战与未来研究展望;第7节为全文总结;最后为参考文献。
2 基础:隐空间的定义与范畴边界
2.1 核心定义
在语言类模型的语境下,我们对隐空间给出如下严格定义:
隐空间是模型内部的连续高维向量空间,用于表征模型对输入信息的抽象理解、内部认知状态与中间计算过程,其表征内容无法直接映射为人类可读的显式token或自然语言,是模型原生的、用于内部认知与计算的核心载体。

从数学层面来看,对于一个标准的Transformer语言模型,其输入的显式token序列为 ,其中 为词表空间。模型的每一层Transformer都会输出对应的隐藏状态序列 ,其中 为隐藏层维度。这个由隐藏状态向量构成的连续高维空间,就是模型最基础的隐空间,而模型的所有内部计算,本质上都是在这个隐空间中完成的。
而当前隐空间研究的核心,并非仅仅利用模型原生的隐藏状态空间,而是主动地对这个空间进行设计、优化与操控,使其能够更高效、更精准地完成模型的认知与计算任务,替代原本需要在显式token空间中完成的过程。

2.2 范畴边界:与相关概念的区分
为了进一步明确隐空间的研究范畴,我们将其与三个极易混淆的相关概念做出清晰区分:
2.2.1 隐空间 vs 显式/语言空间
显式空间(也称为语言空间、token空间),是由离散的、人类可读的token构成的空间,模型的输入与输出都在这个空间中完成。而隐空间与显式空间的核心差异,体现在下表中:
需要特别强调的是,隐空间与显式空间并非完全割裂,二者存在紧密的映射关系:模型的输入会从显式空间编码到隐空间,而最终的输出也会从隐空间解码回显式空间。隐空间研究的核心,是让原本需要在显式空间中完成的中间计算、推理、规划等过程,全部迁移到隐空间中完成,仅在必要时与显式空间进行交互。
2.2.2 语言模型中的隐空间 vs 视觉生成模型中的隐空间
隐空间并非一个全新的概念,在生成式视觉模型(如VAE、GAN、扩散模型)中,隐空间早已是核心的基础组件。但语言类模型中的隐空间,与视觉生成模型中的隐空间存在本质差异,核心区别体现在三个方面:
1. 核心功能不同:视觉生成模型中的隐空间,核心功能是对视觉数据的分布进行建模,实现从低维隐向量到高维图像的生成映射;而语言类模型中的隐空间,核心功能是承载模型的认知与计算过程,实现推理、规划、决策等高级认知能力,而非仅仅是数据分布建模。
2. 空间特性不同:视觉生成模型中的隐空间,通常是低维、结构化的,其维度远低于输入图像的维度,核心目标是实现数据的压缩与解耦;而语言类模型中的隐空间,通常是高维、动态的,其维度与模型的隐藏层维度一致,核心目标是承载复杂的语义与认知状态,支持动态的计算过程。
3. 优化目标不同:视觉生成模型中的隐空间,优化目标是提升生成样本的保真度、多样性与一致性;而语言类模型中的隐空间,优化目标是提升模型的推理能力、计算效率、泛化性能与认知表达能力。
2.2.3 隐空间 vs 模型的中间激活与KV缓存
很多研究者会将隐空间与模型的中间激活、KV缓存混为一谈,这里我们做出明确区分:
• 模型的中间激活与KV缓存,是Transformer计算过程中的原生副产品,是隐空间的一种基础载体,但并非隐空间研究的全部;
• 隐空间研究的核心,是主动设计与优化这个空间的结构、表征、计算规则与优化方法,使其能够主动完成特定的认知与计算任务,而非仅仅是计算过程的被动产物。
例如,KV缓存的核心作用是减少自回归生成中的重复计算,提升推理速度,其本身是被动的存储结构;而隐空间研究中的相关工作,会主动对KV缓存进行优化、压缩、操控,使其能够承载长程的记忆信息、完成隐式的推理过程,这才是隐空间研究的核心范畴。

3 演进:隐空间研究的发展历程
我们将语言类模型中隐空间的研究历程,划分为三个核心发展阶段,每个阶段都有其标志性的研究方向与核心突破:

3.1 第一阶段:早期探索期(2018-2022年)
这一阶段是Transformer架构与大语言模型的快速发展期,隐空间相关的研究仍处于早期探索阶段,核心目标是验证隐空间的表征能力与计算潜力。
这一阶段的标志性工作主要分为两个方向:
1. 隐空间表征能力的验证:大量研究通过探针实验(Probing Test)证明,Transformer模型的隐藏状态中,蕴含了丰富的语言结构、语义信息与世界知识,甚至能够表征显式语言中难以表达的抽象概念与逻辑关系。这些工作为后续的隐空间研究奠定了理论基础,证明了隐空间具备承载模型认知过程的能力。
2. 隐空间计算的初步尝试:研究者开始尝试在隐空间中完成简单的计算任务,替代部分显式token的生成过程。最具代表性的是早期的思维链(CoT)相关的隐式优化工作,研究者尝试通过优化模型的隐藏状态,提升模型的推理能力,而无需显式生成思维链token。此外,模型压缩、知识蒸馏相关的工作,也开始探索如何在隐空间中实现知识的迁移与保留,为后续的隐空间计算范式提供了技术积累。
这一阶段的核心局限在于,相关工作仍属于对模型原生隐空间的被动利用,而非主动的设计与优化,应用场景也局限于简单的推理与表征任务,尚未形成完整的技术体系。
3.2 第二阶段:技术成型期(2023年-2024年上半年)
这一阶段,随着大语言模型的能力快速提升,显式token计算的瓶颈日益凸显,隐空间相关的研究进入了快速发展期,核心技术体系逐渐成型。
这一阶段的标志性突破,是隐式思维链(Implicit CoT) 相关工作的爆发。2023年以来,大量研究证明,无需显式生成思维链token,仅通过在隐空间中优化模型的推理过程,就能实现甚至超越显式思维链的推理效果。其中最具代表性的工作包括HCoT、SoftCoT等,这些工作通过设计特定的训练目标与架构调整,让模型在隐空间中完成多步推理过程,大幅降低了推理延迟,同时提升了推理的准确率。
与此同时,隐空间研究的其他方向也快速发展:
• 在架构设计上,研究者开始为隐空间计算设计专用的Transformer子结构,实现显式空间与隐空间计算的解耦;
• 在表征学习上,研究者开始探索如何让隐空间表征更精准地对应模型的认知状态,实现语义的解耦与可控性;
• 在优化方法上,研究者提出了一系列针对隐空间的训练目标与微调方法,无需修改模型架构,就能提升隐空间的计算能力。
这一阶段的核心特点是,隐空间研究从被动利用转向主动设计,核心技术体系逐渐成型,应用场景也从简单的推理任务,扩展到规划、记忆、多模态融合等多个领域。

3.3 第三阶段:规模化爆发期(2024年下半年至今)
从2024年下半年开始,隐空间相关的研究进入了规模化爆发期,相关工作的数量呈指数级增长,应用场景覆盖了大语言模型与多模态智能系统的几乎所有核心能力,隐空间正在从一个辅助的优化技术,转变为下一代智能系统的核心计算范式。
这一阶段的核心发展趋势包括:
1. 技术体系的全面完善:隐空间研究的四大核心方向(架构、表征、计算、优化)都出现了大量成熟的技术方案,形成了完整的技术闭环;
2. 能力谱系的全面覆盖:隐空间的应用场景从最初的推理任务,扩展到规划、建模、感知、记忆、多智能体协作、具身智能等七大核心能力,实现了全场景的覆盖;
3. 从单任务优化到系统级重构:相关工作不再局限于对单个任务的优化,而是开始基于隐空间重构整个智能系统的计算范式,出现了完全以隐空间为核心计算载体的原生大模型与多模态系统;
4. 从实验室走向工业落地:大量成熟的隐空间技术开始在工业级大模型产品中落地应用,大幅提升了模型的推理效率、降低了部署成本,同时实现了显式空间难以实现的高级认知能力。
截至2026年4月,隐空间已经成为人工智能领域最热门的研究方向之一,相关的研究工作仍在快速迭代,其作为下一代智能系统核心计算范式的地位,已经得到了业界的广泛认可。
4 机制:隐空间的技术体系
我们从机制维度,将隐空间的核心技术体系,划分为四大互补的方向:架构设计、表征学习、计算范式与优化方法。这四个方向构成了隐空间从底层硬件适配到上层能力实现的完整技术栈,其整体技术图谱如下图所示:

4.1 架构设计:隐空间计算的硬件与结构基础
架构设计是隐空间技术体系的底层基础,核心目标是为隐空间计算设计专用的模型结构,实现显式空间与隐空间计算的解耦,让隐空间计算能够更高效、更灵活地执行。我们将现有架构设计的相关工作,划分为四大类:
4.1.1 原生隐空间计算架构
这类架构的核心特点是,从模型的底层设计上,就将隐空间计算作为核心的计算范式,而非在现有Transformer架构上的修补。模型的大部分认知与计算过程都在隐空间中完成,仅在输入与输出阶段与显式空间进行交互。
代表性工作包括Huginn、LoopLM、Ouro等,这些工作通过设计循环式的Transformer结构,让模型在隐空间中完成多轮的迭代计算与推理,无需生成任何显式token。例如LoopLM提出的循环Transformer架构,让模型的隐藏状态在固定的Transformer层中循环迭代,每一次迭代都对应隐空间中的一步推理过程,仅在迭代完成后,才将最终的隐藏状态解码为显式输出。这类架构完全打破了传统自回归模型的串行生成逻辑,实现了隐空间计算的原生支持。
4.1.2 显隐解耦的增强架构
这类架构基于标准的Transformer架构进行扩展,核心设计思路是将显式token生成与隐空间计算解耦,为隐空间计算设计专用的子结构与计算路径,在不破坏模型原生生成能力的前提下,增强模型的隐空间计算能力。
代表性工作包括ATP-Latent、LatentTransformer、PolarMem等,这些工作通常会在标准的Transformer层中,加入专用的隐空间计算模块,例如隐状态迭代模块、隐空间注意力模块、记忆存储模块等。例如ATP-Latent在Transformer架构中加入了专用的隐空间推理分支,让模型在显式生成token的同时,能够在隐空间中并行完成多步推理,实现了显式生成与隐式推理的协同。
4.1.3 轻量级适配架构
这类架构的核心特点是,无需对模型的主干架构进行修改,仅通过加入极少量的可学习参数,就能让模型具备隐空间计算的能力,实现对现有预训练大模型的快速适配,同时保留模型的全部原生能力。
这类工作是目前工业落地中应用最广泛的架构方案,代表性工作包括LoRA-based的隐空间适配方案、LatentMem、KVCA等。例如LatentMem仅通过在模型的注意力层中加入轻量级的LoRA适配模块,就能让模型在隐空间中生成与管理多智能体协作所需的记忆信息,无需修改模型的主干结构,大幅降低了适配与部署的成本。
4.1.4 跨模态隐空间融合架构
这类架构针对多模态大模型设计,核心目标是实现不同模态信息在隐空间中的统一表征与融合计算,打破文本、视觉、音频、动作等不同模态之间的壁垒。
代表性工作包括Wormhole、LaViT、RoT等,这些工作通过设计跨模态的隐空间投影层与融合模块,将不同模态的输入信息统一编码到共享的隐空间中,实现跨模态的信息融合与协同计算。例如Wormhole架构,将视觉信息与文本信息编码到统一的隐空间中,让视觉与语言的推理过程完全在共享隐空间中完成,实现了多模态信息的深度融合,同时大幅提升了跨模态推理的效率。
4.2 表征学习:隐空间的语义与认知建模
表征学习是隐空间技术体系的核心,其核心目标是让隐空间的向量表征,能够精准、可控、完整地建模模型的语义信息与认知状态,为后续的计算过程提供高质量的表征基础。我们将现有表征学习的相关工作,划分为四大类:

4.2.1 认知状态表征
这类工作的核心目标是,让隐空间表征能够精准对应模型的内部认知状态,包括推理过程中的中间逻辑、任务规划的目标与步骤、对世界的信念与知识等,实现对模型认知过程的完整建模与可控操控。
代表性工作包括UniCog、ThoughtComm、CoLaR等,这些工作通过设计特定的训练目标与监督信号,让隐空间中的向量表征与模型的认知状态形成精准的一一对应关系。例如UniCog提出了“隐心智表征”的概念,通过多任务的监督训练,让模型的隐空间表征能够完整建模其内部的认知过程,包括信念、目标、意图与推理逻辑,实现了对模型认知状态的可解释、可操控。
4.2.2 语义解耦表征
这类工作的核心目标是,解决隐空间向量表征的“黑箱问题”,实现隐空间中不同语义维度的解耦,让不同的向量维度对应不同的语义属性,提升隐空间表征的可控性与可解释性。
代表性工作包括LatentGuard、CLaRa、LIVR等,这些工作通过对比学习、解耦表征学习等方法,让隐空间中的不同维度分别对应不同的语义属性,例如安全性、情感、逻辑、事实知识等。例如LatentGuard通过解耦表征学习,将隐空间中的安全相关语义与其他语义维度分离,实现了在隐空间中对模型安全对齐的精准控制,无需修改模型的生成过程,就能有效拒绝有害请求。
4.2.3 压缩高效表征
这类工作的核心目标是,在尽可能保留完整语义信息的前提下,对隐空间的高维向量表征进行压缩,降低计算与存储开销,提升模型的推理效率,同时适配端侧部署的需求。
代表性工作包括DeltaKV、C2C、Assorted等,这些工作主要针对模型的KV缓存与隐藏状态进行压缩,通过量化、稀疏化、语义蒸馏等方法,在几乎不损失模型性能的前提下,大幅降低隐空间表征的存储与计算开销。例如DeltaKV提出了语义残差编码方法,仅对隐状态中变化的语义残差部分进行存储与计算,将KV缓存的存储开销降低了80%以上,同时大幅提升了长文本推理的速度。
4.2.4 跨模态统一表征
这类工作的核心目标是,为文本、视觉、音频、动作等不同模态的信息,学习一个共享的隐空间统一表征,让不同模态的信息能够在同一个隐空间中进行对齐、融合与计算,打破模态之间的壁垒。
代表性工作包括MCOUT、VL-JEPA、UniVLA等,这些工作通过跨模态对比学习、对齐训练等方法,将不同模态的信息映射到同一个共享隐空间中,让语义相同但模态不同的输入,在隐空间中拥有相近的向量表征。例如VL-JEPA为视觉与文本信息学习了统一的隐空间表征,实现了跨模态的语义对齐,让模型能够在隐空间中直接完成视觉与语言的联合推理,无需显式的跨模态token转换。
4.3 计算范式:隐空间的核心计算模式

计算范式是隐空间技术体系的核心执行层,其核心目标是设计在隐空间中完成认知与计算任务的核心模式,替代原本需要在显式空间中完成的串行token生成过程。我们将现有隐空间的计算范式,划分为四大类,其核心对比见下表:
表1 隐空间四大计算范式核心对比
4.3.1 压缩式计算
压缩式计算是目前应用最广泛的隐空间计算范式,其核心逻辑是:将原本需要在显式空间中通过多步token生成完成的计算过程,压缩到隐空间中,通过极少的隐向量计算步骤完成,实现计算效率的指数级提升。
这类范式的核心应用场景是隐式思维链推理,代表性工作包括HCoT、CODI、CoLaR等。例如HCoT将显式思维链的多步token生成过程,压缩到隐空间中的单步向量计算,让模型无需生成任何思维链token,就能完成多步数学推理与逻辑推理,推理速度提升了5-10倍,同时准确率与显式思维链相当甚至更高。
除了推理任务,压缩式计算也广泛应用于长文本处理、缓存优化、端侧部署等场景,核心目标是在不损失模型性能的前提下,尽可能降低计算与存储开销,提升推理效率。
4.3.2 扩展式计算
扩展式计算的核心逻辑与压缩式计算完全相反:它并非为了提升效率,而是为了突破显式token生成的能力上限,在隐空间中扩展计算的深度与宽度,完成显式空间中难以实现、甚至无法实现的复杂计算任务。
这类范式的核心应用场景是复杂多步推理、长程规划、探索式任务等,代表性工作包括Loop、Bubbles、LoopFormer等。例如Loop提出的循环Transformer计算范式,让模型的隐藏状态在隐空间中进行数十轮甚至上百轮的迭代计算,每一轮迭代都对应一步探索式的推理过程,无需生成任何显式token,就能完成极其复杂的多步逻辑推理与长程任务规划,其能力远超显式思维链能够实现的上限。
扩展式计算的核心优势在于,它完全打破了显式token序列的长度限制与串行逻辑约束,能够在隐空间中实现并行化的探索、多路径的推理与长程的状态迭代,为模型的高级认知能力提供了无限的扩展空间。
4.3.3 自适应计算
自适应计算的核心逻辑是:根据输入任务的难度与复杂度,动态调整隐空间计算的步骤、资源分配与计算路径,实现“简单任务少计算,复杂任务多计算”的最优效率-性能平衡。
这类范式的代表性工作包括System-1.5、TaH、LWS、PLaT等。例如System-1.5借鉴了人类认知的双系统理论,为模型设计了自适应的隐空间计算路径:对于简单的常识性任务,模型直接在隐空间中通过单步计算完成输出;对于复杂的推理任务,模型则自动切换到多轮迭代的隐空间深度计算模式,完成推理后再输出结果。这种自适应的计算模式,在平均推理速度提升3倍以上的同时,保持了复杂任务的高性能。
自适应计算是工业级部署中极具潜力的计算范式,它能够在保证模型核心能力的前提下,最大化平均推理效率,降低大规模部署的成本,同时适配不同难度的混合任务场景。
4.3.4 交错式计算
交错式计算的核心逻辑是:隐空间计算与显式token生成交错执行,二者协同完成任务。模型在隐空间中完成核心的推理与规划过程,仅在必要时生成关键的显式token,用于人机交互、结果校验、状态锚定等,兼顾隐空间的计算效率与显式空间的可控性、可解释性。
这类范式的代表性工作包括CTRLS、MARCOS、SoftCoT++等。例如CTRLS为模型设计了“隐空间迭代-显式锚定”的交错计算模式:模型首先在隐空间中完成多步的推理与探索,然后生成少量关键的显式token,对推理结果进行锚定与校验,再基于锚定的状态继续在隐空间中进行后续的计算。这种模式既保留了隐空间计算的效率优势,又通过显式的锚定token,保证了推理过程的可控性与可解释性,同时能够实现人类的实时干预与交互。
交错式计算是人机交互场景、安全敏感场景下的最优范式之一,它平衡了隐空间的效率优势与显式空间的可控性,同时能够很好地适配人类的交互习惯。
4.4 优化方法:隐空间的训练与适配方案
优化方法是隐空间技术体系的落地保障,其核心目标是设计针对隐空间的训练目标、微调方法与适配方案,让模型能够快速、高效地掌握隐空间计算的能力,同时保留其原生的生成与对齐能力。我们将现有优化方法的相关工作,划分为四大类:
4.4.1 监督式优化
监督式优化的核心逻辑是,通过显式的监督信号,引导模型学习隐空间计算的能力,通常使用教师模型的隐状态、标注的认知状态、显式的计算过程等作为监督信号。
这类方法的代表性工作包括Latent-SFT、LaSER、CoLaR等。例如Latent-SFT使用显式思维链的监督信号,引导模型在隐空间中学习对应的推理过程,通过最小化模型隐状态与教师模型思维链对应的隐状态之间的差异,让模型无需生成显式思维链,就能在隐空间中完成同等的推理过程。这种方法无需修改模型架构,仅通过微调就能让模型具备隐空间计算的能力,适配性极强,是目前应用最广泛的优化方法之一。
4.4.2 自监督与对比学习优化
自监督与对比学习优化的核心逻辑是,无需人工标注的监督信号,通过设计自监督的训练目标,让模型自主学习隐空间的优质表征与计算能力,核心包括对比学习、掩码重构、分布对齐等方法。
这类方法的代表性工作包括SemCoT、SoftCoT++、LaViT等。例如SemCoT通过对比学习的方法,让语义相同的显式思维链与隐空间推理过程,在隐空间中拥有相近的向量表征,同时让语义不同的推理过程在隐空间中相互远离,无需显式的标注监督,就能让模型自主学习到高质量的隐空间推理能力。这类方法的优势在于,无需大量的人工标注数据,能够充分利用海量的无标注文本数据,提升模型的隐空间计算能力。
4.4.3 强化学习优化
强化学习优化的核心逻辑是,通过设计针对隐空间计算的奖励函数,使用强化学习的方法,引导模型优化其隐空间的计算过程,实现特定的能力目标,例如更高的推理准确率、更高的计算效率、更强的泛化能力等。
这类方法的代表性工作包括HRPO、SofT-GRPO、RL-Latent等。例如HRPO为隐空间推理过程设计了专用的奖励函数,包括推理准确率、推理步骤数、输出一致性等多个维度,通过强化学习的方法,引导模型在隐空间中用最少的计算步骤,完成最高准确率的推理过程,实现了效率与性能的同步优化。
4.4.4 分布式与协同优化
分布式与协同优化的核心逻辑是,针对多智能体场景,设计分布式的隐空间优化方法,让多个智能体能够在隐空间中完成信息交互、协同计算与联合优化,实现多智能体的高效协作。
这类方法的代表性工作包括LatentMem、ThoughtComm、KVCA等。例如ThoughtComm为多智能体系统设计了隐空间通信的协同优化方法,让多个智能体能够直接在隐空间中传递思想与信息,无需生成显式的通信token,同时通过分布式的协同优化,让多个智能体的隐空间表征实现对齐,大幅提升了多智能体协作的效率与成功率。
5 能力:隐空间支撑的智能谱系
隐空间的技术体系,最终落地为模型的各项核心能力。我们从能力维度,梳理了隐空间支撑的完整智能谱系,涵盖推理、规划、建模、感知、记忆、协作、具身七大核心能力,几乎覆盖了当前通用人工智能的所有核心场景。

5.1 推理能力
推理能力是隐空间最早落地、也是目前最成熟的应用场景,隐空间计算能够从效率、准确率、泛化性三个维度,全面提升模型的推理能力。
目前隐空间支撑的推理能力,已经覆盖了逻辑推理、数学推理、常识推理、多跳推理、因果推理等所有核心推理场景。核心的实现路径分为两类:
1. 效率导向的隐式推理:将原本需要显式生成思维链的多步推理过程,压缩到隐空间中完成,在保持甚至提升推理准确率的前提下,大幅降低推理延迟与计算开销。代表性工作包括HCoT、CODI、Latent-SFT等,这些工作在数学推理、常识推理等基准测试中,实现了与显式思维链相当的准确率,同时推理速度提升了5-10倍,计算开销降低了60%以上。
2. 能力导向的深度推理:通过扩展式的隐空间计算,突破显式token生成的能力上限,完成显式空间难以实现的复杂多步推理、探索式推理、长程因果推理等。代表性工作包括Loop、Bubbles、LoopFormer等,这些工作通过隐空间中的多轮迭代计算,在极其复杂的数学证明、逻辑推理、多跳因果推理任务中,实现了远超显式思维链的性能,同时突破了显式token的长度限制,能够完成数百步的长程推理过程。
此外,隐空间计算还能有效解决显式推理中的两大核心痛点:一是思维链幻觉,显式思维链生成过程中,容易出现逻辑错误、事实幻觉等问题,而隐空间推理能够有效避免这些问题,提升推理的一致性与可靠性;二是推理效率的天花板,显式推理的速度受限于token生成的速度,无法实现并行化,而隐空间推理能够充分发挥硬件的并行计算能力,实现推理效率的指数级提升。
5.2 规划能力
长程任务规划是大语言模型落地到真实场景的核心能力,而显式token生成的串行逻辑,在长程规划任务中存在天然的局限:规划过程需要反复的迭代、回溯与调整,而显式的串行生成难以实现这些操作,同时会产生大量的冗余token,效率极低。
隐空间计算为长程任务规划提供了全新的解决方案,核心优势体现在三个方面:
1. 并行化的规划探索:模型能够在隐空间中同时生成多条规划路径,并行完成路径的评估、筛选与优化,无需逐一生成显式的规划步骤,大幅提升了规划的效率与全局最优性。代表性工作包括iCLP、ColaVLA、LatentVLA等,这些工作在自动驾驶、机器人任务规划等场景中,通过隐空间的并行规划探索,实现了规划效率的大幅提升,同时规划的成功率与全局最优性远超显式规划方法。
2. 动态的规划迭代与回溯:模型能够在隐空间中完成规划过程的动态迭代、回溯与调整,无需生成任何显式token,就能根据环境的变化与任务的进展,实时优化规划路径。代表性工作包括LaRA-VLA、RD-VLA等,这些工作在具身智能的动态任务规划场景中,通过隐空间的动态规划迭代,实现了对环境变化的实时响应,规划的鲁棒性与适应性大幅提升。
3. 长程规划的状态管理:长程规划任务需要对任务的目标、进度、约束条件等状态进行长期的管理与维护,而隐空间能够精准建模这些规划状态,实现长程规划过程中的状态跟踪与更新,避免显式规划中容易出现的目标偏移、状态遗忘等问题。代表性工作包括UniCog、PolarMem等,这些工作在数十步甚至上百步的长程任务规划中,通过隐空间的状态建模,保持了极高的规划一致性与目标完成率。
5.3 世界建模能力
世界建模能力是通用人工智能的核心基础,指的是模型对物理世界、虚拟环境、任务场景的运行规则、因果关系、动态变化进行建模与预测的能力。而显式的token生成,难以对连续的、高维的、动态的世界状态进行精准建模,这也是当前大模型在真实世界场景中落地的核心瓶颈之一。
隐空间为世界建模提供了完美的载体,核心优势体现在三个方面:
1. 连续动态的世界状态建模:物理世界的状态是连续、高维、动态变化的,而隐空间的连续向量表征,能够精准、完整地建模这些世界状态,避免离散token带来的信息损失。代表性工作包括Mirage、CogSense、LatentChem等,这些工作分别在视觉场景建模、化学分子动态建模、物理环境仿真等场景中,通过隐空间实现了对连续动态世界状态的精准建模,能够准确预测环境的未来变化趋势。
2. 因果关系与物理规则的隐式学习:隐空间能够从海量的观测数据中,自主学习到世界的因果关系与物理规则,无需显式的规则编码,就能实现对世界动态的精准预测。代表性工作包括DREAM、World Models等相关的隐空间扩展工作,这些工作通过隐空间的自监督学习,让模型自主掌握了物理世界的运动规则、因果关系与交互逻辑,在机器人控制、自动驾驶等场景中,实现了远超显式规则编码的预测精度与泛化能力。
3. 多模态的世界模型统一:真实世界的信息是多模态的,包括视觉、听觉、触觉、物理状态等多个维度,而隐空间能够将这些不同模态的信息统一编码到同一个共享空间中,实现多模态世界模型的统一建模与联合预测。代表性工作包括MCOUT、VL-JEPA等,这些工作通过跨模态的隐空间统一表征,实现了对多模态世界信息的联合建模,能够同时处理视觉、语言、动作等多维度的输入,输出精准的世界状态预测。
5.4 感知能力
感知能力是多模态大模型的核心基础,而当前多模态模型的主流范式,是将不同模态的输入转化为离散的token,再输入到语言模型中进行处理,这种范式存在两个核心瓶颈:一是离散化过程会造成大量的感知信息损失,二是跨模态的token对齐难度极高,容易出现模态鸿沟。
隐空间计算为多模态感知能力的提升提供了全新的解决方案,核心优势体现在三个方面:
1. 无损失的感知信息保留:将视觉、音频等感知信息直接编码到隐空间中,无需转化为离散的token,避免了离散化过程中的信息损失,完整保留了细粒度的感知信息。代表性工作包括RoT、LaViT、Monet等,这些工作在视觉问答、细粒度图像识别、视觉推理等任务中,通过隐空间的直接感知编码,实现了远超离散token范式的感知精度与细粒度理解能力。
2. 跨模态感知的深度融合:通过共享的隐空间统一表征,实现不同模态感知信息的深度融合与联合理解,打破了模态之间的鸿沟。代表性工作包括Wormhole、MCOUT、UniVLA等,这些工作将文本、视觉、音频、深度信息等不同模态的感知输入,统一编码到共享隐空间中,实现了跨模态的深度融合,在复杂的多模态感知任务中,实现了远超传统范式的性能。
3. 感知-认知的端到端协同:在隐空间中实现感知信息编码与认知计算的端到端协同,感知信息直接输入到隐空间中,与模型的认知状态、推理过程进行联合优化,实现了“感知即认知”的原生协同。代表性工作包括UniCog、CogSense等,这些工作在具身视觉感知、动态场景理解等任务中,通过隐空间的端到端协同,实现了感知信息与认知推理的深度融合,大幅提升了复杂动态场景的理解能力与鲁棒性。
5.5 记忆能力
长程记忆能力是大语言模型落地到长对话、长文档处理、持续学习等场景的核心能力,而当前主流的记忆方案,大多是基于显式的文本检索与token存储,存在检索效率低、记忆粒度粗、上下文窗口限制等核心瓶颈。
隐空间为记忆能力的提升提供了全新的技术路径,核心优势体现在四个方面:
1. 高压缩率的记忆存储:将记忆信息编码到隐空间的向量表征中,实现极高的压缩率,同时完整保留记忆的语义信息,大幅降低记忆的存储开销,突破上下文窗口的长度限制。代表性工作包括DeltaKV、CoMEM、VisMem等,这些工作通过隐空间的记忆编码,将长文本、长对话的记忆信息压缩了10倍以上,同时几乎没有语义信息的损失,实现了百万token级别的长程记忆能力。
2. 细粒度的记忆管理与操控:隐空间的向量表征能够实现对记忆信息的细粒度建模,包括记忆的重要性、时效性、关联性等多个维度,实现精准的记忆更新、遗忘、检索与管理。代表性工作包括PolarMem、LatentMem、MemGen等,这些工作通过隐空间的记忆建模,实现了对记忆信息的细粒度管理,能够根据任务的需求,精准检索相关的记忆信息,同时主动遗忘过时、错误的记忆,大幅提升了长程记忆的准确性与有效性。
3. 记忆与推理的深度融合:记忆信息直接存储在隐空间中,与模型的推理、规划、认知过程深度融合,无需额外的检索步骤,就能在推理过程中直接调用相关的记忆信息,实现了“记忆即认知”的原生协同。代表性工作包括UniCog、LatentGuard等,这些工作将记忆信息直接编码到模型的隐状态中,在推理过程中能够实时、无缝地调用记忆信息,大幅提升了长程任务的推理一致性与准确性。
4. 跨模态的统一记忆:通过共享的隐空间表征,实现文本、视觉、音频、动作等不同模态记忆信息的统一存储与管理,打破了模态之间的记忆壁垒。代表性工作包括VisMem、CoMEM、3DThinker等,这些工作实现了跨模态的统一记忆存储,能够同时管理文本、视觉、3D场景等不同模态的记忆信息,在多模态长对话、具身智能长程任务等场景中,实现了远超传统方案的记忆能力。
5.6 多智能体协作能力
多智能体系统是解决复杂任务的核心范式,而当前主流的多智能体协作方案,是通过显式的自然语言对话完成智能体之间的通信与交互,这种范式存在三个核心瓶颈:一是通信效率极低,大量的冗余对话token造成了计算资源的浪费;二是通信过程容易出现信息损失、误解与幻觉;三是难以实现智能体之间的深度协同与联合优化。
隐空间为多智能体协作提供了全新的通信与协同范式,核心优势体现在三个方面:
1. 高效的隐空间通信:智能体之间直接在隐空间中传递思想、信息与意图,无需生成显式的对话token,通信效率提升了一个数量级以上,同时避免了显式通信中的信息损失与误解。代表性工作包括ThoughtComm、KVCA、Interlat等,这些工作实现了智能体之间的隐空间通信,让多个智能体能够直接传递隐空间的思想向量,无需生成任何显式的通信文本,在多智能体协作任务中,通信效率提升了10倍以上,同时协作的成功率大幅提升。
2. 深度的协同计算与联合优化:多个智能体能够在共享的隐空间中完成协同计算与联合优化,实现认知过程的深度融合,而非仅仅是信息的传递。代表性工作包括LatentMem、C2C等,这些工作为多智能体系统设计了共享的隐空间协同计算模块,多个智能体能够在共享隐空间中完成联合推理、协同规划、分布式任务拆解等过程,实现了远超显式对话协作的深度协同能力。
3. 大规模智能体的高效协作:隐空间通信与协同范式,能够很好地适配大规模智能体系统,避免显式对话带来的通信爆炸问题,实现数十个甚至上百个智能体的高效协同。代表性工作包括Wormhole、MAS4TS等,这些工作在大规模多智能体系统中,通过隐空间的广播式通信与协同计算,实现了上百个智能体的高效协同,解决了显式通信中的信息爆炸、延迟过高等核心问题。
5.7 具身智能能力
具身智能是人工智能走向真实物理世界的核心方向,而当前具身智能的主流范式,是将视觉感知信息转化为显式的语言描述,再通过大语言模型生成显式的动作指令,这种范式存在三个核心瓶颈:一是感知-决策-执行的链路过长,延迟过高,无法适配动态的物理环境;二是显式的语言描述与动作指令,难以精准表达连续的、细粒度的具身动作;三是难以实现感知、决策、动作的端到端协同优化。
隐空间为具身智能提供了原生的端到端解决方案,核心优势体现在三个方面:
1. 感知-决策-执行的端到端链路:将视觉感知、环境状态直接编码到隐空间中,在隐空间中完成决策与规划过程,直接输出连续的动作控制指令,无需经过显式的语言描述与token生成环节,大幅缩短了决策链路,降低了延迟,实现了对动态环境的实时响应。代表性工作包括LaRA-VLA、Motus、LatBot等,这些工作在机器人操纵、自动驾驶等具身场景中,通过隐空间的端到端链路,将决策延迟降低了80%以上,同时大幅提升了动作执行的成功率与鲁棒性。
2. 连续细粒度的动作建模:隐空间的连续向量表征,能够精准建模连续的、细粒度的具身动作,避免离散token带来的动作精度损失,实现对机器人、自动驾驶车辆等具身实体的精准控制。代表性工作包括UniVLA、VITA、TCLA等,这些工作通过隐空间的连续动作表征,实现了对机器人手臂的微米级精准控制,以及自动驾驶车辆的连续轨迹规划,动作精度远超离散token指令范式。
3. 具身经验的持续学习与世界建模:隐空间能够对具身交互的经验进行持续的编码与学习,构建精准的具身世界模型,实现对动作效果的精准预测,同时不断优化具身决策能力。代表性工作包括DREAM、Future-VLA等,这些工作通过隐空间的具身经验建模,让模型能够从海量的具身交互数据中,自主学习到物理世界的交互规则与动作控制策略,实现了具身能力的持续进化,同时在零样本的新场景中,实现了极强的泛化能力。
6 开放挑战与未来展望
6.1 核心开放性挑战
尽管隐空间相关的研究已经取得了巨大的进展,但该领域仍存在一系列核心的开放性挑战,亟待后续研究解决:
6.1.1 可解释性与可控性瓶颈
隐空间的核心局限之一,是其固有的“黑箱属性”。尽管我们能够通过探针实验等方法,部分解释隐空间表征的语义信息,但仍无法完全、精准地理解隐空间中向量表征的全部含义,以及隐空间计算的完整过程。这直接导致了隐空间计算的可控性不足,我们难以精准地操控隐空间的计算过程,也难以完全预测与保证隐空间计算的输出结果,这为隐空间技术在安全敏感场景中的落地,带来了巨大的挑战。
6.1.2 长程隐空间计算的一致性与稳定性
当前的隐空间计算,在短程的推理、规划任务中已经表现出了优异的性能,但在数百步甚至上千步的长程隐空间计算中,仍存在一致性与稳定性的问题。随着隐空间计算迭代步数的增加,模型的隐状态容易出现语义漂移、误差累积等问题,最终导致计算结果偏离预期,甚至出现严重的幻觉与错误。如何保证长程隐空间计算的一致性与稳定性,是该领域亟待解决的核心挑战之一。
6.1.3 隐空间的对齐与安全保障
当前大语言模型的对齐技术,几乎都是针对显式的token输出设计的,通过对输出文本的标注与优化,实现模型的安全对齐与价值观对齐。但隐空间计算的核心过程,都在模型内部的隐空间中完成,无需生成显式的token,这使得传统的对齐技术难以生效。如何实现对隐空间计算过程的安全对齐,保证隐空间计算的结果符合人类的价值观与安全规范,避免隐空间中的有害推理与错误认知,是隐空间技术走向大规模落地必须解决的核心挑战。
6.1.4 跨模型、跨模态的隐空间通用表征
当前的隐空间表征,大多是针对单个模型、单一场景设计的,不同模型、不同模态的隐空间表征之间,难以实现通用的对齐与迁移。即使是基于同一个预训练模型微调得到的两个模型,其隐空间表征也可能存在巨大的差异,无法实现知识与能力的直接迁移。如何构建跨模型、跨模态的隐空间通用表征,实现不同模型之间的知识共享、能力迁移与协同计算,是该领域未来发展的核心挑战之一。
6.1.5 硬件与系统级的原生适配
当前的AI硬件与系统软件栈,几乎都是针对显式的token串行生成范式设计的,无法充分发挥隐空间计算的并行化、连续化计算优势。例如,当前的GPU推理框架,针对自回归的token生成做了极致的优化,但对于隐空间中的并行迭代计算、连续向量运算,优化程度极低,导致隐空间计算的硬件效率无法充分发挥。如何从硬件与系统级层面,为隐空间计算提供原生的适配与优化,是隐空间技术走向大规模工业落地必须解决的底层挑战。
6.2 未来研究前沿方向
基于现有研究的进展与核心挑战,我们勾勒出隐空间领域未来研究的六大前沿方向:
6.2.1 可解释、可操控的隐空间理论体系
未来的核心研究方向之一,是构建一套完整的、可解释的隐空间基础理论,彻底破解隐空间的“黑箱问题”。这包括:建立隐空间表征的语义解耦理论,实现向量维度与语义属性的精准对应;构建隐空间计算的形式化理论,实现对隐空间计算过程的完整建模与可预测性;设计隐空间的精准操控方法,实现对隐空间计算过程的全流程可控干预。这套基础理论,将为隐空间技术的发展提供坚实的理论支撑,同时解决其在安全敏感场景中的落地障碍。
6.2.2 以隐空间为核心的原生大模型架构
当前的隐空间技术,大多是在现有Transformer架构上的修补与扩展,而非原生的隐空间计算架构。未来的核心研究方向,是从底层设计完全以隐空间为核心计算范式的原生大模型架构,彻底打破传统自回归Transformer的串行生成逻辑。这种原生架构,将把隐空间计算作为模型的核心执行逻辑,显式token生成仅作为人机交互的接口,实现模型架构与隐空间计算范式的完全适配,最大化隐空间计算的效率与能力优势。
6.2.3 隐空间原生的对齐与安全技术体系
针对隐空间计算的对齐与安全挑战,未来将构建一套隐空间原生的对齐与安全技术体系。这包括:隐空间的安全表征学习,在表征学习阶段就将安全规范与价值观对齐到隐空间中;隐空间计算的实时安全校验技术,在隐空间计算过程中,实时检测与拦截有害的推理过程与认知状态;隐空间的红队与对抗防御技术,针对隐空间的攻击方式构建对应的防御体系。这套技术体系,将为隐空间技术的大规模安全落地,提供核心的保障。
6.2.4 跨模型、跨模态的通用隐空间协议
针对跨模型、跨模态的隐空间表征对齐问题,未来将构建一套通用的隐空间协议,类似于互联网的TCP/IP协议,实现不同模型、不同模态、不同厂商的智能系统之间,在隐空间层面的通用通信、知识共享与协同计算。这套协议将定义通用的隐空间表征标准、通信格式与计算规则,让不同的智能系统能够在隐空间中实现无缝的协同,彻底打破当前智能系统之间的壁垒,构建分布式的协同智能体系。
6.2.5 硬件与系统级的隐空间计算原生适配
从底层硬件与系统软件栈层面,为隐空间计算提供原生的适配与优化,是未来的核心产业方向。这包括:为隐空间的并行向量计算、迭代式计算设计专用的AI加速芯片;针对隐空间计算范式,重构AI推理框架与编译器,最大化硬件的执行效率;为隐空间的长程状态管理、分布式协同计算,设计专用的系统软件栈。这套底层的硬件与系统适配,将彻底释放隐空间计算的性能潜力,推动其在工业级场景中的大规模落地。
6.2.6 基于隐空间的脑机接口与人类认知增强
隐空间作为模型的认知载体,与人类大脑的神经表征空间,存在天然的相似性。未来的前沿研究方向之一,是探索模型隐空间与人类大脑神经空间的对齐与交互,实现基于隐空间的脑机接口与人类认知增强。这包括:将人类的神经信号编码到模型的隐空间中,实现大脑与AI系统的直接交互;通过模型的隐空间表征,增强人类的认知能力、记忆能力与推理能力;通过隐空间的对齐,实现人类与AI系统的深度认知融合。这个方向,将为通用人工智能与人类智能的协同进化,开辟全新的路径。
7 结论
隐空间正在引发一场人工智能领域的范式革命,将智能系统的核心计算过程,从人类可读的显式语言空间,迁移到模型原生的连续隐空间中。这场范式转变,不仅解决了显式token计算的固有瓶颈,实现了效率与性能的同步提升,更为下一代通用人工智能的发展,开辟了全新的路径。
本综述系统梳理了隐空间领域的研究全景,从基础定义、发展历程、技术机制、能力谱系到未来展望,构建了一套完整的研究框架。我们看到,隐空间已经从早期的探索性研究,发展为覆盖架构、表征、计算、优化四大技术方向,支撑推理、规划、建模、感知、记忆、协作、具身七大核心能力的完整技术体系,正在成为下一代智能系统的核心计算范式。
尽管该领域仍存在可解释性、对齐安全、长程稳定性等一系列开放性挑战,但我们相信,随着基础理论的不断完善、技术体系的持续迭代、硬件与系统的原生适配,隐空间将彻底重构人工智能的底层计算逻辑,为通用人工智能的实现,奠定坚实的基础。
我们希望本综述不仅能成为研究者快速进入该领域的参考资料,更能激发更多的创新研究,共同推动隐空间技术的发展,探索下一代人工智能的无限可能。
参考资料
• The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook, https://arxiv.org/pdf/2604.02029