浙大NTU高校IEEE会士领衔综述:知识蒸馏重塑移动智能体AI新范式
边缘设备想拥有和云端AI一样的“聪明大脑”?算力不够、电池续航短、延迟不能高——这三大难题直接卡住了边缘通用智能的脖子!IEEE会士领衔的浙大+NTU等8大高校顶尖团队重磅出手,带来一篇全面综述,揭秘知识蒸馏如何成为移动智能体AI的“终极瘦身术”,既能保留大型模型的强大能力,又能适配边缘设备的苛刻条件,从无线通信到自动驾驶,从无人机到智能家居,这项技术正在重塑边缘智能的未来……
我们解读最新技术,文末有相关信息。


作者:张长旺,图源:旺知识
摘要 & 解读
边缘通用智能(EGI)代表了移动边缘计算领域的范式转变,智能体在动态、资源受限的环境中自主运行。然而,由于计算、能量和存储资源有限,在移动和边缘设备上部署先进的智能体人工智能模型面临重大挑战。为应对这些限制,本综述探讨了知识蒸馏(KD)与边缘通用智能的融合,将知识蒸馏定位为无线边缘实现高效、通信感知和可扩展智能的关键支撑技术。特别地,我们重点关注专为无线通信和移动网络设计的知识蒸馏技术,例如信道感知自蒸馏、跨模型信道状态信息(CSI)反馈蒸馏以及鲁棒调制/分类蒸馏。此外,我们回顾了原生适用于知识蒸馏和边缘部署的新型架构,如Mamba、RWKV(感受野、权重、键、值)和跨架构蒸馏,这些架构提升了泛化能力。随后,我们考察了知识蒸馏驱动的架构在视觉、语音和多模态任务中赋能边缘通用智能的各类应用。最后,我们强调了知识蒸馏在边缘通用智能领域面临的关键挑战和未来方向。本综述旨在为探索边缘通用智能时代下移动智能体人工智能知识蒸馏驱动框架的研究人员提供全面参考。
研究背景:
• 市场与技术趋势:移动边缘计算市场规模快速扩张(2024年约16.5亿美元,2032年预计超135亿美元),“智能体化”成为核心变革,边缘设备从被动节点转变为具备感知-规划-行动-记忆能力的移动智能体。
• 核心矛盾:边缘通用智能(EGI)需移动智能体AI支撑,但大型语言模型(LLM)等核心组件的计算、内存、能量需求,与边缘设备“资源受限、低延迟”的特性形成“部署鸿沟”。
• 技术基础:知识蒸馏通过“师生架构”实现模型压缩,让小型学生模型模仿大型教师模型的行为,成为弥合部署鸿沟的关键技术。
• 现有研究缺口:现有综述缺乏对边缘通用智能场景下知识蒸馏的系统性探讨,未充分覆盖无线通信定制化蒸馏技术、边缘原生架构适配,以及智能体AI与边缘部署的协同设计。
研究贡献:
• 专题综述无线通信场景定制化知识蒸馏技术,包括信道感知自蒸馏、跨模型CSI反馈蒸馏、鲁棒调制/分类蒸馏等,填补该领域专项综述空白。
• 系统梳理边缘原生架构(Mamba、RWKV等)与跨架构蒸馏的融合方案,解决Transformer架构二次复杂度的边缘部署瓶颈。
• 全面分析知识蒸馏在智能体“感知-规划-行动-记忆”四大核心能力中的适配设计,覆盖视觉、语音、多模态等任务。
• 总结知识蒸馏在无人机、自动驾驶、机器人、物联网等边缘场景的应用效果,提出技术与伦理双重挑战及未来研究方向,为领域提供全面参考框架。
实现设计:
• 核心技术框架:基于“教师-学生”架构的知识蒸馏,包含三类蒸馏范式——响应式蒸馏(模仿教师输出层概率分布)、特征式蒸馏(对齐中间特征表示)、关系式蒸馏(捕捉样本间高阶依赖)。
• 无线场景定制化设计:针对信道估计、CSI反馈、调制分类等无线核心任务,设计专用蒸馏方案(如编码器知识蒸馏、对抗稳健蒸馏),适配无线动态环境。
• 边缘原生架构适配:结合Mamba(线性时间序列架构)、RWKV(RNN-Transformer混合架构)等低复杂度架构,通过跨架构蒸馏(含投影器对齐特征空间),弥补边缘原生架构预训练不足的问题。
• 智能体能力适配:针对“感知-规划-行动-记忆”四大能力,分别设计蒸馏方案(如感知阶段的信道状态蒸馏、规划阶段的策略蒸馏/思维链蒸馏、记忆阶段的无数据蒸馏)。
实验结果:
• 信道状态信息反馈:学生模型NMSE提升7.6dB,编码器计算复杂度降至教师模型的25.50%-43.46%;蒸馏后模型在不完美CSI场景下,PSNR比基准提升0.40-0.54dB。
• 调制分类:学生模型准确率提升2.4%,浮点运算量不足教师模型一半;对抗稳健蒸馏后,30dB SNR下PGD攻击准确率达77.86%,比基准高4.6%-30%。
• 跨架构蒸馏:Vision Transformer教师模型向轻量级CNN学生模型蒸馏后,参数减少97.4%(从85.8M降至2.2M),保留93%诊断准确率,模型体积仅8.79MB。
• 场景化应用:无人机任务中,蒸馏后模型参数仅为原始1.3%,任务完成延迟降低95%;物联网手势识别场景,28K参数的学生模型准确率达99.5%。

1. 引言
1.1 背景
移动边缘计算市场正经历大幅扩张,预计其价值将从2024年的约16.5亿美元飙升至2032年的超过135亿美元¹。这一增长得益于对低延迟计算的需求不断增加,以及日益增多的移动和物联网设备对体验质量(QoE)的提升需求。这一不断演变的格局正在推动一场名为“智能体化”的重大技术变革,通过整合大型语言模型(LLMs)和其他先进人工智能模块,边缘设备被赋予自主能力。这一转变将被动边缘节点转变为主动移动智能体人工智能系统,能够感知环境、进行推理并执行复杂的多步骤任务,而无需人类直接干预。

这种以智能体为中心的范式具有多方面优势。移动智能体人工智能[1]实现了更高程度的自动化和个性化,因为智能体可以学习用户偏好并在设备上实时适应动态情况。这种设备端处理通过减少对集中式云服务器的依赖,显著降低了延迟并增强了数据隐私。此外,这些智能体能够主动预测问题、优化工作流程并跨不同系统进行协调,从而提高运营效率、加快问题解决速度并提升服务灵活性。通过在网络边缘嵌入复杂的认知能力,移动智能体人工智能为更智能、响应更迅速且更安全的应用铺平了道路,标志着向边缘通用智能实现迈出的关键一步——边缘通用智能被定义为边缘设备在严格的资源和延迟限制下,执行与云人工智能相当的通用推理和问题解决的能力[2]。
边缘通用智能的实现依赖于移动智能体人工智能的部署。大型语言模型为此类智能体提供认知引擎,在规划、推理和工具使用方面展现出卓越能力。然而,这些大型语言模型巨大的计算、内存和能量需求与移动和边缘设备的资源受限特性存在根本冲突[3]。这种“部署鸿沟”是实现边缘通用智能愿景的主要障碍。

为弥合这一鸿沟,知识蒸馏已成为压缩大型模型的关键方法。知识蒸馏指的是训练一个较小的“学生”模型来模仿较大、性能更强的“教师”模型的行为。这使得学生模型能够以紧凑的形式保留教师模型的先进能力,适用于部署在资源受限的边缘硬件上[4]。
1.2 与相关综述的比较及贡献
知识蒸馏推动智能体人工智能发展并使其能够部署于边缘通用智能的框架已展现出巨大潜力,从而降低了计算开销,并增强了在动态无线环境中的适应性。本文旨在对知识蒸馏的基础及其在智能体人工智能中的应用进行全面综述,并突出为边缘通用智能部署开辟新途径的使能技术。表1对相关综述进行了深入比较,重点关注知识蒸馏、智能体人工智能及其在边缘通用智能中的实现。这些综述主要侧重于总结知识蒸馏的演进和优化。例如,Gou等人[9]提供了知识蒸馏的基础性综述,详细介绍了其核心组件,如知识类型、训练方案和师生架构。
表1 相关综述总结
此外,已有多项综述研究了智能体人工智能的应用。Hosseini等人[1]回顾了智能体人工智能在组织中的变革性作用,强调了其核心属性以及从人类辅助的“副驾驶”模型向“自主自动驾驶”模型的战略转变。此外,Wu等人[8]综述了多模态移动智能体的研究现状,将其分为基于提示的方法和基于训练的方法,并比较了它们在移动设备上的部署效果。
再者,多项研究表明智能体人工智能在塑造边缘通用智能演进方面的重要性日益凸显。Xu等人[5]提供了关于边缘智能的综合综述。随着强大大型语言模型的发展,对边缘通用智能的探索近年来激增。Chen等人[2]通过将大型语言模型赋能的边缘通用智能分为集中式、混合式和分布式系统并回顾其实现,提供了基础性概述。He等人[6]提出,基础模型的整合是向边缘通用智能演进的关键,并概述了应对挑战的研究方向。聚焦于此类系统的认知核心,Zhao等人[7]全面分析了世界模型如何通过主动规划和推理能力赋能边缘智能体人工智能。
然而,现有研究缺乏对针对边缘通用智能限制的系统性知识蒸馏方法的充分探索,也未全面分析智能体人工智能在边缘环境中面临的资源限制和模型适配挑战。本文通过深入考察先进的模型适配技术(如无线蒸馏[10]-[13])和一些为边缘设计的架构[14]-[17],解决了这些空白。此外,我们展示了知识蒸馏如何有效适配各种边缘通用智能部署场景,如自动驾驶汽车[18]、[19]、无人机(UAV)[20]、[21]、机器人技术[22]、[23]以及其他物联网[24]-[26]。主要贡献总结如下:
1. 专门综述了无线通信场景中的知识蒸馏技术,强调知识蒸馏如何增强信道估计、反馈压缩和无线边缘的资源高效模型部署。
2. 系统回顾了现有知识蒸馏技术及其优势,强调了它们与新型架构的潜在整合。随后,全面讨论了在边缘通用智能中应用知识蒸馏与这些架构相结合的益处和机遇。
3. 分析了现有模型存在的局限性。基于这些不足,介绍了Transformer之外的架构,并研究了与知识蒸馏相结合的调优技术,以创造适合部署在边缘设备上的条件。
4. 进一步从技术和伦理维度分析了边缘通用智能当前面临的挑战,提出了潜在的未来发展趋势和解决方案。
1.3 论文结构
本综述的结构如图1所示。第2节介绍了边缘通用智能、移动智能体人工智能和知识蒸馏的基本概念,并进一步阐明了这三项技术之间的相互关系。随后,第3节系统阐述了将知识蒸馏整合到边缘通用智能中的新型架构和无线蒸馏,并展示了现有模型取得的最新进展。第4节描述了知识蒸馏在边缘通用智能中的作用及其在特定领域的应用。最后,第5节阐述了从综述中获得的经验教训以及该领域在技术和宏观层面面临的挑战,同时概述了潜在的未来研究方向。
2. 核心方法基础
智能体人工智能提供了自主的感知-规划-行动-记忆循环,而边缘通用智能通过在严格的资源限制下实现通用认知能力,将这一范式扩展到网络边缘。它们共同勾勒了智能、自适应和自主边缘系统的统一愿景。

2.1 智能体人工智能的兴起与边缘通用智能的愿景
2.1.1 移动智能体人工智能
智能体人工智能指的是能够感知、推理、规划和行动以实现目标,且只需最少人类监督的自主系统[8]。这些系统在一个连续的循环中运行,通常称为智能体循环,由四个核心组件组成:感知、规划、行动和记忆[8]。

• 感知:感知模块整合多模态信息,形成对环境的连贯理解。如图2所示,这一过程始于从物理传感流或数字信道获取数据。随后,这些原始数据被处理以提取关键特征,并识别相关实体及其属性。
• 规划:规划模块制定一系列行动以实现高层目标,通常利用大型语言模型作为认知核心。如图2所示,智能体规划从静态、预定义的行动序列转向动态规划,这些动态规划根据环境反馈不断更新,确保强大的适应性。
• 行动:智能体执行选定的行动,与环境交互并对其产生影响。行动范围从模仿人类与图形用户界面(GUI)的交互(如点击或打字[27],如图2所示),到利用API调用进行更深层次的系统整合(如修改设备设置或自动化应用导航)。在多智能体系统中,通信本身成为关键行动,使智能体能够协调和委派任务[27]。
• 记忆:记忆模块允许智能体随时间保留信息,为连贯交互提供必要上下文,并促进持续学习。如图2所示,这通常通过两个层次实现:短期记忆保留当前会话的上下文,通常在大型语言模型的上下文窗口内管理;长期记忆存储跨会话的知识,如学到的事实和过往经验,通常使用外部向量数据库实现。智能体可以通过相似性搜索查询该知识库,这是检索增强生成(RAG)的核心机制。
此外,协调和适应是使智能体人工智能能够在动态环境中管理复杂、长期任务的关键能力[28]、[29]。协调通过动态多智能体协作实现,自主智能体通过交互达成共同目标[29]。作为补充,适应是智能体从环境中学习并实时修改其行为以追求高层目标的能力[28]。这种能力从根本上依赖于集成的记忆系统和学习机制,如强化学习[30]和终身学习[31]。强大的协调协议与记忆驱动的适应之间的协同作用,是现代智能体人工智能的显著特征,为更具韧性和自主性的系统铺平了道路。
当部署在无线和边缘计算环境中时,智能体循环的每个组件都必须在有限的计算、存储和通信带宽约束下运行。这一挑战推动了通信协议设计的转变,从关注原始吞吐量转向“语义效率”,并优先传输简洁、高价值的信息,而非冗长的原始数据[32]。6G的新兴框架设想“内容感知”网络,能够智能地优先处理语义关键数据,模糊应用层和网络层之间的界限,并将网络从被动的传输管道转变为信息交换的主动参与者[32]。
2.1.2 边缘通用智能
边缘通用智能[2]代表了一种变革性范式,旨在赋予边缘设备通用认知能力,使其能够在动态环境中自主感知、推理和行动。边缘通用智能的终极愿景是在网络边缘实现人工通用智能(AGI),即系统能够达到甚至超越人类水平的高级认知能力,如理解、推理、规划和从经验中学习。
与传统边缘智能(主要部署静态、特定任务模型用于单个任务)不同,边缘通用智能强调多功能性、适应性和自主认知推理[5]。为实现这一目标,边缘通用智能利用基础模型,使设备能够执行多种不同任务而无需频繁重新训练,并实时动态适应不同的上下文和环境。
这种智能从根本上植根于知识——这一概念不仅包括事实信息,还包括从海量数据中学习到的复杂推理模式、上下文理解和决策能力,并嵌入到人工智能模型中。边缘通用智能架构根据知识的分布方式呈现出不同形态:
• 在集中式模型中,单个强大的、云端托管的大型语言模型拥有所有全面知识。它处理所有复杂的推理和规划,而边缘设备仅拥有最少的本地知识,充当简单的数据收集器和命令执行器。
• 相反,完全分布式方法旨在通过为每个边缘设备配备强大的中型语言模型或小型语言模型(SLM),使其拥有自己的大量知识库,从而实现设备端推理和对等协作[33]。
• 混合架构平衡了这两种极端情况,将具有专门或必要知识的本地小型语言模型用于常规和延迟敏感的操作,同时将需要更广泛或更深入知识的任务卸载到云端大型语言模型。
边缘通用智能的潜在应用广泛且具有变革性,有望重新定义众多领域的人机交互,包括自动驾驶汽车、工业自动化、智慧城市和个性化医疗。
2.2 知识蒸馏:核心技术与范式
知识蒸馏提供了一种有效的框架,将知识从大型模型转移到紧凑模型中,从而能够在资源受限的设备上高效部署。基于现代技术的知识蒸馏方法捕捉了日益丰富的教师知识形式,构成了高性能边缘和智能体人工智能系统的基础。
2.2.1 基本概念和工作原理
Hinton等人[4]首次提出了师生架构,构成了知识蒸馏的基础范式。该架构通常包含两个组件:(i)高容量教师模型,通常实现为最先进的神经网络或模型集成,能够生成丰富的知识表示;(ii)紧凑的学生模型,经过优化以实现高效部署。通过专门的蒸馏过程,学生模型通过逼近教师的知识输出,学习复制教师的功能映射。
该框架的核心是知识转移机制[4]。教师模型不仅提供单一正确答案,还提供所有可能类别的完整概率分布。这些细微的概率(通常称为“软目标”或“暗知识”[34])编码了关于教师如何泛化以及如何感知类别之间相似性的丰富信息,比标准训练中使用的“硬”独热标签提供了更丰富的监督。为了生成这些有效的软目标,温度缩放参数𝑇[35]被应用于教师的输出层,因此分配给类别i的概率为:
其中,表示分配给类别i的概率,表示其对应的对数输出,T表示温度。
学生模型的总体训练目标包括两个组件:(i)软目标损失函数:学生模型在其softmax层中采用与教师相同的高温T,计算其输出分布与教师提供的软目标之间的交叉熵损失;(ii)硬目标损失函数:同时,学生模型还被训练以预测原始训练数据中的真实标签(即硬目标)。对于这一组件,softmax温度设置为1,以反映标准分类行为。组合损失可表示为:
其中,
且
这里,和分别表示学生模型和教师模型的对数输出,y是独热编码的真实标签。令和表示软化的概率分布,其中表示softmax函数,T是温度参数。
蒸馏目标L定义为KL散度,用于衡量教师和学生分布之间的差异:
或者,当采用均方误差(MSE)时,损失公式为:
最后,是一个超参数,用于平衡真实标签交叉熵损失和蒸馏损失项L的权重。
2.2.2 现代知识蒸馏技术分类
基于知识来源的知识蒸馏方法可大致分为三类:响应式蒸馏、特征式蒸馏和关系式蒸馏。

2.2.2.1 响应式蒸馏
响应式知识蒸馏通过使用教师的最终输出来监督学生模型,实现知识转移。最早的知识蒸馏师生形式本质上是响应式的[4]。
在知识蒸馏框架的基础上,已开发出多种变体来解决其不同局限性,形成了渐进式的研究路线。这些研究共同展示了从弥合模型容量差距、替换或移除教师,到设计更稳健和自适应损失函数的一系列策略。Mirzadeh等人[38]通过引入辅助模型扩展了师生范式,以减轻大型教师和小型学生之间的容量差距。此外,他们的框架优于其他强基线(包括FitNets、注意力转移(AT)和 mutual learning)。这在资源受限的情况下实现了更有效的转移,尽管代价是额外的训练阶段。基于移除外部教师的想法,Pham等人[39]提出了自蒸馏,即模型从自身的中间预测中蒸馏知识。这种设计对于设备端持续学习具有吸引力,但其有效性取决于预测质量。实证结果表明,自蒸馏始终优于教师基线,在类似设置下,学生模型在CIFAR-10/100上的准确率提高了高达1-2.5个百分点。综上所述,这些研究勾勒出了一条清晰的发展轨迹,从弥合师生差距,到完全消除对教师的需求,再到增强在噪声条件下的稳健性。总体见解表明,未来的研究可能会整合这些维度,寻求资源高效、自适应且稳健的混合方法,同时解决可扩展性和参数敏感性问题。从智能体人工智能和移动部署的角度来看,这些方向凸显了知识蒸馏在边缘的潜力。
表2 三种知识蒸馏范式的比较分析
2.2.2.2 特征式蒸馏
特征式知识蒸馏利用教师网络的中间特征表示来指导学生训练[40]。基本范式通常包括两个阶段[36]、[40]-[42]:
第一阶段是中间特征对齐。在这一阶段,选择教师的一个层作为提示层,并选择学生的对应层作为引导层。引入回归器将学生引导层的特征投影到教师提示层的表示空间中。该阶段的损失定义为:
其中,是损失函数,L是自定义度量,是教师提示层的输出,是学生引导层的输出,r是回归器函数。
第二阶段是知识蒸馏阶段。在这一阶段,对齐后的学生模型进一步使用真实标签和教师的软标签进行训练,而第一阶段学到的参数保持固定。
多项扩展通过深化师生交互进一步丰富了知识蒸馏范式。Gou等人[43]提出了互惠师生学习,其中知识转移是双向的。学生不仅向教师学习,还为自适应教学提供反馈。这种设计提高了适应性,但需要仔细协调相互更新。Chen等人[44]通过知识回顾提升了监督质量,利用较浅的或多个教师层提供更多样化的指导信号,从而减轻对单一教师表示过拟合的风险。作为这些监督策略的补充,Guo等人[45]开发了基于注意力的蒸馏,鼓励学生模仿特征激活和教师注意力图,从而捕捉原始输出之外的结构依赖关系。这些研究的进展凸显了一个日益明显的趋势:从输出级模仿转向利用更深层次的表示结构,以实现更有效的知识转移。
2.2.2.3 关系式蒸馏
关系式蒸馏转移捕捉样本之间结构关系的成对相似性信息[46]。其核心设计依赖于关系势函数,通常使用基于距离的势函数或基于角度的度量[47]、[48]。
多项变体通过关注结构信息和特征关系进一步完善了知识蒸馏范式。Tian等人[49]引入了对比学习框架,通过正负样本对对齐学生和教师的嵌入。这将蒸馏转向建模结构关系,而不仅仅是模仿输出。基于保留结构的想法,Liu等人[50]开发了通道间相关性蒸馏,强制通道间相关性一致性。这平衡了特征多样性和稳定性,但在高维通道中可能引入计算开销。将结构保留扩展到关系领域,Xin等人[51]提出了邻域关系知识蒸馏(NRKD),蒸馏局部邻域关系而非依赖全局相似性,从而提高了对噪声或不平衡数据的稳健性。这一进展反映了知识蒸馏研究的广泛转变——从简单的输出匹配转向在多个粒度级别上对表示结构进行更细致的建模。
2.3 知识蒸馏:连接移动智能体人工智能与边缘通用智能的桥梁
智能体人工智能是边缘通用智能的核心,使边缘设备能够成为主动的、目标驱动的系统,而非被动的执行器。然而,智能体能力本质上是过程性的(“如何思考”),而非仅仅是静态知识(“说什么”),这与传统的模型压缩方法(侧重于重现输出概率)不匹配。此类技术模仿最终预测,但无法捕捉智能体行为所需的底层推理过程。

知识蒸馏成为调和大规模人工智能的计算需求与边缘设备有限资源的关键技术。如图3所示,它通过使边缘平台能够实现先进智能,充当了连接移动智能体人工智能和边缘通用智能的概念桥梁。通过将数十亿参数的大型“教师”模型蒸馏为紧凑的“学生”模型,知识蒸馏大幅减小了模型尺寸、内存使用和计算成本。这种压缩还提高了运营效率:轻量级模型提供更低的推理延迟(这对于自动驾驶导航和工业机器人等实时边缘通用智能任务至关重要),并显著降低了能量消耗,延长了边缘设备的电池寿命。此外,设备端推理通过将敏感数据保留在本地并减少对不稳定网络连接的依赖,增强了隐私性和可靠性。
在智能体人工智能的背景下,至关重要的是超越将知识蒸馏视为单纯压缩的传统观点,并将其重新定义为能力转移的框架。最终目标不仅仅是减小模型尺寸,而是全面转移智能体行为所需的复杂认知技能[1]。这一过程中出现了关键挑战,包括在资源受限的移动环境中保持泛化能力[52]、在噪声或动态数据下保持稳健性,以及降低对超参数的敏感性。新兴解决方案包括在无线场景中利用知识蒸馏[11]实现高效的空中学习、设计专为边缘部署量身定制的轻量级自适应框架,以及开发与知识蒸馏良好对齐的调优技术。这些经验教训凸显了知识蒸馏从压缩向能力转移的演变角色,为在移动平台上实现资源高效且具有韧性的智能体智能铺平了道路[53]。
3. 为移动部署蒸馏智能体能力
知识蒸馏与边缘通用智能建立了分层关系。在能力层面[54],知识蒸馏为边缘通用智能配备了稳健运行和完成任务所需的基本能力,如感知、规划、行动和记忆。在方法层面[55],一系列与知识蒸馏对齐的框架和技术提高了计算效率并降低了资源消耗[56],同时培养了更符合边缘通用智能中各种下游任务的泛化表示。在工具包层面,知识蒸馏本身提供了可靠的紧凑模型,直接支持边缘通用智能的部署[57]。本节将详细阐述如何在这三个层面利用知识蒸馏实现边缘通用智能部署。
3.1 面向智能体人工智能能力的专用蒸馏框架
为解决这些限制,最近的研究集中于开发专为智能体系统设计的专用蒸馏框架。这些先进方法的一个核心原则是,从模仿原始输出转向转移更抽象、结构化和可重用的知识组件。
3.1.1 “感知”能力
知识蒸馏对于建立智能体人工智能的感知能力至关重要。智能体对无线环境的感知依赖于精确的信道状态信息估计、准确的信号分类等。为克服大型模型直接部署的困难,知识蒸馏使资源受限的边缘设备能够实现高效、准确且稳健的环境感知[68]、[69]。
• 信道估计:融合先前通信系统知识的知识驱动深度学习模型(如Yang等人[70]开发的网络)正越来越多地用于复杂的信道估计。为应对实际部署挑战,知识蒸馏已成为关键使能技术。Catak等人[58]采用防御性蒸馏框架来提高模型对恶意信号扰动的韧性,平滑决策表面并大幅降低攻击成功率。该方法通过将攻击成功率(ASR)从约0.9降至0.06,显著增强了安全性。Kong等人[59]利用知识蒸馏解决了一个基本训练问题——用于信道量化的不可微二值化层提供不准确的梯度并阻碍学习。引入辅助“教师”网络绕过该层并提供“无损梯度”,引导主“学生”网络找到更好的解决方案。这项技术为核心优化挑战提供了新颖的解决方案,在30 dB信噪比(SNR)下实现了约9.0的总和速率,而无知识蒸馏时为8.2。
• 信道状态信息反馈:为了在资源受限的设备上部署复杂的信道状态信息(CSI)反馈模型,Tang等人[60]利用知识蒸馏创建了无需复杂手动重新设计的轻量级模型。该方法将学生模型的性能在归一化均方误差(NMSE)方面提高了高达7.6 dB,同时将编码器的计算复杂度降低到教师模型的25.50%-43.46%。然而,其局限性在于学生模型的性能无法超越教师模型。Cui等人[11]通过提出“编码器知识蒸馏”框架进一步推进了这一领域,以降低全自编码器蒸馏的高训练开销——轻量级学生编码器通过知识蒸馏训练后,再与强大的教师解码器结合。这将总训练时间减少了66.8%,并进一步提高了反馈性能,使NMSE从-9.54 dB降至-9.75 dB。除了效率之外,Gong等人[61]利用知识蒸馏增强了MIMO语义通信中对不完美信道状态信息的稳健性,以解决估计信道状态信息与真实信道状态信息之间的模糊关系阻碍模型收敛的问题。具有完美信道状态信息的教师模型指导在不完美信道状态信息上训练的学生模型,帮助其学习稳健的表示。仅这一知识蒸馏阶段就比包括DeepJSCC[71]、DeepJSCC-V[72]、DeepJSCC-MIMO[73]和SwinJSCC[74]在内的基准(这些基准均使用准确的信道状态信息预训练,然后使用估计的信道矩阵微调)整体提升了0.40-0.54 dB的峰值信噪比(PSNR)。
• 调制分类:为了在边缘设备上部署复杂的自动调制分类(AMC)模型,Yang等人[62]利用知识蒸馏在不增加计算复杂度的情况下提高了计算简单的学生模型的分类准确率。该方法将学生模型的最大准确率提高了2.4%,同时学生模型的浮点运算量保持在教师模型的一半以下。为进一步提高可靠性,Xu等人[63]提出了一种对抗稳健蒸馏策略,将大型、经过对抗训练的教师模型的韧性转移到紧凑的学生模型中。这是必要的,因为轻量级模型更容易受到攻击。他们提出的知识蒸馏方法使学生模型在30 dB信噪比下的投影梯度下降(PGD)攻击下实现了77.86%的准确率,比AT高4.6%,比其他稳健蒸馏技术高约30%。
这一系列研究是智能体人工智能工作流程中感知阶段的核心。通过知识蒸馏,可以在边缘设备上部署紧凑的学生模型,实现对无线环境的实时、可靠感知。准确的信道状态理解构成了智能体高层认知功能的基础,支持在动态环境中的自主和安全运行。
3.1.2 “规划”能力
通过知识蒸馏,可以将大型教师模型复杂且计算密集的规划过程(包括过程推理和高层策略)压缩为适合实际部署的紧凑、高效学生模型。
Kuzlu等人[64]应用防御性蒸馏框架将教师模型的稳健性转移到紧凑的学生模型中,提高了波束预测模型对对抗性攻击的韧性。Park等人[65]、[75]引入了跨模态关系知识蒸馏,将来自使用激光雷达、雷达、GPS和RGB相机的复杂多模态教师模型的知识转移到轻量级纯雷达学生模型中,实现了资源高效的波束预测,而无需依赖昂贵的传感器数据。此外,Yang等人[76]通过将迭代算法的领域知识展开到图神经网络(GNN)中,开发了一种知识驱动的方法,创建了用于高效资源分配的可扩展且可解释的模型。再者,Gong等人[77]采用蒸馏方法将计算昂贵的深度强化学习(DRL)智能体学到的策略转移到梯度提升决策树模型中,实现了更快、更具成本效益的资源优化。
强大而高效的规划能力是智能体的认知引擎,将其目标和感知状态转化为结构化、可执行的行动方案。这是使智能体能够具有前瞻性和目的性运行的基础层,促进在动态和复杂环境中复杂、目标导向的行为。
3.1.2.1 策略蒸馏
策略蒸馏的核心原则是行为模仿。转移的“知识”是教师的决策策略,通常表示为给定状态下所有可能行动的概率分布[78]。
为了动态管理网络切片中的资源,Li等人[79]利用深度强化学习创建了无需流量模型即可适应波动用户需求的策略。这种方法可以学习复杂环境中的有效策略,但受限于高昂的训练成本。为了在分布式环境中高效实施这些策略,策略蒸馏已成为优化无线网络决策模型的关键技术,实现高效、协作的资源管理。Zhou等人[80]开发了一种联邦双向蒸馏机制,以减少联邦强化学习中固有的高通信开销。通过向中央服务器蒸馏知识和从中央服务器接收蒸馏知识,该方法在非独立同分布(non-IID)场景中将所需的通信轮次减少了近50%。超越简单压缩,Mensah等人[81]引入了一种联邦互策略蒸馏方案,用于异构智能体之间的协作资源交易。这对于克服多智能体系统中由冲突目标和非独立同分布数据引起的学习不稳定性和不收敛是必要的。通过允许智能体从彼此的策略中学习,该方法比基准深度强化学习技术将总系统效用提高了12.5%。
尽管策略蒸馏有效,但它存在固有局限性。作为典型的“黑盒”方法,它转移最终决策,但底层推理和因果逻辑丢失[82]。此外,如果环境发生变化,蒸馏策略与价值函数之间的不匹配可能导致错误判断、训练分歧和灾难性遗忘[83]。
3.1.2.2 可解释策略教学
可解释策略教学的核心思想是以明确、可解释的自然语言策略形式提取和转移教师智能体中嵌入的知识[84]。
为了增强无线通信中人工智能的可解释性,Zaidi等人[85]通过开发领域知识引导的神经网络开创了一种内在方法,其架构直接反映无线电传播的物理特性,使其决策具有内在的透明度和稳健性。相比之下,Chen等人[86]对复杂的深度强化学习智能体采用了事后策略,提出了一个框架来分析智能体的行为,以推断可理解的决策启发式,从而建立信任并为工程师提供可行的见解。
这种范式具有多项优势。自然语言策略提高了可解释性,并支持专家审计[87]。它还与黑盒模型兼容,只需API访问而非内部参数[87]。通过将通用模型与可编辑策略库分离,它产生了模块化混合智能框架,支持终身学习并增强智能体人工智能系统的安全性和可信度。
3.1.2.3 思维链(CoT)蒸馏
思维链提示[88]是生成智能体轨迹推理组件的关键技术。思维链引导大型语言模型通过在得出最终答案之前生成中间推理步骤,来模拟人类的认知过程[89]。该技术通过在提示中为少量示例添加明确的推理链,将示例格式化为(输入、思维链、输出),而非简单的(输入、输出)对。Wang等人[90]提出了一个框架,其中启用思维链的大型语言模型将高层用户意图转换为可执行的无线网络控制策略。他们利用思维链克服了标准大型语言模型在无线应用中的关键局限性,如多步骤推理能力差、缺乏可解释性以及倾向于生成不正确或“幻觉”输出。这带来了显著的可衡量收益,例如在无人机(UAV)案例研究中,与非思维链基准相比,网络总和速率提高了27.2%。
基于思维链的知识蒸馏是一种方法论,旨在将大型“教师”语言模型复杂的多步骤推理能力转移到更小、更高效的“学生”模型中,使模型能够将复杂问题分解为可管理的子问题,以便依次解决[91]。
基于以上分析,可以为图4中的不同应用场景提供以下战略建议:
图4 策略蒸馏、可解释策略教学和基于思维链的知识蒸馏的战略建议。策略蒸馏适用于任务明确的稳定环境[78];可解释策略教学适用于需要人机交互的高风险领域[92];基于思维链的知识蒸馏适用于需要压缩通用智能体的场景[91]
3.1.3 “行动”能力
在边缘通用智能的背景下,行动指的是系统将感知和推理转化为在其环境中具体操作的能力。它包括数字和物理交互,从执行数据库查询或调用本地工具,到与外部设备或机器人执行器协调。知识蒸馏超越了其作为单纯模型压缩技术的起源,演变为赋予边缘通用智能一系列关键、面向行动能力的基本机制。具体而言,知识蒸馏通过引导轻量级模型走向稳健和自适应的策略,增强了性能优化的决策制定[93]——例如,使移动智能体能够在无线通信中执行低延迟波束选择。它通过伪标签和合成数据生成,丰富了数据稀缺情况下的行动可靠性[64] [11]——例如,在用户轨迹数据有限时稳定切换决策。它支持跨领域和多任务泛化,确保行动在异构环境(如无人机辅助网络[94]和智能反射面(RIS)启用环境[95]、[96])中保持可转移性和协调性。最后,它促进了分布式智能体之间的隐私保护和高效协调——例如,用于协作频谱感知或干扰管理的联邦知识蒸馏框架。这些维度共同说明了知识蒸馏如何作为统一工具包,增强边缘通用智能中行动的有效性、泛化性和可信度。
3.1.3.1 性能优化的决策制定
传统上,边缘的决策制定受到有限计算和严格延迟要求的限制,通常迫使智能体在准确性和效率之间进行权衡。与这一限制相反,知识蒸馏的最新发展表明,轻量级学生模型甚至可以超越其教师模型,如重生网络(Born-Again Networks)[97]和自蒸馏框架[39]所证明的那样。从机制上讲,知识蒸馏将优化轨迹正则化到更平坦的最小值[98]、[99],这增强了在动态和不确定环境中的稳健性。此外,偏差校正蒸馏[100]、[101]等扩展减轻了有缺陷的教师指导,使边缘智能体不仅能够复制,还能改进决策策略。对于边缘通用智能而言,这将行动从资源受限的执行转变为实时环境中的自适应和韧性控制。
3.1.3.2 通过数据增强丰富行动
边缘通用智能智能体经常在数据稀缺或噪声条件下工作,此时难以获得直接监督或高质量数据。知识蒸馏通过利用软目标、伪标签和合成数据生成来丰富训练信号,从而解决了这一限制,使行动策略即使在不确定场景中也能保持可靠。在数据稀缺的情况下,Li等人[102]和Wu等人[103]证明,知识蒸馏是数据价值的强大放大器,主要通过伪标签实现。教师的软输出提供了比独热标签更丰富、更正则化的信号,使知识蒸馏在半监督和无监督学习中特别有效[104]。除了通用视觉或语言任务外,此类机制在无线应用中也很有前景。例如,伪标签可以在有限标记样本下支持自动调制分类,利用合成训练数据增强信道状态信息反馈,或在低信噪比环境中提高频谱感知可靠性[105]。从机制上讲,置信度阈值和显式去噪框架[102]、[106]等技术增强了对噪声监督的稳健性。除了伪标签外,生成对抗网络(GANs)等生成模型(一类通过生成器和判别器对抗训练以生成逼真合成样本的模型)已被用于合成新数据,随后由教师标记以训练学生模型,这与以数据为中心的人工智能范式一致——该范式强调提高数据质量而非改变模型架构[107]。对于边缘通用智能而言,这些进展转化为即使在严重数据稀缺的情况下也能保持信心和适应性的行动策略,增强了智能体在不可预测边缘环境中有效行动的能力。
3.1.3.3 跨领域和多任务行动
在现实世界的边缘通用智能系统中,行动通常跨越通信、传感和控制等异构领域,需要能够跨任务和模态泛化的策略。知识蒸馏已成为实现此类跨领域和多任务行动整合的强大使能技术。一个核心挑战在于特征空间的异构性,知识蒸馏通过特征空间对齐技术[108]、[109](通常由对比学习策略[110]增强)来缓解这一挑战。在多任务学习(MTL)中,知识蒸馏通过促进任务间的知识共享,解决了负迁移和异步收敛问题[111]。例如,Li等人[112]提出利用多个特定任务的专家教师来指导统一的多任务学生,从而平衡专业化和泛化。更广泛地说,蒸馏知识可以作为共享的中间表示,允许将不同模型模块化组合成更大的人工智能系统。在无线网络中,这些进展使模型能够跨异构任务转移知识,如调制分类[113]、信道估计[59]和干扰管理,从而在动态通信环境中提高适应性和可扩展性。
3.1.3.4 隐私保护和高效行动协调
边缘通用智能依赖于跨异构设备和网络协作的分布式智能体,其中隐私保护和通信效率至关重要。知识蒸馏通过允许交换蒸馏输出(如对数输出)而非原始参数或敏感数据,提供了有效的解决方案,从而降低了隐私风险和通信开销。Li等人[114]证明,在公共代理数据集上共享输出增强了隐私[115],同时提高了通信效率[116],这比标准联邦平均(FedAvg)[117]有显著改进。然而,对公共数据集的依赖引入了新的挑战,如数据集选择和潜在泄露。为解决这一问题,Lu等人[118]和Zhu等人[119]采用生成模型合成代理数据,避免依赖外部数据集。进一步的进展包括去中心化对等(P2P)和协同蒸馏框架[120]-[122],其中客户端直接与邻居交换知识[123],通常使用本地数据作为临时代理进行对等评估和加权更新[124]。对于边缘通用智能而言,这些方法实现了隐私保护和资源高效的行动协调,使边缘智能体能够在分布式环境中安全、有效地协作。
3.1.4 “记忆”能力
在边缘通用智能的背景下,可以从三个互补维度理解记忆。模型记忆涉及在资源受限的边缘设备上存储压缩或蒸馏模型的能力,反映了知识为长期使用而被表示和保留的效率。操作记忆指的是推理和训练过程中的动态内存分配,直接影响智能体在有限硬件资源下执行实时任务的能力。最后,知识记忆捕捉系统保留和回忆过往知识的能力——例如,保留无线网络中信道质量变化[125]、用户移动模式[126]或干扰条件[127]的信息——这些信息可以在持续学习场景[128]中或通过在联邦设置中共享蒸馏的全局表示来利用。
最近的研究探索了知识蒸馏如何通过存储减少、运行时优化和知识保留,有效提高边缘的记忆效率。Chen等人[129]引入了一种计算卸载框架,将深度模仿学习与知识蒸馏相结合,以减少异构边缘-云环境中的任务延迟。通过将离线学习的最优策略蒸馏到轻量级学生模型中,他们的方法使移动设备能够进行实时决策,并为启发式卸载方法提供了原则性替代方案。Li等人[130]解决了灾难性遗忘问题——深度神经网络在连续训练一系列任务时,往往会忘记先前任务学到的知识。与需要大量存储且存在隐私泄露风险的重放方法不同,他们的无数据蒸馏将过往知识嵌入到基于梯度的正则化中,使模型能够在不保留原始数据的情况下回忆先前任务。这一转变凸显了知识蒸馏在加强边缘终身学习功能记忆方面的作用。从知识保留扩展到分布式个性化,Pan等人[131]引入了FedCache 2.0,其中数据集蒸馏取代了参数交换。客户端向中央缓存贡献紧凑的合成数据集,减少了通信和存储负担,同时支持自适应个性化,尽管对客户端异构性的敏感性仍然是一个挑战。
这些研究共同勾勒出了一条分层发展轨迹:从优化运行时记忆,到保护知识记忆,再到重新定义存储和通信记忆,最后到增强功能记忆和稳健性。因此,知识蒸馏成为在各种边缘智能场景中加强记忆的多功能范式,为更广泛的边缘通用智能愿景架起了自然的桥梁。
3.2 超越Transformer:原生为边缘设计的架构
Transformer架构固有的二次复杂度仍然是边缘部署的根本瓶颈。这催生了专为计算效率设计的新型架构。然而,这些新兴模型(如Mamba[141]和RWKV[16])通常缺乏其Transformer基前代模型所依赖的海量数据集上的广泛预训练。知识蒸馏(特别是跨架构蒸馏)成为弥合这一差距的关键且资本高效的策略。通过将来自大型预训练Transformer“教师”的丰富、泛化知识转移到更高效的“学生”模型(如Mamba或RWKV),可以在不承担从头训练的高昂成本的情况下,为这些轻量级架构赋予先进能力。这种高效新型架构与复杂蒸馏技术之间的共生关系,正在为下一代可部署、高性能的边缘通用智能模型铺平道路。
3.2.1 Mamba:线性时间序列架构
Mamba架构可被视为结构化状态空间模型(S4)[141]-[143]的重大演进,继承了其数学公式,同时引入了新颖机制来增强灵活性和效率。Mamba还集成了具有并行扫描和内核融合的高效算法,通过将Transformer的独立注意力层和MLP层统一为同构的Mamba块,简化了其架构[141]。Mamba保持了潜在状态公式,其中隐藏状态根据输入和参数化动态随时间演变。
最近的研究已确立Mamba架构作为无线系统的高效、多功能工具。对于网络优化,Mehrabian和Wong[133]提出了用于蜂窝流量预测的A-Gamba模型,与强基线相比,训练时间加快了7倍,乘加运算(MACs)减少了681倍。在核心通信功能方面,Zhang等人[132]证明Mamba可以增强语义解码,同时支持可扩展的资源分配(如能量高效波束成形),且推理时间随用户数量增长几乎保持恒定。此外,在无线人体传感领域,Liu等人[144]开发了TFMamba,将MACs减少了高达98.9%,同时实现了高准确率。同样,Huang等人[134]创建了SenseMamba,仅用0.021M参数就实现了最先进的准确率。将其扩展到多模态感知,Yang等人[145]表明,基于Mamba的框架在传感器数据缺失时,通过微调不到0.3%的参数,可以提高性能。这些特性共同凸显了Mamba作为下一代无线网络中去中心化、边缘原生智能的关键使能技术的潜力,甚至可能成为移动智能体人工智能的发展方向。
3.2.2 RWKV:RNN-Transformer混合架构
RWKV[16]的核心目的是整合Transformer的高性能和循环神经网络(RNNs)的计算效率。其核心创新在于线性复杂度注意力机制:隐藏状态仅依赖于和当前输入,支持具有恒定内存和线性时间复杂度的逐步计算。
RWKV由四个基本组件组成:(i)R(感受野):一种门控机制,调节过往信息对当前状态的影响程度;(ii)W(权重):特定于通道的、可学习的时间衰减向量;(iii)K(键):类似于注意力键,通过当前和过往令牌的线性插值计算;(iv)V(值):类似于注意力值,也通过当前和过往令牌的线性插值推导。这些组件共同定义了WKV算子,该算子统一了Transformer风格的并行训练和RNN风格的高效推理。
最近的研究利用RWKV架构创建了高效解决方案。例如,Fu等人[136]开发了一种基于RWKV的车联网(V2X)通信信道估计器,与基于LSTM的方法相比,计算复杂度降低了24.9%。在网络安全领域,Xie等人[135]提出了一种基于RWKV的方案,用于检测无线传感器网络中的选择性转发攻击,在恶劣的移动环境中实现了仅0.09%的平均误检率。至关重要的是,Choe等人[146]的研究增强了该架构对无线边缘的适用性,他们引入了一套压缩技术,将RWKV模型的内存占用减少了3.4倍至5倍,且准确率仅略有下降,使其适用于资源受限的设备。
3.2.3 跨架构蒸馏
Mamba和RWKV等新架构有望提供卓越的效率,但缺乏使Transformer如此强大的万亿级令牌预训练数据和大规模计算投入[147]。跨架构蒸馏通过提供资本高效的途径[148],打破了这一循环。
与同架构蒸馏不同,异构架构表现出显著的特征差异[149]。当将非因果模型(如Transformer)蒸馏到因果模型(如Mamba)时,这种不匹配尤为严重。因此,简单的基于特征的蒸馏方法通常会失败,需要更复杂的对齐技术[150]。为克服这些挑战,Yao等人[151]构建了一个混合模型,包含86%的Mamba块和14%的自注意力块,利用Mamba块的计算效率,同时策略性地整合自注意力块来处理全局交互。跨架构蒸馏的另一个方向涉及使用专门设计的“投影器”来对齐特征空间。Liu等人[152]和Hao等人[150]引入了利用这些投影器将学生特征映射到教师特征或注意力空间的方法。
如前所述,通过跨架构蒸馏实现的高效率和更少的模型参数使其成为边缘部署的极具优势的技术。为了在边缘设备上部署准确的视网膜疾病分类器,Yilmaz和Aiyengar[153]使用跨架构蒸馏框架将诊断知识从大型Vision Transformer教师模型转移到轻量级CNN学生模型。他们的框架具有专门的投影器,大幅提高了学生模型的性能,模型参数减少了97.4%(从85.8M减少到2.2M),最终形成了一个紧凑的8.79 MB模型,在边缘设备上保留了教师模型93%的诊断准确率。这种方法的主要优势是成功为资源受限环境创建了高效、高准确率的模型。然而,其局限性包括由于计算限制,训练数据集相对较小且训练轮次有限[153]。
表3 序列建模架构的综合比较分析:
注:L:序列长度;D(d):模型维度;B:批量大小;N:状态维度
3.3 利用知识蒸馏获取紧凑且可部署的边缘模型
3.3.1 作为基础的语言模型:从BERT到TinyBERT
语言模型(LMs)是现代智能体核心功能的核心,将智能化为与环境交互、利用工具和实现目标的能力。然而,依赖托管在集中式云基础设施上的大型语言模型(LLM)API端点的主流架构,由于计算成本、内存占用和能量消耗,与边缘的资源受限特性存在根本冲突。
因此,一种新的愿景正在浮现:通用智能并非作为单一的云端实体实现,而是作为众多由小型语言模型(SLMs)驱动的专业智能体在本地环境中自主运行的聚合能力。知识蒸馏释放了小型语言模型在边缘智能中的真正潜力。在本节中,我们以BERT为例来说明这一点。
双向编码器表示转换器(BERT)等大规模模型的部署挑战与其巨大规模相关的卓越性能密切相关,而知识蒸馏系统地解决了这些挑战。
Sanh等人[154]创建了BERT的小型化通用版本,这是成功应用知识蒸馏的开创性示例。其核心贡献在于证明可以在计算密集的预训练阶段进行蒸馏。DistilBERT的压缩效果非常显著,成功在模型效率和性能之间取得了出色的平衡。与BERT-Base相比,DistilBERT将参数数量减少了40%,推理速度提高了60%。此外,DistilBERT保留了BERT-Base 97%的语言理解能力。在包含9个不同任务的GLUE基准测试中,其平均得分非常接近BERT-Base。
如果说DistilBERT代表了知识蒸馏在BERT上的开创性应用,那么Jiao等人[155]则体现了更深入、更精细的蒸馏策略。TinyBERT开创了一种“Transformer蒸馏”方法,深入探究Transformer的内部机制,旨在对教师模型每一层的中间表示进行细粒度模仿。
TinyBERT通过其先进的两阶段、多级蒸馏框架,在模型压缩方面取得了惊人的成果。以4层的TinyBERT4为例,其参数数量仅为1450万。与BERT-Base相比,其模型尺寸减少了7.5倍,推理速度提高了9.4倍。在实现如此极致压缩的同时,TinyBERT4在GLUE基准测试中保留了BERT-Base 96.8%的性能,性能损失极小。更令人印象深刻的是,6层的TinyBERT6在GLUE上的表现几乎与完整的BERT-Base教师模型相当。TinyBERT的出现为在资源极其有限的边缘设备上部署用于处理和理解人类语言的高性能自然语言处理模型提供了强大而可靠的选择。

3.3.2 面向无线任务的蒸馏模型
在无线通信场景中,紧凑蒸馏模型的开发尚未达到自然语言处理领域的标准化水平——在自然语言处理领域,DistilBERT和TinyBERT等模型已成为公认的基准。尽管如此,在一些特定无线任务中(如信道状态信息反馈和重建),存在多种高效且针对任务的知识蒸馏框架,专门设计用于解决无线系统的独特特性。
• CRNet-SE [11]近年来,已提出多种基于知识蒸馏的模型,以增强无线通信系统中的信道状态信息反馈和边缘推理效率。其中,CRNet-SE专注于大规模MIMO系统中的信道状态信息反馈问题。其主要目标是在计算资源有限的用户设备(UE)上压缩高维信道状态信息。教师模型CRNet采用多分辨率编码器提取丰富的信道特征,而学生模型将编码器简化为仅一个卷积层和一个全连接层,以实现轻量级部署。尽管进行了这种简化,但通过知识蒸馏训练的学生模型实现了比非蒸馏对应模型显著更低的归一化均方误差,这说明了知识蒸馏在严重模型压缩下保持重建准确率的有效性。
• CSI-ALM-Light [12]虽然CRNet-SE强调压缩以提高反馈效率,但CSI-ALM-Light将知识蒸馏范式扩展到高移动性通信场景中的时间预测。与重建当前信道状态信息不同,CSI-ALM-Light利用历史上行链路信息预测未来下行链路信道状态信息。其教师模型CSI-ALM基于预训练的GPT-2骨干网络,并集成了模态对齐机制,以将数值信道状态信息特征与语言嵌入对齐。蒸馏后的学生模型用轻量级Transformer和可学习的软提示替换了这些复杂组件,同时采用基于自注意力关系的蒸馏策略,对齐多级注意力关系(查询-键、查询-查询、键-键和值-值)。值得注意的是,CSI-ALM-Light仅使用10%的数据和不到1/200的参数,就实现了接近教师模型的性能,这凸显了知识蒸馏在弥合截然不同模型规模之间性能差距的潜力。
• 基于知识蒸馏的人工智能物联网(AIoT)框架 [13]与这些面向通信的设计互补,基于知识蒸馏的人工智能物联网框架将知识蒸馏应用于基于Wi-Fi信道状态信息的智能边缘设备手势识别。与专注于信道状态信息重建或预测的CRNet-SE和CSI-ALM-Light不同,该框架利用知识蒸馏在严格的内存和计算限制下实现高效的人类活动识别(如挥手、行走、跌倒)。学生网络仅包含28K参数,集成了多个并行卷积分支和瓶颈融合层,并通过联合响应+特征蒸馏方案,在SignFi数据集上实现了高达99.5%的准确率——优于仅响应蒸馏和硬标签训练。
总体而言,这些研究共同表明,知识蒸馏在各种无线和人工智能物联网任务中是一种多功能机制——从信道压缩(CRNet-SE),到时间预测(CSI-ALM-Light),再到边缘活动识别(基于知识蒸馏的人工智能物联网)——每一项都突出了在硬件限制下高效模型设计的不同但互补的方面。
3.4 经验总结
从这一分析中得出的一个经验教训是,知识蒸馏并非统一的方法,而是一系列自适应策略的集合,其有效性因目标智能体能力而异。在自然语言处理中,知识蒸馏主要保留架构保真度和语义表示,而在无线通信任务中,有限数据和噪声、资源受限的边缘环境等领域限制将重点转向了面向任务的适配——如模型和基于知识蒸馏的人工智能物联网框架[13]所证明的那样。然而,现有的无线知识蒸馏方法大多仍是特定任务的原型,缺乏与自然语言处理领域相当的通用蒸馏协议[93]。此外,知识蒸馏效率在很大程度上取决于教师的领域适应性和中间表示的质量[156]、[157],这对于非文本模态更难定义。未来的方向包括为边缘无线智能建立标准化的知识蒸馏基准、开发可跨异构输入转移的模态无关蒸馏机制[158],以及支持多个边缘节点之间的协作知识蒸馏以接近云端级智能[159]。
4. 应用
本节探讨了针对特定领域(如无人机(UAVs)、自动驾驶汽车(AV)、机器人技术和其他物联网设备)的专用架构和技术。

4.1 无人机
知识蒸馏是在资源受限的无人机上部署复杂模型的关键技术,研究人员开发了专用框架,以提高不同操作领域的设备端效率和性能。这些方法可根据其主要目标大致分类:优化高层任务物流、增强机载网络安全,或改进感知任务的基本蒸馏过程。
首先,在任务优化领域,Sun等人[160]创建了一个协同协进化框架,以解决在能量有限的无人机上运行复杂任务规划算法的挑战。在他们的方法中,多个学生子网络协作学习和交换信息,将大型深度神经网络(DNN)压缩到其原始参数的仅1.3%。知识蒸馏的使用在大规模场景中将任务完成延迟大幅减少了高达95%。这项工作表明,效率只是问题的一方面,对于在动态和对抗性环境中运行的自主无人机而言,安全性仍是另一个至关重要的问题。
知识蒸馏带来的效率提升对于无人机的发展具有基础性意义,而非仅仅是增量改进。通过使设备端推理和规划等复杂认知能力成为可能,知识蒸馏为将无人机从自动化工具转变为自主、目标驱动的智能体无人机[20]架起了关键桥梁。这一最新进展——智能体无人机——结合了认知人工智能模型、多模态传感和边缘计算,以支持实时感知和推理。为解决云端延迟和有限的机载资源,智能体无人机采用紧凑的边缘人工智能平台执行语义分割和路径重新配置等任务[20]。视觉语言模型(VLMs)进一步扩展了这些智能体的能力,通过语义接地和零样本泛化,使它们能够执行高层用户命令。因此,知识蒸馏成为现代无人机系统中构建高阶自主性和认知泛化的使能基础。
然而,无人机智能的发展并非止步于单智能体层面。鉴于电池和处理能力的持续限制[161],无人机通常将3D映射和大规模推理等计算密集型任务卸载到边缘服务器[21]。这种从个体智能到分布式智能的转变标志着向基于集群和边缘通用智能驱动的无人机生态系统的过渡,其中多个智能体协作感知、推理和行动。总之,虽然知识蒸馏等边缘计算技术通过克服固有的物理限制极大地增强了无人机的自主性,但向边缘通用智能驱动的集群等分布式认知系统的演进也带来了新的挑战。深度学习的不透明性造成了“可解释性-问责制危机”,使错误分析变得复杂,而物理安全仍然是确保公众接受和安全部署的关键未充分探索的领域[21]。
4.2 自动驾驶汽车
实现5级自动驾驶(车辆能够在所有环境中运行而无需任何人类干预)需要极其稳健、低延迟和高可靠性的人工智能能力。此类系统必须持续处理大量高维、多模态传感器数据(如摄像头、激光雷达、雷达、GPS、惯性测量单元(IMU)),并实时做出感知、规划和控制决策[18]。
当前支持自动驾驶汽车的方法可大致分为五类:基于车辆的方法、车对车协作计算、云辅助方法、边缘辅助方法和云-边缘辅助方法[19]。为实现自动驾驶汽车的边缘通用智能,知识蒸馏等通用方法得到了鸟瞰图(BEV)感知和协作边缘智能(CEI)等专用技术的补充。
鸟瞰图感知对来自多个摄像头、激光雷达或毫米波雷达传感器的数据进行转换和融合,生成统一的俯视空间表示。这种方法缓解了单一传感器固有的透视失真和遮挡等挑战,为下游路径规划系统提供了更稳定、信息更丰富的输入。
协作边缘智能是一种分布式计算范式,将地理分布式边缘资源整合到联邦池中。它支持垂直协作(云-边缘-终端)和水平协作(边缘-边缘),创建了一个去中心化的智能网络,能够动态协调资源以满足自动驾驶的严格需求[19]。
4.3 机器人技术
机器人操作技术(OT)严格的实时性和安全性要求通常难以通过集中式云计算满足,因此边缘计算成为关键的补充方法,在靠近系统的位置提供计算[22]。有多种框架支持这一点,包括用于任务卸载的FogROS2[23]、用于容器化部署和硬件加速推理的AMR边缘智能软件开发工具包(EI-for-AMR SDK)[162],以及用于5G使能协作映射的边缘驱动机器人平台(EDRP)[163]。
通用机器人技术通常涉及感知和操作复杂物体。多项研究试图解决此类挑战。例如,Chen等人[54]采用了创新的师生学习范式,其中一个配备了布料状态完整信息的“特权智能体”作为教师,通过基于视觉的强化学习指导机器人完成复杂的布料操作任务。同样,对于高精度工业任务,Zhao等人[164]提出了一种新颖的半监督知识蒸馏框架,旨在提高智能制造环境中基于视觉的引导的稳健性和准确性。
在仿真中优化的策略在部署到物理机器人时往往会失败,这是由于仿真和现实世界动态之间的差异。一种常见的解决方案是在仿真中训练教师策略,并提供特权信息(如精确的物体速度、摩擦系数),而学生策略仅使用物理机器人可用的传感器数据(如视觉输入、关节编码器读数)学习复制其行为[165]。
为了管理多种技能或协作多机器人场景,可以为单个任务训练专门的专家教师策略。然后,利用知识蒸馏将它们的能力整合到一个统一的学生网络中。这一过程蒸馏了所有教师的集体行为,使学生能够学习跨任务共性,并形成一个紧凑、可泛化的决策模型[166]、[167]。
4.4 其他物联网设备
物联网(IoT)拥有庞大且不断增长的互联设备网络,生成海量异构、实时数据[24]。
智能体互联网(IoA)提供了实现边缘通用智能的架构蓝图,提供了可扩展、以智能体为中心的基础设施。其分层设计旨在管理全球智能体网络的复杂性[25]。基础架构层提供必要的资源,包括人工智能模型、多样化的计算环境、多模态数据和高可靠性通信网络。
物联网环境中有效的多智能体通信需要平衡效率、可靠性和语义丰富性。虽然MQTT[26]和CoAP等轻量级协议对于简单传感器数据是高效的,但它们缺乏复杂智能体交互所需的语义深度[168]。为解决这一问题,Google的智能体到智能体(A2A)协议和Anthropic的模型上下文协议(MCP)等新兴的以智能体为中心的标准支持目标导向的协作。A2A使用“智能体卡”进行动态发现和任务协调,而MCP统一了对外部工具和实时数据的访问,以增强上下文感知[169]。
智能体人工智能和智能体互联网正从理论走向实践,在多个领域涌现出应用:
• 智能家居:Sasha[170]和SAGE[171]等系统展示了先进的目标推理和个性化,而去中心化的“设备即智能体”架构支持在边缘进行主动、隐私保护的协作[25]。
• 城市和工业物联网:CityGPT[172]和CASIT[173]等框架展示了大规模多智能体协调。CityGPT通过时空数据分析增强人类决策,而CASIT通过使用分层智能体结构优化带宽,自主管理远程环境监测[174]。
• 智能交通:联网和自动驾驶汽车(CAVs)[175]通过车对车(V2V)和车对基础设施(V2I)通信[176]作为协作智能体运行,应用于协作合并和车队行驶等场景。在内部,多智能体层次结构管理规划、战术决策和能量优化。
4.5 经验总结
在无人机[20]、自动驾驶汽车[18]、机器人技术[162]和物联网设备[24]等领域,知识蒸馏通过将大型教师模型压缩为轻量级、可部署的学生模型,一致地为资源受限环境赋能边缘通用智能[9]。这些应用凸显了知识蒸馏在连接高容量模型和边缘智能体方面的作用,支持跨模态知识转移和实时、上下文感知的决策制定[177]。然而,蒸馏模型的不透明性引发了可解释性和问责制问题[178],且知识蒸馏本身并未解决关键系统中的物理安全问题[9]。有前景的方向包括安全感知蒸馏,以及将知识蒸馏从策略转移扩展到语义理解[179],实现更透明、稳健和高效的多智能体协调。
5. 挑战与未来方向
5.1 挑战
尽管这些经验教训凸显了知识蒸馏在赋能边缘通用智能方面的潜力,但它们也揭示了一个更深层次的事实:在边缘通用智能能够安全、可靠地大规模部署之前,仍然存在重大的技术和伦理挑战²。
5.1.1 应对边缘通用智能的技术挑战
• 面向设备端智能体性能的新基准:大多数现有人工智能基准都是以云为中心的,仅关注静态任务准确率,因此不适合评估边缘的移动智能体人工智能。当前的边缘基准存在硬件和软件覆盖有限、测试环境不切实际、缺乏多租户支持以及端到端评估薄弱等问题。此外,它们通常测量准确率,但忽略延迟、能量效率和稳健性。ImageNet[180]和SQuAD[181]等传统基准依赖于预先收集的数据集,而设备端智能体必须在动态、交互式反馈循环中运行。
• 减轻压缩智能体中的幻觉和错误:大型模型经常产生幻觉,生成自信但不正确的输出,因为使用硬标签训练会强化确定性监督和过度自信。知识蒸馏通过使用软化的教师分布缓解了这一问题,但仍然受到暴露偏差的影响:教师生成的示例对学生而言通常具有较高的困惑度,使适配变得困难并降低了蒸馏的有效性[182]。
• 蒸馏和联邦系统中的漏洞:在联邦蒸馏(FD)中,服务器无法观察客户端如何生成对数输出,这使得对数输出投毒攻击(LPA)特别有效。尽管FDLA[183]引入了针对性的对数输出投毒攻击,但其在异构客户端和不同蒸馏阶段的影响仍未得到充分研究。更复杂的变体(如峰值控制联邦对数输出投毒攻击(PCFDLA))通过操纵峰值对数输出来逃避检测。除了这些针对性攻击外,拜占庭客户端可能通过参数篡改或高维扰动降低性能。包括局部模型平均(LMA)和基于共谋的投毒(CPA)在内的其他攻击进一步掩盖了对抗性行为。隐私也无法得到保证——对数输出可能通过成员推理攻击(MIAs)[184]、[185]泄露敏感用户信息。
5.1.2 应对边缘通用智能的伦理困境
边缘通用智能的技术能力和局限性直接引发了一系列深刻的伦理挑战。本节将系统分析这些挑战,并揭示它们与上述技术困难之间不可分割的联系。
• 人的因素:将复杂且有时相互矛盾的人类价值观编码到边缘通用智能系统中是一项伦理挑战。没有真正理解的模拟同理心存在操纵风险,而僵化的伦理规则在需要微妙判断的情况下(如电车难题 [186])会失效。目标不是硬编码情感或伦理,而是实现人类智慧的功能性模拟。
• 算法完整性与信任:偏差、隐私风险和错误是数据驱动人工智能系统固有的 [2]。模糊性、对抗性输入或过拟合可能在高风险场景中导致有害错误。同时,边缘通用智能必须在隐私与获取真实数据的需求之间取得平衡,而有偏差的训练集可能导致不公平或歧视性决策,尤其是在执法、国防和医疗等敏感领域。
• 社会和经济影响:边缘通用智能的兴起可能引发大规模社会经济变革。其发展需要巨额投资,而其自动化能力威胁到广泛的就业领域。再培训等传统应对措施可能不足 —— 这不仅仅是技能差距的问题,还涉及人类劳动力可能面临的淘汰。如果边缘通用智能在大多数认知任务上超越人类,人类工作在经济生产中的作用将变得不确定。
5.2 未来方向
• 安全感知知识蒸馏框架,明确优化模型在实际部署中的稳健性和可预测行为。
• 模态无关蒸馏机制,能够跨异构输入形式转移结构和语义先验 [158]。
• 协作多智能体知识蒸馏,边缘设备通过蒸馏和交换知识,共同接近云端级智能 [159]。
• 从策略转移向语义理解转移转变 [179],实现透明决策并缩小可解释性差距。
• 不取代人类判断,而是将人类监督嵌入关键决策循环,确保问责制、可解释性和与社会规范的一致性。
6. 结论
迈向边缘通用智能的旅程不仅仅是模型压缩的技术问题,更是一项全面的科学和工程事业。通过采用本综述中详细阐述的原则性、协同性方法 —— 结合智能体感知能力转移、边缘原生架构和高效适配方法 —— 研究界可以成功弥合部署鸿沟。未来面临的挑战是巨大的,涵盖基准测试和稳健性等技术领域,以及透明度、信任和社会影响等深刻的社会伦理问题。然而,这些挑战为未来几年定义了明确且引人注目的研究议程。本综述勾勒了一条可行的前进道路,为智能、自主的智能体能够在我们日益互联的数字世界的最边缘安全、高效且有益地运行奠定了基础。
参考资料
• 标题:Towards Edge General Intelligence: Knowledge Distillation for Mobile Agent AI
• 作者:Yuxuan Wu, Linghan Ma, Ruichen Zhang, Yinqiu Liu, Dusit Niyato, Shunpu Tang, Zehui Xiong, Zhu Han, Zhaohui Yang, Kaibin Huang, Zhaoyang Zhang, Kai-Kit Wong
• 单位:浙江大学;南洋理工大学;贝尔法斯特女王大学;休斯顿大学;庆熙大学;香港大学伦敦大学学院;延世大学
• 标签:边缘通用智能(EGI)、移动智能体AI、知识蒸馏(KD)、边缘计算、无线通信、6G、模型压缩、Mamba、RWKV
• 概述:本文系统综述了知识蒸馏技术在移动智能体AI中的应用,聚焦无线场景定制化方案与边缘原生架构适配,旨在弥合大型AI模型与边缘设备资源受限的鸿沟,推动边缘通用智能落地。
• 链接:https://arxiv.org/pdf/2511.19947