心电图数据不能出医院大门,AI还怎么学会看心跳?

你有没有想过一个问题:医院里的心电图数据,为什么不能像训练ChatGPT那样,直接打包传到云端训练一个超级模型?
答案很简单,也很沉重。这些数据记录着真实病人的心跳,一旦泄露,可能暴露一个人的身份、病史,甚至生活习惯。所以各家医院、各类可穿戴设备,它们手里的心电图数据,只能各自锁在自己的服务器里,谁也不敢往外传。
但AI模型想要学得好,通常需要海量数据。这就成了一个死结:数据不能动,模型却需要数据。
这篇来自国立台湾大学、韩国科学技术院、哈佛大学医学院等多家机构联合研究的论文,想解决的正是这个死结。他们没有去说服医院共享数据,而是换了个思路:既然数据不能动,那就让模型自己去每一家医院"串门"学习,学完就走,只带走学到的经验,不带走任何病人的原始数据。
这套思路有个专门的名字。
>
> 联邦学习:一种让多个数据持有方(比如不同医院)合作训练同一个AI模型的技术,训练过程中原始数据始终留在本地,只有模型参数在各方之间传递。
这就好比几个厨师想合作研发一道菜的最佳配方,但谁都不愿意把自己家的独门食材寄给别人。于是他们改了个办法:每个人在自己家试做,把"这次调整了糖和盐的比例,味道更好了"这种心得写成纸条寄给一个统筹者,统筹者把大家的心得汇总提炼成新配方,再发回去,让大家继续在此基础上试验。整个过程中,食材始终没有离开各自的厨房,流动的只是经验。如果换成把食材直接寄出去合并处理,效率可能更高,但一旦食材本身有商业机密(比如某种独家酱料的配方),这么做就完全行不通了。医院数据也是同理:直接共享原始信号确实训练效果更好,但隐私风险不可承受,所以联邦学习用效率换隐私,是没有选择的选择。
这个思路本身不新鲜,早在2017年谷歌就提出了联邦学习的经典算法。但把它用在心电图分类这件事上,有三个特别棘手的麻烦,也是这篇论文真正要啃的硬骨头。
三只拦路虎:数据少、类别偏、各家医院病人还不一样
先说第一只拦路虎:每家医院单独看,数据量都不够大。
这篇论文用的两个标准数据集,一个是MIT-BIH心律失常数据库,另一个是圣彼得堡INCART数据库。
>
> MIT-BIH:一个包含大量心跳片段并标注了心律失常类型的公开心电图数据集,是这个领域几十年来最常用的基准测试集之一。
>
> 心律失常:心脏跳动的节律或频率出现异常,可能是正常的生理波动,也可能是致命疾病的信号。
MIT-BIH按照医学标准把心跳分成五类:正常心跳、室上性早搏、室性早搏、融合心跳,还有一类未知类型。问题是,这五类心跳的数量极不均衡。数一数训练集里的心跳数:正常心跳有72471个,而最少的那一类"融合心跳"只有641个。算一下比例,差不多是113比1。
这意味着什么?如果一个模型偷懒,无论看到什么心跳都判定为"正常",它照样能在正常心跳上拿到接近满分的准确率,因为绝大多数样本本来就是正常的。但这样的模型在真实场景里毫无价值,因为医生真正关心的,恰恰是那些罕见但危险的心律失常。
第二只拦路虎是数据分布不一致。
>
> non-IID(非独立同分布):指参与联邦学习的不同客户端,各自持有的数据在类别比例、特征分布上存在明显差异,不像是从同一个总体里随机抽样出来的。
现实里,不同医院收治的病人本来就不一样。心脏科专科医院可能收治了大量心律失常病人,社区医院可能大部分是体检的健康人。这跟前面说的联邦学习厨师比喻可以接上:如果每个厨师试验用的食材质量、新鲜度都天差地别,统筹者硬把大家的心得汇总成一份配方,效果自然会打折扣。
第三只拦路虎,是通信成本。
联邦学习每一轮训练,都需要把模型参数在服务器和客户端之间来回传输。模型越大,参数越多,每一轮传输花的时间和带宽就越多。如果客户端是网络条件有限的社区医院或者可穿戴设备,这笔通信开销就成了实打实的负担。
所以,这篇论文要找的模型,必须同时满足三个条件:在数据少的情况下学得好,对分布不均衡有抵抗力,还得足够"轻便",别把通信管道堵死。
量子灵感的"变形金刚":HQKAN到底是什么
论文里的主角,有一个挺唬人的名字。
>
> HQKAN(混合量子启发柯尔莫哥洛夫-阿诺德网络):一种结合了传统全连接网络和量子启发结构的轻量级神经网络架构,用来替代传统的多层感知机完成分类任务。
先别被"量子"两个字吓到,这里说的"量子启发",指的不是真的要用量子计算机去跑,而是借用了量子计算里一种特殊的数学结构,用普通显卡就能模拟计算。这就好比现在很多"仿生"设计,飞机的机翼借鉴了鸟类翅膀的原理,但飞机本身不需要真的长羽毛。HQKAN借用的是量子电路里一种叫做"数据重上传"的技巧。
>
> 数据重上传(Data Re-uploading):一种把输入数据反复编码进量子电路多个层级的技术,通过多次编码同一份输入,让电路能够拟合更复杂的函数关系。
这个技巧原本是量子机器学习圈子里的研究成果,论文作者们把它拿来改造了一种叫做柯尔莫哥洛夫-阿诺德网络的新型神经网络架构。
>
> 柯尔莫哥洛夫-阿诺德网络(KAN):一种与传统神经网络设计思路不同的网络架构,它把"学习"这件事放在连接线(边)上而不是节点上,每条边都是一个可以自由调整形状的函数。
传统的多层感知机,也就是我们熟悉的"MLP",每个神经元节点做的是固定的加权求和,再套一个死板的激活函数(比如ReLU,输入小于零就直接归零)。而KAN反过来,把复杂的可学习函数放在了连接线上。HQKAN做的事情,就是把这些连接线上的函数,换成了用"数据重上传"量子电路实现的可训练激活函数,专业说法叫DARUAN。
>
> DARUAN(数据重上传激活函数):HQKAN中使用的一种可学习激活函数,通过带参数的单量子比特旋转电路反复处理输入数据来实现,比传统固定形状的激活函数更灵活,同时参数量更少。
为什么要这么折腾?答案就藏在论文反复强调的一个数字里:参数量。
传统MLP要拟合一个复杂的函数关系,往往需要堆很多层、很多个神经元,参数量蹭蹭往上涨。而HQKAN里的每一条"边"上,只需要几个量子旋转角度作为参数,就能拟合出相当复杂的曲线形状,因为量子旋转本身自带一种周期性和非线性的表达能力,天生比简单的加权求和更"能装"。
这就好比要做一件衣服合身,传统做法是准备十几种不同尺码的成衣(每个尺码就是MLP的一个神经元),客人来了挑一件最接近的凑合穿。而HQKAN的思路是只用几个可以旋转调节的裁剪工具,直接现场量体裁衣。前者需要囤积大量库存(参数),后者用几个灵活的工具就能覆盖同样的体型范围。如果不用这种可调节的"裁剪工具",非要靠囤积成衣去覆盖各种体型,那就得准备极多的尺码库存,也就是极多的参数。
具体到这篇论文的实验数字:在MIT-BIH数据集上,HQKAN只用了11581个可训练参数,而MLP需要18485个,少了37.35%。在INCART数据集上更明显,HQKAN用15147个参数,MLP需要27443个,少了44.81%。
而参数量减少,直接带来的就是联邦学习里每一轮通信量的减少,因为FedAvg算法每一轮都要把整个模型的所有参数(包括不参与训练但依然占空间的部分)在服务器和客户端之间传来传去。论文统计下来,HQKAN在MIT-BIH上帮通信量减少了24.89%,在INCART上减少了36.41%。
>
> FedAvg(联邦平均算法):最经典的联邦学习聚合方法,每一轮由各客户端在本地训练模型,服务器把所有客户端返回的模型参数按照各自数据量加权平均,得到新一轮的全局模型。
HQKAN到底长什么样:编码器、解码器加一个量子处理核心
具体到模型结构,HQKAN不是把整个网络都换成量子电路,而是采用了一种"三明治"结构。
两边是普通的全连接编码器和解码器,负责把心电图信号压缩成精简的特征,或者把处理完的特征还原回去。中间夹着的,是刚才说的QKAN模块,专门负责在这个压缩后的"隐空间"里做复杂的非线性变换。
>
> 隐空间(latent space):神经网络内部经过压缩和抽象后的特征表示空间,通常维度比原始输入低,但保留了对任务最关键的信息。
这个设计有点像自编码器的思路,但目的不是压缩重建,而是让计算量最贵、最需要表达能力的那部分工作,交给参数效率最高的QKAN模块去做,前后两端的普通网络只负责"翻译"数据格式。
为了让这套量子启发结构真能在GPU上跑得快,论文团队专门开发了一个叫FlashQKAN的实现框架,用到了NVIDIA的cuTe DSL做底层加速,采用了算子融合和分块计算的工程技巧,这部分更多是工程实现细节,但说明团队不满足于"理论上参数少",还确保了这套模型在实际硬件上跑得动、跑得快。
实验怎么设计的:8个、16个、32个医院同时训练
搞清楚了模型是什么,接下来的问题是:怎么证明它真的更好?
论文设计的实验框架建立在一个叫FLamby的联邦学习开源平台上。他们把两个数据集分别切分给不同数量的"虚拟客户端",模拟8家、16家、32家医院各自持有一部分数据的场景。
数据切分有两种方式。第一种叫IID切分,就是把所有类型的心跳样本打乱,尽量平均地分给每个客户端,模拟一种理想化的"各家医院病人构成都差不多"的情况。
第二种是non-IID切分,用一种叫狄利克雷分布的数学工具,人为制造出病人构成差异很大的效果,用一个叫α的参数控制差异程度:α越小,各家医院的病人类型差异越大。
>
> 狄利克雷分布(Dirichlet distribution):一种可以生成"比例组合"的概率分布,常用来模拟联邦学习里不同客户端标签比例不均衡的场景,通过调节浓度参数控制不均衡的剧烈程度。
为了衡量这种"病人构成差异"到底有多大,论文还引入了一个量化指标。
>
> Hellinger距离:一种衡量两个概率分布之间差异程度的数学指标,取值在0到1之间,数值越大说明两个分布差别越大,这里用来衡量单个客户端的病人类别比例与全局整体比例的偏离程度。
每一轮训练,客户端本地训练5个周期,一共进行30轮全局同步,训练时用了一种针对稀有类别加权的损失函数,让模型对那些数量稀少的心律失常类型格外"上心",不至于因为数量少就被无视。
硬碰硬的结果:HQKAN在几乎所有场景下都赢了
理论说了这么多,实际打分怎么样?
论文用了几个关键指标来衡量效果。
>
> 宏平均F1分数(macro-F1):把每个类别的精确率和召回率的调和平均数分别算出来,再对所有类别求平均,不受样本数量多寡影响,因此特别适合评估类别不均衡场景下的模型表现。
>
> Cohen's κ系数:一种衡量分类结果与真实标签一致程度的统计指标,会扣除"纯靠运气蒙对"的部分,比单纯的准确率更严格。
>
> Brier分数:衡量模型给出的预测概率与真实结果之间的差距,数值越低说明模型的置信度判断越准。
先看IID理想场景下的表现。在MIT-BIH数据集上,客户端数量从8个增加到32个(也就是每个客户端能分到的数据越来越少),HQKAN相对MLP的宏F1优势从0.013一路扩大到0.054。这说明一件很关键的事:数据越稀缺,HQKAN的优势越明显。这恰好呼应了它"参数少、不容易过拟合"的设计初衷,数据量小的时候,参数多的模型反而更容易"背答案"而不是"学规律"。INCART数据集上也是同样的规律,优势从0.023扩大到0.030。
再看更贴近真实世界的non-IID场景。在32个客户端、病人构成差异较大的设定下,MIT-BIH数据集上HQKAN的宏F1达到0.761,MLP只有0.698;Brier分数上,HQKAN是0.094,MLP是0.121,数值更低代表预测的置信度更靠谱。INCART数据集上,HQKAN宏F1是0.850,MLP是0.838,Brier分数HQKAN是0.032,MLP是0.040。
下面这张表格摘录了论文中最核心的两组对比数据。
| 数据集 | 设置 | 客户端数 | 模型 | 宏F1 | κ系数 | Brier分数 |
|---|---|---|---|---|---|---|
| MIT-BIH | 非独立同分布 | 32 | MLP | 0.698 | 0.748 | 0.121 |
| MIT-BIH | 非独立同分布 | 32 | **HQKAN** | **0.761** | **0.804** | **0.094** |
| INCART | 非独立同分布 | 32 | MLP | 0.838 | 0.891 | 0.040 |
| INCART | 非独立同分布 | 32 | **HQKAN** | **0.850** | **0.910** | **0.032** |
这组数字最值得玩味的地方在于:客户端数量越多、数据分布越不均衡,HQKAN领先的幅度反而越大,而不是越小。这跟很多人的直觉可能不一样,通常我们会觉得,模型越复杂应该越能应付复杂局面。但这里恰恰相反:轻量、参数少的HQKAN在最艰难的场景下反倒撑得更稳。
罕见病例上的较量:谁更擅长发现"少数派"
聚合指标之外,论文还专门看了每个类别单独的表现,因为医学场景里,真正的挑战往往在于那些数量稀少但风险高的类别。
以MIT-BIH里数量最稀少的"融合心跳"(F类)为例,在IID设定下,HQKAN的精确率是0.239,MLP只有0.147,几乎翻了一倍。翻译成更好理解的说法:当模型判断"这是一次融合心跳"时,HQKAN说对的概率明显更高,误报更少。同时HQKAN在这个类别上的特异度也更高(0.980对0.962),意味着它更少把正常心跳错误地标记为融合心跳。当然天下没有免费的午餐,HQKAN的敏感度略低一些(0.837对0.868),意味着它漏掉了稍多一些真实的融合心跳病例,这是精确率和敏感度之间常见的取舍,模型变得更"谨慎",误报少了,但也会漏掉一些边缘案例。
在non-IID的更严苛场景下,HQKAN在室上性早搏(S类)、室性早搏(V类)、融合心跳(F类)三个稀有类别上的敏感度都明显超过MLP,分别高出0.147、0.077和0.073。这意味着在病人构成差异很大的真实场景里,HQKAN能更可靠地把这些危险的心律失常"揪出来",而不是漏诊。
在INCART数据集上,情况稍微复杂一些。S类心跳上,HQKAN的精确率更高,但敏感度反而略低于MLP;V类心跳上则是敏感度更高。这说明模型的优势并不是在所有维度上都碾压对手,而是呈现出一种此消彼长的权衡,这也是医学AI评估里一个诚实的细节:没有任何模型能在所有指标上全面领先,论文没有回避这一点,而是老老实实把每个类别的取舍都列了出来。
面对"千奇百怪的医院",谁更扛得住
最后一组实验,专门测试模型在各种不同程度的病人分布差异下的稳定性,用前面提到的Hellinger距离作为横轴,从α等于1000(几乎均匀)一路调到α等于0.1(极端不均衡)。
结果显示,在所有测试的不均衡程度下,HQKAN的AUROC和AUPRC都始终高于MLP。
>
> AUROC(受试者工作特征曲线下面积):衡量模型整体区分正负样本能力的指标,数值越接近1说明分类能力越强。
>
> AUPRC(精确率-召回率曲线下面积):与AUROC类似,但在类别极度不平衡时更能反映模型对稀有类别的真实表现。
更值得注意的是,随着Hellinger距离增大(也就是病人分布差异越来越极端),MLP的表现下滑得比HQKAN快得多,尤其是在AUPRC这个对稀有类别更敏感的指标上,两条曲线之间的差距被越拉越大。这就像两个人同时下坡骑车,路况平坦时两人速度差不多,但一旦遇到坑洼颠簸的烂路,装了减震系统的那辆车能稳住速度,另一辆车却晃得越来越慢。这里的"减震系统",对应的正是HQKAN参数更少、结构更紧凑这一设计特点带来的抗干扰能力。
写在后面
读完这篇论文,最让我意外的一点是,参数少居然不是"性能打折的代价",反而在联邦学习这个特殊场景里变成了一种优势。这跟我们平时对AI模型的直觉,越大越强,是拧着来的。
背后的道理其实可以往深了想一层:联邦学习的每个客户端,本质上都是在用很少的数据训练一个参数很多的模型,这天然就是过拟合的温床。HQKAN把大量的表达能力压缩进了少数几个量子旋转参数里,相当于给模型提前套上了一个"紧身衣",逼着它在有限数据里学到更本质的规律,而不是死记硬背。
论文里还有一个细节我觉得值得单独说一说:随着客户端数量从8个涨到32个,HQKAN领先MLP的幅度是在扩大而不是缩小的。这暗示着一个更大的可能性,在真实世界里,联邦学习的参与方只会越来越多、越来越碎片化(想想看,未来可能是每一个可穿戴设备都是一个客户端),如果这个趋势成立,那这类参数高效的模型,会越来越重要,而不是一个锦上添花的选项。
这篇论文没有解决的问题是:量子启发这套技巧,能不能扩展到心电图之外更复杂的生理信号,比如脑电图或者多导联的心电数据?如果输入维度大幅上升,DARUAN这种边函数还能维持参数效率优势吗?这是个我很想知道答案的问题。
Q&A
Q1:HQKAN是什么,和普通的神经网络有什么不同?
A:HQKAN全称混合量子启发柯尔莫哥洛夫-阿诺德网络,是一种把量子计算里"数据重上传"技巧应用到网络连接线上的轻量级模型。它用一个全连接编码器和解码器夹住一个量子启发的特征处理核心,比传统MLP用更少的参数就能达到相近甚至更好的效果。
Q2:为什么心电图数据不能直接拿来集中训练AI模型?
A:因为心电图属于敏感的生物医学数据,一旦集中传输和存储,会带来严重的隐私泄露风险。这篇论文采用联邦学习的方式,让原始数据始终留在医院或设备本地,只交换模型参数,从而在保护隐私的同时完成协作训练。
Q3:HQKAN相比MLP到底能省多少参数和通信成本?
A:在MIT-BIH数据集上,HQKAN比MLP减少了37.35%的可训练参数,通信成本降低24.89%;在INCART数据集上,参数减少44.81%,通信成本降低36.41%,同时分类表现整体更优。