突破性 Mamba 模型结合多期 CECT:双层次对比增强感知模块突破精准分类!
点击下方卡片,关注「AI视界引擎」公众号


胰腺肿瘤通常在晚期才被诊断出来,导致预后不良和治疗选择有限,对人类健康构成重大威胁[2]。增强计算机断层扫描(CECT)是准确诊断和亚分类胰腺肿瘤的主要影像学方法[3],对应不同的临床治疗和预后策略。例如,胰腺神经内分泌肿瘤(PNETs)往往对手术干预和靶向化疗反应更良好,而胰腺导管腺癌(PDAC)通常表现出更具侵袭性的进展和对常规治疗的有限反应[1, 2]。
然而,如图1所示,高类间视觉和纹理相似性,以及某些病例中存在非典型增强模式,对基于CECT的准确肿瘤亚型分类提出了重大挑战[4]。放射科医生通常依靠CECT不同阶段增强模式提供的关于病变的有价值的时空信息来确定胰腺肿瘤亚型[3],这一过程非常耗时且主观。因此,需要一种自动的胰腺肿瘤亚分类方法来指导准确的临床治疗策略并提高放射科医生的诊断效率。

现有研究在自动诊断人眼难以察觉的肿瘤方面取得了进展。然而,这些方法未能探索CECT各期相间的增强变化,限制了其在胰腺肿瘤分类中的应用。最近,一些研究尝试整合多期相信息,以同时捕捉不同时间点的显著病变特征。[10]从三期相CECT中分别提取特征,然后将其连接到ConvLSTM[9]中以预测胰腺肿瘤的生存率。类似地,[11, 31]采用有序递归卷积连接操作来提取多期相CT图像中的时间特征,用于肝脏肿瘤分类。这些方法的性能仍然有限,因为其计算复杂度随3D体积大小呈二次方增长,从而限制了建模不同CECT期相间全局时间上下文信息的能力。
Mamba [12] 源自状态-space models (SSMs) [13],在分析长序列数据方面展现出巨大潜力,这被认为能够提升长距离依赖建模的能力。Vision Mamba [14] 采用双向Mamba块来从图像序列中捕获每个图像块的全局上下文信息,克服了高维数据中的计算限制。SegMamba [15] 将Mamba集成到用于3D数据分割的U形编码器-解码器架构中,展示了高效建模整体体积特征的能力。
类似地,[27, 45] 设计了一个用于长期时间编码的时间Mamba块,以实现高效的医学视频分割。尽管取得了这些进展,但先前基于Mamba的扫描序列在实现对动态医学数据更准确和可扩展建模方面仍然有限,因此需要进一步优化,以有效捕获由不同尺度上的动态变化模式产生的复杂时间依赖关系。
受此启发,本研究提出了一种基于Mamba的自动分类方法,命名为CECT-Mamba,用于使用多期CECT数据区分胰腺肿瘤亚型。yinqing-CECT-Mamba_2509有三个亮点:
据作者所知,这是首次探索将Mamba用于3D多相数据分析的工作。作者构建了一个包含动脉期、门静脉期和延迟期的多相CECT数据集,用于胰腺肿瘤亚分类。
作者提出了一种双层次对比增强感知Mamba (DHCM)模块,该模块整合了两种新颖互补的采样序列,用于分析相位内和相位间的时空变化。具体而言,空间扫描序列被设计用于检查相位内空间依赖关系,并结合全局时间变化进行分析。相比之下,时间扫描专注于探索局部区域的相位间时间依赖关系。此外,作者在时间扫描序列中引入了一个相似性引导的细化 模块,以提高对在不同相位间表现出高度变异性的局部肿瘤区域的细致检查。
空间互补积分器(SCI)和多粒度融合(MGF)模块也被分别用于压缩和聚合跨多个尺度的时空特征的语义信息,以实现3D数据的高效学习。实验结果表明,yinqing-CECT-Mamba_2509能够处理来自多相数据的丰富时空信息,并准确且高效地识别肿瘤亚型。
计算机辅助诊断的最新进展带来了多种自动化胰腺肿瘤识别和分类方法。[37]提出了一种利用统计纹理特征进行胰腺肿瘤检测,然后使用深度小波神经网络进行肿瘤分类的方法。[38]引入了一种分层卷积神经网络来提高胰腺肿瘤诊断的准确性。[39]提出了一种级联架构,将弹性图谱与多分辨率CNN相结合,用于腺癌患者的肿瘤提取。[40]探索了使用生成对抗网络(GANs)在对比增强MRI上区分胰腺肿瘤的方法。[41]集成了用于预处理的Gabor滤波、由帝企鹅优化器优化的多级阈值分割、用于特征提取的MobileNet以及用于分类的自编码器,并通过多领导者优化器进一步增强以提高分类准确性。然而,尽管有这些进展,它们的诊断性能仍然有限。据作者所知,此前没有研究探索过利用多期相对比增强CT图像进行胰腺肿瘤亚型分类的自动化方法。
几种深度学习方法使用多相CT扫描进行解剖结构的图像分析,其结果优于单输入方法[35, 36]。[35]引入了一种相位注意力机制,利用动脉相来促进门静脉相的分割。与单独扫描中的独立检测相比,该方法分别提高了和。为了利用CECT在不同相位的时序特征,[28]通过结合CNN(从每个相位提取空间特征)和门控RNN(捕获跨相位的时序增强模式)来利用CECT,实现了对恶性肝肿瘤的准确区分。[10]使用独立的CNN从三相CECT图像中提取特征,并将这些特征连接起来作为ConvLSTM的输入,以预测胰腺肿瘤的生存率。类似地,[11]引入了一种有序递归卷积连接操作,用于捕获多相CT图像中的时序特征,以进行肝肿瘤分类。然而,这些方法缺乏捕获多尺度全局上下文和细粒度增强变化的能力,而这些能力对于胰腺肿瘤的准确分型至关重要。
最近,状态空间模型(SSMs)[13]通过利用状态空间变换[32],在管理语言序列中的长距离依赖方面表现出显著的效率。S4[33]引入了一种结构化状态空间序列模型,该模型利用线性复杂度的优势来捕获长距离依赖。Mamba[12]源自SSMs,集成了高效的硬件设计和采用并行扫描(S6)的选择机制,因此在处理各种自然语言序列方面超越了Transformers。它在分析长序列数据方面表现出巨大的潜力,这被认为可以提高长距离依赖建模的能力。
Mamba不仅在自然语言处理中得到广泛应用,而且在捕捉图像处理中的长距离依赖关系方面表现出色。Vision Mamba [14] 和 VMamba [42] 采用多方向Mamba块,超越了原始Mamba的单向扫描方法,以有效地从图像序列中为每个图像块捕获长距离依赖关系。U-Mamba [43]、SegMamba [15] 和 SwinUMamba [44] 已成功将Mamba块作为即插即用组件整合到基于卷积神经网络的架构中,在生物医学分割基准测试上取得了强大的性能。类似地,Vivim及其他变体 [45, 47] 设计了用于长期时间编码的时间Mamba块,以实现高效的医学视频分割。RainMamba [34] 应用了一种新颖的Hilbert扫描机制,以更好地捕获视频上的序列级局部信息。尽管前景广阔,但当前基于Mamba的方法在动态医学影像的细粒度时间建模和可扩展性方面仍面临挑战。增强其学习多尺度时空依赖关系的能力,对于处理现实世界的临床变异性仍然至关重要。
CECT-Mamba如图2所示,是一个以Mamba块为核心的多阶段框架。给定动脉期、静脉期和延迟期的CECT 3D数据,该框架首先使用编码器-解码器模型从每个相位的整体体积中定位并裁剪胰腺肿瘤区域,随后通过深度大尺寸卷积核卷积和SCI(第3.2节)模块编码3D特征,并结合使用不同感受野进行空间互补细节增强。随后,由DHCM(第3.1节)模块和下采样块组成的四层编码器使用两种新颖的空间和时间采样序列处理来自三个相位的所有潜在特征,以探索不同粒度上病变的期内和期间对比度变化。最后,所有获得的分层时空特征被输入到MGF(第3.3节)模块中,以聚合跨不同尺度的肿瘤显著特征,用于胰腺肿瘤亚型分类。

3.1. 双重层次对比增强感知Mamba (DHCM)
为了有效捕捉肿瘤在不同粒度层次的时空对比增强特征,作者设计了DHCM模块,该模块利用Mamba固有的位置敏感特性来计算全局空间和局部区域的对比增强变化的层次依赖关系。如图2所示,作者首先将每个相位的3D特征展平为1D序列,其中、和分别表示动脉期、静脉期和延迟期。然后,作者通过利用中tokens的相位内和相位间连接顺序,构建两个互补嵌入序列,以实现同时进行空间和时间建模。
扁平化的tokens首先在每个阶段内进行拼接,以构建肿瘤的整体体积信息,然后跨阶段顺序组合。这个嵌入扫描序列随后被输入到Mamba层,用于建模整个肿瘤区域的全局变化模式。此外,在训练阶段,作者对嵌入序列应用随机 Mask ,以增强模型的鲁棒性。计算过程定义为:
其中 表示空间嵌入扫描序列, 表示随机 Mask , 表示 layer normalization,Mamba 指的是 Mamba 层,它捕获全局特征,而 表示多
层感知机
时间建模旨在在 Voxel Level 捕捉肿瘤跨不同阶段的细粒度增强动态。在构建时间扫描顺序之前,应用相似性引导的细化(SimR)模块来选择和增强在跨阶段表现出显著变化的局部嵌入,如图3(a)所示。相似性计算可以定义为:

其中 表示余弦相似度计算。 , 分别表示来自动脉期、静脉期和延迟期的序列的第i个嵌入。 表示第i个嵌入的相似度得分。
根据 ,embeddings被排序为高相似度和低相似度子集,其中低相似度部分被输入到Mamba层进行增强。在重建增强后的低相似度embeddings的原始位置后,作者通过首先按时间顺序连接同一位置的tokens,然后在空间上拼接它们,形成一个时间扫描序列。该序列随后被输入到Mamba层,以在同一局部肿瘤区域内实现特征交互,使模型能够在多个细粒度 Level 上捕获肿瘤的连续期相增强变化。计算可以定义为:
其中 表示时间嵌入扫描序列。
最后,来自空间和时间建模的特征序列被恢复到其原始的3D形状,相加在一起,然后通过下采样块进行后续处理。
为了减轻通过Mamba层后空间信息的显著损失,作者引入了SCI模块。该模块丰富了不同特征 Level 间的互补细节,以提高模型的表示能力。如图3(b)所示,3D特征通过两个并行路径进行处理:一条路径使用两个卷积块来编码通道级空间上下文。每个块由一个卷积层、一个归一化层和一个非线性激活层组成。另一条路径应用两个卷积块来聚合像素级跨通道上下文。最后,通过残差连接获得增强的空间特征。计算过程定义为:
其中 表示输入的3D特征, 表示3D卷积块。
为了整合多尺度的时空语义,MGF模块通过将浅层细节丰富的信息传递到深层抽象特征来融合特征。如图3(c)所示,作者考虑从浅到深的五个层次特征 Level 。对于来自前三层的浅层特征,MGF模块首先应用卷积块(包括卷积、池化和非线性激活层)将输入特征对齐到统一维度 ,然后应用跨尺度多头自注意力[16],生成融合表示 。对于更深层的特征 ,应用尺度内自注意力来过滤由多次下采样引入的噪声和冗余,然后与 应用跨尺度注意力以生成最终的融合特征。MLF模块的计算过程可以定义为:
为定位胰腺肿瘤,作者采用一个预训练的nnUNet [18](配置用于高分辨率图像处理)作为定位网络。定位后,ROI被裁剪为的尺寸,随后进行包括重采样和强度归一化在内的预处理步骤。在整个训练过程中,应用了包括随机翻转和添加随机噪声在内的数据增强技术。在DHCM模块中,序列内的嵌入被随机 Mask 。在SimR模块中,所有tokens基于相似度进行排序,然后均匀地分为高相似度和低相似度组。对于下采样块,作者采用了UNETR [30]中的下采样模块。模型使用Adam优化器进行训练,初始学习率为1e-5。训练跨越100个epoch,学习率通过余弦退火调度器逐步降低至最终值1e-7。整个框架在PyTorch中实现,并在NVIDIA 4090 GPU上执行。
其中 代表多尺度融合特征, 表示交叉注意力机制,而 指的是多头自注意力机制。
数据集构建
作者建立了一个包含270名患者的CECT数据集,其中包括184名PDAC患者和96名PNETs患者。每名患者接受了三个阶段(动脉期、静脉期和延迟期)的动态CECT扫描,形成了总共810张3D图像。其他阶段的所有图像都使用Elastix [17]配准到动脉期。胰腺肿瘤由两名分别具有三年和五年临床经验的腹部放射科医生进行标注和校准,并且肿瘤类型通过手术切除后的病理检查得到确认。CT扫描获取于2015年1月至2020年12月期间,所有敏感的患者信息已被移除。
数据集分析
所有CT扫描具有一致的平面内尺寸,其中轴尺寸范围为41至89层,中位数为57。平面内间距从到不等,中位数为,而轴间距始终为。
作者将yinqing-CECT-Mamba_2509与七种最先进的方法进行比较,包括基于CNN的方法(ResNet3D-50 [19])、LSTM-CNN混合架构(E3D-LSTM [8]、MPBD-LSTM [20])、经过微调以适应3D嵌入输入的基于transformer的方法(Vision Transformer [21]、Swin Transformer [22])、transformer-CNN混合架构(Uniformer [24])以及基于2.5D transformer的方法(Diff3Dformer [23])。对于非基于LSTM的方法,三相CT图像的特征通过concat [25]进行融合,并输入到分类头中。为了进行公平比较,作者使用相同的预处理来获取肿瘤区域。
所有方法均使用5折交叉验证进行评估。为了在作者的数据集上进行定量比较,作者报告了准确率(ACC)、ROC曲线下面积(AUC)、F1-Score、召回率和精确率。这些指标提供了对模型性能的全面评估,不仅反映了整体正确性(ACC),还反映了模型正确识别阳性案例的能力(召回率)、在预测中保持精确性的能力(精确率)以及两者之间的平衡(F1-Score)。AUC进一步衡量了模型在所有分类阈值下的判别能力,这在作者的类别不平衡任务中特别有价值。为了评估统计显著性,作者进行了AUC bootstrap测试。此外,作者通过测量每10个案例的平均推理时间(IT)来评估推理效率,以秒为单位报告。
如表1所示,作者提出的模型在子分类任务中实现了最佳的整体性能,同时保持了高计算效率。在比较方法中,Diff3Dformer取得了强大的结果,其平均准确率、AUC、召回率和F1分数分别为、、和。相比之下,作者的CECT-Mamba优于所有竞争对手,实现了最高的准确率、AUC、召回率和F1分数,展示了卓越的诊断鲁棒性。在推理速度方面,yinqing-CECT-Mamba_2509实现了第二快的运行时间,平均处理10个病例需要0.85秒,优于所有基于LSTM和基于Transformer的方法,仅被ResNet超越。值得注意的是,基于LSTM的方法优于其他比较方法,突显了时间特征在这种子分类任务中的重要性。然而,这种改进是以显著更高的计算开销为代价的。同样,Diff3Dformer由于其依赖于基于重建的预训练策略,在训练过程中产生了大量的计算开销。相比之下,yinqing-CECT-Mamba_2509通过在计算效率和分类准确性之间取得良好的平衡,实现了最佳的整体性能。此外,统计显著性bootstrap测试表明,yinqing-CECT-Mamba_2509产生的AUC显著高于所有比较方法,p值小于0.05。这些结果表明,yinqing-CECT-Mamba_2509通过全局建模有效地捕捉了空间和时间线索,实现了准确且高效的tu

mor 诊断
作者选择了七种比较方法来对作者数据集进行视觉评估。Grad-CAM [26]被用于可视化模型关注的感兴趣区域。为保持一致性,作者在三个成像阶段中使用了同一患者的CT扫描相同切片。作者重点展示了一个特别具有挑战性的病例,在该病例中,放射科医生最初基于CECT图像将肿瘤诊断为PDAC。然而,作为临床金标准的术后病理检查证实,真实诊断是PNET。在所有比较方法中,只有yinqing-CECT-Mamba_2509正确地将肿瘤预测为PNET,而所有其他方法都将其错误分类。值得注意的是,如图4所示,yinqing-CECT-Mamba_2509关注的肿瘤区域更加紧凑和局部化。这表明yinqing-CECT-Mamba_2509在Grad-CAM可视化中突出的肿瘤区域可能对应于识别PNET的诊断关键区域,表明其潜在的临床相关性,并展示了相比其他最先进方法的优越性能。

为了评估作者在CECT-Mamba中提出的子模块的有效性,作者比较了五个 Baseline 网络。第一个 Baseline (表示为"Basic")是从yinqing-CECT-Mamba_2509中移除所有组件,仅保留由卷积层组成的四个下采样块。将SCI模块整合到"Basic"中得到了"C1"。然后,作者向"C1"引入仅具有空间建模的DHCM模块得到"C2",并进一步整合不含SimR模块的时间建模得到"C3"。添加SimR模块产生了"C4"。最后,整合MGF模块得到了作者完整的CECT-Mamba方法。表2中的结果显示,随着每个组件的逐步整合,性能持续提升。例如,仅添加SCI模块(C1)使AUC从大幅提升到,并将Recall从提高到。随着DHCM中空间和时间建模的引入(C2和C3),AUC进一步提升至,Recall达到。整合SimR模块(C4)将Recall提高到,并增强了整体分类的鲁棒性。作者的完整模型在所有指标上均取得了最高性能,达到的ACC、的AUC、的Recall和的F1-Score,证实了每个子模块的互补贡献。

在这项工作中,作者提出了CECT-Mamba,这是一个利用多期相对比增强CT进行胰腺肿瘤亚型分类的新型框架。yinqing-CECT-Mamba_2509擅长捕捉细粒度的期相间全局增强动态,有效解决了胰腺肿瘤不同亚型间高度类间相似性和非典型增强模式所带来的亚型分类挑战。
受放射科医生临床工作流程的启发,作者的流程首先定位肿瘤区域,然后是DHCM模块,该模块集成了Mamba以同时进行空间和时间建模。这种设计能够提取肿瘤的全面体积表征和对比增强动态。
此外,作者引入了SCI和MGF模块来减轻信息损失并增强3D特征的空间和语义互补性。在270名患者的多期相CECT扫描数据集上进行的广泛实验证明了yinqing-CECT-Mamba_2509的有效性和优越性能。消融研究进一步确认了每个提出模块的单独贡献和必要性。
[1]. CECT-Mamba: a Hierarchical Contrast-enhanced-aware Model for Pancreatic Tumor Subtyping from Multi-phase CECT
点击上方卡片,关注「AI视界引擎」公众号