ICML 2026|上智院、华山医院等提出自监督预训练框架TACO,打破医学多模态「孤岛式」学习

作者 | 联合研究团队
编辑丨ScienceAI

在医学影像中,同一个解剖结构在不同患者、不同模态之间往往存在显著外观差异:脑部大小不同、病灶形态不同、MRI (Magnetic Resonance Imaging, 磁共振成像)序列成像特征不同。然而,一个重要事实始终存在 —— 空间拓扑关系人体解剖结构具有稳定的。

例如,在脑部 MRI 中,丘脑通常位于基底节内侧,不同皮层区域之间也保持相对稳定的邻域关系。即使患者个体存在差异,这些结构之间的「相对位置关系」依然具有高度一致性。现有 3D 医学影像自监督学习方法大多仍停留在实例级(Instance-level)范式:把每一位患者、每一次扫描看作独立样本,通过重建、对比学习或遮挡建模来学习表示。这种做法虽然有效,但忽略了医学影像中非常关键的一类监督信号:跨个体、跨模态共享的解剖拓扑结构。

为此,上海科学智能研究院(下称上智院)、复旦大学附属华山医院(下称华山医院)、复旦大学人工智能创新与产业研究院(下称复旦大学 AI³ 院)共同提出了 TACO(Topology-Aware COnsistency),一种面向 3D 多模态医学影像的拓扑一致性自监督预训练框架。

论文题目:Beyond Instance-Level Self-Supervision in 3D Multi-Modal Medical Imaging

论文地址:https://arxiv.org/pdf/2605.14654

代码地址:https://github.com/Ashespt/TACO

该研究成果已被机器学习顶级会议 ICML2026 接收。上智院实习生、复旦大学 AI³ 院博士生潘覃,为第一作者;上智院主任研究员蒋晨,上智院 AI 科学家及生命科学方向负责人、复旦大学 AI³ 院研究员程远,为共同通讯作者;华山医院神经外科博士后梅殊豪,上智院实习生、复旦大学博士生孙翊轩,昆士兰大学博士后郭凯与,新加坡科技局科学家谭兆瑞,复旦大学 AI³ 院工程师李孟渚,复旦大学 AI³ 院副院长韩丽妹,华山医院神经外科副研究员邹翔,昆士兰大学副教授 Mahsa Baktashmotlagh,为共同作者。

核心思想:不只看「图像长什么样」,还要学「结构之间怎么排列」

TACO 的出发点很简单:

如果两个 patch(图像块) 在某一位患者、某一种模态中属于同一解剖邻域,那么它们在另一位患者、另一种模态中的对应表示,也应当保持相似的局部拓扑关系。

换句话说,模型不仅要学习单个结构的外观特征,还要学习结构之间的相对关系。相比传统自监督方法主要关注同一实例内部的增强视图一致性,TACO 进一步引入了群体水平的解剖结构拓扑(Population-level Anatomical Topology):让模型在不同患者、不同模态之间学习稳定的解剖组织方式。

TACO和过去预训练方法的对比

方法概览:同时建模 Intra-instance 与 Inter-instance 拓扑一致性

TACO 主要包含两类拓扑对齐目标。

1. 实例内(Intra-instance):同一患者不同模态之间的拓扑一致性

对于同一位患者,不同 MRI 模态通常已经完成配准,因此 patch 之间存在较明确的空间对应关系。

TACO 在该场景下构建跨模态三元组(Triplet)约束:如果某个 patch 的邻域在模态 A 中是相近的,那么它们在模态 B 中的对应特征也应保持相近;反之,非邻域特征应保持相对远离。

这一设计让模型在同一患者的不同模态之间学习稳定的局部解剖结构关系。

2. 实例间(Inter-instance):不同患者之间的拓扑一致性

跨患者场景更具挑战性,因为不同个体之间不存在天然的像素级对应关系。TACO 通过互最近邻(Mutual Nearest Neighbor,MNN)构建伪对应关系,只在高置信度匹配的 token 子集上施加拓扑约束。

这种方式避免了强行进行密集对齐带来的误匹配问题,同时使模型能够捕捉不同患者之间共享的解剖结构模式。

最终,TACO 的训练目标由三部分组成:单模态重建损失;同一患者跨模态拓扑一致性损失;不同患者跨模态拓扑一致性损失。

TACO框架图

实验结果:7 个下游任务验证有效性

论文在多个 3D 医学影像任务上进行了系统验证,包括:

  • 4 个分割任务:BraTS2023-PED、BraTS-MET、UPENN-GBM、ISLES22;

  • 2 个分类任务:ADNI、ADHD;

  • 1 个缺失模态分割任务:BraTS2018 missing-modality segmentation。

实验结果显示,TACO 在多项任务中取得了当前最优或具有竞争力的表现。

在分割任务中,TACO 在四个数据集上的整体平均 Dice 达到 77.47%,超过最强 baseline BrainMVP 的 76.36%。

在分类任务中,TACO 在平均 ACC、AUC 和 F1 上分别达到 81.86% / 84.12% / 78.70%,其中 F1 相比最佳 baseline 提升达到 5.94%。

这些结果说明,跨患者、跨模态拓扑一致性能够显著增强医学影像表征的可迁移性。

可视化分析:模型真的学到了跨患者解剖对应关系

论文进一步通过 t-SNE 可视化分析模型表示。

结果显示,传统方法往往更容易按照「患者身份」聚类,也就是说模型更关注个体差异。而 TACO 学到的特征在不同患者和不同模态之间呈现更好的混合与聚合,说明其表示更接近「解剖结构本身」,而不是某个患者的个体特征。

在脑组织结构可视化中,TACO 也表现出更清晰、更一致的区域聚类结果,进一步验证了其跨个体解剖拓扑建模能力。

Patch-level特征可视化图

总结展望

TACO 的核心贡献在于:它将医学影像自监督学习从过往的实例级别的表征学习(Instance-level Representation Learning) 推向了群体级别的拓扑感知表征学习(Population-level Topology-aware Representation Learning)。

它不再仅仅让模型学习单个患者图像中的局部模式,而是进一步利用医学影像中天然存在的跨个体解剖拓扑一致性,让模型学习更加稳健、可迁移、可泛化的 3D 多模态医学影像表示。

这一思路对于医学基础模型尤其重要。未来,随着更多模态、更大规模影像数据和更多解剖结构被纳入预训练,拓扑一致性有望成为医学影像自监督学习中的关键监督信号之一。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询