重新定义临床AI,北大、澳门理工等发布首篇面向疾病演化动态预测的世界模型综述

作者 | 论文团队
编辑丨ScienceAI

当临床 AI 迈入真实病房,一个曾经被搁置的问题正变得越来越清晰:仅仅预测风险,已经远远不够了。

医生真正需要的不是一个静态分数,而是对疾病未来演化的可解释推演:患者会沿着哪条轨迹进展?治疗选择会如何改变这条轨迹?当数据不足以支撑反事实判断时,模型能否明确说「不确定」?

近日,北京大学、澳门理工大学、每因智能、新加坡国立大学、南洋理工大学等机构合作完成综述论文,系统讨论了面向疾病演化动态预测的临床世界模型框架。论文将疾病轨迹建模从传统的「风险评分」推进到「预测、干预、反馈学习」一体化的闭环系统,为临床 AI 如何生成决策级证据提供了方法地图。

论文地址:https://arxiv.org/abs/2605.16927

这项工作的开创性,并非停留在对既有临床预测模型的横向梳理上,而是首次从「世界模型」的视角,系统性地重构了疾病轨迹建模问题 —— 把疾病演化、治疗决策和观察过程放进同一个闭环框架里,并明确区分了事实预测、反事实轨迹估计和策略级评估这三类任务。对于正从风险评分走向临床决策支持的医学 AI 来说,这相当于为下一阶段「可干预、可解释、可验证」的动态预测系统,搭建了一套方法论底座。

临床疾病轨迹世界模型:从患者当前状态出发,对不同治疗动作下的未来轨迹进行模拟和策略评估。

本综述的通讯作者北京大学崔斌教授长期深耕数据库、数据智能与大模型基础设施研究,为世界模型式的临床 AI 提供了扎实的数据系统与算法视角。新加坡国立大学的 Saffari 教授、新加坡管理大学的 Lee 教授,以及澳门理工大学的孙悦等通讯作者,则分别从生物医学数据科学、临床建模、因果推断和智能医疗转化等方向切入,共同支撑了这篇文章的理论深度与临床落地价值。北京大学软微学院博士生、每因智能创始人郭潇宇为论文共同第一作者。

静态风险模型,为何难以走进临床?

过去十年,在临床领域,大量机器学习模型仍紧紧围绕着某个固定的终点展开建模:30 天死亡风险、再入院概率、某种并发症的发生风险 —— 仿佛临床结局只有这些可被量化的终点才值得被预测。这类模型对筛查和分层很有价值,但当问题变成「下一步该怎么治」时,静态风险评分会暴露出根本局限。

原因在于,临床决策不是离线预测任务,而是一个反馈系统。模型给出的风险会影响治疗,治疗会改变疾病轨迹,而疾病轨迹又会影响医生何时复查、记录什么、漏掉什么。也就是说,真实世界病历同时包含疾病生物学、医生行为和医疗系统运行方式。

如果模型只是从观察性病历中学习「哪种疾病将来会恶化」,就可能会把疾病进展与治疗选择混为一谈。它也许能很好地预测常规治疗路径下的结局,却无法可靠回答「如果采取另一种治疗会怎样」。 这道关于「如果」的鸿沟,正是临床 AI 必须迈过去的那道坎。

从风险分数到疾病轨迹:临床 AI 的问题被重新定义

这篇综述提出,疾病轨迹建模的核心对象不应是单个风险分数,而应是患者随时间演化的纵向状态。这个状态可以来自电子病历、影像、检验、用药、可穿戴设备、组学数据等多模态信息,并且会在治疗和观察过程中持续更新。

从疾病自然史到数据驱动轨迹:现代临床 AI 需要处理复发、缓解、非线性进展和个体异质性。

在这一视角下,模型不只是问「未来是否发生某个事件」,而是尝试回答一组更接近临床实践的问题:疾病状态将会如何演化?不同治疗序列会将患者推向哪些可能未来?这些未来的证据支持是否充分?

世界模型:让 AI 在内部先「演练」不同治疗未来

世界模型的思想来自智能体学习:系统先学习一个可模拟的内部世界,再在这个世界里评估不同动作的后果。迁移到临床场景后,患者的历史被编码为潜在状态,治疗被视为动作,模型向前滚动生成未来轨迹,并据此评估不同策略的收益和风险。

这并不是把「世界模型」作为一个包装概念,而是把临床预测问题重新组织为动态系统问题:疾病如何自然演化,治疗如何介入演化过程,观察和缺失如何影响我们看到的轨迹,模型何时应当给出不确定性或拒绝外推。

1. 事实轨迹预测:在当前治疗路径下,患者未来会怎样?

这是传统动态风险模型最接近的任务,用于早期预警、病情监测和风险分层。

2. 反事实轨迹估计:如果换一种治疗,未来会怎样?

这是临床决策最关心、也最困难的问题,需要处理时间变化混杂、治疗 - 病情反馈和数据支持不足。

3. 策略级评估:如果改变临床策略,整体收益是否更好?

这一步面向部署前验证和真实世界策略更新,要求模型不仅预测个体结局,还能评估政策层面的安全性与稳健性。

三类机制:决定模型能不能真正支持干预

作者强调,只有把这三类机制放在一起,临床世界模型才可能从「看起来预测很准」走向「可以支持有限条件下的干预推理」。

综述提出的干预感知疾病轨迹建模框架:预测、决策、执行和反馈学习共同构成闭环。

多状态模型方法谱系:从到连续时间反事实推断

论文将相关方法放入同一个框架中比较,而不是简单按照模型名称罗列。传统多状态模型和联合模型能够解释状态转移与事件风险;深度序列模型和 Transformer 擅长从高维、多模态病历中学习长期依赖;时间点过程、神经 ODE/CDE/SDE 等连续时间方法更适合处理不规则访视和事件驱动数据;纵向因果推断则为动态治疗方案、反事实轨迹和离线策略评估提供理论边界。

这种整理方式的价值在于,它把「模型能做什么」和「模型声称能支持什么」区分开来。一个模型可以是优秀的预后工具,但如果没有处理治疗分配和时间变化混杂,就不应被解释为治疗建议引擎。

疾病轨迹建模技术演进:从生存分析、多状态模型到反事实轨迹预测和面向治疗决策的因果 AI。

真正的挑战:不是更大模型,而是决策级证据

综述中一个重要判断是,临床轨迹模型的瓶颈不只在架构表达能力,更在证据与评价体系。事实预测可以用时间分层的 AUROC、Brier score 和动态校准评估;但反事实轨迹和策略评估必须进一步报告治疗重叠、正性假设、隐藏混杂敏感性、离线策略评估稳健性,以及目标试验模拟等证据。

换言之,临床 AI 不能只说「预测得准」,还必须说明「在什么数据支持范围内预测得准,以及何时不该给出建议」。

干预感知疾病轨迹建模的假设、失效模式和安全限制。

从「预测疾病」到「理解干预后的疾病演化」

作者认为在未来,疾病演化世界模型需要把三件事整合为一个系统:第一,联合建模潜在疾病演化、治疗分配和观察过程;第二,把不确定性、重叠诊断和拒绝外推作为模型输出的一部分;第三,让验证协议与临床主张匹配,从回顾性预测扩展到目标试验模拟、准实验验证、离线策略评估和部署后漂移监测。

这意味着,临床 AI 的目标正在从「识别高风险患者」走向「理解不同临床行动如何改变疾病未来」。对于重症、慢病和多模态真实世界数据场景,这一转向可能成为下一阶段医学 AI 的关键基础设施。

疑似含有AI生成内容,请注意甄别
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询