复旦中山医院与新加坡团队:AI实现医疗研究技能包资格审核能力提升

这项由新加坡AIPOCH PTE. LTD.与复旦大学附属中山医院病理科联合开展的研究,发表于2026年4月,以预印本形式发布在arXiv平台,编号为arXiv:2604.20441。感兴趣的读者可通过该编号查询完整论文。
医疗AI领域正在发生一件有点像"厨师雇佣外卖员"的怪事:越来越多的AI系统不再是单打独斗的大模型,而是通过拼装各种"技能包"来完成任务。这些技能包,有点像乐高积木,每一块负责一件事——比如帮你查文献、设计实验方案、跑数据分析,或者帮你写学术论文。问题是,这些技能包上线之前,有没有人认真检查过它们到底靠不靠谱?
这正是这项研究要解决的问题。研究团队开发了一套叫做MedSkillAudit的审核框架,专门在医疗研究类AI技能包正式部署之前,对其进行系统性的质量把关。这件事看起来没什么大不了,但实际上填补了一个相当关键的空白——现有的AI评估工具,要么测的是"模型能不能回答医学题目",要么测的是"AI能不能完成临床任务",却没有人专门检查:一个被设计成可以反复调用的医疗研究工具包,在科学性、安全性和可复现性上,究竟有没有达到可以放出去用的标准。
一、为什么需要专门的"考官"
普通的软件质量检查工具,关心的是代码有没有漏洞、有没有崩溃风险。但医疗研究类AI技能包的问题不止于此。一个工具可能代码完全正常运行,却在悄悄生成一个根本不存在的文献引用;或者帮你做统计分析时,用了错误的物种基因注释数据,导致整个分析结论南辕北辙;又或者每次运行结果都不一样,让你的研究完全无法复现。
这类问题,传统的代码质量工具根本发现不了,因为它们不懂科学研究的逻辑。而那些专门测试大型语言模型的基准测试(比如拿美国执照医师考试来考AI),也不适用——那些测试关心的是"AI知不知道某个医学知识点",而不是"这个被打包成工具的AI,在真实研究流程中会不会出问题"。
MedSkillAudit就是为填补这个缝隙而生的。它的核心逻辑,可以用一个"双重安检门"来理解:任何一个技能包,都必须先通过结构安全检查,再通过科学研究专项审核,两道门都过了,才能拿到上线资格。而只要有一道门亮红灯,不管其他方面表现多好,这个技能包都会被直接拒绝。
二、这套审核框架是如何工作的
MedSkillAudit的审核流程分为两个大的层次,每个层次都有自己的硬性否决机制。
第一道关卡叫做"结构审核",相当于检查这个技能包的基本工程质量。具体来说,它会检查四个维度:运行稳定性(工具崩溃率不能超过20%,不能有无法解决的依赖冲突)、结构一致性(技能描述文件必须格式规范,输入输出类型前后一致)、结果确定性(不能有未设置随机种子的随机数调用,不能有无限循环)、以及系统安全性(不能有未经过滤的危险命令执行,不能存在提示词注入风险)。这四条里任何一条不合格,就直接判定为拒绝,不再往下审核。
通过第一道关卡之后,才进入第二道关卡——"医疗研究专项审核"。这一关聚焦的是科学诚信问题,同样有四个硬性否决标准:不能有捏造的文献引用、DOI编号、样本量或p值(科学诚信门);不能给出直接的诊断结论,必须有适当的医学免责声明(实践边界门);不能出现逻辑谬误,比如混淆相关性与因果关系(方法学基线门);生成的代码不能有语法错误或缺少核心依赖库(代码可用性门)。同样,任何一条触发,直接拒绝。
两道否决关卡之外,还有一套评分系统。技能包的最终质量分,由两部分构成:静态质量评分和动态执行评分,权重分别是40%和60%。静态评分对应着25条标准,覆盖ISO/IEC 25010软件质量模型定义的8个维度,主要依据技能描述文件和代码本身来打分。动态评分则更有意思——系统会根据技能包的复杂程度,实际运行3次、5次或7次测试任务,观察真实的输出质量。动态评分分两层:第一层评通用输出质量,包括功能正确性、可靠性、效率和范围符合度,满分40分;第二层是针对不同类别的专项评分,满分60分,比如文献检索类技能会重点评估检索策略的严谨性,数据分析类会重点评估代码的可执行性,以此类推。
最终,根据综合得分,技能包会被分到四个档位:85分及以上是"生产就绪"(可以直接上线),75到84分是"限制发布",60到74分是"测试版",60分以下或触发否决则是"拒绝"。
三、实验是怎么做的,样本从哪来
研究团队收集了75个医疗研究类AI技能包,均匀分布在五个类别里,每类15个:文献检索与综合(Evidence Insight)、实验设计与统计规划(Protocol Design)、数据分析与生物信息学代码生成(Data Analysis)、学术写作与文档生成(Academic Writing),以及其他通用工具(Other)。
这75个技能包来自两个独立研发团队的四个连续开发周期,采用随机抽样,故意涵盖早期和成熟版本,目的是模拟真实的预部署审核场景——不是把最好的拿出来展示,而是抓一把现实中会遇到的东西来测。
按照执行方式划分,这些技能包分为三类:纯提示词型(Mode A,22个),依靠脚本运行型(Mode B,42个),以及混合型(Mode D,11个)。这个分类在后续分析中很关键,因为代码类工具的失败方式,跟纯文字提示型工具的失败方式截然不同。
为了检验审核框架的可靠性,研究团队还请了两位具备医学研究背景的专家,对同样的75个技能包进行独立评分。每位专家需要给每个技能包打一个0到100的质量分,给出一个四档的发布建议,并标记是否存在高风险问题。两位专家的评分完全独立进行,互不干扰。最终,系统评分与专家评分的一致性,用统计学上的ICC(组内相关系数)来量化,同时也计算了两位专家之间的一致性作为参照基准。
四、审核结果揭示了什么
75个技能包的专家共识质量分,平均值是72.4分,中位数73.2分,分布范围从40分到90.8分不等。从发布档位来看,只有22.7%的技能包达到"生产就绪"标准,20%进入"限制发布",41.3%只能算"测试版",还有16%直接被拒绝。换句话说,超过57%的技能包,还没达到可以正式上线的水平。
不同类别之间的差距相当悬殊。实验设计类(Protocol Design)整体表现最好,平均分高达86.2分,而且分数集中,15个技能包的分数都挤在80到90.7分之间,说明这类工具质量比较整齐。学术写作类(Academic Writing)表现最差,平均只有62.7分,15个里有5个直接被拒绝。数据分析类(Data Analysis)的分数分布最散,标准差达15.3分,从极差到极好都有,主要原因是有一批工具存在依赖库安装失败的问题,直接导致运行崩溃。
从执行方式来看,纯提示词类工具(Mode A)的平均分是77.9分,明显高于脚本型(Mode B,70.1分)和混合型(Mode D,70.2分)。这并不意外——代码类工具多了一层失败的可能性:依赖库版本冲突、API接口变更、安装失败,这些问题在纯文字工具里根本不存在。
在那些被判定为直接拒绝的12个技能包里,研究团队记录了具体的失败原因。其中有一个叫做funding-trend-forecaster的工具,问题极其严重——它把模拟生成的假数据作为真实API返回结果返回给用户,这意味着用户拿到的"研究数据"完全是编造的。另一个叫go-kegg-enrichment的工具,调用了错误版本的函数API,还在基因注释时用了错误的物种数据,这种错误在生物信息学分析中可以导致整个研究结论完全失效。还有一个技能包,声称有完整的脚本目录,打开一看是空的;另一个代码生成工具,由于依赖库之间存在根本性冲突,根本无法安装,连运行都运行不起来。这些案例生动地说明了,如果没有系统性的审核,这些问题完全可能在用户毫不知情的情况下流入真实的研究流程。
五、系统评分与专家评分有多吻合
这是整个研究最核心的问题:MedSkillAudit打出来的分,和人类专家打出来的分,有多一致?
先看人类专家自身的一致性基准。两位专家之间的ICC为0.300,加权Cohen's κ(衡量等级判断一致性的指标)为0.270,绝对分差平均13.8分,最大差距甚至达到50.6分。75个技能包里,两位专家给出完全相同发布档位判断的只有37.3%,而整体高达64%的技能包需要通过调解程序来确定最终判断。这个数字说明,即使是人类专家,在评判这类复杂工具时也存在相当大的主观分歧。
相比之下,MedSkillAudit与专家共识的ICC为0.449,95%置信区间在0.250到0.610之间,明显高于两位人类专家之间的0.300。系统与共识评分的平均差异只有负1.4分(系统略微偏低),统计检验显示这个偏差不具有显著性(Wilcoxon检验p=0.613),说明系统没有系统性地高估或低估技能包质量。系统与共识评分的分差标准差为9.5分,而两位专家之间的分差标准差是12.4分——系统打分的稳定性,实际上比人类专家互相之间还要好一些。
在发布档位判断上,系统与专家共识完全一致的比例是29.3%,相差不超过一个档位的比例达到82.7%,后者比两位人类专家之间的74.7%还要高。这意味着,在"大方向上判断对不对"这件事上,MedSkillAudit的表现并不比人类专家差。
Bland-Altman一致性分析(一种专门用来比较两种测量方法是否可互换的统计方法)显示,系统评分的偏差均值接近于零,一致性区间在负29分到正26.2分之间。分析中可以识别出两类主要的分歧模式:一类是系统评分远低于专家的情况,这通常发生在否决机制触发时——系统直接将分数拉到"拒绝"区间,而专家在受控评测环境下给出了更高的分数;另一类是系统评分高于专家的情况,原因是系统倾向于奖励结构完整性,而专家会额外惩罚那些逻辑浅薄或使用场景覆盖不足的工具。
六、分类别来看:有的类目系统更准,有的反而反着来
按照五个类别分别计算一致性,结果差异相当大,值得仔细拆解。
文献检索类(Evidence Insight)的ICC是0.551,数据分析类(Data Analysis)是0.506,两者都属于中等程度的一致性,说明在这两类工具上,系统评判标准和专家标准是基本对齐的。实验设计类(Protocol Design)的整体ICC偏低(0.232),而且存在统计显著的系统性偏差——系统平均比专家低6.1分(Wilcoxon检验p=0.033)。这是因为很多实验设计工具是纯提示词型,没有可执行代码,但系统的运行稳定性检查门(Veto Gate T1)还是对它们进行了检查,给出了不必要的扣分,而专家评分时并不会在意这一点。这个偏差后来成为框架版本迭代的重要依据。
学术写作类(Academic Writing)出现了最戏剧性的情况:ICC竟然是负0.567,加权κ是负0.308。负的ICC意味着系统评分和专家评分在这一类别里不是"方向相同但程度有差异",而是在反向移动——专家给高分的工具,系统给低分;专家给低分的,系统反而给高分。
这个结果不是随机噪声,而是一个清晰的结构性信号。研究团队的分析揭示了根本原因:系统的"学术语气"评分维度,会将系统化的段落结构和标准的科学表达习惯(如"研究表明""需要进一步验证"这类学术惯用语),识别为AI生成的风格标记加以扣分;而系统的"效率"评分维度,会因为学术文档内容详尽篇幅较长而扣分,认为这是冗余。但人类专家恰恰相反——他们认为规范的学术结构和适当的语言表达是高质量写作的标志,详尽的内容是符合交付标准的体现,而不是冗余。此外,专家评分更关注"这篇输出在典型条件下质量好不好",而MedSkillAudit测试的是多种输入条件下的行为分布,两者本身就在衡量不同的东西。研究团队认为,这个负ICC不是框架的彻底失败,而是一个诊断信号,揭示了写作类工具评测需要建立一套独立的专项评分标准。
七、框架的迭代与改进方向
研究团队在完成75个技能包的评测之后,基于发现的问题,将框架从版本1.0更新到了1.1.0。核心改动是针对数据分析类(Category 3)和实验设计类(Category 2)引入了"场景覆盖"机制。
具体来说,在审核一个差异表达分析工具时,团队发现通用评分标准里有三个地方对科学计算工具存在系统性误判。第一,容错标准(Fault Tolerance)把"遇到无效输入时直接报错停止"判定为不友好行为,但在科学计算流程里,遇到格式错误的样本ID时立刻停止,恰恰是防止后续分析悄悄使用错误数据的正确做法。第二,容忍度标准(Forgiveness)奖励自动修正模糊输入的工具,但在统计分析里,模糊匹配参数可能产生生物学上错误的结果却不给任何警告,这是危险的,而不是友好的。第三,可恢复性标准(Recoverability)奖励在终端输出人类可读的恢复建议,但在AI智能体优先运行的环境里,工具应该返回可被程序解析的错误代码,而不是终端里的散文说明。这三个问题,本质上都是通用软件标准对"人类操作通用软件"场景的假设,与"AI智能体运行科学计算工具"场景存在根本性不匹配。
针对这些问题,版本1.1.0采用的解决思路不是修改通用标准(那会影响其他类别),而是在数据分析类和实验设计类的专项评分文件里加入"场景覆盖"说明,针对这两类工具特有的执行情境给出修正解释。其他类(Category 5,Other)也加入了智能体优先模式的执行说明。
学术写作类(Category 4)的专项修正,则被推迟到了版本1.2.0——计划专门重新校准效率维度和学术语气维度的评分逻辑,使其符合写作类工具的真实评判标准。此外,计划中的版本还将引入模式自适应权重机制:对于纯提示词型工具(Mode A),适当提高静态评分的权重,因为对于这类工具,技能描述文件本身就是最重要的评审对象,而不是动态执行行为。
八、这项研究告诉了我们什么
归根结底,MedSkillAudit这项研究的意义在于,它证明了一件看起来很难、实际上有可行路径的事情:用结构化的自动化审核,在医疗研究AI工具正式上线之前,做一次系统性的质量筛查,而且这套筛查的结论,总体上和人类专家的判断是对得上的——甚至在评分一致性上,比两个人类专家互相打分还要稳定一些。
当然,这不意味着自动化审核可以完全替代专家判断,尤其是在学术写作这类工具上,系统和专家衡量的东西存在根本性的差异,需要更细致的框架调整才能解决。但在工程质量、代码可执行性、科学诚信硬性违规这些维度上,自动化审核展现出了相当可靠的识别能力。
对于任何一个正在构建或管理医疗研究AI工具库的团队来说,这项研究提供了一个实用的参考:不要等到工具部署之后才发现问题,一套分层的预部署审核,或许可以拦住大多数明显的危险,同时为还不成熟的工具指明具体的改进方向。
说到底,一个会编造文献引用的工具、一个永远无法安装的工具、一个每次运行结果都不一样的工具,不管它的说明文档写得多漂亮,都不应该出现在真实的医学研究流程里。而有没有人在它们上线之前认真检查一遍,区别可能就在于此。
感兴趣深入了解这项研究的读者,可以通过编号arXiv:2604.20441查询完整论文。
Q&A
Q1:MedSkillAudit是什么?
A:MedSkillAudit是一套专为医疗研究类AI技能包设计的预部署审核框架,通过"双重否决门"机制和分层评分系统,在工具正式上线前检查其结构安全性和科学可靠性,最终给出从"生产就绪"到"拒绝"四个等级的发布建议。
Q2:为什么现有的AI评测工具不够用,还需要MedSkillAudit?
A:现有的评测方法要么测"AI知不知道医学知识",要么测"AI能不能完成临床任务",都没有专门检查一个被打包成可反复调用工具的AI,在科学完整性、代码可执行性和结果可复现性上是否过关。比如,一个工具可能代码运行正常,却在悄悄生成不存在的文献引用,传统评测完全发现不了这类问题。
Q3:MedSkillAudit的自动化评分和人类专家的判断相差多少?
A:在75个技能包的测试中,MedSkillAudit与专家共识评分的组内相关系数(ICC)为0.449,高于两位人类专家之间的0.300。系统评分的平均偏差只有负1.4分,且没有统计显著的方向性偏差,说明系统的判断总体上和专家对齐,在评分稳定性上甚至优于人类专家互相打分的表现。