韩国KAIST与Valence Labs开创虚拟细胞机制推理新路径

这项由韩国科学技术院(KAIST)与Valence Labs(Recursion旗下研究机构)联合开展的研究,于2026年4月发表在arXiv预印本平台,论文编号为arXiv:2604.11661v2。有兴趣深入了解的读者可以通过该编号查询完整论文。

**研究背景:一个让药物研发者头疼了几十年的难题**

假设你是一名侦探,接到了一桩奇怪的案子:有人往一个城市(细胞)里投放了一种神秘物质(药物),城市随后发生了一系列连锁反应——某些工厂停工、某些道路堵塞、某些建筑突然倒塌。你的任务是搞清楚:这种物质是如何一步步引发这些变化的?

这正是生物医学研究者每天面对的挑战。细胞是人体最基本的功能单位,当药物进入细胞后,会触发一连串分子层面的连锁反应,最终影响基因的开关状态,进而决定细胞的命运——是继续增殖、停止生长,还是走向死亡。理解这条因果链,对于开发新药、理解疾病至关重要。

近年来,科学家们开始构建所谓的"虚拟细胞"——用计算机模拟细胞的行为,让研究者不必每次都做实验就能预测细胞对药物的反应。这听起来很美好,但有一个致命短板:这些虚拟细胞虽然能预测"结果",却说不清楚"为什么"。就像一位侦探只告诉你"凶手是张三",却没有任何推理过程、没有任何证据链——你敢相信吗?

大型语言模型(LLM,比如大家熟知的ChatGPT所属的技术类别)的崛起,让人们看到了解决这个问题的希望。这类AI在数学题、编程任务上展现出了惊人的推理能力,说不定也能帮助虚拟细胞"说清楚道理"?然而,事情并没有那么简单。

**一、侦探推理的第一道难关:如何让AI不瞎编**

在数学和编程领域,AI的推理过程很好验证——答案算出来了就是对的,代码跑通了就是正确的。但生物学完全不同。细胞里的分子机制错综复杂,知识散布在数以百万计的科学论文里,而且很多结论本身就有争议、有条件限制。

更糟糕的是,现有的AI语言模型在生物学领域特别容易"胡说八道"——专业术语叫做"幻觉"。它可能自信满满地告诉你"某种药物会激活某条通路",但实际上这个结论是它凭空捏造的,或者在完全不同的细胞类型里才成立。在药物研发这种关乎人命的领域,这种错误是灾难性的。

另外,人工标注高质量的生物学推理数据,需要极其专业的知识背景,成本极高、规模极难扩展。而直接让AI自己生成训练数据,又面临上述幻觉问题。这就形成了一个两难困境:没有高质量数据就没法训练可靠的AI,而产生高质量数据本身又需要可靠的AI来帮忙。

正是在这个背景下,来自KAIST和Valence Labs的研究团队提出了他们的解决方案。他们的核心思路是:与其让AI用自由散漫的自然语言来描述生物学推理(这样既难以检验,也容易出错),不如给推理过程设计一套结构化的"侦探档案格式",把每一步推理都变成可以被独立核查的"证据条目"。

**二、侦探档案的格式:把细胞故事写成有据可查的案件卷宗**

研究团队设计了一种叫做"结构化机制推理"的表达形式。这个名字听起来很学术,但本质上可以用一个比喻来理解:这就像把一个侦探办案的过程,从一篇主观的叙事文章,改写成了一份格式严格的案件卷宗,每一条记录都有编号、有证据来源、有明确的因果关系。

具体来说,这套格式把整个药物作用过程分解成一系列标准化的"动作原语"(action primitives)。这些动作原语总共有20种,被划分为七大类别,覆盖了从分子层面到细胞表型的完整生物学事件谱系。

第一大类是"系统初始化",只有一个动作叫做"set_context"(设置背景),相当于侦探档案的封面页,记录案发地点(细胞类型)、背景情况(基因突变状态)和已有前情(细胞的既有处理)。第二大类是"代谢",记录某种酶把底物A转化成产物B的化学反应。第三大类是"调控",这是最丰富的一类,包含分子活性调节、通路活性调节、蛋白复合体调节、翻译后修饰、转录调控、翻译调控和表观遗传调控七种子类型,对应了细胞内各种层次的调节机制。第四大类是"功能性",用来描述基因的功能获得或功能丧失,以及分子间的功能相似或统计关联。第五大类是"相互作用",最重要的是"binds_to"(结合)这个动作,用来精确描述药物与靶蛋白之间的物理结合,包括结合亲和力(相当于"案发现场有多少DNA证据")。第六大类是"表型",记录最终的细胞命运变化,比如细胞发生了凋亡(程序性死亡)或者停止了增殖。第七大类是"蛋白质稳态",记录蛋白质的位置转移或降解稳定化。

每个动作原语都有严格定义的参数格式。以最关键的"binds_to"为例,它的完整格式是:binds_to(id="n1", actor="药物名", target="靶蛋白名", affinity="12 nM", via="变构位点结合")。这里,"id"是这条记录的唯一编号,"actor"是药物,"target"是靶蛋白,"affinity"是结合强度(数字越小表示结合越紧密),"via"解释了结合发生的具体方式。每一个参数都有明确含义,每一个参数都可以被独立核查。

这些单个动作并不是孤立存在的,它们通过有向边连接成一张"有向无环图"(DAG)。如果用侦探办案来比喻,这张图就是案件的时间线和因果链——A事件导致了B事件,B事件又同时导致了C和D事件,最终在多条证据链汇聚之后,得出了最终结论。这种图形结构完美契合了细胞信号传导的本质:信息从上游向下游逐级传递,并在多个节点发生汇聚和分叉。

论文中给出了一个具体的示例案例:药物比美替尼(Binimetinib)作用于黑色素瘤细胞系C32。这个例子的推理链条从两个"binds_to"动作出发——比美替尼分别以12纳摩尔和4.6纳摩尔的亲和力结合到MAP2K1和MAP2K2两个蛋白(这两个数字代表结合非常紧密),然后通过变构抑制机制锁定这两个蛋白的非活性构象,进而阻断了整个MAPK信号通路,导致ERK1/2蛋白无法被磷酸化(磷酸化相当于"开关被打开"),ERK1/2随之无法进入细胞核执行转录任务,最终导致一系列促进细胞增殖的基因(如MYC、CCND1、FOS等)表达降低,最终引发细胞周期阻滞和凋亡。整个推理链条由19个节点和20条有向边构成,形成了一张清晰的"案件地图"。

**三、VCR-Agent:三位侦探分工协作的破案机制**

有了这套"案件卷宗格式",下一个问题是:谁来填写这份卷宗?研究团队设计了一个名为VCR-Agent的多智能体系统来自动完成这项工作。这个系统包含三个分工明确的"侦探角色",它们相互协作、相互制衡。

第一位是"情报收集官",也就是报告生成器(Report Generator)。当接到一个任务——比如"药物X在细胞Y中会发生什么"——情报收集官的首要任务是去收集所有相关情报,而不是凭脑子里的记忆瞎猜。它会先用一个叫HunFlair2的生物医学命名实体识别工具,从输入信息中提取出关键实体:这个药物叫什么名字?靶点蛋白是哪个?细胞类型是什么?

提取出关键词之后,情报收集官会同时向四个"情报数据库"发起查询。StarkPrimeKG是一个生物医学知识图谱,里面记录了蛋白质与蛋白质之间的相互关系、药物与靶点的关系、基因与疾病的关联——查这个数据库就像翻阅警方的前科档案,能了解"各个嫌疑人"之间的历史关系。Harmonizome是一个专门针对基因的综合数据库,特别适合查询某个基因在什么细胞类型中表达、与哪些其他基因相关联。PubMed是全球最大的生物医学文献数据库,通过提取实体的相关性搜索,可以找到最相关的科研论文,相当于翻阅历史案卷中的专家证词。Wikipedia则提供通用背景知识,就像给侦探补充基本常识。

从这四个渠道收集到的所有信息,会被汇总喂给Claude 4(Anthropic公司开发的顶尖AI模型,用作这个系统的核心语言引擎),生成一份详尽的、自然语言撰写的综合报告。以比美替尼的案例为例,生成的报告会详细描述这个药物的化学结构、作用机制、IC50值(衡量药效强弱的指标,数值越小表示效力越强)、以及C32细胞系所携带的具体基因突变背景(BRAF V600E突变导致信号通路异常激活、PTEN缺失导致另一条生存信号通路过度活跃等)。

第二位是"案件分析官",也就是解释构建器(Explanation Constructor)。它拿到情报收集官写好的综合报告后,任务是把这份自由格式的叙述,严格转换成前面介绍的那套标准化"案件卷宗"格式。之所以要把这两个步骤分开,而不是让AI直接从原始查询生成结构化结果,是有深思熟虑的设计考量:先让AI用自然语言把所有知识整合好、逻辑理顺,再让它填写格式化卷宗,比直接跳过综合步骤要准确可靠得多。这就像侦探先写了一份详细的调查笔记,再据此整理出正式的案件报告,而不是直接填空白的报告模板。

第三位是"核查官",也就是验证器(Verifier)。核查官的工作是独立审查案件分析官填写的卷宗,找出其中不符合事实的声明,并进行修正或删除。这是整个系统最有创新性的环节。

**四、核查官的武器库:两把精准的事实核查利器**

核查官拥有两种主要的核查工具,分别对应生物学推理中最常见的两类声明。

第一把工具是药物-靶点相互作用(DTI)验证器,专门用来核查"binds_to"(结合)动作。当推理链条声称"药物X结合到蛋白Y上"时,这把工具会调用Boltz-2——一个强大的蛋白质-配体相互作用预测模型,它能通过计算模拟来评估一个药物分子与一个蛋白质之间发生物理结合的概率。如果预测的结合概率低于预设阈值,这条推理链条就会被整体丢弃,因为其第一步基础就是错的。用侦探的比喻来说:如果案件卷宗声称"嫌疑人张三在案发当晚出现在犯罪现场",但监控录像显示张三根本不在那里,那整个针对张三的案件逻辑就要推倒重来。

第二把工具是差异表达(DE)验证器,专门用来核查"regulates_expression"(调控基因表达)动作。当推理链条声称"某种机制会导致基因A的表达升高"时,这把工具会去查询真实的实验数据库——具体来说,是Tahoe-100M数据集(一个包含了数以百万计真实单细胞实验结果的巨型数据库)——核实在该药物处理该细胞类型的实验中,基因A的表达变化方向是否与声明一致。这个验证不是删除整条推理链,而是进行"外科手术式"的精确修正:如果声称"基因MYC、CCND1、FOS、JUN都会下调",但实验数据显示JUN实际上并没有显著下调,那么JUN就会从这个基因列表中被删除,而其他三个有实验支持的基因则保留。

研究团队在完整的VC-Traces数据集构建过程中,这两个验证器发挥了重要作用:DTI验证器成功剔除了28.2%的错误药物-靶点结合声明,而DE验证器则对87.3%的基因表达调控动作进行了精炼,去除了其中与实验数据矛盾的基因条目。这两个数字意味着,如果没有这套验证机制,将近三成的药物作用机制声明会是错误的,而近九成的基因调控描述会包含至少一个不准确的细节。

除了这两个主要验证器,系统还设计了另外两种辅助验证器。定位验证器(LOC verifier)负责核查"localizes_to"(定位转移)动作,通过查询UniProt和人类蛋白质图谱数据库,确认某个蛋白质确实会在特定条件下从一个细胞区室转移到另一个区室。表型验证器(PHENO verifier)负责核查表型相关动作,通过查询细胞表型数据库确认所声明的表型是否与已记录的实验结果一致。

**五、VC-Traces数据集:18950份有据可查的案件卷宗**

用这套系统,研究团队处理了Tahoe-100M图谱中的18,950个独特的"化合物扰动-细胞背景"配对,每一对都生成了一份经过验证的结构化机制推理卷宗,最终汇聚成公开发布的VC-Traces数据集。这个数据集已经通过GitHub公开,任何研究者都可以免费使用。

为了评估这套系统生成的推理质量,研究团队设计了四个指标。"有效性"衡量生成的推理卷宗格式是否正确——标签是否完整、动作原语是否符合定义。"可核查性"衡量生成的参数(比如基因名称、化合物名称)是否能被映射到真实的数据库条目,从而被独立核查。"药物-靶点相互作用得分"直接反映推理中的结合动作在计算模拟中的合理性。"差异表达得分"反映推理中的基因调控声明与真实实验结果的符合程度。

在与其他模型的对比中,研究团队选取了几个代表性的AI系统作为参照:开源阵营包括DeepSeek-R1-8B、Qwen3-30B和Llama3.3-70B,闭源阵营包括Claude-Sonnet-4(VCR-Agent所采用的核心语言引擎)。结果相当清晰。DeepSeek-R1-8B几乎完全无法生成符合格式的推理,有效性仅为0.3%。Qwen3-30B和Llama3.3-70B能生成格式基本正确的推理(有效性分别为86%和84.1%),但药物-靶点得分分别只有52.8%和32.2%,差异表达得分分别只有27.2%和9%——意味着相当多的声明与实验事实不符。即使是独立运行的Claude-Sonnet-4(不经过VCR-Agent的知识检索和验证流程),其药物-靶点得分为65.7%,差异表达得分为50.4%。而配备了完整知识检索和验证流程的VCR-Agent,在同一评测标准下,药物-靶点得分达到72.5%,差异表达得分达到52.8%,在主要指标上全面领先。

**六、下游任务验证:有了"案件推理",AI预测基因变化更准了**

生成高质量的推理卷宗是一个目标,但终极问题是:这些卷宗真的有用吗?能帮助AI更准确地预测生物学现象吗?研究团队设计了一个叫做TahoeQA的下游任务来回答这个问题。

TahoeQA的任务设置很直接:给定一个化合物和一个细胞类型,预测某个特定基因的表达是否会发生显著变化(差异表达任务),以及如果发生变化,是升高还是降低(变化方向任务)。这是一个二分类问题,数据来自Tahoe-100M中真实的单细胞测序实验结果,标签通过严格的统计检验(DESeq2负二项广义线性模型+Wald检验+Benjamini-Hochberg多重检验校正)确定。测试集包含五种细胞系(C32、HOP62、HepG2/C3A、Hs 766T、PANC-1),并且训练集和测试集之间没有重叠的化合物,确保测试的是真正的泛化能力。

对比方阵中包括了多种不同类型的基准系统。统计基准包括随机预测、基于历史平均值的均值预测、以及基于化合物结构相似性的K近邻预测。转录组学基础模型基准选用了STATE(Transition)模型,这是一个专门在大规模扰动数据上训练的单细胞基础模型,代表了当前专用生物AI的最高水平之一。语言模型基准包括零样本直接提问和普通监督微调(SFT,即给AI看问答对让它学习,不提供任何推理链条)。

研究团队微调了一个Qwen3-4B模型,尝试两种不同的利用推理卷宗的方式。第一种叫"SFT-Prompt":在预测时,把生成好的结构化推理卷宗直接作为背景信息输入给模型,让模型在"已知推理过程"的情况下做预测。第二种叫"SFT-Generate":在训练时,让模型学习先自己生成推理卷宗,再据此给出预测答案——相当于训练侦探不仅能回答"凶手是谁",还能在回答前先完整写出推理过程。

结果在差异表达任务上非常突出。SFT-Prompt(给定推理卷宗后做预测)在五个细胞系的平均F1分数达到了0.435,联合测试集上达到0.452,相比普通SFT(0.292和0.291)有了约50%的提升。SFT-Generate(先生成推理再预测)的平均F1为0.388,联合测试集为0.441,也明显超越了所有基准。STATE这个专门的生物AI基础模型的平均F1只有0.257——这个结果表明,即使是专门针对扰动预测训练的大规模模型,在面对训练集中未出现过的新化合物时,也会明显落后于利用了机制推理的语言模型方法。

在变化方向任务上,传统统计方法(均值预测)的表现依然相当有竞争力(F1约0.817),SFT-Prompt在这个任务上的提升相对有限,提升至0.832。这说明当问题变成更简单的"涨还是跌"时,过去积累的统计模式已经能给出相当准确的答案,额外的机制推理信息带来的增量相对较小。

**七、消融实验:拆掉各个零件,看看谁最关键**

为了弄清楚VCR-Agent的各个组成部分各自贡献了多少,研究团队做了一系列"拆零件"测试。

关于检索数据源,团队分别测试了只用四个数据库中的一个来生成推理卷宗会怎样。结果显示,单独使用任何一个数据库,其药物-靶点得分都只有38%到47%,比四个来源合并使用(76.6%)低了将近一半。这说明四个数据库提供的是互补性知识,缺少任何一个都会显著影响推理质量。StarkPrimeKG提供了分子间的关系网络,Harmonizome补充了基因特异性的细节,PubMed提供了文献证据,Wikipedia提供了通用背景。

关于核心语言引擎,团队比较了Claude、GPT-4.1和Gemini-2.5-Flash三个选项。结果显示Gemini-2.5-Flash的格式有效性极低(只有6%,意味着它经常生成无法被解析的格式),基本不实用。GPT-4.1的格式有效性为97%,差异表达得分(0.527)甚至略高于Claude(0.487),但其可核查性只有30%,意味着大量生成的基因名称和参数无法被映射到真实数据库。Claude在有效性(100%)和可核查性(60.1%)上的优势使其成为最平衡的选择。

关于两阶段流水线设计,比较了直接生成结构化推理(一步法)和经过综合报告中转再生成(两步法)的区别。一步法的药物-靶点得分只有32.9%,差异表达得分只有26.7%,而两步法分别达到76.6%和48.7%。药物-靶点得分近乎翻倍的提升,有力证明了先进行知识综合、再进行格式化转换这一设计的必要性。

团队还做了人工评估验证,随机抽取了10份推理卷宗,邀请具有分子生物学和药理学背景的领域专家进行打分,同时与AI评分系统(LLM-judge)的打分进行比较。在科学准确性、逻辑一致性和机制清晰性三个维度上,人类专家与AI评分的皮尔逊相关系数分别为0.72、0.69和0.76,平均相关性达到0.72。这意味着AI评分系统在很大程度上能够代替专家进行质量评估,为大规模数据集的质量控制提供了可行方案。

**结语:当侦探档案成为AI的教科书**

归根结底,这项研究做的事情可以用一句话概括:把AI在生物学领域的推理,从"讲故事"变成了"写案件卷宗"。

这个转变背后有一个深刻的洞察:可核查性是科学可靠性的基础。在数学领域,推理过程可靠是因为每一步都遵循严格的逻辑规则;在编程领域,推理过程可靠是因为代码可以被执行并与预期结果比对。生物学长期以来缺乏这样的机制,导致AI在这个领域容易陷入"空口无凭"的困境。VCR-Agent通过定义标准化的动作原语,为每一类生物学声明建立了对应的验证手段,从而把"可核查性"引入了生物学AI推理。

对于普通读者而言,这项研究最直接的影响可能是:让未来的AI药物研发助手更值得信赖。当AI告诉你"这个化合物可能对这种癌细胞有效,因为它会阻断MAPK通路,导致ERK1/2失活,进而抑制MYC基因的表达,最终引发细胞周期阻滞"时,每一句话背后都有来自真实实验数据库的支撑,而不是AI凭空捏造的。这不仅提高了预测的可信度,也让研究者能更清楚地看到哪些环节是有充分证据支持的,哪些环节还需要进一步实验验证。

当然,这项研究也有其局限性。目前的验证体系主要覆盖了药物-靶点结合和基因差异表达这两类最常见的声明类型,还有许多其他类型的生物学声明(如蛋白质定位、代谢反应等)尚待开发对应的高可靠验证工具。此外,验证器的质量依赖于底层数据库的完整性和准确性,当研究的生物学背景较为冷门、相关数据稀缺时,系统的表现可能会下降。

值得思考的问题是:如果AI能越来越准确地描述细胞内的分子机制,这是否意味着未来的药物研发会越来越多地依赖计算预测,而减少对真实实验的需求?这两者之间会如何形成新的平衡关系?这些问题没有简单的答案,但正是这项研究开始触碰的边界。有兴趣深入了解的读者,可以通过论文编号arXiv:2604.11661查阅完整原文。

---

**Q&A**

Q1:VCR-Agent和普通的ChatGPT回答生物学问题有什么区别?

A:普通ChatGPT回答生物学问题时,会用自然语言描述机制,内容可能看起来合理但难以核实,且容易出现把在一种细胞里成立的结论误用到另一种细胞的情况。VCR-Agent的核心差异在于三点:它首先从真实的科学数据库(知识图谱、文献库等)中检索相关事实再生成推理,而不是仅凭模型记忆;它把推理结果写成标准化的结构化格式,每一条声明都有明确参数;最后,它用专门的计算工具(Boltz-2预测结合、查询真实实验数据)来验证每条关键声明,自动剔除与实验事实不符的内容。

Q2:VC-Traces数据集具体包含哪些内容,普通研究者能用它做什么?

A:VC-Traces数据集包含了18,950个化合物-细胞背景配对的结构化机制推理卷宗,每份卷宗都是经过药物-靶点和差异表达两个验证器筛选后的高质量结果。每条推理记录了从药物进入细胞,到最终影响基因表达或细胞表型的完整因果链,以标准化的动作原语格式存储,附带有向无环图的边列表。普通研究者可以用它来训练或微调自己的语言模型,让模型获得更准确的生物机制推理能力;也可以作为知识库,快速了解某类化合物在特定细胞背景下的已知作用机制;还可以作为假设生成工具的数据基础,为下一步实验设计提供参考。数据集已在GitHub公开,地址见论文附录。

Q3:结构化机制推理的动作原语系统为什么是20种而不是更多或更少?

A:这20种动作原语是研究团队在覆盖性和精确性之间做权衡的结果。一方面,细胞生物学包含的分子事件种类极多,但绝大多数重要的因果机制都可以归纳为这20类基本动作——从分子直接结合、信号通路调控、基因表达调节,到蛋白质修饰、细胞表型变化,形成了从分子到细胞的完整覆盖。另一方面,动作类型不能太多,否则每种类型的训练数据会不足,AI也难以保持格式的一致性;但也不能太少,否则无法精确描述不同类型的生物学事件之间的区别。这20种原语和7个类别的划分,是当前生物学知识体系和AI能力边界下的一个合理平衡点,而且系统本身设计为可扩展的,未来可以随着知识积累增加新的原语类型。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询