Nature丨从10,747个分子到460亿个候选:AI正在把抗生素研发改写成一门可计算的实验科学

编辑丨&

抗生素曾是人类最锋利的武器之一,对付那些细菌无往不利。可即使它们能有效杀死致病物种,也有可能会波及到有益的微生物群。这对 Crohn’s 病等肠道炎症患者尤其不友好,也会给耐药菌留下更大的进化空间。

2023 年,来自 McMaster University 的团队先筛了 10,747 个生物活性小分子,找到窄谱抗生素 enterololin。该团队的目标是专门压制与肠道感染相关的大肠杆菌。他们很幸运,最终只得到了一个分子,但仍需确认这种分子是针对其目标病原体的,而不是作为另一种广谱抗生素。

所以这一次,团队转向求助 AI。

他们把 MIT 的 DiffDock 接进来,用生成式 AI 预测这分子的作用位点;模型在约 100 秒内给出答案,指向细菌生存必需的 LolCDE 脂蛋白转运复合体,实验再用突变株迅速验证。

相关链接:https://github.com/gcorso/DiffDock

坚实基础

DiffDock 由 MIT 的 Barzilay 主导开发,团队基于神经网络开发了一个模型,将分子特征——例如键类型、原子序数和电子电荷——与溶解性和微生物生长抑制等特性关联起来。

研究团队随后用大约 2300 种经过测试以抑制大肠杆菌生长能力的分子数据训练了他们的模型——Chemprop,利用该模型筛选了数百万分子,寻找潜在药物候选人,最终锁定了被团队命名为 halicin 的激酶抑制剂。

图示:抗生素发现中的机器学习。

但拥有训练数据只是第一步——如何标记和分类同样重要。

关于这一点,帝国理工学院的 Bartlett 也有对应的发言权。她参与了一个由帝国理工学院和帝国理工医疗NHS信托领导的多机构合作项目,旨在全球范围内抗击抗菌药物耐药性。

在整理文献时,Bartlett 使用 RDKit 和 xTB 这两类计算工具,模拟各类分子溶解在水或细胞脂膜中的表现。据她所说,她训练数据中至少 10% 的分子需要穿透细菌包膜,这样模型才能学习预测细菌积累的特性。她参与的一些数据库包含超过 10 万个分子,但通常只有 3% 的分子能进入她感兴趣的细菌类型。

在这项工作之初,Bartlett 在编写运行模型所需的代码时遇到困难,但现在有了 Gemini 和 ChatGPT 等 AI 工具来协助排查故障。对此,Bartlett 认为,「你仍然得知道该问什么,但不必是代码架构本身的专家。」

相关链接:https://chemprop.readthedocs.io/en/latest/

肽提升

另一条路来自宾夕法尼亚大学的团队。他们用 APEX(antibiotic peptide de-extinction)筛查超过 1000 万条肽序列,找出 37,000 多条被预测具有广谱抗菌活性。

随后,他们合成并测试了 69 条肽,发现不少分子作用于细菌的细胞质膜。这类新机制,理论上更不容易被既有耐药谱直接拦住。Nature 同篇还写到,该团队后续的 ApexGO 生成式模型已经把设计推进到「从模板出发生成新肽」,并且在约 100 条已合成测试的肽中,约 86% 对至少一种病原体显示抗菌活性。

图示:ApexGO:计算工作流程及其结果。

相关链接:https://www.nature.com/articles/s42256-026-01237-5

分子制造

真正棘手的地方,往往出现在分子被 AI 设计出来之后。

James Collins 团队的一个例子就能作为代表:他们先用生成模型在 N. gonorrhoeae 和 S. aureus 相关空间里扩展出数百万种化合物,再借助可合成性模型和毒性、活性过滤,最后把清单压到不到 5,000 个,其中只有 90 个看起来真有希望,最终能实际合成的只有 22 个,真正有抗菌活性的也只有 6 个。

Stokes 团队接着往下走,做出了 SyntheMol-RL,把分子积木和化学反应放进强化学习框架里,让模型在约 460 亿个化合物空间里寻找「既有效、又能合成」的答案。该算法与另一个人工智能工具协同工作,后者预测SyntheMol-RL构建的分子性质并提供反馈。

图示:SyntheMol-RL 概述。

论文摘要显示,他们合成了 79 个独特于训练集的候选分子,其中 13 个在体外表现出较强活性,7 个还通过了结构新颖性筛选;其中一个命中物 synthecin 甚至在 MRSA 小鼠伤口感染模型里显示疗效。

相关链接:https://link.springer.com/article/10.1038/s44320-026-00206-9

从可能性到实用

到现在为止,这些 AI 赋能的抗生素项目还都停留在临床前阶段,没有哪一个已经真正变成能帮助患者的新药。可它们已经把一条漫长的研发链条拆成了更短的几段:先筛候选,再猜机制,再筛可合成性,最后进入湿实验和动物模型。

在未来,最有效的不应该是模型所展现的性能或者表现得如何花哨。如果无法将电脑里的事情转变为现实,那么实验也就失去了意义。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询