ICML&ACL Oral|迈向全自动实验室,北大两篇顶会论文让大模型从「推理」走向「物理执行」

AI 正在重塑科学发现的流水线,科学家的核心工作正从亲力亲为的「执行」向上游的「判断」转移。未来的科研核心竞争力,在于能否敏锐地评判 AI 递上的假设与方案。
然而,当科学家将精力聚焦于高维决策时,一个严峻的现实问题随之浮现:谁来接管下游极其复杂、容错率极低的湿实验?大语言模型(LLM)虽有强悍的「数字大脑」,却缺乏操作试管的「物理双手」,其在数字空间里无伤大雅的「概率性幻觉」,一旦落在真实的实验仪器面前,往往意味着惨重的设备损坏与资源溃败。
为了真正跨越这道从「数字理论」到「物理执行」的鸿沟,北京大学深圳研究生院 - 科学智能学院的研究团队交出了一份答卷。直击自动化生命科学实验的核心痛点,两项底层突破性工作分别被顶级人工智能会议 ICML 2026 和 ACL 2026 Oral(同时入选 ICLR 2026 Workshop)高分接收。

BioProBench(ICML 2026)论文地址:https://arxiv.org/pdf/2505.07889
开源地址:https://github.com/YuyangSunshine/bioprotocolbench

BioProAgent(ACL 2026)论文地址:https://arxiv.org/pdf/2603.00876
基于这两项核心技术,团队自主研发的原生 BIOMA 多智能体系统已深度赋能 AI4S LAB 平台,不仅给 AI 戴上了「安全帽」、装上了「物理双手」,更真正实现了一站式的「干湿闭环」。
BioProBench破局「懂理论、瞎操作」:
当前大语言模型(LLM)在实现自主科学实验时,常常难以掌握生物学协议所需的严格程序逻辑和准确性。微小的误解可能导致实验失败、资源浪费或不安全的实验室条件。为了解决这一基础性挑战,北京大学深圳研究生院 - 科学智能学院的团队推出了 BioProBench,这是一个针对生物学程序性推理的综合性资源。

坚实的生物学语料基座:BioProBench 建立在 BioProCorpus 的基础之上,后者是一个包含 27,000 份人类编写的协议的基础语料库。
海量且严谨的评测体系:研究团队从语料库中系统地构建了一个包含超过 550,000 个任务实例,同时提供了具有新颖指标的严格基准。
直击大模型痛点:通过评估 10 种主流的 LLM,研究发现尽管模型的一般理解能力很高,但在需要深度推理、定量精度和安全意识的任务上,其性能会显著下降。
表 2 和表 3 分别是 10 个主流 LLMs 在 BioProBench 的纠错 ERR 和带有推理的 REA-ERR 任务上的评测结果。

跨越「执行鸿沟」:BioProAgent
在不可逆的物理湿实验环境中,大模型的概率性幻觉不仅仅是「答错题」,更可能直接导致设备损坏或实验彻底失败。为此,该团队进一步提出了 BioProAgent 框架,真正弥合了计算机模拟预测与体外物理实验之间的执行鸿沟。

神经符号双驱动控制:BioProAgent 是一个神经符号框架,它将概率规划锚定在确定性的有限状态机(FSM)中。
物理前置的安全拦截:框架引入了一种状态增强规划机制,强制执行严格的「设计 - 验证 - 纠正」工作流程,确保在物理执行前符合硬件的合规性。
突破长文本上下文瓶颈:通过引入语义符号基础(Semantic Symbol Grounding),该框架成功解决了复杂设备架构中固有的上下文瓶颈,通过符号抽象将 Token 消耗降低了约 6 倍。
绝对的物理合规优势:在基准评估中,BioProAgent 实现了高达 95.6% 的物理合规性,而作为基线的 ReAct 仅为 21.0%。这充分证明了神经符号约束对于在不可逆物理环境中实现可靠的自治是必不可少的。

全链数智化赋能:BIOMA 多智能体系统与 AI4S LAB
在这两项硬核的学术工作之上,研究团队自主研发了 AI4S 原生多智能体系统 ——BIOMA。该系统集成了智能模型、实验设计乃至全流程的资源管理模块,配备了四位「永不疲倦」的 AI 科学家(智能体)。

这四位智能体各司其职,涵盖了理论科学家(PredAgent)、实验规划师(ProAgent)、实验室指挥官(OperAgent)以及数据分析师(ComAgent)。其中,实验室指挥官(OperAgent)更是连接数字与物理世界的关键桥梁,它负责将抽象的实验协议解析并编译为特定自动化硬件平台(集成了超过 22 台套先进设备)可执行的指令序列。
目前,这套架构已全面且深度地赋能北京大学深圳研究生院的 AI4S LAB 平台,构建了全球首个「AI 驱动、干湿闭环、全链数智」的一站式云端科研生态系统。
AI4S LAB 平台地址:https://ai4slab.pkusz.edu.cn/
结语
如《Nature》社论所揭示的,AI 永远不会取代优秀的科学家,但它一定会不可逆转地重塑科学研究的流水线。当科学家的核心使命升华为高维的「判断」与「创新」时,必须有一个绝对可靠的执行系统来承接实验室里的繁杂与精准。
北京大学深圳研究生院 - 科学智能学院团队的这一系列工作,正是为了将科学家从繁重的物理执行中解放出来。他们不仅为科研工作者打造了最强大、最安全的「AI 执行副手」,更为未来全面自动化的科学发现生态构建了坚实的底座。科学的下一步,已经到来。