如何成为负责人的AI驾驶员:确保科学家搭乘科技发展趋势的五种方法

编辑丨%
20 世纪初,苹果联合创始人史蒂夫·乔布斯将计算机形容为“我们大脑的自行车”。他的灵感来自小时候看到的《Scientific American》 杂志上的一幅图纸,图片显示骑自行车的人比任何动物都更节能。
相比之下,AI 可能被称为飞机更为恰当些——它们比自行车更快,但更难控制,犯错后果可能尤其严重。科学家或将从中获利,因为科学研究究其本质是一场探索未知的旅程,但在全新的工作环境中,挑战与挫折接踵而至。
为了高效且安全地驾驭这新时代的发展工具,学者们需要一套操作手册。真正的问题从来不是机器是否会取代科学家,而是学者们掌握它们时,会成为怎样的存在。
这些表述来自 SciSciGPT 的开发团队,那是一个由多个专业 AI 分工协作进行研究的工作流程。其核心是 ResearchManager 代理。它协调工作流程,将研究人员通过聊天界面输入的自然语言查询划分为任务,然后委派给专门从事文献综述、数据提取或分析的代理。

图 1:SciSciGPT 模块化设计的示意图。
在他们的案例研究中,SciSciGPT 创建了一组大学合作的可视化,并测试论文中的某一图形是否能从其存储库中的数据中复制。它完成这些研究任务的速度更快,结果也比经验丰富的研究人员使用 AI 工具更高效。
在此基础上,该团队总结了从构建一个以研究为导向的人工智能代理中学到的经验教训,以及科学家在使用代理进行科学时应考虑的原则。
协作>自动化
现如今的环境发展趋势其实是将科学研究完全自动化,转向“AI 科学家”或者是“自动实验室”。这些流程可能会让人觉得复杂,但科学并不是流水线,这一切建立在解释、争论与责任之上,人类的判断至关重要。
以牛顿棱镜实验打个比方。一个全自动系统可以进行牛顿棱镜实验,测量白光通过棱镜时的分裂情况,并将这些数据拟合到模型中。但牛顿做了截然不同的事:他颠倒了这一设定,将彩色光束重新组合回白光,果断地表明颜色属于光本身,而非玻璃。

图 2:牛顿棱镜实验。
这一行为——决定一个表面上的异常是现象,而非应消除的错误——是解释上的跳跃,而非计算。自动化工作流程设计上是平滑异常并优化以适应,相比之下,科学家利用了意外的力量。
随着 AI 逐渐成为研究的核心,科学将同时面临技术与公民信任的转折点。在公众对科学信心本已脆弱的时代,正是加强支撑科学基础、通过将透明度、可追溯性和问责性嵌入发现基础设施来更新这一契约的时刻。全面自动化或许能带来一些答案,但会削弱赋予这些答案意义的公信力。
研究团队始终认为,人类科学家应保留对问题框架、验证路径和对结论签署的权威和责任。纵观人类历史,其实不难发现这是一段不断发现的旅程。随着 AI 能够为发现做出贡献,核心问题不再是机器单独能做什么,而是如何设计机器,以保持科学的问责性和可重复性。
速度意味着变革
当失败成本不复往日那般高昂,所有冒险的计划都变得理性起来,过去使得测试曾经过于昂贵或耗时的问题变得切实可行。
基因组学展示了这一转变:解码第一个人类基因组花费了十多年和数十亿美元;如今,测序成本低于 1000 美元,耗时数小时,将该领域从单基因研究转变为对整个基因组的广泛探索。随着转变,带来了新的视角,使研究人员能够看到科学领域中原本难以察觉的联系。
速度也将影响发文的声音。降低的技术门槛和时间壁垒使小型实验室、新手甚至个人研究人员能够完成曾经需要大型团队和数月协调的分析。但加速发现的同样力量也可能放大错误。没有反思的快速科学有可能在大规模上汇聚错误。这进一步凸显了人机协作的重要性,而非完全自动化。
代理应当更专业
SciSciGPT 是一个自然的首个测试案例:科学科学数据丰富,方法论多样,研究发现本身的运作方式。但同样的观点在不同学科中同样适用。每个领域都有其基础——其教材、数据集、工具和标准。
AI 研究代理在不同领域表现不同,但应遵循相同的基本规则:结果应可追溯,方法可验证,职责明确分配。制定这些规则需要多方协调,目标是建立一个共享的公私互作框架——例如,建立日志代理决策的统一标准,使得在一个实验室运行的分析可以被另一个实验室审计或复现。

图 3:一些实验室正试图通过“AI 科学家”从头到尾完成项目来自动化研究工作。
SciSciGPT 团队表明,AI 对于科学的裨益广泛存在于各种学科之中,但他们在分析大学课程大纲时,却察觉到了系统性不匹配:人工智能教育主要集中在计算机科学、数学和工程领域,而那些本可以同样受益的学科——从医学、心理学到经济学——提供的培训远少得多 。
而与这种现象共同存在的,是学术界依然围绕着各系的壁垒组织,随着知识负担的增加,交流的鸿沟逐步加深。科学政策制定者应认识到这些,支持跨学科、促进人工智能专家与领域科学家持续合作的机构式结构。
信任必须树立
自行车与飞机遇难的后果各不相同——这就是人们在 AI 代理面前面临的规模差异。当 AI 发展,失败不仅会给单个研究者带来不便;它们可能误导领域,转移资金,削弱公众对科学的信任。
大型语言模型(LLM)的一个关键优势是它们能够写作。这意味着 LLM 可以用纯文字记录所做的一切。在 SciSciGPT 项目中,系统生成的每一步、每行代码和每一个决策都被 LLM 自动记录。结果是大量数据,但却具有变革性。即使其中最优秀的学生做实验,也无法期望看到或重建每一步操作所导致的结果。
但这也带来了另一个问题:信息过多。
正确的设计可以包括结构化的来源,突出决策的初衷,而不仅仅是做了什么,并通过分层总结,使关键偏差和决策一目了然。
想要足够的透明度?那可能需要自行构建。AI 需要配备严谨的科学来源记录和审计追踪工具。如果做得好,AI 代理能为科学最深层的挑战之一——可重复性——提供强有力的回应。
AI 带来的机遇
飞机带来了对飞行员的需求,AI 自然也是。
AI 代理人可能会提出一些想法——无论是理论构建、异常显现还是假设设计——起初看起来很陌生。问题在于科学家是否受过训练,将这些视为噪音,还是从中学习。结果可能是人机共进化:适应最快的科学家可能成为明天发现的节奏。
但这对科学家和整个科学界都构成风险。对科学家来说,风险在于技能流失。借助 GPS 导航工具开车很方便,但会让司机对路线记忆变得模糊。智能体可能让研究人员提高生产力,但却让他们对挑战 AI 的准备不足。
相关链接:https://www.nature.com/articles/s41586-025-09922-y
在这种环境下,如果许多研究者依赖相同的药物堆栈,科学就面临同质化的风险。人们时常担心,虽然 AI 可能提升个体的质量或表现,但可能会减少集体多样性。除非研究者们有意抵消,否则产出将会极大程度上趋于收敛。
从长远来看,设计多样化的思维和方法至关重要,这需要培养多种模型——采用不同的框架或思维方式——从多元视角和奖励异议的制度规范来解决问题。
重塑科学视角
像 SciSciGPT 这样的系统仍然模仿当前的发现模式,加快了其进程,拓宽了所提问的问题范围。但人类与 AI 共发现的未来不必遵循熟悉的形式。
比如,当钢筋混凝土出现时,建筑师最初用它们模仿砌体,将新结构隐藏在旧设计背后。真正的突破在于他们认识到墙壁不再需要承重:建筑物可以被玻璃包裹,催生了纽约联合国秘书处和巴黎的维尔之家等现代主义标志。
这是一种重要的思想转变,在逐渐充满 AI 代理的当下必须牢记。
还记得 SciSciGPT 团队打的两个比方吗?将交通成本与体重进行对比,显示骑自行车的人站在底部——最高效的移动者。坐飞机却是:成本高昂、效率低下却大胆,开辟了曾经难以想象的领域。前者提醒我们要设计以效率和超越为目标;后者则警示一套完善的信任体系与操作规则的必要性