东南大学与北京中关村学院揭开AI“先见之明”的秘密

这项由东南大学、北京中关村学院与昆山杜克大学联合开展的研究,于2026年6月发表于arXiv预印本平台,论文编号为arXiv:2606.00644。感兴趣的读者可以通过该编号检索到完整论文。
一、为什么需要一个"先见之明"的测试?
每一位在科研领域工作过的人都会遇到这样的困境:面对一堆已知的研究成果,如何判断接下来哪个方向最值得花六个月时间深耕?哪个技术卡口一旦突破,就能打开一片新天地?这类决定不是查阅文献就能找到答案的,它需要的是一种从已有线索中推断未来走向的能力——姑且称之为"科研先见之明"。
当前,人工智能辅助科研工具正以惊人的速度渗透进实验室日常。从自动整理文献到生成研究方案,AI助手越来越频繁地参与到科研决策的链条中。然而,一个关键问题始终没有得到正面回答:这些AI系统到底能不能凭借历史证据,对尚未发生的科研走向做出靠谱的判断?
研究团队注意到,现有的评测基准几乎都在考察AI系统的"事后理解"能力,也就是能不能检索到已知论文、回答已知问题、执行已知流程。没有任何测试系统地考察过:给定一个特定历史时间点之前的所有文献,AI能否像一位有经验的科研人员那样,做出合理的前瞻性判断?
正是为了填补这个空白,研究团队构建了ForeSci,一个专门用来评估AI科研代理(也就是具备自主行动能力的AI系统)能否做出前瞻性科研判断的基准测试平台。
二、ForeSci是什么?一个模拟"只知道过去"的测验考场
理解ForeSci最好的方式,是把它比作一场特殊的考试。在这场考试里,考官会对考生说:"现在是2025年9月30日,我只会给你那天以前发表的论文,然后问你一些关于未来走向的问题。你的答案会等到未来真正发生之后,再来对照评分。"
这个设计抓住了前瞻性科研判断的核心挑战:你不能偷看答案,但你必须给出有理有据的判断。
ForeSci覆盖了四个快速演进的AI研究领域,分别是大语言模型智能体(可以理解为能自主执行复杂任务的AI)、大语言模型微调与后训练(让AI变得更听话、更专业的技术)、检索增强生成与信息检索(让AI能从外部知识库中找到相关信息再作答的方法),以及视觉生成建模与扩散模型(能够生成图片、视频等内容的AI技术)。这四个领域共同构成了500道考题,分布在四种不同类型的科研决策任务中,每种类型各125道题。
配合每道题的,是一套"截止日期对齐的线下知识库",也就是那道题对应时间点之前所有可用的论文。截止日期之后的论文对AI系统完全隐藏,只用于最终评分。此外,研究团队还特别挑选了在截止日期之前就已完成训练的AI语言模型作为测试对象,从根本上杜绝了AI通过自身记忆"偷看"未来信息的可能。
三、四种科研决策任务:不同角度的"先见之明"
为了让测试更贴近真实的科研决策场景,ForeSci设计了四种风格迥异的任务,每一种都考察不同维度的前瞻判断能力。
第一种叫做方向预测,考的是眼光。给AI一组候选研究方向,以及截止日期前的所有相关信息,然后问:这些方向中,哪一个最有可能在接下来的一段时间内加速发展?这就好像让一位股票分析师在只掌握历史数据的情况下,判断哪只股票最有可能在下个季度大涨。
第二种叫做瓶颈与机会发现,考的是诊断能力。给AI一个特定的研究子方向,问它:当前这个方向最根本的技术瓶颈是什么?如果这个瓶颈被攻克,会打开怎样的一步之遥的新机会?这类问题类似于让一位机械工程师在检查完发动机之后,指出最关键的磨损部位,并预判修好之后能解锁什么新功能。
第三种叫做战略研究规划,考的是统筹能力。给AI一套候选研究方向,以及一个假想团队的资源限制,要求它按优先级排列这些方向,并给出六个月的行动路线图。这一任务的难度在于,不仅要理解每个方向的潜力,还要考虑依赖关系、可行性和风险,就像一位项目经理在有限预算下编排多个并行任务的顺序。
第四种叫做场馆感知研究定位,考的是社区敏感度。给AI一篇拟议中的论文摘要,要求它判断这篇工作最适合投向哪个国际学术会议,并解释为什么在这个会议的审稿人面前,这项工作会受到认可,同时还需要指出潜在的被拒风险和可以加强的证据。这就像是让一位老编辑看完一篇文章草稿后,判断它更适合刊登在时尚杂志还是财经周刊,并给出具体的修改建议。
四、知识库是怎么搭建的?一棵会生长的研究地图
为了保证每道题都有坚实的历史证据支撑,研究团队花费了大量精力构建"时间锁定知识库"。他们从arXiv预印本平台批量爬取候选论文,通过Semantic Scholar丰富元数据,去除重复项,再经过两轮筛选。第一轮筛掉那些只是在表面上使用了相关词汇但内容并不真正属于目标领域的论文,第二轮进一步识别出具有核心贡献价值、能对未来研究走向提供有用信号的"骨干论文"。最终,四个领域的知识库分别包含了2769、2131、767和913篇文章。
然而,光有论文还不够。研究团队还基于这些文献构建了一棵随时间生长的"研究分类树",借助一个名为TaxoAdapt的工具,自动从文献中归纳出研究子方向,并用"延伸""适配""替换""竞争"等关系连接不同的技术节点。这棵树会随着时间推移不断生长,每一个树节点都对应着一批截止日期前可见的论文,记录着这个子方向在那一时间点之前面临的问题、采用的方法、评测重心和局限性。
从这棵"研究地图"中,研究团队进一步提炼出若干高层次信号,包括候选研究方向、方法演化脉络(即某个技术是如何一步步从上一代方法演化而来的)、瓶颈信号(哪些局限性在多篇论文中反复出现)、可行性与依赖关系注记,以及各个学术会议的社区画像。所有这些结构都先由AI系统从截止日期对齐的文献中提取,再由人类专家核查时效性和支撑强度,最终才被用于生成考题。
五、如何评判答案的好坏?四把不同尺子
评判一个前瞻性科研判断的质量,远比评判一道选择题复杂得多。研究团队为此设计了四个互补的评分维度,每一个维度都从不同侧面衡量答案的质量。
第一个维度叫做预测事实性。具体做法是把AI的回答拆解成一个个独立的、最小化的事实性陈述,再把这些陈述与来自截止日期之后真实论文的"事实验证库"进行核对,最终计算一个类似精确率与召回率调和平均数的F1得分。这就像核查一篇新闻报道里每一句话的准确性,既要确保说出去的每句话都有来自未来的证据支持,也要确保重要的未来事实没有被遗漏。
第二个维度叫做未来目标对齐度。对于方向预测和瓶颈发现这类任务,评分系统会把AI预测的方向或瓶颈与来自截止日期之后真实演变轨迹所归纳的"目标槽位"进行语义相似度比对,用的是一个叫做bge-m3的文本嵌入模型。对于排序类的任务(研究规划和场馆定位),则直接比对AI给出的排名与标准答案排名的一致程度,综合考察最高优先项是否匹配、各项位置是否准确、两两顺序关系是否保持。
第三个维度叫做证据可追溯性,专门用于评判AI系统有没有真正用上截止日期前的文献来支撑自己的判断。评分员会检查三个方面:AI的主要论断有没有明确关联到具体的论文或证据片段,关联的证据有没有足够的判别力(而不是泛泛的主题相关),以及答案中从证据到结论的推理链条有没有隐性跳跃。这个维度只适用于那些有外部检索支撑的系统,对于直接用AI语言模型本身作答、不调用外部知识库的基础版本则不适用。
第四个维度叫做审稿人说服力。这个维度让另一个大语言模型扮演"虚拟审稿人"的角色,根据任务类型专用的评分表,从决策清晰度、机制推理质量、比较推理质量、清晰度和风险意识等多个子维度给出综合打分。由于这个维度依赖大语言模型的判断,存在一定的随机性,研究团队因此采取了多次重复评分取平均值的策略,以量化其波动范围。
六、测了什么样的AI系统?五种不同"配置"
研究团队没有只评测一种AI系统,而是在四种不同的基础语言模型上,分别测试了五种不同的工作方式。
基础语言模型直接作答的方式是最朴素的"原生LLM"配置,就是直接把问题扔给AI,让它凭自身学到的知识作答,不提供任何外部检索支持。这是基准线。
第二种配置叫做混合检索增强生成,即在AI作答之前,先通过稀疏检索(类似关键词搜索)和密集检索(基于语义相似度的向量搜索)两种互补方式,从知识库里捞出最相关的文献片段,然后连同问题一起喂给AI。这好比考试之前允许翻开参考书,但书的内容被严格限定在截止日期之前。
剩下三种配置模仿了真实世界中已有的科研代理系统,分别是CoI风格(灵感来自"想法链"系统,侧重通过多步骤推理链条生成和筛选研究思路)、ResearchAgent风格(模拟能自主规划评审流程、生成结构化科研方案的代理系统)以及ARIS风格(模拟能做科研工作流中多环节任务的前沿代理平台)。这三种系统都被严格改造,使其只能调用截止日期对齐的本地知识库,不能联网搜索任何额外信息。
测试所使用的四种基础语言模型分别是Qwen3-235B(2025年4月29日发布)、GPT-5.2(知识截止日期为2025年8月31日)、GLM-4.6(2025年9月30日发布)以及Gemini-3(知识截止日期为2025年1月),全部在对应测试任务的截止日期之前完成训练,从而确保不存在信息泄漏。
七、测试结果告诉我们什么?"能检索"不等于"能判断"
研究结果呈现出一幅耐人寻味的图景。从整体来看,具有代理风格的系统在证据可追溯性和预测事实性这两个维度上,普遍优于直接作答的基础语言模型和简单检索增强生成系统。换句话说,当AI系统有了更有组织、更有结构的检索和推理流程,它确实能更清楚地展示"我的判断是基于哪些文献的哪些内容",同时在事实准确性上也有所提升。
然而,这种提升并不均匀,也并不必然转化为更好的整体判断质量。在审稿人说服力这个维度上,代理风格系统的优势并不稳定——有些时候,组织良好的检索结构反而给最终答案引入了杂音,让输出显得结构僵硬而缺乏洞见,拉低了审稿人给出的综合评分。更值得注意的是,没有任何一种方法能在所有基础模型、所有任务类型和所有评分维度上同时占据最优位置。这意味着"更好的AI科研代理"这件事,没有放之四海而皆准的解法。
从单项任务来看,战略研究规划是最难的任务类型:预测事实性低分率高达0.315,未来目标对齐度低分率更是高达0.512。原因并不难理解——这类任务要求AI给出一个全局排序,只要最高优先项判断错误,整个方案的逻辑都会出现系统性偏差,而不像单个方向预测那样可以允许局部误差。场馆定位和瓶颈发现任务则呈现出不同的失败模式,前者的失败往往源于检索到的证据缺乏足够的会议社区特异性,后者的失败则更多来自对因果角色的错误归因。
八、最关键的发现:证据与决策之间的"脱钩"
这项研究最具诊断意义的发现,可以用"证据-决策脱钩"这个词来概括。研究团队通过系统性的错误分析,识别出了四种典型的"答案漂移"模式。
第一种叫范围与粒度漂移,指AI的回答讨论的是一个相关的研究方向,但精度层级不对——比如问题问的是某个具体的技术改进路线,AI给出的却是这个方向上游的一个更宽泛的大类别。
第二种叫因果角色漂移,指AI对某个技术因素的归因出了偏差——比如把一个"被解锁的机会"错误地当成了"根本性瓶颈"来描述,方向没错但因果结构反了。
第三种叫干预模式漂移,指AI识别出了正确的问题领域,但推荐的解决路径类型不对——比如标准答案要求的是"改变训练目标",而AI给出的却是"优化系统集成",同是改进方案,但方向完全不同。
第四种叫时间视野漂移,指AI的判断落脚在了错误的成熟度阶段——比如题目问的是近期可落地的机会,AI给出的却是一个更长远的愿景目标。
研究团队对这四种漂移的严重程度进行了量化评分,并计算了每种漂移对各评分维度的影响。结果显示,因果角色漂移会让预测事实性得分下降1.13个标准差,范围漂移和干预模式漂移则分别让未来目标对齐度下降1.22和1.12个标准差。
更令人印象深刻的是,研究团队还专门检验了"高证据可追溯性但低未来目标对齐度"的案例。在所有高可追溯性答案中,那些同时具有低对齐度的答案,在四种漂移维度上的严重程度都显著高于那些高可追溯性且高对齐度的答案。一个具体例子是:某Gemini-3 ARIS系统的答案在一道场馆定位题上获得了0.920的超高可追溯性得分,但预测事实性仅有0.200,未来目标对齐度只有0.355。这个系统引用了大量正确的历史文献证据,论证逻辑也看起来通顺,但它最终给出了"投NeurIPS最合适"的建议,而标准答案是"投ACL/EMNLP最合适"——因为这项工作的核心定位是语言模型的后训练与对齐,而不是泛化的强化学习方法论。
这个发现揭示了一个此前没有被专门研究过的失败模式:AI系统可以非常有说服力地"从A引向B",但如果一开始对研究对象的定性就出了偏差,那么无论后续的推理多么流畅,最终的判断仍然是错的。
九、预见未来的展望:这个框架还能继续用
ForeSci不仅仅是一套存档式的测试题库。研究团队特别强调,整套构建流水线支持持续刷新。他们在论文发布时,已经以2026年5月15日为截止日期,针对LLM智能体领域生成了12道预测题,覆盖四种任务类型,预测窗口为2026年5月16日至8月15日。由于目标结果尚未发生,这12道题没有评分,但展示了这套机制作为实时科研预测工具的可行性——每当新文献积累到足够数量,就可以用同一套方法生成新一批前瞻性考题,并在未来到来之后对答案质量进行验证。
从更宏观的角度看,这意味着ForeSci可以成为一个持续运行的"AI科研代理能力监测站",随着人工智能研究本身的演进,不断测量这类系统的科研决策能力是否真正在提升。
研究团队也坦诚地指出了这项研究的局限。ForeSci目前只覆盖了四个快速演进的AI细分领域,研究结果反映的是在这一受控基准环境下的特定表现,不宜直接推广为所有科学领域AI代理的通用排名。此外,评测主要依赖截止日期后的学术论文作为验证基准,无法捕捉那些存在于非正式渠道中的社区共识、未公开工作或私下的审稿偏好。场馆定位和战略规划这两类任务本身就具有偏好敏感性,不同人可能有不同但同样合理的判断,因此这套框架更适合用来比较失败模式和证据使用方式,而不是认定唯一最佳答案。
说到底,这项研究最核心的贡献不是告诉我们哪个AI最聪明,而是揭示了一个以前没人系统量化过的能力缺口:AI系统可以把文献检索做得很好,把推理链条写得很漂亮,但在"把证据转化为正确的研究判断"这件事上,它们仍然容易出现系统性的方向性错误。
归根结底,科研先见之明是一种需要理解研究社区文化、技术演化逻辑和资源约束三者交汇的能力,而不只是把相关论文找齐、逻辑写通顺这么简单。当我们越来越多地让AI系统参与到科研决策链条中时,这种区别就变得至关重要。ForeSci提供了一个量化这种区别的工具,也为未来改进这类系统指出了一个具体的方向:不是让AI检索更多,而是让AI在把证据转化为判断时,不再悄悄地把根本问题的角色、层级和时序搞错。有兴趣深入了解这项研究的读者,可以通过arXiv编号2606.00644查阅完整论文。
Q&A
Q1:ForeSci基准测试和普通的AI文献问答测试有什么本质区别?
A:普通的AI文献问答测试考察的是AI系统能否从已有文献中找到正确答案,属于"事后理解"能力。ForeSci的核心不同之处在于它模拟了一种"信息封锁"的情景:给AI一个特定历史时间点之前的所有文献,然后要求它对那个时间点之后才会发生的科研走向作出判断,而真正的评分要等到未来真实发生之后才能进行。这考察的是从历史证据推断未来方向的"前瞻性判断"能力,而非单纯的信息检索能力。
Q2:证据-决策脱钩是什么意思?为什么这个发现很重要?
A:证据-决策脱钩描述的是这样一种失败模式:AI系统引用了真实且相关的历史文献证据,推理链条看起来也很通顺,但最终给出的科研判断方向是错误的。这种错误很难从表面察觉,因为答案看起来有理有据。研究发现,这种情况在高可追溯性但低目标对齐度的答案中尤为突出,说明"检索能力强"和"判断能力强"是两件不同的事,不能用前者替代后者来评估AI的科研决策价值。
Q3:ForeSci测试的四种任务类型中哪个最难,为什么?
A:战略研究规划是最难的任务类型,预测事实性低分率达到0.315,未来目标对齐度低分率更高达0.512。原因在于这类任务要求AI给出一套全局优先级排序,一旦最高优先项判断错误,整个方案的逻辑就会出现系统性偏差。而方向预测类任务只需要判断单个方向的走势,局部误差的代价相对可控。此外,战略规划还要同时考虑依赖关系、可行性和资源限制,信息维度更复杂,错误的早期假设会被放大成整套错误方案。