当AI助手遇上因果推断,谁才该拥有“定案权”?

这项由卡内基梅隆大学与阿布扎比穆罕默德·本·扎耶德人工智能大学联合开展的研究,以预印本形式发布于2026年6月22日,论文编号为arXiv:2606.23608,有兴趣深入了解的读者可通过该编号查询完整论文。

假设你是一位刑警,案发现场留下了许多线索。你有两个助手:一个是经验丰富的法医,能用精密仪器分析血迹、指纹和弹道;另一个是博览群书的顾问,能讲述无数相似案例的故事,提供背景知识。如果你让法医来鉴定证据、得出科学结论,同时让顾问帮你理解案情背景、整理卷宗、解释专业术语——这套搭配天衣无缝。但如果你让顾问来"拍板定案",直接告诉你谁是凶手,而他的依据不过是"这种案子通常都是邻居干的"……那就很危险了。

这正是卡内基梅隆大学研究团队在这篇论文中想要说清楚的事情:在因果发现领域,大语言模型(也就是ChatGPT这类AI)扮演的应该是"顾问"的角色,而不是"法医",更不是"主审法官"。

一、什么是"因果发现",为什么它如此重要

在日常生活中,我们常常分不清"相关"和"因果"。比如,一个城市里冰淇淋销量高的月份,溺水事故也更多——但你不能因此得出"吃冰淇淋导致溺水"的结论,真正的原因是夏天天热,人们既喜欢吃冰淇淋,也喜欢去游泳。找出真正的因果关系,而非表面的相关关系,正是"因果发现"这门学问要解决的核心问题。

回到这位刑警的比喻:因果发现就像从海量的案发现场记录(也就是观测数据)中,严格推断出"谁影响了谁"的真实链条。这件事之所以重要,是因为在基因组学、生态学、神经科学、流行病学等许多科学领域,真正做一次受控实验往往代价极高、耗时极长,甚至在伦理上根本不被允许。你不能随机让一半人去吸烟来研究肺癌,但你可以通过大量观测数据,用因果发现的方法来推断两者之间的关系。

研究团队指出,因果发现领域已经发展出几大方法家族。基于约束的方法,比如PC算法和FCI算法,核心思路是通过检验变量之间的"条件独立性"来排除不可能的因果结构——就像法医通过排除不可能的嫌疑人来缩小排查范围。基于评分的方法,比如GES算法,则是给不同的图结构打分,找出最能解释数据的那一个,就像评审团根据证据质量来为不同版本的案情陈述打分。基于函数因果模型的方法,比如LiNGAM系列算法,利用的是噪声分布和函数形式的不对称性来判断方向——就像通过子弹的飞行轨迹反推射击位置。此外还有处理潜在变量的方法,以及时间序列中的格兰杰因果方法。这些方法各有各的假设前提,没有一种是万能的,选错了假设就可能得出错误的结论。

问题在于,这套方法体系对于没有专业训练的研究者来说门槛极高。一位生物学家可能拿到了一份基因表达数据,却不知道该选哪种算法,也不清楚自己的数据是否满足算法的假设条件,更不知道最后得到的那张图上那些半截箭头到底意味着什么。这就是AI助手有可能大显身手的地方——也是这篇论文要郑重提醒大家警惕的地方。

二、AI助手的"诱惑"与隐患

近年来,研究者们开始尝试把大语言模型引入因果发现的流程。一种思路是直接问AI:"根据这些变量的名字和描述,你觉得A和B之间谁影响谁?"AI凭借从海量文本中学到的知识,给出一个方向判断。另一种思路是把AI的输出作为先验知识或约束条件,塞进统计发现算法里,让算法在AI"认为合理"的结构范围内搜索。

乍一看,这种做法很吸引人。毕竟大语言模型读过无数论文,懂得各个领域的常识,为什么不利用这些知识来加速分析呢?

但研究团队指出了一个根本性的问题:因果发现要找的是数据中真实存在的证据,而大语言模型学的是文本中的规律。当AI说"吸烟导致肺癌",它的依据可能是数以千计的医学文献;但当它说"变量A影响变量B",这个判断背后可能混杂着统计证据、文献知识、训练数据中的措辞习惯,甚至是对某种"听起来合理的故事"的偏好——而这些来源根本无法在事后分开。

把这种混杂的判断植入因果图,得到的结果就像是一份由法医数据和道听途说混合写成的鉴定报告。这张图上某条边的来源,到底是数据中的统计信号、算法的假设约束,还是AI从某篇论文摘要里学来的"常见机制"?没人说得清。这种不透明在因果发现中尤其危险,因为因果结论的价值,恰恰在于你能清楚地知道它的每一步是如何推导出来的。

更麻烦的是,因果发现的结果本来就已经足够复杂、足够容易被误读了。比如一个CPDAG(完全部分有向无环图)并不是一个确定的因果图,它代表的是一整类在统计上等价的因果模型;一个PAG(部分祖先图)也并不是一个完整的因果模型,它表示的是一类可能包含隐变量和选择偏差的模型集合。如果这时候AI用流畅自信的语气给出解读,很容易让人把一个"可能的假设"当成"确定的事实"来接受。

研究团队还特别指出了一类更隐蔽的风险:AI助手可能在流程中悄悄做了一些"小决定",比如默默删掉了某个变量、把文献里提到的一对关系设置为"禁止边"、把某个阈值调低一点让一个潜在变量刚好出现……每一步单独看都像是在"帮忙",但加在一起,算法实际处理的数据和输出的图,已经不再是原来那个严格意义上的因果发现结果了。

三、AI的正确位置:助手而非法官

既然AI不能充当"定案者",那它究竟能做什么?研究团队给出了一个清晰的定位:AI助手应该围绕因果发现的工作流程提供支持,而不是进入推断核心。

具体来说,AI可以在数据理解阶段发挥作用。当研究者上传一份数据集,AI可以调用工具,帮助总结每个变量的含义、检测缺失值的分布情况、标记出可能是唯一标识符或时间戳的列、绘制基本分布图。这类工作类似于案发之前的现场勘查记录工作——整理线索,而不是得出结论。

在数据预处理阶段,AI可以解释不同的处理方式会对后续分析产生什么影响,比如对数据进行标准化、如何处理缺失值、是否需要对某些变量进行离散化……但是,具体选择哪种处理方式,必须由用户来拍板,而不是由AI悄悄决定。每一个预处理步骤都应该是用户有意识做出的决定,而不是AI自动完成的后台操作。

在算法推荐阶段,AI可以扮演一个翻译者的角色。研究者通常清楚自己的科学问题,但未必知道哪种因果发现算法适合自己的数据。AI可以帮助把"我想研究这些基因是否互相影响"这样的科学问题,翻译成"你的数据有没有可能存在隐变量?你的变量是否满足线性非高斯假设?"这样的方法论问题,再推荐合适的候选算法家族,并解释每种方法背后的假设和局限。

在专家知识融入阶段,AI可以通过检索文献、查阅方法文档或调用自身背景知识,为研究者提供领域背景信息。比如说明某个问卷题目的心理学背景,或者提醒某种常见的测量误差模式。这些信息可以帮助研究者更好地理解自己的数据,但它们只是"供参考的背景",而不能直接变成因果图里的一条边或一个约束。任何来自AI的领域知识,如果要进入正式的分析流程,都必须经过用户或领域专家的明确确认。

在结果解读阶段,AI可以帮助把那些复杂的图形符号转化为普通人能理解的语言,解释图上每一个箭头和每一个圆圈的含义,说明哪些结论是方法能保证的,哪些只是条件性的假设。这个阶段尤其重要,因为因果发现的输出本来就很容易被误读,一个好的AI助手能帮助人们保持对结论边界的清醒认识——而不是把一个"在某些假设下成立的推断"包装成一个"铁板钉钉的因果事实"。

研究团队把这套设计原则概括为五个关键词:分离(AI的建议与正式推断核心保持隔离)、可见(所有预处理和假设选择都明确呈现)、可追溯(每一个图上的输出都能追溯到具体的数据、参数和用户决定)、可撤销(用户可以检查并撤销AI辅助的步骤)、用户确认(任何情境知识在进入正式分析前都需要用户明确批准)。

四、causal-learn+:一个把原则落地的平台

为了把上述原则变成可以实际使用的工具,研究团队构建了一个在线平台,名为causal-learn+,可以在causallearn.com上直接使用,不需要安装任何软件,也不需要编写代码。

这个平台建立在causal-learn这个开源Python库的算法生态之上,后者已经在学界积累了相当广泛的关注。causal-learn+支持的方法覆盖了因果发现的几大主流方向:基于约束的方法包括PC、MV-PC(专门处理含缺失数据的情况)、FCI和CD-NOD;基于评分的方法包括GES、DGES、A*、动态规划方法、GRaSP和BOSS;基于函数的方法包括ANM、PNL、LiNGAM全系列(包括DirectLiNGAM、VAR-LiNGAM)以及RCD和CAM-UV;处理潜在变量的方法包括GIN和RLCD;时间序列方向提供线性格兰杰因果方法。平台还内置了多种条件独立性检验方式,包括Fisher z检验、卡方检验、核方法检验(KCI)和G方检验,以及BIC、BDeu和广义评分等多种评分函数。

整个分析流程的设计,像是一条有严格分工的流水线。数据上传之后,AI助手首先帮助用户检视数据的基本情况;接下来,AI协助用户考虑预处理方案,但所有决定由用户做主;然后AI根据数据特征和科学问题推荐候选算法,由用户选择;在此过程中,AI可以检索并展示领域背景知识,但这些知识只作为参考,不自动进入算法;随后,被保护的算法核心开始运行——条件独立性检验、评分计算、图搜索、方向确定,全部由明确的算法完成,没有任何AI参与;最后,AI帮助用户理解输出的图,解释图形标记、总结假设、形成报告。

用一个直观的比喻来理解这套架构:算法核心就像是案件最终的DNA鉴定程序,完全由标准化的科学仪器操作,任何人都不能随意干预;而AI助手则像是案件协调员,负责前期准备、资料整理、沟通翻译和后期汇报,但没有权力修改鉴定结果。

五、大五人格数据的实战检验

研究团队用一个真实的心理学数据集来展示这套框架如何运作,选用的是"大五人格"问卷数据。

大五人格是心理学中一个经典的人格理论框架,认为人的性格可以从五个维度来描述:开放性(对新体验的好奇程度)、尽责性(有条理、守规则的程度)、外向性(善于社交、喜欢与人互动的程度)、宜人性(合作、信任他人的程度)和神经质(情绪不稳定、容易焦虑的程度)。每个维度用10道题来测量,总共50道题。

这个数据集包含接近两万份有效问卷,回答经过缺失值处理后进行标准化分析。数据集本身就已经说明了为什么需要有人引导:用户需要理解每道题的含义、知道如何处理缺失值、要决定是否需要对措辞反向的题目进行反转编码,还要考虑要不要把年龄、性别等人口学变量纳入分析。这些决定每一个都会影响最终的因果图,但没有一个有唯一正确答案。

在这个例子中,因为要处理潜在的隐变量(人格维度本身是不能直接测量的,我们只能观测到问卷回答),研究团队使用了专门处理含有因果相关隐变量的RLCD方法,并辅以GIN方法来帮助确定隐变量之间关系的方向。

得到的因果图显示,与同一个大五维度相关的题目,往往在图上聚集在共同的隐变量周围,这与人格维度作为公共原因驱动一系列特定回答的理论是一致的。同时,图中也出现了隐变量之间的关联,以及部分题目之间的直接联系,这更接近人格研究中"网络视角"的观点——认为人格特质不是独立存在的,而是通过具体的行为和想法相互影响的。比如图中出现了L1→L6→L3和L1→L2→L3这样的隐变量路径,以及O2→O4和O1→O8这样具体题目之间的关联,为领域专家提供了值得进一步探索的假设。

在这整个过程中,AI助手可以帮助整理50道题目的含义、提示哪些是反向编码的题目、解释为什么选择RLCD而不是其他方法、检索大五人格测量的心理学背景知识,以及在结果出来之后,帮助把图上那些以L1、L2这样的代号出现的隐变量,结合题目内容,转化为研究者能够理解和讨论的语言。

但是,AI在这里绝对不能做的事情是:直接把某个隐变量命名为"外向性"并宣称这就是结论;把某条边的方向改成"心理学上更合理"的方向;删掉某些"看起来奇怪"的题目;或者为了让结果看起来更符合大五理论,把某个参数调整一下。这些看起来无害甚至善意的干预,每一个都会让最终的图偏离数据的真实信号,变成AI对心理学的某种主观理解。

六、这套思路的意义与未来

归根结底,这篇论文要表达的观点可以用一句话来概括:AI的流利不等于AI的正确,AI的博学不等于AI的可信。

因果发现这件事,核心价值在于每一步推断都有明确的来源——这个结论来自哪个数据、基于哪些假设、用了哪种算法、通过了哪些诊断检验。这种来源的清晰性,是结论可以被质疑、被验证、被推翻的前提,也是科学的本质所在。一旦把AI的输出混入推断核心,这条可追溯的链条就断了,你面对的就是一张来源不明的图——它可能对,也可能是AI"编"出来的故事。

研究团队对未来工作提出了几个方向。社区需要建立专门的基准测试,来衡量AI助手是否真正改善了数据诊断的质量和算法选择的准确性;需要开发审计追踪工具,把数据、假设、AI建议、用户决定和算法输出作为独立的记录分开保存;需要设计让领域专家在假设进入分析之前给予明确确认的交互界面;还需要评估AI的引导是否减少了用户对部分识别图的过度解读。

更长远地看,研究团队提出了一个更有野心的方向:是否有可能从因果推断的第一性原理出发,训练专门为因果分析设计的基础模型,把显式假设、可识别性条件和失效模式直接内嵌到模型的训练目标里?如果这类模型最终能给出带有形式保证的因果输出,那么AI也许有一天可以更直接地参与因果发现的核心推断。但在那一天到来之前,安全的设计是把今天的AI助手挡在推断核心之外,同时让它把那扇通往核心的大门变得更容易打开、更容易理解、更容易通过。

说到底,这篇论文的核心贡献并不是一个全新的算法,而是一种关于"AI在科学分析中应该扮演什么角色"的严肃思考,并且把这种思考落实成了一套可以实际使用的工具。它揭示了一个容易被忽视的问题:AI越聪明、越流利,就越容易让人忘记它说的不一定是真的。在需要严格证据链的科学推断中,保持对AI输出来源的清醒认识,反而是比利用AI更重要的事情。

对于任何关心"AI能做什么、不该做什么"这个问题的人来说,这篇研究提供了一个难得的具体案例:在因果发现这个对证据严格性要求极高的领域,研究者是如何一步步划定AI与算法之间的边界,并把这个边界落实成可以运行的系统的。如果你想进一步了解这套框架或者亲手试用,可以访问causallearn.com,也可以通过arXiv编号2606.23608找到原论文。

---

Q&A

Q1:因果发现和普通的相关性分析有什么区别?

A:相关性分析只能告诉你两个变量是否有关联,因果发现则要找出谁影响了谁。比如冰淇淋销量和溺水事故都在夏天升高,相关性分析会说两者相关,但因果发现能帮你识别出真正的共同原因是"天气变热",而不是冰淇淋引发溺水。因果发现需要更严格的算法和假设,输出也更有实际指导意义。

Q2:causal-learn+平台上的AI助手为什么不能直接给出因果图?

A:因为大语言模型学习的是文本规律,它的"知识"混合了统计证据、文献印象、训练数据偏差和可能的错误推断。如果把AI的输出直接变成因果图的边或方向,你就无法分辨这条边是来自数据的真实信号,还是AI从某篇论文里学来的"常识",甚至是AI编造的"听起来合理的故事",因果结论的可靠性就失去了保证。

Q3:大五人格数据的因果发现案例中,隐变量代表什么?

A:隐变量是算法在数据中发现的"看不见的共同原因"。在大五人格数据里,外向性、神经质这些人格维度本身无法直接测量,只能从问卷回答中推断。算法发现的隐变量,有些大致对应某个人格维度,有些可能代表多个维度的混合,或者反映答题风格,具体含义需要领域专家结合图的结构和题目内容来判断,不能由AI直接命名为确定的心理特质。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询