伊利诺伊大学厄巴纳-香槟分校:让AI多想几遍,反而可能越想越错

这项由伊利诺伊大学厄巴纳-香槟分校研究团队完成的研究,于2026年6月以预印本形式发布,论文编号为arXiv:2606.28661,题为《当更多采样适得其反:测试时扩展的众数上限与相关性上限》。

你有没有遇到过这样的场景:在一道选择题上反复纠结,把四个选项看了又看,最终反而把原本正确的答案改掉,选了一个错的?这种"想多了反而出错"的现象,不只发生在人类身上,也同样困扰着如今最先进的AI推理系统。而这篇研究,就是专门来解剖这个问题的。

研究团队提出了一个核心命题:当我们让AI对同一道题反复作答很多次,并从中挑选答案时,多做几次真的会越来越准吗?答案出人意料——不,到了某个点之后,做再多次都没用,甚至会更糟。为了把这件事说清楚,研究团队引入了两个核心概念:**众数上限**(modal ceiling)和**相关性上限**(correlation ceiling),并用严谨的数学推导和真实数据验证了这两个上限的存在和位置。

这项研究的意义在于,它揭示了AI推理系统一个长期被忽视的根本瓶颈——不是"能不能生成正确答案",而是"能不能认出哪个是正确答案"。这对AI系统的设计、评测以及计算资源的分配,都有直接的实践影响。

---

一、AI答题的方式:反复抽签,然后投票

要理解这篇研究,先得了解现代AI推理系统的一种常见工作方式。

当一个AI系统面对一道难题时,它不一定只给一个答案。更常见的做法是:让它对同一道题独立作答很多次,比如100次、1000次,然后从这堆答案里挑一个最终答案。这种方法叫做"测试时扩展"(test-time scaling),核心思路是:答的次数越多,总有一次能蒙对,胜算自然更高。

这就像你参加一个多选题考试,规则是可以反复填写答题卡,只要有一次写对了就算通过。你当然会尽可能多填几次。研究人员把这种"至少有一次答对"的概率叫做**覆盖率**(coverage),它确实会随着作答次数的增加而不断上升,这一点毋庸置疑。

但现实部署中的AI系统不是这样运作的。它必须最终给出一个答案,而不是把100个答案全塞给用户。那怎么从一堆答案里挑一个?最常见的做法是**多数投票**,也就是哪个答案出现次数最多,就选哪个——这叫做"自洽性"(self-consistency)方法。

问题就出在这里。假设一道难题,AI作答了100次,其中有3次答对了,但有40次给出了同一个错误答案。多数投票会选出那个出现40次的错误答案,而3次正确答案则被淹没其中。不仅如此,当你继续作答到1000次时,那个错误答案可能出现了400次,正确答案依然只有零星几次——投票结果不会改变,反而会以更高的"自信心"给出错误答案。

研究团队把覆盖率(能不能找到正确答案)与选择准确率(能不能挑出正确答案)之间的差距称为**可识别性缺口**(identifiability gap)。覆盖率一直在攀升,选择准确率却早早撞上了天花板,两条曲线之间那片空白,就是AI"能生成却无法选出"的答案区域。

---

二、第一道墙:当投票结果彻底固定下来

研究团队用一个精确的数学命题描述了投票结果的固化过程。

对于一道固定的题目,AI每次作答都会生成一个答案字符串。所有可能的答案字符串构成一个分布,其中出现频率最高的那个答案叫做**众数**(mode)。根据概率论中的大数定律,当你抽取的样本足够多时,每个答案出现的频率会越来越接近其真实概率,而频率最高的答案——也就是投票结果——会越来越稳定地收敛到那个众数。

这意味着:一旦作答次数足够多,投票结果就彻底锁定了。对于众数恰好是正确答案的题目,多投票是好事;但对于众数是错误答案的题目,继续投票只会更加坚定地得出错误结论。这个固化的上限就叫做**众数上限**(modal ceiling)——它是由"AI最常给出的答案是否恰好正确"所决定的,与你投了多少票毫无关系。

具体来说,在一个基准测试中,所有题目的众数上限平均值就是**众数命中率**(modal-hit rate,πmode)——即在所有题目里,AI最常给出的答案恰好是正确答案的比例。一旦达到这个上限,再多的样本只是在浪费计算资源,或者让系统更加自信地犯错。

研究团队在Beeching等人发布的真实数据集上验证了这个预测。该数据集包含500道数学题(MATH-500),使用Llama-3.2-1B-Instruct模型,每道题各作答256次。结果显示:覆盖率攀升到了0.88(十道题里有近九道至少有一次答对),但多数投票的准确率只有0.45(只有不到一半的题目投票结果是正确的),而且在大约64次之后就几乎不再变化。这256次作答里,每道题平均只产生了约13种不同的答案,而不是256种——答案分布极度集中,投票结果早早就固定了。

这个发现还揭示了一个更微妙的现象:在这0.45的选择准确率中,有相当一部分来自于那些AI正确率不足50%的难题——也就是说,AI在这些题上答对的次数比答错的少,但因为错误答案分散在许多种错法上,正确答案反而是出现最多的单一答案,从而成为众数。这说明众数上限比单纯的"多数投票能不能超过50%"要宽裕得多。

---

三、第二道墙:重复做题不等于学到更多

除了投票结果固化这个问题,研究团队还发现了另一个完全独立的上限,这个上限与评估AI在一批题目上的平均准确率有关。

考虑这样一个情形:为了测量AI的数学能力,你让它对某道题做了一万次,统计答对的比例。你会认为这比只做一次要更精确得多,毕竟样本量大了一万倍。但研究团队指出,这个直觉是错误的。

原因在于,这一万次作答都是同一个AI、同一道题、同样的条件下产生的,它们之间并不是相互独立的。这就像调查一个家庭里所有成员的政治观点——如果家庭成员之间相互影响,那么问了十个人,并不等于你获得了十个独立的意见,实际信息量可能只相当于两三个独立个体。

这种相关性在统计学中用**组内相关系数**(intraclass correlation,简称ρ)来衡量。ρ越大,意味着同一道题的多次作答越"雷同",实际携带的独立信息就越少。研究团队借用了经典调查统计学中的"设计效应"(design effect)概念,把n次相关作答等效换算成了**有效样本数**(neff):

neff = n ÷ [1 + (n-1) × ρ]

当n趋向无穷大时,这个公式的极限是1/ρ。这就是**相关性上限**(correlation ceiling):无论你做多少次,所获得的有效信息量永远不会超过1/ρ个独立样本。

用一个具体数字来感受这件事:如果ρ = 0.1(同一道题的多次作答之间有10%的相关性),那么相关性上限就是10。这意味着,你对一道题做了一百次、一千次,甚至一万次,从统计意义上获得的精度等价于大约十次独立作答——第一万次作答带来的额外信息,约等于第十次作答的百万分之一。

研究团队在Brown等人发布的大规模数据集上检验了这一点。该数据集涵盖GSM8K(小学数学应用题)和MATH(竞赛数学题),使用Llama-3系列模型,每道题各作答一万次。结果发现,不同题目之间的难度差异导致的组内相关系数约为0.4到0.6。换算下来,一万次作答的有效样本数大约只有2——也就是说,为了估计模型在某道题上的真实准确率,花费一万次作答的计算资源,实际上只换来了约等于两次独立作答的统计精度。

这个上限与选择准确率无关,它是专门针对"用重复作答来估计准确率"这件事的。研究团队特别强调,这两个上限——众数上限和相关性上限——是完全不同的东西,分别约束不同的目标,必须分开理解。

---

四、难题堆里的另一个规律:越难的题,覆盖率涨得越慢

前面讲的两道墙都是关于"选答案"和"评估准确率"的,那么覆盖率本身有没有上限?

研究团队指出,覆盖率在数学上是没有"重复作答"上限的——只要一道题对AI来说不是完全不可能解出,那么只要作答次数足够多,总会有一次答对,覆盖率会趋近于1。但问题在于,这个趋近过程可以非常漫长。

这里涉及到题目难度分布的问题。如果所有题目对AI来说难度相同,覆盖率会像"抛硬币"一样以指数速度上升——每多作答一次,没答对的概率就乘以一个小于1的常数,所以会越来越快地接近100%。但现实中,不同题目对AI来说难度差异极大:有些题十次里能答对九次,有些题一万次里也只偶尔对一次。

当题目难度分布呈现出这种"长尾"特征时(即有大量极难的题目),覆盖率的上升速度就会从指数型变成**幂律型**(power law)——也就是每多作答十倍,覆盖率只上升固定的一小段,而不是以固定比例压缩剩余未覆盖的空间。

研究团队用贝塔分布(Beta distribution)对难度分布建模,推导出了覆盖率趋近上限的速度为n的负α次方,其中α由难度分布的形态决定。这与Brown等人发表的实验数据吻合——他们在四个数量级(1次到一万次)的作答范围内,观察到覆盖率在对数坐标轴上呈现近似线性的缓慢上升,这正是幂律型收敛的特征。

还有一种更极端的情况:如果某些题目对AI来说根本不可能答对(比如超出模型能力范围的题目),那么这些题目的"可达率"为零,覆盖率永远无法越过这个硬性边界,无论作答多少次。这是模型能力本身的极限,不是采样策略能弥补的。

---

五、为什么同一道题多次作答会"雷同"?

讲到这里,你可能会好奇:明明每次作答都是随机生成的,为什么还会有相关性?

研究团队用了一个非常直观的框架来解释这件事。他们把AI的每次作答想象成这样一个过程:AI内部对每道题有一个隐藏的"擅长程度"θ,每次作答就像以θ为成功概率抛一枚硬币。不同题目的θ不同:有的题θ = 0.9,十次里九次对;有的题θ = 0.05,二十次里才有一次对。

这个框架来自统计学中的德芬内蒂定理(de Finetti's theorem):只要假设多次作答是"可交换的"(即换个顺序不影响概率分布),就可以用这种混合模型来表示。而θ的方差除以s(1-s)(其中s是平均正确率)就是组内相关系数ρ。

从这个角度看,ρ反映的主要不是"同一道题的多次作答相互影响",而是"同一道题的多次作答都受制于这道题本身的难度"——它们的命运被这道题的θ绑在了一起。研究团队用Beeching等人的五轮独立实验数据验证了这一点:重新跑一遍同样的模型,题目的θ几乎没有变化(不同轮次之间的组内相关系数ρw约为0.0007,接近于零),说明题目难度是稳定的,而不同题目之间的难度差异(ρb约为0.4)才是造成相关性的主要来源。

---

六、三个目标,三种停止时机

研究团队把这一切整合成了一个实用的决策框架。他们指出,"重复作答"在三种不同目标下的效用衰减速度完全不同,因此最佳停止时机也不同。

评估AI在一批题目上的平均准确率,这是最快触达上限的目标。由于难度差异导致的组内相关系数约为0.4到0.6,每道题只需大约2次作答(即1/ρb)就能获取几乎全部的统计信息,多做一千次并不比多做两次强多少。正确的做法是:与其对同一道题反复作答,不如把计算资源分配到更多不同的题目上。

挑选一个答案用于实际输出,这是中等速度触达上限的目标。投票结果收敛的速度取决于答案分布的集中程度——如果一道题只有十几种不同答案,那么大约十几到几十次作答就足以让投票结果稳定下来。继续作答不会改变投票结果,只会强化现有的选择。如果想提高这个上限,核心手段是让答案分布更分散(比如调高随机性参数、使用更多样化的提示方式),而不是增加作答次数。

找到至少一个正确答案供验证器筛选,这是唯一没有重复作答上限的目标。只要有一个外部工具能判断哪个答案是对的(比如代码测试器、数学证明验证器),那么每一次额外作答都有概率贡献一个新的正确答案,覆盖率会持续上升,计算资源的投入是真实有效的。

这三个目标对应的最佳资源分配完全不同,但它们共享同一批作答样本。研究团队提供了一个可操作的公式:从已有的作答日志中估算ρ,计算出有效样本数neff,就能知道当前的采样预算有多少是真正有用的,何时继续作答已经是在浪费资源。

---

七、如何测量这道墙的高度?

研究团队还给出了一个实用的估算方法,让任何人都能从手头的数据中读出这些上限。

估算组内相关系数ρ的方法很简单:假设你有M道题,每道题各作答ni次,其中答对了ci次。计算每道题的答对比例pi = ci/ni,然后比较不同题目之间的方差(题目间差异)与同一道题不同次作答之间的方差(题目内差异)。前者越大、后者越小,就说明题目间难度差异越大,ρ就越高。具体公式使用统计学中的方差分析估算器,研究团队在论文附录中给出了完整推导。

有效样本数neff = n ÷ [1 + (n-1) × ρ],上限为1/ρ。这个数字告诉你:你用n次作答实际上获得了多少独立样本量的信息。研究团队建议在报告任何基于重复采样的AI评测结果时,都应该在名义样本数n旁边附上这个有效样本数neff,以及相关性上限1/ρ,这样读者才能真正理解这个评测结果的可靠程度。

---

归根结底,这项研究传递了一个清醒的信号:计算资源不是免费的,多花不一定多得。覆盖率的上升令人振奋,但它描述的是"AI能生成什么",而不是"AI能交付什么"。真正决定AI系统实际表现的,是它能不能把正确答案排在第一位——而这个能力,不会随着作答次数的增加而自动提升。

当你下次看到某个AI系统宣称"经过N次采样后准确率达到X%",不妨问一句:这N次里,有效样本数是多少?投票结果在第几次就已经固定了?计算资源花在了真正有用的地方吗?这篇研究给了你追问这些问题的工具。

有兴趣深入探讨这些数学细节的读者,可以通过论文编号arXiv:2606.28661查阅完整论文。

---

Q&A

Q1:AI重复作答的"覆盖率"和"选择准确率"有什么区别?

A:覆盖率是指在所有作答中至少有一次答对的比例,它会随着作答次数增加而持续上升。选择准确率则是指最终投票选出的答案是否正确,它受制于"众数上限"——一旦作答次数足够多,投票结果就固定在出现最多的答案上,如果那个答案是错的,继续作答只会更自信地给出错误结论。两者之间的差距就是模型"能生成却无法选出"的答案区域。

Q2:组内相关系数ρ越大,意味着重复作答越没用吗?

A:是的。ρ反映的是同一道题多次作答之间的相似程度,主要来源是不同题目之间的难度差异。ρ越大,有效样本数的上限1/ρ就越低。比如ρ = 0.5时,无论作答多少次,所获得的统计信息等价于最多2次独立作答。实测数据显示,主流数学基准测试的ρ约为0.4到0.6,意味着一万次作答的实际信息量约等于两次独立作答。

Q3:想提高AI投票选答案的准确率,应该怎么做?

A:根据研究结论,增加作答次数并不能提升投票准确率,因为投票结果会收敛到固定的众数。真正有效的手段是让答案分布更分散,比如调高生成时的随机性参数(温度)、使用不同的提示方式、混合使用多个不同模型——这些方法能让答案分布更均匀,减少错误答案的集中优势,从而提高正确答案成为众数的概率。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询