威斯康星大学:当AI团队一起工作时,它们竟然懒得互相了解彼此

这项由威斯康星大学麦迪逊分校与加州大学圣塔芭芭拉分校联合完成的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.11250v1,有兴趣深入了解的读者可以通过这个编号在arXiv平台查询完整论文。

假设你是一家公司的项目经理,手下有十位顾问,每位顾问擅长的领域各不相同。你今天接到一个棘手的任务,需要找一位最合适的顾问协助你完成。理智告诉你,在没有充分了解每位顾问能力之前,应该多试探几个人,再决定长期合作的对象。然而,你却在第一天就把所有问题都抛给了某一位顾问,哪怕这位顾问给出的答案并不特别出色,你也不再考虑其他人了。

这种现象,恰恰就是研究团队在AI系统中发现的问题。当多个AI助手(也就是大语言模型,我们通常称之为LLM)组成团队协同工作时,它们表现得就像那位盲目锁定单一顾问的项目经理一样,过早地依赖某一个同伴,再也不去探索其他可能性。研究者称这种现象为"探索失败",并且发现连GPT-4和GPT-5这样的顶级AI都逃不过这个问题,这说明它并非能力不足的表现,而是当前AI系统的一种根本性局限。

为了解决这个问题,研究团队设计了一个名为MACE(多智能体情境探索,Multi-Agent Contextual Exploration)的轻量级框架,用带有算法结构的"探索引导机制"来帮助AI团队更聪明地互相了解、更有效地协作。实验结果表明,MACE在多种任务场景下大幅提升了AI团队的整体表现。

一、AI团队合作的世界长什么样

随着AI技术的发展,人们开始把多个AI助手组合在一起,让它们像一支真正的团队那样分工合作。这类系统已经被用于许多复杂任务,比如让多个AI一起讨论一道难题、让不同的AI分别处理报告的不同部分、或者让AI集体审议某个决策。现实中有不少已经落地的平台,例如AutoGen、MetaGPT、ChatDev等,都是这类多AI协作系统的代表。

这类系统的核心假设是:当一群AI互相交流、相互补充,整体效果会比单个AI单打独斗更好。这个假设在很多场景下是成立的,因为不同AI可能掌握不同的知识、有不同的推理方式,或者接触到了不同的信息来源。

然而,这个假设有一个隐藏的前提:每个AI必须能够主动了解同伴的能力,才能知道向谁求助最有价值。就像那个项目经理的例子一样,如果他对每位顾问的专长一无所知,就只能凭运气或第一印象做决定,团队协作的优势就无从发挥。

这正是研究团队关注的核心问题:AI在不了解同伴的情况下,能不能主动探索、逐步摸清谁最靠谱?

二、从一个简单游戏发现大问题

研究团队设计了一个极为简洁的实验来验证这个问题。实验的规则像一个经典的赌博游戏:有两台老虎机A和B,A的中奖概率是60%,B是50%。你每次选一台投币,然后观察结果,目标是在50次投币中赚到最多奖金。

最聪明的玩法是:一开始多试试两台机器,积累足够的数据后,再更多地选择看起来胜率更高的那台。这种"先摸底、再下注"的策略,在学术上被称为"探索与利用的平衡",是解决这类问题的标准思路。

研究团队把这个游戏交给了几种AI来玩,包括Qwen2.5-7B(一款性能较强的开源AI)、GPT-4以及GPT-5。同时,他们也让一个经典的数学算法UCB(置信上限算法)来玩同样的游戏,作为参照。

结果出乎意料。UCB算法的表现完全符合预期,它会先均衡地尝试两台机器,然后随着数据积累,逐渐把更多次数投入到胜率更高的A机器上,最终稳定在较优的策略上。而三种AI的表现,则像是完全不同的画风。

研究团队把每种AI在30次独立游戏中选择A机器的次数画成了直方图。理想情况下,这张图应该像UCB一样,大多数游戏都倾向于选A,只是偶尔探索一下B。然而,三种AI的图像呈现出明显的"两极化":大量的游戏要么几乎全选A(接近50次),要么几乎全选B(接近0次),中间的平衡地带寥寥无几。

这意味着这些AI在头几轮之后就彻底"认定"了一台机器,再也不回头。更糟糕的是,这种早早锁定的选择不总是正确的,有很多次AI锁定的恰好是胜率较低的B机器,然后在接下来的40多轮里一直损失惨重,却毫无察觉。

附录中进一步展示了9种不同成功概率组合下的结果,从A机器胜率10%一直测试到90%。无论情境怎么变,三种AI的"两极化"锁定行为始终如一,而UCB则总能灵活应对。其中表现最差的是Qwen2.5-7B,即便A机器的胜率只有10%远低于B的50%,这款AI仍然经常锁定A机器并坚持到底,完全没有从反馈中学习的迹象。GPT-5的表现稍好一些,分布没有那么极端,但依然和UCB差距明显。

研究团队还画出了所有AI在不同成功概率设置下的累积分布曲线(CDF)。这张图清楚地展示了,AI的曲线在0附近和1附近有明显的"台阶"——也就是说,AI要么几乎从不选A,要么几乎总是选A,很少有中间状态。相比之下,UCB的曲线平滑地从左到右,体现了真正的灵活探索。

三、把问题放大到真实的多AI团队场景

单个游戏的失败已经很说明问题了,但现实中的多AI协作要复杂得多。研究团队对此进行了系统性的建模,用数学语言把"多AI探索问题"精确描述出来。

在他们描述的系统里,有N个AI同时运作,每个AI在每一轮都要选择去向哪个同伴"请教",然后把得到的信息用来更新自己的答案。每个AI的能力各不相同——有的拥有更多关键信息,有的推理能力更强,有的掌握了其他人不知道的背景知识。但问题在于,谁都不知道其他人到底能耐几何,只能通过直接交流来逐步了解。

这个过程被研究团队用"部分可观测随机博弈"(POSG)这个数学框架来描述。简单来说,就是每个玩家只能看到自己直接接触到的信息,看不到全局,但所有人的选择又互相影响、共同塑造整个系统的走向。解决这类问题在数学上属于极高难度的问题(NEXP-hard),意味着没有万能公式可以直接套用。

研究团队定义了一个衡量AI表现好坏的指标,叫做"遗憾值"(Regret)。这个词在日常语言里是"后悔"的意思,在这里的含义也颇为贴切:它衡量的是某个AI因为没有选择最佳同伴而白白损失的表现——换句话说,就是本来可以获得但因为做了次优选择而未能获得的那部分收益。遗憾值越低,说明AI的同伴选择越明智。

四、为什么"告诉AI要好好探索"完全没用

在设计解决方案之前,研究团队先测试了一种看似直接的方法:直接在提示词(就是给AI的指令)里告诉它们要平衡探索与利用,要多尝试不同的同伴,不要过早锁定。

这种方法被称为"情境内探索"(In-Context Exploration)——顾名思义,就是把探索的要求写进AI的工作指令里,让AI凭自己的理解来执行。为了公平起见,研究团队给AI提供了和后续方案MACE完全相同的信息,包括每个同伴被选过多少次、平均表现如何等等,只是由AI自己决定下一步怎么做。

结果令人沮丧:在涉及情境多样性的任务中,"情境内探索"的表现甚至不如随机选择同伴,也就是说,让AI随机决定找谁帮忙,比让AI"聪明地"决定还要强。这说明,仅仅通过提示词告诉AI要探索是远远不够的,AI在执行层面依然会犯同样的错误,只是换了个包装。

这个发现十分重要,它证明了探索的失败不是一个可以用"语言提醒"来解决的问题,而是需要在算法层面做出结构性改变。

五、MACE——一套专门为AI团队设计的探索导航仪

研究团队提出的解决方案MACE,其核心思路是:与其让AI自己去猜测该探索谁,不如给它装上一个有数学保证的"导航仪",让导航仪来做出更明智的选择。

这个导航仪的工作原理,可以用一个现实场景来类比。假设你是一名图书馆员,图书馆里有很多不同专业的馆员,每位馆员对不同主题的书了解程度不同。每次有读者来咨询,你需要决定把他引导给哪位同事。你手头有一些信息:每位同事过去解答问题的成功率,他们的专业方向,以及当前读者的问题类型。MACE就像一个精算过的推荐系统,综合所有这些信息,帮你做出最有价值的推荐,同时还会有意识地引导你偶尔尝试那些你还不太了解的同事——因为也许他们的能力还没被充分挖掘。

在技术层面,MACE把每个AI选择同伴的决策转化为一个"情境多臂老虎机"问题。这里的"多臂"指的是有多个选项可以选,"情境"指的是每次做决策时有额外的背景信息可以参考。MACE为每一对可能的AI互动构建了一个特征向量,用来量化这次互动的潜在价值。

这个特征向量包含了四类信息,分别捕捉了互动的不同维度。第一类叫做"回应多样性",衡量的是目标同伴给出的答案和自己的答案差异有多大——如果差异很大,说明对方可能掌握了不同的信息,向他请教可能有新收获;如果完全一致,则说明对方能提供的帮助有限。第二类叫做"同伴独特性",衡量的是目标同伴在整个AI网络中有多"与众不同"——一个独特的声音往往意味着它掌握了别人没有的视角。第三类叫做"历史表现",记录了过去向该同伴请教后自己的答案质量平均提升了多少,这是最直接的"靠谱程度"评分。第四类叫做"互动轮次",记录当前是第几轮交流,因为在早期阶段应该多探索,在后期阶段则应该更多地依赖已经验证过的好同伴。

有了这些特征信息,MACE使用一个叫做LinUCB的算法来做决策。这个算法的聪明之处在于,它不仅会根据历史数据估算向每个同伴请教的预期收益,还会额外给那些"还不太了解的"同伴加一个奖励分——越不了解,奖励分越高,这样就自然而然地推动AI去探索那些还没被充分测试过的同伴,而不是一味守着已知的"好同伴"。

每次互动结束后,MACE会根据实际结果更新自己的估算,让下一次决策更加准确。奖励的计算方式也经过精心设计:它综合了两个因素,一个是本次互动后答案的质量是否提升,另一个是答案的最终绝对质量。这样的设计避免了一种尴尬情况——当一个AI本来就答对了,向同伴请教后仍然保持正确,这次互动其实是有价值的,不应该得零分。

六、两种现实场景的全面检验

为了验证MACE的实际效果,研究团队设计了两类代表性的实验场景,分别对应了真实AI团队中最常见的两种差异来源。

第一种场景叫做"情境多样性"。在这种设置中,所有AI使用同样的基础模型(都是Qwen2.5-7B),但每个AI读到的信息不同。具体来说,研究团队使用了一个叫做HotpotQA的多跳问答数据集,每道题目配有10篇文章,其中只有2篇包含答题所需的关键信息,另外8篇是无关的干扰内容。10个AI各自只读其中一篇,因此只有拿到关键文章的AI才"知道答案",其他AI虽然努力思考,但因为缺少关键信息只能猜测。这就要求AI们通过互相请教来找到那些"真正知情"的同伴。

这个场景特别刁钻,因为每道题目分配给各AI的文章是随机的,今天可能AI5有关键信息,明天可能AI2有,AI们没有任何预先的线索,只能靠探索来发现。研究团队选取了600道被标注为"困难级别"的题目进行测试,前300题用于学习阶段,后300题用于验证迁移效果。AI们每道题要经历5轮交流。

第二种场景叫做"参数多样性"。这里不再是同一个模型,而是将四种能力迥异的AI组成一支混编团队:实力最强的GPT-5、中等水平的Qwen2.5-7B和Llama3.1-8B,以及能力相对有限的Mistral-7B。这四个AI面对同样的问题,但由于训练方式、参数规模和知识储量不同,对于不同类型的题目各有所长。团队在两个具有挑战性的测试集上进行评估:一个是Math500中的难度4-5级数学题,另一个是GPQA(研究生水平的谷歌防作弊问答)中最难的题目集合。

在这两种场景下,研究团队对比了MACE与三种基准方案的表现。第一种是"情境内探索",就是前面提到的仅靠提示词引导AI自主决策的方式。第二种是"随机选择",每轮随机挑一个同伴请教。第三种是"预定义连接",每个AI固定只和右边的邻居交流,这模拟了很多现有AI辩论系统中常见的固定通信结构。

实验分为两个阶段:学习阶段,所有方法正常运作,边做边学;利用阶段,MACE的参数被冻结,不再更新,只用已学到的策略来做决策,相当于把探索阶段学到的"经验"原封不动地应用到新题目上。

七、探索能力的质变:数据说话

实验结果给出了明确的答案。在情境多样性场景中,观察AI们选择同伴的分布图案,就能一眼看出探索质量的差距。"情境内探索"方案下,几乎每个AI都有一个或两个固定偏爱的同伴,选择次数高度集中。以某个AI为例,它在1500次互动机会中,有超过1400次选择了同一个固定同伴,其他8个同伴加起来才被选了不到100次。这种选择完全没有道理,因为每道题目的关键信息持有者是随机分配的,固定选一个同伴必然会在很多题目上找不到真正的知情者。

相比之下,MACE下的选择分布要均匀得多。虽然某些同伴确实会被选得稍多一些,但没有出现极端的"全押在一个人身上"的情况。整体上,每个AI都覆盖到了足够多的同伴,使得当关键信息落在任何一个AI手中时,都有较大概率被发现。

在参数多样性场景中,情况略有不同。这里,有一个实力明显领先的同伴(GPT-5),所以在后期倾向于更多地选择它是合理的。然而,"情境内探索"再次展现出过度锁定的问题:GPT-5在297次互动机会中被某些AI选择了294次,几乎完全忽略了其他三个AI。这种锁定发生得太快,在还没有充分了解其他AI能力的情况下就已经完成。MACE的选择虽然也倾向于GPT-5,但明显更有节制,在早期探索了更多的同伴,在掌握足够信息后才逐步收敛到较优选择。

在遗憾值的累计曲线上,差距体现得更加直观。在学习阶段,"情境内探索"的遗憾值持续上升,甚至超过了随机选择的遗憾值——这是一个令人警醒的结论,意味着一个完全随机的傻瓜策略,居然比试图"聪明地"利用已有信息还要强。"预定义连接"表现也不尽如人意,因为固定结构无法适应每道题目知情者位置的变化。MACE的遗憾值曲线则持续下降,随着互动轮次增加,它越来越善于找到合适的同伴,错失最佳选择的情况越来越少。

进入利用阶段后,MACE的优势不仅没有减弱,反而更加突出。在这个阶段,MACE的参数被冻结,不能再根据新题目做更新,但它仍然以压倒性的优势领先其他方案。这说明MACE在学习阶段获得的不是针对特定题目的死记硬背,而是具有普适性的同伴选择策略。

数学题和科学推理题的结果展示了类似趋势。在Math500的困难题目上,MACE在学习阶段结束时的平均准确率达到了64.5%,而"情境内探索"为61.8%,"随机选择"为56.1%,"预定义连接"为59.9%。在利用阶段,差距进一步拉大,MACE达到68.3%,"情境内探索"为60.3%。在GPQA上,各方法的最终轮准确率依次为54%(MACE)、43%(情境内探索)、47%(随机)、46%(预定义)。值得特别指出的是,即便是团队中能力最强的GPT-5,在MACE框架下表现也比在其他框架下更好,这表明探索机制不是在弥补弱AI的不足,而是在系统层面提升了整体信息流动的效率。

八、学到的东西能迁移,不是只会"死记硬背"

一个特别能体现MACE价值的实验,是把它在HotpotQA上学到的参数,原封不动地搬到一个完全没见过的数据集——2WikiMultihopQA上使用。

2WikiMultihopQA同样是多跳问答任务,但普遍被认为比HotpotQA更难,题目需要整合更多文档、推理链条更长。MACE在这个数据集上甚至比其他方法在自己的"主场"(直接在2WikiMultihopQA上探索的版本)表现还要好。

这说明MACE学到的不是"HotpotQA题目的答案模式",而是更深层的东西:在情境多样的AI团队中,什么样的同伴在什么情况下更值得请教的普遍规律。这种跨任务的迁移能力,是一个实用系统的重要品质,因为在现实部署中,我们总是希望训练好的策略能推广到新场景,而不必每次都从头学起。

九、用数学语言解释"为什么探索如此重要"

除了实验验证,研究团队还提供了数学上的严格保证,证明MACE的优势不是碰运气,而是有理论根基的。

核心的数学结论围绕三个定理展开。第一个定理证明了MACE的遗憾值增长速度是亚线性的,也就是说,随着互动次数的增加,MACE每轮平均的表现损耗会越来越小,最终趋近于零。具体来说,MACE的累计遗憾值增长速度不超过"√T × logT"的数量级,其中T是总互动轮次数。用更直白的话说,MACE随着经验增加会越来越聪明,最终几乎不再犯错。

第二个定理证明了贪心策略(即始终选择当前看起来最好的同伴,没有主动探索)在最坏情况下会付出线性增长的代价,也就是说,遗憾值会以恒定速率增长,永远不会自我改善。

第三个定理把这两者结合起来,并引入了"能力多样性"这个关键概念。研究团队用一个叫做δ(delta)的数值来量化AI团队中各成员能力差异的程度——δ越大,成员能力越参差不齐,找对同伴就越重要,探索的回报也就越高。数学上证明了,探索带来的优势下限与δ×T成正比。当δ趋近于零(也就是大家能力差不多)时,探索的优势缩小;当δ很大(也就是成员能力高度专业化)时,探索变得不可或缺,两种策略之间的差距会以越来越快的速度扩大。

研究团队在实验数据上直接验证了这个理论预测,Qwen2.5-7B在GPQA任务上的累积遗憾曲线走势与理论预测曲线高度吻合,说明这套数学分析不是纸上谈兵,而是对真实AI系统行为的精准描述。

十、当探索算法有了"时间意识"

研究团队还额外探索了一个有趣的扩展版本,叫做MACE-TD(时序差分版本)。标准的MACE把每次请教同伴的决策当成独立的一步,只看当下这次互动带来的即时收益。而MACE-TD则更进一步,考虑到早期的探索可能为后续几轮的决策奠定基础,因此在计算价值时引入了对未来收益的折现估算,类似于国际象棋程序在走一步棋时不只看这步棋的直接得分,而是考虑五步之后的局面。

从理论上说,MACE-TD的思路更完整,但实验结果显示它并没有在遗憾值上稳定地超越标准MACE。在某些任务(如GPQA)上,MACE-TD甚至积累了更高的遗憾值,这可能是因为奖励信号比较稀疏时,时序差分更新引入了额外的不稳定性。

然而,MACE-TD展现出了一个有趣的副作用:它似乎在促进更均匀的"同伴覆盖"。研究团队测量了每轮中至少被一个AI选择过的同伴比例(称为覆盖率),发现MACE-TD的覆盖率明显高于标准MACE和"情境内探索"。这意味着在MACE-TD框架下,不同的AI倾向于探索不同的同伴,形成了一种自发的分工——每个AI负责深入了解一部分同伴,整体上使团队覆盖了更广泛的信息来源。这种现象为未来研究AI团队中自发合作行为的涌现提供了一个有趣的线索,尽管目前还不能说这是真正意义上的合作,但这个苗头值得关注。

十一、探索不是万能的,但有个前提条件

为了更全面地理解MACE的适用范围,研究团队还特意测试了两种情况:一种是AI团队完全同质化(五个完全相同的Qwen2.5-7B,接收完全相同的信息),另一种是使用一组能力都很强但相互接近的前沿模型(GPT-5、GPT-4、GPT-5.4-mini和GPT-5.4-nano)。

结果与理论预测完全吻合。在完全同质化的设置下,MACE的遗憾值优势几乎消失,与随机策略旗鼓相当,甚至在部分阶段还略逊一筹。这完全合理——既然所有同伴的能力完全一样,无论找谁帮忙结果都差不多,探索与否毫无意义。

不过即便如此,MACE在最终答案准确率上仍然保持了小幅优势:学习阶段末的平均准确率MACE为47.8%,高于"情境内探索"的46.9%和"预定义连接"的46.1%,利用阶段的差距也大致如此。这说明即便在同质化环境下,MACE的结构化决策仍然比任意或固定的选择稍微聪明一些,只是不那么显著。

在使用强前沿模型的实验中,遗憾值差异同样不大,但最终任务准确率的差异依然存在,MACE在GPQA上的最终平均准确率比"情境内探索"高出约两个百分点,利用阶段的差距达到了大约4.3个百分点。这个结果暗示,在成员能力相对均衡的团队里,遗憾值层面的探索优势会减弱,但更好的信息整合方式仍然能带来一定程度的表现提升。

归根结底,探索的价值和团队成员的能力差异程度正相关,这一结论在理论和实验两个层面都得到了一致的支持。

由此可以看出,这项研究揭示了多AI协作系统中一个根本性的盲区:当AI们不能有效地相互"摸底"时,再强大的个体能力也可能因为信息错配而浪费。MACE提供的不是一个万能药,而是一个针对特定问题的精准工具,当团队成员能力各有千秋时,这个工具的价值就会非常突出。对于那些试图构建可靠AI协作系统的人来说,这项研究的核心提醒是:别指望AI自己会聪明地互相了解,需要在系统设计层面主动为探索机制留出空间。感兴趣的读者可以通过arXiv编号2607.11250查阅完整论文,或访问论文中提供的GitHub代码仓库(deeplearning-wisc/mace)深入了解实现细节。

Q&A

Q1:多AI团队中的"探索"是什么意思,为什么这么重要?

A:多AI团队中的探索,指的是每个AI主动尝试和了解不同同伴能力的过程。因为各AI的知识和能力各不相同,只有通过实际互动才能发现谁在当前任务上最有帮助。如果AI过早锁定某个固定同伴,就会错过其他更有价值的合作者,导致整体效果大打折扣,甚至还不如随机选择同伴。

Q2:MACE框架是怎么帮助AI团队做出更好的同伴选择的?

A:MACE把AI选择同伴的过程转化为一个有数学保证的决策问题。它会综合考虑四类信息:目标同伴的回应和自己有多大差异、该同伴在整个网络中有多独特、过去向这个同伴请教的收益记录,以及当前互动处于哪个阶段。然后用UCB算法在"选择当前最优"和"继续探索未知"之间找到平衡,避免过早锁定。

Q3:大语言模型的探索能力通过提示词改善吗?

A:研究结果显示不能。研究团队测试了一种"情境内探索"方案,就是直接在给AI的指令里告诉它要主动探索不同同伴,还提供了和MACE完全相同的信息。结果这种方式在情境多样性任务中的表现甚至不如随机选择同伴,说明仅靠语言层面的提示无法从根本上改变AI的探索行为,必须依赖算法层面的结构性设计。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询