当AI裁判自己都判不准的时候,我们该信谁?

想象一下,你雇了六个裁判来给一场体操比赛打分。他们看的是同一套动作,用的是同一套评分标准,结果给出的分数却像六个不同的世界。更麻烦的是,如果你把标准答案(也就是满分动作应该长什么样)提前告诉这六个裁判,其中两个裁判反而打分变得更不准了。这听起来有点荒唐,但这正是一群研究者在AI评估领域里发现的真实情况。
这篇来自ServiceNow AI团队的论文,做的事情说起来挺朴素:现在大家都用大语言模型(LLM)当裁判来评判其他AI模型的表现,尤其是在评判AI调用工具、执行多步骤任务这件事上。但从来没有人系统性地问过一个问题:这些当裁判的LLM,本身靠谱吗?
**这篇论文第一次系统性地回答了这个问题,答案并不让人放心。**
先说清楚背景。现在的AI智能体不再只是聊天,它们要调用各种工具去完成任务,比如查天气、订机票、操作数据库。这些任务往往不是一步到位的,而是像一张流程图一样,有先后顺序,有并行分支,有汇合节点。
DAG*:全称有向无环图,用来描述任务执行的依赖关系。图里的每个节点是一次工具调用,箭头表示先后顺序,"无环"意味着不会出现循环依赖,A必须等B完成才能等C。
要判断AI智能体这一整套工具调用做得对不对,靠人工一个个检查是不现实的,成本太高。于是大家开始用另一个AI模型来当裁判,让它去看智能体调用了哪些工具、参数对不对、顺序合不合理、有没有漏掉用户的需求。这套做法已经被广泛用在很多评测系统里了,但奇怪的是,几乎没有人认真研究过这个裁判本身有多可靠。
问题到底有多难
先说一个具体的数字对比,帮你感受这件事的难度。
论文里设计了一套四维度的评分体系:工具选不选得对、参数结构对不对、执行顺序合不合逻辑、有没有覆盖用户的全部需求。这四个维度分别独立打分,加起来才是完整的评价。
**结果发现,随着任务难度从简单变成困难,六个裁判模型的判断准确率都在下降,而且没有例外。**
更扎心的是,在没有标准答案(也就是没有参考执行轨迹)的情况下,这个下降速度是有标准答案时的1.5倍。这说明什么?说明当裁判手里没有"标准答案"这根拐杖时,它自己独立判断的能力其实相当脆弱。
而当任务难度升到最高档、又没有标准答案可以参考的时候,六个裁判模型不管参数规模是200亿还是站在前沿的顶级模型,最终的判断准确率都卡在77%到82%这个狭窄区间里出不去。
这就好比你请了六个不同经验水平的老师傅来评判一道复杂的木工活,从刚出师的学徒到干了三十年的老师傅都有。结果发现,一旦这道活儿的复杂程度超过某个阈值,所有师傅的判断都开始变得含糊不清,水平的差距反而被磨平了。如果这时候你还指望靠"多找几个经验更丰富的老师傅"来解决问题,那就是找错了方向,因为问题根本不在于经验,而在于活儿本身已经复杂到超出了肉眼判断的极限。
这个现象揭示了一个结构性的天花板,而不是某个模型能力不够的问题。研究者进一步做了个实验来验证这一点:他们把评分提示词里默认判断从"1.0分(正确)"改成"0.5分(部分正确)",结果发现对表现强的生成模型来说,这个改动几乎没影响(提升不到1个百分点),但对表现弱的生成模型影响很大(能提升4到5.6个百分点)。这说明对强模型来说,天花板确实是任务本身太难;但对弱模型来说,这个天花板一部分是提示词设计带来的假象。
标准答案不是万能药
这篇论文最反直觉的发现之一是:给裁判看标准答案,不一定会让它判断得更准。
正常逻辑是这样的:你给裁判一份参考答案,它照着比对,应该判断得更精准才对。但论文发现,对于两个顶级的前沿模型(GPT-5.4和Gemini-2.5-Pro)来说,看了标准答案之后,它们的判断反而比不看标准答案时更差了,分别下降了1.5个百分点和3.9个百分点。
研究者管这个现象叫"过度锚定"。
过度锚定*:指裁判模型看到参考答案后,倾向于逐字逐句地比对表面结构,而不是独立判断这个方案本质上对不对,导致它对那些"结果一样但路径不同"的正确答案产生误判。
举个具体例子。论文里有个案例,用户问的是关于奶酪微生物生长率的计算,正确的执行路径应该是三步:先算生长率,再估算存储温度,最后算保质期。生成模型只做了前两步。按理说这明显是漏了一步,应该扣分。但当裁判模型手里拿着标准答案时,它反而说"这两步的顺序是合理的,生长率计算确实应该在温度估算之前",完全没注意到第三步压根就不存在。可是同一个裁判模型,在没有标准答案的情况下重新看这道题,却准确地指出"这个计划包含一次多余的重复调用,是个小瑕疵",虽然诊断的问题不完全一样,但至少发现了不对劲的地方。
这就像一个阅卷老师,如果给他一份标准答案对照着改卷子,他很容易陷入一种"对号入座"的心态:只要学生写的东西看起来跟标准答案沾边,他就倾向于放行,而忽略了学生实际上漏掉了整个第三步。相反,如果不给他标准答案,让他凭自己对题目的理解去判断这份答卷合不合逻辑,他反而会更认真地去检查每一步是否完整。**参考答案在这里不是帮手,而是一种认知捷径,会让裁判偷懒。**
为了验证这不是巧合,研究者还做了个很聪明的对照实验:故意给裁判一份错误的参考答案(从另一道完全不同的题目里随机抽来的标准答案)。结果Gemini-2.5-Pro不管拿到的是真参考答案还是假参考答案,打分几乎一模一样,这说明它根本没有在真正比对内容,只是"看到有参考答案在,就往那个方向靠"。而QwQ-32B在拿到假参考答案时,打分几乎和完全没有参考答案时一致,说明它确实在动脑子独立判断,而不是被参考答案牵着走。
六个裁判之间到底有多少共识
如果六个裁判打分差异很大,那至少说明他们各有各的判断逻辑,这种"意见不合"本身也是信息。但论文发现,情况更复杂。
论文用了一个叫Cohen's κ的统计指标来衡量裁判之间的一致性。
Cohen's κ*:一种衡量两个评判者之间意见一致程度的统计量,取值范围从0到1,0代表纯属巧合的一致,1代表完全一致,数值越接近1说明两者的判断越吻合,而不是碰巧对上了。
有标准答案时,六个裁判两两之间的平均一致性κ值是0.419,属于"中等"水平;没有标准答案时,一致性看起来提升到了0.559,貌似更好。但研究者揭穿了这个假象:**没有标准答案时一致性变高,不是因为裁判们真的达成了共识,而是因为大家都习惯性地把不确定的情况默认打成满分,这种"偷懒式一致"和真正的判断一致完全是两码事。**
更有意思的是,在有标准答案的条件下,裁判两两之间的意见分歧程度和模型规模差距没什么关系(相关系数只有-0.171);但在没有标准答案的情况下,模型规模差距越大,意见分歧越明显,这个相关性达到了-0.825,是个相当强的统计关联。这说明标准答案确实起到了一种"统一锚点"的作用,让不同水平的裁判至少能对齐到同一个参照系上,虽然这个对齐本身可能带来上面说的过度锚定问题。
研究者还尝试了把六个裁判的意见凑在一起做集体投票,看是不是能"三个臭皮匠顶一个诸葛亮"。结果是,集体投票的准确率能追平表现最好的单个裁判,但没能超越它。这意味着这些裁判犯的错误是高度相关的,大家栽在同一个坑里,投票不但没能互相纠错,反而只是把大家共同的盲区又确认了一遍。
思考链和调温度都没什么用,但提示词格式很关键
论文还测试了几个常见的"提升AI判断力"的手段,结果挺让人意外。
先说思考链,也就是让模型在给出最终答案前先写一段推理过程。
思考链*:Chain-of-Thought,简称CoT,是一种让AI模型在回答之前先展示推理步骤的技术,类似人在做数学题时先打草稿再写最终答案。
按理说,让裁判模型"先想清楚再打分"应该会更准确才对,这也是这几年很多论文反复验证过的一个提升手段。但在这篇论文里,研究者对比了QwQ-32B裁判开启和关闭思考链的表现,24组对比实验里,最大的差异也就0.3个百分点,几乎可以忽略不计。这说明这个裁判本身的判断优势来自它训练时接触过的数据分布,而不是靠临场多想了几步。
调温度参数也是类似结果。
温度参数*:控制AI模型输出随机性的一个数值,温度越高,模型给出的答案越有变化性;温度越低,答案越固定和保守。
研究者把Qwen3-32B裁判的温度从0.3调到1.0,结果所有情况下的分差都不超过0.6个百分点。第二组独立验证(换了另一对裁判和生成模型)差异甚至更小,只有0.25个百分点。这说明这些裁判的判断更像是一种结构化的模式匹配,而不是那种容易受随机性影响的开放式创造,调温度对它基本没什么撬动作用。
**真正有明显效果的,是提示词本身的组织格式。**
研究者对比了两种提示词:一种是结构化的,明确要求裁判分别针对四个维度逐项打分并给理由;另一种是自由格式的,只笼统地让裁判评价整体表现。结果结构化提示词在有标准答案的情况下,能比自由格式提升4.8到6.5个百分点,这是他们测试的所有干预手段里效果最明显的一个。
不过这个效果不是放之四海而皆准的。研究者换了另一组裁判和生成模型再测一次,发现结构化提示词的优势变小了(在简单和中等难度上还是领先,但幅度缩水),而且在最难的那一档任务上竟然反过来了,自由格式反而略微领先。这说明提示词格式的影响是真实存在的,但它跟具体是哪个裁判、评判的是哪个生成模型有关,不能简单地说"结构化提示词永远更好"。
这个现象让我想到一个类比:给员工的工作说明书,写得越详细分条,员工执行起来通常越规范,这是常识。但如果任务本身已经复杂到说明书写多细都覆盖不了所有边界情况,那再细的说明书反而可能限制了员工临场判断的灵活性。提示词格式的作用,某种程度上就是这个道理,它在简单和中等任务上能有效降低裁判的随意性,但在最复杂的任务上,这种约束的边际效益开始打折扣,甚至可能适得其反。
哪个维度最难判断,哪种任务结构最容易出错
论文把评分拆成了四个独立的维度,工具选得对不对、参数结构对不对、执行顺序合不合理、需求覆盖全不全。这四个维度里,最容易让裁判们意见分歧的是执行顺序这个维度。
有标准答案的情况下,不同裁判在"顺序判断"这个维度上的打分差距能拉到22个百分点,这是四个维度里差距最大的。相比之下,参数结构和需求覆盖这两个维度,裁判们的判断都比较一致,普遍在86%到94%之间。
为什么顺序判断最容易吵架?论文里有个很直观的案例。用户想计算自己一笔184.73美元的消费是否异常,正常流程需要先算"时间异常度"和"金额异常度"这两个独立的指标,再把它们汇总成一个综合分数。生成模型算这两个独立指标的顺序跟标准答案反了(标准答案先算时间再算金额,生成模型先算金额再算时间),而且提前调用了汇总步骤,用了占位符代替还没算出来的结果。
按照严格的程序化打分规则,这个顺序错误只能拿到33%的分数,因为它逐位对比时只有第三步对上了。但LLM裁判觉得这个方案没问题,理由是"先分别计算再综合"这个逻辑本身是对的,先算哪个独立指标根本不重要。这两种判断方式没有谁绝对错,这其实反映了"顺序正确"这个概念本身在有并行分支的任务里就存在天然的模糊地带,就像两个厨师做一道菜,一个先切菜再腌肉,另一个先腌肉再切菜,只要腌肉和切菜互不依赖,谁先谁后其实都无所谓,但如果你死板地要求"必须按照食谱写的顺序来",就会误判一道其实做得很好的菜。
除了评分维度,论文还发现任务的DAG结构本身也存在难度梯度。最容易判断的是"分支后不用汇合"这种简单的扇出结构,最难判断的是需要多路汇合的扇入结构和带循环的结构。这个难度梯度在所有六个裁判身上都一致存在,说明这不是某个模型的偏好问题,而是任务结构本身带来的固有复杂度。
谁跟人类的判断最接近
程序化打分虽然客观,但它终究是按规则死板执行的,不一定完全符合人类的直觉判断。为了验证这一点,研究者专门找人工标注员,对120条高难度记录做了独立评审,跟程序化打分结果做对比。
结果显示,人工标注和程序化打分在大多数维度上高度一致,总体一致率达到92.7%。但在参数结构这个维度上,一致率只有82.5%,这是四个维度里表现最差的。原因很有意思:程序化打分器会严格扣掉那些"符合工具schema但不在标准答案里"的多余参数,而人类标注员觉得这些多余参数只要合理,不该被扣分。
有了这个人工评审数据后,研究者又反过来看六个裁判模型跟人类判断的贴近程度,发现结果跟跟程序化标准比对时完全不一样。**跟程序化标准比,QwQ-32B排第一;但跟人类判断比,它掉到了第四位,反而是GPT-OSS-120B(一个开源模型)在两种比对方式下都排名第一。**
这说明一件很重要的事:**你选哪个裁判,取决于你到底想让它模仿谁。**如果你的评判标准就是严格按照程序化规则来,QwQ-32B更合适;但如果你更在意的是这个AI裁判的判断是否符合人的直觉和常识,GPT-OSS-120B才是更稳妥的选择。这提醒我们,"哪个AI裁判最好"这个问题本身没有一个统一答案,答案取决于你拿什么当参照系。
这些发现意味着什么
这篇论文没有停留在"AI裁判不靠谱"这样一个笼统的结论上,而是把这个不靠谱拆解成了具体可测量的现象:难度越高判断力下降越快,没有参考答案时下降更快,六个裁判在难题上会不约而同地撞到同一堵墙,参考答案有时候反而是个陷阱,思考链和调温度基本没用,但提示词的组织形式有实打实的影响,而且这个影响还因裁判和任务组合而异。
对于正在用LLM当裁判评测自己AI系统的团队来说,这篇论文提供的不是一个"哪个模型最好"的排行榜,而是一整套需要警惕的坑。比如,如果你的评测场景大概率是没有标准答案的(这是大多数实际部署场景),你得知道你的裁判在难题上其实已经陷入了一种"信号被压平"的状态,这时候换一个更贵更强的模型未必能解决问题,因为大家都卡在同一个天花板下面。
写在后面
读完这篇论文,最让我心里咯噔一下的其实不是"AI裁判会犯错"这个结论本身,这个大家多少都有心理预期。真正让我意外的是过度锚定这个现象背后的逻辑:**给AI裁判提供更多信息(标准答案),不一定会让它变得更聪明,反而可能让它变懒。**
这跟我们平时对"信息越多越好"的直觉是相反的。我们总以为多给一个参照系,判断应该更准,但这篇论文用扎实的对照实验证明,参照系有时候会变成一种认知拐杖,用久了反而让判断力退化。这个现象其实不只发生在AI身上,人在有标准答案可以对照的时候,也很容易陷入"对号入座"式的浅层核对,而不是深入理解题目本身在问什么。这篇论文用一个很具体的技术场景,把这个认知偏差暴露得清清楚楚。
另一个让我反复琢磨的细节是那个77%到82%的收敛区间。六个从200亿参数到顶级前沿模型的裁判,在最难的任务上判断力被压缩到一个几个百分点宽的窄区间里,这种"能力被抹平"的现象,比单纯的"某个模型判断错了"更值得警惕,因为它意味着简单地换更强的模型,可能根本解决不了问题,你需要的不是更聪明的裁判,而是一套完全不同的评判机制,比如程序化验证,或者更结构化的提示设计。
论文里还留了一个没解决的问题:这些发现是在"评估时刻"测出来的,如果把这些有偏差的AI裁判用来当训练信号(比如做强化学习里的奖励模型),会发生什么?作者自己也说这是留给未来的问题。这个问题细想挺让人不安的,因为如果一个有系统性偏差的裁判被用来指导模型训练,那偏差可能不再只是一次评估的误差,而是会被放大、固化进下一代模型的行为里。
Q&A
Q1:AgentJudgeBench是什么?
A:AgentJudgeBench是ServiceNow AI团队推出的一个基准测试,专门用来系统性评估LLM当裁判去判断AI智能体调用工具正确与否时的可靠性,包含3808条记录、六种任务结构和三个难度等级。
Q2:为什么给LLM裁判看标准答案有时候反而更不准?
A:这种现象叫过度锚定,研究发现两个顶级模型GPT-5.4和Gemini-2.5-Pro在拿到标准答案后判断反而变差,因为它们倾向于对照表面结构而非独立判断方案本质对错,导致对路径不同但结果正确的方案误判。
Q3:思考链和调整温度参数能提升AI裁判的判断准确度吗?
A:论文实验显示效果都很有限,思考链在24组对比中最大差异只有0.3个百分点,温度参数从0.3调到1.0差异也不超过0.6个百分点,真正有明显效果的是提示词的结构化组织方式,能提升4.8到6.5个百分点。