AI智能体测试为什么总能作弊?这篇论文教你如何"设局"

你有没有想过一个问题:如果你出的考题,AI早就在训练数据里见过答案,那这场考试还能测出什么?

这不是杞人忧天。现在评测AI智能体(能自主使用工具、执行任务的AI程序)的能力,最大的麻烦就是分不清它到底是真本事,还是提前背过题。你让它审一份合同、算一笔账、查一份财报,它答对了,是因为它真的懂这个领域的门道,还是因为这类任务的套路早就被喂进了它的训练库?

这个问题听起来抽象,但后果很现实。如果一家公司想用强化学习训练AI智能体去做专业工作,比如法务审查、供应链成本核算,那训练用的任务必须是AI真正"不会"的,而不是"装作不会"的。不然训练出来的模型看似进步了,其实只是在背答案的路上走得更远。

来自DataGrids团队的研究者们盯上了这个问题。他们的解法说起来挺朴素:既然要测AI是不是真的不懂,那就干脆把"懂不懂"这件事做成一个可以精确控制的开关。

一场明知故问的实验

先说说这篇论文想解决的具体困境。

在专业领域里,很多任务依赖的不是通用知识,而是行业里的私有约定。比如一家公司内部规定,计算库存周转率时要不要把开盘前几分钟算进去;一份供应链成本表里,如果某个零件的历史价格缺失,按行业惯例应该记为0还是取邻近价格的平均值。这些规则不写进教科书,不出现在维基百科,纯粹是"圈内人才知道"的东西。

问题来了:如果你想测试一个AI智能体有没有能力运用这类私有知识,你得保证两件事同时成立。第一,这个知识AI确实不知道,不然测试没有意义。第二,这个知识必须能被明确验证,不然你没法给出确定的对错评分。

这两件事天然矛盾。你越想让规则"贴近真实业务",就越容易不小心让AI从上下文的蛛丝马迹里猜出答案;你越想让规则"绝对隐藏",任务就越容易变得刁钻古怪,脱离真实场景的意义。

研究者们把这个矛盾总结成三条"不对称性"。

第一是构造特权:出题人在写题目的时候,可以任意设定一个内部阈值,或者一张只有自己知道的换算表,这个答案从题目本身是推不出来的,不管解题的AI有多聪明。第二是验证的成本不对称:检查一个结构化答案对不对,远比生成正确答案容易,就像判断一道数学题答案对不对,比亲自解出来快得多。第三是可组合验证:如果一个任务有多个检查点,只要全部通过才算过关,任务的复杂度可以慢慢往上叠加,而每个失败点都能被精确定位到具体哪一环出了问题。

这三条听起来像是老生常谈,但组合起来就有意思了。研究者据此设计了一套完整的协议:把每个任务拆成两部分,一部分是任务说明,交代要做什么;另一部分是知识文档,只有几千字节大小,里面藏着这个领域的私有规则、参考表格、专用计算方法。任务说明里绝对不提这份文档的存在,AI要么拿到这份文档就能做对,要么拿不到就基本抓瞎。

68%对0%,一份文档决定生死

研究团队做了一个挺极端的对照实验。

他们准备了15个校准任务,涵盖合同条款风险评分、供应链成本核算、航空订票审计、抵押贷款托管分析等专业场景。每个任务都配了一份知识文档,实验设置了两种情况:给AI提供这份文档,或者完全不给。任务说明本身在两种情况下逐字节相同,不做任何改动。

结果相当扎眼。用Claude Opus 4.8跑这15个任务,拿到文档时的整体通过率是68.0%,没有文档时通过率是0%。整整68个百分点的落差,而且不是从"还不错"掉到"有点差",是从"多半能做对"直接摔到"一次都做不对"。

这里有个类比能帮你理解这个落差的分量。想象你去考驾照的科目一,题库里有一道题问"限速标志上写的数字单位是公里还是英里"。这不是靠推理能答出来的题,你要么背过这条规定,要么完全靠猜。如果你猜对的概率接近于零,那就说明这道题真的在考你有没有背过规则,而不是在考你的推理能力。如果不设置这种"非此即彼"的题目,而是设计成"根据上下文推断限速单位",那AI可能靠训练数据里类似场景的蛛丝马迹蒙对,你测出来的就不是知识掌握度,而是蒙题能力。

论文中还有一个更狠的对照实验,值得单独说一说。研究者拿供应链成本核算这个任务做了个测试:给AI一份看起来一模一样、格式规范、内容详实的知识文档,但里面三个关键数值被悄悄改错了。比如管理费率从12%改成了15%,缺失价格的处理规则从"记为0"改成了"取兄弟节点平均价"。

结果这份看起来言之凿凿的假文档,让AI的通过率也是0%,跟完全不给文档一样差,比给真文档时的100%通过率差了整整一大截。

这个结果说明什么?说明AI不是靠"看起来像那么回事"蒙混过关的,它是真的在按照文档里写的规则去计算。给它一份错误的地图,它会老老实实地按错误路线走到黑,而不会凭直觉绕过去走对路。这也侧面证明了,这套测试设计的确捕捉到了"知识依赖"这个变量,而不是别的什么无关因素在起作用。

光靠一个模型跑分够不够

这里有个技术术语要解释一下。

知识门控:指的是这套协议里设计的核心机制,把任务能否解决的关键因素锁定在一个可控的知识文档上,通过"给"和"不给"这个开关来判断AI的表现差异是不是真的来自知识缺口。

只用一个模型、一份文档做对照,说服力总归有限。万一Opus这个模型本身就对这类任务特别敏感,测出来的结果其实是个例呢?研究者又引入了第二个配置:用Qwen3.6-Plus模型,配合另一套代理框架OpenCode,同样给它提供知识文档,看它能做到什么程度。

结果这个中间档位的配置整体通过率只有22.7%,远低于Opus拿到文档后的68.0%。乍一看好像是说Qwen"更笨",但研究者很谨慎地没有下这个结论。原因很简单,两套配置换的不只是模型,连执行框架、工具调用方式都不一样,低分完全可能是别的原因造成的,比如文件读取失败、输出格式不规范,跟"懂不懂知识"没有直接关系。

为了把这个疑点搞清楚,研究者又做了一个很巧妙的补充实验,叫"背诵探针"。

他们挑出两个任务,把知识文档和任务数据压缩到能塞进单轮对话里,不用工具、不用沙箱环境,直接问Qwen两个问题:第一步,把文档里的私有规则原样复述成结构化数据;第二步,给它真实任务数据,让它给出最终答案。

结果很意外。跑了10次对话,Qwen把每一条私有规则都复述对了,而且最终答案的通过率是100%。可是同样的模型在完整的代理测试环境里跑同样的任务,通过率却是0%。

这说明什么?说明Qwen根本不缺知识,它把文档背得一字不差,也能正确套用规则算出答案。它输在了别的地方:可能是在沙箱环境里没找对文件,可能是工具调用出了岔子,也可能是最终输出格式不符合验证脚本的要求。

这个发现给整个研究提了个醒:一个AI智能体在真实任务里表现差,未必是"不懂",很可能是"不会用"。这就好比一个厨师明明能把菜谱背得滚瓜烂熟,可是让他在一个陌生厨房里,找不到调料架在哪、灶台开关往哪拧,结果做出来的菜还是一团糟。如果只看最终成品打分,你会误以为他不会做菜,实际上他缺的是对这个厨房环境的熟悉度,而不是烹饪知识本身。这也是为什么论文反复强调,所有的通过率比较都是"配置相关"的,不能直接拿来断言哪个模型更强。

怎么筛出真正靠谱的题目

光有对照实验还不够,研究者还得决定,这15个任务里哪些配得上被留下来,成为将来可能用于训练的候选题库。

他们设计了一套筛选规则,本质上是三条硬指标:第一,用最强的Opus配置加上知识文档,通过率必须达到60%以上;第二,同样是Opus,但不给文档,通过率必须是0%;第三,用较弱的Qwen配置加文档,通过率不能超过40%。三个条件同时满足,这个任务才留下来。

这套规则背后的逻辑其实挺直白。第一条保证任务不会难到连有知识的AI都做不出来;第二条保证任务确实是被知识"卡住"的,不是靠瞎蒙也能过;第三条则是个额外的安全阀,防止某个任务其实只是"稍微难一点",随便换个较弱的模型也能勉强蒙过。

经过这套筛选,15个任务里最终留下了7个:合同条款风险评分、论文索引构建、供应链成本核算、航空订票审计、临床变异体映射、抵押贷款托管分析,以及软件依赖审计。

值得说一句的是,研究者对这套筛选规则的局限性说得很坦诚。每个格子只跑了5次试验,这意味着哪怕只翻转一次结果,通过率就能跳动20个百分点,这是个相当粗糙的筛子,不是什么严谨的统计检验。而且用来筛选任务的这批结果,本身就不能反过来当作"这套筛选方法很有效"的独立证据,因为你是用同一批数据既做筛选又做验证,这在方法论上属于循环论证,论文里也明确点出了这个问题,没有藏着掖着。

验证答案对不对,靠的是什么

任务筛出来了,接下来的问题是:怎么给AI的答案打分?

这里论文区分了两类知识门槛。第一类叫约定门(Convention Gate),是那种纯粹靠人为规定、无法从常理推导的东西,比如内部阈值、别名对照表;第二类叫算子门(Operator Gate),是那种理论上可以自己推导,但推导起来极其麻烦、容易算错的复杂算法,比如某种特定归一化方式下的图论中心性计算,或者金融领域的特定波动率公式。

约定门:考验的是AI有没有拿到"标准答案表",因为这种规则本身没有对错之分,纯粹是行业约定俗成。

算子门:考验的是AI在时间压力下,能不能不借助文档独立重新推导出正确的复杂算法,属于能力和效率的双重考验。

两种门槛都会把具体的执行细节,比如数据解析、去重、图结构搭建,留给AI自己处理,所以并不是说有了文档任务就变得轻而易举,AI依然要展现真正的执行能力。

有了这两类门槛的划分,验证机制也分成两条路。对于结构化输出的任务,比如成本核算这种有明确数值答案的,研究者写了独立的Python程序去重新计算一遍标准答案,用严格的数值容差(通常是0.0001)去比对AI的输出,这是完全自动化、不掺杂主观判断的验证方式。

对于那些没法用一个简单数字衡量对错的开放式任务,比如让AI写一份合规审查报告,研究者引入了按条目打分的评分标准。每个任务被拆解成多个具体的评判点,只有全部评判点都通过,这个任务才算通过。这种"全对才算过"的设计有个专业说法。

命名条目评分:将复杂的开放式任务拆解为若干个具体、可独立判断对错的检查点,只有全部检查点都通过,任务才算成功,每个失败点都能定位到具体哪一项没达标。

值得一提的是,虽然论文详细介绍了这套评分标准的设计,但在实际报告的15个校准任务里,全部使用的是第一种确定性验证路径,没有一个任务用到了评分标准判断这条路,这一点论文里也说得很清楚,没有夸大自己的验证覆盖面。

文档能被压缩到多小

论文的附录部分做了一个挺有意思的小实验,专门针对论文索引构建这个任务,看知识文档到底能被精简到多小而不影响效果。

研究者准备了三个版本:完整版4379字节,精简版只保留核心规则、砍掉所有解释和示例,1078字节,相当于压缩到原来的四分之一,还有一个完全空白的版本作对照。

结果精简版和完整版的通过率都是100%,跟空白版本的0%形成鲜明对比。这说明对于这个特定任务,真正起作用的不是文档里那些解释性文字,而是几条核心规则本身,比如某种归一化排序规则、几张别名对照表。

不过研究者也很谨慎地提醒,这只是单个任务的个案观察,不能当成一个普遍规律。压缩到什么程度会真正影响效果,这个实验并没有测出边界在哪,只是证明了"至少可以压缩到这么小",具体的极限还没探到底。

这套方法离真正训练AI还有多远

看到这里你可能会问,这些精心设计的任务是不是已经可以直接拿去训练AI了?

答案是:还不行。

论文标题里那个"无知还是无能"的问题,其实是在提醒大家一件容易被忽略的事:一个AI智能体表现差,原因可能是真的不懂某个领域知识,也可能只是操作层面出了岔子。这两种失败模式对训练策略的启示完全不同,如果不把它们分开测量,你很可能会把训练资源浪费在错误的方向上。

研究团队自己反复强调,这篇论文只是验证了任务构造协议本身是否按预期运作,并没有真正拿这7个筛选出来的任务去训练模型、检验训练效果。这是两件事:证明"这个考试出得公平",和证明"用这份考卷训练出来的学生更优秀",中间还差着一大截实验。

论文里也提到一个有意思的推测。随着AI的自我纠错能力越来越强,那种纯粹靠"能力不够"制造出来的难题,会慢慢被AI用反复试错的方式攻破,就像一个学生虽然没背过某道题的标准解法,但反复琢磨也能自己推出来。但约定门这种知识,本质上是私有规定,任务的说明和运行环境里根本没有留下任何线索,AI再怎么反思、再怎么试错也无从推导。这大概是这类"锁死"设计能持续保持难度的原因,前提是它确实没有被泄露到别的渠道里。

这也是为什么论文花了大量篇幅讨论"泄露审计"这件事,专门检查任务说明和运行环境里有没有不小心暴露知识文档的内容。但研究者也坦承,目前只有九个任务配备了可执行的自动审计脚本,剩下六个任务的审计覆盖并不完整,静态扫描也没法排除所有形式的语义泄露或间接泄露。这种坦诚在学术论文里其实不算常见,很多研究会选择性地淡化自己方法的局限,但这篇论文几乎在每一节都主动列出了"这个结论不能说明什么"。

Q&A

Q1:知识门控任务构造是什么?

A:这是一套让AI智能体测试更公平的设计协议,把任务拆成"任务说明"和"知识文档"两部分,通过控制文档的有无来精确测量AI是否真的依赖专业知识才能完成任务,而不是靠蒙或者背题库。

Q2:为什么Opus有文档和没文档的表现差这么大?

A:论文用15个专业任务做了对照实验,Opus拿到知识文档时通过率是68.0%,完全不给文档时通过率是0%,说明这些任务设计得确实把私有知识作为解题的关键门槛,不是靠AI自身推理就能蒙对的。

Q3:AI答不对任务,是因为不懂知识还是不会操作?

A:论文里的背诵探针实验发现,Qwen模型能把知识文档的规则完整复述并正确套用,单轮对话通过率是100%,但放到完整的代理执行环境里通过率却是0%,说明失败原因更可能出在工具使用、文件读取等操作环节,而不是知识缺失。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询