腾讯华为清华联手揭开AI搜索的致命盲区

这项研究由腾讯混元与清华大学深圳国际研究生院联合开展,论文以预印本形式发表于2026年7月,论文编号为arXiv:2606.27669v2,有兴趣深入了解的读者可通过该编号查询完整论文。

你有没有碰到过这样的情况:朋友帮你去餐厅订位,你说"订个好位置",他没多问就直接去了,结果订到靠近厨房又吵又热的角落?事后你才意识到,你们俩对"好位置"的理解根本不一样。这个令人抓狂的小插曲,放大了之后,正是当下最顶尖的AI搜索助手们每天都在犯的错误——只不过代价要昂贵得多。

研究团队发现,现有的AI搜索系统在处理复杂信息检索任务时,普遍存在一个被忽视的根本性缺陷:当用户的问题本身就说不清楚时,这些系统要么无脑乱猜,要么一头扎进无休止的搜索循环,却从来不懂在关键时刻停下来问一句"你的意思是……?"为了量化和评估这个问题的严重程度,研究团队构建了一个名为DISCOBENCH的测试基准,全称是"Deep Interactive Search with ClarificatiOn Benchmark",也就是"具备澄清能力的深度交互搜索基准"。这是目前学界首个专门针对AI搜索智能体澄清模糊问题能力的系统性测试平台。

一、从订餐到查资料:问题不说清楚会有多严重

要理解这项研究解决的是什么问题,先来感受一下这种"模糊传染病"有多可怕。

论文给出了一个绝妙的例子,完整地展示了模糊问题如何像多米诺骨牌一样一路翻倒。原题大意是这样的:"某人在1936年提出了一种逻辑机器的通用模型。1999年,此人获得了一本著名杂志的荣誉。该杂志1928年的年度人物创立了一家著名汽车公司。该公司后来在中国建立了一家子公司。在这家子公司成立的同一年,哪位教授指导了当年的诺贝尔化学奖得主完成了博士论文?"

光是读完这道题就已经头晕了,对吧?现在再加上模糊条件:原题里精确说明了是"哪家子公司",但被改成了含糊的说法,导致有两家公司都符合条件——北京吉普和克莱斯勒(中国)汽车销售有限公司都满足要求。同样,"2005年诺贝尔化学奖得主"也变得模糊,因为那一年有三位联合获奖者。

一个没有澄清能力的AI搜索助手会怎么做?它会随便选一个自认为"看起来更合理"的答案继续往下走。比如它选了北京吉普,那么接下来所有的搜索都会基于这个错误前提展开,最终找到一个完全错误的教授名字作为答案。而且全程没有任何警报,表面上看起来一切运行正常。这就是研究者们所说的"错误传播"——一个早期的模糊节点,会把后续所有步骤都带偏,像一列火车在第一个岔路口走错了方向,之后每一站都会偏离目的地更远。

相比之下,一个真正聪明的搜索智能体应该在发现两家子公司都符合条件时,停下来问用户:"我找到了两家公司都满足条件,请问您能提供更多线索吗?"用户说"我记得是一家全资的汽车销售公司",助手立刻锁定克莱斯勒(中国),后续搜索也就全部走上了正确轨道。

这个看起来简单的"多问一句",在AI搜索领域却是一项几乎没有被认真研究过的能力。

二、为什么现有测试根本无法发现这个问题

在构建DISCOBENCH之前,研究团队仔细梳理了目前学界已有的相关测试平台,发现它们各自都有明显的局限性。

现有的主流搜索智能体测试,比如GAIA、BrowseComp、AgentBench等,基本上都默认用户的问题是清晰完整的,重点考察AI能不能通过多步骤推理找到答案,完全没有考虑"万一问题本身就说不清楚怎么办"。另一类专门研究"模糊问题"的数据集,比如AmbigQA和DEEPAMBIGQA,倒是关注了问题本身的模糊性,但它们都是静态的——只是把一道模糊题摆在那里,让AI直接给答案,没有模拟"用户和AI来回交流"的动态过程。还有一类"对话交互"测试,比如IN3和UserBench,虽然包含了多轮对话,但场景局限在封闭的沙盒环境里,没有真正连接到广阔的互联网搜索。最新的INTERACTCOMP虽然开始把交互引入搜索场景,但覆盖的模糊类型有限,用户反馈的形式也过于简单(只有"对/错"两种选项),不够贴近真实人类对话的多样性。

DISCOBENCH正是为了填补这些空白而生。它的核心设计理念是:把模糊性看作一种在多步骤推理过程中动态传播的现象,而不是问题本身的固定属性。换句话说,它不是在问"这道题清不清楚",而是在问"AI在一步一步搜索的过程中,能不能在恰当的时刻察觉到自己已经陷入了模糊地带"。

三、DISCOBENCH是怎么搭建起来的

构建这个测试基准是一项耗费大量人力的工程,整个过程分两大阶段,动用了一位专家级标注指导员、六名来自多个专业方向的本科标注员和两名质量检查员,总标注费用高达39000美元。

第一阶段是打地基:构建高质量的多跳问题。研究团队首先手工从11个不同的现实知识领域中收集种子话题,覆盖影视、游戏、学术、艺术、体育、地理、音乐、金融、医药、科技和政策法律。知识来源包括维基百科、百度百科以及谷歌、必应、百度等搜索引擎的结果页面。值得注意的是,DISCOBENCH主要以中文构建,目的是更真实地反映中文网络环境下的模糊模式和检索行为。

所有题目必须满足三个硬性条件:答案必须可以客观核实;不能单靠常识推理得出;必须依赖外部搜索才能完成。在这些条件下,研究团队先让AI生成初步的单跳问答对,再通过图结构扩展和外部检索结果构建候选的多跳推理链,最后由人工标注员进一步审核、重构,确保逻辑严密。

第二阶段是注入"故意的模糊"。在已有的多跳推理链基础上,研究者识别出哪些节点最适合引入模糊性——判断标准是:该节点的目标实体必须与其他实体有足够多的共同属性,使得放宽限定条件后会出现多个合理候选;同时,后续的推理链在模糊状态下仍然可以继续执行(否则AI会直接卡死);最后,这个模糊必须能够通过用户提供的一条线索来解决。

模糊注入的具体操作是将精确的限定条件替换为多个候选实体都满足的宽泛描述,比如把"获得GWB独立游戏大奖赛铜奖"改成"获奖"。人工标注员还需要为每个模糊节点准备一条"区分性事实"——也就是用户在被AI询问时会提供的那条关键线索,例如"我记得是获GWB独立游戏大奖赛铜奖的那个"。

经过严格的五阶段质量控制(结构验证、AI探测、模糊与错误评估、人工复核、最终裁决),最初的314个候选样本中有78个(约24.8%)被淘汰,最终保留了211个高质量样本,包含463个模糊节点,覆盖11个领域和4种模糊类型。

四、四种"模糊陷阱",哪种最难被发现

DISCOBENCH把模糊性分为四种类型,每种的"难度系数"和"危险程度"都不一样。

第一种叫"实体模糊",即多个不同的实体都满足问题的描述。这是最常见的类型,占所有模糊节点的38%。比如某家公司有好几款"获奖游戏",你说"那款获奖游戏"时,AI根本不知道你说的是哪一款。这类模糊的危险在于,AI很容易自信地选一个"看起来最有名"的候选项继续走,而不会意识到需要停下来确认。

第二种是"版本模糊",占约23.5%。这类问题依赖特定时间点或版本,但描述时只给了一个宽泛的时间窗口。比如"2018年3月至4月的某场中超比赛中",实际上这段时间里某球员有两次换人记录,只有确切日期才能区分是哪一场。

第三种是"标准模糊",占约11.4%,也是最隐蔽的一种。同一个描述,在不同的评判标准下会指向完全不同的答案。比如"三大啤酒节城市中纬度超过北纬40度的那个",如果是世界三大啤酒节,答案是德国慕尼黑;如果是中国三大啤酒节,答案是哈尔滨。两者都满足字面描述,但答案截然不同。

第四种是"事实错误模糊",占约27%。这类问题本身就包含了一个不存在于现实中的描述,比如"被称为哈吉米之国的国家"——这根本不是任何国家的真实别称,纯粹是编造的。这类情况下,AI不管怎么搜都搜不到匹配结果,正确做法是识别出这是一个事实错误,然后请用户澄清,而不是乱猜一个国家。

从检测难度来看,事实错误类模糊反而最容易被AI发现,因为搜索结果会明显给出"找不到"的信号,这个矛盾足够明显。相比之下,实体模糊和标准模糊更难识别,因为搜索是能找到结果的,只不过找到了不止一个,而AI往往会直接选其中一个继续推进,并不会意识到需要进行区分。

五、如何测试AI的"何时该问"能力

DISCOBENCH设计了一套完整的评估框架,从四个维度衡量搜索智能体的表现。

第一个维度是"任务完成度",也就是最终答案对不对,以及在多步骤推理链中通过了几个关卡。第二个维度是"模糊识别能力",通过准确率和F1分数衡量AI有没有在该提问的地方提出澄清请求,有没有在不该提问的地方瞎提问。第三个维度是"交互策略质量",分两个子指标:CE-A衡量AI提出的澄清问题有没有问到点上;CE-B衡量AI在得到用户回应之后,有没有成功利用这条线索推进答题。第四个维度是"成本效率",包括平均提问次数、搜索工具调用次数和总token消耗量。

为了模拟真实的用户交互,研究团队专门设计了一个"用户模拟器"——用谷歌的Gemini-3-Flash-Medium模型担任虚拟用户的角色。这个模拟器会根据预先设定的区分性事实,在AI提出正确的澄清问题后给出相应的线索提示。模拟器遵循严格的规则:只有当AI的问题真正命中了当前模糊节点的关键点时,才会释放线索;如果AI问错了方向,模拟器会拒绝透露,不给无效问题"搭台阶"。

研究团队共测试了11个当前最具代表性的大语言模型,包括Claude-Opus-4.7、GPT-5.4、Gemini-3.1-Pro-Preview、豆包Seed-2.0-Pro、DeepSeek-V4-Pro、Qwen-3.6-Max、MiniMax-M2.7、GLM-5.1、MiMo-v2.5-Pro、Kimi-K2.6和混元3.0-Preview。所有搜索调用都通过Tavily搜索引擎实现。测试设有两种提示模式:一种是"中立模式",AI不知道题目里可能有模糊之处,全靠自己判断是否需要澄清;另一种是"引导模式",提示词里明确告知AI"这道题可能有模糊的地方,必要时请主动提问"。

六、成绩单出炉:顶尖AI全线表现不佳

测试结果让人既意外又在意料之中。

在中立模式下,表现最好的豆包Seed-2.0-Pro端到端准确率也只有43.1%,Gemini-3.1-Pro达到40.8%,大多数其他模型都在40%以下。MiniMax-M2.7和Qwen-3.6-Max分别只有16.1%和12.3%。换句话说,即便是当前最顶尖的AI搜索助手,在面对包含模糊节点的复杂多步问题时,大概有一半到六成的时间都会失手。

切换到引导模式后,整体表现有所提升:端到端准确率从平均28.6%提升到33.7%,关卡通过率从50.1%上升到57.6%,模糊检测F1分数从45.3%大幅跳升到64.9%。但问题也随之暴露:引导模式的提升主要集中在"模糊识别"层面,而不是"任务最终完成"层面。比如Claude-Opus-4.7在引导模式下关卡通过率提高了,但最终准确率却略有下降,说明它虽然提出了更多澄清问题,但这些互动并没有真正帮助它把整条推理链跑完。

研究团队还发现了一个特别值得关注的现象:工具调用次数越多,并不等于表现越好。Claude-Opus-4.7在所有模型中搜索次数排名靠前,但最终准确率却比豆包和Gemini都低。而一些表现糟糕的模型,搜索次数同样很多,却依然在最终答案上一塌糊涂。这说明DISCOBENCH确实不奖励"蛮力搜索",真正有价值的是在正确的时刻做出正确的决策。

七、"何时该问"和"怎么问"是两回事

研究中最有意思的发现之一,是"识别模糊"和"有效澄清"居然是两种完全独立的能力,高手在前者未必能在后者上同样出色。

Qwen-3.6-Max就是一个极端案例。在中立模式下,它的模糊检测F1分数只有可怜的16%,每道题平均只提了0.07次问题,基本上就是不问。但一旦它开口提问,命中率非常高:CE-A(问题准确率)高达94.7%,CE-B(澄清后推进率)也有89.5%。简单来说,它很少觉得"有必要问",但每次认为需要问的时候,都能问到点上。

MiniMax-M2.7则刚好相反。它提问的频率不低(中立/引导模式下平均0.61/1.10次),但CE-B只有60.7%/66.5%,意味着它经常问了也没用,要么没把问题聚焦到关键信息上,要么得到线索后仍然没能正确推进。

这个发现对AI系统的设计具有重要的实践意义:你需要同时训练两种不同的能力,不能以为把其中一种练好了就万事大吉。

八、行为模式分析:四种典型的"搜索性格"

为了更细致地理解各模型的行为差异,研究团队把AI在每个模糊节点上的行为轨迹归纳为四种"性格类型"。

第一种叫"直接猜答案"(DirectGuess):搜了很少几次(不超过3次)就直接给出答案,从不提问。第二种叫"搜了又搜再猜"(SearchHeavyGuess):搜索次数很多(超过3次阈值),但最终还是自己猜,从不提问。第三种叫"不搜直接问"(DirectAsk):在搜索之前就直接向用户提问。第四种叫"先搜再问"(SearchThenAsk):先通过搜索收集信息,发现多个候选或信息不足时再向用户提问。

从测试结果来看,"先搜再问"策略的成功率压倒性地高于其他三种,平均通过率高达93.4%,而"直接猜答案"只有56.5%,"搜了又搜再猜"更低,只有51.9%。

这里有一个反直觉的结论值得单独拿出来说:搜索次数最多的"搜了又搜再猜",表现居然比"直接猜答案"还要差。为什么?研究者的解释很有说服力:当一个模型搜索了很多次还没找到唯一答案时,往往说明它其实已经意识到存在多个候选了,但它没能把这种不确定性转化为"向用户提问"的行动,而是选择继续搜索或者硬猜。这种行为浪费了大量资源,最终结果还不如干脆一开始就猜。反观"直接猜答案"的模型,它们虽然也猜,但至少快速结束了无效循环。这个发现揭示了一个在当前AI设计中极为普遍却少有人关注的失效模式:过多的搜索行为有时是对已察觉但未表达出来的不确定性的一种消极应对方式。

九、模型越强、难题越难,模糊越隐蔽越危险

研究还对不同难度级别和不同模糊类型进行了交叉分析,得到了几条值得关注的规律。

从难度分级来看,随着模糊节点数量从1个(简单)增加到2个(中等)再到3个(困难),几乎所有模型的准确率都呈现明显的下降趋势。以豆包Seed-2.0-Pro高推理模式为例,简单题的准确率是65.9%,中等题降到45.1%,困难题只剩29.4%。即便是表现最好的模型,也无法逃脱这个规律。这说明模糊的积累效应是真实存在的,一旦推理链上出现多个模糊节点,就算每个节点单独处理还勉强可以,叠加在一起就会造成系统性崩溃。

从模糊类型来看,事实错误类的检测率相对较高,因为"找不到"本身就是一个强烈的警告信号。实体模糊和标准模糊则明显更难被察觉,因为搜索结果里确实能找到内容,AI容易被这种"假成功"麻痹,误以为自己找到了正确答案。

从推理努力程度来看,研究团队还额外测试了不同"思考力度"对结果的影响,以豆包为例,把推理努力级别从中等提升到高等后,平均得分从45.7%跳升到54.0%,模糊回忆率从37.2%提升到47.3%,提升幅度甚至大于在正常关卡通过率上的提升。这表明更强的推理能力主要帮助模型更好地识别"自己处于模糊状态",从而更积极地寻求澄清。但即便在最高推理力度下,准确率仍然不到45%,模糊回忆率也没能突破50%,说明这不是一个光靠"想更多"就能解决的问题。

说到底,这项研究揭示的是当前AI搜索助手设计中一个相当根本性的缺口。当下的技术路线把大量精力放在"能不能搜到答案"上,却几乎没有认真对待"知道自己什么时候搜不清楚"这件事。当AI面对一个说不清楚的问题时,它的本能反应是继续搜索,而不是停下来问一句。这在处理简单问题时还好,但在多步骤深度推理任务中,这种本能会导致灾难性的错误传播。

DISCOBENCH这个测试基准的价值正在于此——它用211道精心设计的题目,把这个问题的严重程度量化了出来,并且为未来的研究者提供了一个可以持续改进的评估平台。对于普通用户而言,这意味着在可预见的未来,当你使用AI助手处理复杂的多步骤信息查询任务时,最好在一开始就把条件说得尽可能清楚,而不是期待AI自己去猜你的意思。因为即便是今天最强的AI,在"察觉自己不知道"这件事上,还远没有你想象的那么聪明。

这项研究让人忍不住反思:或许我们在评价AI有多聪明的时候,一直用错了衡量标准。能找到答案,只是最基础的能力;知道什么时候自己还没准备好回答,才是真正的智识成熟。有兴趣深入了解这套测试体系和实验细节的读者,可以通过论文编号arXiv:2606.27669在arxiv.org上找到完整原文。

Q&A

Q1:DISCOBENCH测试的是AI搜索助手的什么能力?

A:DISCOBENCH专门测试AI搜索智能体在面对模糊、不明确或事实有误的用户问题时,能不能主动识别出问题说不清楚,并在合适的时候向用户提问来获取关键线索,而不是盲目猜答案或无休止地重复搜索。它覆盖实体模糊、版本模糊、标准模糊和事实错误四种类型,共211个测试样本。

Q2:为什么AI搜索助手搜索次数越多反而表现越差?

A:研究发现,当AI搜索了很多次仍找不到唯一答案时,往往说明它已经隐约意识到存在多个候选结果,但它没有把这种不确定性转化为"向用户提问"的行动,而是继续无效搜索或最终硬猜。这种行为浪费大量资源,结果却比一开始就直接猜还要糟糕,因为直接猜至少快速结束了无效循环。

Q3:DISCOBENCH发现当前最强AI的端到端准确率有多高?

A:在不给任何提示的"中立模式"下,表现最好的豆包Seed-2.0-Pro准确率只有43.1%,Gemini-3.1-Pro达到40.8%,大多数模型低于40%,最弱的Qwen-3.6-Max只有12.3%。即便切换到明确提示"注意模糊问题"的引导模式,整体平均准确率也只从28.6%提升到33.7%,说明当前AI在这项能力上仍存在显著短板。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询