普林斯顿大学:一项新技术让AI学会了“看清证据”再作答

这项由普林斯顿大学与加州大学戴维斯分校联合开展的研究,于2026年6月15日以预印本形式发布在arXiv平台上,编号为arXiv:2606.17053v1。研究方向涵盖自然语言处理与多模态人工智能,有兴趣深入了解的读者可通过该编号查阅完整论文。

一、AI有时候明明"看到了",却偏偏"视而不见"

考虑这样一个场景:你雇了一位助手帮你查阅一份几十页的合同,找出某条关键条款,然后根据那条条款回答你的问题。你的助手把合同通读了一遍,信誓旦旦地给出了答案——然而他的答案其实是根据自己的"常识"猜出来的,根本没有仔细去核对合同里那条决定性的条款。结果当然是答错了,而且错得莫名其妙。

现实中的大型语言模型(AI大脑)正面临着完全相同的困境。这类模型已经在数学推理、代码编写、图像理解等各种任务上展现出令人印象深刻的能力,但研究人员发现了一个隐藏的缺陷:当正确答案藏在一段很长的文字或一张复杂的图片里,需要模型精准定位到某个关键细节时,模型常常会"滑过"那个细节,转而依赖自己训练时积累的"直觉"给出一个听起来合理但实际上错误的答案。

研究团队把这种现象命名为"上下文失察"(context unawareness)——相关信息明明就摆在那里,模型却没有真正将其作为决策依据。论文中举了两个生动的例子:在代码编辑任务里,AI助手在对一个程序做了36轮修改之后,无意间删除了一个之后仍会被用到的变量,导致程序报错崩溃——因为它没有持续追踪自己之前看到的代码上下文;在视觉问答任务里,当被问到"当x趋近于-1时,g(x)的极限是多少",明明图上清清楚楚地画着答案是3,模型却回答了2——因为它没有真正"读"那张图。

这两个失败案例揭示了一个共同的根源:AI在给出答案时,并没有将答案锚定在那个真正支撑答案的具体证据上。普林斯顿大学的研究团队决定正面解决这个问题,并提出了一种名为CONTEXTRL(上下文感知强化学习)的训练方法。

二、先用一个"测验"量化问题有多严重

在着手解决问题之前,研究团队首先想搞清楚:这个"上下文失察"的毛病,在当今主流AI模型里到底有多普遍、有多严重?

他们设计了一种简洁的测试方式,可以把它理解为"找出有效证据"的配对测验。每道题的形式是这样的:给AI看一道问题和一个答案,再同时展示两段极其相似的"背景材料"(比如两段代码执行轨迹,或者两张高度相似的图片)。这两段背景材料的区别非常微妙,但关键在于,其中一段材料实际上支持那个给出的答案,另一段则支持一个不同的答案。AI需要判断:哪段材料才是那个答案真正的依据?

这道题对人类来说并不难——只要仔细读就能分辨。但测试结果令人大跌眼镜。来自OpenAI的GPT-5和来自Anthropic的Claude Opus 4.7这两款顶级商业模型,在代码轨迹配对和图像配对两类测试上,准确率分别达到了0.99和0.98、0.84和0.83,表现相当可靠。然而,在开源模型中表现出色的Qwen3-VL 8B和Qwen3.5 9B,其准确率仅仅在0.58和0.525、0.595和0.575左右——而随机猜测的期望准确率是0.5。换句话说,这些在各种标准测试榜单上成绩亮眼的开源模型,在"找出自己答案的依据"这件事上,几乎和瞎猜没什么区别。

这个发现非常重要:一个模型在标准测评上得高分,并不代表它真的在"读"题——它可能只是靠积累的"本能"在答题。两者之间存在高达40个百分点的差距,清晰地说明了问题的严重性。

三、训练AI"找证据"的核心方法

找到了病因,接下来就是开药方。CONTEXTRL的核心思路可以用一句话概括:除了奖励AI答对题,还要额外奖励AI能够正确指出"我的答案是从哪里来的"。

在传统的强化学习训练中,AI就像一个参加闭卷考试的学生——交卷后老师只告诉他"对"或"错",不解释原因。这种训练方式可以让AI学会答题,但不能确保AI是通过真正理解材料来答题的。CONTEXTRL则在此基础上增加了一个辅助练习:每次训练时,额外给AI出一道"配对题",让它判断两段极其相似的背景材料中,哪一段才是某个特定答案的真正依据,并根据判断结果给予额外的奖励信号。这个额外练习不要求AI生成任何文字,只需要比较两段材料对应答案的"贴合程度",在技术层面,这通过比较模型对两个选项("A"或"B"这两个字母)的原始评分来实现,并且用一个平滑的数学函数(对数sigmoid)将差值转化为可用于训练的信号,同时还设置了一个"截断值"c来防止训练信号过于极端。

训练时,两种信号按比例混合:主要的任务奖励(解决实际问题)与辅助的上下文选择奖励(找出正确依据)共同驱动模型进步,两者的权重由一个参数λ控制。研究团队发现,当λ设置得太大时,辅助信号会压过主信号,反而损害模型解决实际问题的能力;当λ太小时,辅助信号形同虚设。在代码智能体实验中,λ=0.005时效果最佳;在多模态实验中,根据模型不同,λ=0.001或0.005时效果最佳。

这个辅助练习的精妙之处在于它的"间接性":它不直接告诉AI"答题时要看这里",而是通过反复训练"判断哪段材料更支持这个答案",让AI逐渐内化出一种对上下文的精细感知能力,并在实际答题时自然地将这种能力用上。

四、为AI量身定制的"对比材料"是怎么制作的

CONTEXTRL的训练需要大量高质量的"对比材料对"——两段极其相似、却在关键细节上支持不同答案的背景材料。制作这种材料本身就是一项精细的工程。

在代码智能体方向,研究团队从一个包含6.6万条代码调试轨迹的数据集(SWE-smith)出发,通过一套层层递进的筛选流程来挖掘合适的配对。首先,两条轨迹必须来自同一个代码仓库和同一个版本;其次,两条轨迹对应的代码修改必须发生在同一个文件里;再往深走,两者修改的必须是同一个函数或同一个类;最后,对应的问题描述必须有所不同但又相互关联——比如同一个函数的两种不同边界情况。为了防止AI通过直接读取修改内容来"作弊",所有轨迹中的具体代码修改都被替换为占位符""。经过这套严格筛选,再加上GPT-5.4的自动质量审核和人工复核,最终只有1000对轨迹从6.6万条原始数据中存活下来,留存率仅1.5%。这种苛刻的筛选确保了每一对材料都需要真正理解上下文才能区分,而不是靠表面特征取巧。

在多模态方向,研究团队采用了两种完全不同的制作方式,各有其适用场景。对于自然图像(如照片),他们使用生成式图像编辑工具:给定一张图片、一个问题和正确答案,先用GPT-5.4生成一段编辑指令,指示应该如何修改图片使得答案变成另一个值,然后用Nano Banana 2这款图像编辑模型执行修改,最后再由GPT-5.4审核编辑后的图片是否自然、是否只改动了与答案相关的区域而没有破坏其他内容。这个流程的拒绝率高达约65%,从2000张候选图片中最终只保留了约700对高质量对比图像对。对于结构化图像(如数学几何图、图表、科学示意图),直接编辑往往会破坏图像的内在逻辑,因此改用相似度检索的方式:用一个专门的图像嵌入模型(Qwen3-VL-Embedding 8B)将图片转化为向量,然后在超过20万张候选图片中,为每张图寻找视觉上极为相似(余弦相似度不低于0.85)但答案不同的配对图片,再由GPT-5.4过滤掉语义不相关或标注有问题的配对,最终保留了6300对高质量配对,留存率约3.1%。两种方式合计产出约7000对对比图像配对,覆盖图表、几何、数学、科学图解和自然图像五大类视觉场景。

五、实验结果:在17个测试基准上全面超越

研究团队在极为广泛的评测场景下验证了CONTEXTRL的效果,涵盖了5个长时程推理基准测试和12个多模态视觉理解基准测试,共17个测试维度。

在代码智能体方向,以Klear-AgentForge-8B(一款专门为复杂代码智能体任务微调的8B参数模型)为基础,标准训练方法(仅用任务奖励的GRPO)在SWE-Bench Verified和SWE-Bench Lite两个代码修复测试上,分别取得了28.0%和21.7%的解决率;而加入CONTEXTRL之后,这两个数字提升到了30.2%和24.0%,提升幅度分别为2.2和2.3个百分点。以通用模型Qwen3-8B为基础时,CONTEXTRL同样将两项测试的成绩从6.20/2.70提升到了7.00/4.00。

更令人关注的是CONTEXTRL在超出训练范围的测试上的表现。研究团队还在三个与代码修复毫不相关的测试上进行了评估:LiveCodeBench v6(竞技编程题目解题率)、LongBench v2(长文档问答准确率)以及"大海捞针"测试NIAH(在超长文本中精准定位特定信息的召回率)。在这三个测试上,CONTEXTRL不仅超过了标准训练方法,甚至超过了体量大得多的参考模型。以Klear-AgentForge-8B为例,NIAH测试从65.5提升到71.3,LongBench v2整体从27.0提升到29.6,长文档子集更是从24.1提升到了28.7。尤其值得注意的是:标准的GRPO训练在NIAH测试上相比未训练的基础模型反而出现了退步(从68.3降到65.5),而CONTEXTRL却能在这一测试上超越基础模型。这说明单纯用任务结果奖励来训练,有时候反而会让模型在需要精细上下文感知的任务上"退化",而CONTEXTRL学到的是一种更基础、更通用的能力。

在多模态方向,以Qwen2.5-VL-7B为基础模型,CONTEXTRL在12个测试基准上的平均准确率从51.4%提升到了53.4%,平均提升2.0个百分点,而且在每一个单独的测试上都有所提升,没有任何一个测试出现下滑。以Qwen3-VL-8B为基础时,平均准确率从64.1%提升到65.7%,平均提升1.6个百分点,同样在12个测试上全面领先。这12个测试覆盖了数学推理(MathVista、MathVerse、MathVision)、综合多模态理解(MMMU-Pro、MMMU)、精细视觉感知(V*、MMStar、BLINK)、科学推理(ScienceQA、PhyX、OlympiadBench Physics)和真实场景理解(MME-RealWorld Lite)等极为多元的场景,没有任何一个大类出现能力下降,说明提升是全面的,而非某类任务的专项优化。研究团队还将CONTEXTRL与一种名为PAPO的同类方法进行了比较——PAPO专门为多模态感知设计了更精细的奖励机制,在Qwen2.5-VL-7B上平均提升约0.8个百分点,而CONTEXTRL的平均提升是2.0个百分点,超过了这个专项方法。

六、关键对照实验:数据本身并没有魔力,关键是怎么用

这是整篇论文中最具说服力的部分。研究团队意识到一个潜在的质疑:CONTEXTRL的提升,是真的来自那个"判断哪段材料支持答案"的训练目标,还是仅仅因为训练时用到了额外的对比数据?换句话说,如果把同样的对比材料以其他方式用在训练里,能不能得到同样的提升?

为此,他们设计了两种"对照实验"方法,都使用完全相同的对比材料,只是换了一种用法。第一种是"监督学习版"(DA-SFT):先用对比材料做监督微调,让模型学会判断哪段材料支持答案,训练好之后再做常规的强化学习任务训练。第二种是"结果奖励版"(DA-RL):直接把对比材料混入强化学习训练流,当模型选对了支持材料就给奖励1,选错给奖励0,和任务题目共享同一套奖励机制。

结果非常戏剧性。在代码智能体测试上,DA-SFT造成了灾难性的崩溃:以Klear-AgentForge-8B为基础时,SWE-Bench Verified的解决率从28.0%暴跌到6.4%;以Qwen3-8B为基础时,更是直接归零,变成了0.00%。原因在于:监督微调训练的是"选择题"式的短答案,这种训练方式把模型在长达数十轮对话中稳定执行复杂操作的能力彻底破坏了。DA-RL的表现则是"毫无建树"——其结果与完全不用对比材料的标准GRPO几乎无法区分,对于Klear-AgentForge-8B,DA-RL得到27.6/21.7,标准GRPO是28.0/21.7,差异在统计噪声范围内。在多模态测试上,DA-SFT的平均准确率与标准GRPO几乎持平(51.5 vs 51.4,64.1 vs 63.9),DA-RL也只有微乎其微的提升(51.8和64.3)。相比之下,CONTEXTRL在两个模型上分别取得了53.4和65.7的平均分,全面领先。

为了进一步理解这些差异背后的原因,研究团队还做了一个"机制检验":用那套"找出有效证据"的测验来评估每种方法学到的上下文选择能力,然后将这个能力得分与实际任务表现放在一张坐标图上对比。结果呈现出三种截然不同的模式。标准GRPO和DA-RL在上下文选择能力测验上的得分几乎没有提升,停留在接近基础模型的水平,说明仅靠任务结果奖励确实无法有效培养对上下文的精细感知。DA-SFT的上下文选择能力得分最高,达到85%到93%,说明监督学习确实让模型学会了如何区分材料——但这个能力的提升完全没有转化为实际任务的进步,在代码智能体上甚至造成了灾难性下降,说明"会选材料"和"解决实际问题"在训练层面是可以完全脱节的。只有CONTEXTRL同时在两个维度取得了提升:上下文选择准确率高,实际任务表现也在提升。

这组实验有力地证明了:那7000对对比图像和1000对对比轨迹本身并不具有魔力,关键在于如何将其转化为训练信号。CONTEXTRL将上下文选择任务作为一个在线的、辅助性的训练目标,嵌入在强化学习的主循环里,让模型在保持原有任务能力的同时,逐渐建立起对上下文的精细感知,这才是真正有效的设计。研究团队也指出了CONTEXTRL之所以能避免DA-SFT和DA-RL的两种失败模式的原因:一方面,GRPO自带的重要性采样截断和KL散度约束(一种防止模型偏离太远的技术手段),配合辅助损失自身的截断设计,将训练扰动控制在可控范围内,避免了DA-SFT式的分布崩溃;另一方面,直接比较两段材料的相对评分这种方式产生的梯度信号,在每个训练样本上都是有效的,而不像二元结果奖励那样在模型不会选对的时候完全没有学习信号,这解决了DA-RL的稀疏信号问题。

七、这项研究的边界和局限

诚实地评估一项研究,就不能回避它的局限。研究团队在论文末尾坦率地指出,所有实验都在参数规模不超过10B的模型上进行,尚未验证CONTEXTRL在更大的模型(如30B或70B参数规模)上是否同样有效。此外,实验中使用的基础模型大多来自同一个模型家族(Qwen系列),在更多样化的模型家族上的适用性还有待进一步验证。训练所需的硬件配置(4块NVIDIA H200显卡)对于大多数研究团队来说门槛较高,每次训练的计算成本大约在240到288 GPU小时之间,对资源的要求不算低。另外,对比材料的构建本身也依赖GPT-5.4进行质量审核,这引入了对商业API的依赖。这些都是在应用和推广CONTEXTRL时需要考量的实际因素。

归根结底,这项研究揭示了一个AI领域长期被忽视的盲区:标准测评榜单的高分,并不能保证模型在需要精细定位证据的场景下表现可靠。在代码修复、长文档理解、视觉推理这些对"读清楚材料"要求极高的任务里,AI的这种"上下文失察"可能悄悄造成严重错误,而使用者往往难以察觉。CONTEXTRL提供了一个不依赖特定架构设计、不需要大规模人工标注的解决方案:通过在正常训练流程中加入一个轻量的辅助目标,让AI逐渐学会将自己的判断锚定在真实的证据之上,而不是依赖训练时积累的直觉惯性。

这对于普通用户意味着什么?当你把一份合同或一段代码交给AI助手处理时,你希望它给出的答案是真的来自那份材料,而不是来自它的"猜测"。CONTEXTRL朝着这个方向迈出了有实证支撑的一步。有兴趣追踪这个方向进展的读者,可以关注arXiv:2606.17053这个编号的后续版本更新。

Q&A

Q1:CONTEXTRL和普通的强化学习训练有什么区别?

A:普通强化学习训练只告诉AI答案是对还是错,不管AI是怎么得出答案的。CONTEXTRL在此基础上加了一个额外练习:让AI判断两段极相似的背景材料里哪段才是某个答案的真正依据,并对判断正确的情况给予额外奖励。这个辅助练习通过比较模型对两个选项的原始评分来实现,以一种平滑的数学方式转化为训练信号,帮助AI学会将答案锚定在真实证据上,而不是靠直觉猜测。

Q2:为什么直接用对比数据做监督学习反而会让代码智能体崩溃?

A:监督微调训练的是"在两个选项里选一个"的短答案能力,训练样本都是简短的选择题。但代码智能体需要在长达几十轮的对话中持续稳定地执行复杂操作,这两种任务在形式上差异极大。用短答案选择题微调之后,模型处理长对话的能力就被破坏了,就像一个习惯了选择题的人突然要做开放性的长篇论文写作,适应不过来。CONTEXTRL通过将上下文选择作为在线辅助目标而非独立的预训练阶段,配合GRPO的约束机制,避免了这种分布崩溃。

Q3:对比材料对是怎么保证质量的?

A:研究团队采用了极为严格的多层筛选机制。对于代码轨迹,通过仓库、文件、函数等条件层层筛选,再用GPT-5.4自动审核是否存在快捷方式线索或标签歧义,不确定的还要人工复核,最终只有1.5%的原始轨迹入选。对于图像,自然图像经过生成、自动审核两道关卡,拒绝率约65%;结构化图像在视觉相似度阈值0.85的约束下检索,再经GPT-5.4过滤,留存率约3.1%。这种苛刻的筛选确保每对材料只能通过真正理解内容来区分,而不是靠图像风格或文本格式等表面特征。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询