当AI只能看到“最终成绩”却看不到“过程分”,还能学会做决策吗?

这项由威斯康星大学麦迪逊分校领导的研究于2026年6月发表,论文编号为arXiv:2606.18531v1,归类于统计机器学习领域(stat.ML)。有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。
想象一下这样一个场景:你是一位围棋教练,手边有大量历史棋局的录像,但每盘棋只有"最终胜负"这一条记录,没有任何"第几手走得好、第几手犯了错"的逐步点评。你能从这些数据中教出一个优秀的AI棋手吗?这个看似简单的问题,实际上触及了人工智能训练中一个极其基础却长期被忽视的核心难题。威斯康星大学麦迪逊分校的研究团队正是围绕这个问题展开了深入的理论探索,他们想弄清楚:当我们只能看到"最终结果"而看不到"每一步的得分"时,机器学习算法到底要付出多大的代价,又在哪些情况下会彻底无能为力。
研究团队选择了"离线强化学习"这个框架作为研究舞台。离线强化学习可以理解为:机器不能自己去和环境互动探索,只能靠一堆别人留下来的"历史记录"学习如何做决策。这就好比一个厨师学徒没有机会亲自下厨练习,只能翻看前辈留下的菜谱和顾客评价单子,然后靠这些资料学会烹饪。在传统设定里,这份"历史记录"非常详尽,每一道菜的每一个步骤都有评分——这块肉切得几分、火候控制几分、调料比例几分。然而现实中的数据往往没那么好心,很多时候记录里只有一句话:"顾客满意"或"顾客不满意",其他什么都没有。研究团队把这种只有最终结果的反馈称为"轨迹级监督信号",并围绕它建立起了一套完整的统计理论。
一、从"每步打分"到"只看结果"——损失了多少信息?
先从最基本的问题入手:当我们把每一步的奖励信号压缩成一个轨迹末尾的总分时,究竟损失了多少学习所需的信息?研究团队为此提出了一个名为OPAC的算法——"基于结果的悲观式行动者-评判者算法"。这个名字听起来有点绕,但核心思想可以用厨师的比喻来理解。
OPAC的工作方式像是一位拥有"反向工程"天赋的厨师学徒。他拿到的只是顾客对整道菜的总体评分,但他会在脑子里构建一个模型,猜测每个步骤可能贡献了多少分——这叫"潜在奖励模型"。同时,他会用一种非常谨慎的态度评估自己还没尝试过的做法,对那些历史记录里很少出现的烹饪方式保持怀疑和保守——这就是"悲观主义"原则,专门用来应对离线学习中"数据覆盖不全"的问题。
理论上,研究团队证明了OPAC算法能够保证:学到的策略与最优策略之间的差距,以数学符号表示大约是H?乘以覆盖系数Csa(π*)除以样本量n的平方根,其中H是决策的步骤数,覆盖系数反映了历史数据对目标策略的覆盖程度。用大白话翻译:如果你想让误差缩小到ε以内,大约需要收集H?乘以覆盖系数再除以ε?条轨迹数据。
这个结论的关键之处在于与"每步都有奖励"的情形相比较。麻省理工等机构之前的研究表明,如果每走一步都能收到反馈,学到ε精度的策略只需要H?/ε?条轨迹。而在只有最终结果的情况下,这个数字变成了H?/ε?。多了整整一个H的因子。研究团队不仅给出了这个上界,还证明了这个H?/ε?是不可避免的下界——他们构造了一个非常"硬"的反例:只有两种行动选择、完全确定性的状态转移(也就是没有任何随机性)、数据覆盖也很充分,但任何算法都无法绕开这个代价。这意味着那多出来的一个H完全是由"把H步奖励压缩成一个数字"这件事本身造成的,和探索难度、状态转移的随机性、数据覆盖都没有关系。
二、更弱的信号——人类的"偏好比较"同样可行
现实中,数据往往比"总分"还要更不精确。以人工智能对齐领域最常见的场景为例:人类评估者不会给出具体分数,而只会比较两条对话或两段文本,告诉你"这个比那个好"。这种"偏好比较"是比数值标签更粗糙、更难利用的信息。
研究团队把OPAC的框架扩展到了这种偏好反馈的设定。他们假设偏好的产生遵循一种标准模型——Bradley-Terry-Luce模型,简单来说就是:两条轨迹的相对好坏概率,由它们累积奖励之差按照一条S形曲线决定,就像体育比赛中用积分差预测胜负概率一样。
在这个设定下,算法只需要把原来的"对总分做回归"换成"对偏好标签做逻辑回归",其余流程保持不变。理论结果令人惊喜:保证的误差界虽然多了几个与偏好模型本身相关的常数,但H?乘以覆盖系数除以n的平方根这一核心结构完全保留下来。换句话说,对于"优化累积奖励"这个目标而言,经过精心校准的偏好比较信号并不比精确的数值标签更难用——只要偏好信号足够可靠,同样的悲观式行动者-评判者机制就能把工作做好。这对很多依赖人类反馈训练大模型的场景来说是一个相当有力的理论支撑。
三、当"最终结果"本身就是目标——非线性轨迹标准的统计陷阱
前两部分探讨的都是同一个目标:优化累积奖励,只是观测手段不同。但研究团队还研究了一个更深层的问题:如果优化目标本身就是某种非线性的轨迹函数,而不是简单的步步相加,会发生什么?
这个问题来自很多真实场景。以医疗决策为例,医生关心的可能不是"每天的病情改善分数之和",而是"最终患者是否康复"——一个非线性的成功/失败标准。以数学解题机器人为例,目标可能是"每一步推导都正确"的全程正确率,而不是每步得分的累积。以围棋为例,胜负本身就是一个非线性的结果,和每步棋的"质量之和"未必成正比。
研究团队把这类问题统一建模为"广义目标离线强化学习"。形式上,他们引入了一个已知的聚合函数σ,把每步的潜在奖励r?, r?, ..., rH通过σ组合成轨迹的总价值R(τ; r) = σ(r?, r?, ..., rH),并以这个量为优化目标和观测信号。当σ是求和时,就回到了经典问题;当σ是连乘(全程成功率)时,就进入了全新的困难地带。
这部分的核心发现是一个令人震惊的不可能性结果:对于"全程成功"这一目标(每步必须全部成功才得1分,否则得0分),即使状态转移完全确定、数据覆盖充分,任何算法要想获得不平凡的性能,都可能需要指数级——也就是2^H条——轨迹数据。
用更直白的方式来理解这个结论:假设一个任务有100个步骤,每步都有两种选择(对的和错的),那么在最坏情况下,你需要检查2???种不同的情形才能找到正确策略。宇宙中的原子数也就大约10??个,所以这在实际中根本不可能完成。
原因在于这种"全程成功"的聚合方式会把信息藏得极深:绝大多数轨迹的最终结果都是0(因为只要有一步错了就全盘皆输),只有极少数轨迹(正确策略执行的轨迹)的结果是1。在随机收集数据的情况下,这些"有价值的1"出现的概率只有2^(-H),比找到一根针还难。
四、打破指数壁垒——两个结构系数决定能否高效学习
面对这个指数级的障碍,研究团队并没有止步于"这个问题无法解决"的悲观结论。他们进一步挖掘:在什么条件下,广义目标离线强化学习是可以高效完成的?他们的答案落在了两个精心设计的结构系数上,可以把它们理解为衡量"信息损失"程度的两把尺子。
第一把尺子叫做"奖励过程系数"κ_μ(σ)。它回答的问题是:当我们观察到轨迹的总分R(τ; r)时,能有多好地推断出每一步的潜在奖励r?, r?, ..., rH?系数越大,意味着不同的每步奖励组合被σ"捏合"成了几乎一样的轨迹总分,从标量结果反推每步信号的难度就越高。对于求和聚合,这个系数就是常数级别的,非常好;对于全程成功聚合,这个系数可以高达H乘以2^H,极度糟糕。
第二把尺子叫做"贝尔曼逆系数"χ_μ(σ)。它回答的是另一个层面的问题:在用动态规划(贝尔曼方程)逐步推导最优策略时,每步的目标函数值差异能多好地保留每步奖励的差异信息?如果这个系数很大,意味着动态规划过程中奖励差异会被"压扁",学到的价值函数就无法有效区分好坏策略。
这两个系数的意义在于:它们分别捕捉了两个相互独立的信息瓶颈——一个发生在"数据观测端"(从轨迹结果推断每步奖励),另一个发生在"算法优化端"(用贝尔曼更新传播奖励差异)。它们无法合并成一个系数,因为在不同场景下各有主次。比如,有了逐步奖励反馈后,数据端的瓶颈消失,只剩优化端的问题;而对于累积奖励目标,优化端完全没有压缩,χ_μ(σ)恒等于1。
在这两个系数都有限的条件下,研究团队设计了"广义OPAC算法",并证明了其误差界大约由两项主导:一项是V?_max乘以L乘以κ_μ(σ)乘以H?乘以Csa(π*)除以n的平方根,另一项是V?_max乘以L乘以χ_μ(σ)乘以H?除以n的平方根。其中V_max是最大价值、L是聚合函数的Lipschitz常数。这个结果表明,只要这两个系数是多项式级别的,就能保证算法的样本复杂度是多项式级别的,从而避免了指数级的诅咒。
从实用角度看,这两个系数为实践者提供了一个"可行性检查清单":在应用广义目标离线强化学习之前,先估计κ_μ(σ)和χ_μ(σ),如果两者都是合理的有限值,就可以放心使用算法;如果其中一个趋近于无穷大,就需要重新设计观测方式或目标函数。
五、理论的现实意义——从数学到应用场景的映射
这项研究的价值不仅在于给出了精确的数学界,更在于它为一系列实际应用提供了清晰的理论视角。
以大语言模型的强化学习微调为例,这正是当前最热门的AI对齐技术之一。当我们用人类对整段对话的评分或偏好来训练模型时,实际上就处于"轨迹级监督"的设定中。研究结果表明,这种训练方式相比有逐步反馈的情形会额外花费约H倍的数据——其中H可以理解为对话的轮次数或推理步骤数。这为"过程奖励模型"(每步打分)vs "结果奖励模型"(只看最终输出)的长期争论提供了理论上的定量刻画,也解释了为什么在数学推理任务上逐步验证(如DeepSeek-R1的训练方式)往往比只看最终答案对不对更有效——这不是工程经验,而是统计上的必然代价。
再以医疗AI为例,当数据集只记录"患者最终是否康复"而不记录每次治疗决策后的病情变化时,根据本研究的理论,关键问题是这个"康复/未康复"的标签能否有效区分不同的治疗策略(由κ_μ(σ)刻画),以及贝尔曼动态规划能否有效传播这种区分能力(由χ_μ(σ)刻画)。如果两者都合理,就可以从历史病历中学到好的治疗策略;如果不合理,就需要收集更细粒度的数据。
法律领域的AI助手、围棋等复杂博弈游戏、软件代码的自动生成——凡是"只知道最终结果却不知道中间每步好坏"的场景,都可以在本研究的框架下找到对应的理论保障或警示。
归根结底,这项研究做的事情可以用一个简单的比喻来概括:它就像是给各种各样的"只看成败"学习场景做了一张精确的地图,标注出哪里是坦途(可以高效学习)、哪里是沼泽(需要付出多项式代价但仍可达)、哪里是悬崖(指数级复杂度,实际上无法攀越)。知道自己处于地图的哪个位置,本身就是一种极有价值的知识。
这份地图告诉我们:从"每步打分"退化为"只看总分",代价是确定的,刚好多一个H的因子,不多也不少;从"总分"再退化为"偏好比较",代价几乎不增加;而一旦优化目标本身变成非线性的,是否仍然高效就完全取决于两个结构系数,这两个系数是区分"可行"与"不可行"的关键分水岭。对于任何希望从有限数据中训练序贯决策系统的研究者或工程师来说,这份地图都值得挂在墙上常常参看。有兴趣深入了解数学细节的读者,可以通过arXiv:2606.18531查阅完整论文,其中包含了所有定理的严格证明和详尽的辅助引理。
Q&A
Q1:离线强化学习中"轨迹级监督"和"逐步奖励"到底差在哪里?
A:逐步奖励是每走一步都告诉算法得了多少分,而轨迹级监督只在整条轨迹结束后给出一个总分。研究证明这个差异会让学习算法额外需要约H倍的数据,其中H是决策步骤数。这个代价不是因为数据覆盖不好或转移概率复杂,而是纯粹由"压缩信息"本身造成的,任何算法都无法绕开。
Q2:OPAC算法的"悲观主义"是什么意思?
A:"悲观主义"指的是算法对历史数据中没有充分覆盖的行为策略保持保守态度,宁可低估它们的价值也不冒险高估。这是离线学习的核心原则,因为算法无法通过实际试错来验证未被充分覆盖的策略,悲观估计可以防止算法把数据不足当作"这个策略很好"的证据。
Q3:κ_μ(σ)和χ_μ(σ)这两个系数大了会有什么后果?
A:κ_μ(σ)大意味着不同的每步奖励组合会产生几乎一样的轨迹总分,从结果推断每步奖励变得极难;χ_μ(σ)大意味着动态规划过程中奖励差异被严重压缩,策略优化变得困难。两个系数任何一个趋向无穷大,理论上都会导致需要指数级数据,全程成功聚合就是这种极端情形的典型例子。