德州大学发现了一个惊人秘密:只需改变“招式”,不必重练“内功”

这项由德克萨斯大学奥斯汀分校、伊利诺伊大学香槟分校、埃默里大学、Together AI、Recursive Superintelligence Inc.和德国蒂宾根ELLIS研究所联合完成的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.19331。感兴趣的读者可通过该编号检索完整原文。
一、从一个武馆故事开始
假设你是一位武术宗师,门下培养了一批弟子。你发现了一个奇怪的规律:那些修炼最成功的弟子,他们的核心内力强度(也就是武功根基的深浅)几乎没有变化,但他们的出招方式、步法和手势却发生了翻天覆地的变化。换句话说,真正让他们突破境界的,不是重新积累内力,而是学会了如何更好地"发招"。
这个比喻,恰好描述了这篇论文最核心的发现。
现代AI领域有一种训练方式叫做"带验证奖励的强化学习"(简称RLVR)。通俗地说,就是让AI模型自己做题,做对了给奖励,做错了扣分,通过这种方式不断提升AI的推理能力。DeepSeek、Qwen等一批让人印象深刻的推理AI,背后都用到了这项技术。
然而,有一个问题长期困扰着研究者:当我们用这种奖励机制训练AI时,AI的神经网络权重(也就是控制AI行为的数字参数)到底发生了什么变化?过去大家都沿用了预训练时代的优化器,但没有人深究过:这套方法是否真的适合强化学习这种完全不同的训练范式?
德州大学奥斯汀分校的研究团队决定彻底解剖这个问题,他们的发现既出乎意料,又意义深远。
二、深入权重的内部世界:奇异值分解是什么
在展开他们的发现之前,需要先理解一个数学工具——奇异值分解(SVD)。这听起来很吓人,但实际上非常直观。
每一块AI神经网络的权重矩阵,都可以被拆解成三个部分:一组"输出方向"(记为U),一组"缩放比例"(记为Σ,也叫奇异值谱),以及一组"输入方向"(记为V)。可以把这理解为一个武器系统:U就像武器发力时的最终方向,Σ就像武器的整体威力大小,V就像武器接收能量时的姿势。
训练AI模型,从这个角度看,就是在调整U、Σ、V这三组参数。研究团队问了一个非常尖锐的问题:当AI通过强化学习变得更聪明时,这三个部分分别发生了多大的变化?
三、核心发现:内力不变,招式全换
研究团队分析了多个已经完成强化学习训练的AI模型检查点,包括一个训练了超过3000步的长期推理模型(Nemotron-Research-Reasoning-Qwen-1.5B),以及他们自己运行的Qwen3-8B-Base训练轨迹。他们发现了一个令人震惊的规律。
强化学习结束后,奇异值谱Σ几乎纹丝未动。具体来说,奇异值的变化幅度只有基础权重规模的万分之一左右(约10??%),而奇异值残差(即奇异值变化量占总权重变化量的比例)平均仅约3%。换句话说,99%以上的权重变化其实发生在U和V这两个"方向"上,而不是"威力大小"上。
作为对比,监督微调(SFT,一种常见的指令微调方式)会让奇异值谱发生剧烈变化:奇异值残差高达约35%,奇异值能量集中在谱改变方向的程度是强化学习的几百到上千倍。
研究团队给这个现象起了一个名字:近等谱性(near-isospectrality)。意思是,强化学习训练出来的AI,其权重矩阵的奇异值分布几乎保持了与基础模型相同的形态。
不过,聪明的研究者没有止步于此。他们进一步追问:这是因为高维空间的数学特性使然,还是因为强化学习真的偏好不改变奇异值?
他们设计了一个精妙的校准实验。在高维矩阵空间中,能改变奇异值的方向只占极少数(具体来说,在一个d_out × d_in维的空间里,只有min{d_out, d_in}个方向能影响奇异值)。所以即使是随机的权重变化,也大概率不会落在改变奇异值的方向上。研究团队定义了一个"维度归一化的谱改变能量"(κ_spec),如果这个值接近1,说明强化学习对奇异值方向没有特别的偏爱或回避;如果远小于1,才说明存在主动回避。
结果显示,强化学习的κ_spec值大约在1.02到1.35之间,几乎就是随机水平,没有特别的偏好。而监督微调的κ_spec值高达89到1364,是随机水平的几百倍。这说明:强化学习虽然确实保持了奇异值不变,但这更多是一种"顺其自然"的结果,而非刻意为之。
四、更重要的问题:这些微小的谱变化真的必要吗
发现奇异值几乎不变是一回事,但研究团队更关心的是:这3%的奇异值变化,对AI能力的提升有没有贡献?如果没有,那就意味着我们可以直接冻结奇异值来训练AI,不但不会损失性能,还能获得结构上的好处。
他们设计了两个互补的实验。第一个实验是"事后恢复":训练结束后,把RL检查点的奇异值换回原始基础模型的奇异值,但保留RL训练得到的U和V方向,然后测试性能。结果发现,换回基础奇异值之后,模型在数学推理、编程等各项任务上的表现几乎没有下降,保留了绝大多数强化学习获得的能力提升。
第二个实验更直接:从一开始就冻结奇异值不变,只允许U和V这两个方向自由变化,然后照常进行强化学习训练。结果表明,这样的训练仍然能获得很强的推理能力增益,在某些情况下甚至超过了自由训练的基线。
作为反向对照,他们还做了一个实验:冻结U和V不变,只允许奇异值Σ变化。结果这种训练几乎没有任何提升,因为这个参数空间实在太小(每个矩阵只有min{d_out, d_in}个可调参数)。
这两个实验共同确认了"谱继承"(spectral inheritance)原理:强化学习完全可以复用基础模型的奇异值谱,无需重写它,就能获得新的能力。真正载着能力变化的,是两侧的方向——U和V。
五、既然谱可以复用,那两侧的方向是不是也只改一个就够了
这是研究团队提出的第三个问题:既然奇异值可以保持不变,那U和V是否都需要改变?能不能只改其中一个,或者干脆只在原来的U/V空间内部重新组合?
为了回答这个问题,他们设计了四种"重构方案",并测量每种方案能够解释多少比例的权重变化。
第一种是"双侧子空间内混合":把新旧U空间和V空间都保持在原来的跨度内,但允许自由重新组合。这就像说,你可以把原来的所有招式任意拼凑,但不能发明全新的动作。结果显示,这种方案只能解释约13%的权重变化,剩下的87%都无法用这种方式解释。
第二种是"保留输出方向U,只改V",或者第三种"保留输入方向V,只改U"。这两种方案分别只能解释约55%和58%的权重变化,大量变化仍然无法解释。
第四种方案是"保留奇异值Σ,同时允许U和V自由变化"。这种方案的残差极小,平均只有约1.8%,几乎完美地解释了权重变化。
结论非常清晰:奇异值可以冻结,但U和V两侧的方向都必须保持可调,缺一不可。这个发现在跨越不同强化学习阶段(包括空间推理和具身操作两个完全不同目标的连续RL训练)之后依然成立,说明这是一个普遍规律,而不是某个特定任务的偶然现象。
六、从发现到设计:等谱优化框架ISO的诞生
发现了"谱继承"和"双侧方向可调"这两个规律,研究团队顺势提出了一套全新的优化框架,命名为等谱优化(Isospectral Optimization,简称ISO)。
ISO的核心思想非常简洁:在强化学习训练过程中,直接冻结基础模型的奇异值谱,只让U和V两侧的方向矩阵作为可优化变量。每个权重矩阵W都被参数化为W = U × Σ? × V^T,其中Σ?是固定的基础模型奇异值,U和V则在每次更新后通过"极坐标收缩"(polar retraction)操作保持数学约束。
ISO不是一个全新的优化算法,而是一个框架:它可以把任何已有的优化器(比如AdamW或Muon)包装起来,变成对应的ISO版本。对于AdamW,就叫做ISO-AdamW;对于Muon,就叫做ISO-Muon。底层的更新规则不变,只是优化的变量从权重矩阵W变成了框架变量U和V。
梯度的计算也非常自然:基础梯度G_W对U的梯度是G_W × V × Σ?,对V的梯度是G_W^T × U × Σ?。奇异值Σ?在这里起到了放大作用——对应较大奇异值的方向,同样的方向变化会产生更大的权重变化,这在数学上完全自洽。
ISO还有一个重要性质:它没有扩大可表示的模型空间。经过每次极坐标收缩后,权重矩阵严格保持在基础模型的等谱族内。因此,ISO的优势不能归因于"参数量变多了",而只能来自于更合理的参数化方式和更高效的优化轨迹。
七、离线版:不用重新训练,直接合并多个专家模型
ISO框架有两个互补的应用场景。第一个是离线场景:如何把多个从同一基础模型出发、各自专注不同领域的RL专家模型,合并成一个综合性的强大模型?
传统做法通常需要额外的在线策略蒸馏:重新生成训练数据、计算梯度、更新参数。这个过程既耗时又耗资源。ISO-Merger提供了一种纯粹基于检查点的合并方法,完全不需要额外的数据、推理生成或梯度更新。
具体做法如下。首先,对每个专家模型的权重矩阵进行奇异值分解,得到各自的U和V方向。然后,将每个专家的方向变化量(相对于基础模型)投影到基础模型方向的切空间中,保留最主要的90%方向(舍弃与小奇异值对应的末尾10%,因为这些方向跨专家之间不稳定)。接下来,通过一个线性方程组计算合并权重,目标是让每个专家的"自保留率"尽可能接近1——即合并后的模型对每个专家的特有方向都能充分体现。最后,把加权合并后的方向量重新投影回切空间,并通过极坐标收缩恢复到Stiefel流形上,重建出合并后的权重矩阵,其奇异值严格等于基础模型的奇异值。
为了验证效果,研究团队在两个设置下进行了实验。第一个设置以Qwen2.5-7B-Instruct为基础模型,合并了三个分别专注于编程、工具调用和长上下文记忆的RL专家。第二个设置以DeepSeek-R1-Distill-Qwen-1.5B为基础,合并了编程和数学两个专家。
在两个设置中,ISO-Merger在所有对比的无数据合并方法中取得了最高的综合分数。以Qwen2.5-7B设置为例,ISO-Merger的综合平均分为63.80,而最强的传统基线(RAM方法)为62.88;在DeepSeek-1.5B设置中,ISO-Merger达到44.38,最强传统基线为43.52。更重要的是,ISO-Merger在worst@4指标(测量模型输出稳定性的指标,要求每次都能答对)上也有明显提升,说明合并后的模型不只是偶尔表现好,而是更加一致可靠。
八、在线版:训练过程中直接用,效率提升超过2.7倍
ISO框架的第二个应用是在线训练:直接用ISO-AdamW代替AdamW来做强化学习训练,看能不能更快、更好地提升模型能力。
研究团队在数学推理和编程两类任务上进行了系统测试。数学推理部分,他们分别在Qwen3-1.7B-Base、Qwen3-4B-Base和Qwen3-8B-Base三个尺度上训练,使用DeepMath-103K数据集,评估AIME 2024、AIME 2025、AMC 2023、Minerva数学和奥林匹克数学等多项基准。权重空间AdamW尝试了5个不同的学习率(从5×10??到3×10??),ISO-AdamW只用了单一学习率7.5×10??。
在1.7B模型上,ISO-AdamW的最终综合准确率为28.74,超过了AdamW最佳结果28.35和Muon最佳结果27.70。在4B模型上,ISO-AdamW综合准确率达到43.46,超过AdamW的41.69和Muon的42.23,并且达到AdamW最终准确率只需约220步,而AdamW需要约480步,训练效率提升了约2.2倍。在8B模型上,ISO-AdamW在210步时达到综合准确率0.509,而AdamW在同样步数时只有0.487。为了排除AdamW只是训练不足的可能,研究团队继续把AdamW多训练了60步,结果其准确率仅提升到0.495就停滞了,而ISO-AdamW早在100步时就已达到0.495,相当于节省了约2.7倍的训练步数。
编程任务方面,在DeepSeek-R1-Distill-Qwen-1.5B上使用DAPO风格训练,ISO-AdamW在LiveCodeBench v5和v6上均优于调参后的AdamW基线。即使将AdamW的训练延长到330步,它的峰值也只达到0.265随后下降,而ISO-AdamW在220步内就达到了0.268。
ISO-Muon的表现也类似:在Qwen3-4B-Base上,ISO-Muon只需220步就能达到Muon在300步时的最终准确率0.422,并且最终准确率还进一步提升到0.428。
关于额外开销:ISO的主要额外计算来自于极坐标收缩操作(基于SVD的矩阵运算)。在Qwen3-4B-Base的实测中,这个操作大约增加了86秒每步的优化器更新时间,但由于强化学习的每一步中生成样本(rollout)才是耗时大头,这86秒只占端到端训练步骤时间的约7%。未来在异步强化学习系统中,这部分开销还可以和生成过程并行进行,进一步降低实际影响。
九、与相关工作的异同:ISO站在巨人肩上,又走出了自己的路
将奇异值分解和正交约束引入神经网络优化并非全新想法。Muon优化器用正交化动量矩阵;DION做了分布式版本;POET和POET-X通过正交等价变换保持权重谱;StelLA学习低秩适配的正交输入输出子空间……这些工作都从不同角度探索了矩阵几何结构在优化中的价值。
在并发独立工作中,有一个名为Pion的工作(arXiv:2605.12492)也关注了谱保留和正交等价变换的关系,并且明确援引了德州大学团队此前的工作作为动机。两者在在线强化学习优化这一点上有所重叠,但设计思路和出发点不同:Pion设计了一套针对一般LLM训练的专用Lie代数更新规则,关注训练稳定性和尺度控制;ISO则从RLVR的具体实验证据出发,通过维度感知校准和功能性干预验证了谱继承,再将这一发现升级为一个覆盖在线训练和离线合并两个场景的统一框架,且对任何基础优化器(AdamW或Muon)都适用。
从根本上说,ISO的不同之处在于它是"从数据到设计"的路径:先研究强化学习实际在做什么,再根据这个发现设计优化方法,而不是将已有优化工具直接移植过来。
归根结底,这篇论文给整个AI训练领域带来的核心信息非常简洁:针对强化学习这种特殊训练范式,权重矩阵的奇异值谱是天然的"可复用基础设施",真正承载能力变化的是两侧的方向框架。顺应这个结构设计优化器,就能在更少的训练步数内达到更好的结果。这就好像武术训练中,与其让弟子从头重练内力,不如专门雕琢他们的出招姿势和方向感——功倍事半的道理在神经网络里同样奏效。
对于未来的研究者,这里有几个值得深思的问题。不同类型的训练任务(如多模态学习、代码生成等)是否也服从同样的谱继承规律?这是否意味着,AI模型在从一个能力跃升到另一个能力时,总是倾向于复用已有的"内功基础"?随着模型越来越大,这种现象会变得更显著还是逐渐消失?这些问题,可能正等待着下一个研究团队去探索。
对这项研究感兴趣的读者,可以通过arXiv编号2607.19331查阅完整论文,深入了解数学推导和所有实验细节。
Q&A
Q1:等谱优化(ISO)框架在实际部署中需要额外的计算开销大吗?
A:ISO的主要额外开销来自极坐标收缩操作,在Qwen3-4B-Base实测中每步约增加86秒,但这只占强化学习端到端步骤时间的约7%,因为推理生成才是耗时大头。未来在异步强化学习系统中,这部分计算还可与生成过程并行,进一步降低实际影响。
Q2:谱继承规律是否适用于监督微调或预训练?
A:根据论文的实验结果,谱继承是强化学习特有的规律。监督微调会导致奇异值谱发生显著变化,其维度归一化的谱改变能量(κ_spec)高达89到1364,是随机水平的数百倍;而强化学习的κ_spec接近1,说明两种训练方式在权重变化结构上存在根本性差异。
Q3:ISO-Merger合并专家模型时为什么只保留90%的方向,丢掉最后10%?
A:研究团队发现,与较小奇异值对应的末尾方向在不同专家模型之间稳定性较差,不同专家在这些方向上的变化互相干扰。保留这些不稳定的末尾方向反而会降低合并后模型的整体性能,因此选择丢弃最后10%,只合并主要的90%方向,以提升合并质量和稳定性。