英伟达开源Nemotron 3 Super|120B MoE推理提速2.2倍,首次实现降本增效兼得
投入百亿参数,推理成本却高得吓人?当所有人在堆砌算力时,有一个团队悄悄从架构底层“偷”走了90%的冗余计算,让1200亿参数的巨兽跑出了7.5倍的吞吐量。今天,我们彻底拆解Nemotron-3-Super,看它如何用三个颠覆性设计,在精度全面对标的同时,把推理效率卷到新高度。
在深入技术细节之前,先来看一张趣味漫画,1分钟get论文核心!

一张漫画胜千言——快速把握论文全貌!现在,让我们进入硬核拆解。
❓ 核心痛点:为什么你的大模型又慢又贵?
部署一个千亿参数模型,你面临的是双重暴击:惊人的显存占用和爬行般的推理速度。传统MoE(专家混合)模型试图用“稀疏激活”破局——每次只调用部分专家。但这带来了新问题:专家间的通信开销巨大,成为新的瓶颈。
更棘手的是,为了提升生成质量而引入的“推测解码”技术,往往需要训练一个额外的“草稿模型”,这进一步增加了训练成本和系统复杂性。有没有一种方法,能同时解决内存、通信、训练三大难题?
Nemotron-3-Super的答案是:有,而且是从架构层面彻底重构。
🏗️ 架构解析:混合动力巨兽的骨架
Nemotron-3-Super不是一个单纯的Transformer,而是一个精心设计的混合Mamba-Attention-MoE架构。它的核心思想是:让合适的模块做擅长的事。

如图所示,模型由88层周期性堆叠而成。其中,Mamba-2模块负责高效的序列建模,其固定大小的状态缓存彻底解决了Transformer KV缓存随序列长度二次增长的内存噩梦。稀疏的MoE层(LatentMoE)则在固定计算预算下,将模型总参数量扩展到了1206亿。而少量精心布置的Attention层则充当全局“锚点”,确保模型具备捕捉长距离依赖的关键能力。
这种设计像一辆混合动力跑车:Mamba是省电高效的电机,负责日常巡航;MoE是动力澎湃的燃油引擎,在需要时爆发;Attention则是精准的四轮转向系统,确保车辆在任何弯道都稳定可控。
💡 核心创新一:LatentMoE——通信开销的“降维打击”
MoE层的核心瓶颈是“All-to-All”通信。标准MoE中,每个Token的隐藏层表示(维度为 )都需要在所有专家间进行路由和分发,通信量巨大。
Nemotron-3-Super的LatentMoE设计了一个巧妙的“降维投影”方案。

如图所示,LatentMoE在标准MoE的流程中插入了两个可学习的投影矩阵。首先,通过 将高维特征()投影到一个低维潜在空间()。所有的路由、专家计算和通信都在这个“瘦身”后的空间中进行。计算完成后,再通过 将结果投影回原来的高维空间。
这个设计的精妙之处在于:通信开销与专家计算量直接与潜在维度 成正比。通过降低 ,我们大幅削减了瓶颈成本。省下来的资源用来做什么?答案是:增加专家总数 和每个Token激活的专家数 。
这就好比把原来需要跨国运输的集装箱(高维特征),先拆分成标准小包裹(低维特征)进行高效分拣和运输,到达目的地后再组装回去。运输成本骤降,但能处理的货物种类和数量(模型容量)却大大增加。
💡 核心创新二:MTP——自备“草稿本”的推理加速
多Token预测(MTP)通常被用作训练目标,以提升模型表示能力。Nemotron-3-Super将其价值发挥到极致:让训练好的MTP头在推理时充当内置的“草稿模型”,实现原生的推测解码。
传统推测解码需要维护一个外部草稿模型,存在训练/推理不匹配的问题。Nemotron-3-Super的解法是:共享参数的MTP头。在训练时,多个预测头共享参数,使其暴露于不同偏移量的预测任务中,从而对自回归生成时遇到的“自生隐藏状态”更加鲁棒。
在推理时,这个训练好的头可以递归调用,生成更长的草稿序列,再由主模型进行验证。这相当于模型自己给自己打草稿,无需任何外部依赖。

如表2所示,在推测解码基准SPEED-Bench上,Nemotron-3-Super的平均接受长度达到3.45,意味着每个验证步平均能接受3个多Token,效率优势明显。这种效率直接转化为了实实在在的吞吐量提升。

如图5所示,在高用户负载下,开启MTP(草稿长度=3)相比关闭MTP,能保持高得多的总输出吞吐量。这个设计让你在部署时,白捡了一个高性能的推测解码加速器。
🔄 训练流程优化:在低精度悬崖上稳定训练
训练一个1200亿参数的模型已是挑战,而Nemotron-3-Super选择了更硬的模式:直接用4比特(NVFP4)精度进行预训练。这能极大减少训练时的显存占用和通信量,但如同在钢丝上行走,极易因数值下溢导致训练崩溃。
论文中详细诊断了低精度训练中的“梯度消失”问题。

研究发现,很多在BF16精度下表现为极小值(如 <1e-12)的梯度,在NVFP4中直接下溢变成了0。图7清晰地展示了这一点。更深入的分析(图8)揭示了这些零梯度在模型不同层(FC1, FC2)和不同训练阶段的具体来源。

面对这一挑战,团队没有退缩,而是通过改进优化器状态管理和数值转换策略,成功实现了25万亿Token的NVFP4稳定训练。这为未来更大规模的极低精度训练扫清了道路。
另一个训练技巧是检查点离线合并策略。传统的训练需要在最后进行耗时的学习率衰减来得到最优模型。Nemotron-3-Super采用了一种更聪明的方法:在训练稳定阶段,定期保存检查点,然后离线合并这些检查点的权重。

如图11所示,离线合并的模型在多数训练阶段,性能能稳定超越当时的训练检查点2-4个百分点。这相当于不增加训练成本,就获得了多个“模型融合”的效果,是提升训练效率的利器。
📊 数据工程:Agent能力的“燃料”配方
模型的强大能力,离不开高质量数据的喂养。Nemotron-3-Super尤其强调了Agent能力的锻造,其数据配方值得深究。

如图16的饼图所示,在监督微调阶段,Agent相关数据占36%,推理数据占31%,两者合计近七成。这明确传达了其打造“智能体模型”的定位。
这些数据不是简单收集的,而是通过复杂的合成与模拟流程构建的。例如,用于训练通用工具调用能力的数据,来自一个高度自动化的多智能体模拟系统。

如图15所示,流程从种子工具集和人物角色采样开始,生成用户查询,再通过用户代理、助手代理、API模拟器等多个智能体进行交互模拟,最终由评估模块筛选出高质量对话轨迹。这种“数据工厂”模式,能大规模生成逼真、多样且高质量的工具调用数据。
🏆 实验验证:数据不说谎
理论再优美,也需要实验的验证。Nemotron-3-Super交出的成绩单堪称豪华。
首先看综合性能与效率的平衡。

图1的对比震撼人心。左侧是涵盖代码、数学、推理、长上下文等领域的7个硬核基准的准确率。可以看到,Nemotron-3-Super(BF16和NVFP4版本)在几乎所有任务上都达到或超越了GPT-OSS-120B和Qwen3.5-122B的水平。
更有冲击力的是右侧的吞吐量对比。在长上下文(64K)输出场景下,NVFP4量化版的Nemotron-3-Super,其吞吐量达到Qwen3.5-122B的7.5倍,是GPT-OSS-120B的2.2倍。这完美印证了其架构设计的高效性。
其次看与顶尖开源基座模型的对比。

如表4所示,在MMLU、GSM8K、HumanEval等经典基准上,Nemotron-3-Super基础模型与当前最强的开源基座模型相比,在大多数项目上领先或持平,尤其在需要较强推理能力的数学任务上表现突出。
量化后精度保持能力是部署的关键。

团队发布了BF16、FP8、NVFP4三种精度的模型。表9的详细对比显示,4比特的NVFP4模型在绝大多数任务上的性能与BF16版本相差无几,部分任务甚至略有提升。这意味着你可以几乎无损地享受4比特带来的4-7倍的存储和带宽节省,以及Blackwell GPU上的原生加速。
最后看消融实验的扎实程度。

以量化算法为例,表10的消融实验表明,采用最小化MSE的每块缩放策略,相比默认的PTQ方法,在多个基准上都有显著提升。这体现了工程上的深度优化,不放过任何一点提升空间。
⚖️ 客观评价
当然,没有完美的模型。Nemotron-3-Super的架构复杂性较高,Mamba和MoE的协同需要框架层面的深度优化,对部署团队的技术能力提出了要求。此外,虽然其Agent能力突出,但在某些需要极致代码能力的场景(如SWE-Bench),与Qwen3.5等顶尖模型相比仍有细微差距。
但其开创性价值毋庸置疑。它向我们证明,通过LatentMoE、原生MTP推测解码、NVFP4训练这三大核心创新,完全可以在不牺牲精度的前提下,将千亿级模型的推理效率提升一个数量级。这不仅是模型的胜利,更是硬件-软件-算法协同设计思想的胜利。
🌟 价值总结与行动号召
回顾全文,Nemotron-3-Super给我们三大启示:
- 1. 效率革命在架构:与其无脑堆参数,不如像LatentMoE一样重构通信,像MTP一样复用模块,从设计源头砍掉冗余。
- 2. 训练稳定性可攻克:低至4比特的全程训练已被验证可行,为未来更大模型打开了低成本训练的大门。
- 3. 数据是Agent的核心:高质量的合成与模拟数据Pipeline,是锻造模型“动手能力”的关键基础设施。
这篇解读超过5000字,能看到这里的你,绝对是技术深度爱好者。Nemotron-3-Super的开源,无疑为整个行业树立了新的标杆。
🤔 深度思考:你认为这种“混合Mamba+MoE+Attention”的架构,会成为下一代大模型的主流方向吗?LatentMoE的设计思路,对你正在研发的模型有何启发?欢迎在评论区留下你的观点!
💝 支持原创:如果这篇硬核解读帮你摸清了Nemotron-3-Super的脉络,点赞+在看就是最好的支持!分享给你的项目伙伴,一起讨论如何将它的思想落地!
🔔 关注提醒:设为星标,持续获取AI前沿模型的深度拆解与实战思考。
#AI技术 #深度学习 #大模型 #模型优化 #Nemotron #MoE #技术干货 #论文解读
参考
Nemotron-3-Super