Nemotron 3:开源、高效、智能,多智能体 AI 的新标杆
随着多智能体系统在各行业的广泛应用,开发者面临通信开销、上下文漂移及推理成本高等挑战。NVIDIA 推出 Nemotron 3 开源模型系列,采用混合专家混合(MoE)架构,具备高效推理、多智能体协作等核心功能,旨在助力开发者快速构建和部署专业化的多智能体 AI 系统,推动行业智能化发展。

NVIDIA Nemotron 3 是一个开源的多智能体 AI 模型系列,包括 Nano、Super 和 Ultra 三种尺寸。该系列模型采用独特的混合专家混合(MoE)架构,融合了 Mamba2 和 Transformer 的优势,专为构建高效、准确的多智能体 AI 应用设计。Nemotron 3 Nano 拥有 300 亿参数,通过优化推理成本,实现高达 4 倍于前代的吞吐量,适合软件调试、内容总结等任务。Super 和 Ultra 分别具备 1000 亿和 5000 亿参数,用于复杂推理和多智能体协作。
(一)高效推理
Nemotron 3 Nano 拥有 300 亿参数,采用混合专家混合(MoE)架构,每次激活最多 30 亿参数,推理吞吐量高达前代 4 倍,推理成本显著降低。其 100 万字的上下文窗口,能更好处理长文本任务,保持信息连贯性,适合软件调试、内容总结等任务。
(二)多智能体协作
Nemotron 3 Super 和 Ultra 分别具备 1000 亿和 5000 亿参数,支持复杂多智能体应用,可处理深度推理和战略规划任务。模型通过强化学习与多环境并发训练,提升推理准确性与适应性,助力多智能体系统高效协作。
(三)高精度推理
Nemotron 3 通过先进的强化学习技术和多环境并发训练,显著提升推理准确性。其在多个基准测试中表现出色,如 MMLU-Pro、AIME25 等任务中,准确率均达到行业领先水平,能够为复杂任务提供高质量解决方案。
(一)混合专家混合(MoE)架构
Nemotron 3 Nano 采用混合专家混合(MoE)架构,融合了 Mamba2 和 Transformer 的优势。模型包含 23 层 Mamba2 和 MoE 层,以及 6 层注意力层。每个 MoE 层有 128 个专家,每次激活 6 个,动态激活机制使计算高效且吞吐量高,显著降低推理成本。
(二)强化学习与多环境训练
Nemotron 3 通过先进的强化学习技术,在多个环境中并发训练。模型使用同步 GRPO(Group Relative Policy Optimization)算法,结合数学、代码、科学等多领域环境进行训练,提升推理的准确性和适应性,确保在复杂任务中表现出色。
(三)高效训练格式
Nemotron 3 Super 和 Ultra 使用 NVIDIA 的 4 位 NVFP4 训练格式,显著降低内存需求,加速训练过程。这种高效格式在保持与高精度格式相当的准确性的同时,使大型模型能够在现有基础设施上高效训练,无需额外硬件升级。
(四)大规模预训练数据集
Nemotron 3 提供包含 3 万亿 token 的预训练、后训练和强化学习数据集,涵盖推理、编码和多步骤工作流示例。这些数据集支持领域专业化,帮助模型在特定领域表现出色。同时,NVIDIA 还发布了 NeMo Gym 和 NeMo RL 等开源工具,加速开发和部署。
(一)制造业
Nemotron 3 在制造业中可用于生产流程优化、设备监控与故障预测。其高效推理能力和多智能体协作功能能够实时分析生产数据,快速识别潜在故障并优化生产流程,显著提升生产效率和自动化水平,降低生产成本。
(二)网络安全
在网络安全领域,Nemotron 3 能够实时分析网络流量和恶意软件行为,通过多智能体协作快速响应威胁。其高精度推理能力可精准识别复杂的网络攻击,提供实时的威胁预警和防御策略,保障网络安全。
(三)软件开发
Nemotron 3 支持代码生成、调试和自动化测试,帮助开发者快速生成高质量代码,自动检测和修复代码中的错误。其长文本处理能力可生成详细的代码注释和文档,显著提高软件开发效率和质量。
(四)媒体与通信
在媒体与通信行业,Nemotron 3 可辅助内容创作、编辑和智能客服。其多智能体协作功能能够生成多样化的内容,提供个性化的用户体验。同时,其高效的推理能力可实时处理用户请求,提升媒体生产效率和用户满意度。
(五)金融服务
Nemotron 3 用于金融服务中的风险评估、欺诈检测和投资建议。其高精度推理能力能够分析大量金融数据,识别潜在风险和欺诈行为。同时,多智能体协作功能可为客户提供个性化的投资建议,助力金融机构精准决策。
(一)使用Hugging Face Transformers
import torchfrom transformers import AutoTokenizer, AutoModelForCausalLM# Load tokenizer and modeltokenizer = AutoTokenizer.from_pretrained("nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8")model = AutoModelForCausalLM.from_pretrained("nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8",torch_dtype=torch.bfloat16,trust_remote_code=True,device_map="auto")messages = [{"role": "user", "content": "Write a haiku about GPUs"}]tokenized_chat = tokenizer.apply_chat_template(messages,tokenize=True,add_generation_prompt=True,return_tensors="pt").to(model.device)outputs = model.generate(tokenized_chat,max_new_tokens=1024,temperature=1.0,top_p=1.0,eos_token_id=tokenizer.eos_token_id)print(tokenizer.decode(outputs[0]))
(二)使用vLLM
pip install -U "vllm>=0.12.0"wget https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8/resolve/main/nano_v3_reasoning_parser.pyVLLM_USE_FLASHINFER_MOE_FP8=1 vllm serve --model nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 \--max-num-seqs 8 \--tensor-parallel-size 1 \--max-model-len 262144 \--port 8000 \--trust-remote-code \--enable-auto-tool-choice \--tool-call-parser qwen3_coder \--reasoning-parser-plugin nano_v3_reasoning_parser.py \--reasoning-parser nano_v3 \--kv-cache-dtype fp8
(三)使用TRT-LLM
# nano_v3 example yaml is https://github.com/NVIDIA/TensorRT-LLM/blob/main/examples/auto_deploy/nano_v3.yamltrtllm-serve <model_path> \--backend _autodeploy \--trust_remote_code \--reasoning_parser nano-v3 \--tool_parser qwen3_coder \--extra_llm_api_options nano_v3.yaml
(四)使用SGLang
python3 -m sglang.launch_server --model-path nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 \--trust-remote-code \--tp 1 \--attention-backend flashinfer \--tool-call-parser qwen3_coder \--reasoning-parser nano_v3
NVIDIA Nemotron 3 的推出,为多智能体 AI 系统的发展带来了新的机遇。其高效的推理能力、强大的多智能体协作性能以及长文本处理能力,使其在众多应用场景中展现出巨大潜力。通过开放模型权重、训练数据和训练方法,NVIDIA 为开发者提供了一个透明、高效的开发平台,助力开发者快速构建和部署专业化的 AI 系统。
项目官网:https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
HuggingFace 模型库:https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8
点亮“关注”,设为“星标”,精彩不迷路!与你携手探索AI的无限可能,精彩内容持续更新!🚀