一文拆解 NVIDIA GR00T:人形机器人基础模型背后的数据、仿真与部署工具链

【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。

项目地址🔗:https://ai-mzq.github.io/From-Zero-to-AGI/[1]

欢迎关注【魔方AI空间】👇

AIGC技术交流社区(涵盖AI绘画、AI视频、大模型、AI多模态、数字人、具身智能等AIGC干货资源及教程)欢迎大家加入:

上一篇我们梳理了具身智能开发工具地图:模型、数据集、仿真器、评测基准和部署。

往期推荐:

  • 一文讲透2026年具身智能技术栈:VLM、VLA、VLN、世界模型
  • 一文梳理 RT-2 到 π0.7:通用机器人策略的技术演进
  • 一文通俗讲解具身智能 7 个核心概念:VLM、VLN、VA、VLA、WM、WAM、VLX
  • 一文通俗理解机器人数据 8 个核心概念:遥操作、示范学习、动作块、仿真、合成数据、Sim-to-Real、数据飞轮、失败回放
  • 一文详解具身智能:从大模型到世界模型
  • 一文讲透人形机器人 8 个关键能力:感知、抓取、全身控制、平衡、VLA、世界模型、数据、仿真
  • 一文梳理具身智能必读 6 篇综述:从 VLA、VLN 到世界模型
  • 一文梳理具身智能开发工具地图:模型、数据集、仿真器与评测基准

本文聚焦 NVIDIA GR00T,拆解它作为人形机器人基础模型平台背后的模型、数据、仿真、评测与部署工具链。

这一篇就从 NVIDIA GR00T 讲起。

GR00T 常被归入人形机器人基础模型这一类。它背后其实是一整套开发链路:模型怎么理解视觉、语言和机器人状态;数据怎么从遥操作、仿真和人类视频里来;策略怎么在 Isaac Lab 里训练和评测;最后怎么通过 TensorRT、Isaac ROS、Jetson Thor 进入真实机器人。

图 1:GR00T 更像一条人形机器人开发链路,模型、数据、仿真、评测、部署和真机回流需要一起看。

了解 GR00T,关键是看清图 1 里的层次:模型、数据、仿真、评测、部署,最后回到真实机器人。

任务定义
↓
仿真环境与遥操作采集
↓
真实数据 + 合成数据 + 人类视频
↓
GR00T VLA 模型微调
↓
Isaac Lab / Isaac Lab-Arena 评测
↓
TensorRT / Isaac ROS / Jetson Thor 部署
↓
真实机器人执行与数据回流

01 GR00T 首先是一套机器人开发链路

NVIDIA 在 GTC 2024 提出 Project GR00T[2],定位是面向人形机器人的通用基础模型。

到 GR00T N1[3] 发布时,NVIDIA 已经开始同时讲模型、数据、仿真和合成数据。

再看 Isaac-GR00T GitHub[4] 里的 N1.7,开发者拿到的不只有 checkpoint,还有数据格式、训练脚本、评测接口、推理和部署路径。

表 1:GR00T 工具链的主要层级与对应组件。

这也是 GR00T 和很多单篇 VLA 论文的差别。论文通常重点回答“模型怎么训”,GR00T 更关注一套人形机器人开发流程怎样落地。

02 GR00T N1 / N1.7:从视觉语言理解到动作生成

GR00T N1 论文[5]的核心思路是:

用视觉语言模型理解任务和环境,再用动作生成模块输出连续机器人动作。

它采用双系统结构。

System 2 负责理解图像、语言指令和上下文;System 1 负责把理解结果变成动作。对应到架构上,如图 2 所示,就是 VLM / VLA 主干接上 Diffusion Transformer 动作头。

图像 / 视频观测 + 语言指令 + 机器人状态
↓
视觉语言主干:理解场景、目标和任务语义
↓
动作生成模块:生成连续动作轨迹
↓
机器人执行:末端位姿、关节、夹爪或全身动作

图 2:GR00T N1 / N1.7 的核心,是用视觉语言主干理解任务,再通过动作生成模块输出连续机器人动作。

GR00T N1.7[4] 是更适合开发者的版本。官方 GitHub 提供 3B base checkpoint,使用 Cosmos-Reason2-2B / Qwen3-VL 相关视觉语言主干,支持 LeRobot 数据格式,也提供训练、推理、评测和 ONNX / TensorRT 导出。

N1.7 的重点不只是更换模型主干,而是让 GR00T 从基础模型进一步变成可微调、可接入、可部署的机器人开发入口。

开发者需要定义自己的机器人本体、输入输出模态、数据格式和动作空间,再通过后训练把模型调到具体任务上。

这也意味着,GR00T 不是“拿来就能包打天下”的通用机器人。换机器人、换任务、换传感器,仍然要做数据适配、微调和安全验证。

03 数据:真实、合成、人类视频为什么要一起用?

机器人基础模型真正稀缺的是动作经验。

一条可训练的机器人数据,通常要同时包含图像、机器人状态、动作轨迹、语言指令和任务结果。采一条这样的数据,比采一段文本或一张图片贵得多。

GR00T 的数据路线可以分成三类,如表 2 所示:

表 2:GR00T 三类数据来源的价值与限制。

真实数据用来校准物理动作,合成数据用来扩大任务和场景分布,人类视频提供大规模操作先验。图 3 可以把这三类来源看成三条汇入训练的数据流。

图 3:真实机器人数据、仿真合成数据和人类视频分别补足物理动作、场景分布和操作先验。

人类视频不能直接告诉机器人每个关节该转多少度,但它能提供“人在操作物体时怎么组织动作”的线索,比如靠近、抓起、放下、打开、推开、避让。

模型先从视频里学操作模式,再用机器人数据把这些模式映射到具体身体上。

04 合成数据:用少量示范扩展动作和场景

合成数据不是简单地在仿真里多跑几遍。

NVIDIA 的 Synthetic Manipulation Motion Generation for Robotics Blueprint[6] 把流程拆得更细:先从少量示范出发,生成更多机器人运动轨迹,再扩展场景、物体、材质、视角和背景,让训练数据覆盖更宽的分布。

少量人类示范 / 遥操作轨迹
↓
GR00T-Mimic:扩展动作轨迹
↓
GR00T-Gen:扩展场景和视觉变化
↓
Omniverse / Isaac Sim:提供物理和数字孪生环境
↓
Cosmos:提供世界生成和视觉多样化能力
↓
更多可用于训练的机器人数据

图 4:合成数据的作用,是从少量示范出发,扩展动作轨迹、场景变化和视觉分布。

这对人形机器人尤其重要。双臂操作、移动操作、全身平衡的采集成本都高,单靠真机很难覆盖足够多物体、桌面、光照、姿态和失败情况。

合成数据不能替代真实数据,但可以把稀缺的真机时间留给校准、验证和失败回流。

05 Isaac Lab:训练、评测和部署前验证

在 GR00T 链路里,Isaac 不只是画面很真实的仿真器。

图 5:Isaac Lab 的价值不只是仿真画面,而是让策略在部署前经历训练、评测和验证。

如图 5 所示,Isaac Lab[7] 基于 Isaac Sim,面向机器人学习任务。它可以搭环境、定义观测和动作、做模仿学习或强化学习训练,也可以并行跑大量仿真任务。

Isaac Lab-Arena 更偏评测,让策略进入任务场景运行,看它能不能稳定完成任务。表 3 列出了 Isaac 在几个关键环节里的作用。

表 3:Isaac 在数据采集、策略训练和部署前评测中的作用。

机器人策略不能只看离线预测。open-loop 结果再像,也不等于策略真的能在环境里连续跑起来。仿真评测的价值,就是让策略先在可控环境中经历状态变化、遮挡、误差积累和失败恢复。

06 从遥操作到微调:机器人数据怎样变成训练样本?

机器人数据不能只是一段视频。

一条可训练的示范,通常要包含图像、状态、动作、语言指令、相机信息和 episode 元信息。否则模型很难知道“这一步动作对应哪个状态”。

图 6:遥操作数据要变成可训练样本,需要同时记录图像、状态、动作、指令和 episode 元信息。

如图 6 所示,End-to-End Physical AI with Unitree G1[8] 这份官方工作流展示了比较完整的路径:在 Isaac Sim 中搭场景,用遥操作采集数据,把数据转成 LeRobot 风格格式,再进行 GR00T 微调、评测和部署。

仿真 / 真机遥操作
↓
记录图像、状态、动作、任务信息
↓
转换为 LeRobot 风格数据格式
↓
配置 modality.json
↓
GR00T fine-tuning / evaluation

格式统一很关键。机器人领域有很多数据集,但传感器、动作空间、控制频率、机器人本体都不同。没有统一格式,训练、评测和部署就会变成一堆临时脚本。

GR00T 支持 LeRobot 风格数据,是为了让数据处理、模型训练和评测部署尽量沿用同一套接口与工作流。

07 部署:从 checkpoint 到真实机器人

checkpoint 只是开始。

真实部署要处理推理延迟、动作频率、控制接口、通信中间件、安全约束、硬件算力和故障恢复。

图 7:从 checkpoint 到真实机器人,中间还要经过推理加速、控制接口、边缘计算和安全约束。

Isaac-GR00T GitHub[4] 给出 ONNX / TensorRT 支持。沿着 NVIDIA 的平台路线看,对应到图 7,部署链路大致是:

GR00T policy
↓
ONNX / TensorRT 推理加速
↓
Isaac ROS / 控制接口
↓
Jetson Thor / 机器人计算平台
↓
机器人控制器与执行器

VLA 输出动作,不代表动作可以直接发给机器人。真实系统里还会有控制器、安全边界、速度限制、碰撞检测和急停机制。

这也是 NVIDIA 路线的特点:模型只是入口,后面接的是 GPU、Jetson、Isaac ROS、Isaac Sim、Omniverse 和 Cosmos 组成的平台。

08 GR00T 和 OpenVLA、Octo、LeRobot 的差异

对照 GR00T 和几条开源路线,定位会更清楚,具体可以看表 4。

表 4:GR00T 与 OpenVLA、Octo、LeRobot 的定位对比。

GR00T 的特殊之处,在于它天然绑定 NVIDIA 的平台能力。模型是入口,后面接着数据生成、Isaac 仿真、Cosmos 世界模型、TensorRT 推理和 Jetson 部署。

研究者可能更关心它的 VLA 架构、训练数据和跨本体泛化。开发者更关心有没有一条能复现、能微调、能评测、能部署的完整路径。

09 GR00T 指向的是一条完整开发路线

拆开 GR00T,会看到一条很清楚的链路:

基础模型理解视觉、语言和状态
↓
真实数据与合成数据一起补足动作经验
↓
Isaac 负责训练、评测和部署前验证
↓
TensorRT / Isaac ROS / Jetson 把策略送进真机
↓
真实失败数据再回到下一轮训练

这条路线不是唯一答案。真实机器人落地仍然要面对硬件差异、长任务鲁棒性、接触控制、安全边界和数据质量。

但它说明了一件事:人形机器人基础模型的竞争,已经不只发生在模型参数和 demo 视频里,也发生在数据、仿真、评测、部署和硬件平台的连接方式里。

推荐阅读

参考链接

1. https://ai-mzq.github.io/From-Zero-to-AGI/:https://ai-mzq.github.io/From-Zero-to-AGI/

2. Project GR00T:https://nvidianews.nvidia.com/news/foundation-model-isaac-robotics-platform

3. GR00T N1:https://developer.nvidia.com/blog/accelerate-generalist-humanoid-robot-development-with-nvidia-isaac-gr00t-n1/

4. Isaac-GR00T GitHub:https://github.com/NVIDIA/Isaac-GR00T

5. GR00T N1 论文:https://huggingface.co/papers/2503.14734

6. Synthetic Manipulation Motion Generation for Robotics Blueprint:https://build.nvidia.com/nvidia/isaac-gr00t-synthetic-manipulation/blueprintcard

7. Isaac Lab:https://docs.isaacsim.omniverse.nvidia.com/latest/isaac_lab_tutorials/index.html

8. End-to-End Physical AI with Unitree G1:https://docs.nvidia.com/learning/physical-ai/gr00t-e2e-workflow/latest/index.html

9. OpenVLA:https://github.com/openvla/openvla

10. Octo:https://octo-models.github.io/

11. LeRobot:https://huggingface.co/docs/lerobot/main/index

12. NVIDIA Isaac GR00T 官方页面:https://developer.nvidia.com/isaac/gr00t

13. Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T:https://developer.nvidia.com/blog/develop-humanoid-robot-policies-end-to-end-with-nvidia-isaac-gr00t/

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询