一句话定位

NVIDIA 开源的首个通用人形机器人基础模型:VLM「慢思考」(System 2, Eagle-2) + 扩散 Transformer「快动作」(System 1, flow-matching @120Hz) 双系统 VLA,用「真机 + 人类视频 + 仿真 + 神经生成视频」四层数据金字塔联合训练,2.2B 参数、权重/数据/仿真基准全开放。

背景与定位

GR00T N1 属于 2024-2025 年 VLA(Vision-Language-Action)+ flow-matching 动作头 这一主流范式,直接谱系是 Physical Intelligence 的 π0(VLM + flow-matching 动作专家)与 LAPA(潜在动作预训练)。它相对同类工作的三点差异:

  1. 双系统显式解耦:借 Kahneman《Thinking, Fast and Slow》的 System 1 / System 2 隐喻,把「推理/规划」(VLM,10Hz)与「运动生成」(DiT,120Hz)分成两个 Transformer,但端到端联合训练——不同于「黑箱 LLM 规划 + 独立低层策略」的松耦合层级方案。
  2. 简单 cross-attention 而非 MoE 桥接:π0 用 mixture-of-experts 把 VLM 与动作模型缝在一起,GR00T N1 用一层 cross-attention,声称对 VLM/动作模型的具体架构选择更灵活。
  3. 数据金字塔 + 无动作视频动作化:底层用互联网/人类第一视角视频,中层用仿真(DexMimicGen)与神经生成视频(video-gen 世界模型),顶层用真机遥操作;对无动作数据用 latent action(VQ-VAE/LAPA)IDM 伪标注 打上「伪动作」,当作额外 embodiment 混入训练。

它是 NVIDIA Isaac GR00T 全栈(Isaac Sim/Lab 仿真、合成数据 Blueprint、预训练模型)的模型底座,面向 Fourier GR-1、1X Neo 等人形本体。神经轨迹生成复用了 NVIDIA 自家的世界模型/视频生成栈(见 cosmos-predictwan-2-1),真机数据混入了 agibot-world-colosseo 的 AgiBot 轨迹与 Open X-Embodiment。可与 figure-helixgemini-robotics 等 2025 年 VLA 对读。

模型架构

整体:VLA,双系统 compositional 设计。公开的 GR00T-N1-2B2.2B 参数,其中 1.34B 在 VLM

System 2 — 视觉语言模块(Eagle-2 VLM)

  • backbone = NVIDIA Eagle-2(论文;博客表述为「NVIDIA-Eagle with SmolLM-1.7B」),由 SmolLM2 LLM + SigLIP-2 图像编码器 微调而来,在互联网规模数据上预训练。
  • 图像 224×224 编码后经 pixel shuffle,每帧得 64 个 image token;与文本 token 一起走 LLM。
  • 关键工程决策:取第 12 层(中间层)而非最后一层 LLM 表征——推理更快且下游成功率更高。
  • 推理频率 10Hz(L40 GPU)。

System 1 — 扩散 Transformer 动作模块(DiT + flow-matching)

  • DiT 变体(Peebles & Xie),denoising step 通过 AdaLN 条件化,记为 V_θ;交替堆叠 cross-attention(对 VLM token φ_t 条件化)+ self-attention(作用于加噪动作 token 与状态 embedding q_t),结构类似 Flamingo / VIMA。
  • action flow-matching:目标向量场 ε−A_t,损失 L_fm = E_τ‖V_θ(φ_t, A_tᵗ, q_t) − (ε−A_t)‖²;加噪 A_tᵗ = τA_t + (1−τ)ε,噪声调度 p(τ)=Beta((s−τ)/s; 1.5, 1), s=0.999;推理用前向 Euler 积分,K=4 步 denoising 对所有 embodiment 都够用。
  • action chunking:一次预测 H=16 步动作块(Zhao et al. ACT 风格)。
  • 跨本体处理:每个 embodiment 一个 MLP 状态编码器 + 一个 MLP 动作编码器(动作编码器同时编码 diffusion timestep + 加噪动作,见 π0)+ 一个 embodiment-specific 动作解码器 MLP,把不同维度的 state/action 投到共享 embedding。
  • 输出:连续值动作向量(对应各电机控制);推理频率 120Hz(闭环)。
  • 辅助目标检测损失:在 VL embedding 上接线性层预测目标物归一化中心坐标(bbox 用 OWL-v2 标注),L = L_fm + L_det,增强空间理解。

动作块 16 步推理时延63.9ms(L40,bf16)。

数据

四层数据金字塔(Table 7 全量统计,帧数/时长):

真机(peak,共 262.3M 帧 / 3288.8 小时)

  • GR00T N1 人形预训练数据集(自采):Fourier GR-1 遥操作,88.4 小时 / 6.4M 帧 @20Hz,头戴相机第一视角。遥操作硬件:VIVE Ultimate Tracker(腕部 6-DoF)+ Xsens Metagloves(手指),也试过 Apple Vision Pro、Leap Motion;人手动作经 IK 重定向到人形动作。含细粒度(抓/移/放)与粗粒度分层标注。
  • Open X-Embodiment 子集:DROID 428.3h、RT-1 338.4h、Language Table 195.7h、Bridge-v2 111.1h、RoboSet 78.9h、MUTEX 5.0h、Plex 1.1h。
  • AgiBot-Alpha:使用发布时的 140,000 条轨迹(1979.4h / 213.8M 帧)。
  • RH20T-Robot:62.5h。

人类视频(base,共 181.3M 帧 / 2517.0 小时,无动作标签)

  • Ego4D 2144.7h、HoloAssist 169.6h、Ego-Exo4D 123.0h、EPIC-KITCHENS 31.7h、Assembly-101 19.3h、RH20T-Human 16.3h、HOI4D 12.4h。

仿真(middle,125.5M 帧 / 1742.6 小时)

  • 基于 RoboCasa 框架 + DexMimicGen 自动扩增:从几十条 Leap Motion 遥操作源示范出发,对象中心分段→变换→重组。预训练任务为「rearrange A from B to C」,覆盖 54 种 source/target receptacle 组合,每组合生成 10,000 条,共 540k 条预训练示范。
  • 全量(含预/后训练)780,000 条仿真轨迹 ≈ 6,500 小时(约九个月人工示范),仅用 11 小时生成

神经生成视频(middle,23.8M 帧 / 827.3 小时 @8fps)

  • 88 小时自采真机遥操作 ~10× 扩增到 827 小时 counterfactual 轨迹。做法:LoRA 微调 WAN2.1-I2V-14B image-to-video 模型(在 3,000 条 480P/81 帧真机样本上训 100 epoch),给定初始帧 + 新语言 prompt 生成。
  • 多样性:先用商用多模态 LLM 检测初始帧中物体、生成物理可行的「pick up {object} from {A} to {B}」组合;再用商用多模态 LLM 作 judge(下采 8 帧)过滤不遵循指令的视频并 re-caption(下采 16 帧 @256P)。
  • 这些无动作视频再用 latent action + IDM 打伪动作标签入训。

无动作数据的动作化

  • Latent action(LAPA):VQ-VAE 编码相邻帧对 (x_t, x_{t+H}) 得潜在动作 z_t,编码器当逆动力学用,取量化前连续 embedding 作 flow-matching 目标,视为独立「LAPA embodiment」;全异构数据共享同一潜在动作空间,促跨本体泛化。
  • IDM 伪动作:逆动力学模型 = System 1 的 DiT + SigLIP-2 视觉 embedding,flow-matching 目标,条件为(当前帧, 未来帧),每 embodiment 训 30K/60K 步。
  • 真机数据用「真实动作 + latent action」双目标;神经轨迹用「latent + IDM 动作」。

数据格式:扩展 HuggingFace LeRobot 格式(parquet + MP4 + JSON),加 modality.json 细粒度语义字段、多标注、旋转表示声明;状态旋转用 6D 表示、动作旋转用 axis-angle,min-max 归一化。

训练方法

目标:flow-matching 损失(式 1)+ 辅助目标检测损失。

预训练:在全金字塔异构数据上端到端 flow-matching。超参(Table 6):LR 1e-4、AdamW(β1=0.95, β2=0.999, eps=1e-8)、weight decay 1e-5、cosine 调度、warmup 0.05、batch size 16,384200,000 gradient steps。冻结/解冻:vision encoder 解冻、text tokenizer 冻结、DiT 解冻

后训练(post-training):对单一 embodiment 微调,保持 VL backbone 语言部分冻结、微调其余。batch size 128 或 1024,20,000–60,000 步。评测默认全局 batch 1024、训 60k 步;DexMG 因数据少用 batch 128。

神经轨迹后训练:为缓解下游数据稀缺,用微调后的 video-gen 模型对每个下游任务生成神经轨迹(多视角任务生成网格子图),仅在人采轨迹(仿真)或真机 benchmark 10% 数据上微调 video 模型以模拟真实低数据场景;生成视频用 latent 或 IDM 伪动作标注,当作不同 embodiment;真机:神经轨迹按 1:1 采样比例 co-train。低数据时 IDM 也只在低数据上训。

Infra(训练 / 推理工程)

训练

  • 集群经 NVIDIA OSMO 编排,H100 GPU + NVIDIA Quantum-2 InfiniBand(fat-tree 拓扑),基于 Ray 的自研库做容错多节点训练与数据摄取;单模型最多 1024 GPU
  • GR00T-N1-2B 预训练约 50,000 H100 GPU-hours
  • 神经轨迹生成:L40 上生成 1 秒视频耗时 2 分钟,共 ~105k L40 GPU-hours(约 1.5 天)用 3,600 张 L40
  • 仿真数据:DexMimicGen 780k 轨迹 11 小时生成。

推理 / 部署

  • System 2(VLM)@10Hz,System 1(DiT)@120Hz,均在 L40;16 步动作块推理 63.9ms(L40 bf16)。
  • 官方部署硬件:推理可用 NVIDIA RTX A6000Jetson AGX Orin;后训练最小配置 1× RTX A6000 或 1× RTX 4090,更高需求建议 DGX Spark / DGX H100。
  • 支持微架构(HF card):Ampere / Blackwell / Jetson / Hopper / Lovelace;Runtime = PyTorch,OS = Linux。
  • 算力受限微调:单张 A6000,只调 adapter(state/action 编码器 + 动作解码器)+ DiT 时 batch 可达 200;连 vision encoder 一起调时 batch 最多 16。

评测 benchmark

仿真(每任务 100 条示范,平均成功率 %,Table 2)

模型RoboCasa (24)DexMG (9)GR-1 (24)平均
BC-Transformer26.353.916.126.4
Diffusion Policy25.656.132.733.4
GR00T-N1-2B32.166.550.045.0

GR-1 任务上比最强 baseline 高 >17%。按示范数(30/100/300)扫描均一致领先(Appendix Table 4/Fig.10)。

真机(GR-1 人形,4 类共 13 任务:Pick-and-Place 5 + Articulated 3 + Industrial 3 + Coordination 2,平均成功率 %,Table 3)

模型Pick-and-PlaceArticulatedIndustrialCoordination平均
Diffusion Policy (10% data)3.014.36.727.510.2
Diffusion Policy (full)36.038.661.062.546.4
GR00T-N1-2B (10% data)35.062.031.050.042.6
GR00T-N1-2B (full)82.070.970.082.576.8
  • 10% 数据下比 DP 高 32.4%,全量下高 30.4%;GR00T@10% 仅比 DP@full 低 3.8%,凸显数据效率。
  • 预训练 checkpoint 真机 zero-shot:需双手协调交接的任务 76.6%(11.5/15),新物体放入未见容器 73.3%(11/15)
  • 神经轨迹 co-train 增益:RoboCasa 30/100/300 数据档分别 +4.2 / +8.8 / +6.8%,真机 8 任务平均 +5.8%。RoboCasa 上低数据(30)LAPA 略胜 IDM,数据增多(100/300)IDM 反超(IDM 伪动作随数据增多更贴真实动作)。
  • 博客口径:合成 + 真实数据相比只用真实数据带来 ~40% 性能提升
  • Baselines:BC-Transformer(RoboMimic,Transformer+GMM)、Diffusion Policy(U-Net 扩散)。

创新点与影响

贡献:(1) 首个开源人形机器人基础模型,权重(GR00T-N1-2B)+ 训练数据 + 仿真基准全开放;(2) VLM System 2 + DiT flow-matching System 1 的双系统 VLA,用简单 cross-attention 桥接(相对 π0 的 MoE 更解耦灵活);(3) 数据金字塔 + latent-action/IDM 把无动作的人类视频与神经生成视频「动作化」为额外 embodiment,统一混训;(4) 首次以约 300k 条 / 827 小时规模用 video-gen 世界模型生成神经轨迹增广机器人数据。

影响:成为 NVIDIA Isaac GR00T 全栈的模型底座与开源社区基线;后续迭代到 GR00T N1.5 → N1.7(GitHub 仓库现已换 Cosmos-Reason2-2B/Qwen3-VL backbone、Apache-2.0 许可)。

作者自陈局限:(1) 目前仅短时程桌面操作,未及长时程 loco-manipulation(需硬件/架构/语料同步进步);(2) 期待更强 VLM backbone 提升空间推理与语言理解;(3) 合成数据在「多样/counterfactual + 遵守物理规律」上仍有质量瓶颈;(4) 后训练若只含单手数据会丢失预训练学到的双手交接能力(qualitative 观察)。许可为 NVIDIA OneWay Noncommercial(N1-2B),非功能安全场景使用风险自负。

原始链接

一手源存档(sources/)

  • groot-n1—blog — NVIDIA 官方博客快照(sources/embodied/2025/groot-n1—blog.md)
  • groot-n1—hf-card — HuggingFace GR00T-N1-2B 模型卡快照(sources/embodied/2025/groot-n1—hf-card.md)
  • groot-n1—github-readme — Isaac-GR00T GitHub README 快照,现为 N1.7(sources/embodied/2025/groot-n1—github-readme.md)
  • arXiv 2503.14734 全文 PDF(arXiv 原文 PDF,不入 git)