一句话定位
groot-n1 的强化升级版:冻结 VLM 语言塔(Eagle 2.5,内部为 Qwen3-1.7B LLM + SigLIP2-400M 视觉编码器)+ 简化适配器 + 新增 FLARE 世界建模目标,用 dreamgen-groot-dreams 神经轨迹与人类第一视角视频联合训练;真机语言跟随成功率从 46.6%→93.3%,开源为 nvidia/GR00T-N1.5-3B。
背景与定位
GR00T N1.5 是 groot-n1 的直接迭代(同一 NVIDIA GEAR 团队,2025-06 发布,只有博客 + 代码/权重更新,无独立 arXiv 论文),仍属 2024-2025 年 VLA + flow-matching 动作头范式,谱系同 Physical Intelligence 的 pi0。
相对 N1 的改动方向可以概括为「把 VLM 语言塔锁死、把世界建模目标加上去、把数据来源做宽」:
- 冻结语言塔:VLM 的语言模型部分在预训练和微调阶段都保持冻结,防止微调把预训练学到的语言理解/对齐能力冲掉——这是很多 VLA 微调后「语言跟随」能力退化的常见病因。
- FLARE 世界建模目标:引入同组 FLARE(Future LAtent Representation Alignment)项目的思路,作为 flow-matching 之外的辅助目标,让策略网络对齐未来的 latent 表征而非生成未来像素,从而能从无动作标签的人类第一视角视频里学到东西。
- DreamGen 神经轨迹并入预训练:把 dreamgen-groot-dreams 的「视频世界模型造梦 + 伪动作标注」数据正式纳入预训练混合,是 N1 论文提出的「数据金字塔」里「神经生成视频」这一层的具体产品化落地。
它后续继续演进为 N1.6、再到把 backbone 换成 Cosmos-Reason2-2B/Qwen3-VL 架构、许可转为 Apache-2.0 商用的 N1.7(GitHub 仓库现状),N1.5 是这条演进链上的中间节点。
模型架构
整体仍是 System 2(VLM)+ System 1(DiT + flow-matching)双系统结构,细节见 groot-n1;N1.5 的具体改动与 HF 发布的 config.json(nvidia/GR00T-N1.5-3B)披露如下:
VLM(System 2)
- 起点升级为 Eagle 2.5(博客),HF
config.json的backbone_cfg.eagle_path显示内部组成为NVEagle/eagle_er-qwen3_1_7B-Siglip2_400M_stage1_5_128gpu_er_v7_1mlp_nops——即 Qwen3-1.7B LLM + SigLIP2-400M 视觉编码器。 select_layer=12(沿用 N1 的做法,取 LLM 第 12 层而非最后一层表征)。- 冻结粒度:
tune_llm=false(语言模型冻结,对应博客所说的「VLM frozen during both pretraining and finetuning」),但tune_visual=true(视觉编码器仍参与微调)——即严格来说只冻结了 VLM 里的语言塔,视觉塔仍会更新。 - VLM 规模 2.1B(博客 grounding 对比表 Size 列),比同规模 Qwen2.5VL-3B 更小但 grounding 更强:GR-1 grounding IoU 40.4 vs 35.5,RefCOCOg-val IoU 89.6 vs 85.2。
- 适配器简化:连接视觉编码器与 LLM 的 MLP 结构精简,并对输入 LLM 的视觉/文本 token embedding 都加了 LayerNorm(博客),
config.json中use_vlln=true与此对应。
动作头(System 1,DiT + flow-matching)
cross_attention_dim/hidden_size = 2048(与 VLM embedding 对齐);diffusion_model_cfg:num_layers=16、num_attention_heads=32、attention_head_dim=48、norm_type=ada_norm、interleave_self_attention=true;另有vl_self_attention_cfg(4 层、32 头、attention_head_dim=64)供状态/动作 token 的 self-attention。action_horizon=16,action_dim=32(max_action_dim=32、max_state_dim=64,不同本体的 state/action 统一 pad 到该维度)。- 去噪推理步数
num_inference_timesteps=4(与 N1 一致);噪声调度沿用 N1 的 Beta(1.5, 1.0),noise_s=0.999。 - FLARE 相关:
action_head_cfg.num_target_vision_tokens=32——命名与博客所述「对齐未来视觉 embedding」的 FLARE 机制相呼应,但 HF 未给出该字段的专门文档说明,此处仅按命名与博客描述做合理对应,不作强断言。 - 训练目标为 flow-matching + FLARE 联合训练(HF 卡:「trained jointly with flow matching and world-modeling objectives」)。
跨本体扩展:GitHub README 显示 N1.5 提供四个 embodiment head——EmbodimentTag.GR1(人形灵巧手,绝对关节空间,沿用 N1)、新增 EmbodimentTag.OXE_DROID(单臂末端执行器 delta 控制)、新增 EmbodimentTag.AGIBOT_GENIE1(人形 + 夹爪,绝对关节空间)、EmbodimentTag.NEW_EMBODIMENT(非预训练,供新本体微调)。
模型体量:命名为 GR00T-N1.5-3B(较 N1 的 2.2B 增大,主因是 VLM 从 1.34B 升到 2.1B);model.safetensors.index.json 的 metadata.total_size 为 5,448,327,040 字节(约 5.45GB),权重以 torch_dtype=bfloat16 为主的混合精度存储(部分子模块 model_dtype=float32),未见官方给出精确总参数量数字。
数据
- 预训练沿用 N1 的「真机 + 人类视频 + 仿真 + 神经生成视频」四层金字塔思路,博客给出的预训练混合组成为:内部 GR-1 真机数据、OpenXE(Open X-Embodiment)、仿真 GR-1(即 DexMG/DexMimicGen)、来自 dreamgen-groot-dreams 的神经轨迹、以及 AgiBot-Beta。博客仅以图表形式给出混合分布,未在正文披露各源的具体小时数/帧数/混合权重比例(相比 N1 论文 Table 7 的详尽统计,本次发布材料没有重新公布对应表格)。
- HF 页面绑定数据集
nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim,用于robocasa-gr1-tabletop-tasks仿真基准的微调样例数据。 - 与评测/实验挂钩的具体数据规模(均来自博客实验章节):
- Unitree G1 真机后训练:1,000 条遥操作 episode。
- 新物体泛化实验:10 个预训练未见过的物体,结合人类第一视角视频(GoPro 拍摄)co-train。
- DreamGen 神经轨迹泛化实验:覆盖 12 个新动词,通过 DreamGen pipeline 生成对应轨迹并显式训练(并非严格 zero-shot)。
- 视觉输入格式:可变数量的 224×224 uint8 图像帧(HF 卡)。
训练方法
- 目标:flow-matching loss(连续动作,沿用 N1)+ FLARE loss,系数 0.2(预训练和后训练均使用),二者联合训练。
- 优化器:AdamW,cosine 学习率调度,warmup ratio 0.05(与 N1 相同)。
- 规模:预训练 250,000 步(N1 为 200,000 步),global batch size 16,384(与 N1 相同量级),在 1,000 张 H100 GPU 上训练。
- 后训练(微调):README 建议把 batch size 打到硬件上限,训 20k 步;在 RTX 4090 上微调需加
--no-tune_diffusion_model以避免显存溢出;支持 LoRA(lora_rank=64、lora_alpha=128);支持多数据集联合训练,默认对不同数据集/轨迹赋予等权重(LeRobotMixtureDataset类,balance_dataset_weights/balance_trajectory_weights默认True)。 - 本次读到的材料未重新披露 N1.5 专属的、按 embodiment 细分的 post-training 超参表(batch size/steps 因任务而异,仅给出通用建议值)。
Infra(训练 / 推理工程)
训练
- 1,000 张 H100 GPU,global batch 16384,训 250K 步;GPU-hours 未披露(不同于 N1 论文披露的约 50,000 H100 GPU-hours,N1.5 博客未给出等价数字)。
推理(单卡 H100,GitHub README FAQ)
- VLM backbone:23.18 ms
- Action Head(4 步扩散):4 × 6.18 ms = 24.7 ms
- 全模型端到端:47.88 ms
Jetson AGX Thor 部署延迟(trtexec 测,batch_size=1,同一 n1d5 分支 README):
| 模块 | FP16 (ms) | FP8+FP4 (ms) |
|---|---|---|
| Action_Head - process_backbone_output | 2.35 | / |
| Action_Head - state_encoder | 0.04 | / |
| Action_Head - action_encoder | 0.10 | / |
| Action_Head - DiT | 5.46 | 3.41 |
| Action_Head - action_decoder | 0.03 | / |
| VLM - ViT | 5.21 | 4.10 |
| VLM - LLM | 8.53 | 5.81 |
- 硬件覆盖:微调在 H100、L40、RTX 4090、A6000 上验证(Python 3.10,CUDA 12.4),RTX 3090 Ti + CUDA 11.8 组合也验证可行;推理在 RTX 3090、RTX 3090 Ti、RTX 4090、A6000 上验证;LoRA 微调用 2× A6000 或 2× RTX 4090。
- 支持微架构(HF 卡):NVIDIA Ampere / Blackwell / Jetson / Hopper / Lovelace;Runtime = PyTorch,OS = Linux。
评测 benchmark
所有对比 baseline 均为同组织的 GR00T N1(博客原始数据)。
架构验证(从头训练,语言跟随类仿真基准,成功率 %)
| Benchmark | GR00T N1 (from scratch) | GR00T N1.5 (from scratch) |
|---|---|---|
| Language Table | 52.8% | 93.2% |
| Sim GR-1 Language | 36.4% | 54.4% |
数据受限后训练(仿真,成功率 %)
| Simulation Benchmark | GR00T N1 | GR00T N1.5 |
|---|---|---|
| RoboCasa,每任务 30 条示范 | 17.4 | 47.5 |
| Sim GR-1,0-shot | 39.6 | 43.9 |
| Sim GR-1,每任务 30 条示范 | 43.2 | 47.4 |
真机 GR-1 语言跟随(两个水果放桌上,随机指定放到盘子里其一)
| Setting | GR00T N1 | GR00T N1.5 |
|---|---|---|
| 语言跟随率 | 46.6% | 93.3% |
| 总体成功率 | 43.3% | 83.0% |
从人类第一视角视频学习操作新物体(10 个预训练未见物体)
| Setting | GR00T N1 | GR00T N1.5 |
|---|---|---|
| 0-shot | 0% | 15.0% |
| FLARE 后训练(含新物体人类视频) | - | 55.0% |
DreamGen 神经轨迹泛化到新动词(12 个新动词,平均成功率):GR00T N1.5 38.3% vs GR00T N1 13.1%。
Unitree G1 真机后训练(1K 条遥操作 episode 后训练)
| Model | GR00T N1,1K Demos | GR00T N1.5,1K Demos | GR00T N1.5,1K Demos |
|---|---|---|---|
| 任务 | 2 选 1 水果放盘(共 4 种水果) | 2 选 1 水果放盘(共 4 种水果) | 2 选 1 物体放盘(5 种新物体) |
| 成功率 | 44.0% | 98.8% | 84.2% |
创新点与影响
贡献:(1) 冻结 VLM 语言塔,把语言理解/泛化能力从微调中保护下来,是语言跟随成功率大幅提升(46.6%→93.3%)的核心原因;(2) Eagle 2.5 升级 + 适配器简化,grounding 能力显著提升(GR-1 grounding IoU +4.9、RefCOCOg-val +4.4);(3) 引入 FLARE 作为世界建模辅助目标,首次让 GR00T 系列具备从无动作人类视频里零样本学习操作新物体的能力(0%→15%,加人类视频后训练到 55%);(4) 把 dreamgen-groot-dreams 神经轨迹正式并入预训练,使模型在 12 个从未遥操作过的新动词上取得 38.3% 成功率(N1 仅 13.1%);(5) 新增 OXE_DROID/AGIBOT_GENIE1 两个 embodiment head,扩展跨本体覆盖范围。
影响:成为 GR00T 系列首个配套完整微调脚本 + HF checkpoint + 学术仿真基准结果的可用版本,被 HF 社区文章(SO-100/SO-101 微调教程)采用为参照基线;后续继续演进为 N1.6、再到 backbone 换 Cosmos-Reason2-2B/Qwen3-VL、许可转 Apache-2.0 商用的 N1.7。
作者自陈局限(博客原话对应):DreamGen 12 个新动词的「零样本」是有保留的——这些动词虽然没有对应的真实遥操作数据,但训练时通过 DreamGen 生成的神经轨迹被显式训练过,并非严格意义上的 zero-shot;完全的零样本动词/环境泛化留给未来工作(“leaving full zero-shot verb and environment generalization to future work”)。模型许可为 NVIDIA OneWay Noncommercial,仅限非商业用途。
原始链接
- 官方博客:https://research.nvidia.com/labs/gear/gr00t-n1_5/
- HF 模型卡:https://huggingface.co/nvidia/GR00T-N1.5-3B
- GitHub(N1.5 对应分支 n1d5):https://github.com/NVIDIA/Isaac-GR00T/tree/n1d5(主分支现为 N1.7:https://github.com/NVIDIA/Isaac-GR00T)
- 产品页:https://developer.nvidia.com/isaac/gr00t
- 关联仿真数据集:https://huggingface.co/datasets/nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim
- 前作论文(GR00T N1,arXiv):https://arxiv.org/abs/2503.14734
一手源存档(sources/)
- groot-n1-5—blog — NVIDIA 官方博客快照(sources/embodied/2025/groot-n1-5—blog.md)
- groot-n1-5—hf-card — HuggingFace
nvidia/GR00T-N1.5-3B模型卡 +config.json+ safetensors index 快照(sources/embodied/2025/groot-n1-5—hf-card.md) - groot-n1-5—github-readme — Isaac-GR00T GitHub README 快照(n1d5 分支,即 N1.5 对应版本,sources/embodied/2025/groot-n1-5—github-readme.md)