一句话定位

groot-n1 的强化升级版:冻结 VLM 语言塔(Eagle 2.5,内部为 Qwen3-1.7B LLM + SigLIP2-400M 视觉编码器)+ 简化适配器 + 新增 FLARE 世界建模目标,用 dreamgen-groot-dreams 神经轨迹与人类第一视角视频联合训练;真机语言跟随成功率从 46.6%→93.3%,开源为 nvidia/GR00T-N1.5-3B

背景与定位

GR00T N1.5 是 groot-n1 的直接迭代(同一 NVIDIA GEAR 团队,2025-06 发布,只有博客 + 代码/权重更新,无独立 arXiv 论文),仍属 2024-2025 年 VLA + flow-matching 动作头范式,谱系同 Physical Intelligence 的 pi0

相对 N1 的改动方向可以概括为「把 VLM 语言塔锁死、把世界建模目标加上去、把数据来源做宽」:

  1. 冻结语言塔:VLM 的语言模型部分在预训练和微调阶段都保持冻结,防止微调把预训练学到的语言理解/对齐能力冲掉——这是很多 VLA 微调后「语言跟随」能力退化的常见病因。
  2. FLARE 世界建模目标:引入同组 FLARE(Future LAtent Representation Alignment)项目的思路,作为 flow-matching 之外的辅助目标,让策略网络对齐未来的 latent 表征而非生成未来像素,从而能从无动作标签的人类第一视角视频里学到东西。
  3. DreamGen 神经轨迹并入预训练:把 dreamgen-groot-dreams 的「视频世界模型造梦 + 伪动作标注」数据正式纳入预训练混合,是 N1 论文提出的「数据金字塔」里「神经生成视频」这一层的具体产品化落地。

它后续继续演进为 N1.6、再到把 backbone 换成 Cosmos-Reason2-2B/Qwen3-VL 架构、许可转为 Apache-2.0 商用的 N1.7(GitHub 仓库现状),N1.5 是这条演进链上的中间节点。

模型架构

整体仍是 System 2(VLM)+ System 1(DiT + flow-matching)双系统结构,细节见 groot-n1;N1.5 的具体改动与 HF 发布的 config.jsonnvidia/GR00T-N1.5-3B)披露如下:

VLM(System 2)

  • 起点升级为 Eagle 2.5(博客),HF config.jsonbackbone_cfg.eagle_path 显示内部组成为 NVEagle/eagle_er-qwen3_1_7B-Siglip2_400M_stage1_5_128gpu_er_v7_1mlp_nops——即 Qwen3-1.7B LLM + SigLIP2-400M 视觉编码器
  • select_layer=12(沿用 N1 的做法,取 LLM 第 12 层而非最后一层表征)。
  • 冻结粒度:tune_llm=false(语言模型冻结,对应博客所说的「VLM frozen during both pretraining and finetuning」),但 tune_visual=true(视觉编码器仍参与微调)——即严格来说只冻结了 VLM 里的语言塔,视觉塔仍会更新。
  • VLM 规模 2.1B(博客 grounding 对比表 Size 列),比同规模 Qwen2.5VL-3B 更小但 grounding 更强:GR-1 grounding IoU 40.4 vs 35.5RefCOCOg-val IoU 89.6 vs 85.2
  • 适配器简化:连接视觉编码器与 LLM 的 MLP 结构精简,并对输入 LLM 的视觉/文本 token embedding 都加了 LayerNorm(博客),config.jsonuse_vlln=true 与此对应。

动作头(System 1,DiT + flow-matching)

  • cross_attention_dim/hidden_size = 2048(与 VLM embedding 对齐);diffusion_model_cfgnum_layers=16num_attention_heads=32attention_head_dim=48norm_type=ada_norminterleave_self_attention=true;另有 vl_self_attention_cfg(4 层、32 头、attention_head_dim=64)供状态/动作 token 的 self-attention。
  • action_horizon=16action_dim=32max_action_dim=32max_state_dim=64,不同本体的 state/action 统一 pad 到该维度)。
  • 去噪推理步数 num_inference_timesteps=4(与 N1 一致);噪声调度沿用 N1 的 Beta(1.5, 1.0),noise_s=0.999
  • FLARE 相关:action_head_cfg.num_target_vision_tokens=32——命名与博客所述「对齐未来视觉 embedding」的 FLARE 机制相呼应,但 HF 未给出该字段的专门文档说明,此处仅按命名与博客描述做合理对应,不作强断言。
  • 训练目标为 flow-matching + FLARE 联合训练(HF 卡:「trained jointly with flow matching and world-modeling objectives」)。

跨本体扩展:GitHub README 显示 N1.5 提供四个 embodiment head——EmbodimentTag.GR1(人形灵巧手,绝对关节空间,沿用 N1)、新增 EmbodimentTag.OXE_DROID(单臂末端执行器 delta 控制)、新增 EmbodimentTag.AGIBOT_GENIE1(人形 + 夹爪,绝对关节空间)、EmbodimentTag.NEW_EMBODIMENT(非预训练,供新本体微调)。

模型体量:命名为 GR00T-N1.5-3B(较 N1 的 2.2B 增大,主因是 VLM 从 1.34B 升到 2.1B);model.safetensors.index.jsonmetadata.total_size5,448,327,040 字节(约 5.45GB),权重以 torch_dtype=bfloat16 为主的混合精度存储(部分子模块 model_dtype=float32),未见官方给出精确总参数量数字。

数据

  • 预训练沿用 N1 的「真机 + 人类视频 + 仿真 + 神经生成视频」四层金字塔思路,博客给出的预训练混合组成为:内部 GR-1 真机数据、OpenXE(Open X-Embodiment)、仿真 GR-1(即 DexMG/DexMimicGen)、来自 dreamgen-groot-dreams 的神经轨迹、以及 AgiBot-Beta。博客仅以图表形式给出混合分布,未在正文披露各源的具体小时数/帧数/混合权重比例(相比 N1 论文 Table 7 的详尽统计,本次发布材料没有重新公布对应表格)。
  • HF 页面绑定数据集 nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim,用于 robocasa-gr1-tabletop-tasks 仿真基准的微调样例数据。
  • 与评测/实验挂钩的具体数据规模(均来自博客实验章节):
    • Unitree G1 真机后训练:1,000 条遥操作 episode。
    • 新物体泛化实验:10 个预训练未见过的物体,结合人类第一视角视频(GoPro 拍摄)co-train。
    • DreamGen 神经轨迹泛化实验:覆盖 12 个新动词,通过 DreamGen pipeline 生成对应轨迹并显式训练(并非严格 zero-shot)。
  • 视觉输入格式:可变数量的 224×224 uint8 图像帧(HF 卡)。

训练方法

  • 目标:flow-matching loss(连续动作,沿用 N1)+ FLARE loss,系数 0.2(预训练和后训练均使用),二者联合训练。
  • 优化器:AdamW,cosine 学习率调度,warmup ratio 0.05(与 N1 相同)。
  • 规模:预训练 250,000 步(N1 为 200,000 步),global batch size 16,384(与 N1 相同量级),在 1,000 张 H100 GPU 上训练。
  • 后训练(微调):README 建议把 batch size 打到硬件上限,训 20k 步;在 RTX 4090 上微调需加 --no-tune_diffusion_model 以避免显存溢出;支持 LoRAlora_rank=64lora_alpha=128);支持多数据集联合训练,默认对不同数据集/轨迹赋予等权重(LeRobotMixtureDataset 类,balance_dataset_weights/balance_trajectory_weights 默认 True)。
  • 本次读到的材料未重新披露 N1.5 专属的、按 embodiment 细分的 post-training 超参表(batch size/steps 因任务而异,仅给出通用建议值)。

Infra(训练 / 推理工程)

训练

  • 1,000 张 H100 GPU,global batch 16384,训 250K 步;GPU-hours 未披露(不同于 N1 论文披露的约 50,000 H100 GPU-hours,N1.5 博客未给出等价数字)。

推理(单卡 H100,GitHub README FAQ)

  • VLM backbone:23.18 ms
  • Action Head(4 步扩散):4 × 6.18 ms = 24.7 ms
  • 全模型端到端:47.88 ms

Jetson AGX Thor 部署延迟trtexec 测,batch_size=1,同一 n1d5 分支 README):

模块FP16 (ms)FP8+FP4 (ms)
Action_Head - process_backbone_output2.35/
Action_Head - state_encoder0.04/
Action_Head - action_encoder0.10/
Action_Head - DiT5.463.41
Action_Head - action_decoder0.03/
VLM - ViT5.214.10
VLM - LLM8.535.81
  • 硬件覆盖:微调在 H100、L40、RTX 4090、A6000 上验证(Python 3.10,CUDA 12.4),RTX 3090 Ti + CUDA 11.8 组合也验证可行;推理在 RTX 3090、RTX 3090 Ti、RTX 4090、A6000 上验证;LoRA 微调用 2× A6000 或 2× RTX 4090。
  • 支持微架构(HF 卡):NVIDIA Ampere / Blackwell / Jetson / Hopper / Lovelace;Runtime = PyTorch,OS = Linux。

评测 benchmark

所有对比 baseline 均为同组织的 GR00T N1(博客原始数据)。

架构验证(从头训练,语言跟随类仿真基准,成功率 %)

BenchmarkGR00T N1 (from scratch)GR00T N1.5 (from scratch)
Language Table52.8%93.2%
Sim GR-1 Language36.4%54.4%

数据受限后训练(仿真,成功率 %)

Simulation BenchmarkGR00T N1GR00T N1.5
RoboCasa,每任务 30 条示范17.447.5
Sim GR-1,0-shot39.643.9
Sim GR-1,每任务 30 条示范43.247.4

真机 GR-1 语言跟随(两个水果放桌上,随机指定放到盘子里其一)

SettingGR00T N1GR00T N1.5
语言跟随率46.6%93.3%
总体成功率43.3%83.0%

从人类第一视角视频学习操作新物体(10 个预训练未见物体)

SettingGR00T N1GR00T N1.5
0-shot0%15.0%
FLARE 后训练(含新物体人类视频)-55.0%

DreamGen 神经轨迹泛化到新动词(12 个新动词,平均成功率):GR00T N1.5 38.3% vs GR00T N1 13.1%

Unitree G1 真机后训练(1K 条遥操作 episode 后训练)

ModelGR00T N1,1K DemosGR00T N1.5,1K DemosGR00T N1.5,1K Demos
任务2 选 1 水果放盘(共 4 种水果)2 选 1 水果放盘(共 4 种水果)2 选 1 物体放盘(5 种新物体)
成功率44.0%98.8%84.2%

创新点与影响

贡献:(1) 冻结 VLM 语言塔,把语言理解/泛化能力从微调中保护下来,是语言跟随成功率大幅提升(46.6%→93.3%)的核心原因;(2) Eagle 2.5 升级 + 适配器简化,grounding 能力显著提升(GR-1 grounding IoU +4.9、RefCOCOg-val +4.4);(3) 引入 FLARE 作为世界建模辅助目标,首次让 GR00T 系列具备从无动作人类视频里零样本学习操作新物体的能力(0%→15%,加人类视频后训练到 55%);(4) 把 dreamgen-groot-dreams 神经轨迹正式并入预训练,使模型在 12 个从未遥操作过的新动词上取得 38.3% 成功率(N1 仅 13.1%);(5) 新增 OXE_DROID/AGIBOT_GENIE1 两个 embodiment head,扩展跨本体覆盖范围。

影响:成为 GR00T 系列首个配套完整微调脚本 + HF checkpoint + 学术仿真基准结果的可用版本,被 HF 社区文章(SO-100/SO-101 微调教程)采用为参照基线;后续继续演进为 N1.6、再到 backbone 换 Cosmos-Reason2-2B/Qwen3-VL、许可转 Apache-2.0 商用的 N1.7。

作者自陈局限(博客原话对应):DreamGen 12 个新动词的「零样本」是有保留的——这些动词虽然没有对应的真实遥操作数据,但训练时通过 DreamGen 生成的神经轨迹被显式训练过,并非严格意义上的 zero-shot;完全的零样本动词/环境泛化留给未来工作(“leaving full zero-shot verb and environment generalization to future work”)。模型许可为 NVIDIA OneWay Noncommercial,仅限非商业用途。

原始链接

一手源存档(sources/)

  • groot-n1-5—blog — NVIDIA 官方博客快照(sources/embodied/2025/groot-n1-5—blog.md)
  • groot-n1-5—hf-card — HuggingFace nvidia/GR00T-N1.5-3B 模型卡 + config.json + safetensors index 快照(sources/embodied/2025/groot-n1-5—hf-card.md)
  • groot-n1-5—github-readme — Isaac-GR00T GitHub README 快照(n1d5 分支,即 N1.5 对应版本,sources/embodied/2025/groot-n1-5—github-readme.md)