一句话定位
NVIDIA 提出的 4 阶段流水线:把图生视频世界模型(WAN2.1/Cosmos)微调到目标机器人本体上,用它「造梦」出全新行为、全新环境的机器人视频,再用 IDM 或潜在动作模型把这些视频反标注出伪动作序列(“神经轨迹” neural trajectories),最终只用神经轨迹就能训出策略——让人形机器人仅凭单一环境的抓取-放置遥操作数据,学会 22 种全新动词、并迁移到 10 个全新环境。
背景与定位
DreamGen 处在 2024-2025 年「视频世界模型 → 机器人合成数据」这条支线上,与依赖仿真引擎(如 robocasa、MimicGen 系)或纯图像增广(in-painting/GenAug)的合成数据路线不同:它把 SOTA 视频生成模型(wan-2-1、cosmos-predict/cosmos-predict2、Hunyuan、CogVideoX)当作”世界先验”的搬运工——先用少量真机遥操作数据把视频模型 LoRA 微调到目标本体的运动学/动力学上,再让它在训练分布之外自由生成(新动词、新场景),最后用 lapa-latent-action-pretraining 或 VPT 式 IDM 把视频反标注成动作,交给下游视觉运动策略(groot-n1、π0、Diffusion Policy)训练。
与此前”视频世界模型当测试时规划器/奖励信号”的用法(Video Language Planning 等)不同,DreamGen 刻意把世界模型和机器人策略解耦——不追求实时联合运行,而是把世界模型当离线数据生成器,从而能榨干当前最强视频生成模型的先验,而不受”能否实时跑在机器人上”的约束。它是 NVIDIA Isaac GR00T 数据金字塔(真机 + 人类视频 + 仿真 + 神经生成视频)中”神经生成视频”这一层的具体实现,后续作为 GR00T-Dreams blueprint 开源,成为 groot-n1 的数据来源之一。
模型架构
DreamGen 本身不是单一网络,而是一条 4 段流水线,涉及三类模型:
(1) 视频世界模型(数据生成器)
- 主体实验的 backbone 是 WAN2.1(image-to-video 扩散模型);DreamGen Bench 里另外评测了 Cosmos(Cosmos-Predict1)、Hunyuan、CogVideoX 共 4 个模型的 zero-shot 与微调(SFT)版本。开源代码库(GR00T-Dreams repo)实际发布的流水线换成了 Cosmos-Predict2(cosmos-predict2)。
- 微调方式:默认用 LoRA(rank 4,alpha 4,学习率 1e-4)微调,以减轻对互联网视频先验的遗忘。
- 多视角输入处理:RoboCasa、DROID 等含多相机视角的数据集,把 left/right/wrist 三个视角拼成 2×2 网格(左上=left cam,右上=right cam,左下=wrist cam,右下补黑),整格喂给视频模型微调。
(2) 伪动作标注模型(把视频转成动作)
- IDM(inverse dynamics model):diffusion transformer + SigLIP-2 视觉编码器,用 flow matching 目标训练;只喂两帧图像(不喂语言、不喂本体状态),预测两帧之间的 action chunk;推理时用滑动窗口(预测 â_t..â_{t+H},再滑一步预测 â_{t+1}..â_{t+1+H},以此类推)逐段伪标注整段生成视频。
- 潜在动作模型(LAPA):transformer encoder-decoder,VQ-VAE 目标,codebook size = 8,序列长度 = 16;条件是当前帧 + 未来 1 秒帧;用预量化的连续 embedding 作为潜在动作(沿用 groot-n1 的做法);训练 100K steps,batch size 1024。优点是不需要目标本体的真实动作标签。
(3) 下游视觉运动策略:神经轨迹与具体策略架构解耦,论文在 Diffusion Policy、π0、GR00T N1 三种策略上都验证有效;神经轨迹没有本体状态信息,训练时状态一律置零(消融显示这不损害性能);GR00T N1 把”神经轨迹”当作一个独立的 embodiment,用单独的 action encoder/decoder 与真实轨迹区分;co-training 采样比例 1:1。
数据
LAPA 潜在动作模型训练混合(Table 3,跨真机/仿真/人类视频):
| 数据集 | 帧数 | 时长(h) | FPS | 类别 |
|---|---|---|---|---|
| GR-1 Teleop Pre-Training | 6.4M | 88.4 | 20 | 真机 |
| DexMG | 4.4M | 61.64 | 20 | 仿真 |
| DROID (OXE) | 23.1M | 428.3 | 15 | 真机 |
| RT-1 (OXE) | 3.7M | 338.4 | 3 | 真机 |
| Language Table (OXE) | 7.0M | 195.7 | 10 | 真机 |
| Bridge-v2 (OXE) | 2.0M | 111.1 | 5 | 真机 |
| RoboCasa | 19.3M | 268.0 | 20 | 仿真 |
| Agibot-Alpha | 213.8M | 1979.4 | 30 | 真机 |
| Sth-v2 | 4.0M | 105.7 | 30 | 人类 |
| Ego4D | 154.4M | 2144.7 | 20 | 人类 |
| 合计 | 438.1M 帧 | 5721.3 h | – | – |
各具体实验的真机遥操作数据规模:
- RoboCasa 仿真:视频世界模型在 1,200 条原始人类演示上微调;策略/IDM 训练分低/中/高三档(720=30×24 任务、2,400=100×24、7,200=300×24);RoboCasa 数据生成把神经轨迹规模扩到 24 万条(240k),观测到策略表现与神经轨迹数量呈 log-linear 关系。
- GR1 人形(4 个灵巧任务:锤钉子/擦拭/叠布/摞碗):每任务采集 100 条,但只用 10 条(叠布任务用 25 条)做低数据实验;对应生成 300 条神经轨迹/任务,1:1 co-train。
- Franka(DROID,3 个任务:放奶盒/摞方块/工具使用-舀 M&M):视频世界模型与 IDM 在 49,895 条 DROID 轨迹上训练;低数据实验分别只用 11 / 10 / 8 条真机轨迹;每任务生成 100 条神经轨迹。
- SO-100($100 机械臂,2 个任务:摘草莓/井字棋):原始采集 40 条与 50 条,各取 25%(10 条、13 条)做低数据实验;生成 40 条、50 条神经轨迹。
- 行为泛化实验(GR1):视频世界模型只在 2,884 条单一实验室环境的抓取-放置轨迹上训练;对 14 个全新行为任务各生成 50 条神经轨迹,纯神经轨迹训练策略(不用任何人类演示)。
- 环境泛化实验:同一个(仅抓取-放置)视频世界模型,喂入 10 个全新环境的初始帧,覆盖 6 个”新环境+已见行为”任务与 7 个”新环境+全新行为”任务,共 13 个任务,同样纯神经轨迹训练。
训练方法
四步流水线:(1) 微调视频世界模型(LoRA,在目标机器人遥操作视频上学运动学/动力学约束,用 instruction-following 与 physics-following 两个指标判断微调是否到位)→ (2) 世界模型 rollout(喂初始帧 + 语言指令生成大量合成视频,涵盖训练分布内动作与全新动词/全新场景)→ (3) 伪动作标注(IDM 或 LAPA,见”模型架构”)→ (4) 在神经轨迹上训练视觉运动策略(语言指令 + 图像观测 → 动作序列 â_{t:t+H})。
两种使用神经轨迹的方式:与真实轨迹 1:1 co-training(数据增广场景),或只用带 IDM 动作的神经轨迹训练(行为/环境泛化场景,完全不用目标行为的真机演示)。RoboCasa 微调超参:100 epochs,batch 32;GR1:75 epochs,batch 64;DROID:5 epochs,batch 64;SO-100(两个任务):200 epochs,batch 8。
Infra(训练 / 推理工程)
- 训练超参见上(epoch/batch size 均已披露,未披露具体 GPU 型号/卡数/训练时长)。
- 唯一披露的大规模算力数字:生成 RoboCasa 的 24 万条(240k)神经轨迹数据集,耗时 54 小时、使用 1,500 张 NVIDIA L40 GPU(论文 Limitation 一节明确指出这是 DreamGen 当前的主要成本瓶颈)。
- 推理侧 FPS / 控制频率 / 边缘硬件延迟:论文未披露具体数字。
- 开源 blueprint(GR00T-Dreams repo)给出的是部署侧推荐硬件清单(非论文训练算力):推荐配置 8× RTX PRO 6000 Blackwell Server Edition(800GB 显存);“卓越中心”配置 NVIDIA DGX B300(Blackwell Ultra,2.3TB 显存)。
评测 benchmark
RoboCasa 数据增广(Appendix E,24 任务均值,GR00T N1 为策略):
| 30 traj | 100 traj | 300 traj | 30+NT | 100+NT | 300+NT | 仅 NT | |
|---|---|---|---|---|---|---|---|
| 成功率 | 17.44% | 32.07% | 49.59% | 23.32% | 39.94% | 57.61% | 20.55% |
——即便完全不用真实演示、只用神经轨迹训练,也能达到 20.55% 的非平凡成功率,接近 30 条真实演示的水平。
真机数据增广(低数据/10% 场景,GR00T N1,Appendix G): GR1 四任务均值 37.0% → 46.0%;Franka 三任务均值 23.3% → 36.7%;SO-100 两任务均值 21.0% → 45.5%(Diffusion Policy、π0 上同样有正向增益,幅度略小)。
行为泛化(GR1,14 个全新动词任务,仅神经轨迹训练): GR00T N1 baseline(只在 2,885 条抓取-放置上训练)均值 11.2% → DreamGen 43.2%;单任务如 Hit Keyboard 0→90%、Water flowers 50→95%、Unroll mat 0→55%。
环境泛化(10 个全新环境,共 13 个”新环境×行为”任务,仅神经轨迹训练): baseline 在全部 13 个任务上均为 0.0%(完全无法泛化出训练环境)→ DreamGen 合计均值 28.5%(涵盖 6 个”新环境+已见行为”与 7 个”新环境+全新行为”任务,单任务如 Close soup container 达 55%)。
DreamGen Bench(4 视频模型 × zero-shot/SFT × 4 数据集,Table 2): 微调(SFT)后所有模型都显著优于 zero-shot(多数 zero-shot 在 RoboCasa/GR1 上 IF≈0);SFT 后 WAN2.1-sft 与 Cosmos-sft 总体最强(如 RoboCasa PA:Cosmos-sft 61.5 > WAN2.1-sft 55.3 > CogVideoX-sft 44.8 ≈ Hunyuan-sft 44.8;GR1-Behavior PA:WAN2.1-sft 64.9 ≈ Cosmos-sft 64.9)。自动指标与人工评测的 Pearson 相关系数(IF, GPT-4o 评测):RoboCasa 0.94、GR1-Object 0.93、GR1-Behavior 0.96、GR1-Env ≈1.00,验证了自动 benchmark 的可靠性。用 7K 条神经轨迹在 RoboCasa 上重跑下游策略训练,DreamGen Bench 分数与下游成功率呈正相关。
创新点与影响
- 首次证明视频世界模型微调 + 伪动作标注可以零样本解锁行为泛化与环境泛化:机器人只用单一环境、单一动词(抓取-放置)的遥操作数据,就能学会 22 种新动词、迁移到 10 个新环境——此前工作的环境泛化通常要求扩大训练环境数量的真实采集。
- 提出 DreamGen Bench,把”视频世界模型好不好用来生成机器人数据”这件事量化为可复现的 instruction-following + physics-alignment 指标,并验证其与下游策略表现正相关,为不接触真实机器人的视频模型研究者提供了低成本的机器人learning代理指标。
- 论文自陈的局限:任务相对简单,覆盖机器人运动学能力的一小部分,更复杂灵巧行为仍是未来方向;当前流水线算力开销大(RoboCasa 240k 样本生成需 1,500×L40×54h);仍需人工提供初始帧(未自动化);DreamGen Bench 的轻量开源评测模型在判断物理真实感时仍会偶尔幻觉。
原始链接
- arXiv: https://arxiv.org/abs/2505.12705 (v2,2025-06-17;v1 于 2025-05-19 提交,标题曾为 “…through Neural Trajectories”)
- PDF: https://arxiv.org/pdf/2505.12705
- 项目主页: https://research.nvidia.com/labs/gear/dreamgen
- GitHub: https://github.com/NVIDIA/GR00T-Dreams
- HF 模型(Cosmos-Predict2 微调 checkpoint,需登录): https://huggingface.co/nvidia/Cosmos-Predict2-14B-Sample-GR00T-Dreams-GR1 、 https://huggingface.co/nvidia/Cosmos-Predict2-14B-Sample-GR00T-Dreams-DROID
一手源存档(sources/)
- dreamgen-groot-dreams—github-readme.md — GR00T-Dreams repo README + reference_architecture.md
- dreamgen-groot-dreams—project-page.md — 官方项目主页(research.nvidia.com/labs/gear/dreamgen)
- arXiv 原文 PDF/HTML(2505.12705),不入 git,见上方链接