一句话定位
RoboDreamer 把「文本条件视频扩散=机器人世界模型」这条路线的语言条件做成了可组合的:先用句法解析器把一句机器人指令拆成动词短语(动作)+介词短语(空间关系)等分量,再让一组共享参数的扩散分量分别对每个分量条件建模、推理时按能量模型(EBM)的乘积组合到一起,从而只需见过分量本身、不需要见过分量的具体组合就能零样本生成”未见过的动作-物体-关系搭配”的操作视频;同一套乘积组合机制被进一步扩展到目标图像 / 目标简笔画等多模态条件,实现语言与视觉目标的即插即用组合。
背景与定位
RoboDreamer 延续 unipi-universal-policies-video 开创的 UPDP(Unified Predictive Decision Process)范式——把决策规划规约成「文本条件视频生成 + 逆动力学取动作」,视频扩散模型本身就是世界模型 ρ(·|x₀,c)。它在代码与生成骨干上直接建立在 avdc-actionless-videos 与 Imagen Video(Ho et al., 2022)之上(“built upon AVDC and Imagen”),但要解决的是这条范式共同的短板:自然语言指令的组合爆炸——机器人任务里的语言高度依赖具体物体和空间关系的搭配(“move X near Y”),训练数据难以覆盖所有搭配,单一(monolithic)文本条件视频模型在训练时未见过的动作-物体-关系组合上会显著失准(如把 “move pepsi can near plastic bottle” 生成成把易拉罐放到了错误的绿色罐子旁)。
RoboDreamer 的解法是把组合生成(compositional generation)文献里”用能量模型/扩散模型的乘积组合子分布”的思路(Liu et al., 2022 Composable Diffusion;Du et al., 2023a Reduce-Reuse-Recycle)从图像生成迁移到文本条件视频生成——此前该思路在视频生成里探索有限。同为组合式规划的 HiP(Ajay et al., 2023,“Compositional foundation models for hierarchical planning”)走的是组合多个专家基础模型(高层规划器+低层视频模型+逆动力学各自独立)的路线,而 RoboDreamer 是在同一个视频扩散模型内部,把语言本身的组合性映射成分量条件的乘积,是句法层面的因子分解而非模型层面的分工。VideoAdapter(Yang et al., 2023a)也做文本到视频的适配迁移,但不能泛化到未见过的文本描述。
模型架构
视频扩散骨干沿用 avdc-actionless-videos + Imagen Video 的像素空间级联扩散设计,三阶段级联超分辨率(base + 2 个 super-resolution 阶段):
- U-Net 结构:4 个 ResNetBlock,每块由「空间-时间卷积层 + 与条件指令做 cross-attention 的层」组成;temporal-attention 层加在编码器最后一块和解码器第一块。base channel = 128,channel multiplier = [1, 2, 4, 8]。
- 分辨率级联:base 模型在 8×64×64 视频上训练,随后级联超分到 8×128×128、再到 8×256×256(三阶段)。沿用 tiling 方式增强时间一致性;由于同一视频各帧背景应保持一致,把输入条件帧在通道维拼接到所有加噪帧上再喂入 U-Net。
- 文本编码:冻结的预训练 T5-XXL 文本编码器,输出上下文相关的语言 embedding。
- 多模态编码:目标图像 / 目标简笔画使用 Stable Diffusion VQVAE 的预训练图像编码器(下采样、快速抽取空间信息);所有模态 embedding 统一送入 PerceiverSampler(Perceiver IO 架构),再通过 U-Net ResNet 块内新增的 cross-attention 层注入。
- 文本解析(组合的关键):用预训练成分句法解析器(Kitaev et al., 2018)+ 规则方法,把一条指令 L 拆成一组动词短语/介词短语分量 {lᵢ},如 “place water bottle into bottom drawer” → 动作分量 “place water bottle” + 空间关系分量 “into bottom drawer”。
- 组合生成的概率表达:把 p_θ(τ|L) 表示成各分量条件密度的乘积 p_θ(τ|L) ∝ ∏ᵢ p_θ(τ|lᵢ)^(1/N)(式 1),对应分数函数取平均 Σᵢ(1/N)ϵ(τ,t|lᵢ);训练用混合目标(式 4):每步随机采样 M 个分量的子集 S′,用 (1/M)Σᵢϵ(τₜ,t|l_{Sᵢ}) 去逼近噪声,而非只优化全分量乘积——这样保证每个分量单独条件时也能准确建模 p(τ|lᵢ),推理时才能自由拼装未见过的分量组合。推理阶段(Algorithm 2)用类似 classifier-free guidance 的组合公式:ε̃ = ε_uncond + Σᵢ w(ε_θ(τₜ,t|lᵢ) − ε_uncond),guidance weight w 可调。
- 多模态扩展:把语言分量集 L={lᵢ} 与多模态目标集 M={mᵢ}(目标图像、目标简笔画)一起纳入乘积 p_θ(τ|L,M) ∝ ∏ᵢp_θ(τ|lᵢ)^{1/(N+K)} ∏ᵢp_θ(τ|mᵢ)^{1/(N+K)}(式 5),训练目标相应扩展为语言与模态两组子采样分量的联合去噪(式 6)。这使得推理时可以自由改变模态数量与语言组合,包括训练时未成对出现过的语言-模态搭配。
数据
- RT-1 数据集(Brohan et al., 2022):约 70k 条演示,平均长度 44 帧,训练时每 5 帧采样一次;约 500 个不同任务,任务类别涵盖 pick、pick…from…、place、open、close、knock、pull。语言指令随机抽取部分作为训练时未见过的测试用例,用于零样本泛化评测。
- 多模态训练标注来源:目标图像取自视频最终帧;目标简笔画由 ControlNet 的标注器(annotator)生成(原文未展开具体是哪种边缘检测标注器)。
- RLBench(James et al., 2020):74 个视觉驱动的机器人学习任务,涵盖工具使用、抓取放置、长时程规划;遵循 Guhur et al., 2023(Hiveformer)的 macro-step 设定;仅使用前置相机的 RGB 观测(不用多视角,加大挑战性);Franka Panda 机械臂,7 自由度(7 DoF),8 维动作空间 + 夹爪状态。
- 人评规模:约 128 个样本、覆盖 20+ 条文本指令,每条样本至少 3 人评分,0/1 二值(是否完成任务/规划是否合理可执行)。
- 逆动力学模型训练数据:两帧相邻观测 + 当前状态 → 动作,用于把视频计划转成可执行动作。
- sim-vs-real:RT-1 与 RLBench 均为已有的机器人真实/仿真数据集,论文未额外做人类视频等跨域数据混合训练(与其自陈的局限 2 呼应——现有数据集多样性有限)。
训练方法
- 目标函数:如上式(4)(6)所述,是标准 DDPM ε-预测 MSE 损失在”随机子采样分量集合”上的期望,本质是把组合生成的乘积密度用分数匹配训练,不涉及强化学习;属于纯监督式视频扩散训练(video-level imitation)。
- 多阶段:(1)文本解析器离线切分指令为分量;(2)视频扩散主干在分量条件与多模态条件上联合训练;(3)推理阶段用组合采样(Algorithm 2)拼装出未见过的语言/模态组合对应的视频;(4)执行阶段沿用 unipi-universal-policies-video 的做法,用逆动力学模型 π(·) 从相邻帧对推出动作,按视频顺序执行,并周期性用新观测重新生成视频计划做闭环重规划(closed-loop replanning)。
- 动作 token 化:无——动作不是模型直接输出,而是靠独立的逆动力学模型从生成视频的相邻帧回归出来,与 AVDC 的纯几何解算不同,RoboDreamer 沿用的是 UniPi 式”学习一个逆动力学网络”的方案。
- 关键超参:batch size 256,learning rate 5e-5;RLBench 评测为公平对比,RoboDreamer 本身也只使用语言指令、不额外加入目标图像条件。
Infra(训练 / 推理工程)
- 训练硬件:视频扩散模型在约 100 块 V100 GPU 上训练,batch size 256,learning rate 5e-5(论文原文数字)。GPU-hours、混合精度策略均未披露。
- 推理 FPS / 控制频率 / 边缘硬件:论文正文未给出 RoboDreamer 自身的推理延迟或控制频率数字(仅在讨论组合采样算法时给出算法流程,未给出实测秒数);Table 3/RLBench 实验也未披露单次规划或执行的时延。
评测 benchmark
RT-1 上的组合泛化(Table 1,人评打分,越高越好)
| 模型 | Seen | Unseen |
|---|---|---|
| AVDC | 63.1 | 46.9 |
| HiP | 70.3 | 50.1 |
| RoboDreamer w/o(去掉文本解析的消融) | 85.5 | 68.8 |
| RoboDreamer | 90.1 | 81.3 |
RoboDreamer 相对 w/o 消融的提升在 Unseen 上更大(68.8→81.3,+12.5),验证文本解析+组合生成主要收益体现在未见组合的泛化上。
RT-1 上的多模态生成(Table 2 + 附录 Table 4,人评 ↑ / FVD ↓ / IMO ↑,IMO 为 GroundingDINO 检测框 IoU)
| 模型 | Human | FVD | IMO |
|---|---|---|---|
| AVDC | 46.9 | 517.1 | — |
| RoboDreamer (t,仅语言) | 81.3 | 487.8 | 63.5 |
| RoboDreamer (t+s,+目标简笔画) | 94.7 | 454.7 | 72.5 |
| RoboDreamer (t+i,+目标图像) | 95.8 | 444.3 | 78.1 |
加入目标图像或简笔画条件后,人评与 FVD、IMO 三项指标一致提升,验证多模态组合对空间对齐的帮助。
RLBench 机器人规划成功率(Table 3,单位:%,单前置相机观测)
| 模型 | lamp off | lamp on | stack blocks | lift block | take shoes | close box | Average |
|---|---|---|---|---|---|---|---|
| Image-BC | 60.1 | 47.0 | 0 | 0 | 0 | 82.4 | 31.6 |
| Hiveformer | 81.2 | 53.2 | 10.6 | 28.2 | 1.0 | 90.8 | 44.2 |
| UniPi | 70.6 | 47.1 | 7.1 | 23.3 | 3.8 | 94.1 | 41.0 |
| RoboDreamer | 96.3 | 51.9 | 18.5 | 22.2 | 10.5 | 96.3 | 49.3 |
RoboDreamer 在长时程任务(stack blocks、take shoes)上仍优于两个基线,平均成功率 49.3% 为四者最高。(原文正文另有一句表述”RoboDreamer achieves a success rate of 15% with the help of predicted future observations”,与 Table 3 具体数字对不上,原文如此,未做修正推断。)
创新点与影响
- 把组合生成从图像域迁移到文本条件视频生成域:此前组合式扩散/EBM 主要用于文本、图像生成,视频生成里的组合性探索有限;RoboDreamer 用句法解析+分量条件乘积把这一思路系统地用到机器人视频世界模型上。
- 多模态即插即用组合:同一套乘积框架把语言分量与目标图像/简笔画分量统一处理,推理时可以自由变更模态数量与组合,不要求训练时见过该配对。
- 在 RT-1 未见任务组合与 RLBench 单相机机器人规划上均验证有效,一致超过 AVDC、HiP、UniPi、Hiveformer、Image-BC 等基线。
- 作者自陈局限(原文 Limitations 节):(1)仅用单相机观测,无法利用多视角/3D 信息,认为为 RoboDreamer 引入 3D 归纳偏置是未来方向;(2)在许多真实世界图像上泛化较差,认为现有机器人数据集多样性仍不足,提出未来可联合 YouTube 视频与机器人数据做协同训练;(3)与同类视频生成模型一样,在移动相机场景下能力受限,需要额外的稳定化处理。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2404.12377
- 论文 PDF:https://arxiv.org/pdf/2404.12377
- 项目主页(视频 demo):https://robovideo.github.io/
- 官方代码:https://github.com/rainbow979/robodreamer
一手源存档(sources/)
- robodreamer—project — 项目主页快照(abstract、作者单位、各类生成结果分类清单)
- robodreamer—github-readme — 官方 GitHub README 快照(安装、训练命令、致谢的基础代码库 imagen-pytorch / AVDC)
- arXiv 全文 PDF(arXiv:2404.12377,ICML 2024,arXiv 原文 PDF,不入 git)