一句话定位
UniSim 把「真实世界模拟器」做成一个动作进、视频出(action-in-video-out)的条件视频扩散模型:用一份 5.6B 参数的 video U-Net 融合互联网图文、机器人、人类活动、导航全景等异构数据,既能响应「打开抽屉」这类高层语言指令,也能响应「移动 Δx, Δy」这类低层控制,从同一张静态初始帧自回归地滚动出长时序、时间一致的交互视频,并被用来纯在模拟里训练视觉-语言规划器与 RL 策略后 zero-shot 迁移到真机。ICLR 2024 Outstanding Paper(最佳论文)。
背景与定位
这篇工作站在两条脉络的交叉点上。一条是隐空间世界模型(world-models-ha-schmidhuber、planet、dreamer-v1/dreamer-v2/dreamer-v3 的 RSSM,iris 的 transformer 世界模型)——它们大多在低维隐状态里学 one-model-per-system 的动力学,样本高效但难以跨系统共享知识、且多局限在游戏/仿真等视觉简单、数据充裕的域。另一条是互联网级生成模型:文本、图像、视频扩散模型已能合成逼真内容,但主要服务于生成媒体,而非驱动能多轮交互的智能体。UniSim 明确把 video generation 当成动力学建模问题来做,这一点是它与同期一众可控视频生成(driving motion、3D 几何、trajectory 条件)工作的分野。
它的直接前身是同一作者(Sherry Yang / Mengjiao Yang)的 unipi-universal-policies-video(UniPi,把序列决策转化为文本条件视频生成)——UniPi 把视频生成当策略,UniSim 则把视频生成当环境/模拟器,二者互补。与聚焦单一域的生成式世界模型(如自动驾驶的 gaia-1-wayve)不同,UniSim 的野心是一个跨域统一接口:所谓 “universal” 指的是「通过动作↔视频这个统一接口来模拟」,而非能模拟一切(作者明确声明声音、力反馈等非视觉量不在建模范围)。范式名称:action-conditioned generative real-world simulator / 生成式交互世界模型。
模型架构
总体范式:观测预测模型 p(o_t | h_{t-1}, a_{t-1}) —— 给定历史帧 h_{t-1} 与一个时序展开的动作 a_{t-1},预测下一段(变长)观测帧 o_t,用视频扩散参数化。自回归地把上一段采样出的观测拼进下一段的条件,即可跨视频生成边界滚出长时序、时间一致的交互。作者刻意只用「最近若干历史帧」而非完整 recurrent state 来条件化,以简化建模。
backbone:3D U-Net(Çiçek 2016 / Ho 2022b video U-Net),下采样-上采样带 skip connection,交错 3D 卷积与注意力层。级联三段:
- base 历史条件视频预测模型:时空分辨率 [16, 24, 40](16 帧、24×40);forward model 用时间注意力换最大建模灵活度。
- 两级空间超分模型:[24,40] → [48,80] 和 [48,80] → [192,320];超分模型用时间卷积(而非注意力)换效率。
history-conditioning(历史条件化):取上一视频段的 4 帧,把这些条件帧在所有未来帧位置复制、并逐通道拼接到噪声样本上,作为 U-Net 输入。消融显示(Ego4D 验证集)4 帧优于 1 帧、且「最近 4 帧」优于「指数间隔的 4 帧远历史」(见评测表)。
action-conditioning(动作条件化):用 classifier-free guidance(Ho & Salimans 2022)注入动作,公式为 ε̃ = (1+η)ε_θ(·|h, a) − η·ε_θ(·|h),η 控制动作条件强度。文本类动作用 T5 language embeddings 编码;低层控制(如机器人 Δx, Δy)既编成文本、又归一化后离散成 4096 个 bin,与语言 embedding 拼接,构成统一动作空间。实践中只用历史帧、省略历史动作作为 history。
关键超参(Table 6):模型总量 5.6B 参数;base channels 1024;channel multipliers 1,2,4;每分辨率 3 blocks;注意力分辨率 6/12/24,注意力头 16/16/8;条件 embedding 维度 4096、MLP 4 层、条件 token 长度 64;扩散噪声 schedule cosine、log-SNR range [−20, 20];采样 256 步;EMA 0.9999;dropout 0.1;预测目标 ε;优化器 Adam(β1=0.9, β2=0.99)、lr 1e-4、weight decay 0、batch size 256、训练 1,000,000 步。
数据
UniSim 的核心论点就是「编排(orchestrate)多样数据」——不同数据集各自在某个维度上信息丰富(图像富对象、机器人富动作、导航富运动、人类活动富语义动作),把它们在统一动作接口下融合。全量数据混合(Appendix B, Table 5,# examples / mixture weight):
| 数据集 | 类别 | # 训练样本(约) | 混合权重 |
|---|---|---|---|
| Habitat HM3D (object-nav) | Simulation/rendering | 710 | 0.1 |
| Language Table sim | Simulation | 160k | 0.05 |
| Bridge Data | Real robot | 2k | 0.05 |
| RT-1 data | Real robot | 70k | 0.1 |
| Language Table real | Real robot | 440k | 0.05 |
| Miscellaneous robot videos | Real robot | 133k | 0.05 |
| Ego4D | Human activity | 3.5M | 0.1 |
| Something-Something V2 | Human activity | 160k | 0.1 |
| EPIC-KITCHENS | Human activity | 25k | 0.1 |
| Miscellaneous human videos | Human activity | 50k | 0.05 |
| Matterport Room-to-Room scans | Panorama scan | 3.5M | 0.1 |
| LAION-400M | Internet text-image | 400M | 0.05 |
| ALIGN | Internet text-image | 400M | 0.05 |
| Miscellaneous videos | Internet video | 13M | 0.05 |
动作标注/统一策略:
- 仿真渲染(Habitat HM3D、Language Table):有文本就抽文本动作;连续控制用语言 embedding + 离散化控制值拼接。
- 真机数据(Bridge、RT-1/RT-2、Language Table real):任务描述当高层动作;有低层连续控制时同样离散化。
- 人类活动(Ego4D、EPIC-KITCHENS、SSV2):把视频分类/动作识别的标签转成文本动作;对视频下采样到能捕捉有意义动作的帧率、切成观测 chunk。
- 全景扫描(Matterport3D):静态扫描本无动作 —— 通过截断全景 + 两图间相机位姿构造动作(如 turn left)。
- 互联网图文(LAION):单张图当单帧视频,caption 当动作(caption 里常含 “a person walking” 之类运动信息)。
统一动作空间 = T5 文本 embedding ⊕(若有)离散化低层控制。混合权重取 0.1 或 0.05,作者自陈「未经仔细调参」,如何调混合权重影响模拟质量留作 future work。低数据域(如 Habitat HM3D 仅 710 例)naive 混合会退化,作者给动作前缀数据集标识符(dataset name)来提升 in-distribution 生成质量——但该 domain identifier 会损害跨域泛化,只在测试域 in-distribution 时用。
训练方法
目标:标准扩散去噪 MSE,L_MSE = ‖ε − ε_θ(√(1−β^(k)) o_t + √(β^(k)) ε, k | h_{t-1}, a_{t-1})‖²,ε∼N(0,I),β^(k) 为 K 级噪声。采样按逆过程从 o_t^(K)∼N(0,I) 迭代去噪 K→0。
级联训练:base 历史条件模型 + 2 个空间超分模型分别训练(类 Imagen Video 级联)。整体只用视频帧作 history、省略历史动作。
三个下游应用(都是”纯模拟训练 → 真机 zero-shot”):
- 长时序视觉-语言策略(hindsight relabeling):在 Language Table 上,用改造版 PaLM-E 12B(加入 goal image 条件)作 VLM 策略,预测语言指令 + 电机控制。用 UniSim 做 rollout 生成 10k 条长时序轨迹(每条 3-5 次 rollout、每次对应一条脚本语言指令),取末帧当 goal、脚本指令当监督来训策略。执行时先采一条语言指令→UniSim 预测 16 帧→用单独训练的逆动力学模型恢复低层控制在真机执行。VLM 用 64 TPUv3 训 1 天。
- 低层控制的模型基 RL(REINFORCE):微调 PaLI 3B(ViT-G/14 视觉 + UL2 编解码)用 BC 学 VLA 策略(连续动作离散成如 “+1 -5” 的 extra token)。Stage 1 多任务(BC + steps-to-success 预测 + instruction 预测),lr 1e-3、dropout 0.1、batch 128、300k 步、1k warmup。Stage 2 冻结 Stage 1 副本当奖励模型(steps-to-completion 之差当 reward,r = −[d(o_{t+1},g)−d(o_t,g)]·C,C=5e-2),把 UniSim 推理接口经 RPC 包成 DM Env API,用 REINFORCE 训 VLA。RL 超参:max steps/episode 100、64 个 actor、history stack 2、learner batch 64、γ=0.9(ACME 框架)。
- 视觉-语言模型数据增广(视频描述):微调 PaLI-X 55B 做 video captioning。用 ActivityNet Captions 训练集 30,740 条文本、每条从 UniSim 生成 4 段视频(4× 数据量),纯用生成数据微调。文本-only 条件通过喂白图占位帧 + 提高文本 CFG 强度实现。
Infra(训练 / 推理工程)
- 训练硬件:512 块 TPU-v3,训练 20 天(跑完全部数据),训练步数 1,000,000。
- 参数量/规模档:主模型 5.6B;模型规模消融跑了 500M / 1.6B / 5.6B 三档(见评测)。
- 并行/精度:论文未披露具体并行策略与数值精度(未披露)。
- 推理工程:base 模型采样 256 步的扩散(DDPM-style),级联两级超分到 192×320;作者未给出具体 FPS / 单步延迟 / control-Hz(未披露)。RL 应用中把视频生成模型的推理接口经 RPC 暴露、用 DM Env API 包成环境 step,actor 做限速以防生成轨迹过于 off-policy。
- 边缘/部署 HW:未披露(模型未开源、未发布权重)。
评测 benchmark
均为论文一手报告的自评(模拟质量用 FVD/FID/IS/CLIP,下游用任务指标):
历史条件消融(Ego4D 验证集,Table 1) —— 4 recent 最佳:
| 条件 | FID↓ | FVD↓ | IS↑ | CLIP↑ |
|---|---|---|---|---|
| 1 frame | 59.47 | 315.69 | 3.03 | 22.55 |
| 4 distant | 34.89 | 237 | 3.43 | 22.62 |
| 4 recent | 34.63 | 211.3 | 3.52 | 22.63 |
数据消融(held-out test,Table 8) —— 去掉互联网数据 FVD 显著变差:
| 数据 | FVD↓ | CLIP↑ |
|---|---|---|
| Internet only | 219.62 | 22.27 |
| Without internet | 307.80 | 21.99 |
| Universal simulator(全量) | 211.30 | 22.63 |
模型规模消融(held-out test,Table 9) —— 越大越好但 FVD 增益随规模放缓(作者自陈从 scaling 角度「略令人失望」):
| 规模 | FVD↓ | CLIP↑ |
|---|---|---|
| 500M | 277.85 | 22.08 |
| 1.6B | 224.61 | 22.27 |
| 5.6B | 211.30 | 22.63 |
下游 1 — 长时序 VLM 策略(Language Table,RDG=reduction in distance to goal,Table 2):模拟 hindsight 数据训练比原始短时序数据好 3-4 倍。
| 方法 | RDG(moved) | RDG(all) |
|---|---|---|
| VLM-BC(原始短时序) | 0.11±0.13 | 0.07±0.11 |
| Simulator-Hindsight | 0.34±0.13 | 0.34±0.13 |
下游 2 — RL 策略(48 任务成功率,Table 3):Simulator-RL 显著优于 VLA-BC,尤其在示范稀缺的 pointing 任务。
| 方法 | Succ.(all) | Succ.(pointing) |
|---|---|---|
| VLA-BC | 0.58 | 0.12 |
| Simulator-RL | 0.81 | 0.71 |
RL 策略纯在 UniSim 里训、zero-shot 迁移真机成功执行(如「把蓝方块移到绿圆」)。
下游 3 — 视频描述(PaLI-X 55B,CIDEr,Table 4):纯用 UniSim 生成数据微调,ActivityNet 从 15.2(不微调)→ 46.23,达真数据微调(54.90)的 84%,且迁移其他任务(MSR-VTT/VATEX/SMIT)优于真数据微调(真数据易过拟合 ActivityNet):
| 微调 | ActivityNet | MSR-VTT | VATEX | SMIT |
|---|---|---|---|---|
| No finetune | 15.2 | 21.91 | 13.31 | 9.22 |
| 真 ActivityNet 数据 | 54.90 | 24.88 | 36.01 | 16.91 |
| UniSim 生成数据 | 46.23 | 27.63 | 40.03 | 20.58 |
创新点与影响
贡献:
- 首次把跨维度丰富的异构数据(对象/场景/动作/运动/语言/电机控制)在统一 action-in-video-out 生成框架下融合,做成一个真实世界的通用(统一接口意义上的)模拟器。
- 把该框架形式化为基于有限历史的观测预测模型、用视频扩散参数化,并证明可自回归滚动出一致的长时序视频。
- 证明该模拟器能让高层语言策略、低层控制策略、以及视频描述模型在纯模拟训练后泛化到真实世界,向弥合 sim-to-real gap 迈出一步。
它改变了什么:UniSim 树立了「用大规模生成视频模型当可交互环境/真实世界模拟器」这一范式的旗帜性成果(ICLR 2024 最佳论文),是后来 Genie、Genie-2、以及各类交互式神经世界模型/游戏引擎、以及把世界模型用于具身智能体训练的重要参照点。它把「视频生成」从生成媒体推向「动力学建模 + 决策」,并给出可跨域数据编排的具体配方。
作者自陈局限:
- 幻觉:动作与场景不匹配时(对桌面机器人说”洗手”)会产生不合理输出(桌子变水槽),理想上应能检测「无法模拟的动作」而非硬编。
- 有限记忆:只条件化最近几帧无法捕捉长期记忆(放进抽屉的苹果若不在条件历史里,开抽屉时可能消失)。
- 有限跨域泛化:尤其对训练数据未覆盖的域;模型主要在 4 种机器人形态上训练,对未见机器人泛化有限,需进一步扩数据。
- 仅视觉模拟:不建模不引起视觉变化的动作(如抓静止杯子的不同力度),也不建模声音等非视觉量——真正的通用模拟器应覆盖视觉之外的一切。
原始链接
- arXiv abs:https://arxiv.org/abs/2310.06114 (v3, 2024-09-26;ICLR 2024 conference paper)
- arXiv PDF:https://arxiv.org/pdf/2310.06114
- OpenReview PDF:https://openreview.net/pdf?id=sFyTZEqmUY
- 项目主页(交互 demo / 视频):https://universal-simulator.github.io/unisim/
- 无官方开源代码库 / 无发布权重(Google DeepMind 未开源)
一手源存档(sources/)
- unisim—project-page — 项目主页快照(sources/world-model/2023/unisim—project-page.md)
- arXiv 全文 PDF(arXiv:2310.06114,本页数字均出自该原文 + 附录 B/C/D/E,不入 git,用上方 arXiv 链接重下)