一句话定位
EnerVerse(AgiBot/智元机器人 + 上海人工智能实验室等,2025-01)把机器人操作的”未来空间生成”和”视频生成”明确区分开——用一个 chunk-wise 自回归多视角视频扩散模型 + 稀疏记忆机制生成理论上无限长的具身未来空间,配合不依赖物理相机、锚定在机器人基座坐标系下的 Free Anchor View(FAV)虚拟视角解决遮挡和运动歧义,再用生成模型与 4D Gaussian Splatting(4DGS)互相闭环的”数据飞轮”缓解 Sim2Real 数据稀缺,最终接一个朴素策略头(EnerVerse-A)在 LIBERO、CALVIN 与真实机械臂任务上取得当时的 SOTA。
背景与定位
论文开篇明确一个立场:“视频生成不等于具身未来空间生成”——机器人任务需要因果任务逻辑(何时开始/结束)、精确的执行结果,以及跨步骤的上下文记忆能力,而通用视频生成模型只建模 2D 投影序列,缺乏这些属性。这是对同期”把视频扩散模型直接套用到机器人”路线的一次反思,论文点名 avid(把预训练视频扩散模型通过轻量 adapter 改造为动作条件世界模型,同样在 RT-1 上微调 DynamiCrafter 做对比基线)为”简单套用通用视频生成模型、忽视机器人任务特有需求”的代表。
EnerVerse 站在两条脉络的交叉点:
- 视频生成→策略规划:VidMan、AVID、GR-2(bytedance-gr-2,在互联网视频上预训练再微调视频生成+动作预测)等工作已经在探索用无动作标注的大规模视频数据训练策略先验;
- 多视角/3D 世界建模:论文认为单视角视频生成难以处理遮挡和度量歧义,因此把 2D 视频生成扩展为以相机几何为条件的多视角生成,并引入 4DGS 做几何一致性约束。
与直接在物理机器人/工作空间上加装多相机的方案(openvla、octo、Diffusion Policy diffusion-policy 等常用固定视角设置)不同,EnerVerse 提出的 Free Anchor View 不受物理相机安装位置约束——可以在狭窄空间(如厨房)里”悬空”存在,用深度扭曲(depth warping)+ 点云渲染从单目观测生成。预训练数据沿用 RT-1(rt-1)等公开数据集,策略基线对比涵盖 Diffusion Policy、Octo、OpenVLA、MDT、MAIL。EnerVerse 之后,同一团队把这条”4D 具身基础模型”路线进一步扩展为统一平台 genie-envisioner。
模型架构
Backbone:基于 UNet 的隐空间视频扩散模型 DynamiCrafter(1.4B 参数,冻结 VAE 83.7M),论文声明架构上也兼容 DiT,但实验主体仍用 UNet。整个生成过程被扩展到 4D 隐空间 B×C×V×T×H×W(batch、channel、视角数、时间步、空间分辨率),通过 reshape 在三种模式间切换:(BT)(VHW)C 做空间注意力、(BVHW)TC 做时间注意力、(BVT)CHW 做解码前处理;图像解码按 view、按帧独立进行。
Chunk-wise 自回归生成:观测隐变量序列 o_t^{1:K}(VAE 编码)与预测隐变量序列 z_t^{1:M} 拼接,训练干净帧+噪声帧联合预测去噪目标,采用 v-prediction 参数化;推理时用滑动窗口——已去噪的帧滚动成为下一轮的干净上下文,直到检测到预定义的 End-of-Sequence(EOS)帧(用生成帧与 EOS 帧隐变量的 L1 距离设阈值判断),理论上支持无限长序列生成。Chunk size 在 {1,4,8,16} 间做过对比,8 时鲁棒性最优(默认配置)。
稀疏记忆(Sparse Memory / Context Frame)机制:训练时不用连续帧做上下文,而是随机稀疏采样约 20% 的历史帧作为干净上下文(即丢弃约 80% 冗余帧),并对记忆帧注入按时间距离余弦调度的”腐蚀噪声”(沿用 Genie genie-generative-interactive-environments 的做法)。消融显示该设计避免了连续记忆下的”意外坍塌”(模型在 OOD 场景下无法恢复),同时节省计算。
FAV / 多视角生成(EnerVerse-G):文本条件 c 用途上论文正文(2.1 节)写”由一个冻结的 T5 编码器编码后接 MLP 投影”,但附录 A 讨论真实世界实验时又提到”our CLIP text encoder”——原文两处表述不一致,此处照录、不替读者调和。相机条件通过逐像素的 ray-direction map(编码内外参)沿通道维与图像隐变量拼接(隐空间通道数:图像隐变量 4 + ray map 6),再用沿 view 维展开的”跨视角空间注意力”和沿时间维的”时间注意力”分别建模跨视角几何一致性与场景动态。FAV 本身不依赖物理相机,而是相对机器人基座坐标系定义,通过初始点云重建(深度扭曲)+ 渲染获得——正文示例中渲染视角对应绕 Z 轴 ±30° 旋转 RGB 相机视角得到的两个 Render View。
策略头(EnerVerse-A):以 Diffusion Policy(diffusion-policy,Chi et al. 2023)为设计参照,具体实现为 18 层 DiT block + 线性投影到动作空间,总参数量 190M。策略头的视觉条件 E 取自视频扩散 UNet middle block 之前、仅第一步(最噪)去噪时的特征,对空间维取均值得到 T×C 的特征向量(而非多步去噪特征),以降低动作输出延迟;该特征在动作去噪的 K 步迭代中被缓存复用一次。动作表示为 7 维连续向量(delta 位置 x/y/z、旋转 roll/pitch/yaw、夹爪开合),以 8 步为一个 action chunk 做 DDPM 式去噪预测(训练用 sample-prediction 参数化)。
关键超参(Table 10):扩散步数 1000,线性噪声调度 β₀=0.00085、β_T=0.0120;DDIM 采样、步数 500(原文如此);视频分辨率 320×512,隐变量 z-shape 40×64×4;时间/空间注意力分辨率 {64,32,16}、head channels 64、卷积层数 4;学习率 5e-5,Adam 优化器,单视角 batch/GPU=8、多视角 batch/GPU=1,最大训练步数 100,000,梯度裁剪(范数)0.5。
数据
预训练混合 6 个公开/自建数据集(均只用视频帧、不含动作标注做视频生成预训练):
- RT-1:370 万帧,8.7 万条 episode,第一人称视角,真实机器人;
- Language Table:700 万帧,44.2 万条 episode,正面视角,真实机器人;
- BridgeV1:200 万帧,2.5 万条 episode,第一人称视角,真实机器人;
- RoboTurk:7.2 万帧,1900 条 episode,正面视角,真实机器人;
- ManiSkill:400 万帧,3 万条 episode,正面视角,仿真;
- 自建 Isaac Sim 数据集:300 万帧,4 万条 episode,第一人称+8 个第三人称视角,仿真(覆盖 8 类任务:垃圾入桶、水果入篮、玩具入盒、插笔、放包、开抽屉、摆水果、摆放工件,场景涵盖工业和家居布局,光照/相机位姿多样)。
六项加总约 1977 万帧、约 62.6 万条 episode(本文自行汇总,原文未直接给出总数)。构建自研 Isaac Sim 数据集的原因是:当时公开具身数据集普遍只提供单一第三人称或第一人称视角,不足以训练多视角生成;LIBERO 本身轨迹数不足 500 条,也不适合多视角训练。
策略微调阶段只需少量任务特定示范数据即可取得 SOTA:LIBERO 每个任务套件 10 个任务、每任务 50 条人类示范;真实世界实验用商用机械臂在 3 类任务(磁块摆放、透明塑料件分拣、水果分拣)上采集数据。为缓解跨数据集(实体/任务类型/视觉风格)的域冲突,每个子数据集分配独立的 domain embedding,与扩散 timestep embedding 融合后输入模型(做法借鉴 Wang et al. 2024a)。论文未披露 sim(ManiSkill + Isaac Sim)与 real 数据之间除 domain embedding 外的显式配比/加权方案。
训练方法
默认两阶段流程:先对 EnerVerse-G(多视角视频生成器)做预训练,再固定/微调用于策略头 EnerVerse-A 的动作模仿学习。训练策略消融(LIBERO-Spatial,成功率)验证了这一顺序的必要性:
- 完全从零训练(不加载任何预训练权重):不收敛(Failed);
- 加载 DynamiCrafter 通用视频预训练权重后训练:79.0;
- 同时优化策略动作损失与视频生成损失的一阶段联合训练:86.3;
- 默认的两阶段(先预训练视频生成器,再仅用策略损失微调):92.1(最优)。
其他关键设计:
- v-prediction 参数化的标准 DDPM 去噪 MSE 作为视频生成目标;
- 稀疏记忆机制(见”模型架构”)配合腐蚀噪声注入,兼顾长程一致性和 OOD 鲁棒性;
- EnerVerse-D 数据引擎:先用预训练好的 4D 生成器(EnerVerse-G)微调以接受稀疏多视角输入——对
m个视角里至少n≪m个有完整观测的机载相机视角跳过加噪、直接作为干净条件,对其余未观测目标视角走标准加噪-去噪流程;再用生成的多视角视频+对应相机位姿,通过官方 4DGS 实现(Wu et al. 2024,深度初始化、形变深度=1)重建 4D 场景,渲染回目标视角得到更高保真度的图像;这些渲染结果可再次加噪送回生成器、叠加下一轮 4DGS 优化,形成”生成↔重建”迭代闭环,并随真实多视角数据积累持续微调生成器——本质是一个不依赖精确标定真实多相机采集的离线数据飞轮。
Infra(训练 / 推理工程)
- 训练算力(以 LIBERO-Spatial 为例):单 S-RGB 设置下,视频生成适配阶段用 8× A100,约 20 小时;动作学习阶段额外约 12 小时(合计约 32 小时,基础多视角生成器本身的预训练算力未披露)。
- 推理显存:视频生成——单视角约 12GB,三视角约 13.5GB;动作推理——单 S-RGB 约 10.6GB,三视角约 12GB。
- 推理延迟:单个视频 chunk 生成约 20 秒/视角(硬件未注明,推测与训练同为 A100);动作 chunk(默认 chunk size=8)推理约 300 毫秒/chunk(附录 F)——摘要部分另给出”约 280 毫秒/8 步 action chunk,单张 RTX 4090”的数字,与附录 F 的 300ms 不完全一致(可能对应不同硬件测量),此处两个数字都如实记录、不强行取舍。
- 精度/并行策略:未披露。
评测 benchmark
具身未来空间生成质量(RT-1 数据集,200 条自建评测视频,对比微调过 RT-1 的 DynamiCrafter+FreeNoise 长视频生成基线 DC-FN):
| 方法 | PSNR↑ | FVD↓ | Quality↑ | Semantic↑ | Consistency↑ | Continuity↑ | 长任务能力 |
|---|---|---|---|---|---|---|---|
| DC-FN | 25.42 | 445.94 | 54 | 97 | 92 | 80 | ✗ |
| EnerVerse | 26.1 | 404.65 | 59 | 97 | 89 | 90 | ✓ |
LIBERO(4 个任务套件,各 10 任务×50 示范,50 rollout×3 随机种子):
| 方法 | 视觉输入 | Spatial | Object | Goal | Long | Avg. |
|---|---|---|---|---|---|---|
| Diffusion Policy | S-RGB | 78.3 | 92.5 | 68.3 | 50.5 | 72.4 |
| Octo | S-RGB | 78.9 | 85.7 | 84.6 | 51.1 | 75.1 |
| OpenVLA (7B) | S-RGB | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 |
| MDT | S-RGB+G-RGB | 78.5 | 87.5 | 73.5 | 64.8 | 76.1 |
| S-RGB+G-RGB | 74.3 | 90.1 | 81.8 | 78.6 | 81.2 | |
| S-RGB×2 | 76.0 | 90.0 | 82.0 | 78.0 | 81.5 | |
| EnerVerse-A | S-RGB | 92.1 | 93.2 | 78.1 | 73.0 | 84.1 |
| EnerVerse-A | RGB+1 Render | 93.0 | 95.0 | 81.0 | 73.0 | 85.5 |
| EnerVerse-A | RGB+2 Render | 91.2 | 97.7 | 85.0 | 80.0 | 88.5 |
CALVIN ABC→D(成功链式子任务数,Avg.Len 为平均连续完成子任务长度;EnerVerse 未按协议在新任务开始时重置记忆,对自身是更严苛的设置):
| 方法 | 输入 | 1 | 2 | 3 | 4 | 5 | Avg.Len |
|---|---|---|---|---|---|---|---|
| RoboFlamingo | S/G-RGB | 82.4 | 61.9 | 46.6 | 33.1 | 23.5 | 2.47 |
| GR-1 | S/G-RGB, P | 85.4 | 71.2 | 59.6 | 49.7 | 40.1 | 3.06 |
| 3D Diffuser Actor | S/G-RGBD, P | 92.2 | 78.7 | 63.9 | 51.2 | 41.2 | 3.27 |
| SUSIE | S-RGB | 87.0 | 69.0 | 49.0 | 38.0 | 26.0 | 2.69 |
| EnerVerse-A | S-RGB | 90.8 | 73.0 | 57.3 | 43.7 | 35.6 | 3.00 |
消融:稀疏记忆(LIBERO-Long-SV)——无 30.8 vs 有 73.0;3D 视频 vs 4D 空间(LIBERO-Spatial)——DynamiCrafter+DP(无多视角预训练,S-RGB)79.0 vs EnerVerse-A(多视角预训练,S-RGB)92.1、(S-RGB+1 Render)93.0;视频生成任务适配的作用(LIBERO-Object)——完整 EnerVerse 93.2 vs 跳过 LIBERO 视频生成适配直接微调动作 85.0;train-all/test-all 混合训练平均分 87.63 vs 单任务套件训练 84.1。
OOD 纹理泛化(LIBERO-Object,未见场景/容器纹理,Δ为相对 Seen 的下降幅度):
| 方法 | Seen | 未见场景纹理 | Δ | 未见容器纹理 | Δ |
|---|---|---|---|---|---|
| OpenVLA (S-RGB) | 88.4 | 64.9 | 23.5 | 82.0 | 6.4 |
| EnerVerse-A (S-RGB) | 93.2 | 93.1 | 0.1 | 93.0 | 0.2 |
| EnerVerse-A (RGB+2 Render) | 97.7 | 96.4 | 1.3 | 97.5 | 0.2 |
真实世界磁块摆放任务(9 个目标格位×5 次执行取均值,Success=Grasp×Place×Instruction-Following):EnerVerse-A 均值 Grasp 1.0 / Place 0.89 / Instruction-Following 0.78 / Success 0.67;OpenVLA 均值 Grasp 0.89 / Place 0.61 / Instruction-Following 0.96 / Success 0.61——EnerVerse-A 在抓取/放置/总体成功率上占优,但指令跟随弱于 OpenVLA(论文归因于 OpenVLA 的 LLM 语言分支 vs EnerVerse 更弱的文本编码器);在靠近机械臂动作空间边界的两个格位 (3,2)/(3,3) 上指令跟随成功率为 0。
创新点与影响
- 核心贡献:(1) chunk-wise 自回归视频扩散 + 稀疏上下文记忆,使生成理论上可以无限长且带显式 EOS 检测,解决了连续记忆下的模型坍塌问题;(2) Free Anchor View——不依赖物理相机安装、锚定在机器人基座坐标系的虚拟多视角表示,用深度扭曲+渲染从单目观测构造,缓解遮挡/运动建模歧义/狭窄空间物理约束这三类同时困扰单视角和固定多相机方案的问题;消融证明多视角预训练本身就能给单相机部署带来 3D 先验增益(DynamiCrafter+DP 79.0 → EnerVerse-A 同样单视角输入 92.1);(3) EnerVerse-D 数据引擎——生成模型与 4DGS 互相闭环的离线数据飞轮,不依赖精确标定的真实多相机采集来缩小 Sim2Real 差距;(4) EnerVerse-A 策略头复用最噪去噪步的视觉特征、以 8 步为单位做 action chunk 预测,在单张 RTX 4090 上做到约 280 毫秒/chunk 的推理延迟,兼顾实时控制需求。
- 它改变了什么:把”视频生成模型能否直接套用做机器人世界模型”这一问题往前推了一步——论文明确论证视频生成不等于具身未来空间生成,机器人任务需要因果任务逻辑、精确执行结果和跨步记忆,仅靠通用 I2V 微调(如 AVID 类适配器路线)并不充分;转而把多视角、3D 一致性和数据飞轮做成了同一个框架里的一等公民。同一团队后续把这条”4D 具身基础模型”思路进一步平台化,扩展为 genie-envisioner。
- 论文自陈局限:(1) 预训练模型直接在域差异较大的数据(如 LIBERO)上做动作微调、不先做视频生成任务适配,会显著掉点(LIBERO-Object 93.2→85.0);(2) 在机械臂动作空间边界附近的目标位置(真实世界任务的 (3,2)/(3,3) 格位)失败,作者归因于这些位置难以到达;(3) 真实世界任务上指令跟随能力弱于用 LLM 做语言分支的 OpenVLA,作者归因于自身文本编码器(CLIP/T5,原文两处表述不一致)能力有限;(4) CALVIN 评测协议要求任务切换时不重置记忆,这对依赖记忆的 EnerVerse 而言比无记忆基线更苛刻;(5) 在形变物体/复杂运动学任务(如叠布)上生成视频存在穿模、跳变等伪影,作者认为这些伪影对下游控制影响有限,因为生成视频只作为 4D 先验、后续会被策略微调进一步修正。
原始链接
- 论文(arXiv abs,含 v1/v2/v3 修订历史,正文分析以 v3 修订版为准):https://arxiv.org/abs/2501.01895
- 论文 PDF:https://arxiv.org/pdf/2501.01895
- 项目主页:https://sites.google.com/view/enerverse
- 关联数据生态 AgiBot World:https://agibot-world.com
一手源存档(sources/)
- enerverse—project-page — 项目主页快照(
sources/world-model/2025/enerverse--project-page.md) - arXiv 全文(2501.01895,arXiv 原文 PDF,不入 git):见上方 arXiv 链接