一句话定位

EnerVerse(AgiBot/智元机器人 + 上海人工智能实验室等,2025-01)把机器人操作的”未来空间生成”和”视频生成”明确区分开——用一个 chunk-wise 自回归多视角视频扩散模型 + 稀疏记忆机制生成理论上无限长的具身未来空间,配合不依赖物理相机、锚定在机器人基座坐标系下的 Free Anchor View(FAV)虚拟视角解决遮挡和运动歧义,再用生成模型与 4D Gaussian Splatting(4DGS)互相闭环的”数据飞轮”缓解 Sim2Real 数据稀缺,最终接一个朴素策略头(EnerVerse-A)在 LIBERO、CALVIN 与真实机械臂任务上取得当时的 SOTA。

背景与定位

论文开篇明确一个立场:“视频生成不等于具身未来空间生成”——机器人任务需要因果任务逻辑(何时开始/结束)、精确的执行结果,以及跨步骤的上下文记忆能力,而通用视频生成模型只建模 2D 投影序列,缺乏这些属性。这是对同期”把视频扩散模型直接套用到机器人”路线的一次反思,论文点名 avid(把预训练视频扩散模型通过轻量 adapter 改造为动作条件世界模型,同样在 RT-1 上微调 DynamiCrafter 做对比基线)为”简单套用通用视频生成模型、忽视机器人任务特有需求”的代表。

EnerVerse 站在两条脉络的交叉点:

  • 视频生成→策略规划:VidMan、AVID、GR-2(bytedance-gr-2,在互联网视频上预训练再微调视频生成+动作预测)等工作已经在探索用无动作标注的大规模视频数据训练策略先验;
  • 多视角/3D 世界建模:论文认为单视角视频生成难以处理遮挡和度量歧义,因此把 2D 视频生成扩展为以相机几何为条件的多视角生成,并引入 4DGS 做几何一致性约束。

与直接在物理机器人/工作空间上加装多相机的方案(openvlaocto、Diffusion Policy diffusion-policy 等常用固定视角设置)不同,EnerVerse 提出的 Free Anchor View 不受物理相机安装位置约束——可以在狭窄空间(如厨房)里”悬空”存在,用深度扭曲(depth warping)+ 点云渲染从单目观测生成。预训练数据沿用 RT-1(rt-1)等公开数据集,策略基线对比涵盖 Diffusion Policy、Octo、OpenVLA、MDT、MAIL。EnerVerse 之后,同一团队把这条”4D 具身基础模型”路线进一步扩展为统一平台 genie-envisioner

模型架构

Backbone:基于 UNet 的隐空间视频扩散模型 DynamiCrafter(1.4B 参数,冻结 VAE 83.7M),论文声明架构上也兼容 DiT,但实验主体仍用 UNet。整个生成过程被扩展到 4D 隐空间 B×C×V×T×H×W(batch、channel、视角数、时间步、空间分辨率),通过 reshape 在三种模式间切换:(BT)(VHW)C 做空间注意力、(BVHW)TC 做时间注意力、(BVT)CHW 做解码前处理;图像解码按 view、按帧独立进行。

Chunk-wise 自回归生成:观测隐变量序列 o_t^{1:K}(VAE 编码)与预测隐变量序列 z_t^{1:M} 拼接,训练干净帧+噪声帧联合预测去噪目标,采用 v-prediction 参数化;推理时用滑动窗口——已去噪的帧滚动成为下一轮的干净上下文,直到检测到预定义的 End-of-Sequence(EOS)帧(用生成帧与 EOS 帧隐变量的 L1 距离设阈值判断),理论上支持无限长序列生成。Chunk size 在 {1,4,8,16} 间做过对比,8 时鲁棒性最优(默认配置)。

稀疏记忆(Sparse Memory / Context Frame)机制:训练时不用连续帧做上下文,而是随机稀疏采样约 20% 的历史帧作为干净上下文(即丢弃约 80% 冗余帧),并对记忆帧注入按时间距离余弦调度的”腐蚀噪声”(沿用 Genie genie-generative-interactive-environments 的做法)。消融显示该设计避免了连续记忆下的”意外坍塌”(模型在 OOD 场景下无法恢复),同时节省计算。

FAV / 多视角生成(EnerVerse-G):文本条件 c 用途上论文正文(2.1 节)写”由一个冻结的 T5 编码器编码后接 MLP 投影”,但附录 A 讨论真实世界实验时又提到”our CLIP text encoder”——原文两处表述不一致,此处照录、不替读者调和。相机条件通过逐像素的 ray-direction map(编码内外参)沿通道维与图像隐变量拼接(隐空间通道数:图像隐变量 4 + ray map 6),再用沿 view 维展开的”跨视角空间注意力”和沿时间维的”时间注意力”分别建模跨视角几何一致性与场景动态。FAV 本身不依赖物理相机,而是相对机器人基座坐标系定义,通过初始点云重建(深度扭曲)+ 渲染获得——正文示例中渲染视角对应绕 Z 轴 ±30° 旋转 RGB 相机视角得到的两个 Render View。

策略头(EnerVerse-A):以 Diffusion Policy(diffusion-policy,Chi et al. 2023)为设计参照,具体实现为 18 层 DiT block + 线性投影到动作空间,总参数量 190M。策略头的视觉条件 E 取自视频扩散 UNet middle block 之前、仅第一步(最噪)去噪时的特征,对空间维取均值得到 T×C 的特征向量(而非多步去噪特征),以降低动作输出延迟;该特征在动作去噪的 K 步迭代中被缓存复用一次。动作表示为 7 维连续向量(delta 位置 x/y/z、旋转 roll/pitch/yaw、夹爪开合),以 8 步为一个 action chunk 做 DDPM 式去噪预测(训练用 sample-prediction 参数化)。

关键超参(Table 10):扩散步数 1000,线性噪声调度 β₀=0.00085、β_T=0.0120;DDIM 采样、步数 500(原文如此);视频分辨率 320×512,隐变量 z-shape 40×64×4;时间/空间注意力分辨率 {64,32,16}、head channels 64、卷积层数 4;学习率 5e-5,Adam 优化器,单视角 batch/GPU=8、多视角 batch/GPU=1,最大训练步数 100,000,梯度裁剪(范数)0.5。

数据

预训练混合 6 个公开/自建数据集(均只用视频帧、不含动作标注做视频生成预训练):

  • RT-1:370 万帧,8.7 万条 episode,第一人称视角,真实机器人;
  • Language Table:700 万帧,44.2 万条 episode,正面视角,真实机器人;
  • BridgeV1:200 万帧,2.5 万条 episode,第一人称视角,真实机器人;
  • RoboTurk:7.2 万帧,1900 条 episode,正面视角,真实机器人;
  • ManiSkill:400 万帧,3 万条 episode,正面视角,仿真;
  • 自建 Isaac Sim 数据集:300 万帧,4 万条 episode,第一人称+8 个第三人称视角,仿真(覆盖 8 类任务:垃圾入桶、水果入篮、玩具入盒、插笔、放包、开抽屉、摆水果、摆放工件,场景涵盖工业和家居布局,光照/相机位姿多样)。

六项加总约 1977 万帧、约 62.6 万条 episode(本文自行汇总,原文未直接给出总数)。构建自研 Isaac Sim 数据集的原因是:当时公开具身数据集普遍只提供单一第三人称或第一人称视角,不足以训练多视角生成;LIBERO 本身轨迹数不足 500 条,也不适合多视角训练。

策略微调阶段只需少量任务特定示范数据即可取得 SOTA:LIBERO 每个任务套件 10 个任务、每任务 50 条人类示范;真实世界实验用商用机械臂在 3 类任务(磁块摆放、透明塑料件分拣、水果分拣)上采集数据。为缓解跨数据集(实体/任务类型/视觉风格)的域冲突,每个子数据集分配独立的 domain embedding,与扩散 timestep embedding 融合后输入模型(做法借鉴 Wang et al. 2024a)。论文未披露 sim(ManiSkill + Isaac Sim)与 real 数据之间除 domain embedding 外的显式配比/加权方案。

训练方法

默认两阶段流程:先对 EnerVerse-G(多视角视频生成器)做预训练,再固定/微调用于策略头 EnerVerse-A 的动作模仿学习。训练策略消融(LIBERO-Spatial,成功率)验证了这一顺序的必要性:

  • 完全从零训练(不加载任何预训练权重):不收敛(Failed);
  • 加载 DynamiCrafter 通用视频预训练权重后训练:79.0;
  • 同时优化策略动作损失与视频生成损失的一阶段联合训练:86.3;
  • 默认的两阶段(先预训练视频生成器,再仅用策略损失微调):92.1(最优)。

其他关键设计:

  • v-prediction 参数化的标准 DDPM 去噪 MSE 作为视频生成目标;
  • 稀疏记忆机制(见”模型架构”)配合腐蚀噪声注入,兼顾长程一致性和 OOD 鲁棒性;
  • EnerVerse-D 数据引擎:先用预训练好的 4D 生成器(EnerVerse-G)微调以接受稀疏多视角输入——对 m 个视角里至少 n≪m 个有完整观测的机载相机视角跳过加噪、直接作为干净条件,对其余未观测目标视角走标准加噪-去噪流程;再用生成的多视角视频+对应相机位姿,通过官方 4DGS 实现(Wu et al. 2024,深度初始化、形变深度=1)重建 4D 场景,渲染回目标视角得到更高保真度的图像;这些渲染结果可再次加噪送回生成器、叠加下一轮 4DGS 优化,形成”生成↔重建”迭代闭环,并随真实多视角数据积累持续微调生成器——本质是一个不依赖精确标定真实多相机采集的离线数据飞轮。

Infra(训练 / 推理工程)

  • 训练算力(以 LIBERO-Spatial 为例):单 S-RGB 设置下,视频生成适配阶段用 8× A100,约 20 小时;动作学习阶段额外约 12 小时(合计约 32 小时,基础多视角生成器本身的预训练算力未披露)。
  • 推理显存:视频生成——单视角约 12GB,三视角约 13.5GB;动作推理——单 S-RGB 约 10.6GB,三视角约 12GB。
  • 推理延迟:单个视频 chunk 生成约 20 秒/视角(硬件未注明,推测与训练同为 A100);动作 chunk(默认 chunk size=8)推理约 300 毫秒/chunk(附录 F)——摘要部分另给出”约 280 毫秒/8 步 action chunk,单张 RTX 4090”的数字,与附录 F 的 300ms 不完全一致(可能对应不同硬件测量),此处两个数字都如实记录、不强行取舍。
  • 精度/并行策略:未披露。

评测 benchmark

具身未来空间生成质量(RT-1 数据集,200 条自建评测视频,对比微调过 RT-1 的 DynamiCrafter+FreeNoise 长视频生成基线 DC-FN):

方法PSNR↑FVD↓Quality↑Semantic↑Consistency↑Continuity↑长任务能力
DC-FN25.42445.9454979280
EnerVerse26.1404.6559978990

LIBERO(4 个任务套件,各 10 任务×50 示范,50 rollout×3 随机种子):

方法视觉输入SpatialObjectGoalLongAvg.
Diffusion PolicyS-RGB78.392.568.350.572.4
OctoS-RGB78.985.784.651.175.1
OpenVLA (7B)S-RGB84.788.479.253.776.5
MDTS-RGB+G-RGB78.587.573.564.876.1
MAILS-RGB+G-RGB74.390.181.878.681.2
MAILS-RGB×276.090.082.078.081.5
EnerVerse-AS-RGB92.193.278.173.084.1
EnerVerse-ARGB+1 Render93.095.081.073.085.5
EnerVerse-ARGB+2 Render91.297.785.080.088.5

CALVIN ABC→D(成功链式子任务数,Avg.Len 为平均连续完成子任务长度;EnerVerse 未按协议在新任务开始时重置记忆,对自身是更严苛的设置):

方法输入12345Avg.Len
RoboFlamingoS/G-RGB82.461.946.633.123.52.47
GR-1S/G-RGB, P85.471.259.649.740.13.06
3D Diffuser ActorS/G-RGBD, P92.278.763.951.241.23.27
SUSIES-RGB87.069.049.038.026.02.69
EnerVerse-AS-RGB90.873.057.343.735.63.00

消融:稀疏记忆(LIBERO-Long-SV)——无 30.8 vs 有 73.0;3D 视频 vs 4D 空间(LIBERO-Spatial)——DynamiCrafter+DP(无多视角预训练,S-RGB)79.0 vs EnerVerse-A(多视角预训练,S-RGB)92.1、(S-RGB+1 Render)93.0;视频生成任务适配的作用(LIBERO-Object)——完整 EnerVerse 93.2 vs 跳过 LIBERO 视频生成适配直接微调动作 85.0;train-all/test-all 混合训练平均分 87.63 vs 单任务套件训练 84.1。

OOD 纹理泛化(LIBERO-Object,未见场景/容器纹理,Δ为相对 Seen 的下降幅度):

方法Seen未见场景纹理Δ未见容器纹理Δ
OpenVLA (S-RGB)88.464.923.582.06.4
EnerVerse-A (S-RGB)93.293.10.193.00.2
EnerVerse-A (RGB+2 Render)97.796.41.397.50.2

真实世界磁块摆放任务(9 个目标格位×5 次执行取均值,Success=Grasp×Place×Instruction-Following):EnerVerse-A 均值 Grasp 1.0 / Place 0.89 / Instruction-Following 0.78 / Success 0.67;OpenVLA 均值 Grasp 0.89 / Place 0.61 / Instruction-Following 0.96 / Success 0.61——EnerVerse-A 在抓取/放置/总体成功率上占优,但指令跟随弱于 OpenVLA(论文归因于 OpenVLA 的 LLM 语言分支 vs EnerVerse 更弱的文本编码器);在靠近机械臂动作空间边界的两个格位 (3,2)/(3,3) 上指令跟随成功率为 0。

创新点与影响

  • 核心贡献:(1) chunk-wise 自回归视频扩散 + 稀疏上下文记忆,使生成理论上可以无限长且带显式 EOS 检测,解决了连续记忆下的模型坍塌问题;(2) Free Anchor View——不依赖物理相机安装、锚定在机器人基座坐标系的虚拟多视角表示,用深度扭曲+渲染从单目观测构造,缓解遮挡/运动建模歧义/狭窄空间物理约束这三类同时困扰单视角和固定多相机方案的问题;消融证明多视角预训练本身就能给单相机部署带来 3D 先验增益(DynamiCrafter+DP 79.0 → EnerVerse-A 同样单视角输入 92.1);(3) EnerVerse-D 数据引擎——生成模型与 4DGS 互相闭环的离线数据飞轮,不依赖精确标定的真实多相机采集来缩小 Sim2Real 差距;(4) EnerVerse-A 策略头复用最噪去噪步的视觉特征、以 8 步为单位做 action chunk 预测,在单张 RTX 4090 上做到约 280 毫秒/chunk 的推理延迟,兼顾实时控制需求。
  • 它改变了什么:把”视频生成模型能否直接套用做机器人世界模型”这一问题往前推了一步——论文明确论证视频生成不等于具身未来空间生成,机器人任务需要因果任务逻辑、精确执行结果和跨步记忆,仅靠通用 I2V 微调(如 AVID 类适配器路线)并不充分;转而把多视角、3D 一致性和数据飞轮做成了同一个框架里的一等公民。同一团队后续把这条”4D 具身基础模型”思路进一步平台化,扩展为 genie-envisioner
  • 论文自陈局限:(1) 预训练模型直接在域差异较大的数据(如 LIBERO)上做动作微调、不先做视频生成任务适配,会显著掉点(LIBERO-Object 93.2→85.0);(2) 在机械臂动作空间边界附近的目标位置(真实世界任务的 (3,2)/(3,3) 格位)失败,作者归因于这些位置难以到达;(3) 真实世界任务上指令跟随能力弱于用 LLM 做语言分支的 OpenVLA,作者归因于自身文本编码器(CLIP/T5,原文两处表述不一致)能力有限;(4) CALVIN 评测协议要求任务切换时不重置记忆,这对依赖记忆的 EnerVerse 而言比无记忆基线更苛刻;(5) 在形变物体/复杂运动学任务(如叠布)上生成视频存在穿模、跳变等伪影,作者认为这些伪影对下游控制影响有限,因为生成视频只作为 4D 先验、后续会被策略微调进一步修正。

原始链接

一手源存档(sources/)

  • enerverse—project-page — 项目主页快照(sources/world-model/2025/enerverse--project-page.md
  • arXiv 全文(2501.01895,arXiv 原文 PDF,不入 git):见上方 arXiv 链接