一句话定位

UMass Amherst / HKUST / Harvard 团队提出的 TesserAct:把传统 2D 视频世界模型扩展成预测 RGB-Depth-Normal(RGB-DN) 三通道视频的 4D 具身世界模型,再用一套显式的深度-法线联合优化算法把生成的 RGB-DN 视频转换成时空一致的 4D 点云场景,用于机器人动作规划;论文已被 ICCV 2025 接收。

背景与定位

论文开篇的批评指向所有基于 2D 像素空间的视频世界模型(如 CogVideoX、OpenSora 等文生/图生视频扩散模型,以及 OpenAI “video generation models as world simulators” 的提法):物理世界本质是三维的,但 2D 世界模型缺乏深度和 6-DoF 位姿信息,导致跨帧的物体尺寸/形状不一致,难以支撑需要精确几何的机器人抓取等任务。

论文把自己定位在两条相关工作线之间:一条是把 3D 输入/输出接入基础模型的具身智能体路线(3D-LLM、3D-VLA 等,用文本描述动作或直接输出 3D 目标状态);另一条是把视频模型当世界模型用的路线(如 UniPi,先生成未来视频再用 2D 逆动力学模型推动作)。TesserAct 与 3D-VLA 最接近但有本质区别——3D-VLA 只预测单帧 3D 目标状态,而 TesserAct 建模的是整段 4D 场景的演化;与同期的 Aether(几何感知的统一世界模型,纯合成数据训练、相机位姿轨迹做动作表示)相比,TesserAct 选择用真实机器人操作视频(RT-1 Fractal、Bridge)+ 人手交互视频(Something-Something V2)+ RLBench 仿真数据混合训练,动作以自然语言指令 + 机械臂名称文本条件给出,目标场景是具身操作规划而非通用相机轨迹重建。

模型架构

  • 表示选择:不用 NeRF / 3D Gaussian Splatting 等显式 4D 表示(训练慢、SDS loss 难收敛),而是用RGB + Depth + Normal 三通道视频作为 4D 场景的轻量代理表示——比显式点云/体素便宜得多,且与现有视频扩散模型架构高度兼容,可以直接复用视频生成模型的生成能力。
  • Backbone:基于 CogVideoX-5B(图生视频版) 微调而来的 DiT 扩散模型;RGB、Depth、Normal 三种模态分别用 CogVideoX 自带的 3D VAE 编码(VAE 本身不再微调)。
  • 输入设计:为 RGB(v)、Depth(d)、Normal(n) 三种模态各设一个独立的 InputProj 投影器提取 embedding,f_z = InputProj(z_t, z⁰)(z ∈ {v,d,n}),DiT 取三者embedding之和 h = DiT(Σf_z, t, 𝒯) 作为隐状态;文本条件 𝒯 = [动作指令] + [机械臂名称](如 “pick up apple google robot”),用于区分不同机器人本体。
  • 输出设计:RGB 分支复用 CogVideoX 原有的 OutputProj 直接输出去噪结果 ε_v;Depth/Normal 分支新增专用模块——一个 3 层 Conv3D(Conv3DNet)编码「输入 latent + 预测出的 RGB 去噪结果」的拼接,再与 DiT 隐状态结合送入 2 层、维度 1024 的 MLP(DNProj)得到 ε_{d,n}。为保留预训练知识,新增模块全部零初始化,保证训练起点的 RGB 输出与原始 CogVideoX 完全一致。
  • 动作条件粒度:仅用自然语言文本条件(指令+机械臂名),不引入连续动作 token、离散动作 token 或独立的动作扩散头——动作以「未来状态如何变化」的隐式方式体现在生成视频里,真正离散的机器人控制信号在下游由独立的逆动力学模型(PointNet + MLP)从生成的 4D 场景反推得到。
  • 4D 场景重建算法(后处理,非端到端可微):对每帧先用法线积分(式 3,基于透视相机模型 + 曲面平滑假设,迭代最小二乘求解 log-depth)做空间一致性优化(损失 L_s);再用 RAFT 光流区分动态区域 M_d(光流幅度超阈值 c)与背景区域 M_b(相邻帧均静止的交集),对动态/背景像素分别与前一帧对齐深度做时间一致性约束(损失 L_c);再加一个正则项 L_r 防止优化结果偏离原始生成深度太远;三项损失联合优化(式 7),从第一帧的生成深度开始逐帧迭代精化,最终得到时空一致的 4D 点云。RLBench 上的 λ 权重(λ_d=20, λ_b=200, λ_g1/g2=2;RT-1/Bridge 上 λ_g1/g2=20)因数据域不同而需要分别调参。
  • 动作规划头:4D 点云 → PointNet 提取几何特征 → 与指令文本 embedding 拼接 → 4 层 MLP → 输出 7-DoF 机械臂动作,即 a_i = ID(s_i, s_{i+1}, 𝒯)(逆动力学模型,输入当前状态、预测的下一状态、指令)。

数据

  • 4D 具身视频数据集(自建),覆盖合成 + 真实两类来源:
    • RLBench 合成数据:从 RLBench 选取 20 个较高难度任务,每任务 4 个视角各采 1000 组,共 80k 合成 4D 视频;仿真器自带 metric depth 真值,法线用 DSINE 的 depth2normal 函数估计;并采用 Colosseum 数据生成管线的场景随机化(背景/桌面纹理/光照)增强多样性。
    • 真实数据:从 OpenX 中选取 RT-1 Fractal 数据(80k 视频,Google Robot)与 Bridge 数据集(25k 视频,WidowX 机械臂),深度用 RollingDepth 估计(affine-invariant),法线用 Temporal-Consistent Marigold-LCM-normal 估计;额外引入人手交互数据集 Something-Something V2(100k 视频)增加指令多样性。
    • 四个来源合计 285k 视频(按 Table 1 逐项相加);正文另有一处表述为”即便自动标注,我们的 RGB-DN 数据集也仅有约 200k 数据点”,与 Table 1 汇总数不完全一致,论文未做进一步说明,如实并陈两个数字。
  • 动作规划专用子集:从 RLBench 中选取 9 个高难度任务(如 close box、open drawer、open jar、open microwave、put knife、sweep to dustpan 等),每任务采集 500 个样本训练逆动力学模型;动作数据增强对图像/点云坐标施加 20% 相对幅度的高斯噪声。
  • 规模对比:论文明确指出,常规 RGB 视频基础模型训练需要数十亿级样本(如 CogVideoX 原始训练集),而 TesserAct 的标注数据集仅有 ~20-30 万量级,不足以从零训练,因此选择在 CogVideoX 预训练权重上微调而非从头训练。

训练方法

  • 训练目标:标准 ε-预测扩散损失(式 4)L = E[‖[ε_v, ε_d, ε_n] − ε_θ(x_t, t, x⁰, 𝒯)‖²],在 RGB、Depth、Normal 三个模态的噪声上联合优化。
  • 视频扩散主干超参:输出 49 帧视频,用梯度检查点(gradient checkpointing)节省显存;全局 batch size 16,bf16 精度;采样用 DDPM 调度器、50 步;无分类器引导(CFG)系数 7.5
  • 优化器/调度:训练 40,000 迭代,初始学习率 1×10⁻⁴,梯度裁剪 1.0,1,000 步线性 warmup;Adam 优化器(ε=1×10⁻¹⁵);EMA 衰减 0.99
  • 动作规划阶段的微调:沿用同一套 RGB-DN 视频扩散架构,但改为预测 13 帧关键帧、分辨率固定 512×512,在 RLBench 上后训练(post-train),让模型只需生成任务相关的关键帧而非完整长视频;推理时先一次性预测未来所有关键帧,后续动作只需反复查询逆动力学模型。
  • 对比方法的复现方式:论文将 UniPi baseline 的 backbone 替换为微调过的 CogVideoX 以保证公平对比(记为 UniPi*)。
  • 训练/推理代码栈:官方开源训练脚本基于 Finetrainers 框架,支持多 GPU / 多机分布式训练(train_i2v_depth_normal_sft.sh);另提供基于 LoRA 的低成本微调脚本(train_i2v_depth_normal_lora.sh),约 100 个视频~30GB 显存约 2 天即可完成自定义数据微调,RGB-only LoRA 版本训练 12,000 步(GitHub/usage.md 披露,非论文正文)。

Infra(训练 / 推理工程)

  • 训练硬件/GPU 数/GPU 小时:论文正文未披露具体 GPU 型号、数量或总训练小时数,仅说明”训练代码支持多 GPU 或多机分布式训练”(GitHub README);全量 SFT 训练 40,000 迭代、batch size 16、bf16 精度(见”训练方法”),但换算成 GPU 小时所需的单卡吞吐/卡数未公开。
  • 精度bf16(论文正文明确披露)。
  • LoRA 微调资源(GitHub 披露,非正文):约 30GB GPU 显存,~100 个自定义视频训练约 2 天
  • 推理显存(usage.md 披露):两个已发布模型(tesseract_v01e_rgbdn_sft 全量 SFT、tesseract_v01e_rgb_lora RGB-only LoRA)推理显存均为 25–29GB;--memory_efficient 选项可进一步降低。
  • 推理分辨率:野外图片输入自动 resize 到 640×480(usage.md);RLBench 规划任务训练/推理固定 512×51213 帧(论文正文)。
  • 推理 FPS / 延迟 / 边缘设备:论文未披露具体生成侧 FPS 或延迟数字;仅在新视角合成任务(Table 4)对比中给出端到端耗时——TesserAct 约 1 分钟完成一次新视角合成 vs. baseline Shape of Motion(SoM)约 2 小时(两者均为离线后处理耗时,非严格意义的实时推理 FPS)。

评测 benchmark

4D 场景预测质量(Table 2,真实域:RT-1 Fractal + Bridge 400 个未见样本;合成域:RLBench 200 个未见样本;每样本生成 10 次取平均;指标含 RGB 的 FVD↓/SSIM↑/PSNR↑,深度的 AbsRel↓/δ₁↑/δ₂↑,法线的 Mean↓/Median↓/11.25°↑,点云的 Chamfer L1↓):

方法FVD↓SSIM↑PSNR↑AbsRel↓δ₁↑δ₂↑法线Mean↓法线Median↓11.25°↑Chamfer↓
真实OpenSora23.6771.3119.2531.4160.3979.9741.8232.1513.580.3013
真实CogVideoX20.6479.3822.3926.1764.8281.6219.5310.0922.700.2191
真实TesserAct21.5975.8620.2722.0766.8082.6015.747.3227.800.2030
真实4D Point-E0.2211
合成OpenSora54.1165.9019.2818.4065.0291.2012.947.5825.020.2570
合成CogVideoX41.2376.6020.8719.8160.0780.1620.3610.4726.040.2884
合成TesserAct40.0177.5919.7316.0269.2693.0314.756.3436.850.0811
合成4D Point-E0.1086

TesserAct 在两个域上 Chamfer L1(4D 点云重建精度的核心指标)均最优,深度/法线指标全面领先;RGB 视觉指标(SSIM/PSNR)上不总是最优(真实域 SSIM/PSNR 略逊于 CogVideoX),论文将此解释为额外的深度/法线预测目标会与纯 RGB 生成质量之间存在轻微权衡。4D Point-E(作者自行实现的 4D 点云扩散 baseline,T=4 帧、n=8192 点)Chamfer 距离逊于 TesserAct,且因直接对点云训练,计算开销大、可用帧数受限。

具身动作规划成功率(Table 3,RLBench 9 个任务,100 episode 均值,%):

方法close boxopen draweropen jaropen microwaveput knifesweep to dustpanlid offweighing offwater plants
Image-BC534050012210
UniPi*(CogVideoX backbone)816738726649706835
TesserAct(“4DWM”在表中记法)888044707056736241

9 个任务中 TesserAct 在 7 个上超过或持平 UniPi*,尤其在 close box、open drawer、open jar、sweep to dustpan、water plants 上优势明显;在 open microwave 与 weighing off(称重) 两项上略逊于 UniPi*,论文将此归因于这些任务 2D 前视图信息本身已经足够,4D 几何信息带来的增益有限。

单目新视角合成(Table 4,RLBench 前视相机输入,对比俯视/左肩相机视角,vs. Shape of Motion 高斯泼溅方法):PSNR/SSIM/LPIPS/CLIP Score/CLIP Aesthetic/耗时——SoM: 10.94 / 24.02 / 73.82 / 66.67 / 3.61 / ~2 小时;TesserAct: 12.99 / 42.62 / 60.51 / 83.02 / 3.73 / ~1 分钟。六项指标全面优于 SoM,且耗时仅为其约 1/120。

创新点与影响

  • 首次把 RGB-Depth-Normal 三模态联合预测作为 4D 世界模型的表示,用比显式 4D 表示(NeRF/3D-GS/4D 点云扩散)轻量得多的方式获得可直接转换为高质量 4D 场景的中间表征,同时能直接复用预训练视频扩散模型(CogVideoX)的生成先验。
  • 提出法线积分 + 光流一致性联合优化的 4D 重建算法(式 3、5、6、7),用两项新损失(时间一致性 L_c、正则化 L_r)解决”逐帧深度优化”缺乏跨帧时序一致性的问题,消融实验(Fig. 3)验证了两项损失分别提升了运动连贯性与几何精度。
  • 是首个从”当前帧 + 文本动作指令”直接预测 4D 场景演化的方法(相比之前工作只预测单帧 3D 目标状态,或纯合成数据训练、无语言接地)。
  • 下游动作规划验证了 4D 信息的实用价值:在多数 RLBench 任务上,4D 点云驱动的逆动力学模型显著优于基于 2D 视频 + 2D 逆动力学的 UniPi* 与纯图像行为克隆 Image-BC。
  • 官方开源(ICCV 2025 接收):发布了训练代码、数据生成脚本、两版模型权重(全量 SFT 版 tesseract_v01e_rgbdn_sft 与 RGB-only LoRA 版 tesseract_v01e_rgb_lora),并持续更新(如 2025-06 追加 LoRA 微调脚本)。
  • 作者自述局限(论文 Sec. 7):RGB-DN 表示只捕捉世界的单一表面(single surface),无法处理被遮挡/多层几何;未来方向是生成多个 RGB-DN 视角并融合成更完整的 4D 世界模型。GitHub/项目页另披露的实际失败模式包括:操作过程中物体消失(视觉不一致)、对物体功能可供性理解错误(如无法理解水壶把手)、对未见物体泛化有限(如只能抓起玩具头部);建议对同一输入多采样 ~5 个随机种子择优。

原始链接

一手源存档(sources/)