一句话定位

上海 AI Lab 提出的 Aether:把 4D 几何重建、动作条件视频预测、目标条件视觉规划三项任务统一进同一个视频扩散模型的后训练里,完全用合成 4D 数据训练、不接触任何真实数据,却在真实视频上取得与专用重建模型相当甚至更好的零样本表现。

背景与定位

世界模型研究长期存在一条隐性分野:一边是几何重建 / SLAM 传统(DUSt3R、MASt3R、CUT3R、MonST3R 等 pointmap 回归方法,专注”感知”当前 4D 状态但不具备生成能力),另一边是视频生成范式(如 Sora “video generation models as world simulators” 的提法、CogVideoX 等文生/图生视频 DiT,具备生成未来能力但缺乏几何一致性)。Aether 的定位是把 Ha & Schmidhuber (2018) 经典 world model 框架里的**感知(perception)→ 预测(prediction)→ 规划(planning)**三段论直接实现为同一个模型的三种条件组合,而不是三个独立系统的拼接。

论文将自己与三类前作对照:① 交互式 3D/4D 世界生成——Cat3D(3D 场景生成扩散模型)、Cat4D(动态 4D 环境)、Genie 2(DeepMind 大规模交互式 3D 世界基础模型)、Motion Prompting(轨迹条件精确视频控制);② 4D 重建——DUSt3R / MASt3R / MonST3R / Spann3R / CUT3R 等 pointmap 回归方法;③ 视频生成基座——CogVideoX、Stable Video Diffusion、HunyuanVideo 等扩散 Transformer。Aether 选择相机位姿轨迹作为统一的全局动作表示(而非按键、人体/机器人运动、点流等其他动作模态),理由是它对以自我为中心(ego-view)的任务天然适配:导航中相机轨迹即导航路径,机械臂操作中手持相机的运动即末端执行器的 6D 运动。

模型架构

范式:对预训练视频扩散模型做多任务后训练(post-training),而非从零设计新架构。

  • BackboneCogVideoX-5B-I2V(图生视频扩散 Transformer),使用其预训练权重初始化;新增的深度/动作(raymap)输入输出投影层通道初始化为零。训练/推理均不使用文本条件,统一喂空文本 embedding(保留了基座模型的文本分支但未激活使用)。
  • 联合潜空间:扩散目标 z₀ 由三种模态**通道维拼接(channel-wise concatenation)**而成——彩色视频潜 z_c、深度视频潜 z_d、动作(raymap)潜 z_a;条件同样由彩色条件 c_c 与动作条件 c_a 拼接而成。标准 ε-prediction MSE 扩散损失(式 1)。
  • 深度表示:深度值裁剪到 [d_min, d_max] → 开方后取倒数转视差 → 逐 clip 做 scale-invariant 归一化 → 线性映射到 [-1,1] → 单通道视差复制 3 份 → 送入(CogVideoX 自带的)3D VAE 编码,与彩色 VAE 兼容以保证重建误差最小。
  • 动作表示(raymap):相机内参 K、外参 E 转换为 6 通道 raymap 视频(3 通道 ray direction + 3 通道 ray origin)。平移分量先按比例因子 s_ray 缩放并按最大视差归一化,再做 signed log(1+·) 压缩抑制大值;raymap 空间上双线性下采样 对齐 VAE 潜空间分辨率,时间上每 4 帧一组沿通道维拼接以对齐 3D VAE 的时间压缩比。推理时用直接的最小二乘式算法(附录算法 1)把生成的 raymap 逆转回相机内外参。
  • 可变长度 / 帧率:训练时随机采样帧数 T ∈ {17, 25, 33, 41}、FPS ∈ {8, 10, 12, 15, 24},RoPE 位置编码系数按此线性插值,使模型适配不同时长与帧率的视频。
  • 多任务通过条件组合实现(而非多个模型头):重建任务下 c_c 为完整输入视频潜;预测任务下 c_c 仅首帧观测图像有效、其余置零;规划任务下 c_c 首末帧分别为观测/目标图像、中间置零;动作条件 c_a 在动作无关/动作条件两种模式间整体置零或填入完整轨迹。

数据

  • 来源:沿用 DepthAnyVideo(DA-V)与 The Matrix 的合成数据源,采集大规模、高质量、per-frame 深度标注的高分辨率 RGB-D 合成视频(论文未给出具体小时数/片段数,仅描述为 large-scale)。
  • 自研 4D 相机标注管线(四阶段,全自动)
    1. 动态物体分割:Grounded SAM 2 基于语义类别(车、人等潜在动态物体)分割动态区域,保证长序列时序一致(比光流分割更鲁棒,代价是偶尔误判静止车辆等为动态)。
    2. 视频切片:用 SIFT 关键点数过滤纹理不足帧;用动态区域占比过滤动态主导帧;用 RAFT 光流估计运动幅度及前后向光流误差比,超阈值处截断片段。
    3. 粗相机估计:DroidCalib 基于静态区域深度信息做粗略内外参估计。
    4. 相机精化:CoTracker3 提取长时程对应关系,SIFT + SuperPoint 特征点在静态区域跟踪,Ceres Solver 做全帧集束调整(bundle adjustment)最小化重投影误差(Cauchy loss 处理稀疏性),并结合稠密深度做前后向 3D 空间重投影误差最小化。
  • 验证集(生成/规划实验专用,附录 C):预测任务验证集含 93 个 in-domain 场景 + 43 个 out-domain 场景(每场景对应一段合成视频;in-domain 取自训练同分布合成环境,out-domain 取自训练中完全未见过的合成环境);规划任务验证集含 80 个 in-domain + 40 个 out-domain 场景
  • 数据混合/课程:训练时对条件输入做随机掩码而非固定任务标签,从而让同一批数据同时服务三类任务(掩码比例见”训练方法”)。全程不使用任何真实世界数据,测试阶段的零样本迁移完全来自合成数据训练 + 视频扩散基座的先验。

训练方法

  • 训练目标:标准隐扩散模型 MSE 损失(式 1,ε-prediction)。
  • 条件随机掩码策略(同时实现多任务与提升泛化):对 c_c(彩色条件),观测+目标图像同时掩码概率 30%(对应规划任务的训练信号)、仅观测图像掩码 40%(对应预测任务)、整段彩色视频潜掩码 28%(对应 4D 重建任务)、全部掩空 2%;对 c_a(动作条件),轨迹潜以**等概率(各 50%)**保留或整体置零,对应动作条件/动作无关两种模式。
  • 两阶段训练
    • Stage 1:标准隐扩散 MSE 损失,在潜空间直接优化。
    • Stage 2(约为 Stage 1 训练步数的 1/4):将生成结果解码回图像空间后追加三项损失精修——彩色视频用 MS-SSIM loss(多尺度结构相似度,强调结构一致性优于逐像素精度);深度视频用 Scale- and Shift-Invariant (SSI) loss(数据项 + 梯度正则项,解决深度尺度/偏移歧义);raymap 投影出的点云图用 Pointmap loss(对深度视差与 raymap 转换出的 3D 点云做加权 L_p 范数对齐,梯度仅回传给 raymap 潜、深度视差梯度被截断)。
  • 优化器与调度:AdamW + OneCycle 学习率调度器。
  • 推理:重建任务仅需 4 步去噪(远少于典型扩散采样步数);相机位姿估计推理结果有噪声,额外用 Kalman 滤波平滑轨迹;预测任务对观测图像的无分类器引导(CFG)系数为 3(对比 baseline CogVideoX 文本 CFG 系数 6),动作条件不施加 CFG 以保证公平对比。

Infra(训练 / 推理工程)

  • 训练集群80 张 A100-80GB GPU,混合并行——节点内 FSDP + ZeRO-2,节点间 DDP;深度视频需要在线归一化,因此 VAE 编码器也在训练时在线运行(跑在 DDP 下)。
  • 批大小:单卡局部 batch size 4,跨 80 卡有效 batch size 320
  • 训练时长:约 两周(two weeks)完成两阶段训练。
  • 精度:论文正文未披露具体训练精度(bf16/fp16 等)。
  • 推理硬件:官方本地演示(Gradio demo)部署于单张 A100 80GB,本地端口 7860;重建任务默认输入尺寸 480×720,超出该尺寸需做空间/时间滑窗(stride 8 用于深度、stride 32 用于相机位姿)并做重叠区域融合。
  • 推理速度 / FPS / 延迟:论文未给出具体生成侧 FPS 或延迟数字,仅披露重建任务 denoise 步数为 4 步(远少于常规生成任务的采样步数,速度更快)。

评测 benchmark

零样本视频深度估计(Sintel / BONN / KITTI,Abs Rel ↓ / δ<1.25 ↑,逐序列尺度对齐):

MethodSintel AbsRelSintel δBONN AbsRelBONN δKITTI AbsRelKITTI δ
MonST3R-GA0.37855.80.06796.30.16874.4
CUT3R0.42147.90.07893.70.11888.1
Aether(重建baseline组,逐序列尺度对齐)0.32450.20.27359.40.05697.8
DepthCrafter(扩散baseline,尺度+偏移对齐)0.59055.50.25356.30.12486.5
Aether(扩散baseline组,尺度+偏移对齐)0.31460.40.30860.20.05497.7

KITTI 上 Aether 全面刷新 SOTA(AbsRel 0.056 vs CUT3R 0.118,δ<1.25 97.8 vs 88.1);Sintel 上 AbsRel 最优;BONN 上 AbsRel 不占优(0.273,弱于 MonST3R-GA 的 0.067)但 δ<1.25 最高。

零样本相机位姿估计(Sintel / TUM-dynamics / ScanNet,ATE / RPE-trans / RPE-rot,Sim(3) 对齐后,↓ 越好):

MethodSintel ATESintel RPEtSintel RPErTUM-dyn ATETUM-dyn RPEtTUM-dyn RPEr
CUT3R(feed-forward)0.2130.0660.6210.0460.0150.473
Aether(feed-forward)0.1890.0540.6940.0920.0121.106

Aether 在 Sintel 上取得 feed-forward 方法中最优 ATE(0.189)与 RPE-trans(0.054),RPE-rot(0.694)略逊于 CUT3R(0.621);TUM-dynamics 上 RPE-trans 最优(0.012);ScanNet(室内)上整体落后于 CUT3R,论文将此归因于室内数据在训练集中占比不足。

VBench 视频预测(与基座 CogVideoX 对比,in-domain/out-domain/overall 加权平均分):

  • 无动作条件(Table 3):CogVideoX 79.01/77.52/78.51 → Aether 80.34/79.42/80.04
  • 动作条件(Table 4):CogVideoX 79.56/80.70/79.92 → Aether 80.33/81.55/80.71;Aether 在 dynamic degree 指标上尤其明显跟随动作条件产出高动态场景,而 CogVideoX 即便给了动作文本描述仍倾向生成静态场景。

视觉规划消融(Aether vs 去掉深度重建目标的 Aether-no-depth):

  • 动作条件导航(Table 5,像素级 PSNR/SSIM/MS-SSIM/LPIPS,overall):Aether-no-depth 18.97/0.5353/0.5376/0.3074 → Aether 19.70/0.5545/0.5760/0.2659(PSNR/SSIM/MS-SSIM 提升,LPIPS 降低,四项全面更优)。
  • 动作无关路径规划(Table 6,VBench 加权平均 overall):Aether-no-depth 79.59 → Aether 80.67

两组消融一致表明:把 4D 重建目标纳入多任务联合训练,能实质性提升生成式规划能力,是论文的核心论据之一。

创新点与影响

  • 首次把重建、预测、规划三种能力统一进同一个视频扩散后训练框架,而非拼接三个独立系统;用条件掩码策略而非多头/多模型实现多任务共享。
  • 全自动 4D 合成数据标注管线(动态分割 + 视频切片 + 粗估计 + 精化 bundle adjustment),解决了 4D(RGB + 深度 + 精确相机位姿)数据稀缺的问题,为”后训练式世界模型”研究提供了可复用的数据获取路径。
  • 完全合成数据训练、零真实数据接触,却取得与专用重建模型相当甚至更优的零样本真实世界迁移——重建精度媲美/超越 DUSt3R/MASt3R/MonST3R/CUT3R 等专门在真实数据上调优的重建模型。
  • 几何感知的动作空间(相机位姿轨迹)把预测能力自然转化为可执行的规划能力,且消融实验证明重建目标对规划性能有直接因果贡献。
  • 作者自述局限:① 相机位姿估计精度不够稳定,可能源于 raymap 表示与既有视频扩散模型架构的不完全兼容;② 室内场景重建落后于室外(训练数据以室外为主);③ 无语言提示的预测在高动态场景中经常失败;④(GitHub 补充)在密集人群/剧烈运动场景表现挣扎;⑤ 视觉规划任务建议观测与目标图像相对接近以保证效果。作者提出的未来方向:探索新的动作表示、与真实数据协同训练、保留基座模型的语言提示能力。
  • 论文已被 ICCV 2025 接收,并在 ICCV 2025 RIWM workshop 获 Outstanding Paper Award(2025-10);同团队后续发布了 4D 自回归世界模型 DeepVerse(2025-06)。

原始链接

一手源存档(sources/)

  • aether—github-readme — GitHub OpenRobotLab/Aether README(fetched 2026-07-16)
  • aether—hf-card — HuggingFace AetherWorldModel/AetherV1 model card(fetched 2026-07-16)
  • aether—project-page — 项目主页文本快照(fetched 2026-07-16)
  • arXiv 2503.18945 全文(arXiv 原文 PDF,不入 git,见上方链接)