一句话定位
上海 AI Lab 提出的 Aether:把 4D 几何重建、动作条件视频预测、目标条件视觉规划三项任务统一进同一个视频扩散模型的后训练里,完全用合成 4D 数据训练、不接触任何真实数据,却在真实视频上取得与专用重建模型相当甚至更好的零样本表现。
背景与定位
世界模型研究长期存在一条隐性分野:一边是几何重建 / SLAM 传统(DUSt3R、MASt3R、CUT3R、MonST3R 等 pointmap 回归方法,专注”感知”当前 4D 状态但不具备生成能力),另一边是视频生成范式(如 Sora “video generation models as world simulators” 的提法、CogVideoX 等文生/图生视频 DiT,具备生成未来能力但缺乏几何一致性)。Aether 的定位是把 Ha & Schmidhuber (2018) 经典 world model 框架里的**感知(perception)→ 预测(prediction)→ 规划(planning)**三段论直接实现为同一个模型的三种条件组合,而不是三个独立系统的拼接。
论文将自己与三类前作对照:① 交互式 3D/4D 世界生成——Cat3D(3D 场景生成扩散模型)、Cat4D(动态 4D 环境)、Genie 2(DeepMind 大规模交互式 3D 世界基础模型)、Motion Prompting(轨迹条件精确视频控制);② 4D 重建——DUSt3R / MASt3R / MonST3R / Spann3R / CUT3R 等 pointmap 回归方法;③ 视频生成基座——CogVideoX、Stable Video Diffusion、HunyuanVideo 等扩散 Transformer。Aether 选择相机位姿轨迹作为统一的全局动作表示(而非按键、人体/机器人运动、点流等其他动作模态),理由是它对以自我为中心(ego-view)的任务天然适配:导航中相机轨迹即导航路径,机械臂操作中手持相机的运动即末端执行器的 6D 运动。
模型架构
范式:对预训练视频扩散模型做多任务后训练(post-training),而非从零设计新架构。
- Backbone:CogVideoX-5B-I2V(图生视频扩散 Transformer),使用其预训练权重初始化;新增的深度/动作(raymap)输入输出投影层通道初始化为零。训练/推理均不使用文本条件,统一喂空文本 embedding(保留了基座模型的文本分支但未激活使用)。
- 联合潜空间:扩散目标 z₀ 由三种模态**通道维拼接(channel-wise concatenation)**而成——彩色视频潜 z_c、深度视频潜 z_d、动作(raymap)潜 z_a;条件同样由彩色条件 c_c 与动作条件 c_a 拼接而成。标准 ε-prediction MSE 扩散损失(式 1)。
- 深度表示:深度值裁剪到 [d_min, d_max] → 开方后取倒数转视差 → 逐 clip 做 scale-invariant 归一化 → 线性映射到 [-1,1] → 单通道视差复制 3 份 → 送入(CogVideoX 自带的)3D VAE 编码,与彩色 VAE 兼容以保证重建误差最小。
- 动作表示(raymap):相机内参 K、外参 E 转换为 6 通道 raymap 视频(3 通道 ray direction + 3 通道 ray origin)。平移分量先按比例因子 s_ray 缩放并按最大视差归一化,再做 signed log(1+·) 压缩抑制大值;raymap 空间上双线性下采样 8× 对齐 VAE 潜空间分辨率,时间上每 4 帧一组沿通道维拼接以对齐 3D VAE 的时间压缩比。推理时用直接的最小二乘式算法(附录算法 1)把生成的 raymap 逆转回相机内外参。
- 可变长度 / 帧率:训练时随机采样帧数 T ∈ {17, 25, 33, 41}、FPS ∈ {8, 10, 12, 15, 24},RoPE 位置编码系数按此线性插值,使模型适配不同时长与帧率的视频。
- 多任务通过条件组合实现(而非多个模型头):重建任务下 c_c 为完整输入视频潜;预测任务下 c_c 仅首帧观测图像有效、其余置零;规划任务下 c_c 首末帧分别为观测/目标图像、中间置零;动作条件 c_a 在动作无关/动作条件两种模式间整体置零或填入完整轨迹。
数据
- 来源:沿用 DepthAnyVideo(DA-V)与 The Matrix 的合成数据源,采集大规模、高质量、per-frame 深度标注的高分辨率 RGB-D 合成视频(论文未给出具体小时数/片段数,仅描述为 large-scale)。
- 自研 4D 相机标注管线(四阶段,全自动):
- 动态物体分割:Grounded SAM 2 基于语义类别(车、人等潜在动态物体)分割动态区域,保证长序列时序一致(比光流分割更鲁棒,代价是偶尔误判静止车辆等为动态)。
- 视频切片:用 SIFT 关键点数过滤纹理不足帧;用动态区域占比过滤动态主导帧;用 RAFT 光流估计运动幅度及前后向光流误差比,超阈值处截断片段。
- 粗相机估计:DroidCalib 基于静态区域深度信息做粗略内外参估计。
- 相机精化:CoTracker3 提取长时程对应关系,SIFT + SuperPoint 特征点在静态区域跟踪,Ceres Solver 做全帧集束调整(bundle adjustment)最小化重投影误差(Cauchy loss 处理稀疏性),并结合稠密深度做前后向 3D 空间重投影误差最小化。
- 验证集(生成/规划实验专用,附录 C):预测任务验证集含 93 个 in-domain 场景 + 43 个 out-domain 场景(每场景对应一段合成视频;in-domain 取自训练同分布合成环境,out-domain 取自训练中完全未见过的合成环境);规划任务验证集含 80 个 in-domain + 40 个 out-domain 场景。
- 数据混合/课程:训练时对条件输入做随机掩码而非固定任务标签,从而让同一批数据同时服务三类任务(掩码比例见”训练方法”)。全程不使用任何真实世界数据,测试阶段的零样本迁移完全来自合成数据训练 + 视频扩散基座的先验。
训练方法
- 训练目标:标准隐扩散模型 MSE 损失(式 1,ε-prediction)。
- 条件随机掩码策略(同时实现多任务与提升泛化):对 c_c(彩色条件),观测+目标图像同时掩码概率 30%(对应规划任务的训练信号)、仅观测图像掩码 40%(对应预测任务)、整段彩色视频潜掩码 28%(对应 4D 重建任务)、全部掩空 2%;对 c_a(动作条件),轨迹潜以**等概率(各 50%)**保留或整体置零,对应动作条件/动作无关两种模式。
- 两阶段训练:
- Stage 1:标准隐扩散 MSE 损失,在潜空间直接优化。
- Stage 2(约为 Stage 1 训练步数的 1/4):将生成结果解码回图像空间后追加三项损失精修——彩色视频用 MS-SSIM loss(多尺度结构相似度,强调结构一致性优于逐像素精度);深度视频用 Scale- and Shift-Invariant (SSI) loss(数据项 + 梯度正则项,解决深度尺度/偏移歧义);raymap 投影出的点云图用 Pointmap loss(对深度视差与 raymap 转换出的 3D 点云做加权 L_p 范数对齐,梯度仅回传给 raymap 潜、深度视差梯度被截断)。
- 优化器与调度:AdamW + OneCycle 学习率调度器。
- 推理:重建任务仅需 4 步去噪(远少于典型扩散采样步数);相机位姿估计推理结果有噪声,额外用 Kalman 滤波平滑轨迹;预测任务对观测图像的无分类器引导(CFG)系数为 3(对比 baseline CogVideoX 文本 CFG 系数 6),动作条件不施加 CFG 以保证公平对比。
Infra(训练 / 推理工程)
- 训练集群:80 张 A100-80GB GPU,混合并行——节点内 FSDP + ZeRO-2,节点间 DDP;深度视频需要在线归一化,因此 VAE 编码器也在训练时在线运行(跑在 DDP 下)。
- 批大小:单卡局部 batch size 4,跨 80 卡有效 batch size 320。
- 训练时长:约 两周(two weeks)完成两阶段训练。
- 精度:论文正文未披露具体训练精度(bf16/fp16 等)。
- 推理硬件:官方本地演示(Gradio demo)部署于单张 A100 80GB,本地端口 7860;重建任务默认输入尺寸 480×720,超出该尺寸需做空间/时间滑窗(stride 8 用于深度、stride 32 用于相机位姿)并做重叠区域融合。
- 推理速度 / FPS / 延迟:论文未给出具体生成侧 FPS 或延迟数字,仅披露重建任务 denoise 步数为 4 步(远少于常规生成任务的采样步数,速度更快)。
评测 benchmark
零样本视频深度估计(Sintel / BONN / KITTI,Abs Rel ↓ / δ<1.25 ↑,逐序列尺度对齐):
| Method | Sintel AbsRel | Sintel δ | BONN AbsRel | BONN δ | KITTI AbsRel | KITTI δ |
|---|---|---|---|---|---|---|
| MonST3R-GA | 0.378 | 55.8 | 0.067 | 96.3 | 0.168 | 74.4 |
| CUT3R | 0.421 | 47.9 | 0.078 | 93.7 | 0.118 | 88.1 |
| Aether(重建baseline组,逐序列尺度对齐) | 0.324 | 50.2 | 0.273 | 59.4 | 0.056 | 97.8 |
| DepthCrafter(扩散baseline,尺度+偏移对齐) | 0.590 | 55.5 | 0.253 | 56.3 | 0.124 | 86.5 |
| Aether(扩散baseline组,尺度+偏移对齐) | 0.314 | 60.4 | 0.308 | 60.2 | 0.054 | 97.7 |
KITTI 上 Aether 全面刷新 SOTA(AbsRel 0.056 vs CUT3R 0.118,δ<1.25 97.8 vs 88.1);Sintel 上 AbsRel 最优;BONN 上 AbsRel 不占优(0.273,弱于 MonST3R-GA 的 0.067)但 δ<1.25 最高。
零样本相机位姿估计(Sintel / TUM-dynamics / ScanNet,ATE / RPE-trans / RPE-rot,Sim(3) 对齐后,↓ 越好):
| Method | Sintel ATE | Sintel RPEt | Sintel RPEr | TUM-dyn ATE | TUM-dyn RPEt | TUM-dyn RPEr |
|---|---|---|---|---|---|---|
| CUT3R(feed-forward) | 0.213 | 0.066 | 0.621 | 0.046 | 0.015 | 0.473 |
| Aether(feed-forward) | 0.189 | 0.054 | 0.694 | 0.092 | 0.012 | 1.106 |
Aether 在 Sintel 上取得 feed-forward 方法中最优 ATE(0.189)与 RPE-trans(0.054),RPE-rot(0.694)略逊于 CUT3R(0.621);TUM-dynamics 上 RPE-trans 最优(0.012);ScanNet(室内)上整体落后于 CUT3R,论文将此归因于室内数据在训练集中占比不足。
VBench 视频预测(与基座 CogVideoX 对比,in-domain/out-domain/overall 加权平均分):
- 无动作条件(Table 3):CogVideoX 79.01/77.52/78.51 → Aether 80.34/79.42/80.04。
- 动作条件(Table 4):CogVideoX 79.56/80.70/79.92 → Aether 80.33/81.55/80.71;Aether 在 dynamic degree 指标上尤其明显跟随动作条件产出高动态场景,而 CogVideoX 即便给了动作文本描述仍倾向生成静态场景。
视觉规划消融(Aether vs 去掉深度重建目标的 Aether-no-depth):
- 动作条件导航(Table 5,像素级 PSNR/SSIM/MS-SSIM/LPIPS,overall):Aether-no-depth 18.97/0.5353/0.5376/0.3074 → Aether 19.70/0.5545/0.5760/0.2659(PSNR/SSIM/MS-SSIM 提升,LPIPS 降低,四项全面更优)。
- 动作无关路径规划(Table 6,VBench 加权平均 overall):Aether-no-depth 79.59 → Aether 80.67。
两组消融一致表明:把 4D 重建目标纳入多任务联合训练,能实质性提升生成式规划能力,是论文的核心论据之一。
创新点与影响
- 首次把重建、预测、规划三种能力统一进同一个视频扩散后训练框架,而非拼接三个独立系统;用条件掩码策略而非多头/多模型实现多任务共享。
- 全自动 4D 合成数据标注管线(动态分割 + 视频切片 + 粗估计 + 精化 bundle adjustment),解决了 4D(RGB + 深度 + 精确相机位姿)数据稀缺的问题,为”后训练式世界模型”研究提供了可复用的数据获取路径。
- 完全合成数据训练、零真实数据接触,却取得与专用重建模型相当甚至更优的零样本真实世界迁移——重建精度媲美/超越 DUSt3R/MASt3R/MonST3R/CUT3R 等专门在真实数据上调优的重建模型。
- 几何感知的动作空间(相机位姿轨迹)把预测能力自然转化为可执行的规划能力,且消融实验证明重建目标对规划性能有直接因果贡献。
- 作者自述局限:① 相机位姿估计精度不够稳定,可能源于 raymap 表示与既有视频扩散模型架构的不完全兼容;② 室内场景重建落后于室外(训练数据以室外为主);③ 无语言提示的预测在高动态场景中经常失败;④(GitHub 补充)在密集人群/剧烈运动场景表现挣扎;⑤ 视觉规划任务建议观测与目标图像相对接近以保证效果。作者提出的未来方向:探索新的动作表示、与真实数据协同训练、保留基座模型的语言提示能力。
- 论文已被 ICCV 2025 接收,并在 ICCV 2025 RIWM workshop 获 Outstanding Paper Award(2025-10);同团队后续发布了 4D 自回归世界模型 DeepVerse(2025-06)。
原始链接
- arXiv abs:https://arxiv.org/abs/2503.18945
- arXiv PDF:https://arxiv.org/pdf/2503.18945
- 项目主页:https://aether-world.github.io/
- GitHub:https://github.com/OpenRobotLab/Aether
- HuggingFace 模型权重:https://huggingface.co/AetherWorldModel/AetherV1
- HuggingFace Gradio Demo:https://huggingface.co/spaces/AmberHeart/AetherV1
一手源存档(sources/)
- aether—github-readme — GitHub OpenRobotLab/Aether README(fetched 2026-07-16)
- aether—hf-card — HuggingFace AetherWorldModel/AetherV1 model card(fetched 2026-07-16)
- aether—project-page — 项目主页文本快照(fetched 2026-07-16)
- arXiv 2503.18945 全文(arXiv 原文 PDF,不入 git,见上方链接)