一句话定位
WorldSplat(ICLR 2026)用一个前馈(feed-forward,无需逐场景优化)的 4D 高斯表征桥接”生成”与”重建”两条路线:先用 4D 感知的隐扩散模型一次性生成 RGB+深度+动静语义的多模态隐变量,再用一个前馈高斯解码器直接把隐变量解码成像素对齐的 3D 高斯并聚合成 4D 高斯场,最后用一个增强扩散模型修补新视角渲染中的空洞和运动模糊,从而在任意用户指定的自车轨迹偏移下渲染出时空一致的多路环视新视角驾驶视频。
背景与定位
自动驾驶场景合成长期分裂成两条路线:以 gaia-1-wayve、drivedreamer、magicdrive、panacea-driving-video 为代表的视频生成模型能造出高保真、可控的驾驶视频,但工作在 2D 图像域,3D 一致性弱,换个视角看就会失真;以 magicdrive3d、OmniRe、StreetGaussian 等为代表的城市场景重建方法能从真实录制的驾驶日志中做出精确的新视角合成(NVS),但完全不具备”无中生有”的生成能力,只能重建已录制过的场景。先生成视频再重建(如 magicdrivedit 之前的 MagicDrive3D、InfiniCube、DreamDrive 一类”video-first”管线)虽然可行,但新视角质量同时受两个阶段误差的制约。WorldSplat 的定位是把生成能力直接内嵌进一个显式的 3D(4D)表征里:扩散模型不再直接吐出像素,而是吐出一个可被 3D 高斯泼溅(3DGS)解码、并沿任意新轨迹实时渲染的隐变量,从而一次前馈同时拿到生成的自由度与重建的空间一致性。
模型架构
三个独立训练的模块(4D 感知扩散模型 → 隐 4D 高斯解码器 → 增强扩散模型),推理时串联。
多模态隐变量构造:给定 K 路环视、T 帧的视频片段 I={I^v_t},用预训练 VAE(OpenSora-VAE-v1.2)编码得图像隐变量 L_img;用一个基础深度估计器(Metric3D v2)生成度量深度图,归一化到 [-1,1] 后复制三通道再编码为深度隐变量 L_depth;用 SegFormer 对动态类别做二值分割,编码为语义隐变量 L_seg;三者通道维拼接成解码器输入 L。
4D 感知扩散模型架构:基于 OpenSora v1.2 的 STDiT2 骨干,扩展成双分支扩散 Transformer——主 DiT 流处理时空视频隐变量 L,另一条 ControlNet(多 block)分支处理条件 C={S(BEV 布局草图), B(3D 框), T(自车轨迹), D(文本描述)}。为保证多视角一致性,把标准自注意力替换成跨视角注意力(把 B×V×T×H×W×C 重排成 B×T×(VHW)×C,将展平的 VHW 当作注意力序列长度,参数量不变)。ControlNet block 融合来自预训练 VAE 的道路草图隐变量 E(S) 与 T5 文本编码器的文本嵌入;3D 框(3D 卷积投影 2D 图像平面嵌入)、自车轨迹(MLP 编码)与文本特征再经单层交叉注意力融合成统一的场景级条件向量。文本条件来自论文提出的 DataCrafter 模块:把 K 路视频切片,用 VLM 评分器打分、逐视角生成 caption,再用一致性模块融合出兼顾场景上下文(天气/时间/布局)与物体细节(类别/框/描述)的结构化 caption。
训练用 Rectified Flow 取代标准 IDDPM:定义插值 z(s)=(1-s)ε+s·x(s∈[0,1]),训练神经场 g_ψ(z,s,C) 回归目标向量 x-ε,损失为 MSE;推理时离散化 s_k=k/N 并沿 z(s_{k-1})=z(s_k) - (1/N)·g_ψ(z(s_k),s_k,C) 反向步进——附录披露仅需 8 步采样即可(对比 MagicDrive-V2、Cosmos-transfer1 等常见 >30 步)。
隐 4D 高斯解码器(Latent 4D Gaussians Decoder):基于 ViT 的 Transformer,由多个跨视角注意力块 + 帧间时序注意力层 + 一系列上采样 block 组成,直接从多模态隐变量 L 预测逐像素 3D 高斯参数;额外注入 Plücker 射线图 P(由相机内外参得到逐像素射线原点 R_o 与方向 R_d)增强 3D 空间线索。每个 3D 高斯参数化为 g=(μ,r,s,α,c)(中心 μ∈R³、四元数旋转 r∈R⁴、尺度 s∈R³、不透明度 α∈R⁺、颜色 c∈R³),解码器末层预测逐像素偏移量 δ、旋转 r、尺度 s、不透明度 α、颜色 c、深度 d 与动静分类 logits m,Gaussian 中心由 μ = R_o + d⊙R_d + δ 显式几何构造(而非直接回归绝对坐标),输出形式为 D_φ: (L_img,L_depth,L_seg,P) ↦ {(G_t,M_t)∈R^{V×H×W×(14,1)}}_{t=1}^T(每像素 14 维高斯参数 + 1 维动静 mask logit)。论文强调该解码器同时支持 48+ 路输入视角,超过此前的前馈重建工作(pixelSplat、OmniScene 等)。
4D 高斯聚合:按已知自车轨迹 T 把各帧 3D 高斯统一变换到同一坐标系;每个时间步用当前帧的动态高斯 + 所有历史帧累积的静态高斯融合,即 G_4D = {(G_t⊙M_t) ∪ ⋃_i(G_i⊙(1-M_i))}_{t=1}^T,从而把跨时刻观测汇聚成一份完整的几何/外观/运动场,支持任意新空间视角与新时刻的渲染。
增强扩散模型:架构与 4D 感知扩散模型完全一致(同一套双分支 DiT+ControlNet 骨干,只调整输入输出通道维度),目标是在隐空间把渲染结果 R 回归到真实图像隐变量 E(I)。因为 3DGS 对未观测区域(如被遮挡的天空)渲染质量差、且无逐场景优化时强自车运动下渲染会模糊,该模块专门修补这两类瑕疵。相较 ReconDreamer 只用降质渲染训练(导致条件与输出对不齐),本文采用混合条件策略——训练时混合降质渲染与高质量视角,同时提升可控性与生成保真度(该策略即消融表里的”Mixed Aug”)。
监督:高斯解码器的 RGB 由 L1 + LPIPS 感知损失监督,深度由度量空间 L1 监督,动静 mask 由 SegFormer 生成的伪标签做二值交叉熵监督,总损失 L = L_recon + λ1·L_lpips + λ2·L_depth + λ3·L_seg(论文未披露 λ 具体取值)。
新轨迹生成:沿用 FreeVS 的自车位姿扰动策略,对原轨迹施加 Δy∈{±1m,±2m,±4m} 的横向偏移生成新轨迹用于评测;重建真实驾驶视频时可跳过 4D 感知扩散模型,高斯解码器直接吃干净隐变量。
数据
训练与评测均在 nuScenes(1,000 个城市驾驶场景,2Hz 标注)上进行,700 场景训练 / 150 场景验证;按 StreamPETR 的做法把标注(3D 框、道路草图)上采样到 12Hz。辅助模态全部由现成模型离线生成而非人工标注:Metric3D v2 出度量深度图,SegFormer 出动静语义分割 mask,road sketch 从 BEV 标注投影得到,caption 由 VLM(GitHub README 注明用 Qwen2-VL)生成并预抽取 T5 特征存为 .npy。原始 nuScenes 数据外未引入额外的真实或仿真数据源(全流程未使用 LiDAR 或真实图像做条件输入——4D 感知扩散模型只接受布局/框/轨迹/文本等结构化条件,不依赖真实图像或 LiDAR)。视频生成评测时按三种条件设定分别统计样本数:无首帧条件、有首帧条件下样本数均为 5,369 clips;noisy-latent 协议下为 6,019 clips(与 Vista、UniScene 对齐的评测口径)。
训练方法
三个模块独立训练(4D 感知扩散、增强扩散、高斯解码器互不共享梯度)。
- 4D 感知扩散模型(四阶段递进,均在 nuScenes 上,从 OpenSora v1.2 checkpoint 起步):Stage1 在 256×256 固定分辨率图像上微调 6 万步,建立布局/草图控制(此阶段只优化 ControlNet-Transformer、空间注意力与布局模块,含基础层里的空间自注意力);Stage2 用混合分辨率(144p/240p/360p)与可变帧长继续训练 4 万步,对齐 nuScenes 数据分布(仍用空间自注意力);Stage3 把 IDDPM 换成 Rectified Flow,在低分辨率(144p–360p)训练 2 万步;Stage4 在更高分辨率(480p 到全尺寸)用 Rectified Flow 微调 6 万步。
- 增强扩散模型:架构与训练管线与 4D 感知扩散模型一致,只是条件集合换成 C’={R(渲染结果),S,B,T,D} 且回归目标换成图像隐变量;GitHub README 给出其规模为 5 万步迭代。
- 隐 4D 高斯解码器:Transformer 结构(跨视角注意力 + 上采样头),多任务损失(RGB 重建 + 感知 + 深度 + 分割),GitHub README 给出规模为 10 万步迭代。
- 推理管线:4D 感知扩散模型输入噪声隐变量 + 条件 C 输出去噪隐变量 L_d → 高斯解码器由 L_d 预测 4D 高斯 → 按自定义新轨迹 T’ 渲染新视角视频 R’(草图/框重投影为 S’/B’)→ 增强扩散模型以 C’={R’,S’,B’,T’,D} 为条件精修,得到最终高保真新视角视频。
Infra(训练 / 推理工程)
- 训练硬件:三个模块均使用 32× NVIDIA H20 GPU 在 nuScenes 上训练。GitHub README 给出 GPU-hours 明细:4D 感知扩散模型(四阶段合计)约 157 小时;增强扩散模型(5 万步)约 59 小时;高斯解码器(10 万步)约 22 小时。并行策略、显存占用(训练侧)未披露。
- 推理效率(附录 B,单张 NVIDIA H20,17 帧 6 视角、424×800 分辨率):
方法 Diff-1 (s) Gs Dec. (s) Diff-2 (s) VAE Dec. (s) Total (min) GPU Mem (GB) MagicDrive-V2 215.35 - - 15.83 3.85 26 Cosmos-transfer1(nvidia-cosmos-transfer1) 126.37 - - 4.14 2.18 17 Ours 66.56 0.84 66.35 16.10 2.50 22 尽管本文管线含两个扩散模块,但 Rectified Flow 仅需 8 步采样(对比其他方法常见 >30 步),使总推理时间与 GPU 显存反而优于/接近单扩散模型的基线。控制频率、端到端时延(毫秒级)、边缘硬件部署数据均未披露。
评测 benchmark
原视角视频生成(nuScenes val,FVD/FID,越低越好,Table 1):
- 无首帧条件:DriveDreamer-2 FVD 105.10/FID 25.00;MagicDrive-V2(magicdrivedit)FVD 94.84/FID 20.91;MagicDrive3D(magicdrive3d)FVD 164.72/FID 20.67;Panacea(panacea-driving-video)FVD 139.00/FID 16.96;Ours FVD 74.13/FID 8.78(5,369 样本)。
- 有首帧条件:CoGen FVD 68.43/FID 10.15;DriveDreamer-2 FVD 55.70/FID 11.20;Ours FVD 16.57/FID 4.14。
- noisy-latent 协议(6,019 样本):Vista* FVD 112.65/FID 13.97;UniScene FVD 70.52/FID 6.12;Ours FVD 60.84/FID 6.51(正文行文写 60.87,表格数值为 60.84,以表格为准)。三种设定下 WorldSplat 均取得 FVD 最优(noisy-latent 下 FID 6.51 略逊于 UniScene 的 6.12,居第二)。
新视角合成(nuScenes,自车横向偏移 ±1m/±2m/±4m,FID/FVD,Table 2,基线数据取自 DiST-4D 论文):
| 方法 | ±1m FID/FVD | ±2m FID/FVD | ±4m FID/FVD |
|---|---|---|---|
| PVG | 48.15/246.74 | 60.44/356.23 | 84.50/501.16 |
| EmerNeRF | 37.57/171.47 | 52.03/294.55 | 76.11/497.85 |
| StreetGaussian | 32.12/153.45 | 43.24/256.91 | 67.44/429.98 |
| OmniRe | 31.48/152.01 | 43.31/254.52 | 67.36/428.20 |
| FreeVS* | 51.26/431.99 | 62.04/497.37 | 77.14/556.14 |
| DiST-4D | 10.12/45.14 | 12.97/68.80 | 17.57/105.29 |
| Ours | 8.25/40.17 | 11.26/47.41 | 13.38/64.07 |
| WorldSplat 在全部三档偏移下都取得全表最优 FID 与 FVD,包括对纯几何重建方法(OmniRe、StreetGaussian)与另一生成式基线 DiST-4D 的全面超越。 |
消融(Table 3,±2m 偏移,FVD/FID):A(仅重投影框/草图条件,无高斯,用 Enhanced)260.07/41.40 → B(+ 单帧 3D 高斯,用 Enhanced)75.26/16.31 → C(换成完整 4D 高斯聚合,用 Enhanced)50.73/11.60 → D(4D 高斯 + Mixed Aug,去掉 Enhanced 模块)107.58/26.73 → E(4D 高斯 + Mixed Aug + Enhanced,完整模型)47.41/11.26。可见 4D 高斯聚合(B→C)与 Enhanced 扩散模块(D→E)分别贡献了最大的两次提升。
下游任务收益(Table 4): (a) 用预训练 BEVFormer 做域差验证(mIoU/mAP):MagicDrive 18.34/11.86,MagicDrive3D 18.27/12.05,MagicDrive-V2 20.40/18.17,DiVE 35.96/24.55,Ours 38.49/29.34(正文写 29.32,表格 29.34,以表格为准),相对 DiVE 提升 mIoU +2.53 / mAP +4.79(按论文口径)。 (b) 把生成数据加入 StreamPETR 训练(mAP/NDS):Real 34.5/46.9;Panacea 22.5/36.1,Real+Panacea 37.1(+2.6)/49.2(+2.3);Ours(单独)29.2/41.7,Real+Ours 38.5(+4.0)/50.1(+3.2)——WorldSplat 生成数据带来的增量收益(+4.0 mAP / +3.2 NDS)大于 Panacea 生成数据的增量收益(+2.6/+2.3)。
创新点与影响
- 贡献:提出一个把生成扩散模型与显式 3D 重建统一起来的前馈 4D 场景生成框架——扩散模型直接吐出可解码为 3D 高斯的多模态隐变量,而非像素,从根本上避免了”先生成视频、再离线重建”两阶段管线的误差累积;提出动静分解的前馈高斯解码器,支持 48+ 路输入视角同时重建;提出增强扩散模型专门修补 3DGS 渲染中固有的未观测区域空洞与强运动模糊问题,训练时用混合质量条件(区别于 ReconDreamer 只用降质渲染)保持条件-输出对齐。
- 改变了什么:相对纯视频生成类驾驶世界模型(GAIA-1、DriveDreamer、MagicDrive、Panacea),补上了 3D/4D 空间一致性与任意视角可控渲染;相对纯重建类方法(OmniRe、StreetGaussian、EmerNeRF),补上了”无中生有”的生成能力(不依赖真实图像或 LiDAR 输入);相对 video-first 的生成+重建两阶段管线(MagicDrive3D、InfiniCube、DreamDrive),把两阶段合并为单次前馈,避免了两次误差叠加。
- 作者自陈局限:论文正文与附录未设专门的 Limitations 小节;从消融看,去掉 Enhanced 扩散模块后(Table 3 版本 D)FVD/FID 从 47.41/11.26 大幅回落到 107.58/26.73,说明当前的前馈高斯渲染本身对未观测区域与强自车运动仍有明显瑕疵,高度依赖后处理扩散修补而非几何本身足够鲁棒;新视角偏移评测最大只测到 ±4m,更大幅度轨迹偏移下的表现未知。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2509.23402
- arXiv PDF:https://arxiv.org/pdf/2509.23402
- arXiv HTML 全文:https://arxiv.org/html/2509.23402v1
- 项目主页:https://wm-research.github.io/worldsplat/
- GitHub(代码已迁移维护):https://github.com/xiaomi-research/worldsplat(原 https://github.com/wm-research/worldsplat 仅留转移说明)
- HF Papers 聚合页:https://huggingface.co/papers/2509.23402
- 相关前作:gaia-1-wayve、drivedreamer、drivedreamer-2、magicdrive、magicdrive3d、magicdrivedit(MagicDrive-V2)、panacea-driving-video、vista-driving-world-model、nvidia-cosmos-transfer1(推理速度对比基线)
一手源存档(sources/)
- worldsplat—project-page — 项目主页快照(sources/world-model/2025/worldsplat—project-page.md,fetched 2026-07-16)
- worldsplat—github-readme — GitHub README 快照(sources/world-model/2025/worldsplat—github-readme.md,fetched 2026-07-16,含各阶段 GPU-hours 明细)
- arXiv 全文 PDF(不入 git,引用见上方链接)