一句话定位
小米汽车世界模型团队的技术报告:把”世界表征”(WorldRec——稀疏查询驱动的前馈 3D Gaussian 重建,单 clip 重建从小时级压到约 10 秒)与”世界生成”(WorldGen——DiT 骨干、双向预训练 + 三阶段递进因果微调,去噪步数从 50 步蒸馏到 4 步)深度耦合成 Joint World Model:几何约束抑制生成漂移,生成能力填补重建盲区,在 nuScenes 上以自回归模型身份取得 FVD 64.97(0.19 秒/帧、81 帧序列),同时 WorldRec 在 Waymo/nuScenes 重建基准上全面刷新 PSNR/SSIM。
背景与定位
驾驶世界模型近年收敛到”先重建 3D 场景、再用几何先验条件化视频生成”的混合范式——从 GAIA-1 开创生成式驾驶世界模型,到 MagicDrive/MagicDrive-V2、Vista、Delphi、GAIA-2、Cosmos-Drive-Dreams 等在可控性和规模上持续推进,再到 WorldSplat 引入前馈 3D Gaussian 做多视角生成。报告把这一路线的瓶颈归纳为三点:① 表征侧——逐场景 3DGS 优化(StreetGaussians、OmniRe 等)单序列训练需数小时且难泛化到新视角;即便是 STORM、DGGT、UFO 这类前馈方法,依赖 DPT head 逐像素预测 Gaussian,独立预测的每帧 Gaussian 拼接后产生重影和层叠伪影,单 clip 的 Gaussian 数量还会膨胀到数亿级,渲染开销随序列长度急剧上升;② 生成侧——因果扩散模型从零训练缺乏场景先验,推理动辄要上百步去噪,且自回归生成固有的 exposure bias(train/inference 分布不一致)会随时间步累积,导致长时序内容漂移;③ 耦合浅——多数系统把重建和生成当成两个独立模块,NeoVerse 虽然用百万级野生单目视频训出了通用 4D 场景重建-生成混合架构,但缺乏自动驾驶特有的多相机几何一致性、ego-motion 条件化、结构化 layout 控制等设计。本报告的定位就是在重建(WorldRec)和生成(WorldGen)两侧分别解决各自瓶颈,再专门为自动驾驶场景设计紧耦合机制,区别于 NeoVerse 面向通用 4D 场景理解的定位;这与同期的 DriveWorld-VLA 也不同——后者把世界模型和 VLA 规划器绑在共享潜空间里服务决策,本报告的 Joint World Model 面向闭环仿真、数据合成与端到端训练,不涉及规划决策头。
模型架构
WorldRec(世界表征,前馈稀疏查询重建):给定多相机、多时刻图像序列 {I^t_c},共享权重视觉骨干抽取多尺度特征图 {F^t_{c,l}}。在世界坐标系中初始化 N 个稀疏 3D 查询(每个查询对应参考坐标 p=[X,Y,Z]ᵀ),用标定好的内外参把参考点投影到每个视角、每个尺度的特征图上(u^{c,l}=π_c(p)),双线性插值采样局部特征 f^{c,l}。一个轻量网络为每个采样特征预测归一化权重 w^{c,l},做”可见性感知的加权聚合”得到该查询的场景 token:q_i=Σ_{c,l} w^{c,l} f^{c,l}_i(时间维度上相邻帧特征先对齐再聚合)。轻量 MLP 把每个 token 解码为完整的 Gaussian 属性——位置偏移 Δp、颜色 c(RGB)、不透明度 α、协方差尺度 s、旋转四元数 r,最终中心 p̂=p+Δp。训练用可微 Gaussian 光栅化对所有相机视角同时渲染监督,损失 L=L_pixel+λ·L_perceptual(像素级 + 感知损失)。论文未披露 N 的具体数值、骨干网络结构细节、隐藏维度等配置数字。
WorldGen(世界生成,DiT + 因果微调):以 Diffusion Transformer(DiT)为骨干,用 rectified flow(而非标准 DDPM 噪声预测)建模:x_t=(1-t)z+t·x_0(z~N(0,I) 为噪声、x_0 为数据),目标速度场 v*=x_0-z,训练用 flow matching 目标 L_rf=E‖v_θ(x_t,t,c)-(x_0-z)‖²。条件信号包括 ego 轨迹、相机内外参(逐层注入每个 DiT block)、多视角首帧 + layout 条件(经 VAE 编码为 latent)、自由文本描述(经预训练多语言模型 umT5 编码),各模态 token 拼接后送入因果 DiT。
两阶段训练框架:
- Stage 1(双向预训练):全双向时序注意力,无因果掩码,标准 rectified-flow 目标,学习驾驶场景的全局时空分布,建立强生成先验。
- Stage 2(因果微调,从双向 checkpoint warm-start,三级递进):
- Teacher Forcing——引入因果注意力掩码(每帧只能看当前噪声帧和过去干净的 GT 帧),ε-prediction 损失 L_TF,训练稳定收敛快,但引入经典 exposure bias:推理时要基于自己生成的历史帧而非 GT,累积后造成长时漂移。
- ODE Distillation——teacher 用确定性 probability-flow ODE 以 N=50 步求解得到 x̂_0^teacher,学生 f_φ 用 K=4 步直接回归该目标(stop-gradient),推理效率提升约 12×(50→4 步)。
- DMD(Distribution Matching Distillation)——训练时历史上下文换成模型自己 rollout 生成的帧 x̂^(<i)(而非 GT),直接暴露模型于自身生成分布,损失 = 去噪回归项 + λ·D_KL(p_φ‖p_data) 分布匹配项,显著缩小 train/inference 分布差距,抑制长时序内容漂移。
Joint World Model 的架构扩展(二者分别做针对性适配,而非从零联合训练):
- WorldRec 侧——增量场景融合(scene fusion):新观测 token 与缓存场景 token 通过 cross-attention 融合,支持随车辆行驶不断扩展、维护一个全局一致的 4D Gaussian 表征。
- WorldGen 侧——渲染先验 RGB 条件化:WorldRec 维护的场景 token 按自车视角光栅化到目标相机视角,产生可能存在空洞/遮挡的部分参考图像,作为额外条件模态注入 DiT,为未观测区域提供粗糙几何脚手架,同时保留已重建区域的光度一致性;报告专门构造了一个渲染数据集(从已重建场景在留出目标位姿渲染参考图像)对 WorldGen 做针对性微调。
推理配置:H20 GPU 上,WorldGen 单视角 0.19 秒/帧、三视角 0.46 秒/帧,支持 10fps/30fps 下最长 1 分钟的可控长时序生成;WorldRec 对 10 秒 clip 的重建约 10 秒完成。参数量、DiT 层数/宽度、VAE 与 umT5 具体规格均未披露。
数据
这是一份技术报告而非完整论文,数据部分披露极薄:
- 定量评测用两个公开数据集——Waymo(Sun et al. 2020)与 nuScenes,后者细分原始域内、zero-shot 跨域、fine-tuning 三种设置分别评测 WorldRec;WorldGen 的生成质量同样在 nuScenes 上评测(Table 3,81 帧生成)。
- WorldRec 的新视角合成、鸟瞰视角重建定性展示(Fig 8、Fig 9)另外用了”private data”(私有数据),规模、时长、车队来源、传感器配置均未披露。
- Joint World Model 的渲染先验 RGB 条件化训练用了专门构造的数据集——从已重建场景在留出目标位姿渲染参考图像作为训练样本——但样本规模、覆盖场景数未披露。
- 动作/轨迹标签隐含来自各评测数据集自带的 ego 真值轨迹;报告未讨论训练阶段的预训练语料规模(小时数/帧数/条目数)、数据混合配比、sim-to-real 配比或 co-training 细节,也未说明预训练数据是否包含小米自有车队采集(“private data”一词提示存在自有数据,但未证实规模或占比)。
训练方法
- WorldRec:端到端有监督重建训练,损失 = 像素级重建 + 感知损失(L=L_pixel+λL_perceptual),对所有相机视角同步渲染监督以强化跨视角几何一致性,无对抗损失或 GAN 组件披露。
- WorldGen 两阶段范式:Stage 1 双向预训练用标准 flow-matching 目标从零学习强先验;Stage 2 因果微调按 Teacher Forcing → ODE Distillation → DMD 三级递进,每一级针对性解决”因果约束引入""推理步数过多""exposure bias 长时漂移”三个独立问题,且后一级都从前一级 checkpoint warm-start,避免因果扩散模型从零训练的优化难题。
- Joint World Model 训练:不是从零联合训练两个模块,而是分别给 WorldRec(加 scene fusion cross-attention 层)和 WorldGen(加 rendered-RGB conditioning 通路 + 专门构造的渲染先验数据集)做针对性微调,使二者接口对齐、协同工作。
- 具体优化器、学习率、batch size、iteration/epoch 数、各阶段训练时长等超参,全文未披露。
Infra(训练 / 推理工程)
- 训练侧 GPU 型号/数量、并行策略(数据/模型并行)、训练精度(fp16/bf16/fp32):未披露。
- 训练总 GPU-hours、模型参数量、batch size:未披露。
- 推理侧是本报告唯一披露硬件信息的部分:在 H20 GPU 上,WorldGen 生成速度为单视角 0.19 秒/帧、三视角 0.46 秒/帧;WorldRec 对 10 秒 clip 的重建耗时约 10 秒(对照逐场景优化基线约 4 小时)。
评测 benchmark
WorldRec —— Waymo / nuScenes 重建质量(Table 2,PSNR↑ / SSIM↑)
| 方法 | Waymo PSNR | Waymo SSIM | nuScenes Zero-Shot PSNR | nuScenes Zero-Shot SSIM | nuScenes Fine-Tuning PSNR | nuScenes Fine-Tuning SSIM |
|---|---|---|---|---|---|---|
| MVSSplat | 20.56 | 0.697 | 17.84 | 0.563 | — | — |
| NoPoSplat | 24.31 | 0.751 | 19.75 | 0.545 | — | — |
| DepthSplat | 23.26 | 0.696 | 19.52 | 0.601 | — | — |
| STORM | 26.38 | 0.794 | 17.77 | 0.669 | 24.54 | 0.784 |
| DGGT | 27.41 | 0.846 | 25.31 | 0.794 | 26.63 | 0.813 |
| Ours (WorldRec) | 28.48 | 0.861 | 26.54 | 0.821 | 27.50 | 0.826 |
WorldRec 在三种设置下全部取得最优 PSNR/SSIM,全面超过此前最强基线 DGGT。10 秒 clip 重建约 10 秒 vs. 逐场景优化约 4 小时(14400 秒/10 秒 ≈ 1440×,此换算为本文根据披露数字推算,非论文原表述的精确倍数)。
WorldGen —— nuScenes 生成质量对比(Table 3)
| 模型 | Bi/AR | Venue | FID↓ | FVD↓ | 帧数 | 推理时延(秒/帧) |
|---|---|---|---|---|---|---|
| MagicDrive | Bi | ICLR’24 | 16.20 | — | 1 | — |
| MagicDrive-V2 | Bi | ICCV’25 | 20.91 | 94.84 | 16 | — |
| Vista | Bi | NeurIPS’24 | 6.9 | 89.4 | 16 | — |
| DiVE | Bi | arXiv’25 | 7.14 | 68.4 | 8 | — |
| Delphi | Bi | arXiv’24 | 15.08 | 113.5 | 8 | — |
| UniScene | Bi | CVPR’25 | 6.12 | 70.52 | 8 | — |
| Genesis | Bi | NeurIPS’25 | 6.45 | 67.87 | 16 | — |
| Epona | AR | ICCV’25 | 7.5 | 82.8 | 16 | 1.06 |
| Ours (WorldGen) | AR | — | 7.04 | 64.97 | 81 | 0.19 |
作为自回归(AR)模型,WorldGen 的 FVD 64.97 优于表中全部模型(含双向模型),FID 7.04 略逊于最优双向模型 UniScene(6.12)但与之接近;生成帧数 81 帧远超其余模型的 1–16 帧;相比唯一另一个自回归方法 Epona,WorldGen FVD 更低(64.97 vs 82.8)且推理速度快 5.6×(0.19 秒 vs 1.06 秒/帧)。
Joint World Model:报告只给出长时序一致性、多视角空间一致性、多次生成稳定性三方面的定性图/视频展示,没有提供针对 Joint World Model 本体的定量指标(例如联合模型相较单独 WorldGen 的 FVD/FID 提升、或消融实验数据)——这是评测层面的明显缺口,报告本身也未做说明或致歉。
创新点与影响
- WorldRec 用”稀疏查询聚合”取代主流 DPT-head 逐像素预测范式,从根本上避免了逐帧独立预测 Gaussian 拼接产生的重影和层叠伪影,同时把 Gaussian 数量从”每 clip 数亿级”压缩为紧凑稀疏 token 集合,重建时间从小时级压到秒级。
- WorldGen 的”双向预训练 → 因果微调”范式,加上 Teacher Forcing → ODE Distillation → DMD 三级递进微调,把”因果扩散训练难、推理步数多、exposure bias 长时漂移”三个此前分散解决的问题串成一条可复现的技术流水线,是较少见的把三者放进同一体系逐一拆解的公开报告。
- Joint World Model 的核心论点是”WorldRec 的确定性几何约束抑制生成漂移 + WorldGen 的生成能力填补重建盲区”双向互补,思路上呼应 NeoVerse,但报告明确自陈与 NeoVerse 的差异在于针对自动驾驶场景专门设计了多相机几何一致性、ego-motion 条件化、结构化 layout 控制等能力。
- 作者自陈/隐含的局限:全文未见任何消融实验(无论是 WorldRec、WorldGen 还是 Joint World Model 的组件消融);Joint World Model 部分只有定性图/视频展示,没有量化对比表;数据规模、训练算力(GPU 型号/数量/GPU-hours)、模型参数量三项在”技术报告”体裁下均未披露;也未讨论泛化到不同车型/传感器配置、恶劣天气实测效果,以及下游闭环仿真、规划器评测中的实际表现。
原始链接
- arXiv abs:https://arxiv.org/abs/2605.18137
- arXiv PDF:https://arxiv.org/pdf/2605.18137
- HuggingFace Papers:https://huggingface.co/papers/2605.18137
- 项目主页:https://jointwm.github.io/
一手源存档(sources/)
- xiaomi-auto-world-model—blog — 项目主页快照(fetched 2026-07-16)
- arXiv 2605.18137 全文(arXiv 原文 HTML,不入 git,见上方链接)