一句话定位

ViDAR(CVPR 2024 Highlight)提出视觉点云预测(visual point cloud forecasting)这一自监督预训练任务——用历史多视角图像预测未来 LiDAR 点云——以此同时监督语义、3D 几何与时序动态三种信息,把易得的「图像-LiDAR 序列」变成可扩展的预训练信号,让下游视觉 BEV 编码器在感知/预测/规划上全面涨点(检测 +3.1% NDS、运动预测误差 ~10%、规划碰撞率 ~15%)。作者自己也把它定性为一个跨模态世界模型(visual-in / LiDAR-out)。

背景与定位

视觉(纯相机)自动驾驶模型高度依赖昂贵的 3D 标注(3D 框、语义占据、轨迹),难以规模化。通用视觉的预训练(对比学习、掩码建模)主要只管语义,无法满足自驾同时需要语义 + 3D 几何 + 时序动态的要求。已有的免标注方案各有短板:深度估计(如 occworld 之外的单目深度预训练)只从单图取深度、缺多视角几何;渲染式重建(如 UniPAD/掩码场景渲染)能做多视角几何但没有时序建模,而时序对端到端系统(如 UniAD)的预测与规划恰恰是关键。

ViDAR 的思路是提出一个同时压满三种监督的 pretext:强迫模型”从历史预测未来”来学到场景流与物体运动(时序),而”从图像重建点云”又监督多视角几何与语义。它承接点云预测(point cloud forecasting)这一自监督传统——早期用 range image + 3D 卷积/LSTM,后来 4D-Occ(Khurana 等)用 4D 占据 + 可微光线投射把传感器运动因子化——但首次把输入换成图像、输出保留点云,并把它抬升为一个通用预训练范式。

与同期驾驶世界模型相比定位鲜明:gaia-1-wayvedrivedreamer 是「图像进-图像出」的生成式世界模型,copilot4d-waabioccworld 是「LiDAR/占据进-占据出」的同模态预测,而 ViDAR 首次跨模态(视觉进、点云出)。它与 i-jepa 同属「用预测式代理任务学可迁移表征」的自监督路线,只是把预测目标放在了 3D 几何的点云上。作者在讨论中也点明:ViDAR 可作为基于模型的强化学习(model-based RL,参见 dreamer-v3)的仿真器,用于视觉自主体的决策训练。

模型架构

ViDAR = History Encoder(预训练目标)→ Latent Rendering 算子 → Future Decoder 三段,整体在 BEV latent 空间里做自回归点云预测。

(1) History Encoder(被预训练的目标结构)

  • 任意视觉 BEV 编码器均可,默认用 BEVFormer-base:ResNet101-DCN 骨干 + FPN neck + 额外 6 层 BEV 编码层,从多视角图像序列抽 BEV 特征 $\mathcal{F}_{bev}$。刻意与下游模型(BEVFormer/OccNet/UniAD)共用同一 BEV 编码器结构,便于权重迁移。
  • BEV 查询为 $200\times200$ 可学习 token,有效感知范围 X/Y 轴 $[-51.2\text{m}, 51.2\text{m}]$。

(2) Latent Rendering 算子(核心创新,解决 ray-shaped 特征问题)

  • 动机:若直接把 History Encoder + Future Decoder 接可微光线投射(4D-Occ 的做法)来预训练,下游不升反降(检测 44.11→40.20 NDS)。原因是同一条射线上的 3D 网格对应图像同一像素,学出**「射线状特征」**——沿射线特征雷同、不判别,迁移下游变差。
  • 做法:在 latent 空间里模拟体渲染。① 投影层从 $\mathcal{F}{bev}$ 估独立概率图 $\mathbf{p}$;② 条件概率函数(Eq.10):某网格的条件概率 = 其前方所有 waypoint「未被占据」的连乘 × 自身独立概率——一旦某网格响应升高,其前后网格被抑制,从而每条射线只留少数峰值(对应真实物体/结构),打破射线状特征;③ 特征期望函数(Eq.11)算 ray-wise 特征;④ 把 ray-wise 特征与条件概率图相乘,得判别性几何特征 $\hat{\mathcal{F}}{bev}$。
  • 多组(multi-group)Latent Rendering:把 256 通道拆成 16 组、每组渲染 16 通道并行,保持几何特征多样性。配置 $G{=}16, \lambda{=}1$。消融证明:组数 1/2/4/8/16 → NDS 39.18/43.36/45.53/47.01/47.58,越多越好。

(3) Future Decoder(自回归 transformer)

  • 6 层结构、通道 256,每层 = Deformable Self-Attention + Temporal Cross-Attention + FFN。
  • 以上一帧 BEV 特征 $\hat{\mathcal{F}}_{t-1}$ 和期望自车运动条件 $\mathbf{e}_t$(下一帧自车坐标与朝向)为输入,MLP 把 $\mathbf{e}_t$ 编码后加到未来 BEV 查询上,自回归地预测下一帧 BEV 特征 $\hat{\mathcal{F}}_t$。Temporal Cross-Attention 针对自车移动导致的坐标系错位,额外按 ego-motion 计算未来查询在上一帧特征图中的参考坐标做对齐。
  • 投影层(输出 16 通道)把 $\hat{\mathcal{F}}_t$ 转成占据体 $\mathcal{P}\in\mathbb{R}^{200\times200\times16}$(16 为高度维,范围 $[-5\text{m}, 3\text{m}]$),再由「origin 射线 + 沿射线取最大占据响应距离」还原点云。
  • 因是自回归设计,即使只有 1s 输入也能外推任意未来。作者在讨论里也强调:可条件于不同未来自车运动,从视觉输入生成不同的未来点云——这正是它作为世界模型的体现。

数据

  • 主数据集 nuScenes:1,000 段驾驶序列。ViDAR 预训练只用其中的图像-LiDAR 序列(自监督,不需要 3D 框/占据标注)。
  • 预训练输入:5 帧历史多视角图像,自回归迭代 Future Decoder 6 次,预测未来 3 秒点云(每帧 0.5s 间隔)。
  • 点云预测评测:按 4D-Occ 设置分别用 1s(2 帧)/ 3s(6 帧) 历史输入;评测范围 X/Y 轴 $[-51.2, 51.2]$m。
  • 下游初始化三档:ViDAR-cls(ImageNet 分类)、ViDAR-2D-det(COCO 2D 检测,InternImage-S/B 骨干)、ViDAR-3D-det(nuScenes FCOS3D 3D 检测)——均在其上再做 ViDAR 预训练。
  • 数据规模消融:从全量到 1/8 子集微调 3D 检测。作者坦承数据规模仍受限(仅 nuScenes)。
  • 代码另放出 OpenScene-mini(12.5% / 100%) 的预训练配置与模型(CVPR 2024 Predictive World Model 挑战赛数据)。

训练方法

  • 目标函数:不用 4D-Occ 的深度 L1 loss,而是在拿到几何特征后直接用 ray-wise 交叉熵 loss(Eq.7)——对每个 GT 点从传感器原点打射线、沿射线均匀采 waypoint,最大化真值点位置响应、抑制其他 waypoint 响应,$\mathcal{P}_t$ 用三线性插值取值。
  • 省显存技巧:每个训练 step 随机只选 1 个未来预测计算 loss、detach 其余帧梯度。
  • 优化:50 epochs,AdamW,初始 lr 2e-4,cosine annealing。微调阶段沿用各下游官方训练策略。
  • 两阶段迁移(UniAD 实验):ViDAR 预训练后先微调 BEVFormer 做 3D 检测,再作为 UniAD 两阶段微调的初始化,与 UniAD 官方实现一致。
  • 关键消融:① Latent Rendering 拆解——只加条件概率函数就 40.20→47.34 NDS(+7.14),再加特征期望函数 →47.58;② 未来监督帧数 0/1/3/6 → 跟踪 AMOTA 42.12/43.79/44.74/45.10,越多越好;③ 预训练主要惠及 BEV 编码器的 view-transformation 组件(44.11→44.74→47.58)。

Infra(训练 / 推理工程)

  • 训练硬件(来自官方 README):推荐 8× A100;预训练显存占用约 63 GB/卡。提供省显存配置(supervise_all_future=False + 减少预测历史/未来帧数)可降到约 34 GB
  • GPU-hours / 训练总时长:未披露。
  • 软件栈:基于 mmDetection3D(v0.17.1)+ mmcv-full 1.4.0 / mmdet 2.14.0;PyTorch 1.10.1 + CUDA 11.1;Chamfer distance 走自带 CUDA 扩展。
  • 推理:ViDAR 是预训练框架而非实时部署模型,推理 FPS / 控制频率 / 端侧硬件均不适用/未披露;下游落地是把预训练好的 BEV 编码器权重迁到 BEVFormer/OccNet/UniAD 后按各自方式推理。
  • 并行/精度:未披露(沿用 mmdet3d 默认分布式训练 dist_train.sh,8 卡数据并行)。

评测 benchmark

全部在 nuScenes val(点云预测指标 Chamfer Distance 单位 m²,越低越好)。

点云预测(视觉输入)vs 4D-Occ(LiDAR 输入)

历史方法模态0.5s1.0s1.5s2.0s2.5s3.0s
1s4D-OccL1.261.88----
1sViDARC1.111.251.401.571.761.97
3s4D-OccL0.911.131.301.531.722.11
3sViDARC1.011.121.251.381.541.73

→ 用视觉输入却超过用 LiDAR 输入的 SOTA:1s 历史时未来 1s 误差 ~33%↓;3s 历史时 3s 误差 ~18%↓

下游感知——3D 检测(BEVFormer)

骨干 / 初始化预训练mAPNDS
RN101 / ImageNet-clsbaseline37.747.7
RN101ViDAR-cls42.651.8
RN101 / nus-3D-det监督预训练41.551.7
RN101ViDAR-3D-det45.854.8
InternImage-B / COCO-2D-detbaseline42.952.0
InternImage-BViDAR-2D-det50.157.6

关键:仅用图像-LiDAR 序列的 ViDAR-cls(42.6 mAP)就超过了用 3D 框监督的预训练(41.5 mAP);同数据规模下比 3D 检测监督预训练 +1.1% mAP / +2.5% mIoU,若叠加在 3D 检测预训练之上则 +4.3% mAP / +4.6% mIoU。

下游感知——语义占据(OccNet,mIoU):ImageNet-cls 24.35 → ViDAR-cls 29.57(同样超过 3D-det 监督的 26.98);ViDAR-3D-det 31.67多目标跟踪(UniAD, AMOTA):39.0 → 45.1,纯视觉超过既往端到端 tracker。 在线建图(UniAD, lane IoU):31.3 → 33.2

下游预测

  • 运动预测(UniAD):minADE 0.75→0.67(~10%↓)、minFDE 1.08→0.99、MR 0.158→0.149、EPA 0.463→0.498(+3.5%)。
  • 未来占据预测:近处 VPQ 54.6→57.3 / IoU 62.8→65.4;远处 VPQ 33.9→36.4 / IoU 40.1→42.1,全面超过 BEVerse。

下游规划(UniAD, open-loop):平均碰撞率 0.27→0.23(~15%↓)、平均 L2 位移误差 1.12→0.91 m(−0.21m),超过 VAD。

联合 P-P-P(Table 10,UniAD 全栈涨点):检测 NDS 49.36→52.57 / mAP 37.96→42.33;跟踪 AMOTA 38.3→42.0;建图 lane-IoU 31.3→33.2;运动 minADE 0.75→0.67;占据 VPQ-n 54.6→57.3;规划 avg.Col 0.27→0.23。

标注效率:ViDAR 预训练的 BEVFormer只用一半标注(39.4 mAP)就超过全量监督的基线(37.7 mAP);全/半/四分之一/八分之一子集上 mAP 增益分别为 4.9/6.5/6.7/7.3%——标注越少收益越大。

创新点与影响

  • 提出「视觉点云预测」这一新预训练任务:首次用一个统一过程同时监督语义 + 多视角 3D 几何 + 时序动态,把 UniAD 式端到端系统的感知/预测/规划一起预训练,而非只管感知。
  • ViDAR:首个视觉点云预测架构,并给出关键的 Latent Rendering 算子解决射线状特征这一”直接接可微光线投射反而掉点”的坑(+3.47 NDS)。
  • 首个跨模态驾驶世界模型:作者明确把 ViDAR 定性为世界模型——不同于 GAIA-1/DriveDreamer 的同模态生成,ViDAR 视觉进、点云出,可条件于不同未来自车动作生成不同未来点云,指向”在 3D 里训练视觉自主体”与 model-based RL 仿真器。
  • 影响:CVPR 2024 Highlight;直接催生 CVPR 2024 Autonomous Driving Challenge 的 Predictive World Model 赛道(配套开源 OpenScene 预训练配置);代码与 nuScenes/OpenScene 预训练+微调权重全部开源(Apache 2.0)。
  • 作者自述局限:预训练仅在 nuScenes 上、数据规模仍有限;未来计划跨数据集扩规模、尽量用公开图像-LiDAR 序列训练一个视觉自驾基础模型,并探索与其他单模态世界模型结合做数据仿真。

原始链接

一手源存档(sources/)