一句话定位

把 3D 占据预测重新表述为以当前帧传感器输入为条件的 4D 占据预测(world model)问题:用显式 3D 语义高斯(而非 BEV/Voxel 隐式表征)承载场景状态,逐帧对齐自车运动、预测动态物体局部位移、补全新观测区域,从而以流式方式(每帧只用上一帧历史)做时序占据预测,几乎不增加单帧推理的计算量。

背景与定位

视觉 3D 占据预测此前的时序建模基本走”感知→变换→融合”三段式流水线(如 BEVFormer、CVT-Occ):每帧独立抽特征,按自车轨迹把多帧特征对齐到当前帧,再融合多帧表征得到当前占据。这类方法把时序信息当作需要额外融合的多帧输入,既没有利用”驾驶场景演化本质上只由自车与动态物体的运动决定”这一强先验,又因为要同时处理多帧特征而增加计算开销。

GaussianWorld 的核心动作是把 3D 占据预测重新表述成一个以当前视觉输入为条件的 4D 占据预测(forecasting)问题——即经典 world model 范式 z^T = w(z^{T-1}, x^T) 在感知任务上的一个实例,而非”生成未来画面/点云”的 GAIA-1、DriveDreamer 类 world model。作者延续同组前作 GaussianFormer(单帧 3D 语义高斯占据预测器)的场景表征,为每个高斯新增一个时间特征属性以携带历史信息,并把场景演化显式拆成三个因子建模:① 静态场景的自车运动对齐、② 动态物体的局部位移、③ 新观测区域的补全。与同期的占据世界模型——如 occworld 的离散 token 自回归、DOME 的连续潜空间时空扩散——不同,GaussianWorld 不做”生成未来多帧”,而是专注”用上一帧场景状态 + 当前帧图像做流式感知”,属于 world model 用于感知任务(而非生成任务)的路线。

模型架构

场景表征沿用 GaussianFormer 的显式 3D 语义高斯集合,每个高斯 g = {p, s, r, c, f},分别是位置、尺度、旋转、语义概率、时间特征(f 为 GaussianWorld 相对 GaussianFormer 新增的属性,用于携带历史信息)。全场景固定用 25600 个高斯表示(与 GaussianFormer 一致)。

场景演化的三因子分解(对应论文 Eq. 6–9):

  • 自车运动对齐(Ego Motion Alignment):对上一帧全部高斯做一次基于自车轨迹的全局仿射变换 M_ego,把其位置对齐到当前帧坐标系,得到对齐后高斯 g_A^T;
  • 动态物体局部位移(Local Movements of Dynamic Objects):按语义概率把对齐高斯分成动态集合 {g_D} 与静态集合 {g_S},用运动层 Move 结合当前观测 x^T 预测 {g_D} 的位置更新(只更新动态高斯的位置,静态高斯位置不变);
  • 新观测区域补全(Completion of Newly-Observed Areas):随自车前移,落出感知边界的高斯被丢弃,同数量随机初始化的高斯被采样填入新观测区域 g_I^T,再用感知层 Per 结合当前观测预测这些新高斯的全部属性(位置、尺度、旋转、语义、时间特征)。

统一 Gaussian World Layer:Move 与 Per 共享同一套编码器 Enc(3D 稀疏卷积做高斯间交互 + 可变形注意力做高斯-多尺度图像特征交互)与 refine 模块 Ref,因此可合并成统一的演化层 Evol——对新高斯走 Per 分支、对历史高斯走 Move 分支,二者在同一层内并行计算:g_{l+1}^T = Evol(g_l^T, x^T)。堆叠 n_e 个演化层迭代精化高斯后,再接 n_r 个额外的 refinement 层(refine 全部属性,弥补高斯表征与真实世界的偏差;与演化层的唯一区别是对历史高斯是否只更新位置)。论文披露总共堆叠 4 个 Gaussian world layer(与 GaussianFormer 一致),未单独披露 n_e、n_r 各自的具体层数。

关键配置数字:25600 个 3D 高斯、4 个 Gaussian world layer、输入图像分辨率 900×1600、ResNet101-DCN(FCOS3D 预训练初始化)为图像 backbone、FPN 抽取 1/8、1/16、1/32、1/64 四种下采样尺度的多尺度特征。

相对 GaussianFormer 的三点结构改动(Appendix B 消融验证,见下文评测部分):① 新增时间特征属性携带历史信息(Temp. Feat.);② 用”预测属性增量”而非”直接预测新属性值”来更新高斯(Delta Ref.,尽量保留高斯原有特征);③ 扩大高斯与图像交互及预测占据时的影响范围(Range,因为建模动态物体运动需要更大的位移覆盖范围)。

数据

  • 数据集:nuScenes(Caesar et al., 2020),1000 个驾驶场景(Boston + Singapore),官方划分 700/150/150 训练/验证/测试序列;每个序列 20Hz 采集、20 秒时长,关键帧 2Hz 标注;每个样本含 6 路环视 RGB 图像。
  • 占据标注:采用 SurroundOcc 提供的稠密 3D 语义占据标注(而非常见的 Occ3D 标注),体素网格范围 X/Y 轴 [-50m, 50m]、Z 轴 [-5m, 3m],分辨率 200×200×16,共 18 类语义标签(16 类物体 + 空类 + 未知类)。
  • 无额外预训练数据或数据增强说明;图像 backbone 用 FCOS3D 在 nuScenes 检测任务上预训练的权重初始化,其余无专门数据配比/过滤说明。

训练方法

  • 损失:交叉熵 + Lovász-Softmax 损失(缓解类别不均衡)。
  • 两阶段训练:先在单帧任务上预训练(对应 GaussianFormer-B 配置),再用流式训练策略微调——每个场景的图像按时间顺序逐帧送入模型,当前帧图像 + 上一帧预测的 3D 高斯作为输入做当前帧占据预测,预测出的高斯再传给下一次迭代,形成连续的流式训练。
  • 训练稳定性技巧:流式训练早期模型还不擅长预测场景演化,直接训长序列会导致误差累积失控,因此:① 训练序列长度从短到长逐渐增加(5→10→20→30→38 帧);② 引入概率建模,每次迭代以概率 p 随机丢弃上一帧的历史高斯(相当于退化为单帧预测),且 p 随训练推进逐渐减小,使模型逐步适应更长序列。
  • 流式训练策略消融(Table 4,5 种配置对比):A(梯度按 Sum 累积,30h,mIoU 19.77/IoU 30.90)、B(梯度按 Mean 累积,30h,mIoU 19.81/IoU 30.93)、C(不做梯度累积但压缩总 epoch,20h,mIoU 反而降到 18.63/IoU 28.69)、D(只在最长 38 帧序列上训 30 epoch、不做短序列课程,15h,mIoU 19.82/IoU 30.96)、E(本文最终采用:概率建模 + 序列长度课程 [5,5,5,5,20] epoch,15h,mIoU 20.24/IoU 31.22)——E 训练时间最短且效果最优。
  • 未采用 RL;无蒸馏;无额外大模型初始化(仅图像 backbone 用 FCOS3D 预训练权重)。

Infra(训练 / 推理工程)

  • 训练:16× NVIDIA RTX 4090,总 batch size 16,20 epoch,AdamW(学习率 4e-4,weight decay 0.01),耗时 15 小时(对应正式训练配置;Table 4 中的训练策略消融另有 15h/20h/30h 等不同配置,属对比研究用途,非最终模型的训练成本)。
  • 并行策略、混合精度位宽:未披露。
  • 推理延迟/显存(单张 RTX 4090,batch size 1,Table 2):GaussianWorld 228 ms / 7030 MB,对比 Single-Frame(GaussianFormer-B)225 ms / 6958 MB——流式建模仅增加 3ms / 72MB,几乎不增加推理开销;远低于两种显式多帧融合基线(3D Gaussian Fusion 379ms/9993MB、Perspective View Fusion 382ms/10019MB,二者都需要 3 帧历史输入)。
  • 未披露:控制频率(Hz)、端到端系统延迟、车载部署硬件。

评测 benchmark

评测数据集统一为 nuScenes 验证集 + SurroundOcc 稠密占据标注,指标为 IoU(几何重建)与 mIoU(16 类语义均值)。

主表:3D 语义占据预测(Table 1,节选)

MethodIoUmIoU
MonoScene23.967.31
BEVFormer30.5016.75
TPVFormer*30.8617.10
OccFormer31.3919.03
GaussianFormer(原论文结果)29.8319.10
SurroundOcc31.4920.30
GaussianFormer-B(本文复现的单帧基线)30.6819.73
GaussianFormer-T(本文补做的时序融合变体)31.3420.42
GaussianWorld(本文)33.4022.13

GaussianWorld 相对单帧基线 GaussianFormer-B 提升 mIoU +2.40 个百分点(论文称 2.4%)、IoU +2.72 个百分点(论文称 2.7%);相对时序融合基线 GaussianFormer-T 提升 mIoU +1.71 个百分点(1.7%)、IoU +2.06 个百分点(2.0%)。

不同时序建模方式的效率对比(Table 2)

Temporal Modeling历史帧数LatencyMemorymIoUIoU
Single-Frame0225 ms6958 M19.7330.68
3D Gaussian Fusion3379 ms9993 M20.2432.27
Perspective View Fusion3382 ms10019 M20.4231.34
GaussianWorld1228 ms7030 M21.8733.02

注:Table 2 与 Appendix Table 5(结构消融)中 GaussianWorld 的数值(21.87 mIoU / 33.02 IoU)与 Table 1 正式结果(22.13 / 33.40)不完全一致,论文未说明差异原因,推测 Table 2/5 用的是消融研究阶段的训练配置。

场景演化三因子消融(Table 3,逐项经 pdftotext -layout 核对复选框对齐)

配置mIoUIoU
去掉自车运动对齐(保留 Dynamics + Completion)18.4728.88
去掉动态物体位移(保留 Ego + Completion)21.1732.49
去掉新区域补全(保留 Ego + Dynamics)×(训练崩溃)×
完整模型(三者都保留)21.5032.72

去掉自车运动对齐导致 mIoU 下降约 3.0 个百分点(论文原话),是三个因子里影响最大的一项;去掉动态物体位移只导致轻微下降;完全不做新区域补全会导致训练崩溃——因为随自车前移,所有高斯最终都会移出感知范围之外,模型无法维持场景表征。

模型结构设计消融(Appendix Table 5,同样经 pdftotext -layout 核对复选框对齐):去掉时间特征属性(Temp. Feat.)mIoU 降到 21.55/IoU 32.81;去掉增量式更新(Delta Ref.)mIoU 降到 21.37/IoU 32.25;去掉扩大交互范围(Range)mIoU 降到 21.21/IoU 32.32;三者全部启用时 mIoU 21.87/IoU 33.02(对应 Table 2 的 GaussianWorld 行)为最优。

流式序列长度与 refinement 层数(Figure 5,论文仅以图表形式给出,未提供精确数值表):流式帧数越多总体性能越好,但超过约 20 帧后略微下降,论文推测是因为占据标注本身经多帧 LiDAR 融合得到,场景边缘标注偏稀疏,拉低了长序列的有效监督质量;refinement 层数存在权衡——层数越多越有利于动态建模,但会损害静态元素的跨帧一致性。

创新点与影响

  • 把 3D 占据预测重新表述为以当前帧观测为条件的 4D 占据预测问题,是较早将 world model 范式系统用于感知任务本身(而非仅用于生成未来)的工作。
  • 用显式、连续的 3D 高斯代替隐式 BEV/Voxel 表征,使”自车对齐-动态位移-区域补全”三个物理直观的场景演化因子可以被直接建模,而不必依赖网络隐式学习这种关联。
  • 流式设计(每步只用上一帧历史高斯 + 当前帧图像)使 GaussianWorld 相对单帧基线几乎不增加推理延迟/显存(228ms/7030MB vs. 225ms/6958MB),却能大幅超过需要多帧输入的显式融合方法——这是相对此前”感知-变换-融合”三段式时序范式最主要的效率优势。
  • 论文自陈局限:模型无法对静态场景做到完全的跨帧一致性,原因是动态/静态高斯的解耦并不完全准确(依赖语义概率的软加权,而非硬性二分类)。

原始链接

一手源存档(sources/)

  • gaussianworld-occupancy—github-readme — GitHub README 快照(方法简介、安装/数据准备、单帧 GaussianFormer 与流式 GaussianWorld 的训练/评测/可视化命令、致谢项目),来源 https://github.com/zuosc19/GaussianWorld
  • 论文全文:arXiv:2412.10373(arXiv 原文 PDF,不入 git;正文数字取自 arXiv HTML v1 全文;Table 3、Appendix Table 5 的消融复选框列对齐额外用 pdftotext -layout 核对原始 PDF 排版后确认)