一句话定位

用一组随机初始化的稀疏 3D 锚点(anchor:一簇点 + 一个特征向量)直接从多帧多视角图像特征做一次前馈(feed-forward、非自回归、非扩散)预测,跳过 VAE 离散 token 化和 BEV 中间表征,并把未来自车轨迹编码成时空特征参与融合,在 Occ3D-nuScenes 上以纯相机输入超过此前依赖真值占据(Occ GT)输入的方法。

背景与定位

驾驶端 4D 占据世界模型此前的技术分野可归为三个维度:

  • Token 化策略occworld 用重建式 VQ-VAE 把占据体压成离散场景 token 再自回归预测;OccLLaMA 换成针对语义稀疏性优化的 VAE 场景 tokenizer 做统一视觉-语言-动作建模;RenderWorld 用双码本 AM-VAE 分别编码空气/非空气体素;I²-World 进一步做多尺度 token 化;dome-occupancy-world-model 与 COME 则放弃离散化,改用连续 Occ-VAE 保留细粒度信息。
  • 中间表征:多数 VAE 方法(含 PreWorld、DFIT-OccWorld)依赖稠密 BEV 特征图;GaussianAD、RenderWorld 用 3D 高斯溅射;DTT、DynamicCity 用 triplane / hexplane。
  • 生成范式:自回归(OccWorld、RenderWorld、OccLLaMA、Occ-LLM)仍是主流,DFIT-OccWorld 走非自回归,DOME 用时空扩散 Transformer,COME 在此基础上接 ControlNet 做条件扩散生成。

SparseWorld-TC 的立场是三线都不站:不用 VAE 离散 token,不经 BEV 几何先验,也不用自回归或扩散——而是仿照 GPT / VGGT(3D 视觉的纯注意力前馈模型)的思路,把场景占据表示成一组可学习的稀疏锚点特征,靠跨模态、跨时间的注意力机制单次前向预测多帧未来占据;轨迹作为条件信号直接嵌入并参与融合,与场景特征交互。其稀疏锚点设计承袭自 SparseBEV、SparseDrive、PETRv2、Sparse4D、OPUS 等稀疏感知模型的路线,而非稠密体素范式(drive-occworld 一脉的”栅格特征原位分类”)。

注意:论文标题与代码仓库都叫 “SparseWorld”(TC = trajectory-conditioned 后缀),但与本库同期收录、同样基于稀疏 query 的 sparseworld-4d-occupancy(AAAI 2026,华中科大/清华 AIR/联想,arXiv 2510.17482)是两个独立工作:作者、机构、GitHub 仓库(MrPicklesGG/SparseWorld vs MSunDYY/SparseWorld)均不同,本文全文未引用或提及对方,纯属命名撞车,二者代表两条不同团队各自独立收敛到”稀疏 query 替代稠密体素”这一设计的现象。

模型架构

单帧占据表示:一个占据状态 M 由 N 个锚点 {A_i} 组成,A_i = (P_i, f_i):P_i 是围绕随机中心 c_i(在 3D 空间均匀采样)局部高斯扰动初始化的 M 个 3D 点,f_i∈R^D 是关联特征向量(初始置零)。f_i 经两个 MLP 解码,分别输出每点的几何偏移 Δp_i,j∈R^3 与语义类别 logits s_i,j∈R^C,用于把随机点”去噪”成有意义的占据点云(图 2)。

轨迹表示:未来轨迹 τ={x_t}_{t=1}^T,每个状态含自车平面位置 (x,y)、朝向角 θ 和时间戳 t,不假设路点等间隔采样。轨迹嵌入分三步:

  • 位置嵌入:路点坐标做相对位姿变换后经 MLP 映射到特征维度,位姿变换矩阵本身也经 MLP 映射;
  • 时间嵌入:对未来时间戳列表(如 [0,2,4,6])用经典 sin-cos 编码;
  • 时空融合嵌入:借鉴 StreamPETR 的 motion-aware layer normalization(MLN),用两个线性层隐式学习相邻帧间的仿射变换,再把该变换作用到 query 特征上,将空间与时间信息organic 融合,得到最终轨迹特征 τ={f”_t}。

传感器嵌入:借助可变形注意力(deformable attention),每个锚点中心 c_i(用点集 P_i 在 x/y/z 方向的均值和标准差确定采样偏移基准)投影到 m 个相机(用 ResNet-50 或 DINOv3-Base 作 backbone)的多尺度图像特征图上采样,多视角重叠时取平均;每个锚点中心收集过去 T’ 帧(历史 2 秒)的特征,并叠加正弦时间嵌入编码运动线索。

融合与解码:占据嵌入、传感器嵌入、轨迹嵌入统一投影到同一特征空间后,按”帧内交叉注意力(占据 query attend 历史传感器嵌入)→ 帧内自注意力(融合轨迹嵌入)→ 跨帧时间自注意力(对全部未来帧联合精炼)“堆叠多轮迭代,逐步把随机初始化的 3D 锚点点云精炼为未来 T 帧的准确占据预测。

配置:

  • SparseWorld-TC-Small:N=600 锚点,每锚点 M=128 点,ResNet-50 backbone;
  • SparseWorld-TC-Large:N=4800,M=16(点更少但锚点更多);
  • -Small* / -Large*:backbone 换成 DINOv3-Base,其余配置不变;
  • 预测视野 T 设为 3s(主榜)和 8s(长时程实验);历史窗口 T’=2 秒。

数据

训练与评测均在 Occ3D-nuScenes 基准上进行,输入模态是纯相机图像(不依赖 LiDAR 或真值占据),严格follow既有工作(DOME、OccWorld、DFIT-OccWorld、COME、Occ-LLM、I²-World)的实验设置。论文未描述额外的预训练数据集、数据配比或数据增强/过滤流程;轨迹标签直接取自 nuScenes 自车真值轨迹(消融实验中另用 BEVPlanner 预测轨迹替代真值轨迹做条件输入对比)。

训练方法

  • 损失函数:从每个真值占据体素提取中心点作为目标点云,用 Chamfer Distance loss(L_CD,双向最近邻 L1 距离)监督预测点分布对齐真值几何;对匹配到的目标点同时带有语义标签,用标准 focal loss(L_focal)监督语义分类;总损失 L = L_CD + L_focal。
  • Random Ensemble 训练策略:为让同一模型适应任意长度/任意时间间隔的未来预测需求(不改变网络结构),训练时对每个样本随机采样目标序列长度 L∈{2,…,T},用对应的 L 帧真值监督——由于没有固定时间步长,场景演化完全由轨迹嵌入(编码了时间和位置信息)来驱动。消融显示该策略比固定序列长度监督更有效(长时程 1-8s 平均 mIoU 22.33 vs 20.36,IoU 45.35 vs 43.25,见下文 Table 4)。
  • 优化器:AdamW,初始学习率 2×10⁻⁴,余弦退火(cosine annealing)学习率调度,训练 70 epoch。

Infra(训练 / 推理工程)

  • 训练硬件:8 张 NVIDIA H20 GPU,总 batch size 8(即近似单卡 batch 1)。
  • GPU-hours、混合精度设置:未披露。
  • 推理速度(FPS,Occ3D-nuScenes,单卡):SparseWorld-TC-Small 9.35 FPS,-Large 3.58 FPS,-Small*(DINOv3)5.63 FPS,-Large*(DINOv3)2.08 FPS;作为对比,此前 SOTA 的 Camera-输入方法 DOME-STC 2.75 FPS、I²-World-STC 4.21 FPS,而使用真值占据输入的 I²-World-O 可达 37.04 FPS(真值输入跳过了图像 backbone 与深度估计,速度不可比)。
  • 边缘设备部署:未披露。

评测 benchmark

主榜(Occ3D-nuScenes,1-3s 占据预测,仅列相机输入方法,Table 1)

方法输入mIoU Avg (%)IoU Avg (%)FPS
OccWorld-DCamera8.6216.53-
OccLLaMACamera8.6622.99-
PreWorldCamera9.5521.62-
Occ-LLMCamera10.2123.79-
DFIT-OccWorldCamera10.5017.02-
OccVARCamera11.7924.35-
DOME-STCCamera14.5323.332.75
I²-World-STCCamera18.9728.774.21
DOME-FCamera18.2528.84-
DTTCamera19.6036.11-
COME-F(此前 SOTA)Camera22.2644.07-
SparseWorld-TC-SmallCamera25.6049.029.35
SparseWorld-TC-LargeCamera26.4249.213.58
SparseWorld-TC-Small*Camera27.7151.055.63
SparseWorld-TC-Large*Camera29.8953.522.08

SparseWorld-TC-Large 相对此前 SOTA(COME-F)mIoU 提升 18.7%(26.42 vs 22.26),IoU 提升 11.7%(49.21 vs 44.07)。作为参照,使用真值占据作输入的 I²-World-O 达 mIoU 39.73 / IoU 49.80,但 SparseWorld-TC-Large* 的平均 IoU(53.52)已反超它,论文将此归因于自身在长时程预测中衰减更慢。

长时程预测(Occ3D-nuScenes,1-8s,Table 2,对比对象用真值占据输入):SparseWorld-TC-Large(纯相机)mIoU 逐秒为 28.64/26.28/24.36/22.65/21.07/19.73/18.52/17.42(avg 22.33),IoU 为 50.57/49.26/47.80/46.20/44.57/42.98/41.44/39.97(avg 45.35);对比 DOME(Occ GT,avg mIoU 15.83 / IoU 25.21)与 COME(Occ GT,avg mIoU 19.07 / IoU 29.96),分别领先 17.1%(mIoU)与 51.4%(IoU)。

RayIoU(Table 5,SparseWorld-TC-Large*,解决体素级 mIoU 深度轴不一致惩罚问题):重建 42.1,1s 35.8,2s 31.6,3s 28.9(阈值 1m/2m/4m 平均)。

消融

  • 轨迹条件(Table 3,Small 模型,1-3s avg):无轨迹 mIoU 15.44 / IoU 32.19;BEVPlanner 预测轨迹 mIoU 21.57 / IoU 44.76;真值轨迹 mIoU 25.60 / IoU 49.02——性能随轨迹精度单调提升,且在预测轨迹下仍保持鲁棒。
  • 训练策略(Table 4,Large 模型,1-8s avg):固定序列长度 mIoU 20.36 / IoU 43.25;Random Ensemble mIoU 22.33 / IoU 45.35。
  • 轨迹嵌入模块(Table 6,Small 模型,1-3s avg):无嵌入 mIoU 15.44 / IoU 32.19 → 仅 TE(时间嵌入)17.45 / 35.06 → TE+PE(位置嵌入)23.07 / 47.53 → TE+PE+STE(时空融合,完整版)25.60 / 49.02,三个模块逐级叠加均带来提升。
  • 逐类别表现(附录 Table 7/8):SparseWorld-TC-Large* 在可行驶路面(drive. suf.)等静态大类上 IoU 衰减慢(重建 76.87% → 3s 73.56%),而自行车、行人等小体积动态类别 mIoU 随时间衰减明显更快(如 bicycle 重建 26.72% → 3s 12.38%)。

创新点与影响

  • 首次证明纯前馈(非自回归、非扩散)、无 VAE 离散化、无 BEV 中间表征的稀疏锚点 Transformer 架构,可以直接从原始相机图像端到端预测多帧未来 3D 占据,且在 Occ3D-nuScenes 上以纯相机输入超越此前依赖真值占据输入的方法(部分指标)。
  • 把轨迹条件建模为独立的时空特征嵌入(位置嵌入 + 时间嵌入 + StreamPETR 式仿射融合),与场景特征做统一注意力交互,使模型能在任意给定轨迹下做条件化场景演化预测,且对预测轨迹(而非仅真值轨迹)保持鲁棒。
  • Random Ensemble 训练策略让同一权重适应任意长度/任意时间间隔的预测需求,无需为不同预测时长重新设计网络。
  • 论文自陈的局限:长时程预测存在”未来本质多可能性(multi-possibility)“,用单一真值做评测指标的公平性存疑(第 4.4 节明确提出这一顾虑);把架构扩展到 3D 高斯(用于直接预测未来传感器观测/前视图渲染)目前仅在附录给出定性结果(Figure 7、8),未给出量化指标,作者将其列为”未来工作的一个有前景方向”而非本文的完成项。

原始链接

一手源存档(sources/)

  • 未额外归档:论文声明的代码仓库 https://github.com/MrPicklesGG/SparseWorld 抓取时返回 “404 Not Found”(截至 2026-07-16 尚未放出代码/README);无官方博客、无独立 project page;HuggingFace Papers 页仅为 arXiv 摘要的自动镜像,无增量信息,故未归档。
  • arXiv 原文 HTML/PDF 不入 git,见上方”原始链接”。