一句话定位

SparseWorld(AAAI 2026)用一组数量固定(1040 个)的可学习稀疏动态 query 取代传统占据世界模型的稠密体素网格:query 自带 4D 坐标(x,y,z,时间戳),感知阶段按自车历史轨迹自适应缩放感知范围,预测阶段把”逐体素分类”换成对 query 位置的连续回归迁移,在 Occ3D-nuScenes 上相对 PreWorld 取得 20%–40% mIoU 提升、碰撞率减半、推理速度提升约 7 倍。

背景与定位

占据世界模型此前大致有两条路线:一是以 occworld 为代表的”感知-预测解耦”范式——先把每帧占据观测各自编码成隐向量,再用一个世界模型对隐向量做自回归预测,最后解码回占据,这类方法梯度在编码-预测-解码之间断开,且编解码过程本身会丢信息;二是近期的”栅格特征”范式(论文点名 PreWorld、AAAI2025 的”Driving in the Occupancy World”即 drive-occworld 一脉),用感知阶段的体素/BEV 特征直接作为世界模型的中间表征做逐体素”原位分类”式预测,实现端到端优化,但这种静态、原位分类的操作与自车运动和场景动态的连续性存在错位,导致时序不一致、特征漂移和误差累积;且两条路线都依赖人工预定义的固定感知范围,无法随车速动态调整,稠密网格也带来显著的存储和计算开销。

SparseWorld 受近期稀疏占据感知模型(OPUS、Liu et al. 2024 的 Fully Sparse 3D Occupancy Prediction)启发,提出”先感知后预测”(perceive-then-forecast)的全稀疏范式:用稀疏动态 query 在当前时刻自适应构建扩展范围的占据表征,再把未来运动建模为相对自车的连续回归,而非在静态网格上做分类。

模型架构

整体由四部分组成:通用图像 backbone(多帧多尺度特征)→ Range-Adaptive Perception 模块(RAP,L 个解码层)→ State-Conditioned Forecasting 模块(SCF)→ 两个并行解码头(占据预测 + 运动规划)。

Range-Adaptive Perception(RAP)

  • 输入是可学习 query embedding 及其对应的 4D 坐标(x, y, z, 时间戳)。
  • Adaptive Scaling 子模块:编码历史自车路点 {w^i}_{i=-p}^0(隐含反映当前速度)经 MLP 得到缩放因子 γ=[γx,γy,γz],逐元素调制初始 query 坐标 p'_i = γ ⊙ p_i,实现”车速越快、感知范围越大”的自适应缩放(消融显示纵向 vx 值域比横向 vy 更大且恒为正,γx 对 vx 更敏感——符合驾驶直觉)。
  • Temporal-Spatial Multi-Head Self-Attention(TS-MHSA):注意力分数由三部分构成——语义相似度 q_i^T q_j、空间邻近度 -τ_i‖p_i-p_j‖²(τ_i 为受 SparseBEV 启发的可学习空间偏置缩放因子)、时间因果掩码 M_ij(仅允许 t_i ≥ t_j 的 query 互相看到,避免未来 query 干扰当前帧补全)。
  • 解码器采用由粗到精范式:每层输出的每 query 点数逐层递增(1, 4, 16, 24, 32, 48),query 位置按输出点均值逐层更新,每层输出都单独监督。
  • query 数量按 7 个时间步(当前 + 未来 6 帧)划分为 (720, 60, 60, 60, 60, 40, 40),共 1040 个初始 query

State-Conditioned Forecasting(SCF)

  • 自车 query q^t 与同时刻场景 query Q^t 做空间交叉注意力,注意力权重 A^t_i = (q^t)^T q_i^t - τ_i^t ‖p_i^t‖²(τ_i^t 由 MLP 从 q_i^t 学出)。
  • 下一帧场景表征通过拼接 + 4D 位置编码 + 自车 query 广播得到:Q̂^{t+1} = [Q̂^t, Q^{t+1}] + PE([P^t,P^{t+1}]) + repeat(q^{t+1}),递归自回归执行;q^t 同步解码用于规划。
  • 核心思想是把逐体素”原位分类”换成对 query 位置的回归式偏移,与场景连续演化对齐。

图像 backbone:ResNet-50,输入分辨率 256×704。

数据

  • 数据集:Occ3D-nuScenes(基于 nuScenes),700 个训练场景 + 150 个验证场景,每段 20 秒,标注间隔 0.5 秒。密集标签分辨率 200×200×16(体素尺寸 0.4m×0.4m×0.4m),17 语义类 + 1 自由类。
  • 输入/预测窗口:当前及过去 2 秒视频帧作为输入,预测未来 3 秒的占据与自车轨迹。
  • 动作/轨迹标签:来自 nuScenes 自身自车路点标注。
  • Timestamp-Aware Self-Scheduling 用的伪 GT 构造:把未来 f 帧的占据 GT 稀疏化为 3D 占据体素坐标点云,通过坐标变换统一到当前时刻坐标系后合并、再体素化,得到融合多帧的 GT 点云 Ĝ,用于对 RAP 输出的 query 位置做 Chamfer distance 监督。
  • 无额外采集数据、无 sim-to-real、无跨模态 co-training;沿用 Occ3D-nuScenes 官方数据切分,可见性 mask 在训练和推理中均未使用。

训练方法

两阶段训练(Timestamp-Aware Self-Scheduling)

  • 论文指出直接给 query 分配时间戳有两个朴素方案的失败模式:(1) 人工手动指定时间戳并逐帧显式监督——相邻帧空间重叠导致监督信号失效;(2) 忽略时间区分、让所有 query 预测所有未来帧——训练收敛冲突、性能下降。
  • 阶段一(预训练,6 epoch):暂时去掉 TS-MHSA 里的时间掩码项,不显式指定 query 时间戳,仅用 L_pretrain = CD(P'_0, Ĝ) + Σ_l (CD(P_l, Ĝ) + L_focal(C_l, C_g)) 预训练 RAP(Chamfer distance + Focal loss 监督语义)。
  • 训练过程中维护一个统计矩阵 M ∈ R^{N×(f+1)},记录每个 query 匹配到各时间戳 GT 点的次数(点匹配基于 Chamfer distance 的最近邻关系,重体素化时一个体素可能对应多个时间戳);基于 M 用”最大占比优先分配算法”(细节见附录)为每个 query 动态分配时间戳归属。
  • 阶段二(端到端训练,48 epoch):统计矩阵 M 和 query 时间戳每个 epoch 动态更新,总损失 L_total = L_pretrain + Σ_t (λ1 CD(P^t,Ĝ^t) + λ2 L_focal(C^t,Ĉ^t) + λ3 L_2(w^t,ŵ^t)),用 Chamfer distance 监督占据、L2 loss 监督轨迹。
  • 推理阶段 query 时间戳固定,不再执行动态分配过程,保证推理效率。
  • 优化器:AdamW,学习率 2e-4,warm-up + cosine annealing。
  • 消融对比显示:该策略相比”无时间区分”(mIoU 11.82 vs 10.95,训练 12h vs 11h) 和”人工手动指定时间戳”(mIoU 11.82 vs 11.37,训练 12h vs 22h,因需 L×f 次 Chamfer distance 计算) 均更优——省时且效果更好(Table 5)。

Infra(训练 / 推理工程)

  • 论文正文实验(Table 1/2 主结果)训练硬件:4 张 NVIDIA A100 GPU,总 batch size 8;推理速度测于 4090 GPU,达 8.0 FPS(PreWorld 为 1.0 FPS,约 8 倍提升;论文摘要/引言称”约 7 倍加速”)。
  • GitHub 发布的最终 checkpoint(SparseWorld-R50,2025/12/20 发布)训练硬件:8 张 NVIDIA H20 GPU;据 README 称训练实际仅占用约 17GB 显存,可在 RTX 4090 等消费级 GPU 上复现。
  • GPU-hours、并行策略(DP/DDP/FSDP)、训练精度(fp16/bf16/fp32)均未披露。
  • 消融实验的训练耗时(Table 5,推测同为 4×A100 环境):完整 Temporal-Aware Self-Scheduling 训练需 12 小时,“无时间区分”需 11 小时,“人工指定时间戳”因 L×f 次 Chamfer distance 计算需 22 小时。

评测 benchmark

Occ3D-nuScenes,输入当前+过去 2 秒,预测未来 3 秒占据与轨迹。以下数字均取自论文正文 Table 1/2(对比结果均引自原论文,非复现)。

4D 占据预测(Table 1,mIoU / IoU 分 1s/2s/3s/Avg):

方法辅助监督mIoU@1s@2s@3sAvgIoU@1s@2s@3sAvgFPS
OccWorld-TSemantic LiDAR4.683.362.633.569.328.237.478.34-
OccWorld-D3D Occ11.558.666.988.6618.9016.2614.4316.53-
OccLLaMA-F3D Occ10.348.666.988.6625.8123.1919.9722.99-
PreWorld3D Occ11.698.726.779.0623.0120.7918.8420.881.0
PreWorld+Pre-training2D&3D Occ12.279.247.159.5523.6221.7619.6321.621.0
SparseWorld (Ours)3D Occ14.9313.1511.5113.2022.9622.1021.0522.038.0

相对 PreWorld,mIoU 提升 20%–40%(论文原文口径),且随预测时长增长,SparseWorld 的分数衰减幅度在所有对比方法中最小。论文自陈在 IoU 指标上无明显优势,并解释:IoU 由背景体素主导(约占 95%,多数不可见),而 SparseWorld 擅长的是前景物体识别。

运动规划(Table 2,L2 / 碰撞率, 表示训练与推理均使用自车状态):

方法辅助监督L2@1s@2s@3sAvgColl@1s(%)@2s@3sAvg
UniADMap&Box&Motion&Track&Occ0.480.961.651.030.050.170.710.31
OccNetMap&Box&3D Occ1.292.132.992.140.210.591.370.72
OccWorld-D3D Occ0.521.272.411.400.120.402.080.87
OccLLaMA-F†3D Occ0.381.072.151.200.060.391.650.70
PreWorld2D&3D Occ0.411.162.321.300.500.882.421.27
PreWorld†2D&3D Occ0.220.300.400.310.210.660.710.53
SparseWorld (Ours)3D Occ0.490.941.470.970.180.781.880.95
SparseWorld† (Ours)3D Occ0.190.250.360.270.110.290.460.29

论文正文称”SparseWorld 的碰撞率始终只有 PreWorld 的一半”(原文表述),但逐列核对:不用自车状态时 SparseWorld 碰撞率 Avg 0.95% vs PreWorld Avg 1.27%(约为 3/4,非严格一半,1s/2s/3s 各档比值也不一致);加入自车状态后 SparseWorld† Avg 0.29% vs PreWorld† Avg 0.53%,比值约 0.55,更接近论文所称的”减半”。加入自车状态后 SparseWorld† 各项指标均为对比方法中最优或次优。

消融(均在 6 epoch 预训练 + 12 epoch 端到端训练的缩短配置上做,Avg 取未来 3 秒)

  • 核心组件消融(Table 3,baseline mIoU 11.82 / IoU 21.17):去掉 Adaptive Scaling → mIoU 11.45(-0.37);去掉 Temporal mask → 11.52(-0.30);去掉 4D PE → 11.58(-0.24);去掉 State Condition → 11.31(-0.51,降幅最大)。
  • 自车状态 + 空间交叉注意力消融(Table 4):有自车状态+空间交叉注意力 → L2 0.29m / 碰撞率 0.37% / mIoU 11.82(最优);无自车状态+空间交叉注意力 → L2 1.01m / 碰撞率 0.65% / mIoU 10.64;有自车状态+普通交叉注意力 → L2 0.31m / 碰撞率 0.44% / mIoU 11.71;无自车状态+普通交叉注意力 → L2 1.25m / 碰撞率 0.77% / mIoU 10.28(最差)。空间调制在缺失自车状态输入时收益尤其明显。
  • 训练策略消融(Table 5):Temporal-Aware Self-Scheduling mIoU 11.82 / IoU 21.17 / 12h;无时间区分 10.95 / 20.08 / 11h;人工指定时间戳 11.37 / 20.31 / 22h。

创新点与影响

  • 把占据世界模型从”稠密网格 + 原位分类”转向”稀疏动态 query + 连续回归”,用单一统一表征(query)同时承载感知与预测,避免了解耦范式的梯度断裂问题,也避免了栅格范式的静态分类与场景连续性错位。
  • Adaptive Scaling 让感知范围随自车历史轨迹(隐含速度)自适应缩放,作者用 γ 值热力图验证了其学到的”纵向感知范围应更大”的驾驶先验与直觉相符。
  • Timestamp-Aware Self-Scheduling 训练策略解决了稀疏 query 时间戳分配的监督难题:预训练阶段模型通过统计匹配自动学出 query 的时间戳归属,端到端阶段动态更新,相比人工指定方案训练时间减半(12h vs 22h)且精度更高。
  • 推理速度 8.0 FPS,相对 PreWorld 的 1.0 FPS 提升约 8 倍(论文摘要口径为”约 7 倍”)。
  • 作者自述局限(Conclusion/Limitations 部分):SparseWorld 的几何推理能力(IoU 指标)仍有较大提升空间;对未见场景的泛化能力有待进一步验证。作者同时指出该框架不依赖稠密占据标注,未来计划探索弱监督训练方案(仅用激光雷达点云+2D 标签),并计划引入大语言模型以获得更强的复杂场景推理能力——这一方向已在后续工作 SparseOccVLA(2026/1,arXiv:2601.06474)中落地。

原始链接

一手源存档(sources/)

  • sparseworld-4d-occupancy—github-readme — GitHub README 快照(作者/单位、AAAI 2026 接收与发布时间线、Model Zoo 训练硬件说明、致谢、BibTeX,含后续工作 SparseOccVLA 预告),来源 https://github.com/MSunDYY/SparseWorld
  • 论文全文:arXiv:2510.17482(arXiv 原文 HTML,不入 git;正文数字取自 v1 版全文,含 Methodology/Experiments/Ablation 全部小节)