一句话定位
SparseWorld(AAAI 2026)用一组数量固定(1040 个)的可学习稀疏动态 query 取代传统占据世界模型的稠密体素网格:query 自带 4D 坐标(x,y,z,时间戳),感知阶段按自车历史轨迹自适应缩放感知范围,预测阶段把”逐体素分类”换成对 query 位置的连续回归迁移,在 Occ3D-nuScenes 上相对 PreWorld 取得 20%–40% mIoU 提升、碰撞率减半、推理速度提升约 7 倍。
背景与定位
占据世界模型此前大致有两条路线:一是以 occworld 为代表的”感知-预测解耦”范式——先把每帧占据观测各自编码成隐向量,再用一个世界模型对隐向量做自回归预测,最后解码回占据,这类方法梯度在编码-预测-解码之间断开,且编解码过程本身会丢信息;二是近期的”栅格特征”范式(论文点名 PreWorld、AAAI2025 的”Driving in the Occupancy World”即 drive-occworld 一脉),用感知阶段的体素/BEV 特征直接作为世界模型的中间表征做逐体素”原位分类”式预测,实现端到端优化,但这种静态、原位分类的操作与自车运动和场景动态的连续性存在错位,导致时序不一致、特征漂移和误差累积;且两条路线都依赖人工预定义的固定感知范围,无法随车速动态调整,稠密网格也带来显著的存储和计算开销。
SparseWorld 受近期稀疏占据感知模型(OPUS、Liu et al. 2024 的 Fully Sparse 3D Occupancy Prediction)启发,提出”先感知后预测”(perceive-then-forecast)的全稀疏范式:用稀疏动态 query 在当前时刻自适应构建扩展范围的占据表征,再把未来运动建模为相对自车的连续回归,而非在静态网格上做分类。
模型架构
整体由四部分组成:通用图像 backbone(多帧多尺度特征)→ Range-Adaptive Perception 模块(RAP,L 个解码层)→ State-Conditioned Forecasting 模块(SCF)→ 两个并行解码头(占据预测 + 运动规划)。
Range-Adaptive Perception(RAP):
- 输入是可学习 query embedding 及其对应的 4D 坐标(x, y, z, 时间戳)。
- Adaptive Scaling 子模块:编码历史自车路点
{w^i}_{i=-p}^0(隐含反映当前速度)经 MLP 得到缩放因子γ=[γx,γy,γz],逐元素调制初始 query 坐标p'_i = γ ⊙ p_i,实现”车速越快、感知范围越大”的自适应缩放(消融显示纵向 vx 值域比横向 vy 更大且恒为正,γx 对 vx 更敏感——符合驾驶直觉)。 - Temporal-Spatial Multi-Head Self-Attention(TS-MHSA):注意力分数由三部分构成——语义相似度
q_i^T q_j、空间邻近度-τ_i‖p_i-p_j‖²(τ_i 为受 SparseBEV 启发的可学习空间偏置缩放因子)、时间因果掩码M_ij(仅允许 t_i ≥ t_j 的 query 互相看到,避免未来 query 干扰当前帧补全)。 - 解码器采用由粗到精范式:每层输出的每 query 点数逐层递增(1, 4, 16, 24, 32, 48),query 位置按输出点均值逐层更新,每层输出都单独监督。
- query 数量按 7 个时间步(当前 + 未来 6 帧)划分为 (720, 60, 60, 60, 60, 40, 40),共 1040 个初始 query。
State-Conditioned Forecasting(SCF):
- 自车 query
q^t与同时刻场景 queryQ^t做空间交叉注意力,注意力权重A^t_i = (q^t)^T q_i^t - τ_i^t ‖p_i^t‖²(τ_i^t 由 MLP 从q_i^t学出)。 - 下一帧场景表征通过拼接 + 4D 位置编码 + 自车 query 广播得到:
Q̂^{t+1} = [Q̂^t, Q^{t+1}] + PE([P^t,P^{t+1}]) + repeat(q^{t+1}),递归自回归执行;q^t同步解码用于规划。 - 核心思想是把逐体素”原位分类”换成对 query 位置的回归式偏移,与场景连续演化对齐。
图像 backbone:ResNet-50,输入分辨率 256×704。
数据
- 数据集:Occ3D-nuScenes(基于 nuScenes),700 个训练场景 + 150 个验证场景,每段 20 秒,标注间隔 0.5 秒。密集标签分辨率 200×200×16(体素尺寸 0.4m×0.4m×0.4m),17 语义类 + 1 自由类。
- 输入/预测窗口:当前及过去 2 秒视频帧作为输入,预测未来 3 秒的占据与自车轨迹。
- 动作/轨迹标签:来自 nuScenes 自身自车路点标注。
- Timestamp-Aware Self-Scheduling 用的伪 GT 构造:把未来 f 帧的占据 GT 稀疏化为 3D 占据体素坐标点云,通过坐标变换统一到当前时刻坐标系后合并、再体素化,得到融合多帧的 GT 点云
Ĝ,用于对 RAP 输出的 query 位置做 Chamfer distance 监督。 - 无额外采集数据、无 sim-to-real、无跨模态 co-training;沿用 Occ3D-nuScenes 官方数据切分,可见性 mask 在训练和推理中均未使用。
训练方法
两阶段训练(Timestamp-Aware Self-Scheduling):
- 论文指出直接给 query 分配时间戳有两个朴素方案的失败模式:(1) 人工手动指定时间戳并逐帧显式监督——相邻帧空间重叠导致监督信号失效;(2) 忽略时间区分、让所有 query 预测所有未来帧——训练收敛冲突、性能下降。
- 阶段一(预训练,6 epoch):暂时去掉 TS-MHSA 里的时间掩码项,不显式指定 query 时间戳,仅用
L_pretrain = CD(P'_0, Ĝ) + Σ_l (CD(P_l, Ĝ) + L_focal(C_l, C_g))预训练 RAP(Chamfer distance + Focal loss 监督语义)。 - 训练过程中维护一个统计矩阵
M ∈ R^{N×(f+1)},记录每个 query 匹配到各时间戳 GT 点的次数(点匹配基于 Chamfer distance 的最近邻关系,重体素化时一个体素可能对应多个时间戳);基于 M 用”最大占比优先分配算法”(细节见附录)为每个 query 动态分配时间戳归属。 - 阶段二(端到端训练,48 epoch):统计矩阵 M 和 query 时间戳每个 epoch 动态更新,总损失
L_total = L_pretrain + Σ_t (λ1 CD(P^t,Ĝ^t) + λ2 L_focal(C^t,Ĉ^t) + λ3 L_2(w^t,ŵ^t)),用 Chamfer distance 监督占据、L2 loss 监督轨迹。 - 推理阶段 query 时间戳固定,不再执行动态分配过程,保证推理效率。
- 优化器:AdamW,学习率 2e-4,warm-up + cosine annealing。
- 消融对比显示:该策略相比”无时间区分”(mIoU 11.82 vs 10.95,训练 12h vs 11h) 和”人工手动指定时间戳”(mIoU 11.82 vs 11.37,训练 12h vs 22h,因需 L×f 次 Chamfer distance 计算) 均更优——省时且效果更好(Table 5)。
Infra(训练 / 推理工程)
- 论文正文实验(Table 1/2 主结果)训练硬件:4 张 NVIDIA A100 GPU,总 batch size 8;推理速度测于 4090 GPU,达 8.0 FPS(PreWorld 为 1.0 FPS,约 8 倍提升;论文摘要/引言称”约 7 倍加速”)。
- GitHub 发布的最终 checkpoint(SparseWorld-R50,2025/12/20 发布)训练硬件:8 张 NVIDIA H20 GPU;据 README 称训练实际仅占用约 17GB 显存,可在 RTX 4090 等消费级 GPU 上复现。
- GPU-hours、并行策略(DP/DDP/FSDP)、训练精度(fp16/bf16/fp32)均未披露。
- 消融实验的训练耗时(Table 5,推测同为 4×A100 环境):完整 Temporal-Aware Self-Scheduling 训练需 12 小时,“无时间区分”需 11 小时,“人工指定时间戳”因 L×f 次 Chamfer distance 计算需 22 小时。
评测 benchmark
Occ3D-nuScenes,输入当前+过去 2 秒,预测未来 3 秒占据与轨迹。以下数字均取自论文正文 Table 1/2(对比结果均引自原论文,非复现)。
4D 占据预测(Table 1,mIoU / IoU 分 1s/2s/3s/Avg):
| 方法 | 辅助监督 | mIoU@1s | @2s | @3s | Avg | IoU@1s | @2s | @3s | Avg | FPS |
|---|---|---|---|---|---|---|---|---|---|---|
| OccWorld-T | Semantic LiDAR | 4.68 | 3.36 | 2.63 | 3.56 | 9.32 | 8.23 | 7.47 | 8.34 | - |
| OccWorld-D | 3D Occ | 11.55 | 8.66 | 6.98 | 8.66 | 18.90 | 16.26 | 14.43 | 16.53 | - |
| OccLLaMA-F | 3D Occ | 10.34 | 8.66 | 6.98 | 8.66 | 25.81 | 23.19 | 19.97 | 22.99 | - |
| PreWorld | 3D Occ | 11.69 | 8.72 | 6.77 | 9.06 | 23.01 | 20.79 | 18.84 | 20.88 | 1.0 |
| PreWorld+Pre-training | 2D&3D Occ | 12.27 | 9.24 | 7.15 | 9.55 | 23.62 | 21.76 | 19.63 | 21.62 | 1.0 |
| SparseWorld (Ours) | 3D Occ | 14.93 | 13.15 | 11.51 | 13.20 | 22.96 | 22.10 | 21.05 | 22.03 | 8.0 |
相对 PreWorld,mIoU 提升 20%–40%(论文原文口径),且随预测时长增长,SparseWorld 的分数衰减幅度在所有对比方法中最小。论文自陈在 IoU 指标上无明显优势,并解释:IoU 由背景体素主导(约占 95%,多数不可见),而 SparseWorld 擅长的是前景物体识别。
运动规划(Table 2,L2 / 碰撞率,† 表示训练与推理均使用自车状态):
| 方法 | 辅助监督 | L2@1s | @2s | @3s | Avg | Coll@1s(%) | @2s | @3s | Avg |
|---|---|---|---|---|---|---|---|---|---|
| UniAD | Map&Box&Motion&Track&Occ | 0.48 | 0.96 | 1.65 | 1.03 | 0.05 | 0.17 | 0.71 | 0.31 |
| OccNet | Map&Box&3D Occ | 1.29 | 2.13 | 2.99 | 2.14 | 0.21 | 0.59 | 1.37 | 0.72 |
| OccWorld-D | 3D Occ | 0.52 | 1.27 | 2.41 | 1.40 | 0.12 | 0.40 | 2.08 | 0.87 |
| OccLLaMA-F† | 3D Occ | 0.38 | 1.07 | 2.15 | 1.20 | 0.06 | 0.39 | 1.65 | 0.70 |
| PreWorld | 2D&3D Occ | 0.41 | 1.16 | 2.32 | 1.30 | 0.50 | 0.88 | 2.42 | 1.27 |
| PreWorld† | 2D&3D Occ | 0.22 | 0.30 | 0.40 | 0.31 | 0.21 | 0.66 | 0.71 | 0.53 |
| SparseWorld (Ours) | 3D Occ | 0.49 | 0.94 | 1.47 | 0.97 | 0.18 | 0.78 | 1.88 | 0.95 |
| SparseWorld† (Ours) | 3D Occ | 0.19 | 0.25 | 0.36 | 0.27 | 0.11 | 0.29 | 0.46 | 0.29 |
论文正文称”SparseWorld 的碰撞率始终只有 PreWorld 的一半”(原文表述),但逐列核对:不用自车状态时 SparseWorld 碰撞率 Avg 0.95% vs PreWorld Avg 1.27%(约为 3/4,非严格一半,1s/2s/3s 各档比值也不一致);加入自车状态后 SparseWorld† Avg 0.29% vs PreWorld† Avg 0.53%,比值约 0.55,更接近论文所称的”减半”。加入自车状态后 SparseWorld† 各项指标均为对比方法中最优或次优。
消融(均在 6 epoch 预训练 + 12 epoch 端到端训练的缩短配置上做,Avg 取未来 3 秒):
- 核心组件消融(Table 3,baseline mIoU 11.82 / IoU 21.17):去掉 Adaptive Scaling → mIoU 11.45(-0.37);去掉 Temporal mask → 11.52(-0.30);去掉 4D PE → 11.58(-0.24);去掉 State Condition → 11.31(-0.51,降幅最大)。
- 自车状态 + 空间交叉注意力消融(Table 4):有自车状态+空间交叉注意力 → L2 0.29m / 碰撞率 0.37% / mIoU 11.82(最优);无自车状态+空间交叉注意力 → L2 1.01m / 碰撞率 0.65% / mIoU 10.64;有自车状态+普通交叉注意力 → L2 0.31m / 碰撞率 0.44% / mIoU 11.71;无自车状态+普通交叉注意力 → L2 1.25m / 碰撞率 0.77% / mIoU 10.28(最差)。空间调制在缺失自车状态输入时收益尤其明显。
- 训练策略消融(Table 5):Temporal-Aware Self-Scheduling mIoU 11.82 / IoU 21.17 / 12h;无时间区分 10.95 / 20.08 / 11h;人工指定时间戳 11.37 / 20.31 / 22h。
创新点与影响
- 把占据世界模型从”稠密网格 + 原位分类”转向”稀疏动态 query + 连续回归”,用单一统一表征(query)同时承载感知与预测,避免了解耦范式的梯度断裂问题,也避免了栅格范式的静态分类与场景连续性错位。
- Adaptive Scaling 让感知范围随自车历史轨迹(隐含速度)自适应缩放,作者用 γ 值热力图验证了其学到的”纵向感知范围应更大”的驾驶先验与直觉相符。
- Timestamp-Aware Self-Scheduling 训练策略解决了稀疏 query 时间戳分配的监督难题:预训练阶段模型通过统计匹配自动学出 query 的时间戳归属,端到端阶段动态更新,相比人工指定方案训练时间减半(12h vs 22h)且精度更高。
- 推理速度 8.0 FPS,相对 PreWorld 的 1.0 FPS 提升约 8 倍(论文摘要口径为”约 7 倍”)。
- 作者自述局限(Conclusion/Limitations 部分):SparseWorld 的几何推理能力(IoU 指标)仍有较大提升空间;对未见场景的泛化能力有待进一步验证。作者同时指出该框架不依赖稠密占据标注,未来计划探索弱监督训练方案(仅用激光雷达点云+2D 标签),并计划引入大语言模型以获得更强的复杂场景推理能力——这一方向已在后续工作 SparseOccVLA(2026/1,arXiv:2601.06474)中落地。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2510.17482
- arXiv PDF:https://arxiv.org/pdf/2510.17482
- GitHub(代码 + 训练/评测文档 + Model Zoo):https://github.com/MSunDYY/SparseWorld
- HuggingFace 模型仓库(checkpoint + 训练日志,无独立 model card):https://huggingface.co/MSunDYY2001/SparseWorld
一手源存档(sources/)
- sparseworld-4d-occupancy—github-readme — GitHub README 快照(作者/单位、AAAI 2026 接收与发布时间线、Model Zoo 训练硬件说明、致谢、BibTeX,含后续工作 SparseOccVLA 预告),来源 https://github.com/MSunDYY/SparseWorld
- 论文全文:arXiv:2510.17482(arXiv 原文 HTML,不入 git;正文数字取自 v1 版全文,含 Methodology/Experiments/Ablation 全部小节)