一句话定位

I²-World(ICCV 2025,西安交通大学)把占据世界模型的场景 tokenizer 拆成”场内(intra-scene)多尺度残差量化”+“场间(inter-scene)时序残差量化”两个轻量模块,用 G+S 层卷积就在保持 3D tokenizer 压缩率的同时获得 4D tokenizer 的时序建模能力;配合编码器-解码器结构的 I²-Former(用变换矩阵而非轨迹做条件),在 Occ3D-nuScenes 上把 4D 占据预测的 SOTA 提升 25.1% mIoU / 36.9% IoU,训练仅需 2.9GB 显存,推理达 37.0 FPS(RTX 4090)。

背景与定位

占据世界模型的 tokenizer 此前分两条路线:一条是 occworld 代表的 3D tokenizer 路线——每帧占据各自压缩成高度紧凑的隐向量,压缩率高但因逐帧独立编码而无法显式建模时序动态,只能靠简单堆叠隐向量 + 昂贵的时空注意力(如 occworld、DFIT-OccWorld、dome-occupancy-world-model)来补偿;另一条是 4D tokenizer 路线(OccSora、DOME 的扩散式变体),直接把时空信息一起编码进 token,时序表达力更强,但产生的高维 token 对下游自回归 Transformer 或扩散模型造成显著算力开销,难以用于低延迟的自动驾驶场景。I²-World 认为这是一个”压缩率 vs 动态表达力”的固有权衡,提出用显式的 intra/inter 双分支残差量化来同时兼顾两端,而不是靠更大模型堆时空注意力。

在生成端,此前方法(OccWorld、OccLLaMA、DOME 等)多为纯 decoder-only 自回归架构,依赖轨迹(trajectory)做条件;I²-World 的 I²-Former 转而使用编码器-解码器架构,用回归出的 4×4 变换矩阵(而非轨迹点)做逐步生成的空间条件,据作者说这能提供更细粒度、米/弧度级精度的可控生成。

模型架构

整体分两个阶段的组件:I²-Scene Tokenizer(场景压缩)+ I²-Former(自回归预测)。

I²-Scene Tokenizer(VAE 范式训练):

  • Encoder/Decoder:沿用 OccWorld 风格。编码器先把 3D 占据 O_t 通过”每个语义类别一个可学习 embedding、沿高度维拼接”转成 BEV 表示,再用轻量 ResNet 下采样得到特征图 B_t;解码器用带转置卷积的 ResNet 上采样,再按通道切分恢复高度维度、softmax 分类每个体素的占据类别。
  • Intra-Scene Tokenization(场内):受 RQ-VAE、VAR 启发,对特征图 B_t 做 S 个尺度的分层残差量化:每个尺度先插值到目标分辨率、量化到共享 codebook 最近邻码字,再插值回原分辨率并从残差中减去,逐尺度累加重建,仅需一个学习卷积层 φ_s 缓解每尺度信息损失。
  • Inter-Scene Tokenization(场间):维护 G 帧历史特征图的记忆队列,用 ego-pose 变换矩阵 T 把历史特征对齐到当前坐标系,再与 intra 阶段的残差做逐步累加式残差量化(复用同一个共享 codebook),用学习卷积层 ψ_g 补偿时序聚合损失。
  • 相比传统单阶段 tokenizer,I²-Scene Tokenizer 只多引入 G+S 个轻量卷积层就同时获得空间细节保真与时序动态建模。
  • Codebook:512 个码字,128 维隐特征(Implementation Details 给出)。
  • 训练损失:L_token = L_focal + L_lovasz + L_vq(VQ commitment 系数 β=1,仅对 intra-scene 量化做 codebook 监督,以稳定训练)。

I²-Former(编码器-解码器,非纯 decoder-only):

  • Intra-Encoder:用可变形注意力实现的空间自注意力(SSA)在当前时刻 token 图 B̂'_{t+k} 内部聚合上下文;同时用多头注意力把由历史自车运动(速度、轨迹)经 MLP 编码出的 plan embedding P^0 与场景 token 交叉融合;按层下采样、默认 L=3 层分层聚合,用轻量 FPN 融合多尺度特征;精炼后的 plan feature 回归出 4×4 变换矩阵 T_{t+k}^{t+k+1}(平移用 L2 loss、旋转用四元数余弦 loss 分别监督),投影进隐空间后加到融合特征图上作为下一步生成的条件。
  • Inter-Decoder:标准 Transformer 结构 + SSA + 轻量时序融合(Lightweight Temporal Fusion);维护历史 token 记忆队列 {B̂_t, B̂'_{t+1}, ..., B̂'_{t+k-1}},把历史 token 与当前条件特征沿通道拼接后过一层 MLP 融合(不用重量级交叉注意力或循环模块),输出下一步 token 追加进记忆队列。
  • 可控生成两种模式:(1) 高层控制——调节转向/速度等 ego 动作指令;(2) 细粒度控制——直接操纵变换矩阵,实现米/弧度级精度的场景生成。

数据

  • 主评测集:Occ3D-nuScenes(源自 nuScenes),600 训练场景 / 150 验证场景;空间范围 x/y∈[-40m,40m]、z∈[-1m,5.4m],体素分辨率 0.4m,采样率 2Hz
  • 泛化评测集:Occ3D-Waymo,202 个验证场景(仅用验证集),空间范围与体素分辨率同 Occ3D-nuScenes,采样率 10Hz
  • 协议:沿用 OccWorld/DFIT-OccWorld/OccLLaMA/DOME 一致的 2 秒历史→3 秒未来预测协议。
  • 两种输入配置:I²-World-O 用 ground-truth 3D 占据作为输入;I²-World-STC 用 STCOcc(一个纯视觉的占据预测前端)输出的相机预测占据作为输入,验证端到端相机方案的可行性。
  • 无额外真实数据采集、无 sim-to-real 迁移、无跨模态 co-training;数据即标准 Occ3D 占据标注(本身就是自动驾驶场景的稠密体素语义标注)。
  • 零样本泛化实验:Waymo 上做零样本迁移测试(不在 Waymo 上训练),验证方法作为自动标注(auto-labeling)工具的潜力。

训练方法

  • 两阶段训练:Stage 1 用 VAE 范式训练 I²-Scene Tokenizer(24 epoch);Stage 2 冻结 tokenizer、训练 I²-Former 做动态迁移建模(48 epoch)。
  • 优化器:AdamW,基础学习率 1×10⁻³,全局 batch size 128
  • I²-Former 生成损失:对预测 token B̂'_{t+k} 与 tokenizer 编出的真值 token B̂_{t+k} 做 MSE,按时间步加权 w_k(抑制误差累积对训练的影响);变换矩阵损失把 4×4 矩阵拆成平移(L2)+ 四元数旋转(余弦损失)分别监督。
  • 评估协议:用 ground-truth 变换矩阵引导生成(评估阶段不做变换矩阵自回归预测误差的传导,聚焦评估占据 token 预测本身)。
  • Copy-Paste 基线(用于 Waymo 泛化对比):直接用当前帧重建结果作为未来帧预测,作为最朴素的”零动态假设”基线。

Infra(训练 / 推理工程)

  • 训练显存:I²-Former 完整模型训练仅需 2.92 GB(消融 Table 4 最后一行,对应论文摘要宣称的”2.9GB”);仅 Trans+Rotate 条件、无 Intra-Encoder 时更低至 1.81 GB,加入 Intra-Encoder 后升至 3.74 GB,加入多尺度(MS)策略后降为 2.92 GB。
  • 训练硬件(GitHub README 披露):8× RTX 4090 GPU 训练 I²-Scene Tokenizer 与 I²-Former;用 6 张 GPU 做 II-Tokenizer 评估(README 强调评估用的 GPU 数须能整除 150 个验证场景数)。
  • GPU-hours、并行策略(DP/DDP/FSDP)、训练精度(fp16/bf16/fp32):均未披露。
  • 推理 FPS(论文 Table 1,测于 RTX 4090,FPS 计算方法沿用 OccWorld 协议):I²-World-O 37.04 FPS;I²-World-STC(端到端相机输入)4.21 FPS。作为对比,DOME 为 6.54 FPS,OccWorld-O 为 18.00 FPS。

评测 benchmark

以下数字均取自论文 Table 1–4 原文(对比 baseline 数字均为原论文引用,非本文复现)。

Occ3D-nuScenes 4D 占据预测(Table 1,mIoU/IoU 单位 %,Recon./1s/2s/3s/Avg)

方法输入mIoU Recon1s2s3sAvgIoU Recon1s2s3sAvgFPS
OccWorld-OOcc66.3825.7815.1410.5117.1462.2934.6325.0720.1826.6318.00
OccLLaMA-OOcc&Text75.2025.0519.4915.2619.9363.7934.5628.5324.4129.17-
Occ-LLMOcc&Text-24.0221.6517.2920.99-36.6532.1428.7732.52-
DFIT-OccWorldOcc&Camera-31.6821.2915.1922.71-40.2831.2425.2932.27-
DOMEOcc83.0835.1125.8920.2927.1077.2543.9935.3629.7436.366.54
UniSceneOcc92.1035.3729.5925.0831.7687.0038.3432.7029.0934.84-
I²-World-O(本文)Occ81.2247.6238.5832.9839.7368.3054.2949.4345.6949.8037.04
OccWorld-STCCamera23.6310.9715.1610.197.5331.2020.6824.8120.0917.143.77
DOME-STCCamera25.3017.7914.2311.5814.5333.1526.3923.2020.4223.332.75
I²-World-STC(本文)Camera25.1321.6718.7816.4718.9732.6630.5528.7626.9928.774.21
  • I²-World-O 相对此前最佳(mIoU 对比 UniScene 31.76、IoU 对比 DOME 36.36)提升 25.1% mIoU / 36.9% IoU;论文原文另称端到端 I²-World-STC 相对此前最佳基线提升 50.9% mIoU(18.97 vs. 12.57)/ 40.9% IoU(28.77 vs. 20.41)——这两个对照数字(12.57/20.41)与上表 STC 组 Avg 列(OccWorld-STC 7.53/17.14,DOME-STC 14.53/23.33)不完全吻合,原文未说明取值口径,此处如实转录论文正文表述,未做修正或外推。

Occ3D-Waymo 零样本泛化(Table 2)

方法采样率重建 mIoU重建 IoU预测 mIoU预测 IoU
Copy-Paste10Hz76.2774.6228.3440.09
I²-World10Hz76.2774.6243.7360.97
Copy-Paste2Hz76.2774.6217.1728.21
I²-World2Hz76.2774.6236.3852.36

I²-Scene Tokenizer 消融(Table 3,均为重建指标):baseline(单尺度 tokenizer,无 Inter-Scene)66.52/61.07 mIoU/IoU → +Inter-Scene(w/o Align) 70.37/62.18(+5.7%/+1.8% 相对基线)→ +Inter-Scene(w Align) 77.12/64.20(+15.9%/+5.1% 相对基线)→ 完整版(w Align + 多尺度 Intra-Scene)81.22/68.30

I²-Former 消融(Table 4,均为预测指标,Mem 为训练显存):无条件基线 17.12/27.75 mIoU/IoU(Mem 1.81GB)→ 仅平移条件 28.74/36.44(相对基线 +67.8%/+31.4%)→ 仅旋转条件 20.34/29.23(相对基线 +18.7%/+5.4%)→ 平移+旋转 34.25/42.71(Mem 1.81GB)→ +时序融合(TF) 35.21/43.32(Mem 2.03GB)→ +Intra-Encoder 36.73/46.84(Mem 3.74GB)→ +多尺度(MS) 39.73/49.80(Mem 回落至 2.92GB,相对”平移+旋转”行 +16.0%/+16.6%)。

创新点与影响

  • 贡献:把占据世界模型的 tokenizer 显式拆成 intra-scene(空间多尺度残差量化)与 inter-scene(时序残差量化)两个正交、可插拔模块,用极少的额外卷积层(G+S 层)就同时获得 3D tokenizer 的压缩效率与 4D tokenizer 的时序表达力;I²-Former 摒弃纯 decoder-only 范式,改用编码器-解码器结构、以回归出的 4×4 变换矩阵(而非轨迹)作为逐步生成的显式空间条件,兼具更高精度与更细粒度可控性。
  • 影响:在 Occ3D-nuScenes 上以远低于 LLM/扩散模型方案的算力代价(训练仅 2.9GB 显存)刷新 4D 占据预测 SOTA,且推理达到 37 FPS 的实时水平;在 Occ3D-Waymo 上的零样本泛化结果显示其有作为自动标注(auto-labeling)工具的潜力。
  • 论文自陈局限:细粒度变换矩阵控制在训练分布之外的场景(如倒车,对应的变换矩阵在训练集中未出现)会失效,产生不真实的静态智能体行为;作者认为可通过在数据集中丰富变换矩阵的分布来缓解。

原始链接

一手源存档(sources/)