一句话定位
I²-World(ICCV 2025,西安交通大学)把占据世界模型的场景 tokenizer 拆成”场内(intra-scene)多尺度残差量化”+“场间(inter-scene)时序残差量化”两个轻量模块,用 G+S 层卷积就在保持 3D tokenizer 压缩率的同时获得 4D tokenizer 的时序建模能力;配合编码器-解码器结构的 I²-Former(用变换矩阵而非轨迹做条件),在 Occ3D-nuScenes 上把 4D 占据预测的 SOTA 提升 25.1% mIoU / 36.9% IoU,训练仅需 2.9GB 显存,推理达 37.0 FPS(RTX 4090)。
背景与定位
占据世界模型的 tokenizer 此前分两条路线:一条是 occworld 代表的 3D tokenizer 路线——每帧占据各自压缩成高度紧凑的隐向量,压缩率高但因逐帧独立编码而无法显式建模时序动态,只能靠简单堆叠隐向量 + 昂贵的时空注意力(如 occworld、DFIT-OccWorld、dome-occupancy-world-model)来补偿;另一条是 4D tokenizer 路线(OccSora、DOME 的扩散式变体),直接把时空信息一起编码进 token,时序表达力更强,但产生的高维 token 对下游自回归 Transformer 或扩散模型造成显著算力开销,难以用于低延迟的自动驾驶场景。I²-World 认为这是一个”压缩率 vs 动态表达力”的固有权衡,提出用显式的 intra/inter 双分支残差量化来同时兼顾两端,而不是靠更大模型堆时空注意力。
在生成端,此前方法(OccWorld、OccLLaMA、DOME 等)多为纯 decoder-only 自回归架构,依赖轨迹(trajectory)做条件;I²-World 的 I²-Former 转而使用编码器-解码器架构,用回归出的 4×4 变换矩阵(而非轨迹点)做逐步生成的空间条件,据作者说这能提供更细粒度、米/弧度级精度的可控生成。
模型架构
整体分两个阶段的组件:I²-Scene Tokenizer(场景压缩)+ I²-Former(自回归预测)。
I²-Scene Tokenizer(VAE 范式训练):
- Encoder/Decoder:沿用 OccWorld 风格。编码器先把 3D 占据
O_t通过”每个语义类别一个可学习 embedding、沿高度维拼接”转成 BEV 表示,再用轻量 ResNet 下采样得到特征图B_t;解码器用带转置卷积的 ResNet 上采样,再按通道切分恢复高度维度、softmax 分类每个体素的占据类别。 - Intra-Scene Tokenization(场内):受 RQ-VAE、VAR 启发,对特征图
B_t做 S 个尺度的分层残差量化:每个尺度先插值到目标分辨率、量化到共享 codebook 最近邻码字,再插值回原分辨率并从残差中减去,逐尺度累加重建,仅需一个学习卷积层φ_s缓解每尺度信息损失。 - Inter-Scene Tokenization(场间):维护 G 帧历史特征图的记忆队列,用 ego-pose 变换矩阵
T把历史特征对齐到当前坐标系,再与 intra 阶段的残差做逐步累加式残差量化(复用同一个共享 codebook),用学习卷积层ψ_g补偿时序聚合损失。 - 相比传统单阶段 tokenizer,I²-Scene Tokenizer 只多引入
G+S个轻量卷积层就同时获得空间细节保真与时序动态建模。 - Codebook:512 个码字,128 维隐特征(Implementation Details 给出)。
- 训练损失:
L_token = L_focal + L_lovasz + L_vq(VQ commitment 系数 β=1,仅对 intra-scene 量化做 codebook 监督,以稳定训练)。
I²-Former(编码器-解码器,非纯 decoder-only):
- Intra-Encoder:用可变形注意力实现的空间自注意力(SSA)在当前时刻 token 图
B̂'_{t+k}内部聚合上下文;同时用多头注意力把由历史自车运动(速度、轨迹)经 MLP 编码出的 plan embeddingP^0与场景 token 交叉融合;按层下采样、默认 L=3 层分层聚合,用轻量 FPN 融合多尺度特征;精炼后的 plan feature 回归出 4×4 变换矩阵 T_{t+k}^{t+k+1}(平移用 L2 loss、旋转用四元数余弦 loss 分别监督),投影进隐空间后加到融合特征图上作为下一步生成的条件。 - Inter-Decoder:标准 Transformer 结构 + SSA + 轻量时序融合(Lightweight Temporal Fusion);维护历史 token 记忆队列
{B̂_t, B̂'_{t+1}, ..., B̂'_{t+k-1}},把历史 token 与当前条件特征沿通道拼接后过一层 MLP 融合(不用重量级交叉注意力或循环模块),输出下一步 token 追加进记忆队列。 - 可控生成两种模式:(1) 高层控制——调节转向/速度等 ego 动作指令;(2) 细粒度控制——直接操纵变换矩阵,实现米/弧度级精度的场景生成。
数据
- 主评测集:Occ3D-nuScenes(源自 nuScenes),600 训练场景 / 150 验证场景;空间范围 x/y∈[-40m,40m]、z∈[-1m,5.4m],体素分辨率 0.4m,采样率 2Hz。
- 泛化评测集:Occ3D-Waymo,202 个验证场景(仅用验证集),空间范围与体素分辨率同 Occ3D-nuScenes,采样率 10Hz。
- 协议:沿用 OccWorld/DFIT-OccWorld/OccLLaMA/DOME 一致的 2 秒历史→3 秒未来预测协议。
- 两种输入配置:I²-World-O 用 ground-truth 3D 占据作为输入;I²-World-STC 用 STCOcc(一个纯视觉的占据预测前端)输出的相机预测占据作为输入,验证端到端相机方案的可行性。
- 无额外真实数据采集、无 sim-to-real 迁移、无跨模态 co-training;数据即标准 Occ3D 占据标注(本身就是自动驾驶场景的稠密体素语义标注)。
- 零样本泛化实验:Waymo 上做零样本迁移测试(不在 Waymo 上训练),验证方法作为自动标注(auto-labeling)工具的潜力。
训练方法
- 两阶段训练:Stage 1 用 VAE 范式训练 I²-Scene Tokenizer(24 epoch);Stage 2 冻结 tokenizer、训练 I²-Former 做动态迁移建模(48 epoch)。
- 优化器:AdamW,基础学习率 1×10⁻³,全局 batch size 128。
- I²-Former 生成损失:对预测 token
B̂'_{t+k}与 tokenizer 编出的真值 tokenB̂_{t+k}做 MSE,按时间步加权w_k(抑制误差累积对训练的影响);变换矩阵损失把 4×4 矩阵拆成平移(L2)+ 四元数旋转(余弦损失)分别监督。 - 评估协议:用 ground-truth 变换矩阵引导生成(评估阶段不做变换矩阵自回归预测误差的传导,聚焦评估占据 token 预测本身)。
- Copy-Paste 基线(用于 Waymo 泛化对比):直接用当前帧重建结果作为未来帧预测,作为最朴素的”零动态假设”基线。
Infra(训练 / 推理工程)
- 训练显存:I²-Former 完整模型训练仅需 2.92 GB(消融 Table 4 最后一行,对应论文摘要宣称的”2.9GB”);仅 Trans+Rotate 条件、无 Intra-Encoder 时更低至 1.81 GB,加入 Intra-Encoder 后升至 3.74 GB,加入多尺度(MS)策略后降为 2.92 GB。
- 训练硬件(GitHub README 披露):8× RTX 4090 GPU 训练 I²-Scene Tokenizer 与 I²-Former;用 6 张 GPU 做 II-Tokenizer 评估(README 强调评估用的 GPU 数须能整除 150 个验证场景数)。
- GPU-hours、并行策略(DP/DDP/FSDP)、训练精度(fp16/bf16/fp32):均未披露。
- 推理 FPS(论文 Table 1,测于 RTX 4090,FPS 计算方法沿用 OccWorld 协议):I²-World-O 37.04 FPS;I²-World-STC(端到端相机输入)4.21 FPS。作为对比,DOME 为 6.54 FPS,OccWorld-O 为 18.00 FPS。
评测 benchmark
以下数字均取自论文 Table 1–4 原文(对比 baseline 数字均为原论文引用,非本文复现)。
Occ3D-nuScenes 4D 占据预测(Table 1,mIoU/IoU 单位 %,Recon./1s/2s/3s/Avg):
| 方法 | 输入 | mIoU Recon | 1s | 2s | 3s | Avg | IoU Recon | 1s | 2s | 3s | Avg | FPS |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| OccWorld-O | Occ | 66.38 | 25.78 | 15.14 | 10.51 | 17.14 | 62.29 | 34.63 | 25.07 | 20.18 | 26.63 | 18.00 |
| OccLLaMA-O | Occ&Text | 75.20 | 25.05 | 19.49 | 15.26 | 19.93 | 63.79 | 34.56 | 28.53 | 24.41 | 29.17 | - |
| Occ-LLM | Occ&Text | - | 24.02 | 21.65 | 17.29 | 20.99 | - | 36.65 | 32.14 | 28.77 | 32.52 | - |
| DFIT-OccWorld | Occ&Camera | - | 31.68 | 21.29 | 15.19 | 22.71 | - | 40.28 | 31.24 | 25.29 | 32.27 | - |
| DOME | Occ | 83.08 | 35.11 | 25.89 | 20.29 | 27.10 | 77.25 | 43.99 | 35.36 | 29.74 | 36.36 | 6.54 |
| UniScene | Occ | 92.10 | 35.37 | 29.59 | 25.08 | 31.76 | 87.00 | 38.34 | 32.70 | 29.09 | 34.84 | - |
| I²-World-O(本文) | Occ | 81.22 | 47.62 | 38.58 | 32.98 | 39.73 | 68.30 | 54.29 | 49.43 | 45.69 | 49.80 | 37.04 |
| OccWorld-STC | Camera | 23.63 | 10.97 | 15.16 | 10.19 | 7.53 | 31.20 | 20.68 | 24.81 | 20.09 | 17.14 | 3.77 |
| DOME-STC | Camera | 25.30 | 17.79 | 14.23 | 11.58 | 14.53 | 33.15 | 26.39 | 23.20 | 20.42 | 23.33 | 2.75 |
| I²-World-STC(本文) | Camera | 25.13 | 21.67 | 18.78 | 16.47 | 18.97 | 32.66 | 30.55 | 28.76 | 26.99 | 28.77 | 4.21 |
- I²-World-O 相对此前最佳(mIoU 对比 UniScene 31.76、IoU 对比 DOME 36.36)提升 25.1% mIoU / 36.9% IoU;论文原文另称端到端 I²-World-STC 相对此前最佳基线提升 50.9% mIoU(18.97 vs. 12.57)/ 40.9% IoU(28.77 vs. 20.41)——这两个对照数字(12.57/20.41)与上表 STC 组 Avg 列(OccWorld-STC 7.53/17.14,DOME-STC 14.53/23.33)不完全吻合,原文未说明取值口径,此处如实转录论文正文表述,未做修正或外推。
Occ3D-Waymo 零样本泛化(Table 2):
| 方法 | 采样率 | 重建 mIoU | 重建 IoU | 预测 mIoU | 预测 IoU |
|---|---|---|---|---|---|
| Copy-Paste | 10Hz | 76.27 | 74.62 | 28.34 | 40.09 |
| I²-World | 10Hz | 76.27 | 74.62 | 43.73 | 60.97 |
| Copy-Paste | 2Hz | 76.27 | 74.62 | 17.17 | 28.21 |
| I²-World | 2Hz | 76.27 | 74.62 | 36.38 | 52.36 |
I²-Scene Tokenizer 消融(Table 3,均为重建指标):baseline(单尺度 tokenizer,无 Inter-Scene)66.52/61.07 mIoU/IoU → +Inter-Scene(w/o Align) 70.37/62.18(+5.7%/+1.8% 相对基线)→ +Inter-Scene(w Align) 77.12/64.20(+15.9%/+5.1% 相对基线)→ 完整版(w Align + 多尺度 Intra-Scene)81.22/68.30。
I²-Former 消融(Table 4,均为预测指标,Mem 为训练显存):无条件基线 17.12/27.75 mIoU/IoU(Mem 1.81GB)→ 仅平移条件 28.74/36.44(相对基线 +67.8%/+31.4%)→ 仅旋转条件 20.34/29.23(相对基线 +18.7%/+5.4%)→ 平移+旋转 34.25/42.71(Mem 1.81GB)→ +时序融合(TF) 35.21/43.32(Mem 2.03GB)→ +Intra-Encoder 36.73/46.84(Mem 3.74GB)→ +多尺度(MS) 39.73/49.80(Mem 回落至 2.92GB,相对”平移+旋转”行 +16.0%/+16.6%)。
创新点与影响
- 贡献:把占据世界模型的 tokenizer 显式拆成 intra-scene(空间多尺度残差量化)与 inter-scene(时序残差量化)两个正交、可插拔模块,用极少的额外卷积层(
G+S层)就同时获得 3D tokenizer 的压缩效率与 4D tokenizer 的时序表达力;I²-Former 摒弃纯 decoder-only 范式,改用编码器-解码器结构、以回归出的 4×4 变换矩阵(而非轨迹)作为逐步生成的显式空间条件,兼具更高精度与更细粒度可控性。 - 影响:在 Occ3D-nuScenes 上以远低于 LLM/扩散模型方案的算力代价(训练仅 2.9GB 显存)刷新 4D 占据预测 SOTA,且推理达到 37 FPS 的实时水平;在 Occ3D-Waymo 上的零样本泛化结果显示其有作为自动标注(auto-labeling)工具的潜力。
- 论文自陈局限:细粒度变换矩阵控制在训练分布之外的场景(如倒车,对应的变换矩阵在训练集中未出现)会失效,产生不真实的静态智能体行为;作者认为可通过在数据集中丰富变换矩阵的分布来缓解。
原始链接
- arXiv: https://arxiv.org/abs/2507.09144
- PDF: https://arxiv.org/pdf/2507.09144
- GitHub: https://github.com/lzzzzzm/II-World
- HF Papers 页: https://huggingface.co/papers/2507.09144
一手源存档(sources/)
- i2-world-tokenization—github-readme — GitHub README 快照(8×RTX4090 训练硬件、codebook/权重、Model Zoo),来源 https://github.com/lzzzzzm/II-World
- i2-world-tokenization—hf-papers — HF Papers 镜像页快照(摘要与作者信息),来源 https://huggingface.co/papers/2507.09144
- 论文全文:arXiv:2507.09144(arXiv 原文 HTML,不入 git;正文数字取自全文 Method/Experiments/Ablation 全部小节)