一句话定位
GaussianDWM(CVPR 2026 收录)用语言增强的 3D 高斯(3DGS)同时做驾驶场景理解(VQA / 2D&3D 视觉定位 / 规划)与生成(RGB-D 视频):把 CLIP 语言特征直接挂在每个高斯基元上实现「文本-3D」的显式空间对齐,再用任务感知的混合采样(全局 top-k+uniform 采样 vs. 语言引导的 cross-attention 稀疏采样)把百万级高斯压到 4096 个 token 喂给 Qwen3-8B;VLM 抽出的高层语言特征再和低层点云投影条件一起,双条件引导扩散 UNet 做时空场景生成。
背景与定位
驾驶世界模型(DWM)此前分裂成两条线:一条只做生成(预测图像 / 点云演化,如 drivedreamer、magicdrive、GAIA-1),难以被查询、解释;另一条是把 VLM 接到驾驶场景做理解(VQA、视觉定位),但不具备生成未来场景的能力。论文点名最接近的工作是 HERMES(ICCV 2025,BEV 特征 + VLM 统一理解与生成的自动驾驶世界模型)——但 HERMES 用 BEV 表征文本-空间对齐,只是特征级对齐,不够精确。GaussianDWM 的定位是换一种场景表征:用 3D Gaussian Splatting 直接承载语言特征,实现文本和 3D 几何的显式空间对齐,同时把「理解」与「生成」统一进同一套 3DGS 场景表征之上——论文自称是首个支持这两类任务的 3D 高斯统一驾驶世界模型框架。
模型架构
三个模块:World Tokenizer → Scene Understanding(VLM)→ Multi-modal Scene Generation(扩散)。
3D Gaussian Tokenizer(语言场构建):基于 LangSplat 给每个高斯 $G_i$ 挂一个语言嵌入 $f_i$,语言特征来自 CLIP(512 维),其层级语义由 SAM 分割提供(对应 LangSplat 的 subpart/part/whole 三层级 $l\in{s,p,w}$)。为省显存,引入场景级语言自编码器 $E$:把 CLIP 嵌入 $F(v)\in\mathbb{R}^{D=512}$ 压到 $H(v)=E(F(v))\in\mathbb{R}^{d=3}$,解码器 $\Psi$ 负责重建 CLIP 特征;高斯的语言隐变量就学在这个 3 维场景专属隐空间里,而非直接学 512 维 CLIP 空间。
3D Gaussian Projector(对齐文本空间):每个高斯基元表示为 $G_i=(x_i,o_i,s_i,r_i,f_i)$(位置 $\mathbb{R}^3$、不透明度、缩放、旋转、CLIP 特征)。位置用可学习傅里叶编码(频带数 $L=10$);不透明度过 sigmoid;CLIP 特征经预训练场景级解码器投到 512 维;五类属性各自过独立 MLP 投影到共享的 4096 维特征空间(与 Qwen3-8B 隐维对齐),再用 softmax 归一化的可学习权重 $\alpha_p$ 加权融合成最终高斯 token $\mathcal{G}_i$。
Scene Understanding(LLM = Qwen3-8B):${t_i, C_i^l}=\mathrm{LLM}(\mathcal{G}_i,\mathcal{T}_i)$,同时输出文本答案 $t_i$ 与高层语言特征 $C_L$(后者喂给生成模块)。
任务感知混合采样:直接把全部高斯转 token 会超 LLM 上下文长度且冗余严重。对场景级任务(RD&P 区域描述/规划)用全局采样——uniform + top-k 从数十万高斯里选 $N=4096$ 个;对 2D/3D 视觉定位任务用语言引导的 cross-attention 稀疏采样——用文本 query 与高斯特征做 cross-attention,只保留与 query 最相关的高斯,得到更紧凑的定位专用 token 集。附录 D 的 token 数消融(均搭配 cross-attn)显示:4096 token 时 Avg 57.70,降到 512 反而升到 58.26,再降到 128 略回落到 58.15——说明语言引导采样下并非 token 越多越好,512 附近是本文测的最优点。
训练目标:两阶段 VLM 训练,均用 prefix language modeling(自回归交叉熵):$\mathcal{L}(\theta,\mathcal{B})=-\sum \log p_\theta(t_{gt}^{(i)}\mid t_{gt}^{(<i)}, t_{prefix})$,prefix 含文本、图像、3D 高斯 token 三种 token。LLM 用 LoRA 微调。
Multi-modal Scene Generation(双条件扩散):denoising UNet + 冻结预训练 VAE,把 RGB 图像 $I_i$ 与深度图 $D_i$(深度通过通道复制转伪 RGB)编码进统一隐空间 $z_I,z_D$;解码时深度取三通道均值还原单通道。用 v-prediction 目标:$v_t=\alpha_t\epsilon_t-\sigma_t d_t$,训练损失 $\mathcal{L}=\mathbb{E}|\mathcal{F}\theta(d_t,d{ref},C_I,C_D,C_L,s)-v_t|2^2$。低层条件 $C_I,C_D$:用投影矩阵把 t 时刻周围点云投到 t+n 时刻得到稀疏图像条件(几何/纹理);高层条件 $C_L$:VLM 输出的语言特征(世界知识)。两类条件拼接噪声隐变量后一起喂 UNet。世界知识注入路径(附录 C):CLIP 文本编码器把 caption 编码成 token 级嵌入 $E{text}\in\mathbb{R}^{L\times D}$(而非池化的单一全局向量),与参考帧的图像 token $E_{img}$ 拼接、加可学习类型嵌入,$E_{enc}=[E_{img};E_{text}]+E_{type}$ 作为 encoder-hidden-states 输入 UNet 多层 cross-attention。支持空间生成(视角平移 ±1m/±2m,评测扩展到 ±4m)与时间生成(未来 1s/2s 场景预测,2Hz 关键帧插值到 12Hz)。
数据
3DGS 场景数据集:基于 nuScenes 构建首个大规模室外自动驾驶 3D 高斯数据集,共 800 个场景(源自 nuScenes 序列)。处理流程:剔除重叠度低 / 运动模糊严重的帧或整段场景;用 nuScenes 自带的聚合 LiDAR 点云初始化高斯(而非常规 3DGS 流程用的 COLMAP,避免大尺度误差);有深度监督的场景额外加深度损失;优化后按 PSNR 二次过滤重建质量。
语言标注:LangSplat 构建 3DGS 语言场,CLIP 512 维特征 + SAM 层级语义;每场景训练专属语言自编码器(3 维隐空间)压缩存储。
QA / 指令数据集(GitHub CVPR release 版本口径,三部分合计约 190 万训练样本 / 35.8 万测试样本):
- NuInteract-based(改编自 DriveMonkey/NuInteract,2DVG 输出统一成结构化 JSON):训练 1,415,606 / 测试 253,887,含 RD&P(810,302/167,596)、3DVG(208,616/44,860)、2DVG(189,450/40,373)、Caption(181,286/-)、Planning(25,952/1,058)。原始 NuInteract 数据集本身含约 150 万条多视角图文标注(论文 Related Work 引用数字)。
- OmniDrive-based(只取 Desc/VQA/Conv 三个子集,多轮对话拆成独立 QA 对,训练设置对齐 HERMES):训练 400,464 / 测试 78,208。
- Trajectory 数据(来自 nuScenes CAN bus,预测时长 0.5s/1s/2s/3s/5s/10s,输入 4 帧历史位姿+动力学,输出结构化位姿序列;论文附录示例为 7 元组 [x,y,z,四元数 4 分量],GitHub README 里简化描述为 [x,y,z,sin(yaw),cos(yaw)] 5 元组,两处口径略有出入):训练 121,880 / 测试 26,064,按预测时长细分(如 0.5s: 24,630/5,269 … 10s: 11,330/2,419)。
- NuScenes 底座:700 训练 / 150 验证 / 150 测试场景,六路环视相机输入。
输入-输出格式(附录 B 示例):QA 样本把 <gauss> 占位符放在指令开头引用对应帧的高斯特征文件(如 gauss/output-full-6v/2_CAM_FRONT/langsplat_3/per_frame/00000.pth),紧跟图像路径、相机视角、bbox 坐标与自然语言问答对。轨迹样本从每段视频抽 10 帧,前 4 帧作为 prompt、后 6 帧作为预测目标,位姿统一转换到第 5 帧的 ego 坐标系。
未披露:3DGS 每场景的高斯点数、单场景重建耗时、原始视频总小时数。
训练方法
三阶段流水线:
- 理解侧:先独立训练 Gaussian tokenizer / projector / 采样模块,再接入 LLM 联合微调(LLM 用 LoRA);训练用 16× NVIDIA A100。参数效率:第一阶段可训练参数仅占模型总参数 0.45%,LoRA 微调阶段占 0.79%。
- 生成侧:先训 224×400 低分辨率 RGB 视频生成,再扩展到低分辨率 RGB-D,最后用混合帧长策略精炼到 424×800 高分辨率 RGB-D 视频生成器;优化器用 simulation-free rectified flow + v-prediction loss。
- 联合优化:端到端联合优化全部组件以保证理解与生成的一致性。
Infra(训练 / 推理工程)
- 训练硬件:论文仅披露理解侧(tokenizer+projector+采样+LLM LoRA)用 16× NVIDIA A100;生成侧(扩散 UNet 从低分到高分三阶段)GPU 数量与 GPU-hours 未披露。
- 并行策略 / 数值精度:未披露。
- 推理:FPS、控制频率、单帧时延、去噪步数、边缘硬件均未披露(论文未给出类似 GAIA-2 式的固定去噪步数或延迟数字)。
- 参数效率(作为资源侧的间接信号):理解侧总可训练参数占比 0.45%(阶段一)/ 0.79%(LoRA 微调),体现轻量适配思路。
评测 benchmark
场景理解(NuInteract 测试集,Tab.1,遵循 DriveMonkey 实验设置):对比 LLM 类方法(LLaVA1.5、MiniCPM-V2/2.6、InternVL1.5/2 系列、QWen2VL、DriveMonkey)与专用 3D 检测器(BEVFormer、PETR、CAPE,仅覆盖 VG 任务)。GaussianDWM(Qwen3-8B):BLEU 66.17、Rouge_L 79.07、CIDEr 77.06、2D VG mAP 34.95 / F1 40.49 / MIoU 71.85、3D VG Pr 50.66 / mAP 52.78 / F1 32.05、Planning Acc 66.27,综合 Avg 57.14,超过此前 VQA SOTA DriveMonkey(Avg 52.12)与最强通用 VLM InternVL2-8B(Avg 45.42)。注:主表数字实为混合采样两套结果逐列拼接——RD&P/Planning 四列(66.17/79.07/77.06/66.27)与 Tab.2 消融里”Top-k+Uniform(无 cross-attn)“行完全一致,2D VG/3D VG 六列(34.95/40.49/71.85/50.66/52.78/32.05)与 Tab.2 消融里”Top-k+Uniform+CrossAttn”行完全一致——即最终报告数字按任务类型分别取各自最优采样策略的结果,Tab.2 该行本身未给出对应的 Avg 数值。
组件消融(Tab.2):zeroshot(无微调)Avg 15.39 → 微调但不用 3D 高斯 Avg 53.32 → 加高斯 + 随机采样 Avg 55.21 → 加高斯 + Top-k+Uniform Avg 56.92 → 混合采样(VG 任务再加 cross-attn)达到主表 57.14,逐级验证 3D 高斯表征与任务感知采样各自的增益。
场景生成(Tab.3,nuScenes,空间偏移 ±1m/±2m/±4m,FID/FVD 越低越好):对比 PVG、EmerNeRF、StreetGaussian、OmniRe、FreeVS、DiST-S。GaussianDWM 在 ±1m(FID 8.36/FVD 44.50)与 ±2m(11.27/68.17)全面优于包括 DiST-S(10.12/45.14,12.97/68.80)在内的所有对比方法;但在 ±4m 极端偏移,DiST-S 反而更优(FID 17.57/FVD 105.29 vs GaussianDWM 18.81/116.40)——这与论文正文”outperforms all existing methods”的表述有出入,如实记录。
双条件消融(Tab.4,主文):仅高层条件(无低层)FID/FVD 缺失(论文标”-”);仅低层条件 FID 10.12/FVD 45.14(±1m);双条件 FID 8.36/FVD 44.5(±1m),验证高层世界知识对生成质量有正向贡献。附录 D 另有一组”World Knowledge × Gaussian”三态消融(±1/2/4m,量级与主文 Tab.4 不同,属不同规模/设置的补充实验,未见论文解释两者关系):(无WK,无高斯) 11.44/42.22 → 21.79/137.31;(+WK) 11.30/41.63 → 19.02/151.19;(+WK+高斯) 11.28/41.62 → 18.91/150.05,改善幅度比主文 Tab.4 小得多。
跨数据集验证(附录 E,OmniDrive 数据集,理解侧):对比纯理解模型(GPT-4o、LLaVA-OV、OmniDrive 及其 2D/BEV 变体)与统一理解-生成模型(Separated unification、HERMES、GaussianDWM)。GaussianDWM(8B)METEOR 0.395、ROUGE_L 0.341 均为最优,但 CIDEr 0.712 低于 Separated unification(0.745)与 HERMES(0.741)——并非在该表全部指标上都是 SOTA,如实记录。
创新点与影响
- 贡献:首个用 3D Gaussian Splatting 同时承载语言特征与几何/纹理信息、统一驾驶场景「理解」与「生成」的世界模型;提出任务感知的语言引导混合采样,把稠密高斯压缩成 LLM 可处理的紧凑 token;提出双条件(高层语言 + 低层点云投影)扩散生成框架;构建了目前公开的最大规模 3DGS-QA 驾驶数据集(约 190 万训练样本)。
- 改变了什么:相对 HERMES 的 BEV 特征级对齐,换成 3D 高斯让文本与 3D 几何做显式空间对齐(每个高斯自带语言嵌入,而非全局 BEV 网格特征);相对纯生成式 DWM(DriveDreamer/MagicDrive 等),补上了场景理解 / VQA / 视觉定位能力;相对纯理解式 VLM(LLaVA、InternVL 等通用模型或 DriveMonkey 等驾驶专用 VQA 模型),补上了受语言知识引导的时空场景生成能力。
- 作者自陈局限 / 待办:论文正文与附录未设专门的 Limitations 小节;从实验数字看,高层语言条件对生成指标的边际增益总体有限——主文 Tab.4 里”仅低层→双条件”FID 从 10.12 降到 8.36(±1m,相对提升约 17%),但附录 D 的独立三态消融里同样的加法只把 FID 从 11.30 压到 11.28(±1m),几乎可忽略;±4m 极端视角外推仍不敌纯几何重建方法 DiST-S。
- 开放度:代码与模型权重开源(GitHub
dtc111111/GaussianDWM,Apache 2.0 许可,CVPR 2026 release 分支src/gaussiandwm_cvpr);官方声明该分支不包含轨迹预测代码、“VGGDrive” 期刊延伸版、ViT-feature 高斯变体、attention-based 高斯选择等论文里出现过的部分内容,属阉割版公开代码;模型权重dtc111/GaussianDWM在 HF 上为**受限(gated)**访问;QA 数据集xushan/GaussianDWM公开于 HF Datasets。
原始链接
- arXiv 摘要(v2,已标注 Accepted by CVPR 2026):https://arxiv.org/abs/2512.23180
- arXiv PDF:https://arxiv.org/pdf/2512.23180
- arXiv HTML 全文:https://arxiv.org/html/2512.23180v2(v1: https://arxiv.org/html/2512.23180v1,正文/数据/消融数字两版一致,v2 仅补全参考文献列表)
- GitHub(CVPR release 代码):https://github.com/dtc111111/GaussianDWM
- HF 模型(受限访问):https://huggingface.co/dtc111/GaussianDWM
- HF 数据集(QA/理解):https://huggingface.co/datasets/xushan/GaussianDWM
- HF 数据集(采样版):https://huggingface.co/datasets/xushan/GaussianDWM-sampled
- HF Papers 聚合页:https://huggingface.co/papers/2512.23180
- 最相关前作 HERMES(BEV 版统一理解-生成驾驶世界模型,ICCV 2025):arXiv 2501.14729(本 wiki 暂无独立页面)
- 基座 LLM:qwen3;相关前作:gaia-1-wayve、drivedreamer、magicdrive
一手源存档(sources/)
- gaussiandwm—github-readme — GitHub README 快照(sources/world-model/2025/gaussiandwm—github-readme.md,fetched 2026-07-16,含数据集统计表与代码/权重/许可信息)
- arXiv 2512.23180 全文(v1 HTML 用于逐字核对正文/公式/表格数字,v2 用于确认 CVPR 2026 收录状态与参考文献):见上「原始链接」(arXiv 原文,不入 git)