一句话定位
HERMES 把”用 BEV 表征驱动 LLM”这条路线同时用在两件事上——理解当前驾驶场景(VQA/描述)和生成未来点云——靠一组从 BEV 特征里最大池化出来的”world queries”在 LLM 的因果注意力里吸收文本世界知识,再用这些查询去反哺跨到未来帧的 BEV 特征,用一个共享的 3D 卷积 + 可微体渲染模块把当前与未来 BEV 都解码成点云,在 nuScenes /OmniDrive-nuScenes 上同时刷新生成(Chamfer Distance 降 32.4%)和理解(CIDEr 提升 8.0%)两条榜单。
背景与定位
在这篇论文之前,自动驾驶世界模型(Driving World Models, DWMs)与驾驶 VLM 是两条互不相交的路线:GAIA-1、ViDAR(vidar-visual-point-cloud-forecasting)、OccWorld 等只做”预测场景怎么演化”,擅长生成但看不懂场景、答不了问题;OmniDrive、DriveLM、DriveGPT4 等驾驶 VLM 只做场景理解(VQA、场景描述、决策推理),却不能预测未来。作者把这两条线的”分立-拼接”方案(各自训一个理解模型 + 一个生成模型,共享 BEV 特征但互不交互)称为图 1(c) 的直接联合方式,并指出它无法利用理解与生成之间的相互增益、且分离训练会拖累优化。
HERMES 的定位是把这两件事收进同一个自回归 LLM 前向里:现有多视角图像先编码成 BEV,BEV 送进 LLM 做”看图说话”式的场景理解(沿用 InternVL 系多模态 LLM 的做法),同时另起一组 world queries 通过 LLM 内部的因果注意力”偷听”文本 token 里的世界知识,再用这些注意力增强过的查询去指挥一个跨注意力模块生成未来若干秒的 BEV,最终经统一的渲染模块解码成点云。与同期工作 Doe-1(doe-1,清华,自回归 Chameleon 骨干、直接把观测/描述/动作序列化)相比,HERMES 强调多视角环视几何(BEV)而非仅前视图像,且把生成留在连续 BEV 隐空间里做体渲染,而不是把未来帧也离散成图像 token 自回归生成——论文把这一区别列为与 Doe-1 的主要差异。范式上,HERMES 延续”BEV 统一表征 + LLM 世界知识注入”路线,是首个(作者自称)同时做 3D 理解与生成的统一驾驶世界模型。
模型架构
- 总体流程:多视角图像 I_t → BEV world tokenizer → 展平 BEV 特征 F_t 送入 LLM;LLM 同时接收用户文本指令 T 和一组 world queries Q^w;LLM 输出的编码 BEV B_t 与经 LLM 因果注意力吸收了世界知识的 world queries,一起送入 “current-to-future link” 模块生成未来 Δt 步的 BEV(B_{t+1}, …, B_{t+Δt});共享的 Render 把 B_t 到 B_{t+Δt} 全部解码成点云 P_t 到 P_{t+Δt}。
- BEV world tokenizer:CLIP 图像编码器(OpenCLIP ConvNeXt-L backbone)+ 单帧 BEVFormer(沿用 BEVFormer v2-base 超参),BEV 尺寸 w=h=200,通道 c=256;下采样两倍后得到 (w/4)×(h/4)×(c×4) 的压缩 BEV,再展平投影为 F_t ∈ R^{L_bev×C}(L_bev=(w/4)×(h/4)=2500)供 LLM 使用。
- LLM 骨干:InternVL2-2B(视觉-语言模型,参数量约 1.8B 用于表中对比,文中称调用其 LLM 部分)。BEV 通过两层 MLP 投影进 LLM 特征空间;文本用标准 tokenizer 编码;LLM 做自回归 next-token prediction 完成场景理解(VQA/描述)。
- World queries(生成侧的核心设计):从展平 BEV 特征 F_t 上做 adaptive max pooling 得到 n 个查询 Q ∈ R^{n×(c×4)}(消融确定 n=4 最优,见评测部分),复制 Δt=3 份(对应未来 1/2/3 秒),每份分别叠加:(1) 该帧的自车运动条件 e_{t+i}(自车从当前到第 i 帧的坐标与朝向,MLP 编码);(2) 位置编码 PE 标记该组负责第几帧;再经 MLP 投影、与展平 BEV 共享同一投影层进入 LLM 通道维 C,得到 Q^w ∈ R^{(Δt×n)×C}。这组查询作为额外 token 拼进 LLM 输入序列,通过 LLM 内的因果注意力被文本 token 携带的世界知识”增强”。
- Current-to-future link:3 个跨注意力 block,每个 block = 跨注意力(query=LLM 输出的编码 BEV B_t,key/value=对应帧的 world queries)+ 自注意力 + FFN,逐步把稀疏的 world queries 展开成完整的未来 BEV 特征。
- BEV-to-Point Clouds Render:先将压缩 BEV 上采样回 w×h×c,再 reshape 出高度维 z(z=32),经一系列 3D 卷积重建体特征 F^vol ∈ R^{w×h×z×c’}(c’=32);按数据集 LiDAR 配置构造射线,用可微体渲染(隐式 SDF 场,参照 Wang et al. 的 NeuS 式渲染公式,opacity 由可学习 sigmoid 参数 s 调制)沿射线积分得到深度,从而重建点云。该渲染器对当前帧与未来帧点云共享同一套参数。
- 规模对比:LLM 参数约 1.8B,远小于对比的理解模型 OmniDrive/OmniDrive-BEV/LLaVA-OV(均为 7B)。
数据
- nuScenes:700 训练场景 / 150 验证场景 / 150 测试场景,取六路环视相机图像与 LiDAR 点云;Stage-1 用 12Hz 的 nuScenes 训练集数据训 tokenizer 与 Render;Stage-3 用 nuScenes 关键帧(2Hz 标注帧)做统一训练。
- NuInteract:一个新的语言-驾驶数据集(引用自 DriveMonkey 工作),为每张图像/场景配文本 caption。作者提出一个简单数据增强——遮挡多视角中的一路图像,拼接可见视角的 caption,同时保留未处理的多视角场景描述——把多视角图文对扩充到约 20 万(~200K),相当于 nuScenes 关键帧数量的 7 倍。
- OmniDrive-nuScenes:在 nuScenes 基础上补充 GPT-4 生成的高质量 caption 与 VQA 文本对;作者只用了 OmniDrive 训练数据的一个子集(caption/VQA 部分由 GPT-4 自动标注,其余感知信息如 3D 目标框需人工核验,作者未使用后者)。最终的理解与生成联合训练/测试都在 OmniDrive-nuScenes 上进行。
- 消融数据规模:消融实验只用 nuScenes 训练场景的四分之一(约 7K 帧),在 Stage-3 设置下训练。
- 输入图像分辨率:1600×900(六路环视)。
- 数据未披露具体的仿真数据占比——全部为真实世界(nuScenes 采集车队)数据,无 sim-to-real 或额外仿真数据混合。
训练方法
三阶段训练流程(细节见下表,来自论文 Table 1):
| 配置 | Stage-1(Tokenizer) | Stage-2(BEV-Text 对齐/精调) | Stage-3(理解-生成统一) |
|---|---|---|---|
| 优化器 | AdamW | AdamW | AdamW |
| 学习率 | 2e-4 | 2e-4 / 4e-4(对齐/精调两阶段) | 4e-4 |
| Epoch | 6 | 3 / 6 | 36 |
| LR 调度 | Cosine | Cosine | Cosine |
| 单卡 batch size | 1 | 4 | 4 |
| GPU | 32×NVIDIA A800(三阶段共用) |
- Stage-1(Tokenizer 训练):只训 world tokenizer 与 Render,让 P_t = R(E(I_t)),用 nuScenes 训练集的 12Hz 数据。
- Stage-2(BEV-Text 对齐与精调):分两个子阶段——对齐阶段只训 BEV 的输入/输出投影层(in-projection 与 out-projection),建立 BEV-文本对齐,使用 NuInteract 的密集 caption 数据;精调阶段解冻全部参数,用 LoRA 微调 LLM,采用 OmniDrive-nuScenes 的场景描述数据以适应标注风格。
- Stage-3(理解-生成统一):在前两阶段基础上引入 4.2 节的未来生成模块(world queries + current-to-future link),用 nuScenes 关键帧、场景描述与 OmniDrive-nuScenes 的通用对话标注联合训练。
- 损失函数:文本用标准 next-token-prediction 交叉熵损失 L_N;点云生成用逐条射线深度的 L1 损失 L_D = Σ_{i=0}^{Δt} λ_i · (1/N_i) Σ_k |d(r_k) − d̃(r_k)|,其中 λ_i = 1 + 0.5×i(i∈{0,1,2,3},对当前帧和未来 1/2/3 秒赋予递增权重);总损失 L = λ_N·L_N + λ_D·L_D,取 λ_N=1,λ_D=10。
- 预测视界:Δt=3,即预测未来 3 秒(0/1/2/3 秒四个时间点,0 秒为当前帧的辅助重建任务)。
Infra(训练 / 推理工程)
- 训练硬件:32×NVIDIA A800(三阶段共用同一套硬件规模,论文未按阶段拆分卡时数)。
- 并行策略 / 精度:未披露(论文只给出 batch size per GPU、优化器与学习率,未提混合精度、并行方式或总训练时长/GPU-小时)。
- 推理侧:论文未报告推理 FPS、控制频率(control-Hz)或延迟数字,也未讨论边缘部署硬件——未披露。
评测 benchmark
主结果(Table 2,nuScenes 验证集 Chamfer Distance ↓ / OmniDrive-nuScenes VQA 语言指标 ↑):
仅生成模型:
- 4D-Occ(CVPR’23,L→L):0s 不支持 / 1s=1.13 / 2s=1.53 / 3s=2.11
- ViDAR(CVPR’24,C→L):0s 未报告 / 1s=1.12 / 2s=1.38 / 3s=1.73(ViDAR 用 3 秒历史窗 + 专门设计的 latent rendering + FCOS3D 检测预训练)
仅理解模型:
- GPT-4o(C→T):METEOR=- , CIDEr=0.244, ROUGE=0.223
- LLaVA-OV(arXiv’24, 7B):CIDEr=0.284, ROUGE=0.221
- OmniDrive(arXiv’24, 7B):METEOR=0.380, CIDEr=0.686, ROUGE=0.326
- OmniDrive-2D(7B):METEOR=0.383, CIDEr=0.671, ROUGE=0.325
- OmniDrive-BEV(7B,用 LSS 做 BEV + SOLOFusion 时序建模):METEOR=0.356, CIDEr=0.595, ROUGE=0.278(BEV 图文对齐数据不足导致理解反而下降)
HERMES(本作,1.8B LLM,C→T&L 统一模型):METEOR=0.384、CIDEr=0.741、ROUGE=0.327;生成 Chamfer Distance 0s/1s/2s/3s = 0.59 / 0.78 / 0.95 / 1.17。
- 相比 ViDAR,仅用当前帧多视角图像(无 3 秒历史窗、无专门渲染模块、无检测预训练)就把 3 秒点云的 Chamfer Distance 从 1.73 降到 1.17,降幅约 32%(论文摘要称 32.4%)。
- 相比 OmniDrive,CIDEr 从 0.686 提升到 0.741,提升约 8.0%,且只用了 OmniDrive 训练数据的一个子集。
消融研究(在四分之一 nuScenes 训练场景/约 7K 帧上做):
- World queries 数量 n(Table 3a):n=1/2/4/8/16 时 CIDEr 分别为 0.712/0.714/0.720/0.713/0.716,3 秒 CD 分别为 1.725/1.720/1.719/1.744/1.748;n=4 综合最优(CIDEr 最高、3s CD 最低),继续增大查询数反而因冗余信息和优化难度导致性能下降。
- World queries 初始化方式(Table 3b):Attn. Pool / Avg. Pool / Max Pool 的 3 秒 CD 分别为 1.748 / 1.741 / 1.718,CIDEr 分别为 0.712 / 0.715 / 0.720;Max Pool 最优,比其余两种方式 3 秒 CD 降低约 0.03,作者解释 max pool 能捕捉 BEV 的峰值响应,avg/attn pooling 更易被背景噪声干扰。
- 生成长度(Table 3c):预测帧数越多,各时间步 CD 略微上升(优化难度增大);对比”是否预测当前帧点云作为辅助任务”的最后两行,加入当前帧预测能让编码 BEV 得到正则化,从而改善未来生成(且该辅助任务不增加推理开销)。
- 理解-生成交互方式(Table 3d):仅理解(METEOR=0.379, CIDEr=0.728, ROUGE=0.323)、仅生成(0s/1s/2s/3s CD=0.651/0.988/1.313/1.687)、“分离式统一”(两个独立模型共享 BEV,图1c 方案,METEOR=0.377, CIDEr=0.722, ROUGE=0.321;0s/1s/2s/3s CD=0.663/1.095/1.476/1.875)与 HERMES 的联合训练(METEOR=0.377, CIDEr=0.720, ROUGE=0.321;0s/1s/2s/3s CD=0.645/0.984/1.333/1.718)相比——单任务训练在各自指标上略优于联合训练(论文指出 METEOR/ROUGE 差约 0.002,3 秒 CD 差约 0.03),但 HERMES 显著优于”分离式统一”方案(3s CD 1.718 vs 1.875),说明本文的 world-query 交互机制确实比简单共享 BEV + 独立解码有效,只是联合优化本身仍有一定难度;值得注意的是 HERMES 在 0 秒和 1 秒生成上反而优于纯生成模型(0.645<0.651,0.984<0.988),作者认为这佐证了理解侧世界知识对生成有正向迁移,仅在更长视界(2s/3s)上联合训练略逊于专精模型。
创新点与影响
- 首个统一 3D 理解与生成的驾驶世界模型(作者自称):此前 DWM 与驾驶 VLM 是分立范式,HERMES 用同一个 LLM 前向同时完成两件事。
- World queries 机制:不是简单共享 BEV 特征后拼接两个下游头,而是显式设计了一组从 BEV 峰值响应初始化、经 LLM 因果注意力吸收文本世界知识、再通过跨注意力”current-to-future link”注入未来 BEV 的查询,实验(Table 3d)证明这一机制比”分离式统一”更有效地融合了两个任务。
- 用 BEV 而非仅前视图像:与同期的 Doe-1(仅处理前视图像的自回归模型)相比,HERMES 强调多视角几何一致性,声称这是与 Doe-1 的主要区别。
- 论文自陈的局限:(1) 未探索感知与规划任务(仅做场景理解 VQA/描述 + 未来点云生成,没有做 3D 检测/轨迹规划);(2) 未来图像生成(而非点云)也是重要的生成模态,本文未探索,留作未来工作;此外定性分析也指出复杂场景(大幅左转、遮挡)和低光照(夜间驾驶)下生成质量会下降。
- 后续影响:项目 2025-06-26 被 ICCV 2025 接收,2025-07-14 开源代码、预训练权重与处理后数据集;2026-04-30 发布扩展版 HERMES++(arXiv:2604.28196),本页未覆盖 HERMES++ 的具体改动。
原始链接
- arXiv: https://arxiv.org/abs/2501.14729
- PDF: https://arxiv.org/pdf/2501.14729
- GitHub: https://github.com/LMD0311/HERMES
- HF model: https://huggingface.co/LMD0311/HERMES
- 项目主页: https://lmd0311.github.io/HERMES/
- HF papers page: https://huggingface.co/papers/2501.14729
- 扩展版 HERMES++ arXiv: https://arxiv.org/abs/2604.28196(未在本页覆盖)
一手源存档(sources/)
- hermes-driving-world-model—github-readme — GitHub README 快照(https://github.com/LMD0311/HERMES,main 分支,fetched 2026-07-16)
- hermes-driving-world-model—hf-card — HF model card 快照(https://huggingface.co/LMD0311/HERMES,fetched 2026-07-16)
- hermes-driving-world-model—project-page — 项目主页快照(https://lmd0311.github.io/HERMES/,fetched 2026-07-16)
- arXiv 原文 HTML(2501.14729v1,全文含公式/表格/消融),已读全但不入 git;可用上方 arXiv 链接重新获取