一句话定位

Hermes++ 是 HERMES(ICCV 2025)的期刊扩展版:在同一套”BEV 表征 + LLM”骨架上,把原来单靠显式点云监督的生成分支换成显式 + 隐式的联合几何优化(Joint Geometric Optimization),并新增 Textual Injection 把文本语义直接注入 Current-to-Future Link、用 Ego Modulation 解耦自车运动与场景本身动态,在 nuScenes 上把 3 秒点云生成误差在会议版基础上再降 13.7%,同时同步提升 OmniDrive-nuScenes 理解指标,代码与四个训练阶段的权重已开源。

背景与定位

驾驶世界模型长期存在”会生成不会理解、会理解不会生成”的分裂:一类是纯生成路线,如 ViDAR、OccWorld、Epona,只预测场景几何/视觉演化,答不了”这是什么场景""前方是什么”这类问题;另一类是驾驶 VLM 路线,如 OmniDrive、DriveLM、DriveGPT4,擅长场景理解和问答,却没有预测未来几何演化的能力。

作者自己的会议版 HERMES(ICCV 2025)已经是把两件事收进同一个自回归 LLM 前向的统一框架:BEV 表征喂给 LLM 做场景理解,同时用从 BEV 特征最大池化出的 world queries 在 LLM 因果注意力里”偷听”文本世界知识,再驱动一个跨注意力模块生成未来 BEV,经共享渲染模块解码成点云。Hermes++ 在同一骨架上做三处针对性加固,对应其自述的三点新增贡献(相对 ICCV25 版本):

  1. 会议版的生成监督只有点云上的显式几何约束(渲染损失),本文引入隐式几何正则——用一个自监督预训练、训练期冻结的 3D 稀疏卷积几何特征提取器给出”geometry-aware priors”,通过余弦相似度损失和 Gram 矩阵损失对齐预测的体素特征,联合显式约束构成 Joint Geometric Optimization。
  2. 会议版的 Current-to-Future Link 只靠 world queries 传递语义,本文新增 Textual Injection,把 LLM 处理过的文本 token 池化投影成文本嵌入,与 world queries 拼接后一起作为跨注意力的 Key/Value,让语言理解直接调制几何生成。
  3. 新增 Ego Modulation(EM),用自车未来运动参数生成 FiLM 式调制参数 γ/β 作用于 Current-to-Future Link 的自注意力与前馈层,把自车运动从场景固有动态中解耦出来,零初始化保证训练初期稳定。

同期的统一驾驶世界模型探索还包括 Doe-1(单视角生成为主)、Epona(自回归扩散解耦时序动态)、FSDrive(视觉时空 CoT),Hermes++ 强调自己仍是这条”统一理解与生成”路线里少数同时给出 3D 几何约束与语言推理深度交互的工作。论文本身即是对同一批作者 ICCV25 会议论文的直接扩展,GitHub 组织名 H-EmbodVis 是 HUST 团队(Xiang Bai 组)的具身视觉实验室代号。

模型架构

  • 骨干:InternVL2(预训练权重,主配置用 1.8B,并给出 3.8B 放大版本;消融额外测过 0.8B、Llama-3.2、Qwen3 三种 LLM 骨干做泛化性验证)。
  • 视觉 tokenizer(两阶段):① OpenCLIP ConvNeXt-L 视觉编码器抽取多尺度透视特征,经空间交叉注意力(BEVFormer v2 式可变形注意力)提升到 BEV 空间,得到 F_bev ∈ ℝ^(w×h×c),实现配置为 180×180 网格、通道 c=256;② 因原始 BEV token 数超出 LLM 长度限制,用跨步卷积+池化把空间分辨率降采样 ×4、通道相应扩到 4c,得到 F_down∈ℝ^((w/4)×(h/4)×4c)(即 45×45×1024),再展平投影成 LLM 输入 token 序列 F_t∈ℝ^(L_BEV×C)。注:VI-C1 节的对照实验里为了让直接多视角图像特征基线信息量可比,将其 resize 到 2,532 tokens”匹配 BEV 输入的 token 长度”——与 45×45=2025 存在原文自身未解释的差异,如实并记。
  • BEV-to-Point 渲染(Render):把压缩 BEV 特征上采样回原分辨率并沿高度维展开成体特征 V̂_t∈ℝ^(w×h×z×c′)(z=32, c′=32),用一系列 3D 卷积精炼;沿用 NeuS 式隐式 SDF 场做体渲染——每条 LiDAR 射线离散采样点、MLP 预测 SDF 值、按透过率加权求深度,最终把渲染深度转回 3D 坐标得到点云。该渲染模块同时用作生成分支的解码器和几何正则模块的解码器(共享权重)。
  • World Queries(知识迁移载体):初始化 Δt 组(默认对应未来 0/1/2/3 秒 4 个时间点)× n=4 个 query,用对压缩 BEV 特征 F_down 做 Max Pooling 得到基础空间 query(消融显示 Max Pooling 优于 Random Init/Attention Pooling/Cross Attention/Average Pooling),叠加自车未来运动 MLP 嵌入与可学习帧嵌入后投影到 LLM 隐维度,与文本指令一起送入 LLM,靠因果注意力吸收视觉与文本上下文;LLM 处理后的增强 query Q^w_ε 作为未来几何预测的先验。
  • Current-to-Future Link:由多个堆叠 block 组成(每 block 含跨注意力+自注意力+FFN),默认 6 层(消融显示从 3 层加深到 6 层持续降低生成误差);跨注意力的 Key/Value 是 [world queries; 文本嵌入] 的拼接(新增的 Textual Injection:文本嵌入 T̂∈ℝ^(k×C) 由 LLM 处理后的文本 token 经平均池化+线性投影得到);自注意力/FFN 分支额外接受 Ego Modulation:自车运动经 MLP+Tanh 生成 FiLM 式 γ/β,EM(x)=(γ+1)⊙LN(x)+β,调制向量训练初期零初始化。处理后的特征重塑上采样得到未来 BEV {B_(t+i)},经共享 Render 解码成未来点云序列。
  • 几何特征提取器(隐式正则先验来源):稀疏 3D 卷积编码器(SECOND 架构)配对同一个可微 Render,先做自监督点云重建预训练,主训练阶段冻结作为静态先验,仅用于训练期正则、推理时丢弃不引入额外开销。
  • 预测视野:Δt=3 秒;帧级生成损失权重 λ_i=1+0.5×i(i∈{0,…,3}),强调长时预测精度。

数据

  • nuScenes:多视角图像为输入,同步点云为真值,训练/评测几何生成分支(3D 区域 x,y∈[−51.2m,51.2m],z∈[−3m,5m] 内算双向 Chamfer Distance)。
  • OmniDrive-nuScenes:在原始 nuScenes 上补充高质量场景描述与 VQA 对,用于统一指令微调与理解评测(CIDEr/METEOR/ROUGE-L)。
  • NuScenes-QA:约 46 万条 QA 对,基于 3D 检测标注构造场景图,用于跨数据集理解泛化评测(top-1 准确率)。
  • DriveLM:基于 nuScenes 关键帧的 Graph VQA,感知-预测-规划问题带逻辑依赖链,官方测试服务器给分。
  • NuInteract:约 150 万条 语言标注(含逐图/逐场景密集描述),专门用于 BEV 视觉特征与 LLM 语义空间的初始对齐,缓解视觉-语言预训练阶段数据稀缺。
  • 数据增强:对齐阶段仅训练 LLM projector 时,用”拼接描述 + 未遮挡视角”的 masking 增强策略把图文对扩充 7 倍到约 20 万对
  • 除非特别说明,第 VI-C 节全部消融实验只用 25% 训练数据

训练方法

三阶段渐进式训练(Table I,AdamW + Cosine 调度):

  1. 几何感知预训练:① 稀疏 3D 编码器(几何特征提取器)先做自监督点云重建预训练,之后冻结作为静态先验;② 视觉 tokenizer 与 Render 从零初始化,用 L_render+L_cos 监督,把 2D 多视角观测提升到 3D 空间重建当前帧点云。LR 2e-4,epoch 12/6,batch size 32。
  2. 对齐 + 精炼:先只训练 LLM projector(配合上述 7× masking 增强扩到约 20 万图文对)建立 BEV-LLM 语义对齐;再解冻全部参数(LLM 侧用 LoRA)用 NuInteract 密集描述 + OmniDrive-nuScenes 场景描述精炼。LR 2e-4/4e-4,epoch 3/6,batch size 128。
  3. 统一联合训练:接入 Current-to-Future Link,在 nuScenes 关键帧 + 描述 + 对话标注上联合训练理解与生成,用 Joint Geometric Optimization(L_gram + L_cos)监督几何演化。LR 4e-4,epoch 36,batch size 128。

损失函数

  • 理解:标准自回归 next-token-prediction 语言损失 L_lang。
  • 生成:L_gen = 10·L_render + L_cos + L_gram(L_render 为射线深度 L1 渲染损失;L_cos 为预测体素特征与几何先验的逐体素余弦相似度损失;L_gram 为沿 HW/HZ/WZ 三个正交投影方向计算的 Gram 矩阵 Frobenius 范数损失,捕捉全局结构相关性)。
  • 总损失:L_total = L_lang + L_gen。

Infra(训练 / 推理工程)

  • 训练算力(GPU 型号/数量、GPU-hours、并行策略、训练精度):论文正文(含 V-B 实现细节节)未披露,GitHub README/HF 模型卡也未给出。
  • 推理(FPS/延迟/端侧硬件):未披露——论文与仓库均未给出推理速度、显存占用或部署硬件数据;几何特征提取器明确说明推理时丢弃、不引入额外推理开销,但生成/理解主链路本身的推理耗时无公开数字。
  • 已开源的检查点分四阶段发布(ckpt/hermes++.stage1.pth ~ stage3.pth,对应上述三段训练流程),代码含训练与评测配置(projects/configs/hermes),Apache 2.0 许可。

评测 benchmark

主表 Table II(nuScenes 生成 0/1/2/3 秒 Chamfer Distance ↓,OmniDrive-nuScenes 理解 METEOR/ROUGE-L/CIDEr ↑):

方法LLM3s CD↓METEOR↑ROUGE↑CIDEr↑
ViDAR(生成专家)-1.73不支持理解
DriveX(生成专家,ICCV25)-1.10不支持理解
Omni-L(理解专家)7B不支持生成0.3760.3210.732
OmniDrive-2D(理解专家)7B不支持生成0.3830.3250.671
ORION(理解专家)7B不支持生成0.3540.3060.635
Hermes(会议版, ICCV25)1.8B1.170.3840.3270.741
Hermes++(本文, 1.8B)1.8B1.010.3850.3270.749
Hermes++(本文, 3.8B)3.8B0.970.3890.3310.772

论文自述的关键对比:相对 ViDAR,3s CD 降低 41.6%;相对 DriveX,3s CD 降低 0.09(8.2%);相对 Omni-L / OmniDrive-2D,CIDEr 分别高 2.3% / 11.6%;相对自己会议版 Hermes,3s 生成误差降低 13.7%(1.8B 版本)。

其他基准的生成结果:

  • NuScenes-QA(3D 空间感知 VQA,准确率):Hermes++ 61.3%,优于相机方案 Omni-Q(59.2%)、OpenDriveVLA-7B(58.2%),并超过 LiDAR 专家 CenterPoint+MCAN(59.5%)。
  • DriveLM(Graph VQA,官方混合指标):Hermes++ Acc=0.83 / GPT=0.61 / Match=0.43 / FS=0.59,Final Score 追平挑战赛冠军 Team NVIDIA(0.59),Acc 超过 Omni-Q(0.78)5 个百分点。
  • 开环运动规划(nuScenes val,仅用文本指令+几何监督训练,无感知监督):平均 L2=0.37m,平均碰撞率=0.29%;相对 ORION(L2 0.34m/碰撞 0.37%)碰撞率低 0.08 个百分点,L2 相当。

关键消融(均用 25% 训练数据,3s CD / CIDEr):

  • BEV vs 多视角直接输入(token 数对齐到 2,532):理解几乎打平(METEOR 差 0.001),生成 CD 降低约 32%(BEV 更优)。
  • BEV 降采样倍率(Table III):×8 CD=1.781/CIDEr=0.681;×4(默认)CD=1.436/CIDEr=0.720;Direct Query×4 CD=2.012/CIDEr=0.723。
  • Joint Geometric Optimization(Table IV):无隐式正则 CD=1.637;仅 L_cos CD=1.441;仅 L_gram CD=1.544;两者都用(默认)CD=1.436。
  • Current-to-Future Link 逐项消融(Table V):无 Link CD=2.377/CIDEr=0.433 → +Simple Link(3层)CD=1.542 → +Textual Injection CD=1.506 → +Ego Modulation CD=1.442 → +加深到6层(默认)CD=1.436/CIDEr=0.720。
  • 任务交互(Table VI):分离式统一(仅共享 tokenizer 不深度交互)CD=1.634/CIDEr=0.703;本文联合训练 CD=1.436/CIDEr=0.720。
  • World queries 集成方式(Table VII):仅 Textual Injection(不过 LLM)CD=1.634;Q^w 绕过 LLM CD=1.526;Q^w 经过 LLM(本文)CD=1.436/CIDEr=0.720。
  • World queries 数量 n(Table VIII-b):n=0 CD=1.478;n=1 CD=1.419;n=2 CD=1.431;n=4(默认)CD=1.436;n=8 CD=1.430(原文按效率/容量权衡选 n=4,但 n=1 在此表中 CD 数值实际更低)。
  • LLM 骨干泛化(Table XII-a):Llama-3.2 CD=1.533/CIDEr=0.700;Qwen3 CD=1.521/CIDEr=0.696;InternVL2(默认)CD=1.436/CIDEr=0.720。
  • 模型规模(Table XII-b):0.8B CD=1.434/CIDEr=0.708;1.8B CD=1.436/CIDEr=0.720;3.8B CD=1.255/CIDEr=0.742(3.8B 相对 0.8B 的 3s 误差降低 12.5%)。

创新点与影响

  • 相对自己 ICCV25 会议版 HERMES 的三点具体加固——Joint Geometric Optimization(显式点云约束 + 隐式体素特征正则)、Textual Injection(文本嵌入直接注入 Current-to-Future Link 的跨注意力)、Ego Modulation(FiLM 式自车运动解耦)——每一项都有对应消融验证增益方向一致,属于对同一统一框架的系统性加固而非推翻重来。
  • 论文强调隐式正则的可视化证据:仅用显式渲染监督时,学到的 BEV 特征会出现沿相机投影方向的”射线状伪影”和自车中心处异常高响应;加入 Joint Geometric Optimization 后这些伪影被显著抑制,特征更贴合点云真值的内在几何结构(Fig. 5 定性对比)。
  • 在无 3D 框/车道线等辅助检测监督的前提下,仅靠 BEV 表征+标准指令微调就在 OmniDrive-nuScenes 上超过依赖辅助监督的 Omni-Q/OmniDrive 系列,作者将此归因于 BEV 表征本身保留的几何-语义耦合信息。
  • 作者自陈局限(原文 Limitation and future work):如何更好利用预训练多模态大模型中封装的语义先验来改进 BEV 输入表示,仍需进一步研究;将生成范式扩展到更多模态(而不止点云)是有前景的方向。论文本身未讨论训练/推理算力开销,也未给出与更大规模 VLA/端到端规划系统的直接对比。

原始链接

一手源存档(sources/)