一句话定位

ADriver-I 把「多模态大模型做控制信号预测」和「视频扩散模型做未来场景生成」拼进同一个闭环:引入 interleaved vision-action pair 概念,把历史帧图像与控制信号统一编码成词嵌入空间里的 token 序列,MLLM 自回归吐出当前帧的 speed/steer angle,再拿这个控制信号去condition一个视频扩散模型生成未来帧,生成的未来帧又反过来作为下一时刻的「当前帧」喂回 MLLM——如此循环即可在自己生成的世界里”无限行驶”,且全程不依赖 HD map 或 3D bounding box 先验。

背景与定位

自动驾驶主流做法是感知-预测-规划-控制的模块化流水线(PETR/PETRv2、UniAD、VAD、Transfuser、TCP 等),可解释但环节冗余。ADriver-I 想学人类司机「看图直接打方向盘+预判未来」的端到端直觉,因此转向驾驶世界模型这条线:同期工作 gaia-1-wayve 用一个 6.5B 自回归 Transformer 做纯粹的未来生成(不做控制信号预测),drivedreamer 能同时做生成和控制预测,但重度依赖 HD map、3D 框等结构化先验作为生成条件;并发工作 DriveGPT4 用 MLLM 接视频+文本输出控制信号并给出可解释的理由。ADriver-I 的定位是:像 gaia-1-wayve 一样不需要 HD map/3D 框先验,同时像 DriveDreamer 一样统一做控制信号预测与未来生成,并且是第一个明确提出「infinite driving」(在自己生成的世界里做闭环自动驾驶)概念的工作。论文将其架构类比机器人领域的 RT-2(vision-language-action 模型直接输出低层控制信号)和 PaLM-E,属于 MLLM+扩散 双引擎的驾驶世界模型 范式。

模型架构

Interleaved vision-action pair:每一帧图像 token 与其对应的控制信号 token 配对拼接,构成 MLLM 输入序列的基本单元,优势有二——(1) 支持不定长多轮对话,提升 MLLM 灵活性;(2) 把未来生成与动作预测统一到同一个 word embedding 空间。

MLLM(控制信号预测):由预训练 LLM + 视觉编码器 + 视觉适配器三部分组成——

  • LLM:Vicuna-7B-1.5(在 LLaMA2 上微调而来)
  • 视觉编码器:CLIP-ViT-Large
  • 视觉适配器:2 层 MLP,权重取自 LLaVA-7B-1.5 的预训练适配器,用于对齐视觉特征与语言特征

输入为当前帧 $I_t$ 及三对历史 vision-action pair $(I_{t-1},A_{t-1}),(I_{t-2},A_{t-2}),(I_{t-3},A_{t-3})$;对话结构固定为:

Human: <SYS><TOKENimg><TOKENact><STOP>
Agent: <TOKENact><STOP>

<num_start>/<num_end> 标记数字 token 边界。为降低 LLM 拟合连续数值的难度,控制信号被放大 1000 倍转成整数、保留 3 位小数(消融显示 2 位小数与 3 位效果几乎相同,见下文数据部分)。训练阶段采用 multi-round conversation:MLLM 以自回归方式一次性输出 ${A’{t-2},A’{t-1},A’_t}$ 三步预测并逐一监督(比只监督当前帧的 single-round 效果更好,能降低推理时的累积误差);推理阶段 MLLM 单步直接输出当前帧控制信号 $A’_t$。

VDM(未来场景生成):基于 latent diffusion model 构建,权重继承自 Stable Diffusion 2.1,并叠加类似 Video LDM(“Align your latents”)的时序模块获得时间一致性;引入 reference-video control(把给定历史帧与扩散输入在通道维拼接)实现历史条件生成;保留文本条件模块以支持动作引导生成。由于 VDM 的文本编码器缺乏 LLM 级别的推理能力(难以理解带符号的 steer angle 语义,如负值到底是左转还是右转),论文额外用 GPT-3.5 把相邻帧的低层控制信号翻译成自然语言运动描述(如 “steady speed”、“gradual right shift”)作为 VDM 的文本 prompt。VDM 以 MLLM 预测出的当前帧控制信号 $A’t$ 为条件,一次预测未来 4 帧 ${I’{t+1},…,I’_{t+4}}$;推理时用 DDIM 采样,采样步数 50。

闭环(infinite driving):生成的 $I’{t+1}$ 被当作下一时刻的”当前帧”重新喂回 MLLM,产出 $A’{t+1}$,如此重复即可在模型自造的世界里持续驾驶(仅需 3 个初始 vision-action pair 即可启动)。MLLM 与 VDM 分开训练,推理时才拼装到一起(论文自陈的局限之一,见下)。

数据

  • 私有数据集:约 140 万(1.4M) 组前视摄像头视频帧 + 对应低层控制信号(speed、steer angle),场景聚焦高速公路(highway),speed/steer angle 方差相对较小。
  • nuScenes:约 23K 视频样本,用于 VDM 微调及 MLLM 的 SFT 对照。
  • 控制信号即车辆的连续数值(speed、steer angle),无需额外人工动作标注(direct sensor readout),转成文本token喂给 LLM。
  • MLLM 训练分两阶段:pretraining(冻结 LLM,只更新视觉编码器与视觉适配器,用私有 1.4M 数据)→ SFT(冻结视觉编码器,其余参数全部更新,分别在 nuScenes 和私有数据集上做)。
  • VDM 先在 1.4M 私有数据上预训练,再在 nuScenes 上微调;两阶段视频长度均为 8 帧,空间分辨率 256×512。
  • 编码方式消融(Table 3,nuScenes,L1 误差):Num2English(数字转英文描述)speed 2.094 / steer 0.536;Special Token(分箱转分类)0.094 / 0.106;Relative Diff(相邻帧差值)0.081 / 0.096;Absolute Number(直接回归绝对数值,即论文采用方案)0.072 / 0.091——直接预测绝对数值优于文字化或相对差分。
  • 小数位数消融(Table 4):0 位 0.212/0.099,1 位 0.094/0.093,2 位 0.073/0.091,3 位(采用)0.072/0.091——2/3 位小数效果接近,位数太少损失精度。
  • Cross-dataset 对比:私有数据(ADriver-I†)表现显著优于 nuScenes(ADriver-I),论文归因于(1)高速场景本身方差小,(2)私有数据规模远大于 nuScenes SFT 数据(1.4M vs 23K)。

训练方法

  • MLLM 与 VDM 分开训练,推理阶段拼接(无端到端联合优化,论文自认是局限)。
  • MLLM:2 epoch(pretrain + SFT 均为 2 epoch),batch size 16,输入图像分辨率 336×336,输入为 3 个历史 vision-action pair + 当前帧图像;优化器 AdamW,学习率 2×10⁻⁵;监督信号为 LLaVA 式 cross-entropy loss(MLLM 输出全部是文本 token)。
  • VDM:预训练 40,000 步,batch size 128(32× A100 80GB);nuScenes 微调再训 40,000 步,batch size 32(16× A100 80GB);学习率预训练 4×10⁻⁴,微调 3.2×10⁻⁴;推理用 DDIM 采样,采样步数 50。
  • Multi-round conversation 消融(Table 5,L1 误差):Temporal Fusion(多帧视觉/动作 token 直接融合)0.078/0.092;Single Round(仅监督当前帧)0.078/0.094;Multi Round(同时监督 $A’{t-2},A’{t-1},A’_t$,采用)0.072/0.091——multi-round 在 speed 上提升明显,因为对中间预测加了更多监督,降低了推理时的累积误差。

Infra(训练 / 推理工程)

  • MLLM 训练:8× A100(80GB)
  • VDM 预训练:32× A100(80GB),40k steps,batch 128。
  • VDM 微调(nuScenes):16× A100(80GB),40k steps,batch 32。
  • 推理侧:MLLM 单步前向输出当前帧控制信号;VDM 用 DDIM、采样步数 50。论文未披露具体的推理 FPS/control-Hz/延迟数字,也未披露边缘硬件部署数据——未披露

评测 benchmark

控制信号预测(Table 2,L1 及阈值内准确率 $A_\theta$)

MethodSpeed L1↓Speed A0.01/0.03/0.05/0.07↑Steer L1↓Steer A0.01/0.03/0.05/0.07↑
MLP-Only0.1220.189/0.275/0.361/0.4400.1010.183/0.482/0.641/0.715
CNN-Based0.1060.191/0.301/0.407/0.4740.0950.277/0.527/0.648/0.721
ViT-Based0.1030.200/0.326/0.438/0.4890.0920.299/0.546/0.656/0.724
ADriver-I(nuScenes)0.0720.237/0.398/0.535/0.6400.0910.411/0.575/0.664/0.731
ADriver-I†(私有数据)0.0350.295/0.519/0.790/0.8620.0150.643/0.840/0.925/0.964

三个基线均取三帧历史输入:MLP-Only 仅用历史动作序列过全连接层;CNN-Based 在此基础上加 ResNet+GAP 图像特征;ViT-Based 把 CNN 换成 ViT-B。ADriver-I 在 nuScenes 上全面优于三个基线;论文指出 ViT-Based 在 steer angle 的 L1 上与 ADriver-I 接近,但 ADriver-I 在低阈值 $A_{0.01}$ 上优势明显更大。

未来场景生成质量(Table 6,nuScenes,FID/FVD)

MethodInput→OutputFID↓FVD↓
DriveGAN1F→12F73.4502.3
DriveDreamer1F+12B(box)+12M(HD map)→12F52.6452.0
ADriver-I4F→4F(无 box/map 先验)5.597.0

论文强调 ADriver-I 在不使用 3D bounding box、HD map 先验的情况下取得远优于 DriveGAN、DriveDreamer 的生成质量。

创新点与影响

  • 首次提出 interleaved vision-action pair,把驾驶场景的视觉特征和控制信号统一编码进同一词嵌入空间,让 MLLM 能像处理交错图文文档一样处理”历史帧+动作”序列。
  • 首次把控制信号预测未来场景生成统一进一个 MLLM + VDM 框架,且未来生成不依赖 HD map / 3D bounding box 等结构化先验(与 drivedreamer 的关键区别)。
  • 首次明确提出并验证 infinite driving:给定极少数(3 个)初始 vision-action pair,模型可在自己生成的未来世界里递归地做控制预测+场景生成,构成闭环自动驾驶的雏形。
  • 论文自述的局限:(1) VDM 类似闭环仿真器,但控制信号剧烈变化时可能生成低质量帧,进而扰乱下一时刻的控制预测;(2) 性能距离实际部署仍有较大差距,计划用更大规模私有数据继续迭代;(3) MLLM 与 VDM 分开训练,未能享受端到端联合优化的收益,需要统一的理解-生成框架;(4) 缺少导航/路径信息,长距离驾驶能力受限。

原始链接

一手源存档(sources/)

  • 未发现官方 blog / GitHub 仓库 / HuggingFace model card / project page(HF Papers 页面 huggingface.co/papers/2311.13549 返回 404;arXiv 摘要页无 project page 或代码链接);论文正文与致谢部分也未提及代码开源计划。
  • arXiv 原文 PDF(https://arxiv.org/pdf/2311.13549),不入 git,本页所有数字均据此 PDF 全文核对。