一句话定位

Epona(ICCV 2025,Horizon Robotics 团队)是一个时空解耦的自回归扩散驾驶世界模型:用因果 transformer 在压缩隐空间里做纯时序自回归、用两个并行 DiT 分别以 rectified-flow 扩散生成”下一帧图像”与”未来 3 秒轨迹”,配合训练期的 chain-of-forward 策略压制自回归漂移,在 NuScenes 上以 2.5B 参数取得 FVD 82.8(对比最强基线 vista-driving-world-model 的 89.4,提升 7.4%),并把可用生成时长从 15 秒推到 2 分钟(600 帧),同时作为无感知输入的实时运动规划器在 NAVSIM 上拿到 PDMS 86.2,超过 UniAD、TransFuser 等强端到端规划器。

背景与定位

生成式驾驶世界模型此前分裂成两条路线,各有硬伤:一条是以 vista-driving-world-model 为代表的视频扩散范式——联合建模固定长度未来帧的整体分布,视觉质量高,但因缺乏逐时间步的局部分布建模,天然不支持变长/长时预测,也难以嵌入轨迹规划(没有多模态预测机制);另一条是 GAIA-1、drivingworld-gpt、ADriver-I 等 GPT 风格自回归路线——把图像和动作离散化成 token 做 next-token 预测,天然支持变长生成,但量化过程明显损失视觉细节与轨迹精度,且因果注意力只擅长逐步预测下一个动作,难以规划长时轨迹。Epona 的定位是把两条路线的优点缝合:时序上因果自回归(继承 GPT 路线的变长能力),单步预测上用连续隐空间扩散(继承视频扩散的视觉保真),同时把轨迹规划设计成与视觉生成并行、共享同一时序隐表示的独立扩散头,让世界模型本身可以脱离视觉生成、单独当实时规划器用。论文明确指出同期发布的 cosmos-predict(NVIDIA Cosmos 世界基础模型平台)虽也可作驾驶世界模型,但未引入新框架、且参数量大/算力需求高,限制了实用性;另将 magicdriveditinfinitydrive 列为同期视频生成类竞品,并强调其代码基于团队前作 drivingworld-gpt 与 Flux、DCAE 构建。

模型架构

Epona 由三个模块组成,总计 2.5B 参数

  • Multimodal Spatiotemporal Transformer(MST,1.3B,12 层):负责把历史观测编码成紧凑时序隐表示。输入是过去 T 帧的图像隐 patch(先经预训练 Deep Compression AutoEncoder/DCAE 压缩,下采样率 32×、隐通道 32,比常规 8× 下采样 VAE 多减少 16× token 数)与对应动作序列 $\mathbf{a}_{t-1\to t}\in\mathbb{R}^3$(航向角变化 $\Delta\theta$ + 相对位移 $\Delta x,\Delta y$,ego 坐标系)拼接后投影,交替经过因果时序注意力层(causal temporal layer,跨帧、带三角因果 mask)多模态空间注意力层(spatial layer,帧内跨图像 patch 与动作 token),用 einops 记号实现 (b t) l c → (b l) t c(b l) t c → (b t) l c 的维度重排。最后取最后一帧的隐嵌入 $\mathbf{F}\in\mathbb{R}^{B\times(L+3)\times D}$ 作为下一阶段两个 DiT 的统一条件——这是”共享隐空间联合预测”的关键设计。
  • Trajectory Planning DiT(TrajDiT,50M,2 层):一个双流-单流(Dual-Single-Stream)DiT,双流阶段历史隐 $\mathbf{F}$ 与噪声轨迹分别独立处理、只通过 attention 交互,单流阶段拼接后统一处理做信息融合。用 rectified-flow 目标预测速度场 $v_{traj}$,一次性去噪生成未来 N 帧(3 秒)的完整轨迹(而非逐步预测单个动作)——论文强调这是首个用扩散模型生成连续多步驾驶轨迹的驾驶世界模型。
  • Next-frame Prediction DiT(VisDiT,1.2B,12 层):架构与 TrajDiT 相同,额外加一个 adaLN 风格的调制分支接收动作 $\mathbf{a}{T\to T+1}$(模型自预测或用户指定)做动作条件控制;同样以 rectified-flow 目标去噪生成下一帧图像隐 $\mathbf{Z}{T+1}$,再经 DCAE 解码器还原像素。
  • Temporal-aware DCAE 解码器:原始 DCAE 是纯图像自编码器,逐帧独立解码会产生闪烁。Epona 在 DCAE 解码器前插入时空自注意力层做多帧交互(编码器保持冻结,只微调这部分),改善帧间一致性。
  • 两个 DiT 共享同一套 rectified-flow 目标($\mathcal{L}=\mathcal{L}{traj}+\mathcal{L}{vis}$),联合端到端训练;推理时 DiT 采样步数默认 100 步。分辨率 512×1024,输入历史条件帧数 10 帧(消融显示为当前模型设置下的实用上限)。

数据

  • 训练集:公开的 NuPlan 数据集视频(训练集)+ NuScenes 训练集 700 个场景,从零训练(不基于任何预训练视频扩散权重,这点与依赖大规模视频预训练的 vista-driving-world-model 形成对比)。所有图像统一 resize 到 512×1024
  • 评测集:NuPlan 测试集 1628 段视频片段;NuScenes 验证集 1646 段视频片段
  • 动作标注:ego 轨迹(航向变化 + 相对位移)直接来自数据集自带的车辆位姿,非额外标注。
  • 中国场景泛化(HF 模型卡 + 项目页披露,论文正文未展开):额外发布了 epona_nuplan+china.pkl 检查点,在基础模型上用大规模中国驾驶场景 in-house 数据微调,项目页视频演示其在中国道路的泛化能力;epona_nuplan+nusc.pkl 则是在 NuScenes 上微调的版本。
  • 未使用仿真数据、未做多相机/多模态传感器融合,只用前视相机(front camera only)。

训练方法

  • 目标函数:视觉生成与轨迹规划统一用 rectified flow(flow-matching)目标——噪声与数据线性插值 $x_{(t)}=(1-t)x_{(0)}+t\epsilon$,网络预测速度场 $v_\Theta$,L2 回归到 $(x_{(0)}-\epsilon)$。两个 DiT 各自的 loss 直接相加联合优化整个世界模型。
  • Chain-of-Forward 训练策略(应对自回归漂移的核心创新):常规 teacher-forcing 训练用真值历史帧,但推理时模型吃自己的历史预测,存在训练/推理域差。Epona 每隔 10 步周期性触发一次 chain-of-forward,连续做 3 次前向,用模型自预测的帧(而非真值)作为下一步的历史条件;为了训练效率,不真的多步去噪采样,而是用当前速度场预测一步估计去噪结果 $\hat{x}{(0)}=x{(t)}+t,v_\Theta(x_{(t)},t)$,再把 $\hat{x}_{(0)}$ 接回下一次前向,模拟推理噪声但不显著增加训练开销。
  • DCAE 微调:编码器权重冻结,只对解码器前插入的时空自注意力层做微调,用于消除逐帧独立解码带来的闪烁。
  • 超参:AdamW,学习率 $1\times10^{-4}$,weight decay $5\times10^{-2}$;共 600k 迭代,batch size 96

Infra(训练 / 推理工程)

  • 训练硬件48× NVIDIA A100,训练约 两周(nearly two weeks),600k 迭代,batch 96。并行策略、精度(FP16/BF16)均未披露
  • 推理硬件:单张 NVIDIA RTX 4090。论文按模块报告不同 DiT 采样步数下的推理耗时(生成 3 秒轨迹 + 512×1024 单帧图像):
DiT 采样步数MSTTrajDiTVisDiT
10 步~0.02s~0.03s~0.3s
100 步(默认)~0.02s~0.3s~2s
  • 实时规划:由于 MST + TrajDiT 可独立于 VisDiT 运行(脱离视觉生成),单独做轨迹规划时推理 FLOPs 大幅降低,论文声称可达实时 20Hz
  • 视频生成侧未披露端到端 FPS(VisDiT 单帧 ~2s @100 步意味着离线逐帧 rollout,而非实时视频流生成)。

评测 benchmark

视频生成质量(NuScenes 验证集,Table 1,与各方法自报数字对比)

方法FID↓FVD↓最大时长/帧数
DriveGAN73.4502.3N/A
DriveDreamer52.6452.04s / 48
WoVoGen27.6417.72.5s / 5
Drive-WM15.8122.78s / 16
GenAD (OpenDV)15.4184.04s / 8
vista-driving-world-model6.989.415s / 150
drivingworld-gpt7.490.940s / 400
Epona(本作)7.582.8120s / 600

Epona 的 FVD 为最优(较 Vista 提升 7.4%),FID 略逊于 Vista/DrivingWorld,但生成时长比第二名 DrivingWorld 长 3 倍。

轨迹规划 — NuScenes(Table 3,仅前视相机、无额外监督):L2 误差 1s/2s/3s/平均 = 0.61/1.17/1.98/1.25m;碰撞率 1s/2s/3s/平均 = 0.01/0.22/0.85/0.36%——碰撞率优于 UniAD(0.31%用了 Map/Box/Motion/Tracklets/Occ 多重监督)、doe-1(0.53%)等,但本模型不使用任何辅助监督(无 map/box/depth)。

轨迹规划 — NAVSIM 测试集(Table 4)

方法输入NC↑DAC↑TTC↑Comf.↑EP↑PDMS↑
Human/10010010099.987.594.8
UniADCamera97.891.992.910078.883.4
PARA-DriveCamera97.992.493.099.879.384.6
LAWCamera96.495.488.799.981.784.6
TransFuserCamera&Lidar97.792.892.810079.284.0
DRAMACamera&Lidar98.093.194.810080.185.5
VADv2Camera&Lidar97.289.191.910076.080.9
Epona(本作)Camera97.995.193.899.980.486.2

Epona 仅用前视相机、条件于过去 2 秒观测预测未来 4 秒轨迹,PDMS 全面超越含 Lidar 输入的强基线。附录 Table 8 中与 DrivingGPT 的单独对比:DrivingGPT PDMS 82.4 vs Epona 86.2

消融实验

  • 去掉视频联合训练(只训练轨迹分支):NAVSIM PDMS 从 86.2 降到 78.1(NC 97.9→94.5,DAC 95.1→89.7,EP 80.4→74.7),验证共享隐表示对规划的贡献。
  • Temporal-aware DCAE 解码器(NuPlan 测试集,FVD 在生成 10/25/40 帧时):无该模块 52.95/76.46/100.11 → 加入后 50.77/61.46/74.88
  • 条件帧数消融(NuPlan,FVD10/25/40):2 帧 59.85/81.58/103.70 → 5 帧 55.46/71.28/86.76 → 10 帧 50.77/61.46/74.88(更长历史持续提升效果,10 帧为当前设置下的实用上限)。
  • Chain-of-Forward 训练:定性对比显示无该策略时视觉质量在 10–20 秒后迅速劣化;FID 随生成长度增长的曲线(Fig.8)显示有/无该策略的差距随时长增大而显著拉开(论文未给出该图的具体数值表)。
  • 与同期视频生成工作对比(NuScenes FVD,仅作者自述):MagicDriveDiT 94.84、InfinityDrive 70.06、Epona 82.83——作者将 InfinityDrive 更优的视觉质量归因于其使用专用 3D-VAE 而非 DCAE 压缩(DCAE 换来的是训练效率与更强时序/规划能力)。

创新点与影响

  • 贡献:首次把”时序自回归 + 空间/轨迹连续扩散”解耦成三模块(MST 时序编码 + TrajDiT 轨迹扩散 + VisDiT 视觉扩散),用同一份共享隐表示联合监督视觉生成与轨迹规划;提出 chain-of-forward 训练策略以一步速度场估计模拟推理噪声,缓解自回归漂移;论文自称是首个用扩散模型生成连续多步(而非逐步)驾驶轨迹的驾驶世界模型。
  • 改变了什么:把驾驶世界模型的可用生成时长从此前最长的 40 秒(drivingworld-gpt)推到 2 分钟(600 帧),且全程用连续隐空间(而非离散 token)保留视觉细节;证明一个纯自监督的下一帧预测世界模型可以在无地图/无 3D 框/无深度等任何辅助监督下,仅凭前视相机就在 NAVSIM 上超过多传感器融合的端到端规划器,隐含说明世界模型能从自监督预测任务中学到交通规则等隐式知识(如论文强调的”停在红灯前”)。
  • 作者自陈局限:视觉质量(FID)略逊于依赖专用 3D-VAE 的同期工作(InfinityDrive),原因是 DCAE 压缩带来的视觉伪影权衡;论文未讨论多相机/环视扩展、仿真数据混训、或更长时间尺度(远超 2 分钟)下的稳定性。

原始链接

一手源存档(sources/)