一句话定位

InfinityDrive(SenseAuto Research / 清华大学)是一个基于 DiT(Diffusion Transformer)的驾驶世界模型,靠”时空协同建模模块 + 记忆注入/保留机制 + 记忆曲线自适应损失”三件套,把驾驶视频生成从此前的”几秒、低分辨率”推到 576×1024、10Hz、超过 1500 帧(约 2 分钟) 的高保真连贯生成,并用 I2V/T2V 联合训练在同一初始条件下产出多样化场景。

背景与定位

论文把既有驾驶世界模型的局限归纳为三条:(1) 时空分辨率差——多数模型(drivedreamergaia-1-wayvewovogenadriver-ipanacea-driving-videogenad-generalized-predictive-model)训练窗口 < 30 帧,只能生成几秒视频;即便尝试长时程生成的方法(如 GAIA-1、StreamingT2V、Loong)也往往牺牲分辨率;(2) 自回归误差累积——现有方法(DriveDreamer、SVD、vista-driving-world-model)靠”预测短段→用末帧重置条件→继续”做长程 rollout,预测偏差会随时间放大导致明显漂移;(3) 多样性不足——同一初始条件+不同随机噪声下,现有模型(drivedreamer、GAIA-1、wovogen、GenAD 等)生成结果几乎一致。

范式上 InfinityDrive 属于图像/文本条件的 DiT 视频扩散型驾驶世界模型(区别于 drive-occworldoccworld 等 BEV/占据栅格世界模型)。论文 Table 1 的横向对比把自己与 DriveGAN、drivedreamer、DrivingDiffusion、drive-wm-driving-into-the-futurewovogenadriver-i、Panacea、gaia-1-wayve、Delphi(delphi-driving-video)、DriveScape、vista-driving-world-model 逐项比较帧率/训练帧数/分辨率/时长/数据规模/骨干网络,核心声称:同为 576×1024 分辨率下,Vista 只能自回归到 15 秒(25 帧/段 ×6 次迭代),而 InfinityDrive 能以 128 帧/段训练、12 次迭代做到 2 分钟(表中 “Ours” 一行:10Hz / 128 帧训练序列 / 576×1024 / 2min / 12 次迭代 / 1745h 数据 / Transformer 骨干)。同时对标通用长视频生成方法 FreeNoise、Gen-L-Video(滑动窗口拼接短段)、StreamingT2V(自回归+锚帧+长短记忆模块)、Loong(自回归 LLM 式短到长训练+loss 重加权),但指出这些方法面向物体中心视频、缺乏驾驶场景的显式可控性,也未验证过对复杂驾驶场景的适用性。

模型架构

骨干:基于 DiT(Diffusion Transformer,Peebles & Xie 2023)的图生视频/文生视频联合模型(论文称”based on the DiT model”),区别于同类工作普遍采用的 Stable Diffusion / Stable Video Diffusion(SD/SVD)骨干(Table 1 “Base Model” 列,Ours 标注为 “Transformer”)。具体层数/隐藏维度/参数量论文未披露。

时空协同建模模块(Efficient Spatio-Temporal Co-Modeling, STCM)——解决高分辨率与长序列不能同时训练的显存瓶颈:

  • 动态信息密度调整:训练数据基准分辨率 (H, W)、最大帧率 K、训练序列长度 L。每次迭代随机采样分辨率缩放因子 α∈[1,4],把分辨率放大到 (H×α, W×α),同时允许的序列长度按比例压缩为 L_curr = L/α²;再从原始 L 帧序列中按原始时间索引均匀采样 L_curr 帧(保留其在原序列中的真实位置 P=[…, T−α², T, T+α², …])。
  • skip-ROPE 位置编码:时间位置编码按原始帧率 K(而非降采样后的索引)编码,使低/高分辨率下的时间嵌入保持一致,让模型在低分辨率训练时也能建立连贯的时间理解,从而外推到因显存限制无法直接训练的高分辨率长时程场景。
  • 效果:高分辨率时优先保空间细节、降低时间密度;低分辨率时提高时间密度以跟踪长程变化,二者共同支持 576×1024 分辨率下的时间连贯性。

扩展时间跨度训练策略(Extended Temporal Scope Training, ETST):课程学习式逐步扩大训练窗口——从 L=16 帧起步(利用 ROPE 的外推能力作预训练基础),依次扩展到 32、64,最终 128 帧/迭代;帧数少的阶段用更大 batch size 提升效率,帧数增大后按显存限制相应减小 batch size。

长程 rollout:记忆注入与保留机制(Memory Injection and Retention Mechanisms):输入潜变量序列 x={x¹,…,x^L} 切分为记忆段 x_mem={x¹,…,x^M}(前 M 帧)与未来预测段 x_future={x^{M+1},…,x^L};M 的取值依分辨率而定——高分辨率取更小 M、低分辨率取更大 M,以在不同配置下保持一致的”记忆时长”(具体数值未披露)。记忆段在前向过程中时间步固定为 t=0(不加噪,x_t^T = x_0^T 当 T≤M),只保留历史信息、不参与去噪预测;未来段则按 t~U(0,1000) 走完整扩散去噪。

记忆曲线自适应损失(Memory Curve Adaptive Loss, MCAL):受 Ebbinghaus 遗忘曲线启发,对距记忆模块越近的帧赋更高损失权重(强调精确记忆保持),对越远的未来帧权重指数衰减(给生成更多自由度):w(T)=e^{−λT},总损失 L_total=Σ_T w(T)·(L_MSE^T + L_VB^T),其中 L_VB 沿用 DiT 论文的变分下界损失项,λ 为衰减率超参(具体数值未披露)。

ACTION-conditioning:论文正文以”explicit controllability”泛泛带过、具体动作空间的例子放在论文未随 arXiv 版本公开的 Appendix(正文多处写”Examples can be found in the Appendix”但该版本 PDF 无附录内容)。项目主页第 2 节”Action Controllability”演示了以**转向命令(左转/直行/右转)**控制 ego 车辆的能力(6 秒、12Hz、288×512 片段),可确认存在离散命令式动作条件,但具体注入方式(cross-attention/拼接等)未见文本披露。

场景多样性增强:基于 DiT 联合做 I2V 与 T2V 训练,并用多模态基础模型(InternLM-XComposer-2.5,论文引用 [60])对驾驶数据集重新打标——prompt 以相机位置信息为前缀,要求模型描述天气、时间、地点等场景信息,车道布局/物体等上下文信息,以及 ego 与他车动作等动态信息,以此扩充文本多样性驱动生成多样性。

数据

  • 训练数据规模:论文摘要与 Table 1 均写”trained on over 1700 hours”/1745 小时(Table 1 “Data Scale” 列,Ours=1745h),量级与 Vista 所用 OpenDV-YouTube(约 1740h)接近,但论文正文未说明是否直接复用 OpenDV 数据集或另有采集/清洗流程——具体数据来源、采集渠道、清洗/过滤规则均未披露(“请参阅附录”,但本 arXiv 版本无附录内容)。
  • 评测/演示数据集:图 5 标注”Our long-term generation results on the opendv2k dataset”,即长时程生成结果在一个称为 “opendv2k” 的数据集上展示,具体与 OpenDV-YouTube 的关系(同一数据集的别名,还是另一子集)论文未说明。
  • 动作标注/sim-vs-real/co-training 细节:论文未给出(无 Appendix 内容可查),仅能从项目主页演示视频反推存在转向命令标注。
  • 文本增强:如上,用 InternLM-XComposer-2.5 对训练片段重新生成密集 caption(场景/上下文/动态三类信息 + 相机位置前缀),具体重新标注的样本量/覆盖率未披露。

训练方法

  • 目标函数:标准扩散噪声预测 MSE 损失 + DiT 变分下界损失(L_VB),按帧序号做 MCAL 时间衰减加权(见”模型架构”)。
  • 多阶段训练:ETST 课程学习——16→32→64→128 帧逐步扩窗;STCM 在每次迭代随机采样分辨率缩放因子 α∈[1,4] 动态调整分辨率/序列长度配比;两者组合使模型能在显存受限的前提下间接学到高分辨率+长序列的联合表征。
  • 推理 rollout:迭代式自回归——每次生成一段未来帧,把记忆段(含最近历史)作为无噪声条件继续下一段预测,累积拼接到 1500+ 帧。
  • 联合 I2V/T2V 训练:同一 DiT 骨干同时接受图像条件(I2V)与文本条件(T2V)两类输入,配合文本增强扩大生成多样性。
  • 关键超参(batch size、学习率、优化器、总训练步数等):论文未披露(本 arXiv 版本无 Appendix/实验设置细节小节,正文 4.1 节仅写”Please refer to Appendix”)。

Infra(训练 / 推理工程)

  • 训练硬件(GPU 型号/数量/GPU-hours)未披露。论文仅泛泛提及”高分辨率时空建模带来的显著 GPU 显存需求”是既有方法的瓶颈,STCM/ETST 正是为缓解该瓶颈设计,但未给出自身训练所用的具体 GPU 型号、卡数或总训练时长(对比 Vista 论文披露 128×A100、Delphi 披露 8×A100/A800,InfinityDrive 本版本无对应披露)。
  • 并行策略/精度:未披露。
  • 推理侧:论文未给出具体 FPS、控制频率(Hz)与端到端延迟数字;仅从生成结果反推帧率为 10Hz(与 Table 1 “Frame Rate” 列一致),且长程质量可维持到约 1200 帧(定性描述,见”评测 benchmark”)后开始参考基线对比,未做实时化 profiling。
  • 代码/权重发布:未见官方 GitHub 仓库(搜索 “InfinityDrive” 未命中 SenseAuto/清华相关的代码仓库,仅有同名但无关的第三方项目);论文未在 Hugging Face 任何仓库 README 中被引用,因此没有对应的 HF Papers 聚合页(访问 huggingface.co/papers/2412.01522 返回 404)。

评测 benchmark

以下均为论文 Table 2/Table 3 一手数据(标 * 为原论文数字,其余为作者复现/自身结果);“short term”按 25 帧评测,“long term”按 100 帧评测:

① 短时程 / 长时程生成质量对比(Table 2,FID/FVD 越低越好)

设置方法FID↓FVD↓
short termDriveGAN*73.4502.3
short termDriveDreamer*52.6452.0
short termWoVoGen*27.6417.7
short termDrive-WM*15.8122.7
short termGenAD*15.4184.0
short termVista*6.989.4
short termStreamingT2V111.01792.68
short termOurs10.9370.06
long termSVD-XT42.99275.08
long termVista34.61234.60
long termStreamingT2V-SVDXT181.221255.30
long termOurs14.92113.91

关键结论(论文原话口径):短时程设置下 InfinityDrive 取得最低 FVD(70.06),但 FID 不敌 Vista(6.9 < 10.93);长时程设置下 InfinityDrive 的 FID 与 FVD 同时全面最优,且论文图 3(FID/FVD 随生成帧数 40/80/120 演变曲线,仅描述趋势未列数值)显示其分数保持稳定,而 Vista/SVD-XT/StreamingT2V 随帧数增加均明显上升。

② 定性长程生成:同一历史帧条件下,SVD-XT 在 80 帧后开始模糊过饱和,Vista 最终丢失细节,StreamingT2V 出现细节丢失与不一致;InfinityDrive 可维持到 1200 帧仍保空间细节与长短程时间一致性(图 4 红框标注对比)。摘要与结论声称完整生成时长可达**超过 1500 帧(约 2 分钟)**的一致视频。

③ 消融研究(Table 3,含 ETST/STCM/MCAL 三个组件)

ETSTSTCMMCALFID↓FVD↓
23.88175.17
17.51117.31
17.40115.62
14.92113.91

逐项加入均带来提升:ETST 贡献最大的单项降幅(23.88→17.51 / 175.17→117.31),STCM 带来小幅进一步提升,MCAL 最终把 FID 从 17.40 降到 14.92(FVD 115.62→113.91)。

④ 多样性评测:无量化指标,仅定性对比(图 8/9)——同一历史帧+不同噪声下,InfinityDrive 在 0-20 帧内忠于历史条件、之后演化出不同建筑结构与交通参与者;同一文本条件+不同噪声下(T2V)能保持天气/光照一致同时生成不同建筑与车辆布局,而 Vista/SVD 在相同条件下输出几乎不变。

创新点与影响

  • 贡献:(1) 时空协同建模模块(动态信息密度调整 + skip-ROPE)+ 扩展时间跨度训练策略,首次在 576×1024 分辨率下把训练序列做到 128 帧/迭代,绕开”高分辨率与长序列不能同时训练”的显存瓶颈;(2) 记忆注入/保留机制 + 记忆曲线自适应损失,把一致生成时长从此前方法的数秒/十几秒(如 Vista 15s)推到超过 1500 帧(约 2 分钟),同时长时程 FID/FVD 在论文对比中全面最优;(3) DiT 骨干上的 I2V/T2V 联合训练 + 文本重标注方案,缓解了既有驾驶世界模型”同条件生成结果高度雷同”的多样性不足问题。
  • 改变了什么:论文自称是”the first driving world model”实现分钟级、高保真、多样化的三者兼得(此前工作往往三选二,如 GAIA-1 长时程但低分辨率、Vista 高分辨率但仅 15 秒);Table 1 的横向对比把自己定位为同时刷新分辨率×时长×数据规模三维指标的新基线。
  • 官方自陈局限(结论 “Limitations and future work”):论文明确说明由于工作量限制,本文主要聚焦于解决时间一致的长时程、高保真视频生成这一个挑战;作者将 InfinityDrive 定位为未来可扩展为多视角、可控驾驶世界模型的基础模型,通过生成符合真实分布且带标注的合成驾驶视频,为感知模型训练提供数据——这意味着当前版本未验证多视角一致性、未验证下游感知/规划任务的实际增益(不同于 Delphi 论文验证了对 UniAD 规划性能的提升)。
  • 未公开事项:无官方代码/权重发布,无 Hugging Face 页面收录,且本 arXiv 版本正文多次引用的 Appendix(实验设置、动作标注示例等实现细节)实际未包含在已发布的 PDF/HTML 中(v1/v2 均如此),导致 GPU 数量、训练超参、动作条件具体注入方式等工程细节均无法从一手材料验证。

原始链接

一手源存档(sources/)