一句话定位
NVIDIA 把通用世界基础模型 Cosmos-1 WFM 针对自动驾驶域后训练出一整套专用模型 Cosmos-Drive(前视/多视文生视频 + HDMap/LiDAR ControlNet 精确布局控制 + 单视转多视扩展 + 野外视频自动标注 + LiDAR 生成),并在其上搭建可扩展合成数据生成(SDG)流水线 Cosmos-Drive-Dreams:从结构化标注或网上行车视频出发,渲染像素对齐的 HDMap 条件视频 → LLM 提示改写造多样天气/时段 → 生成单视高保真视频 → 扩展成 6 视角 → VLM 拒绝采样过滤,专门批量制造长尾/安全关键(暴雨、浓雾、雪夜、行人突入、急停)驾驶数据;实验证明合成数据在 3D 车道线检测、3D 目标检测、LiDAR 3D 检测、驾驶策略学习四类下游任务上都能涨点(尤其 corner case),并开源了模型权重、工具包与 81,802 条合成视频数据集。
背景与定位
自动驾驶是最”吃数据”的物理 AI 领域,而真实世界采集 + 标注多视角、时序一致、带精细语义标签的驾驶数据代价极高;更棘手的是长尾 / 安全关键场景(突然横穿的行人、异常车辆行为、罕见路型、极端天气)在真实数据中天然稀缺,但恰恰是训练鲁棒感知/策略模型所必需。纯用自然采集数据训练的模型在 corner case 上泛化差,直接威胁部署可靠性。
论文把驾驶合成数据方法分成三派并指出各自短板(Related Work §5):
- 物理引擎仿真(CARLA/MetaDrive/AirSim/LGSVL):可控但缺照片级真实感、覆盖长尾需大量人工。
- 重建式渲染(NeRF / 3DGS,UniSim、OmniRe、3DGRUT):真实感高、可闭环,但受原始观测视角分布约束,无法凭空造全新场景、难改天气/光照。
- 生成式仿真(Drive-WM、Panacea、MagicDrive、Delphi、GAIA-1/GAIA-2、Vista、DriveDreamer):可扩展、多样,但受限于训练分布,罕见场景本身在真实数据里就少,生成时难以高保真复现。GAIA-2 的思路是把训练数据堆到 14,000 小时来扩覆盖。
Cosmos-Drive 的定位就是走生成式这一派,但用大规模预训练世界基础模型的先验来突破”训练分布约束”——直接站在通用 Cosmos-1 WFM(在数千万条物理视频上预训练)肩上做驾驶域后训练,再靠 20,000 小时精心平衡的行车数据补长尾/区域特性。范式上这是把 Cosmos WFM 的”预训练通才 → 下游专才 post-training”方法论落到自动驾驶,并配上完整的 数据飞轮(Data Flywheel):训下游模型 → 检测数据缺口/长尾 → 用 Cosmos-Drive-Dreams 定向补数据 → 再训。模型架构承袭 DiT + ControlNet 体系。
注:本工作是 Cosmos 生态在驾驶垂域的应用层,基座是 Cosmos-1 (Cosmos-Predict1),控制机制承袭 Cosmos-Transfer1(arXiv 2503.14492,多模态自适应控制)。
模型架构
基座是 Cosmos-7B-Text2World——7B 文生视频扩散 WFM,DiT 架构,在数千万条物理相关视频 clip 上预训练。Cosmos-Transfer1 在其上加多个 ControlNet(分割图 / Canny 边缘 / 深度 / 模糊视频控制)。Cosmos-Drive 把这套东西后训练成一套 6 个模型的驾驶专用套件(命名统一为 Cosmos-[ModelName]-Sample-AV):
| 模型 | 作用 | 从谁 fine-tune | 训练配置 |
|---|---|---|---|
| Cosmos-7B-Sample-AV | 前视文生视频基座 | Cosmos-7B-Text2World(RDS 前视微调) | batch 64 / 140k 步 / LR 1.5e-5 |
| Cosmos-7B-Multiview-Sample-AV | 6 视角文生视频基座 | Cosmos-7B-Text2World(RDS 六视角) | 见 Cosmos-1 §6.3 |
| Cosmos-Transfer1-7B-Sample-AV | HDMap/LiDAR 精确布局控制(单视) | 基座冻结 + 训 ControlNet 分支 | batch 64 / 25K 步 / LR 5e-5 |
| Cosmos-7B-Single2Multiview-Sample-AV | 单视 → 多视(至多 6 视)扩展 | Cosmos-7B-Multiview-Sample-AV | batch 32 / 30K 步 / LR 5e-5 |
| Cosmos-7B-Annotate-Sample-AV | 野外视频 → HDMap + LiDAR 深度标注 | Cosmos-7B-Sample-AV | batch 32 / 30k 步 / LR 2e-5 |
| Cosmos-7B-LiDAR-GEN-Sample-AV | HDMap/RGB 条件 LiDAR 点云生成 | Cosmos tokenizer + WFM | 见下 |
1) Cosmos-Transfer1-7B-Sample-AV(精确布局控制,图 4)
为让生成视频能训布局相关感知模型(3D 车道线 / 3D 框),生成内容必须精确对齐底层场景布局与运动。做法:在城市尺度 3D 空间里画 3D cuboid、车道线、路沿、杆、斑马线、路面标记、红绿灯、交通标志,用 ego 相机内外参渲染成 2D 视频帧——称 HDMap Video,对应的 ControlNet 记为 [HDMap]。HDMap 提供 ego 相机与道路几何的相对位姿,使 ControlNet 能模拟不同 ego 轨迹、造罕见/安全关键场景(应急车辆、急转、复杂并线)。另训一支 LiDAR ControlNet([LiDAR])做更细粒度控制。HDMap 与 LiDAR 走分离分支,推理时可选择性融合。训练时基座扩散模型冻结(因基座已在驾驶域后训练),只训 control 分支。
2) Cosmos-7B-Single2Multiview-Sample-AV(单视→多视,图 7)
从前视视频 + 多视提示 +(可选)多视 HDMap/LiDAR,预测固定车载 rig 的多视角视频。关键设计:
- 条件视图用干净(clean)video token而非带噪 token 输入,每个视图附一个输入/输出二值指示位(图 7a)。
- 把输入视图 token 与被去噪 token 沿序列维拼接,使所有 DiT 块的自注意力跨全部视图联合注意;交叉注意力按视图独立(每视图自己的文本 embedding)。配合 per-view view-embedding,可灵活指定条件哪些视图、生成哪些视图(图 7b,transformer 块换成 MV transformer 块)。
- 分辨率改为 576×1024,训 57 帧;为控上下文长度,训练时选”输入视图 + 5 个输出视图中的任 3 个”共 4 视图成 batch,推理时可同时生成全部 5 个输出视图。
- 另训多视 ControlNet(HDMap/LiDAR),用同一多视架构。
3) Cosmos-7B-Annotate-Sample-AV(野外视频标注,图 9)
把互联网单视 RGB 视频转成 HDMap + LiDAR 深度(近似真实 LiDAR 扫描),从而对无地图/无 LiDAR 的野外视频做”重仿真”。架构:把输入视频 token 与去噪 token 沿通道维拼接做条件;为支持多输出模态(HDMap/LiDAR),引入每模态一个可训练 context embedding,替换交叉注意力里的文本 token(因给定视频推 HDMap/LiDAR 不需要文本提示),使模型专注模态特定条件,也便于加新模态、混训缺某些输出的数据集。
4) Cosmos-7B-LiDAR-GEN-Sample-AV(LiDAR 生成,图 10-11)
把 LiDAR 表示为 range map(笛卡尔 (x,y,z) → 球坐标 (r,θ,φ))。难点是运动补偿反演:真实 LiDAR 转一圈约 0.1s(10 Hz)期间车在动,需按 NVIDIA 传感器模型估每点时间戳——(1) 128 束垂直非均匀分布(两端稀疏 −25°/15°、中间密 −6°~2°),按仰角 θ 匹配到 range image 的行;(2) 每个发射时刻 128 束方位角略不同呈之字形,用方位角 profile 校正 φ 定列,列索引即时间戳估计。不做这些校正会出 ghost 像素。预处理:tokenizer 用 float32(深度对精度敏感)、扩散阶段才转 bfloat16;每行 range map 重复 4 次引入冗余对抗稀疏;range 值裁到 2~98 百分位并归一化到 [−1,1]。生成模型:先把 Cosmos 图像/视频 tokenizer 微调到 range map 模态(不改网络结构),再建两个生成模型——(a) HDMap 条件:clean HDMap latent 与 noisy LiDAR latent 沿通道维拼接,精确对齐布局 + bbox 控制运动体(先从 HDMap/bbox 参数表示采 3D 点、反做运动补偿再投 range map);(b) RGB 条件:仿多视生成任务,用前 / 后左 / 后右三路 RGB 合成对应 LiDAR。接入提示改写后还能按天气改 LiDAR(雨天点云 ray drop 增多,因湿表面吸能)。
数据
- RDS(Real Driving Scene):约 360 万条 20 秒 6 视角视频 clip ≈ 约 20,000 小时,NVIDIA 内部行车平台采集,每 clip 6 路相机;从大标注语料里按目标属性分布(车密度、天气、光照、ego 车速、行为)挑选。(此即 Cosmos-1 用的 RDS。)
- RDS-HQ:750 小时高质量 30-FPS 6 视角行车视频,配 HDMap + 3D cuboid 标注 + 时间戳对齐的 LiDAR 点云(承 Cosmos-Transfer1)。是布局控制/标注/LiDAR 模型的后训练集。
- 相机 / LiDAR 规格:相机 30 FPS、LiDAR 10 FPS,每帧 LiDAR 对应 3 连续相机帧;128 束 LiDAR;共 7 路相机视图(front_wide_120fov、cross_left/right_120fov、rear_left/right_70fov、rear_tele_30fov、front_tele_30fov)。
- Single2Multiview 训练用:2,000 小时内部行车视频(batch 32)。
- 开源数据集(HF):5,843 条 10 秒 clip(源自 RDS-HQ)的完整标注(HDMap 9 类图层 + 3D 物体 12 类 + 相机内外参 + 位姿 + LiDAR raw);81,802 条合成视频(= 5843 clip × 2 chunk × 7 天气变体,每 chunk 121 帧)。天气变体:Foggy / Golden_hour / Morning / Night / Rainy / Snowy / Sunny。总量约 3TB(纯合成视频约 700GB)。许可 CC BY 4.0,创建于 2025-05-20。
- HDMap 标注(polyline/polygon/cuboid):车道线、车道、路沿、等待线、斑马线、路面标记、杆、红绿灯、交通标志。3D 物体类别:Automobile / Heavy_truck / Bus / Train_or_tram / Trolley_bus / Other_vehicle / Trailer / Person / Stroller / Rider / Animal / Protruding_object。
- SDG 产出配比:每条真实 clip 生成 7× 合成 clip(对应 7 天气/时段);下游训练用 $R_{s2r}$(每 epoch 合成:真实比例)控制实际取用量。合成视频分辨率 704×1280 / 121 帧 / 30 FPS;多视版取前 57 帧扩成 576×1024。拒绝采样丢弃约 3%。
训练方法
整体是**“通用 WFM → 驾驶域后训练 → 专用条件模型 fine-tune”**三级:
- 驾驶域后训练:Cosmos-7B-Text2World 在 RDS 前视上微调 → Cosmos-7B-Sample-AV(batch 64 / 140k 步 / LR 1.5e-5,小学习率保护预训练知识);六视角版扩成 Cosmos-7B-Multiview-Sample-AV。
- 条件模型 fine-tune(均在 RDS-HQ 精细标注上,基座思路是尽量复用 WFM 知识):
- Cosmos-Transfer1-7B-Sample-AV:冻结基座,只训 HDMap/LiDAR ControlNet 分支(batch 64 / 25K 步 / LR 5e-5)。
- Cosmos-7B-Single2Multiview-Sample-AV:先在 2000 小时内部数据训基座(batch 32 / 30K 步 / LR 5e-5),再冻结基座训 HDMap/LiDAR 多视 ControlNet(batch 32 / 20K 步 / LR 5e-5)。
- Cosmos-7B-Annotate-Sample-AV:RDS-HQ 上 fine-tune(batch 32 / 30k 步 / LR 2e-5)。
- Cosmos-7B-LiDAR-GEN-Sample-AV:先微调 tokenizer 到 range map 模态,再训 HDMap/RGB 条件扩散生成。
- SDG 流水线的两个即用组件(不训,直接调开源 LLM/VLM):
- Prompt Rewriter:用 Qwen2.5-7B-Instruct 把原始视频 caption 改写成多样提示,只改天气/时段(雾/雨/雪、清晨/黄金时刻/夜晚),保留场景核心内容与空间布局以与 HDMap 条件一致(论文给了完整 system prompt 和 rainy/snowy/foggy 改写示例)。
- Rejection Sampling:用 Qwen2.5-VL-7B-Instruct 做自动 VLM 视觉质检,检测物体消失、形变、纹理/渲染故障、时序不连续等,标 Clean/Artifacted,丢弃 Artifacted,实现无人力可扩展质控。
目标函数沿用 Cosmos 扩散 WFM 的去噪训练(见 cosmos-predict),本文未额外改动训练目标,创新集中在架构改造 + 条件注入 + 流水线设计。
Infra(训练 / 推理工程)
- GPU 数量 / GPU-hours / 并行策略 / 精度:本文未披露具体后训练算力(基座 Cosmos-1 曾在 10,000×H100 上训约 3 个月,但本文的驾驶域后训练规模未给)。仅公开了各模型的 batch size / 步数 / 学习率(见上表)。LiDAR tokenizer 用 float32、扩散阶段 bfloat16。
- 数据并行:工具包的 HDMap 视频渲染与推理基于 Ray 做数据并行(多 worker 自动拆分 clip)。
- 推理 FPS / 控制频率 / 时延 / 边缘 HW:未披露量化数字。论文结论明确点出局限:依赖计算重的扩散模型,使大规模生成在时间与资源上都很昂贵,留作未来优化。(可粗略推知:每条 121 帧 704×1280 视频 + 多视扩展需多次 7B 扩散采样,成本远非实时。)
- 相机模型:工具包支持 pinhole 与 f-theta 两种相机模型渲染 HDMap,并提供 f-theta → pinhole 的图像矫正脚本。
- 部署形态:开源模型权重(HF,多数走 Cosmos-Transfer1-7B-Sample-AV 等 model card)、SDG 工具包(GitHub,含 HDMap 渲染 / 交互式 3D 轨迹编辑 GUI / 第三方数据集如 Waymo 转换脚本 / WebUI 轨迹编辑)、81,802 条合成数据集(HF,CC BY 4.0)。Cosmos-7B-Annotate-Sample-AV 论文发布时标注为”under review / 待发布”。
评测 benchmark
评测思路是**“合成数据能否提升真实下游任务”**,覆盖 4 类任务,普遍在 corner case(暴雨/浓雾/夜晚)上增益最大。基线对照包括仅真实数据(w/o SDG)与像素级增广库 Albumentations。
3D 车道线检测(检测器 LATR;Waymo Open + RDS-HQ,表 1)
Cosmos-Drive-Dreams 在 Albumentations 增益有限的场景下显著涨点。在 RDS-HQ (2k) 上 rainy / foggy 测试子集 F1 分别 +10.4% / +9.4%,整体测试集 +6.4%(Waymo 的天气子集是 Extreme Weather / Night,不细分 rainy/foggy)。RDS-HQ (2k) 关键数字($R_{s2r}{=}1$):
| 子集 | w/o SDG F1 | w/ SDG F1 |
|---|---|---|
| All | 0.532 | 0.566 |
| Rainy | 0.458 | 0.506 |
| Foggy | 0.524 | 0.572 |
| Night | 0.547 | 0.581 |
随真实数据量(2k/5k/10k/20k)扫描($R_{s2r}{=}0.5$):低数据区(2k)增益最大 +6.0%,foggy 达 +9.4%;即便 20k 真实 clip,foggy 仍 +2.4%——增益随真实数据增多而收窄是饱和效应而非 SDG 上限。
3D 目标检测(检测器 BEVFormer,时序 transformer;表 2)
指标 LET-AP / LET-APH / LET-APL(纵向误差容忍 AP)。设定 A(增广真实训练集,$R_{s2r}{=}1$,LET-AP):
| 数据 | 子集 | w/o SDG | w/ SDG |
|---|---|---|---|
| RDS-HQ (2k) | All | 0.299 | 0.337 |
| RDS-HQ (2k) | Rainy | 0.280 | 0.323 |
| RDS-HQ (2k) | Foggy | 0.265 | 0.308 |
| RDS-HQ (20k) | All | 0.459 | 0.489 |
设定 B(SDG 用与真实 clip 不相交的 HDMap 标注生成):用 3 档 HDMap(2k/20k/52k)产合成子集(16k/160k/420k);多视版 2 档 HDMap(2k/11k)产 10k/31k。在人工标注集 RDS-HQ-HL 上,1K 真实 clip + SDG ≈ 线性插值下的 93K 真实 clip;给 1K 真实加 SDG 带来 +55.0% 相对提升(+14.5% LET-AP)≈ 把真实数据翻 9.3×。SDG 量与性能正相关,仍有继续 scale 空间。
LiDAR 3D 目标检测(检测器 Transfusion-LiDAR + JiSAM 联合训练;表 3)
从 HDMap 标注生成 150k 帧 LiDAR,与真实联合训练:
| 数据 | w/o SDG mAP | w/ SDG mAP |
|---|---|---|
| RDS-HQ (1k) | 0.240 | 0.250 |
| RDS-HQ (2k) | 0.289 | 0.297 |
(分类别看 Bus 从 0.155→0.181、0.225→0.248 提升最明显;对更大更远物体召回改善。)
驾驶策略学习(transformer 策略,NVIDIA Alpamayo;表 4)
输入 9 帧前视,预测轨迹,指标 minADE(5s 预测,RDS-Bench[Policy],越低越好)。加 SDG 一致提升,小数据集尤甚:
- 30k 真实:$R_{s2r}{=}0$ 1.307 → $R_{s2r}{=}3.0$ 1.183;135k 真实:1.026 → 0.976(即使 SDG 仅基于 50k 子集生成,最大规模仍受益,说明 SDG 增多样降过拟合)。
- 降数据需求:要达 minADE=1.35,可用 60k 真实,或 50k 真实 + $R_{s2r}{=}0.5$,或 39k + $R_{s2r}{=}3.0$。
- 定向补长尾:VRU(弱势道路使用者)/急左转 corner case——用 Annotate 模型给 1000 条无标注 clip 造 HDMap,再生成 3k SDG(占训练集 ≤2%),VRUs minADE 0.774→0.692、left-turn 1.269→1.186,且不损伤总体驾驶性能。
创新点与影响
核心贡献
- 首个把 Cosmos WFM 系统性专用化到自动驾驶域:从通用 Cosmos-1 后训练出一套 6 模型的 Cosmos-Drive,覆盖前视/多视文生视频、HDMap/LiDAR ControlNet 精确布局控制、单视→多视扩展、野外视频自动标注、LiDAR 点云生成——高保真、多视角、时空一致、几何可控。
- 完整可扩展 SDG 流水线 Cosmos-Drive-Dreams:结构化标注/野外视频 → HDMap 条件渲染 → LLM 提示改写造多样天气 → 视频生成 → 多视扩展 → VLM 拒绝采样,端到端批量造长尾/安全关键数据,配”自动驾驶数据飞轮”闭环。
- 野外视频标注 = 打开互联网规模数据:Annotate 模型从无标注 dashcam 视频(如 Nexar 碰撞数据集)反推 HDMap + LiDAR 深度,实现对网络视频的”重仿真”与 corner case 变体生成,绕开昂贵传感器套件与人工标注。
- 实证下游收益:3D 车道线 / 3D 目标 / LiDAR 3D 目标 / 策略学习四类任务全面涨点,corner case 增益最大;量化出”1K 真实 + SDG ≈ 93K 真实”、“SDG 可把真实数据需求降约 1/3”等有说服力的数据效率结论。
- 开源:模型权重 + SDG 工具包(含交互式 3D 轨迹编辑 GUI、Waymo 转换)+ 81,802 条 CC BY 4.0 合成数据集,经 NVIDIA Cosmos 平台发布。
影响:把世界基础模型从”通用视频预测”落成”自动驾驶合成数据引擎”的代表作,后续演进为 Cosmos-Transfer2.5 的 AV/multiview 能力(工具包 2025-10 加入 World Scenario Rendering)。它示范了 WFM 先验 + 结构化控制 + 提示改写造长尾数据的范式,与 GAIA、Drive-WM 等生成式驾驶世界模型同处一条演进线,但更强调可控性 + 多模态(RGB+LiDAR)+ 下游可用性。
已知局限(论文自述):依赖计算重的扩散模型,大规模生成时间/资源开销大(留作未来优化);生成质量仍需 VLM 拒绝采样兜底(丢约 3%);设定 B 的”1K≈93K”是线性插值外推,实际饱和效应存在;Cosmos-7B-Annotate-Sample-AV 与 LiDAR-GEN 部分组件发布时尚在评审/陆续放出。
原始链接
- arxiv_abs: https://arxiv.org/abs/2506.09042
- arxiv_pdf: https://arxiv.org/pdf/2506.09042
- project_page: https://research.nvidia.com/labs/toronto-ai/cosmos_drive_dreams/
- github: https://github.com/nv-tlabs/Cosmos-Drive-Dreams
- hf_dataset: https://huggingface.co/datasets/nvidia/PhysicalAI-Autonomous-Vehicle-Cosmos-Drive-Dreams
- hf_collection: https://huggingface.co/collections/nvidia/cosmos-drive-dreams
- hf_model (Cosmos-Transfer1-7B-Sample-AV): https://huggingface.co/nvidia/Cosmos-Transfer1-7B-Sample-AV
- hf_model (Single2Multiview): https://huggingface.co/nvidia/Cosmos-Transfer1-7B-SingleToMultiView-Sample-AV
- hf_model (Multiview base): https://huggingface.co/nvidia/Cosmos-Predict1-7B-Text2World-Sample-AV-Multiview
- toolkit: https://github.com/nv-tlabs/Cosmos-Drive-Dreams/tree/main/cosmos-drive-dreams-toolkits
- 基座论文 Cosmos-1: https://arxiv.org/abs/2501.03575 | Cosmos-Transfer1: https://arxiv.org/abs/2503.14492
一手源存档(sources/)
- arxiv-2506.09042.pdf (论文全文 v3,24MB,已 pdftotext 精读)(arXiv 原文 PDF,不入 git)
- cosmos-drive-dreams—github-readme.md (GitHub README,含模型清单/HF 链接/下载脚本/SDG 五步 walkthrough/引用)
- cosmos-drive-dreams—hf-dataset-card.md (HF 数据集卡,含 81,802/5,843 计数、CC BY 4.0、文件结构、相机/LiDAR 同步、物体类别)
- cosmos-drive-dreams—project-page.md (NVIDIA 项目页快照,含简化版评测表与贡献者名单)