一句话定位
Cosmos-Transfer1 是在 Cosmos-Predict1 扩散世界模型上加装多路 ControlNet(分割 / 深度 / Canny 边缘 / 模糊、AV 场景另加 HDMap / LiDAR)并引入**逐时空位置可调的控制权重图(spatiotemporal control map)**的条件世界生成模型:同一帧画面里可以让前景用高约束模态(边缘/模糊)保形状颜色,背景用低约束模态(深度/分割)换出多样场景,从而做各类 world-to-world transfer——核心落地场景是机器人 Sim2Real 数据增广与自动驾驶数据 enrichment;论文还给出一套 GB200 NVL72 并行推理方案,把单条 5 秒 720p 视频生成压到 4.2 秒(快于播放时长),并把代码权重全部开源。
背景与定位
CG 仿真器(机器人操作场景、AV 仿真)渲染的视频存在 synthetic-to-real 的域差(domain gap),直接拿去训策略/感知模型会因风格失真而泛化差。经典做法是用 GAN(RetinaGAN、RL-CycleGAN)或近年 ControlNet 类扩散模型把仿真渲染”翻译”成照片级真实感,同时保留仿真自带的深度/分割等结构标签。Cosmos-Transfer1 把这条路线接到 NVIDIA 的世界基础模型(WFM)体系里:以 Cosmos-Predict1(在数千万小时物理相关视频上预训练的 DiT 扩散 WFM)为基座做后训练(post-training),沿用 Zhang et al. (2023) 的 ControlNet 思路、并按 Chen et al. (2024, PixArt-δ) 的做法把 ControlNet 从 UNet 搬到 DiT 架构。
区别于此前”单模态 ControlNet”工作,Cosmos-Transfer1 的核心创新是空间/时间自适应的多模态融合:不同模态在图像的不同区域、不同时刻可以被赋予不同权重,而不是简单地把所有控制信号等权重叠加。这让用户可以精确指定”前景用什么约束、背景用什么约束”,服务于 Sim2Real 场景里”保物体形状、换环境细节”的典型需求。论文明确把 Cosmos-Transfer1 定位为 Cosmos WFM 三大分支之一(predict 预测 / transfer 迁移 / reason 推理),后续 NVIDIA 又在此基础上做出面向驾驶垂域的 Cosmos-Drive-Dreams(HDMap/LiDAR ControlNet 即直接复用/扩展自本文的 AV 分支)。
注:GitHub 仓库显示 2026 年 NVIDIA 已发布统一架构的 Cosmos 3,Cosmos-Transfer1 仓库现”仅限维护”;本页对象是 2025-03 发布的原始 Cosmos-Transfer1(含后续社区补的 Keypoint 模态与蒸馏版,见下)。
模型架构
基座:Cosmos-Transfer1-7B 由预训练的 Cosmos-Predict1-7B-Video2World(DiT 扩散 WFM,interleaved 自注意力/交叉注意力/FFN,AdaLN 按时间步调制,交叉注意力接文本)后训练而来;AV 专用版 Cosmos-Transfer1-7B-Sample-AV 则后训练自 Cosmos-Predict1-7B-Video2World-Sample-AV(在 dash cam 视频上微调过的 Predict1-7B-Video2World)。
ControlNet 设计(图 1-2):
- 每个模态一个独立的 control branch:由基座前几层 transformer block 复制权重初始化而来,本文固定用 3 个 conditional block(“经验上在控制效果与推理效率间取得较好平衡”)。
- control branch 的输出经过零初始化线性层后加回基座对应 block 的激活;训练时基座权重冻结,只训 control branch(继承 ControlNet 的标准做法)。
- N 路模态独立分别训练,推理时才融合(而非联合训练):好处是显存友好(训练时每次只需装一个 control branch)、不同模态可用不同/难以配对的数据训练、且推理时可自由增减模态。
自适应空间控制(本文核心机制):引入控制权重图 $\mathbf{w}\in\mathbb{R}^{N\times X\times Y\times T}$($N$ 模态数,$X,Y,T$ 为视频宽/高/帧数)。第 $i$ 个 control branch 第 $j$ 个 block 的激活 $\mathbf{h}_i^j$ 先与该模态、该时空位置的权重 $\mathbf{w}_i$ 逐元素相乘再加回主干,即 $\mathbf{w}_i\cdot\mathbf{h}_i^j$;若某位置多模态权重之和 >1 则归一化到 1。权重图可手工设计、按启发式规则(如前景/背景分割)生成,或由神经网络模块预测(论文用 VLM 驱动的 SalientObject 算法自动生成,见”评测”节)。
四种基础模态(Cosmos-Transfer1-7B):
- Vis(模糊):对输入视频做 bilateral blur(Tomasi & Manduchi 1998),训练时随机化模糊参数做增广;用于保留原始颜色/大致形状、只改纹理细节。
- Edge:逐帧提取 Canny 边缘(Canny 1986),训练时随机化阈值;用于只保留场景轮廓,给模型更多创作自由。
- Depth:DepthAnything2 提取深度图并归一化到 [0,1];用于保留 3D 几何。
- Segmentation:用 GroundingDino 从首帧 caption 检测物体、SAM2 在全视频提取分割掩码;掩码颜色随机化(不携带语义),用于保留场景布局同时给高自由度。
AV 专用模态(Cosmos-Transfer1-7B-Sample-AV):
- HDMap:车道线/路沿/停止线/杆/斑马线/路面标记/红绿灯/交通标志等高精地图标注,基于城市级预建 LiDAR 地图 + in-house 自动标注管线渲染,叠加 3D bbox 检测跟踪,人工 QA 复核;提供 ego 相机与道路几何的相对位姿,可模拟不同 ego 轨迹。
- LiDAR:10Hz LiDAR 与 30fps 相机通过时序插值/致密化对齐(每个相机帧取最近 LiDAR 扫描 + 前后各 2 个相邻扫描);静态点直接投影、动态点先按 3D bbox 插值再投影;用 kernel size=4 的 kernel 插值缩小投影空洞。
4KUpscaler:另训一个 ControlNet 把 720p 生成结果上采样到 4K;训练用 Real-ESRGAN 的退化方法造”劣化高分辨率块 → 恢复原块”的数据对;推理时 patch-based,把 4K 输出切成 3×3 网格(有重叠区),每个去噪步各网格分别推理、重叠区域取平均以保证边界无缝。
推理规格:继承自 Predict1-7B-Video2World,单次调用生成 5 秒、1280×704p、24fps 视频,对应 56,320(56K)token(计算:1280÷8(tokenize)÷2(patchify) × 704÷8÷2 × [(121−1)÷8+1] 帧 = 80×44×16);视频 tokenizer 为 Cosmos-Tokenize1-CV8×8×8-720p(因果、8×8×8 时空压缩率)。
数据
- Cosmos-Transfer1-7B 各 control branch 训练数据:复用 Cosmos-Predict1 的高质量精调数据集(论文未在本文重复给出规模数字,指向 NVIDIA 2025 Predict1 论文)。
- AV 专用数据集 RDS-HQ(Real Driving Scene HQ):新策展的 360 小时高质量自动驾驶数据集,含 HD map 与 3D bbox 标注;由 65,000 条 20 秒环视视频组成(约合 360 小时),配对 10Hz LiDAR 扫描,用 NVIDIA 驾驶平台采集;每条 clip 附密集 caption(强化相机安装位置、周边车流密度等领域细节的对齐)。
- TransferBench(本文自建评测集):600 个样本,覆盖三大 Physical AI 场景各 200 例——机械臂操作(随机采样自 AgiBot World 数据集)、驾驶场景(采样自 OpenDV 数据集)、第一视角日常生活场景(采样自 Ego-Exo-4D 数据集)。
- 机器人 Sim2Real 案例研究数据:用 NVIDIA Omniverse + Isaac Lab 程序化生成的 20 个厨房机器人操作场景(开合柜门、拿放常见厨具),机器人动作由自动化任务与运动规划算法(PDDLStream)计算;每场景配 6 条不同光照/场景细节/环境描述的文本 prompt,共 120 条视频(20×6)评测集;每场景同时输出 RGB、分割、深度。
- Prompt Upsampler 训练数据:每个模态各策展 100 万条(1M)视频的配对数据集(短 prompt ↔ 长 prompt),训练 2 个 epoch。短 prompt 由 Gemma-2-9B-it 从已有训练长 prompt 反向生成以保真度与多样性。
训练方法
- 训练目标:沿用 Cosmos-Predict1 的扩散去噪目标(denoiser $D$ 预测加噪视频 token 里的噪声 $\mathbf{n}$),ControlNet 版本扩展为条件去噪 $\mathbf{n}=D(\mathbf{x}_\sigma,\sigma,\mathbf{c})$,$\mathbf{c}$ 为控制模态 token;训练时基座权重冻结、只更新 control branch,属标准 ControlNet 训练范式。
- 分模态独立训练:$N$ 个 control branch 各自单独训练(不同模态数据可不同源/不配对),推理时按空间控制图融合——这是本文相比”联合训练多控制”方案的主要工程/方法选择,理由是显存效率、数据灵活性与推理时可插拔。
- Prompt Upsampler:为对齐用户短 prompt 与训练用长描述的分布 gap,按模态各微调一个独立的 Pixtral-12B,输入条件视频 + 用户短 prompt,输出结构一致、信息更丰富的长 prompt(论文给出分割图与深度图两个具体的输入输出示例);训练目标要求满足 Fidelity / Completeness / In-Distribution Consistency 三准则,用 FSDP2 训练。
- 自适应控制图的构造方法(评测阶段用到):文中提出 SalientObject 算法——用 VLM(如 GPT-4)读取参考帧、完整 caption 与逐 segment 短语列表,判断每个短语对应物体是前景还是背景,据此生成前景/背景二值控制图(前景赋 Vis/Edge 权重,背景赋 Depth/Seg 权重,或反之)。
Infra(训练 / 推理工程)
- 训练算力:每个 control branch 用 1024 张 NVIDIA H100 GPU 训练 2 到 4 周(依模态而定);论文未进一步拆分 GPU-hours、并行策略或精度细节。
- 实时推理并行方案(GB200 NVL72,本文重点工程贡献):GB200 NVL72 机架绑定 36 个 Grace CPU + 72 个 Blackwell GPU,any-to-any NVLink 网络。因 Cosmos-Transfer1-7B 参数量相对 LLM 很轻(7B)但单次推理要生成数万 token,本文没有沿用 LLM 常见的张量/上下文并行,而是设计了非注意力层纯数据并行 + 注意力层 head-parallelism 的策略:
-
单张 B200 GPU 具 192GB HBM,可完整放下整个 7B 模型;因此把整条 5 秒视频对应的 56K token 序列切分到多张 GPU,扩散过程中唯一的通信点在注意力层,用 all-to-all collective 让每张 GPU 处理全部 56K token 在单个注意力头上的计算。
-
模型有 32 个注意力头;classifier-free guidance 的正/负 prompt 去噪相互独立,被拆到两组 GPU 上;由此把注意力计算负载分布到 64 张 GPU,每张 GPU 对 56K query/key/value token 做注意力,即便用 Blackwell FMHA kernel 里最大的 query tile size 仍能占满每张 B200 的 SM。
-
实测结果(Tab. 5,生成一段 5 秒视频的耗时):
GPU 数 1 4 8 16 32 64 仅扩散耗时 141.0s 39.3s 20.1s 10.3s 5.4s 3.5s 端到端耗时 141.7s 40.0s 20.8s 11.0s 6.1s 4.2s 1→64 GPU 扩散耗时约 40× 加速;64 GPU 端到端 4.2 秒生成 5 秒视频,达到”生成快于播放”的实时吞吐(论文口径的”real-time generation throughput”)。
-
- HF 卡补充:推理仅测试过 BF16 精度;支持硬件为 NVIDIA Ampere / Hopper 微架构;测试硬件涵盖 H100 / A100 / GB200;加速引擎 PyTorch + flash attention。
- 部署形态:代码 Apache-2.0 开源,模型权重按 NVIDIA Open Model License 开放,托管于 HuggingFace;含 Llama Guard 3 安全护栏(独立许可)。
评测 benchmark
评测统一使用自建 TransferBench(600 例),三项指标:(1) 控制信号遵从度——Blur SSIM / Edge F1 / Depth si-RMSE / Mask mIoU;(2) 生成多样性——Diversity-LPIPS(同一控制输入配 K 个不同文本 prompt 生成 K 段视频,两两 LPIPS 取均值);(3) 整体生成质量——DOVER-technical Quality Score。
单模态 vs 多模态(Tab. 1):Vis 单模态在 Blur SSIM 最高(0.96),Edge 单模态在 Edge F1 最高(0.28);而 Cosmos-Transfer1-7B Uniform Weights(四模态各权重 0.25 均匀融合)虽在 Vis/Edge 对齐上只排第二,却拿到最优 Depth si-RMSE(0.47)与最高 Quality Score(8.54)——说明多模态融合虽在单一对齐指标上不是最优(每模态权重被稀释到 0.25),但综合质量最好。同时发现:Vis/Edge(密集结构信息)排除后多样性上升(LPIPS 0.37/0.31),Depth/Seg(稀疏结构信息)排除后多样性反而下降(0.25/0.23)——密集控制利于高保真复现,稀疏控制利于多样生成。
自适应空间控制案例(Tab. 2 / 图 6-7):用 SalientObject 算法把前景赋 Vis+Edge、背景赋 Depth+Seg(或反之互换)。前景 Vis 权重从 0→0.5 时前景 Blur SSIM 从 0.43 升到 0.81(Pearson 相关系数 0.93);背景 Depth 权重从 0→0.5 时背景 Depth si-RMSE 从 1.88 降到 0.52(相关系数 −0.92)——证明控制权重图对局部区域的可控性符合预期方向;互换前背景模态后 Diversity-LPIPS 也随之互换(FG: 0.01→0.12,BG: 0.03→0.33)。
机器人 Sim2Real 案例(Tab. 3,120 条视频):单模态模型(如 Cosmos-Transfer1-7B [Vis])在对应指标上最高(Blur SSIM 0.95),但 Quality Score 较低;引入前景机器人专用的空间控制图 Setting1/Setting2(前景用 Edge+Vis 或仅 Edge,背景全用 Segmentation)后,Quality Score 达到 9.57 / 10.42(论文原话:“两个 Cosmos-Transfer1-7B 配置在 Quality Score、Diversity-LPIPS、FG Mask mIoU 三项指标上都进入前三”),FG Mask mIoU 分别为 0.61 / 0.63(高于四个单模态模型的 0.54–0.57),验证了”保机器人形状、放开背景多样性”的实用价值。
AV 数据 enrichment 案例(Tab. 4,Cosmos-Transfer1-7B-Sample-AV):单用 LiDAR 的 3D-Bbox mAP 最高(46.50)、重投影误差最低(8.60),但 Lane mIoU 最差(48.19,因缺车道布局信息);单用 HDMap 的 Lane mIoU 更高(50.37)但 3D-Bbox mAP 较低(41.89);融合 HDMap+LiDAR 达到最高 Lane mIoU(51.55)、mAP(44.66)居中、重投影误差(8.67)接近纯 LiDAR,验证了多模态互补优于任一单模态。定性上还展示了融合模拟 LiDAR(Omniverse Sensor RTX API 生成)后模型仍能保留互联网预训练带来的世界知识,生成 AV 微调数据里没有的场景效果(暴雨/雾/夜晚等)。
创新点与影响
核心贡献
- 首个把 ControlNet 的空间自适应控制扩展到”时空控制权重图”:不同模态在不同空间位置、不同时间帧都可被独立赋权,突破此前 ControlNet 类工作”整段视频统一控制强度”的限制,直接服务于 Sim2Real 里”前景保真、背景多样”的实际需求。
- 模态独立训练 + 推理时融合的工程选择:降低大规模视频世界模型 ControlNet 训练的显存门槛,允许不同模态用不同/不配对数据训练,推理时任意增减模态组合。
- GB200 NVL72 实时推理方案:针对”7B 参数量小但单次生成海量 token”这一有别于 LLM 的特点,设计非注意力层数据并行 + 注意力层 head-parallelism(64 卡分摊 32 头),把 5 秒视频生成压到 4.2 秒,是较早给出视频扩散世界模型 GB200 实测吞吐数字的工作之一。
- 开源覆盖机器人 Sim2Real 与自动驾驶两条 Physical AI 应用线:代码/权重/评测脚本全开源,AV 分支(HDMap/LiDAR ControlNet + RDS-HQ 数据集构建方法)后来被 Cosmos-Drive-Dreams 直接沿用扩展为完整驾驶合成数据流水线。
论文自陈局限 / 后续演进:论文本身未列专门的 Limitations 小节,但从内容看——控制信号遵从度指标(如 Edge F1 普遍偏低,最高仅 0.28)表明像素级严格对齐仍有较大提升空间;GB200 实时方案仅针对固定 5 秒/720p/单条视频的 diffusion-only 场景,未讨论更长视频或更高分辨率下的可扩展性;4KUpscaler 的分块推理(3×3 网格)依赖重叠区域平均,边界质量对网格划分与去噪步数敏感。GitHub 后续新增了 Keypoint 模态与 Edge Distilled(单步蒸馏,速度提升,2025-08)等本文未覆盖的扩展;仓库 2026 年起标注为”仅限维护”,NVIDIA 后续演进方向转向统一的 Cosmos 3 平台。
原始链接
- arxiv_abs: https://arxiv.org/abs/2503.14492
- arxiv_pdf: https://arxiv.org/pdf/2503.14492
- project_page: https://research.nvidia.com/labs/dir/cosmos-transfer1/
- github: https://github.com/nvidia-cosmos/cosmos-transfer1
- hf_model (Cosmos-Transfer1-7B): https://huggingface.co/nvidia/Cosmos-Transfer1-7B
- hf_model (Cosmos-Transfer1-7B-Sample-AV): https://huggingface.co/nvidia/Cosmos-Transfer1-7B-Sample-AV
- hf_model (Cosmos-Transfer1-7B-4KUpscaler): https://huggingface.co/nvidia/Cosmos-Transfer1-7B-4KUpscaler
- hf_collection: https://huggingface.co/collections/nvidia/cosmos-transfer1-67c9d328196453be6e568d3e
- 基座论文 Cosmos-Predict1: https://arxiv.org/abs/2501.03575
- 下游应用 Cosmos-Drive-Dreams: https://arxiv.org/abs/2506.09042
一手源存档(sources/)
- arxiv-2503.14492(论文全文,通过 arXiv HTML 精读;未落盘 PDF)(arXiv 原文,不入 git)
- cosmos-transfer1—github-readme.md(GitHub README 快照,含模型清单、Cosmos 3 迁移公告、仓库统计)
- cosmos-transfer1—hf-card.md(HF 模型卡快照,含架构描述、I/O 规格、测试硬件)
- cosmos-transfer1—project-page.md(NVIDIA 项目页快照,含摘要与引用)