一句话定位

Cosmos 家族第二代世界基础模型:一个 flow-matching 视频生成模型(2B / 14B)把 Text2World、Image2World、Video2World 统一进单一架构(Predict2.5),用物理 AI 专用 VLM nvidia-cosmos-reason1 取代 T5 作文本编码器;配套 control-net 式 Cosmos-Transfer2.5(2B)做 Sim2Real / Real2Real 世界翻译,比上一代 Transfer1-7B 小 3.5× 却更强。全部按 NVIDIA Open Model License 开源,定位为「物理 AI 的通用世界模拟器平台」。

背景与定位

延续 Cosmos-Predict1 / Cosmos-Transfer1(NVIDIA 首批面向物理 AI 的开源世界模型)。本作走的是像素空间视频生成式世界模型范式(frame-by-frame 高保真视频预测),与另一条潜空间预测范式(v-jepa / v-jepa-2 这类 JEPA、以及 Dreamer 系 RSSM)明确对立——论文 Related Work 把两条路线并列,自陈选择前者是因为「保留高保真信息,天然适合做下游策略学习的合成数据引擎」。

同属 NVIDIA Cosmos 生态、与本页可交叉参考的是 cosmos-drive-dreams(Transfer1 驱动的驾驶合成数据)。横向对标的开源视频生成模型为 Wan2.1 / Wan2.2、HunyuanVideo、CogVideoX、LTX;闭源对标 Sora / Veo / Kling / Seedance。与通用视频模型不同,Cosmos 的差异化在于「物理 AI 领域数据 + 动作/多视角/控制信号条件化 + 作为策略训练与闭环仿真的合成数据源」。驾驶多视角方向可对比 gaia-2-wayve / vista-driving-world-model,交互式世界方向可对比 genie-3

三大改进(相对 Predict1):(1) 更严的数据过滤 + 手工整理的物理 AI 后训练数据;(2) 简化架构、三任务合一;(3) 训练配方升级——模型合并(model merging)+ 新 RL 算法后训练 + 用 Cosmos-Reason1 替换 T5。

版本说明:模型与代码 2025-10-06 首发(GitHub),arXiv 2511.00062 v1 于 2025-10-28 提交(v1 摘要已含 2B/14B),v2 于 2026-02-24 修订。本页数字取自 arXiv PDF(v2 版)。

模型架构

Predict2.5(backbone = latent DiT + flow matching)

  • 生成范式:Flow Matching(FM,Lipman 2022),取代 Predict1 的 EDM 扩散。二者前/反向过程等价,差别在去噪网络参数化——FM 让网络预测扩散轨迹的速度 v_t = ε − x(x_t=(1−t)x+tε),MSE 回归;用 shifted logit-normal 采样 timestep(shift 参数 β),偏向高噪声区以打破高分辨率像素相关性。

  • 去噪网络:沿用 Predict1 的 DiT,唯一大改是去掉绝对位置编码、只保留相对位置编码(3D RoPE),以提升对更高分辨率 / 更长序列的外推能力(借鉴长上下文 LLM 的 RoPE 外推思路)。

  • 视觉 tokenizer:换成 WAN2.1 VAE(causal VAE),时空压缩率 4×8×8(T×H×W);其上再做 1×2×2 patchify。生成 93 帧(= 24 latent 帧)@ 16 fps ≈ 5.8 秒/段

  • 文本编码器Cosmos-Reason1(decoder-only 物理 AI VLM)替换 T5。不取单层输出,而是拼接多个 block 的逐 token 激活再投影到 1024 维,兼顾局部与全局语义;经 cross-attention 注入去噪过程。Reason1 的视觉编码器还能接图像/视频做风格控制,本作留作 future work。

  • 三模式合一:Text2World(纯文本)/ Image2World(文本+参考图)/ Video2World(文本+参考视频)。I2W/V2W 用**帧替换(frame-replacement)**策略:把生成序列的前若干帧固定替换为条件帧,条件帧数可调,强化时间一致性。

  • 配置(Table 3)

    配置Predict2.5-2BPredict2.5-14B
    层数3236
    model dim2,0485,120
    FFN hidden8,19220,480
    AdaLN-LoRA dim256256
    注意力头数1640
    head dim128128
    激活 / 位置编码GELU / 3D RoPEGELU / 3D RoPE

Transfer2.5(control-net 式,2B)

  • 建在 Predict2.5-2B 之上。沿用 Transfer1-7B 的总体设计,但把 4 个 control block 从「集中插在主干开头」改为「每 7 个主干 block 后插 1 个」,让条件信息更渐进地融合。总控制块数不变。
  • 支持多空间控制模态:edge、blur、segmentation、depth(可来自 IsaacSim 物理仿真或真实视频)。多模态用空间均匀权重(各 0.25)融合。
  • 多视角扩展:把多个视角沿 latent 时间维拼接(视角当作序列帧),latent 时间维降到 8 以塞下最多 7 视角;每视角独立编解码 + 一个 size-7 的 per-view 可学习 embedding;RoPE 按视角分别构造。
  • 相机控制:目标相机用 Plücker raymap(像素→6D 射线)表示、patchify,经相机投影层对齐到 video latent 后加到 video token 上;训练时只解冻 self-attention 层与相机投影层。
  • 动作条件化(action-cond):动作是预训练里没有的新模态——用一个 action embedder MLP 把每个动作映射成 tensor,加到 DiT 的 timestep embedding 上(消融证明优于 cross-attention 与 channel concat,见评测)。

数据

预训练数据(通用)

  • 处理 >2 亿条原始视频、约 3500 万小时原始素材(Predict1 为 2000 万小时),切出 >60 亿 clips(5–60 秒,<5 秒丢弃)。
  • 七阶段 curation pipeline:shot-aware 切分 → GPU 转码 → 裁剪 → 过滤 → captioning → 语义去重 → sharding。
  • 多级过滤:美学评分 → 运动过滤 → OCR(去字幕叠加)→ 感知质量(类 DOVER)→ 语义 artifacts(类 VTSS)→ 最后用 VLM(Qwen2.5-VL)高精度兜底。剔除游戏/合成图案/动画/卡通等非物理分布内容。仅约 4% clips 通过全部过滤(Predict1 是 30%),最终保留 约 2 亿条可训练 clips 作预训练集。
  • Captioning:每 clip 切 5 秒窗口,用 Qwen2.5-VL-7B 生成 short/medium/long 三档 caption。语义去重按 embedding 聚类 + 在线去重(保留更老、更高分辨率者)。sharding 按 26 类内容 taxonomy + 分辨率/宽高比/长度多轴切分。基础设施到 PB 级,配 Delta Lake 湖仓 + Milvus 向量库。

领域专用数据(加入预训练)——5 个域:机器人、自动驾驶、智慧空间、人体动力学、物理。

  • 机器人(Table 2,按视角计 clip 数):AgiBot-Beta 中视 194k(左/右视各 30k)、Bridge 36k、DROID 39k(wrist)、GR00T 3k、1X 17k、OpenX 500、RoboMIND 16k。注入数据集元数据(如 GR00T 的人工成功率标注、Bridge 的 step 指令、AgiBot 初始场景描述)降低幻觉。
  • 自动驾驶:自建 ~310 万条 20 秒环视 clip,每条 7 路同步相机(前宽/前长焦/左/右/后/后左/后右),按地域、车流密度、车速、路型、天气、光照等属性分布采样;三档 caption。
  • 智慧空间:仓库/工厂/工地等,VLM 校验相关性,过滤后约 4 万条 clips
  • 人体动力学:YOLOX 检人 + RTMPose 关键点;人出现帧 >40%、单帧 ≤8 人、至少 1 人占画面 ≥3% 才保留。
  • 物理:先定义可视物理现象 taxonomy(经典力学、流体等),curate 强调动态性的视频(碎玻璃、滚球碰撞、流水)。

后训练数据

  • SFT:用 InternVideo2 embedding 训多头分类器,切成 5 域——object permanence 10.4M、high motion 1.0M、complex scenes 1.6M、driving 3.1M、robotic manipulation 730K(另有 4K 高清冷却集 388K)。每域单独训一个模型(避免调配比),再合并。
  • Transfer2.5 控制条件数据:depth 用 Video Depth Anything 标 1000 万视频、segmentation 用 SAMv2 标 300 万视频、edge+blur 1400 万视频

训练方法

渐进式预训练(Table 4,沿分辨率与任务两轴加难度):

  • 阶段:Text2Image 256p → +Video2World 256p → 480p → 720p → +Text2World 720p。I2W/V2W 随机取 1 或 5 条件帧、生成剩余 92/88 帧(共 93 像素帧 = 24 latent 帧),用 mask token 标记哪些是条件输入、loss 只加在生成帧。加 Text2World 阶段时按 0/1/2 条件帧概率 0.5/0.25/0.25 采样。
  • timestep:logit-normal 采样,shift β 随分辨率从 256p 的 1 增到 720p 的 5;另强制 5% 样本取自最高 2% 噪声区以消除帧间突变 artifact。
  • 优化器 AdamW(β1=0.9, β2=0.999),lr 3e-5(2B)/ 1.3e-5(14B),weight decay 0.001,线性衰减 + 2000 步 warmup。

后训练

  • SFT:每个专用模型训 30k iters、batch 256,超参同预训练末阶段;人偏好评测每域 SFT 显著胜过预训练基线(如 robotic manipulation 72.6% win)。另做 4K 高清 cooldown(lr 线性降到 0)提升细节。
  • 模型合并:试 model soup / TIES / DARE-Linear / DARE-TIES,每法扫参生成 >20 个候选。发现简单网格搜索 > 按单模型 win-rate 的启发式选择;除 DARE-Linear 外各法相当,最终选 model soup
  • RL:把「条件=状态、整条去噪轨迹=动作」纳入 RL 框架。用 VideoAlign(VLM 奖励模型,评 text alignment / motion / visual quality)后训 Predict2.5-2B。每条件生成 8 个输出 × 20 扩散步,组内归一化算 advantage(GRPO 式);受显存限制把轨迹概率拆成逐步条件概率之和、每两步算梯度、累积 10 步做一次更新;训 256 步、batch 32;用 fine-tuning 集上的 diffusion loss 做正则以缓解 reward hacking;发布合并模型上后训的 EMA 权重为最终 checkpoint。
  • 蒸馏(timestep distillation):用 rCM(连续时间一致性蒸馏 + 分布匹配蒸馏的混合前向-反向联合框架),自建含 JVP 支持的 fused flash attention、FSDP2 与 context parallelism 适配;蒸馏后 4 步即可出高保真样本,质量与 teacher 相近(PAI-Bench T2W overall teacher 0.768 vs distilled 0.764;I2W 0.810 vs 0.816)。

Infra(训练 / 推理工程)

  • 训练规模:Table 9 报告在 4096 张 NVIDIA H100 上(720p、93 帧)的 MFU:Predict2.5-2B 36.49%(context parallelism size=2)14B 33.08%(CP size=8)——14B 掉点因大 CP 引入更多通信。GPU-hours 未披露。
  • 并行/框架:主框架 FSDP2(逐参数 sharding,优于 FSDP1 的 bucket sharding;引入 TorchTitan 的异步分布式 checkpointing 与 meta-device init)。上下文并行用 Ulysses 式 all-to-all(取代 Predict1 diffusion 世界模型的 ring-attention),更简单、通信更省,且更好支持 NATTEN 稀疏注意力与带 JVP 的 fused flash attention;图像 iteration 时动态关闭 CP、视频 batch 再开。Selective Activation Checkpointing(细粒度策略,优先重算轻算子)。
  • RL 基础设施:Elastic Reward Service——外部可弹性伸缩的奖励服务,producer-consumer 流水(decode 阶段解码 latent、inference 阶段多奖励模型并行),进程间用 CUDA IPC 零拷贝共享,异步返回 task UUID + Redis 存结果。
  • 推理:官方 GitHub 补充支持 Blackwell + ARM 推理、DMD2 蒸馏做模型压缩、自回归滑窗生成长视频、Diffusers pipeline 接入。具体 FPS / 控制 Hz / 端侧硬件延迟未披露

评测 benchmark

PAI-Bench(predict 任务,Domain Score + Quality Score,Overall = 均值)

  • T2W(Table 10):Predict2.5-2B post-train Overall 0.768、14B post-train 0.768;对标 Wan2.1-14B 0.761、Wan2.2-5B 0.764、Wan2.2-27B-A14B 0.769(即 2B/14B 与 27B-A14B 打平)。
  • I2W(Table 11):Predict2.5-2B/14B post-train Overall 0.810,为最佳(Wan2.2-27B-A14B 0.806、Wan2.2-5B 0.804)。
  • 人偏好(更能反映质量):post-train 2B 虽比 Wan2.2-5B 小 60%、比 Wan2.1-14B 小 85.7%,仍优于 Wan2.2-5B(30.0% vs 26.2%)、与 Wan2.1-14B 相当(33.0% vs 34.8%)。post-train 14B 优于 Wan2.1-14B(48.6% vs 31.8%)、与 Wan2.2-27B-A14B 打平(38.1% vs 35.9%),而参数仅其一半。

RL 增益(Table 6,VideoAlign 奖励 sum,2B merged):T2W 1.23 → 1.74,I2W 0.24 → 0.45;人投票 RL 后普遍更受偏好(Merged+RL 46.7% win)。

Transfer2.5-2B vs Transfer1-7B(PAIBench-Transfer,600 视频,Table 12):2B 在多数 alignment 指标与 Overall Quality(uniform weights 9.31 vs 9.24)上超过 7B 的 Transfer1,体积小 3.5×。长视频(17 段 30–120 秒,自提 RNDS 指标)在 edge/blur/depth/seg 四模态上误差累积/幻觉都远小于 Transfer1。

下游应用(均为一手实验)

  • 机器人策略学习(Real2Real 数据增强):双臂 Kinova Gen3 + egocentric 相机,100 条遥操作示范训 UNet Diffusion Policy(8 步 action chunk @10FPS);每条原示范用 Transfer2.5-2B 生成 5 个语义变体增强。10 个测试场景(含 OOD 与组合扰动)×3 试:Transfer2.5 增强策略 24/30 成功,远超标准图像增强 baseline 5/30 与仅原始数据的 base 1/30
  • 驾驶多视角仿真:Predict2.5-2B/auto/multiview(1.5M 7 相机 30FPS clips 训 2 epoch,global batch 64、CP=8)。RDS-HQ-HL 上 FVD/FID 大幅优于 Predict1-7B-Sample-AV(FVD StyleGAN 23.06 vs 63.69,约 2.8×;FID 12.10 vs 25.34 约 2.1×——论文将 FVD/FID 增益概括为 up to 2.3×);Transfer2.5/auto/multiview 用「world scenario map」(HD 地图+遮挡/朝向感知 3D 框,RDS-HQ 14 万场景) 控制,3D-cuboid 检测最高提升约 60%(LET-AP 0.394 vs 0.243,+62%),车道检测(F1 0.637 vs 0.604、分类准确率 0.904 vs 0.899)小幅优于 Transfer1。
  • 相机可控多视角(Table 17,80 视频×16 轨迹):multiview 跨视一致性 Sampson error 19.73 优于 singleview 26.61,相机精度相当。
  • VLA 合成数据(DreamGen Bench,GR1 指令跟随):Predict2.5-14B/gr00tdream-gr1 取得最高综合指令跟随分,尤以 object/env 两维领先(object GPT 91.8/Qwen 69.4、env GPT 69.0/Qwen 69.0),超过 Hunyuan、CogVideoX、WAN2.1,多数维度也优于未用 Reason1 的早期 Predict2-14B;但 behavior 维非最优——behavior-GPT WAN2.1 72.3 略高于其 70.2,behavior-Qwen 早期 Predict2-14B 61.7 略高于其 59.6(论文自陈优势「particularly in object and environment generalization」)。
  • 动作条件世界生成(Bridge,2 万 episodes,7 维动作,Table 19):Predict2.5-2B/robot/action-cond 全面超 Predict1-7B baseline——PSNR 24.95 vs 21.14、SSIM 0.85 vs 0.82、FVD 146 vs 190;消融证明动作经 time embedding 注入(FVD 146)优于 cross-attention(159)与 channel concat(267)。

创新点与影响

  • 三任务合一 + 换脑:把 T2W/I2W/V2W 收进单一 flow-matching 模型,并用物理 AI 专用 VLM Cosmos-Reason1 取代 T5 文本编码器(拼接多层激活投影到 1024 维),是相对 Predict1 最实质的两处改动。
  • 小而强:Predict2.5-2B/14B 以远小的体量追平/超过 Wan2.2-27B-A14B;Transfer2.5-2B 比 Transfer1-7B 小 3.5× 却更强、长视频误差累积显著更小——把「用更强 base + 更严物理 AI 数据」而非「堆参数」作为提升路径。
  • 完整后训练配方:domain-specific SFT → model soup 合并 → GRPO 式 RL(VideoAlign 奖励 + diffusion-loss 正则防 reward hacking)→ rCM 4 步蒸馏,配 Elastic Reward Service 与 Ulysses CP 工程,是本作可复用的方法学骨架。
  • 平台定位:不止基座,而是把 control-net(Transfer2.5)、多视角、相机控制、动作条件、VLA 合成数据五类下游能力一并开源(NVIDIA Open Model License),坐实「物理 AI 世界模型平台」叙事,为机器人/驾驶提供 Sim2Real、策略评估、闭环仿真的合成数据引擎。
  • 自陈局限/未尽:Reason1 的视觉条件(风格控制)能力未启用、留作 future work;长视频仍靠 chunked 自回归、存在误差累积(只是被缓解);DreamGen 那栏注明早期 Predict2-14B 未用 Reason1;推理侧 FPS/时延/端侧指标未在报告中量化。GitHub 已声明本仓转维护态,后续迭代转向 Cosmos 3(NVIDIA/Cosmos)。

原始链接

一手源存档(sources/)