一句话定位
NVIDIA 把”推理”从 Cosmos 世界生成模型家族里拆出来单独做的多模态 LLM:面向视频输入的物理常识与具身推理模型,提出空间/时间/基础物理三大类 16 个子类的物理常识本体论,以及”自然主体 × 机器人系统”两维、四种能力的具身推理本体论,训练 7B(Qwen2.5-VL 骨干)与 56B(Nemotron-H 混合 Mamba-Transformer 骨干)两个规格,走 SFT + GRPO 强化学习两段式,长思维链输出 <think>...</think><answer>...</answer>;最终只开源了 7B。
背景与定位
Cosmos 家族此前的旗舰是生成式世界模型 cosmos-predict2(Predict1/Predict2,DiT 扩散架构预测未来视频),本文是同一实验室在”理解/推理”方向的对应产品——不生成视频,而是让多模态 LLM 看视频、做长链推理、输出自然语言里的具身决策(下一步动作)。论文明确把自己定位为 DeepSeek-R1 式”规则化可验证奖励 + RL”范式在物理世界推理上的移植:数学/代码领域的正确性可以字符串匹配验证,物理常识和具身推理却是开放式回答,因此本文的核心工程动作是把开放问题转成 MCQ 从而拿到可验证奖励。
同属”用 VLM 做具身推理”路线的另一支是把推理直接内嵌进 VLA 策略模型,如 gemini-robotics、groot-n1 的双系统架构;Cosmos-Reason1 走的是解耦路线——先把”物理常识 + 具身推理”能力训成一个独立可评测的 VLM,不直接输出动作 token,留给下游 VLA 或规划器去接。训练数据里的具身推理来源之一 agibot-world-colosseo(AgiBot World)与自动驾驶数据均取自这条脉络下常见的机器人/AV 数据集。GitHub 仓库已标注 Cosmos-Reason1 不再活跃维护,继任者是 2025 年 10 月后统一”理解+生成+动作”于一体的 Cosmos 3(不再分推理/生成两个模型)。
模型架构
解码器专用(decoder-only)多模态 LLM,结构为「视觉编码器 → 下采样两层 MLP projector → LLM 主干」,与 LLaVA/NVLM-D 同款设计。两个规格配置(取自论文 Table 3):
| 配置 | Cosmos-Reason1-7B | Cosmos-Reason1-56B |
|---|---|---|
| 视觉编码器 | ViT-676M,动态分辨率,patch 14×14,32 层,dim 1,280,FFN 3,456 | ViT-300M,输入固定 448×448,patch 14×14,24 层,dim 1,024,FFN 4,096 |
| Projector | 下采样 2×2×2,2 层,输入 1,280→隐层 5,120→输出 3,584 | 下采样 2×2×1,2 层,输入 4,096→隐层 32,768→输出 8,192 |
| LLM 主干 | 纯 Transformer,28 层,dim 3,584,FFN 18,944,28 attention heads(即 Qwen2.5-VL-7B 骨干) | 混合 Mamba-MLP-Transformer,118 层,dim 8,192,FFN 32,768,64 heads(Nemotron-H 骨干) |
- 7B 视觉编码器沿用 Qwen2.5-VL 的动态分辨率处理;56B 视觉编码器为 InternViT-300M-V2.5,图像按预定义长宽比切 1~12 个 448×448 tile 加一张缩略图 tile(参照 NVLM-D 做法),视频均匀采样最多 32 帧、最高 2 FPS,每帧 448×448 经 ViT 产生 1,024 个 14×14 patch token,再用 PixelShuffle 2×2 下采样到 256 token。
- 56B 的混合 Mamba-MLP-Transformer 主干:少量 Transformer 层(自注意力+MLP)穿插在交替的 Mamba-MLP 模块之间,兼顾 Mamba 的长序列线性复杂度和 Transformer 的长程建模能力(结构图 Fig.4 显示按 alternating block 分组,组间穿插 Transformer×7/9/10)。
- 训练并行度:7B 用 Tensor Parallelism=4;56B 用 TP=8 + Pipeline Parallelism=2。
- 输出:长思维链,
<think>标签内推理、<answer>标签内最终答案(格式奖励用正则匹配这两个标签)。 - 实际开源:GitHub/HF 只发布了 7B(基于 Qwen2.5-VL-7B-Instruct,675.76M ViT + 7.07B LLM + 545.00M 输出投影层,合计约 8.29B 参数);56B 模型未公开权重,仅论文报告结果。HF 模型卡后续(2025-08-01)在 7B 基础上做了增量训练更新(见”数据”节),但架构未变。
数据
Physical AI SFT 阶段共 ~4M 条视频-文本标注对(论文摘要口径),按论文 Table 4/5/6 拆解为三大来源:
物理常识 VQA(自建 pipeline:人工挑视频→详细字幕→LLM 出 QA→DeepSeek-R1 提取推理轨迹→规则清洗):
- Free-form:9.9K 条”高质量”视频片段,人工标注详细字幕(平均 297.4±46.4 词),产出 ~99K 理解型 + ~59.4K 推理型 SFT 样本。
- MCQ:先用 VLM 给 ~1.2M 高质量片段标详细字幕,构造 ~2.4M 理解型 MCQ;再从中取 ~356K 片段构造 ~600K 推理型 MCQ。
具身推理 SFT(来自 5 个数据源,统一”任务完成验证/动作可行性/下一步动作预测”三类问题,DeepSeek-R1 补推理轨迹):
- BridgeData V2:原始 60,096 条轨迹(50,365 遥操作 + 9,731 脚本化 pick-and-place,13 种技能、24 种环境),切出 129.2K clip 用于 SFT(129.1K reasoning)。
- RoboVQA:~220K clip 直接使用,标注/推理后得到 ~930K QA-推理对,筛选后取子集用于 SFT(表中 understanding 218.5K / reasoning 920.0K)。
- AgiBot(AgiBot World,G1 硬件平台,36 项任务):抽样 3,300 条视频,按子任务标注切成 19.8K clip。
- HoloAssist:166 小时第一人称视频,1,758 条视频切成 139,653 个 clip(仅用于”下一步子任务预测”)。
- 自动驾驶(AV,NVIDIA 专有数据):~12.4K 条 20 秒视频(约 70 小时),人工标三类字幕(整体描述/驾驶难度/注意事项),避免用模型字幕产生幻觉。
Intuitive Physics(自监督构造,SFT 数据表中 Puzzle 11.0K / AoT 30.0K / Object Permanence 10.0K):
- 空间拼图(Spatial Puzzle):3,000 条视频首帧切 2×2 patch 打乱 + 7 张干扰图同样切块,共 32 帧一组,过滤后剩 11K 条。
- 时间箭头(AoT):从 Cosmos-Predict1 训练集选大运动视频,正放/倒放各生成 2 条不同推理轨迹,共 30,000 条(clip+其反转版)。
- 物体恒存性(Object Permanence):Libero 仿真平台(130 项机械臂操作任务)合成 10K clip,相机绕场景运镜过程中随机遮挡/移除物体。
RL 阶段数据量(论文 Table 5,MCQ 化后的子集):物理常识 5,133 条(源自 1,989 条视频,人工标注,依据 GPT-4o/Gemini-2.0-Flash/Qwen2.5-VL-7B/Cosmos-Reason1-7B 四模型投票分 easy/hard 两难度子集);具身推理每源 200~252 条(BridgeData V2 240、RoboVQA 252、Agibot 200、HoloAssist 200、AV 200);Intuitive Physics 24,079 条(Puzzle 3,998 + AoT 9,994 + Object Permanence 10,087,注意与 SFT 用的 clip 完全不重叠以防过拟合)。
评测基准(与训练数据同源但严格划分 val/held-out,不重复):物理常识 604 题(426 段视频,336 二元 + 268 MCQ,Space 13.25% / Time 49.33% / Fundamental Physics 37.4%);具身推理 610 题(600 段视频,覆盖 RoboVQA/BridgeData V2/AgiBot/HoloAssist/AV 各 100 题 + RoboFail 100 题的困难子集,RoboFail 专门挑”需要高度观察力或复杂时序理解”的样本)。
HF 模型卡增量更新(2025-08-01,超出原论文范围):追加 PLM-Video-Human(39K)、Nexar(240K)、Describe Anything(178K,用于 Set-of-Mark 提示)、ITS/仓储场景(24K)、Visual Critics(24K,取自 Cosmos-Predict2 与 Wan2.1 生成视频的人工物理正确性标注)等数据,SFT 总存储从 300.6GB 增至 2.6TB,用于增强密集时序字幕、SoM 定位、城市/工业场景理解。
训练方法
两阶段:Physical AI SFT → Physical AI RL。
SFT 超参:7B 训练 12.5K 迭代,余弦退火学习率 1e-5→1e-6;56B 先以 1e-5 训 30K 迭代,再以 1e-6 训 20K 迭代;global batch size 7B=256、56B=32;fused Adam(β1,β2=0.9, 0.95),weight decay 0.1;域间均衡采样避免过采样某一来源。
RL 算法:GRPO(去掉独立 critic,组内奖励归一化算 advantage,A_i = (R(o_i)-mean(G))/std(G))。两类规则奖励:准确率奖励(答案在 <answer> 标签内与 ground truth 字符串匹配,因为 RL 只用 MCQ)+ 格式奖励(正则检查 <think>/<answer> 标签是否存在)。RL 超参:global batch 128 题,每题采样 9 个输出,单条最长 6,144 token 截断,学习率 4e-6,KL 惩罚系数 0.005,训练 500 迭代,MCQ 选项动态打乱以防位置偏置。
训练框架(自研,论文 Sec.4.2):全异步、强容错的 RL 训练架构,分三部分——Dispatcher(调度分发训练数据、管理框架状态)、Actor Rollout(生成响应、算奖励和 advantage,支持 DP/PP/TP)、Policy Training(执行 RL 算法优化 actor,支持 5D 并行:DP/PP/CP/FSDP/TP);用自定义 NCCL 通信器连接 dispatcher 与 rollout/policy 节点。相比主流的 colocated 框架(训练和 rollout 共享同一批 GPU、需同步),本框架采用异构部署 + 统一 dispatcher 调度,论文声称相比 colocated 框架训练效率提升约 160%;另有训练网格快速重配置能力,任意节点故障时可在不重启的情况下继续当前训练步,并支持基于负载的动态扩缩容。
Infra(训练 / 推理工程)
- 预训练/SFT/RL 阶段的 GPU 数量与 GPU-hours:论文未披露(只给了并行策略:7B TP=4;56B TP=8+PP=2;RL policy training 支持 DP/PP/CP/FSDP/TP 5D 并行)。
- 推理硬件(HF 模型卡):测试硬件为 H100、A100、GB200,支持 NVIDIA Hopper 与 Blackwell 微架构;仅验证过 BF16 精度;runtime 用 vLLM。
- 推理最低门槛(GitHub):1 张 24GB 显存 GPU 即可跑 7B 推理。
- 推理设置建议:输入视频 FPS=4(与训练设置对齐),输出 max_tokens 建议 ≥4096 以免长思维链被截断;系统 prompt 显式要求
<think>...</think><answer>...</answer>格式。 - 官方提供 FP8 量化脚本(
quantize_fp8.py,依赖 vllm==0.9.2 + llmcompressor>=0.6.0),产出 W8A8-FP8 版本,但未披露量化后的精度/速度对比数字。 - 推理 FPS / control-Hz / 端到端延迟:未披露(模型定位是”离线/半在线推理规划”,不是闭环控制策略,论文未测控制频率)。
评测 benchmark
三套自建基准,对比基线含 Gemini 2.0 Flash、GPT-4o、OpenAI o1(闭源,API 调用)与 Qwen2.5-VL-7B、Nemotron-H-56B(开源骨干本身,零样本 CoT 提示);Cosmos-Reason1 结果为温度 0.6、top-p 0.95 下 5 次推理的平均准确率。
物理常识基准(Table 7,Space/Time/Other Physics 三类平均准确率):Gemini 2.0 Flash 50.2、GPT-4o 55.6、OpenAI o1 59.9、Qwen2.5-VL-7B 47.4、Nemotron-H-56B 58.2;Cosmos-Reason1-7B 54.3(+6.9 vs. 骨干 Qwen2.5-VL-7B)、Cosmos-Reason1-56B 60.2(+2.0 vs. 骨干 Nemotron-H-56B,超过 OpenAI o1)。
具身推理基准(Table 8,BridgeData V2/RoboVQA/Agibot/HoloAssist/AV/RoboFail 六项平均):Gemini 2.0 Flash 46.7、GPT-4o 53.3、OpenAI o1 54.5、Qwen2.5-VL-7B 50.8、Nemotron-H-56B 53.5;Cosmos-Reason1-7B 61.8(+11.0 vs. 骨干)、Cosmos-Reason1-56B 63.7(+10.2 vs. 骨干)。
Intuitive Physics 基准(Table 10,Arrow of Time/Spatial Puzzle/Object Permanence 平均,含 Random Guess=41.7 基线):Gemini 2.0 Flash 43.0、GPT-4o 58.3、OpenAI o1 54.7、Qwen2.5-VL-7B 42.1(接近随机);Cosmos-Reason1-7B(仅 SFT)74.5(+32.4 vs. Qwen2.5-VL-7B 骨干),+ Physical AI RL 后 81.5(+7.0)。多数模型在 Arrow of Time 与 Object Permanence 上接近随机猜测水平,仅 GPT-4o/OpenAI o1 在 Spatial Puzzle 上明显好于随机——论文据此指出现有 MMMU 类通用基准掩盖了模型对物理世界理解的真实短板。
Physical AI RL 增益(Table 9,7B 模型,SFT→+RL):Common Sense 54.3→56.2;BridgeData V2 58.8→73.5;RoboVQA 83.8→86.8;Agibot 49.4→54.2;HoloAssist 63.0→60.0(下降);AV 55.6→67.0;RoboFail 60.0→62.0;六项加常识平均 60.7→65.7(+5.0)。RoboFail 是唯一在 SFT 和 RL 阶段都持续困难的基准,论文认为是训练数据里缺乏代表性的高难度样本所致,故意保留它作为具身推理能力的”待改进”指标。定性上论文展示 RL 后模型学会在选项均不合理时主动拒答全部 MCQ 选项(Fig.9 自动驾驶换道案例),而非被迫选一个错误答案。
HF 模型卡(2025-08-01 增量训练版,与论文 Table 9 不可直接比较,因训练数据已扩充)另给出一版结果:RoboVQA 87.3、AV 70.8、BridgeDataV2 63.7、Agibot 48.9、HoloAssist 62.7、RoboFail 57.2,平均 65.1。
创新点与影响
- 把”物理常识”和”具身推理”两种此前散见于不同基准/数据集的能力,归纳成两套系统性本体论(16 个物理常识子类 + 2 维具身推理矩阵),给这个方向提供了共享评测框架,而不是像以往工作各自为战地测某个子任务。
- 证明了 DeepSeek-R1 式”规则化可验证奖励 + GRPO”范式可以从数学/代码迁移到开放式的物理世界推理:关键工程手段是把自由形式问题转成 MCQ 从而拿到字符串匹配奖励,Intuitive Physics 任务因为天然自监督(视频反转/拼图/仿真遮挡)几乎不需要人工就能规模化生成 RL 数据。
- 自研的全异步、故障可恢复 RL 训练框架(声称比同类 colocated 框架效率提升约 160%),但论文未披露具体硬件规模,细节止步于架构描述。
- 论文自陈的局限:(1)基准只测最终答案准确率,未定量评估思维链本身的质量,留作未来工作;(2)具身推理的”从交互中学习”(Learn from Interactions)维度被明确排除在本文范围外;(3)RoboFail 上的持续低效反映复杂物理约束推理仍是弱项;(4)56B 模型未开源,社区能验证的只有 7B。
- 后续影响:该模型被同门的 cosmos-predict2 用作 prompt refiner 和 rejection-sampling 的 critic,是 NVIDIA Cosmos 平台里”理解”与”生成”分工协作的具体例子;仓库已被继任的统一模型 Cosmos 3 取代(不再区分推理/生成两个模型),标志着”reasoning VLM + generative WM”两段式架构在该实验室内被单一统一模型路线取代。
原始链接
- 论文(arXiv):https://arxiv.org/abs/2503.15558 / PDF: https://arxiv.org/pdf/2503.15558
- GitHub:https://github.com/nvidia-cosmos/cosmos-reason1
- Hugging Face 模型(仅 7B):https://huggingface.co/nvidia/Cosmos-Reason1-7B
- 项目主页(Cosmos Lab):https://research.nvidia.com/labs/dir/cosmos-reason1/
- 后训练框架:https://github.com/nvidia-cosmos/cosmos-rl
一手源存档(sources/)
- nvidia-cosmos-reason1—github-readme.md
- nvidia-cosmos-reason1—hf-card.md
- nvidia-cosmos-reason1—project-page.md
- arXiv 原文 PDF(2503.15558,不入 git)