一句话定位

RoboBrain 2.0 是北京智源人工智能研究院(BAAI)推出的具身视觉-语言基础模型,在 Qwen2.5-VL 之上叠加三阶段渐进式训练(基础时空学习 → 具身时空增强 → 思维链推理 + RLVR),发布 7B/32B 两个尺寸(后追加 3B),统一支撑空间感知(指点、可供性、轨迹预测)与时序决策(闭环交互、多机器人长程规划、场景图更新),在 12 个公开具身评测中的 6 个刷新 SOTA,超过 Gemini-2.5-Pro、o4-mini、Claude-Sonnet-4 等闭源模型和 Qwen2.5-VL-72B 等开源模型。

背景与定位

论文把自己摆在”数字智能”(既有 LLM/VLM 在通用 VQA、推理、GUI 操作上的进展)与”物理智能”(让模型感知环境、理解具身任务、和真实世界交互)之间的鸿沟上,明确点出既有具身基础模型的三个瓶颈:空间理解弱(难以建模相对/绝对空间关系和物理可供性)、时序建模弱(缺乏多阶段、跨智能体的时序依赖与反馈机制,限制长程规划和闭环控制)、推理链条不足(难以从复杂指令中抽取因果逻辑并对齐动态环境状态)。RoboBrain 2.0 是 BAAI RoboBrain 系列的第二代,前作 RoboBrain 1.0(arXiv:2502.21257,CVPR 2025)已提出统一具身大脑模型的框架;这一代把重点放在把空间感知、时序推理、思维链整合进同一套架构,并明确区分自己与通用 VLM 基线(Qwen2.5-VL、GPT-4o、Gemini-2.5、Claude-Sonnet-4)以及同为具身推理模型的 Cosmos-Reason1、VeBrain、Magma 等基线。

RoboBrain 2.0 本身定位为纯粹的视觉-语言推理模型(VLM),不直接输出低层动作;论文结论明确把”接入 VLA 框架做真正的动作生成”列为未来方向之一。围绕它形成了一个项目群:多机器人协同系统 RoboOS(把 RoboBrain 2.0 作为”大脑”)、后训练方法 Reason-RFT(提供本文 Stage 3 的 CoT-SFT + RFT 两阶段框架)、空间指代数据管线 RefSpatial/RoboRefer(本文空间数据合成直接复用其管线)。此后该系列演进为 RoboBrain 2.5(“Depth in Sight, Time in Mind”,把 2D 像素级指代升级为 3D 深度感知的空间指代/轨迹预测,并新增稠密时序价值估计的通用奖励模型 GRM),以及基于 RoboBrain 2.0-3B 构建的跨本体 VLA 模型 RoboBrain-X0(CoRL 2025)。

模型架构

采用模块化编码器-解码器架构,四个核心组件:(1) 面向文本/结构化输入的 tokenizer;(2) 视觉编码器;(3) 把视觉特征映射到语言模型 token 空间的 MLP projector;(4) 从 Qwen2.5-VL 初始化的解码器语言模型骨干。

  • 视觉编码器:约 6.89 亿(689M)参数,支持动态分辨率图像/视频输入,沿用 Qwen2.5-VL 的自适应位置编码与窗口注意力机制;采用逐帧视觉 tokenization + 多维 RoPE 做时空编码;多视角场景下不同摄像机视角的视觉 token 会附加视角专属位置标识后再与其他模态融合。
  • LLM 解码器:decoder-only,7B/32B 两个尺寸(2025-07-23 又补发了 3B 版本,面向边缘设备)。按论文 Table 1,两个尺寸的全模型可训练参数分别为 8.29B(7B 档)33.45B(32B 档)——全参微调,无 LoRA/adapter。
  • 输入模态:语言指令(跨越高层空间指令到底层运动命令)、场景图(JSON 结构,记录已探索环境中的物体、类别、空间位置及本体配置,例如 name: KitchenTable1, type: table, object: [basket, knife], robot: RealMan-single-arm)、多视角静态图像(头戴/腕戴相机或 3D 环境多视角投影)、带可选时间戳 token 的视频帧。
  • 输出表示:自由文本(任务分解、场景图更新、智能体调用、人机对话)、空间坐标(点位置、bbox、图像空间轨迹)、可选的长链思维推理轨迹。模型不设专门的动作解码头,动作相关输出仍以坐标/文本形式给出。

数据

通用 MLLM VQA:873K 高质量样本,主要来自 LLaVA-665K 与 LRV-400K 的精炼。LLaVA-665K 侧:合并同图多轮 QA、过滤无效 ShareGPT 条目、截断 >2048 token 的长对话(得到 40K 有效样本),A-OKVQA 补充选项做平衡、OCR-VQA 贡献 8 万条场景文字对话、Visual Genome 限每图 10 条密集对象标注、RefCOCO 拆成 <10 轮的短对话,纯文本对话单独分批采样使吞吐提升 25%;过滤掉依赖 bbox 的 QA 后保留 531K 样本。LRV-400K 侧:GPT-4 在少样本指令下于 16 类视觉-语言任务上合成 40 万条图像条件指令(依托 VG 的密集标注,每图约 21 个对象区域),过滤 bbox 相关 QA 后取 342K。

空间数据

  • 视觉定位(Visual Grounding):LVIS 精选 152K 高分辨率图像,标注转为 (x1,y1,x2,y2) bbox,生成 86K 段多轮对话。
  • 物体指点(Object Pointing):以 Pixmo-Points(223K 图像、230 万点标注)为源,两步过滤(丢弃 >10 点的标注、用 GPT-4o 筛选室内相关物体)后得到 190K QA/64K 图像,配 28 个人工模板;另引入 RoboPoint 物体参照数据 347K QA/288K 图像(每题最多采样 10 点)。
  • 可供性(Affordance):PACO-LVIS 部件级标注(75 类物体、200 类部件、46K 图像)转为 bbox,GPT-4o 生成”哪个部位可以抓取来提起手提包”一类问题,得到 561K QA;另用 RoboPoint 区域参照数据 270K 图像/320K QA(14 种空间关系标签,每答案最多重采样 10 点)。
  • 空间理解数据集:826K 样本,覆盖 31 种空间概念(此前同类数据集通常只有约 15 种)。部分复用 RefSpatial 管线构造 2D 网页图像和 3D 视频数据:OpenImage 170 万图像过滤到 466K 后用 RAM 做类别预测、GroundingDINO 出 2D 框、Qwen2.5-VL + 启发式方法生成由粗到细的层级化 caption,再用 UniDepth V2 + WildCamera 做深度/相机内参估计重建 3D 点云,结合 SAM 2.1 掩码得到轴对齐 3D 框,形成伪 3D 场景图;3D 场景视频整合 MMScan、3RScan、ScanQA、SQA3D、SpaceR 五个数据集;3D 具身视频用 CA-1M,200 万帧过滤到 10 万高质量帧。
  • 空间指代数据集:802K 样本(RefSpatial 管线),瞄准精确的单目标定位(区别于视觉定位/物体指点里常见的多候选或歧义参照),并加入基于 3D 占据图的放置数据(编码物体位置、朝向及”距椅子右侧 10cm”一类度量空间关系)。

时序数据

  • Ego-View Planning:处理自 EgoPlan-IT,5 万条自动生成样本,每题含正确下一步动作及最多 3 个干扰项。
  • ShareRobot Planning:100 万条 QA / 5.1 万个实例,覆盖 102 个场景、12 种机器人本体、107 个原子任务(按 Open-X-Embodiment 分类法筛选),人工按 RoboVQA 格式标注。
  • AgiBot Planning:基于 AgiBot-World 构建,9,148 条 QA、19 类操作任务、109,378 张第一人称图像,每样本 4–17 帧连续画面。
  • Multi-Robot Planning:基于 RoboOS 在家庭/超市/餐厅三类环境中模拟协同任务,定义 1,659 种多机器人协作任务类型,用 DeepSeek-V3 生成 44,142 条样本(场景图 + 机器人规格 + 工具列表 → 工作流分解 → 各智能体的 Observation-Action 计划)。
  • Close-Loop Interaction:基于 AI2Thor 模拟器,120 个室内环境、4,000+ 交互物体/容器,沿用 Embodied-Reasoner 的多阶段管线合成 Observation-Thought-Action 轨迹,GPT-4o 生成涵盖情境分析、空间推理、自我反思、任务规划、验证的思维过程。

整体数据构成是”真实标注数据集(LVIS/PACO/AgiBot-World/ShareRobot)+ 网络图像(OpenImage)+ 模拟器合成(AI2Thor + DeepSeek-V3 生成)“的混合,未使用真实机器人遥操作动作轨迹作训练信号(该模型不输出低层动作)。

训练方法

三阶段渐进式训练(论文 Table 1 给出各阶段详细超参):

  • Stage 1:基础时空学习(SFT)——在 480 万条 Foundation 数据上训练,全模型可训练(8.29B/33.45B),per-device batch 2 × 梯度累积 2,LR 1e-4,1 epoch,AdamW,weight decay 0.1,warmup ratio 0.01,cosine 学习率调度,最大序列长度 16384,GPU 数原文表格写作 “16/64×8”(同一单元格给出两个数字,推测分别对应 7B/32B 两个变体,但论文未进一步说明具体是节点数还是总卡数,此处照录原文)。
  • Stage 2:具身时空增强(SFT)——在 22.4 万条 Embodied 数据(高分辨率/多视角/第一人称视频,视角感知参照、3D 可供性、以物体为中心的场景图构建,叠加多智能体协同场景)上继续训练,LR 降到 1e-5,其余批大小/序列长度设置与 Stage 1 相同,GPU 数同为 “16/64×8”。
  • Stage 3:具身场景下的思维链推理,遵循 Reason-RFT 的两阶段框架:
    • CoT-SFT:对构造数据的 10%(19.5 万条,“Embodied Phase 1”)用 GPT-4o 标注 CoT 理由后做监督微调,batch 4 × 梯度累积 2,LR 1e-5,1 epoch,DeepSpeed Zero3,weight decay 0.1,warmup 0.03,最大序列长度 32768,GPU 数 4×8(=32)。
    • RFT(RLVR):另采样 10%(4.5 万条,“Embodied Phase 2”)收集模型自身作答,把错误答案重新整理为多选题或 LaTeX/数值答案形式的训练集,用 GRPO 优化,奖励函数综合”答案准确性”与”格式正确性”,batch 1 × 梯度累积 2,LR 1e-6,3 epoch,DeepSpeed Zero3,weight decay 0,warmup 0,最大序列长度 32768,最大补全长度 1024,每题采样 8 条补全,GPU 数同为 4×8。

评测统一用 BAAI 自研的 FlagEvalMM 框架。

Infra(训练 / 推理工程)

训练框架:BAAI 自研的开源框架 FlagScale,数据预处理基于 Megatron-Energon 并做了定制优化,自定义 WebDataset 格式支持纯文本/单图/多图/视频等多模态混合采样且保序。关键优化:

  • 多维混合并行:非均匀流水线并行(ViT 出现在模型前段且计算量小,因此减少第一个 PP stage 内的 LLM 层数以提升吞吐而不增加显存开销);ViT 单独开启 recompute(退火阶段视觉输入可达 2–3 万 token,容易 OOM),LLM 侧关闭 recompute 以保计算效率。
  • 显存预分配:训练前扫描全数据集算出最大序列长度,第一步就把所有样本 pad 到该长度,让张量复用预分配显存块,避免 PyTorch 默认缓存分配器在变长输入下的碎片化(也避免了每步调用 torch.cuda.empty_cache() 的性能损耗)。
  • 数据预处理:改为只预处理 JSON、图像保持原样(延后到 TaskEncoder 用 Qwen2.5-VL 自带的预处理器处理),32 万样本预处理时间从 2 小时以上降到 10 分钟以内(最高降约 90%),同时消除了 Megatron-Energon(cv2)与模型训练(PIL)图像读取器不一致的问题。
  • 分布式数据加载:在 DP-PP-TP 混合并行下,只让每个 PP 组的首尾 stage、每个 TP 组内的一块 GPU 负责实际加载数据,其余通过广播获取,减少冗余 I/O。
  • 容错:与平台联合设计,LostCard、KubeNodeNotReady 等常见故障自动检测并触发自动恢复重启;基于 Megatron-Energon 的自定义 DataLoader 支持完整的数据状态恢复,能从最近 checkpoint 无缝续训并保持采样/shuffle 状态一致。

RFT 基础设施:用 VeRL(基于 HybridFlow 架构,全局控制器协调跨 RL 角色数据流 + 分布式控制器做角色内并行)做 GRPO 强化微调。

推理基础设施:用 FlagScale 的多后端推理框架,针对不同硬件加速器自动搜索最优推理引擎与配置;引入混合比特量化——视觉编码器保持全精度浮点,语言模块权重量化到 INT8、激活保持 FP16——仅权重量化即可让端到端具身任务的推理延迟降低约 30%,且对现有推理管线侵入性很小。

GPU 规模:训练阶段 GPU 数按论文表格为 Stage1/2 “16/64×8”、Stage3(CoT-SFT 与 RFT 均为)“4×8”;论文未说明这些数字具体是节点数还是总卡数、也未标注两个数字(16 与 64)分别对应哪个模型尺寸。GPU 型号、总 GPU-小时数、绝对推理延迟/FPS 数值,论文均未披露(仅给出量化带来的相对延迟降幅)。

评测 benchmark

统一用 FlagEvalMM 框架,覆盖 12 个公开具身评测(9 个空间 + 3 个时序),RoboBrain 2.0 在其中 6 个刷新 SOTA。对照基线含通用模型(Gemini-2.5-Pro-preview-05-06、Gemini-2.5-Flash-preview-04-17、GPT-o4-mini-2025-05-16、GPT-4o-2024-11-20、Claude-Sonnet-4-2025-05-14、Qwen2.5-VL-32B/72B-Instruct)与具身模型(Cosmos-Reason1-7B、VeBrain-8B、Magma-8B、RoboBrain-7B-1.0)。

空间推理

  • BLINK(Dep./Spa. 平均):RoboBrain-7B-2.0 83.95(Dep 84.68/Spa 83.22)SOTA,超过 GPT-o4-mini(83.57)、Gemini-2.5-Pro(81.83)、Qwen2.5-VL-32B(81.37)、Claude-Sonnet-4(78.12)、GPT-4o(77.90)、Qwen2.5-VL-72B(76.26)及具身基线 VeBrain-8B(79.68)、Cosmos-Reason1-7B(68.57);RoboBrain-32B-2.0 83.63(Dep 79.84/Spa 87.41)。
  • CV-Bench:7B 85.75 SOTA;32B 83.92;对照 GPT-o4-mini 85.21、Gemini-2.5-Pro 84.59、Qwen2.5-VL-72B 82.68、Qwen2.5-VL-32B 81.59、GPT-4o 78.63、Claude-Sonnet-4 78.43,VeBrain-8B 78.57、Cosmos-Reason1-7B 74.71。
  • EmbSpatial:32B 78.57,仅次于 Gemini-2.5-Pro(78.74)居第二;对照 GPT-o4-mini 78.29、Qwen2.5-VL-32B 74.45、Qwen2.5-VL-72B 73.30、GPT-4o 71.92、Claude-Sonnet-4 64.26;7B 76.32。
  • RoboSpatial:32B 72.43 SOTA,明显领先 Gemini-2.5-Pro(59.87)、Qwen2.5-VL-72B(48.33)、GPT-o4-mini(51.25)、Claude-Sonnet-4(51.26);7B 54.23。
  • RefSpatial-Bench(Loc./Pla.):32B 54.00/54.00 SOTA,远超 Gemini-2.5-Pro(44.58/31.73)、Qwen2.5-VL-72B(23.50/15.83)、Qwen2.5-VL-32B(16.83/10.60)、GPT-o4-mini(15.00/19.58)、GPT-4o(8.00/9.55)、Claude-Sonnet-4(5.00/10.37);7B 36.00/29.00。
  • SAT:32B 86.67 SOTA,超过 GPT-o4-mini(82.00)、Gemini-2.5-Pro(79.33)、Qwen2.5-VL-72B(58.67)、Claude-Sonnet-4(75.33);7B 75.33。
  • VSI-Bench:Gemini-2.5-Flash 全场最佳(48.83);32B 42.69 为具身模型中最佳,超过 GPT-o4-mini(41.96)、Qwen2.5-VL-72B(35.51);7B 36.10。
  • Where2Place(Seen/Unseen 平均):32B 73.59(73.95/72.74)SOTA,远超 Qwen2.5-VL-72B(39.92)、Gemini-2.5-Pro(42.38)、Claude-Sonnet-4(25.63)、VeBrain-8B(11.34);7B 63.59(64.33/61.88)。论文注明该测试集人工筛除了部分错误用例。
  • ShareRobot-Bench-Affordance:32B 35.28 SOTA,超过 Qwen2.5-VL-72B(23.80)、Qwen2.5-VL-32B(11.97)、GPT-4o(6.00)、Claude-Sonnet-4(8.00);7B 28.05。
  • ShareRobot-Bench-Trajectory(DFD,越低越好):32B 0.2368 SOTA(最优),优于 Qwen2.5-VL-72B(0.5034)、GPT-o4-mini(0.5726)、Gemini-2.5-Pro(0.7666);7B 0.5512。

时序推理

  • Multi-Robot Planning(Super/Rest/House 平均):32B 80.33(84.42/72.36/85.43);7B 数字上反而更高,为 81.50(83.92/77.39/84.42),是本项唯一 7B 超过 32B 的评测;两者均超过 GPT-4o(74.50)、Qwen2.5-VL-72B(74.67)、Claude-Sonnet-4(71.30)、Gemini-2.5-Pro(65.39)、Qwen2.5-VL-32B(68.00)。原文正文在此处的表述本身自相矛盾——先说 32B(80.33)“also surpasses the embodied baseline RoboBrain-7B-2.0 (81.50)“,随后又说 7B “81.50…matching the performance of RoboBrain-7B-1.5-OS”(后者是一个未在文中其他地方定义的型号名);本页如实记录原文数字与措辞,不代作者判定何处是笔误。
  • Ego-Plan2(Daily/Hobbies/Rec/Work 平均):32B 57.23(64.01/53.22/57.92/52.48)SOTA,超过 Qwen2.5-VL-32B(56.25)、Qwen2.5-VL-72B(53.75)、Gemini-2.5-Pro(42.85)、GPT-4o(41.79)、Claude-Sonnet-4(41.26)、GPT-o4-mini(41.11)、VeBrain-8B(27.30)、Cosmos-Reason1-7B(26.87);7B 只有 33.23(39.41/32.20/33.88/26.98),低于 Qwen2.5-VL 两个基线。
  • RoboBench(Planning 部分,跨本体/跨物体/跨视角):7B 72.16 SOTA,超过 Claude-Sonnet-4(70.21)、GPT-o4-mini(70.01)、GPT-4o(68.60)、Qwen2.5-VL-72B(66.94);32B 68.33,仍超过 Cosmos-Reason1-7B(53.17)、VeBrain-8B(46.77)。

创新点与影响

  • 把 Qwen2.5-VL 骨干和三阶段渐进课程(通用/具身基础 SFT → CoT-SFT+GRPO/RLVR,遵循 Reason-RFT 框架)组合成一套专门瞄准”空间理解/时序建模/推理链”三大瓶颈的具身 VLM,而非停留在通用 VQA 上叠加少量机器人数据。
  • 空间数据合成管线(复用/扩展 RefSpatial)把 2D 网页图像通过 RAM+GroundingDINO+Qwen2.5-VL 层级化描述+UniDepth V2+SAM 2.1 转成伪 3D 场景图,在没有真实 3D 采集的情况下把空间概念覆盖从约 15 种扩展到 31 种,产出 826K+802K 规模的空间数据,是可复用的规模化空间标注方法论。
  • 多机器人规划数据用 RoboOS 模板 + DeepSeek-V3 生成(1,659 类任务、44,142 条样本),把 RoboBrain 2.0 直接接入 RoboOS 多机器人协同系统作为”大脑”角色。
  • Infra 侧的 FlagScale 混合并行优化(非均匀 PP、ViT 单独 recompute、JSON-only 预处理省去 90% 预处理时间)面向异构 ViT+LLM 多模态训练这一具体痛点,已开源。
  • 影响链条:RoboBrain 2.0 后来成为 RoboOS(多机器人协同)、RoboBrain-X0(基于 3B 版本的跨本体 VLA,CoRL 2025)的底座,并被 RoboBrain 2.5(3D 度量空间推理 + 稠密时序价值估计奖励模型 GRM)取代为最新一代。
  • 论文自陈的局限:模型本身仍是感知-推理 VLM,并未闭环到真正的低层动作生成,“融合进 VLA 框架做动作生成”和”与机器人操作系统做系统级集成、实现低延迟实时控制”被明确列为下一步方向,说明当前版本尚未做到端到端的低延迟真机部署;Where2Place 测试集本身存在需要人工剔除的错误用例,评测结果建立在自行修正过的测试集上。

原始链接

一手源存档(sources/)

  • robobrain-2—github-readme — GitHub README 快照(changelog、Model Zoo、3B/7B/32B 各版本发布节点、RoboBrain-X0/Reason-RFT/RoboOS 关联项目引用)
  • robobrain-2—hf-card — Hugging Face 模型卡快照(架构简述、三尺寸定位说明、评测总述、关联论文列表)
  • robobrain-2—project-page — 项目主页 2.0 专属子页快照(性能总述、架构图文字说明、12 个演示视频标题与描述、FlagScale/FlagEvalMM 说明)
  • arXiv 原文 PDF(2507.02029)未入 git,引用见上「原始链接」