一句话定位

BAAI 在 RoboBrain 2.0 基础上推出的 RoboBrain 2.5,把 2D 像素级空间指代升级为深度感知的 3D 度量空间推理(解耦 (u,v,d) 坐标 + 碰撞检查后的完整操作轨迹生成),并新增稠密时序价值估计(跳步归一化进度标签 + 多视角融合 + 双向一致性检查)作为下游强化学习的通用奖励信号;8B 模型在 2D/3D 空间推理与时序价值估计三大类基准上全面超过 Gemini-3-Pro-Preview、GPT-5.2、Qwen3-VL-8B-Inst. 等通用 VLM 与 RoboBrain-2.0、Mimo-Embodied 等具身基线,并首次在千卡级摩尔线程(Moore Threads)国产加速器集群上完成端到端训练,与英伟达平台的收敛损失差距控制在 0.62% 以内。

背景与定位

论文把既有具身基础模型的可靠性问题归结为两个根本缺陷:空间维度上的”度量盲区”——指代只做到 2D 像素坐标或弱拓扑关系,缺乏绝对深度/尺度信息,无法保证毫米级间隙或生成无碰撞的 3D 轨迹;时序维度上的”开环”预测——只把动作生成当成静态序列预测任务,依赖稀疏的成功/失败标签,对滑移、倒退等中间失败状态视而不见,长程任务里做不到自适应恢复。RoboBrain 2.5 沿着这两条线索各推进一步:空间上从 2D 指点走向精确 3D 规划以满足度量约束,时序上从开环生成走向稠密价值估计以支撑闭环可靠性。

模型延续 RoboBrain 2.0 的整体框架与训练基础设施,但把底层 VLM 骨干从 Qwen2.5-VL 换成了 Qwen3-VL。围绕这次升级衍生出两个独立的深挖项目:RoboTracer(3D 空间推理专项研究)与 Robo-Dopamine(稠密时序价值估计专项研究,提出 General Process Reward Modeling / GPRM 范式),本文的两大新能力分别在这两个姊妹工作中有更详细的展开。评测基线覆盖通用 VLM(Gemini-3-Pro-Preview、GPT-5.2、Qwen3-VL-8B-Inst.)与具身模型(RoboBrain-2.0、Mimo-Embodied),数据管线复用了 RefSpatial/RoboPoint 的空间指代管线以及团队自己在 RoboTwin 2.0AgiBot-WorldDROID 上的数据处理经验。

模型架构

RoboBrain 2.5 不是传统意义上的 VLA(无专门的离散/连续/diffusion/flow 动作头),而是一个”具身大脑”式 VLM:3D 轨迹与时序价值都以自回归文本 token 的形式输出,用标准 next-token prediction loss 训练。

  • 骨干:Qwen3-VL 架构(相对 RoboBrain 2.0 的 Qwen2.5-VL 升级),ViT 视觉编码器 + LLM 解码器的异构组合;本次发布的主力规格为 8B 全参可训练(另有 4B 版本;32B 版本在 GitHub Todo 中标注”尚未发布”)。
  • 3D 空间推理接口:将 3D 空间轨迹生成形式化为预测有序 3D 点序列 τ={p_t},每个 p_t=(u_t, v_t, d_t) 由图像平面坐标 (u_t, v_t) 与绝对深度 d_t 组成——采用解耦表示而非直接回归相机/世界坐标系下的 (x,y,z),可用已知相机内参平凡地投影到 3D,避免让 VLM 隐式学习相机几何。该表示天然支持降维复用:去掉深度 d 得到 2D 视觉轨迹;只保留首尾点得到 2D/3D 空间指代数据——从而让 2D 数据集与 3D 数据集可以联合训练。
  • 3D 空间推理的三项子能力:(1) 3D 空间指代(定位轨迹涉及的物体);(2) 3D 空间测量(估计绝对度量量,如间隙、高度);(3) 3D 空间轨迹生成(在物理约束下产出无碰撞的关键点序列)。
  • 稠密时序价值估计接口:模型作为视觉-语言价值估计器,接收任务指令 + 初始状态 s₀ + 目标状态 s_M + 一对 BEFORE/AFTER 状态 (s_p, s_q),输出离散化的跳步标签 H(s_p, s_q)(相对当前段到起点/终点的归一化进度增量,见”训练方法”)。推理时融合三种视角——增量预测(沿轨迹递推)、前向锚定预测(相对初始状态)、后向锚定预测(相对目标状态)——三者平均得到最终进度估计 Φ*(s_t);在线 RL 场景下进一步用双向一致性检查(比较前向/后向预测的分歧程度,用高斯核换算置信权重)做保守更新,抑制分布外观测下的”奖励黑客”(reward hacking)。
  • 两个硬件变体:架构与训练数据完全一致的 RoboBrain2.5-8B-NV(NVIDIA 集群训练)与 RoboBrain2.5-8B-MT(摩尔线程/Moore Threads 集群训练),用于验证跨加速器训练的一致性。
  • 最大序列长度:16384 token(两阶段训练一致)。

数据

训练语料共约 1240 万(12.4M)条高质量样本,分三大板块:

(1) 通用 MLLM 数据(2.83M 样本):以 Honey-Data-1M(截断长 CoT,只留最终答案对齐”简洁执行指令”风格)与 LLaVA-OneVision-1.5-Instruct-Data(过滤纯文本样本、按视觉子类做均衡采样、样本打包使序列长度集中在 2048–8192 token)为主要来源,经图像相似度 + 文本相似度去重后得到 2.83M 条。

(2) 空间推理数据(多个子集,累计规模最大的板块):

  • 视觉定位:152K 张 LVIS 高分辨率图像 → 86K 条多轮对话式 QA。
  • 物体指点:Pixmo-Points(223K 图/2.3M 点)过滤密集重复标注、用 GPT-4o 筛选室内相关物体后得到 190K QA/64K 图;另加 RoboPoint 物体参照数据 347K QA/288K 图。
  • 可供性(affordance):PACO-LVIS(46K 图,75 类物体、200 类部件)转换为 bbox 标注 + GPT-4o 生成功能性问题,得 561K QA;另加 RoboPoint 空间可供性区域数据 270K 图/320K QA(14 种空间关系标签)。
  • 空间理解:826K 样本,覆盖 31 种空间概念(远超此前数据集常见的约 15 种)。2D 网页图像来自 OpenImage(1.7M 过滤到 466K),经 RAM 类别预测 + GroundingDINO 2D 检测 + Qwen2.5-VL 分层描述生成 + UniDepth V2/WildCamera 深度重建 + SAM 2.1 分割,构建伪 3D 场景图;3D 扫描数据整合 MMScan、3RScan、ScanQA、SQA3D、SpaceR 五个数据集;3D 具身视频用 CA-1M(200 万帧过滤到 10 万高质量帧)。
  • 空间指代(Spatial Referring):802K 样本,遵循 RefSpatial 管线,面向单一无歧义目标的位置/摆放数据(如”椅子右侧 10cm”)。
  • 3D 空间推理(RoboBrain 2.5 新增):1.74M 样本 / 8.08M QA 对,遵循 TraceSpatial 管线。3D 扫描来自 CA-1M + ScanNet;操作视频来自真机数据(AgiBot-Beta 从 167K 清洗到 59K、DROID 从 116K 清洗到 24K)与仿真数据(RoboTwin 2.0),并用 Qwen3-VL 分解任务为子目标,覆盖单臂/双臂共 3 种机器人配置。

(3) 时序预测数据

  • Ego-View Planning:EgoPlan-IT 子集,50K 自动生成样本。
  • ShareRobot Planning:1M QA 对/51K 实例,覆盖 102 个场景、12 种机器人本体、107 个 Open-X-Embodiment 分类下的原子任务。
  • AGIBot Planning:9,148 QA 对,19 项操作任务,109,378 张第一人称图像。
  • Multi-Robot Planning:基于 RoboOS 在家居/超市/餐厅 3 类场景模拟协同任务,定义 1,659 种多机协作任务类型,用 DeepSeek-V3 生成 44,142 条样本。
  • Close-Loop Interaction:基于 AI2Thor 仿真器构建的 Observation-Thought-Action 轨迹,覆盖 120 个室内环境、4000+ 可交互物体/容器,GPT-4o 生成结构化思维过程。
  • 稠密价值估计(RoboBrain 2.5 新增):从 2700 万+ 原始帧构建约 3500 万条价值估计样本,最终下采样到 350 万(3.5M) 条用于训练。三大来源按比例混合:真机数据 约 60%(AGIBot-World、DROID、RoboBrain-X)、仿真数据 约 13%LIBERORoboCasa、RoboTwin)、人类第一视角数据 约 26%EgoDex),覆盖单臂工业机器人到双臂人形机器人等多种本体,避免模型过拟合特定运动学结构。

训练方法

沿用 RoboBrain 2.0 的渐进式两阶段训练:

  • 阶段 1:基础时空学习(8.3M 样本,全模型可训练)——通用视觉感知(Honey-Data-1M 等)+ 2D 定位与定性 3D 理解(文本形式的空间关系/占据关系 QA,不含度量坐标回归)+ 规划与时序逻辑(引入”时序价值比较”任务:模型学习对关键帧排序而非直接回归绝对值,建立进度感知的初步能力)。
  • 阶段 2:具体时空增强(4.1M 样本,全模型可训练)——(1) 度量感知 3D 轨迹:引入专门的 3D 点/轨迹数据,使模型从定性理解过渡到定量感知(绝对 3D 坐标、深度感知轨迹、厘米级度量距离);(2) 稠密价值估计:从成对比较过渡到显式跳步(Hop)预测,模型学习逐帧预测连续进度值,充当鲁棒的价值函数(Critic);(3) 抗遗忘策略:随机采样 15% 阶段 1 数据与阶段 2 数据混合训练,防止学习专项度量任务时灾难性遗忘通用对话/2D 定位/逻辑规划能力。

跳步(Hop)标签构造是稠密时序价值估计的核心:给定专家轨迹的关键帧分段 {K₀,…,K_N}(K₀ 为初始观测,K_N 为成功观测),对每段做自适应采样得到状态序列 S={s₀,…,s_M},定义全局进度 Φ(s_i)=i/M;两状态间的跳步标签 H(s_p,s_q) 前进时按”到目标的剩余距离”归一化、倒退时按”离起点的已走距离”归一化,动态缩放到 [-1,1],并可证明迭代重构的全局进度恒落在 [0,1] 区间内(论文附录给出证明)。为平衡样本分布,还引入 N_hop×N_dis 个非平凡跳步区间加一个零跳步(stagnation)比例 α。

超参数(NV/MT 两平台一致部分):全局 batch size 1024,张量并行 TP=2,流水线并行 PP=2,学习率 {ViT, LLM} = 1×10⁻⁶ / 1×10⁻⁵,1 个 epoch,AdamW,余弦学习率调度,最大序列长度 16384;权重衰减在 NV 两阶段均为 0.1,MT 阶段 2 降为 0.0;warmup ratio 在 NV 两阶段为 0.01,MT 阶段 1/2 分别为 0.03/0.00。

Infra(训练 / 推理工程)

沿用并强化 RoboBrain 2.0 的自研分布式框架 FlagScale

  • 数据管线:基于 Megatron-Energon 深度自研,用定制化 WebDataset 样本格式统一表示文本/单图/多图/视频等异构模态在线混合训练,同时严格保持数据集内部样本顺序以满足指令对齐与时序一致性要求。
  • 混合并行:针对 ViT(轻量)与 LLM 解码器(重量级)计算特征差异悬殊的问题,采用非均匀流水线并行——ViT 模块置于模型前端,第一条流水线阶段相应减少分配的语言模型层数,平衡各阶段计算负载、减少流水线气泡。
  • 动态预分配显存:针对样本序列长度差异大、PyTorch 默认 CUDA 缓存分配器易产生显存碎片甚至 OOM 的问题,提出基于双数据流的动态统一填充策略——训练前统计训练集最大序列长度;首个迭代按该最大长度填充完成一次性显存预分配;后续迭代复用预分配显存;仅当视觉 token 长度超过当前最大值时才触发一次完整显存清理并重新按新最大长度填充。避免了每次迭代调用 torch.cuda.empty_cache() 带来的性能损失。
  • 跨加速器训练:借助 FlagScale 在异构加速器集群上的分布式训练能力 + VLM 专用 kernel/通信优化,在由摩尔线程(Moore Threads)非英伟达加速器组成的千卡级集群(128 节点 × 8 卡 = 1024 卡)上完成端到端训练;损失收敛行为与英伟达平台高度一致,最终收敛差距控制在 0.62% 以内;训练完的 MT checkpoint 迁移到英伟达平台评测,性能与原生 NVIDIA 训练模型高度一致。
  • GPU 规模:NVIDIA 平台阶段 1/阶段 2 均为 64 节点 × 8 卡 = 512 卡;摩尔线程平台阶段 1/阶段 2 均为 128 节点 × 8 卡 = 1024 卡
  • 推理 FPS / 控制频率 / 边缘硬件延迟:未披露具体数值(论文正文聚焦模型能力与跨加速器训练一致性,未给出严格意义上的推理速度基准表)。但论文 Section 9 定性展示了一个真实世界 RL 案例作为间接证据:以 RoboBrain 2.5 的稠密价值估计作为奖励信号,“Insert Block”(插入方块)任务的策略仅训练约 20 分钟即达到 95%+ 成功率,且在人为干扰导致对位偏差后,模型输出的 Progress 估计会立刻显著下滑、驱动策略重新对齐并完成插入——这是论文正文自带的数字,而非仅见于 README/项目主页的转述(官方 GitHub README 与项目主页把这一结果概括为”仅用一条示范轨迹即可达到 95%+ 成功率”,更完整的消融与统计见姊妹项目 Robo-Dopamine,arXiv:2512.23703)。

评测 benchmark

沿用 FlagEvalMM 评测框架,报告 NVIDIA(NV)与摩尔线程(MTT)两个训练变体的结果。

2D 空间推理(CV-Bench / CrossPoint / RoboSpatial / RefSpatial / EmbSpatial,均为准确率,越高越好):

模型CV-BenchCrossPointRoboSpatialRefSpatialEmbSpatial平均
Gemini-3-Pro-Preview92.0038.6057.9665.5076.6266.14
GPT-5.286.8433.0043.7815.0068.0249.33
Qwen3-VL-8B-Inst.92.8928.4066.9054.2078.5064.18
RoboBrain-2.0 (7B)85.7526.0054.2332.5076.3254.96
Mimo-Embodied (7B)88.8220.0261.7648.0076.2458.97
RoboBrain-2.5 (8B) NV94.5875.4073.0360.5075.5875.82
RoboBrain-2.5 (8B) MT93.9076.3073.0059.0076.9275.82

CrossPoint(跨视角点对应)上的提升尤其突出(76.30 对最强基线 Qwen3-VL-8B-Inst. 的 28.40)。

3D 空间推理(MSMU / Q-Spatial 越高越好;TraceSpatial 报告 3D Start / 3D End / Success 三项成功率;VABench-V / ShareRobot-T 为 RMSE,越低越好):

模型MSMU↑Q-Spatial↑TraceSpatial Start/End/Success↑VABench-V↓ShareRobot-T↓
Gemini-3-Pro-Preview59.4481.3719/25/70.17050.1899
GPT-5.257.9669.163/8/00.19620.2379
Qwen3-VL-8B-Inst.43.4870.7430/20/60.19790.2347
RoboBrain-2.0 (7B)55.0163.37–/–/–0.1240
Mimo-Embodied (7B)46.3665.42–/–/–0.69700.6351
RoboBrain-2.5 (8B) NV64.1773.5383/63/440.12810.1164
RoboBrain-2.5 (8B) MT61.6678.3180/65/360.11890.1171

TraceSpatial 的 Success 指标要求轨迹同时满足起点抓取、终点摆放、全程无碰撞三个条件;RoboBrain-2.5 (NV) 的 44% 相对通用 VLM(最高 7%)与开源具身基线是数量级差距。

稠密时序价值估计(VOC⁺/VOC⁻ 双向秩相关,均越高越好;数据源覆盖真机/仿真/人类第一视角):

模型AgiBotDROIDGalaxeaEgoDexLIBERORoboCasa
Gemini-3-Pro-Preview81.36/58.7090.57/44.1588.86/35.3480.48/50.1598.42/76.3167.89/34.28
GPT-5.290.02/15.9191.45/15.2988.76/10.0378.12/22.7996.97/19.1977.91/10.71
Qwen3-VL-8B-Inst.82.50/5.3281.33/10.3779.98/5.5163.85/12.8272.31/22.0759.11/-0.03
RoboBrain-2.5 (8B) NV83.08/88.5890.82/90.0793.38/95.7979.14/84.9998.97/98.9498.47/98.75
RoboBrain-2.5 (8B) MT87.36/87.4893.67/89.2694.58/94.5480.67/81.1298.88/98.9198.54/99.58

通用 VLM 的 Forward VOC 有时能追平甚至反超(如 GPT-5.2 在 AgiBot 上 90.02 高于 RoboBrain-2.5 NV 的 83.08),但 Reverse VOC 普遍崩塌(GPT-5.2 在 DROID 上仅 15.29),说明它们只学到了”哪个更靠后”的粗略语义线索,而非真正对时序方向敏感的进度建模;RoboBrain-2.5 在两个方向上都保持高相关,验证了跳步归一化 + 多视角融合的设计目标。

创新点与影响

  • 贡献:(1) 提出解耦 (u,v,d) 表示的 3D 空间轨迹生成任务formulation,把”3D 空间指代 + 测量 + 轨迹生成”三项能力统一进同一套自回归输出,且天然兼容 2D 数据集做多任务联合训练;(2) 提出跳步归一化的稠密时序价值估计——用相对当前段到起点/终点距离的归一化标签替代朴素的绝对进度回归,理论上保证迭代重构的进度值恒在 [0,1] 内,并用双向一致性检查在在线 RL 中抑制分布外奖励黑客;(3) 首次在千卡级摩尔线程(非英伟达)加速器集群上完成 8B 级具身 VLM 的端到端训练,收敛损失与英伟达平台差距仅 0.62%,验证了 FlagOS/FlagScale 跨加速器训练基础设施的生产可用性。
  • 改变了什么:把 RoboBrain 系列此前局限于 2D 像素/弱拓扑的空间指代能力,升级为可直接用于机械臂末端执行器的度量级 3D 规划信号;把此前依赖稀疏成功标签的时序监督,升级为逐帧、可跨视角迁移的稠密奖励信号,为下游 VLA 强化学习提供了通用 Critic。
  • 作者自陈的未来方向(即当前局限):(1) 尚未把图像/视频预测(next-stage prediction)整合进统一架构,模型还不能作为”世界模型”在执行前于内部模拟动作结果;(2) 尚未在移动操作与人形机器人平台上做广泛的真实部署验证;(3) 32B 版本尚未发布,“Instruction”(快执行)与”Thinking”(慢推理)两种解耦变体也仍是规划中的方向;(4) 尚未建立让模型用自身稠密价值估计器自动筛选/标注海量未整理视频的闭环自进化数据引擎。

原始链接

一手源存档(sources/)