一句话定位
北京智源研究院(BAAI)联合北大、中科院、港大提出的”具身大脑”MLLM——RoboBrain,把长程操作任务拆成规划(Planning)、可供性感知(Affordance Perception)、轨迹预测(Trajectory Prediction)三种能力,用自建的百万级 QA 数据集 ShareRobot 与七段式训练把 LLaVA + Qwen2.5-7B 基座练成”从抽象指令到具体动作”的统一大脑模型,CVPR 2025 收录。
背景与定位
论文的靶子是 PaLM-E、RT-H、RoboMamba 这类把 MLLM 用作机器人规划器的工作:它们能生成推理文本和/或调用额外的策略头输出动作,但缺乏对”在哪里抓""怎么移动末端执行器”这类具体、可执行信息的显式建模。RoboBrain 的定位不是端到端 VLA(不直接输出连续动作),而是”大脑-躯体分离”范式的大脑侧——模型只吐出文本/坐标形式的计划、可供性框和轨迹点,交给下游的低层控制器去执行。这条路线和同期把动作也纳入同一自回归 token 序列的 MolmoAct(深度 token + 视觉轨迹 + 动作 token 三段式,2025-08)形成对照:MolmoAct 是自称的下一步演进,RoboBrain 则是更早、更”轻装”的版本——用两个独立的 rank-64 LoRA 适配器(而非联合训练一个更大骨干)分别外挂可供性和轨迹能力。RoboBrain 之后 BAAI 团队延续发布了 RoboBrain 2.0(arXiv:2507.02029,3B/7B/32B)与 RoboBrain 2.5(arXiv:2601.14352,加入深度感知 3D 空间推理与稠密时序价值估计),以及配套的多机协同系统 RoboOS 和强化微调框架 Reason-RFT。
模型架构
整体:LLaVA 框架,三模块——视觉编码器 ViT、Projector、LLM;在此基础上外挂两个 LoRA 专家模块,共三个可切换的推理头。
- 视觉编码器:SigLIP(
siglip-so400m-patch14-384),在 WebLi 上以 384×384 分辨率预训练,27 个隐藏层,patch 14×14,单图产生 729 个视觉 token。 - Projector:2 层 MLP(
mlp2x_gelu),把视觉 token 投影到 LLM 语义空间。 - LLM:Qwen2.5-7B-Instruct,28 个隐藏层,支持 128K 长上下文,覆盖 29+ 种语言。
- 基座 Planning 模型(全参可训,8.0B):给定图像/视频 X_v,ViT 编码为 Z_v = g(X_v),Projector 映射为视觉 token H_v = h(Z_v),LLM 以自回归方式基于人类指令 X_t 和 H_v 生成文本回复(下一步子任务描述)。
- A-LoRA(可供性感知):rank-64 LoRA,插入 Projector 和 LLM 的 FFN 层,冻结骨干只训 LoRA(28.0M 可训参数)。输出格式为 bbox 文本 token {l(x), l(y), r(x), r(y)}(左上角、右下角坐标),表示人手/末端执行器可接触的区域。
- T-LoRA(轨迹预测):结构同 A-LoRA(28.0M 可训参数)。输出为一串归一化到 [0,1000) 的 2D 路点文本 token P_{t:N} = {(x_i, y_i)},遵循 Qwen2-VL 的坐标离散化约定;最终版本额外引入起点坐标、最多 10 个采样点、以及专用”Spec Token”标记路点/起止点。
- 视觉分辨率随阶段扩容:Stage-1 为 384×384(729 token/图),Stage-1.5 起扩至最大 384×{2×2} 平铺(≈729×5 token),Stage-2 起进一步扩到最大 384×{6×6} 平铺(≈729×37 token/图,
spatial_unpadpatch-merge),并从 Stage-2 的视频子阶段起支持最多 32 帧的历史帧记忆。 - 三个推理头(Planning / A-LoRA / T-LoRA)在推理时按顺序串联使用:先生成详细计划,再拆成子任务描述分别调用可供性、轨迹头执行具体操作。
数据
ShareRobot 数据集(论文核心贡献,源自 Open X-Embodiment 的二次标注):
- 数据筛选:从 OXE 中依据高分辨率(≥128px)、描述准确、任务成功、视频≥30 帧、目标物/末端执行器不被遮挡、轨迹清晰等标准,最终验证出 51,403 条实例,覆盖 23 个原始数据集、102 个场景(卧室/实验室/厨房/办公室等)、12 种机器人本体、107 类原子任务(高频动作为 pick/move/reach/lift/place)。
- Planning 标注:每条示范抽取 30 帧 + 高层描述,用 Gemini 分解为低层指令,3 名标注员人工复核;为 RoboVQA 定义的 10 类问题各设计 5 套模板,每条实例随机采 2 套生成 QA 对 → 51,403 条实例扩增为 1,027,990 条 QA 对(切分 100 万训练 / 2,050 测试)。
- Affordance 标注:筛出 6,522 张图,按高层描述标注 bbox {l(x),l(y),r(x),r(y)} 并人工复核修正(6,000 训练 / 522 测试)。
- Trajectory 标注:筛出 6,870 张图,按低层指令标注末端执行器 ≥3 个 {x,y} 路点并人工复核(6,000 训练 / 870 测试)。
七段式训练数据混合(Phase 1 通用 + Phase 2 机器人):
| 子阶段 | 数据 | 规模 |
|---|---|---|
| Stage-1 | LCS-558K(LAION/CC/SBU 子集,LLaVA 视觉指令预训练集) | 558K,仅对齐 Projector |
| Stage-1.5 | Image-4M(BLIP558K/COCO118K/CC3M/UReader/Instruct-Azure-DC/Evol-Instruct/SynthDog 共 8 源) | 4M |
| Stage-2(图像) | SI-3.2M(LLaVA-OneVision 单图集,含 Cambrian/Cauldron/UReader/AI2D/OKVQA 等) | 名义 3.2M,因部分子集不可下载实际用 3.1M |
| Stage-2(图像+视频) | OV-1.6M(约 80 万条重采样自 SI-3.2M + M4-Instruct + LLaVA-video 视频子集) | 名义 1.6M,因原论文过滤描述不清实际用 2.4M |
| Stage-3 | 机器人数据 3M 总量 = RoboVQA-800K(5,246 长程 episode + 92,948 中程 episode)+ ScanView-318K(MMScan-224K + 3RScan-43K + ScanQA-25K + SQA3D-26K)+ ShareRobot-200K 子集,三者合计约 1.3M(800K+318K+200K),再混入 Phase-1 高质量子集约 1.7M 通用图文数据防灾难性遗忘,机器人:通用 ≈ 4:6 | 3M |
| Stage-4(A-LoRA) | ShareRobot 可供性子集 + 其他开源可供性数据(如 AGD20K [58]) | 约 10K |
| Stage-4(T-LoRA) | ShareRobot 轨迹子集 + 其他开源轨迹数据(如 LLARVA [65]) | 约 400K |
数据消融(附录 Table 4,固定 40% 机器人数据 / 60% 通用数据):含 ShareRobot 的 Exp A(20% ShareRobot + 20% 其他机器人数据)平均分 62.48(ShareRobot-Eval 单项 63.11);去掉 ShareRobot 换成等量其他机器人数据的 Exp B 平均分降到 55.66,其中 ShareRobot-Eval 单项暴跌到 27.03——是整张消融表里落差最大的单项指标,验证了 ShareRobot 精细标注对模型能力的直接贡献。
训练方法
沿用 LLaVA-OneVision 的训练配方并向后扩展出机器人训练阶段,Phase 1(通用)+ Phase 2(机器人)共 7 个子阶段,全部 1 epoch、AdamW、weight decay 0、warmup ratio 0.03、cosine 学习率:
- Phase 1 通用 OV 训练:Stage-1 只训 Projector(lr 1e-3)对齐视觉-语言特征;Stage-1.5、Stage-2(图像)、Stage-2(图像+视频)逐步全参微调整个模型(lr_ViT=2e-6, lr_{Proj,LLM}=1e-5),提升通用理解、指令跟随、长视频/高分辨率感知能力。
- Phase 2 机器人训练:Stage-3 在 Phase-1 基座上继续全参微调(同一 lr 配置),用 3M 混合数据(1.3M 机器人 + 1.7M 通用回放)赋予模型机器人操作规划能力——这是发布的”Base Planning Model”检查点;Stage-4 冻结 Stage-3 骨干,只对 Projector+LLM 的 FFN 层插入 rank-64 LoRA(A-LoRA、T-LoRA 各自独立训练,互不干扰),分别学习可供性感知和轨迹预测——这样两种”具体”能力可以作为可插拔适配器叠加在同一个规划骨干上,而不需要为每个技能单独训一个完整模型,也避免了联合微调导致规划能力被稀释。
- 轨迹预测的设计消融(主文 Table 3,指标为 Discrete Fréchet Distance/Hausdorff Distance/RMSE,越低越好):Baseline(0.191/0.171/0.133)→ + Start Points 起点坐标(0.176/0.157/0.117)→ + Max Points 均匀采样限制 10 个路点(0.185/0.163/0.125)→ + Spec Token & End Points 专用标记路点/起止点(0.109/0.010/0.091,较 baseline 分别下降 42.9%/94.2%/31.6%)。起点坐标的引入被证实能纠正生成轨迹与末端执行器之间的平移偏移。
Infra(训练 / 推理工程)
- 训练硬件:每台服务器 8×A800 GPU 组成集群;分布式策略为 DeepSpeed ZeRO-3(Stage-1 到 Stage-3)/ ZeRO-2(Stage-4 两个 LoRA 阶段)。
- 各阶段 GPU 规模:Stage-1 16 节点(128 卡)、Stage-1.5 16 节点(128 卡)、Stage-2(图像)20 节点(160 卡)、Stage-2(图像+视频)20 节点(160 卡)、Stage-3 22 节点(176 卡)、Stage-4 A-LoRA 4 节点(32 卡)、Stage-4 T-LoRA 4 节点(32 卡)。总 GPU-小时:未披露。
- 序列长度:Stage-1 为 8192,Stage-1.5~Stage-3 扩到 32768,Stage-4(两个 LoRA 阶段)回落到 4096。
- 推理:官方支持 HF
transformers直接推理,以及 vLLM 服务化(vllm==0.6.6.post1,--max_model_len 16384 --limit_mm_per_prompt image=8),并可用 BAAI 自研的 FlagScale 做多节点分布式部署(flagscale serve llava_onevision)。GitHub README 披露:FlagScale 支持对模型做 W8A16 训练后量化压缩,模型体积缩小 40% 以上、推理速度最高提升 50%(压缩后输出会有轻微漂移)——此为工程附加项,非论文主体内容。控制频率/端到端时延/边缘设备部署:未披露(RoboBrain 只输出文本形式的计划/可供性框/轨迹点,本身不构成闭环实时控制器)。
评测 benchmark
规划能力(主文 + 附录 Table 3,基线含 GPT-4V、Claude3、LLaVA-1.5、LLaVA-OneVision-7B、Qwen2-VL-7B、RoboMamba):
- RoboVQA(BLEU1–4):RoboBrain 72.05 / 65.35 / 59.39 / 55.05,显著超过次优的 RoboMamba(54.9/44.2/39.5/36.3),BLEU-4 领先幅度达 +18.75。
- OpenEQA(GPT-4o 打分,7 项子指标):RoboBrain 总体优于 GPT-4V,但在部分子项(如 object-recognition 49.54)落后于 Qwen2-VL-7B(61.91)、LLaVA-OV-7B(51.73),论文承认仍有空间智能上的提升空间。
- ShareRobot-Eval(2,050 条 VQA,102 场景,12 本体,GPT-4o 打分,8 项子指标):RoboBrain 在 8 项中的 7 项领先,例如 discriminative 99.02(vs Qwen2-VL-7B 76.47)、future-prediction 72.92(vs 8.04)、generative 32.43(vs 4.63)。
可供性感知(主文 Table 2,AGD20K 风格测试集,指标 AP):RoboBrain 27.1%,超过 Qwen2-VL-7B 的 12.5%(+14.6)和 LLaVA-NeXT-7B 的 9.8%(+17.3)。
轨迹预测(主文 Table 3):最终模型 DFD 0.109 / HD 0.010 / RMSE 0.091(消融过程见”训练方法”)。
通用 MLLM 基准(附录 Table 2,用 LMMs-Eval 工具跑,对比 GPT-4V/LLaVA-OV-7B/InternVL2-8B/Qwen2-VL-7B/GPT-4o):RoboBrain 作为一个被机器人任务重度微调过的模型,在通用能力上仍保持竞争力——AI2D 82.03、ChartQA 80.48、RealWorldQA 68.89(超过含 GPT-4o 在内的所有列出基线的 58.6)、MMBench-en-test 80.44、MME 2084;在 DocVQA(88.0 vs GPT-4V 88.4)和 OCRBench(677 vs LLaVA-OV-7B 794)上略逊。
创新点与影响
- ShareRobot 数据集:在论文发表时是最大的开源”规划+可供性+轨迹”三维标注数据集(103 万 QA 对 + 6.5K 可供性图 + 6.9K 轨迹图),标注流程(Gemini 自动分解 + 人工三重复核)具备可扩展性,便于后续新增本体/任务/场景。
- 统一具身大脑范式:用一个 LLaVA+Qwen2.5-7B 骨干 + 两个独立轻量 LoRA 适配器覆盖三种此前需要分别建模的机器人认知能力(规划、可供性、轨迹),而不是为每种能力单独设计架构或动作头。
- 论文自述的局限:可供性感知在杂乱/嘈杂场景下会退化(定性可视化部分展示了失败案例),作者将其归因于 Stage-4 训练数据缺乏此类噪声场景,并明确列为未来工作;OpenEQA 上的空间智能泛化也被作者认为有待加强。
- 后续影响:RoboBrain 系列由此延展为 RoboBrain 2.0(arXiv:2507.02029)与 RoboBrain 2.5(arXiv:2601.14352,把 2D 可供性/轨迹升级为深度感知的 3D 空间推理 + 稠密时序价值估计,用于给 VLA 强化学习提供密集奖励信号),并衍生出多机协同系统 RoboOS 与视觉推理强化微调框架 Reason-RFT。RoboBrain 于 2025-04-11 被 CVPR 2025 官方”Embodied AI Trends Commentary”专题报道收录。
原始链接
- arXiv: https://arxiv.org/abs/2502.21257
- PDF: https://arxiv.org/pdf/2502.21257
- GitHub(代码/训练脚本/推理): https://github.com/FlagOpen/RoboBrain
- 项目主页(RoboBrain 1.0 子页): https://superrobobrain.github.io/robobrainv1/index.html
- HuggingFace 权重(Planning 基座): https://huggingface.co/BAAI/RoboBrain
- HuggingFace(A-LoRA 可供性): https://huggingface.co/BAAI/RoboBrain-LoRA-Affordance
- HuggingFace(T-LoRA 轨迹): https://huggingface.co/BAAI/RoboBrain-LoRA-Trajectory
- HuggingFace(ShareRobot 数据集): https://huggingface.co/datasets/BAAI/ShareRobot
- ModelScope: https://www.modelscope.cn/models/BAAI/RoboBrain/files/
- ShareRobot 数据集 GitHub: https://github.com/FlagOpen/ShareRobot
- 在线 Demo: https://ei2.baai.ac.cn/home
一手源存档(sources/)
- robobrain—github-readme — GitHub README 快照(sources/embodied/2025/robobrain—github-readme.md)
- robobrain—project-page — 项目主页(RoboBrain 1.0 子页)快照(sources/embodied/2025/robobrain—project-page.md)
- arXiv 2502.21257 全文 PDF(含附录 A–E 完整训练配置/数据统计/消融表)(arXiv 原文 PDF,不入 git)