一句话定位
RoboCerebra 是北航 / 新加坡国立大学 / 上海交大团队提出的超长时程机器人操作评测基准,专门评测 VLA 智能体的”System 2”式高层推理(规划、反思、记忆),含 1,000 条人工标注轨迹(100 个任务变体、平均 9.1 个原子步骤、平均轨迹长 2,972.4 个仿真步——约为既有长时程基准的 6 倍),并提出分层规划-执行(HPE)框架把 VLM 高层规划器和 OpenVLA 底层控制器接起来;NeurIPS 2025 收录。
背景与定位
论文把自己放进”双过程”框架里:现有 VLA 工作(如 openvla、RT-2)绝大多数是快速反应式的 System 1 策略,把语言指令直接映射到底层控制信号,没有发挥 VLM 在语义抽象、关系理解上的优势;这些能力更契合慢思考的 System 2 过程(长时程规划、子目标分解)。而已有的多步基准——calvin、robocasa、libero(含其 Libero-Long 子集)、vlabench——虽然把任务从单步扩展到多步,但通常只有 2~5 个子任务、少于 500 个动作步,缺乏动态场景变化和记忆需求,无法反映真实世界的层级目标分解和自适应规划需求。
论文用 Table 1 逐项对比 RLBench、VLMBench、ARNOLD、ALFRED、calvin、robocasa、Libero-Long、vlabench 与自己在”长时程 / LLM 生成任务 / 人类轨迹 / 动态场景 / 时间标注 / 细粒度分解”六个维度上的差异,指出 RoboCerebra 是唯一同时具备全部六项特征的基准:训练集 1,000 条轨迹对应 100,000 个变体(“1,000 (100,000)”),测试集 60 个任务对应 600 个变体,平均轨迹长度约为其余基准的 6 倍。
范式关键词:System 1 / System 2 双过程具身智能体、分层规划-执行(planner + controller)、长时程记忆与动态扰动评测。低层控制器沿用 openvla(OpenVLA-OFT 代码库用于官方评测流水线,见 openvla-oft),与同期聚焦”高层语义任务到低层连续控制全层级”评测的 embodiedbench 形成互补——EmbodiedBench 横跨导航/操作/家务四个环境测视觉作用,RoboCerebra 则专注单一操作域内的时间尺度(时长 6 倍、显式记忆/扰动子任务)来隔离测试规划与记忆能力。
作者:Songhao Han、Boxiang Qiu(并列一作)、Yue Liao(并列一作 + Project Leader)、Siyuan Huang、Chen Gao、Shuicheng Yan、Si Liu(通讯作者);机构为北京航空航天大学、新加坡国立大学、上海交通大学。
模型架构
RoboCerebra 本身是评测基准 + 数据集,另配套提出一个分层规划-执行(Hierarchical Planning and Execution, HPE)框架作为参考基线:
- System 1(低层控制器):直接采用 openvla 架构,在长时程域数据上微调;接收自我中心(egocentric)高频视觉观测 + 当前子目标指令,输出离散化 token 化的机器人动作(沿用 OpenVLA 的 next-token prediction 范式)。
- System 2(高层规划器):一个 VLM,处理低频观测,把高层任务指令解析为一系列 step-level 子目标,写入共享记忆库(memory bank);训练阶段用”执行视频 + 成功/失败标注的分步指令”做对比式监督,让 VLM 学会判断任务进度(成功 vs 未完成)。
- 协调机制:VLA 持续查询记忆库中的当前活跃子目标并执行细粒度动作;VLM 周期性关注最近观测以监控执行进度,检测到子目标完成或偏离时更新记忆库中的下一子目标或发出修正指令,形成闭环协调(Algorithm 1: Task-Aware Memory Mechanism)。
- 评测中使用的具体 System 2 模型:GPT-4o、Qwen2.5-VL(-7B)、LLaVA-Next-Video(-7B),以及去除视觉输入的”盲”变体(Qwen2.5-VL-Blind、LLaVA-Next-Blind、GPT-4o-Blind)用于隔离语言推理能力;另有一个在 RoboCerebra 视频-指令数据上做 SFT 的 Qwen2.5-VL-7B-SFT。
- 锚点对齐(anchor points):为了让不同规划模型之间的子目标切换时机保持公平可比,评测协议预先定义一组锚点决定 System 1 何时在子目标间转换,把”切换时机”与具体规划模型解耦。
数据
- 规模:1,000 条人工标注轨迹,覆盖 100 个任务变体(训练侧标称 100,000 个变体、测试侧 60 个任务对应 600 个变体,即测试用 60 个任务 × 10 次 rollout);每个任务实例含 2 到 20+ 个原子步骤(均值 9.1),累计超过 10,000 个 step 级分段标注;平均轨迹长度 2,972.4 个仿真步(约为既有长时程操作数据集的 6 倍)。
- 动作类型:定义 12 种动作类别,place / pick / pour 为高频主力动作,turn / return / store 等为低频精细动作;平均每个任务涉及 3.5 种动作类别,超过 10% 的任务需要 5 种以上动作类别。
- 场景:基于 libero 仿真平台构建,涵盖备饮品、整理食品杂货、收拾房间、摆餐桌等家居活动。
- 六类子任务(用于隔离不同 System 2 认知能力):Ideal(静态全可观测基线)、Memory Exploration(需主动探索建立内部表征,如查看柜子隔间内容)、Memory Execution(依赖记忆检索完成目标,探索阶段的感知线索被移除)、Random Disturbance(引入意外环境变化,如碰撞后物体移位)、Observation Mismatching(要求对计划-感知错位保持鲁棒)、Mix(叠加记忆与动态因素,要求持续重新规划)。
- 构建流水线(三阶段):
- 级联任务生成(Cascaded Task Generation):从 Libero 物品库随机采样物体,转换为带类别/功能可供性/空间上下文的结构化表示;用 GPT-o3-mini 生成高层任务描述(如”在微波炉里加热牛奶”),再分解为连贯的分步子任务指令;prompt 中显式加入可供性感知和空间接地推理,校验前置/后置条件与物体交互的物理合理性。
- 场景初始化与验证执行:把每个动作步解析成空间/关系约束(如”把牛奶从 short_fridge_upper_region 放到 coffee_table_top”),维护固定装置与可移动物体的注册表,按规则映射生成初始/目标物体摆放,编译成可执行仿真代码;双重验证——符号仿真器循环校验跨步骤的物体状态/关系约束一致性,GPT-4o 做视觉-语言验证循环(基于多视角 RGB-D 渲染判断空间合理性是否符合人类常识)。
- 人工演示与标注:人工操作员在仿真中执行任务指令生成轨迹,每条轨迹标注细粒度子任务边界(时间分段)。人力投入:任务生成 prompt 20 小时 + 规则定义编程 30 小时 + 轨迹与时间标注 400 小时 + 人工二次校验 200 小时(Table 2)。
- VideoQA 评测集:额外构建 M 个人工撰写的二元问题,用于评估感知对齐与语义可解释性(对应 Action Completion Accuracy 指标)。
训练方法
- System 1(OpenVLA)微调:从 RoboCerebra 训练集采样 100 个任务实例,按时间标注分解为单步序列;训练 200K 步,全局 batch size 64,初始学习率 5e-5(100K 步后衰减),输入分辨率 256×256;训练与评测均在 8 张 NVIDIA A100 GPU 上进行。
- System 2(VLM)训练:构建带 step-level 指令标注的执行视频数据集(含成功与未完成两类执行),用对比式监督让模型关联视觉序列与指令完成状态,使 VLM 具备进度感知的规划/重新规划能力。
- 评测协议核心指标(对应第 3.4 节公式 1–4):
- 任务成功率 SR:衡量智能体是否达成预期的物体状态转移(用仿真器内部谓词函数 ψ(s) 自动验证)。
- 平均规划匹配准确率 Acc_P:预测高层计划与人工标注的 ground-truth 计划做精确序列匹配。
- 规划效率 η = SR / Len:成功率除以平均计划长度。
- 动作完成准确率 Acc_C:基于 VideoQA 二元问题的语义可解释性指标,与”反思”能力密切相关。
- 针对记忆任务另设 Exploration-only Success Rate、Exploration Efficiency(基于预测计划与 ground-truth 计划的重叠度 Comp_Exp 归一化)、Decision Accuracy(目标物体识别与计划选择的正确率)等中间指标。
- 评测覆盖每个方法 600 次 rollout(60 个任务 × 10 次试验)。
Infra(训练 / 推理工程)
- 训练硬件:OpenVLA 微调与评测均在 8 张 NVIDIA A100 GPU 上完成;200K 训练步、batch size 64、输入分辨率 256×256。
- VLM 训练/推理:论文未披露 System 2 VLM 微调(Qwen2.5-VL-7B-SFT)的 GPU 数量、显存或训练时长。
- 推理延迟 / 控制频率(Hz/FPS):论文未披露具体数值;仅说明 VLA 使用高频视觉观测执行细粒度动作,VLM 使用低频观测周期性更新计划。
- 数据构建人力成本(非计算 infra,但论文明确量化):任务生成 prompt 20 小时、场景规则编程 30 小时、人工轨迹与时间标注 400 小时、人工二次校验 200 小时。
评测 benchmark
主结果(Table 3,600 rollout = 60 任务 × 10 trial,成功率 %):
| 方法 | Avg | Ran.(随机扰动) | Obs.(观测错配) | Exp.(记忆探索) | Exe.(记忆执行) | Mix | Ideal |
|---|---|---|---|---|---|---|---|
| OpenVLA-Libero100(未在长时程域微调) | 2.00 | 4.59 | 1.35 | 0.18 | 1.86 | 0.00 | 4.05 |
| OpenVLA*(长时程域微调) | 4.57 | 7.84 | 8.65 | 1.06 | 2.06 | 0.00 | 7.84 |
| Planner+OpenVLA*(GPT-4o 做纯规划,无反馈) | 16.04 | 18.63 | 19.45 | 8.04 | 16.69 | 11.48 | 21.92 |
| HPE 分层框架(GPT-4o + 记忆/重新规划闭环) | 16.55 | 18.63 | 19.18 | 9.06 | 17.83 | 13.21 | 21.10 |
- Ideal 设定下微调 OpenVLA 仅 7.84%,远低于 HPE 的 21.10%;Mix 设定(同时含记忆需求与动态变化)下微调 OpenVLA 完全失败(0.00%),凸显纯 System 1 策略无法处理长时程依赖与部分可观测性。
- Mix 设定下 System 2 带来的提升最明显:Planner+OpenVLA 达 11.48%、HPE 达 13.21%;但在 Ideal(全可观测静态)设定下 HPE 反而比 Planner+OpenVLA 低 0.82 个百分点,说明简单任务中额外的推理开销可能引入次优决策。
Planner 模型消融(Table 4,%):
| Planner | Avg | Ran. | Obs. | Exp. | Exe. | Mix | Ideal |
|---|---|---|---|---|---|---|---|
| GT-plan(人工标注计划,上界) | 25.16 | 26.85 | 30.68 | 19.47 | 23.48 | 19.26 | 31.23 |
| GPT-4o | 16.04 | 18.63 | 19.45 | 8.04 | 16.69 | 11.48 | 21.92 |
| GPT-4o-Blind(无视觉) | 15.10 | 20.00 | 17.03 | 7.02 | 16.09 | 10.48 | 20.00 |
| Qwen2.5-VL-Blind | 11.87 | 18.90 | 12.88 | 7.02 | 10.87 | 2.55 | 18.90 |
| LLaVA-Next-Video | 11.37 | 16.71 | 16.16 | 1.07 | 10.87 | 3.70 | 19.73 |
| Qwen2.5-VL | 11.19 | 14.25 | 14.25 | 2.63 | 12.61 | 6.67 | 16.71 |
| LLaVA-Next-Blind | 8.00 | 13.97 | 12.33 | 3.54 | 3.54 | 0.37 | 14.25 |
GPT-4o 比其余被测 VLM 高出 4 个百分点以上;即便去掉视觉输入(GPT-4o-Blind),性能仍相对稳定(15.10% vs 16.04%),说明语言推理本身对长时程任务贡献显著;但 GPT-4o 与 GT-plan 上界仍有 9 个百分点以上差距。
System 2 多维度评测(Table 5):
| 模型 | Acc_P↑ | Acc_C↑ | SR↑ | Len↓ | η↑ |
|---|---|---|---|---|---|
| GPT-4o | 68.33 | 32.66 | 16.04 | 10.67 | 1.50 |
| GPT-4o-Blind | 61.37 | 0.00 | 15.10 | 10.73 | 1.41 |
| Qwen2.5-VL-7B | 44.67 | 47.74 | 11.19 | 8.30 | 1.34 |
| LLaVA-Next-Video-7B | 40.00 | 37.19 | 11.37 | 8.33 | 1.36 |
| Qwen2.5-VL-7B-SFT | 30.00 | 66.83 | 9.33 | 6.95 | 1.32 |
GPT-4o 在规划准确率、成功率、规划效率上均最优;Qwen2.5-VL 经 RoboCerebra 数据微调后反思能力(Acc_C)显著提升(47.74%→66.83%),但整体成功率反而略降(11.19%→9.33%)。
记忆任务细粒度结果(Table 6,Hierarchical Framework 下):
| VLM | SR_Exp.↑ | SR_Exp.-only↑ | η_Exp.↑ | SR_Exe.↑ | Acc_Dec.↑ |
|---|---|---|---|---|---|
| Qwen2.5-VL | 3.54 | 50.0 | 0.17 | 12.39 | 10.0 |
| GPT-4o | 9.06 | 80.0 | 0.32 | 17.83 | 30.0 |
GPT-4o 在探索阶段定位目标物体的成功率(80.0%)远高于 Qwen2.5-VL(50.0%),决策准确率(30.0% vs 10.0%)也明显更高。
创新点与影响
- 首个显式评测”System 2”式高层推理的长时程操作基准:把成功率单一指标拆分为规划准确率、规划效率、动作完成准确率(反思相关)等多维指标,并进一步细分探索效率、决策准确率等记忆专项指标。
- 六类子任务系统化隔离记忆与动态因素:Ideal / Memory Exploration / Memory Execution / Random Disturbance / Observation Mismatching / Mix 六类任务首次在同一基准内同时覆盖长时程记忆保持、部分可观测推断、环境动态更新、扰动恢复。
- GPT-o3-mini 驱动的级联任务生成 + 双重验证流水线:把 LLM 生成任务、符号仿真校验、VLM 视觉-语言校验结合起来,在保持大规模自动化的同时用人工执行保证轨迹真实性(400+200 人工标注/校验小时)。
- HPE 分层框架验证了 System 2 规划对复杂长时程任务(尤其 Mix 设定)确有实质提升,但在简单静态任务中反而可能因推理开销引入次优决策。
- 论文自陈局限:System 1-System 2 交互仍较有限,未来需要更丰富的双向通信以实现更细粒度、可解释的反馈;评测协议可进一步扩展执行层面信号(如子任务顺序、失败恢复);目前基准完全在仿真中构建,部署到真实世界会引入额外挑战,有待进一步验证长时程推理在真实条件下的有效性。
原始链接
- 论文 arXiv:https://arxiv.org/abs/2506.06677(PDF:https://arxiv.org/pdf/2506.06677)
- 项目主页:https://robocerebra.github.io/
- 代码(GitHub):https://github.com/qiuboxiang/RoboCerebra
- 数据集(Hugging Face,原始轨迹):https://huggingface.co/datasets/qiukingballball/RoboCerebra
- 基准(Hugging Face,RLDS 预转换):https://huggingface.co/datasets/qiukingballball/RoboCerebraBench
一手源存档(sources/)
- robocerebra—project-page.md — 项目主页快照(摘要、数据集统计、HPE 框架示意、基准结果图)
- robocerebra—github-readme.md — GitHub README 快照(NeurIPS 2025 标注、安装/评测命令、Apache-2.0 许可、依赖 OpenVLA-OFT/LIBERO)
- robocerebra—hf-card.md — Hugging Face 数据集卡快照(原始轨迹仓库结构:RLDS 导出、demo.hdf5、task_description.txt 等)
- arXiv 原文 PDF(https://arxiv.org/pdf/2506.06677,arXiv 原文 PDF,不入 git)