一句话定位
VLABench 是复旦大学(OpenMOSS 组)提出的机器人操作基准:100 个任务类别(60 原子 + 40 复合)、163 类 / 2164 个物体,专门针对”用基础模型做操作”这一路线设计——强调世界知识/常识迁移、非模板化自然语言指令、长时程多步推理,并把 VLA 策略执行与 VLM 语言理解拆开分别评测;实验显示 OpenVLA/Octo/RDT-1B 微调后表现普遍很差(多数任务 Progress Score 个位数到十几),后续(2025)用 pi0 系列微调把 Track 1 成功率拉到 30~51%。
背景与定位
VLABench 针对的问题:rlbench、calvin、libero 等已有基准聚焦技能学习本身,任务多用模板化指令(“pick A then place B”),物体类别数有限,且未考虑基础模型带来的常识迁移与语义理解能力——例如 RT-2 论文里”把可乐罐挪到泰勒斯威夫特旁边”这类需要常识关联的任务,或 CoPA 论文里”帮我做一杯手冲咖啡”这类需要多步分解的长时程任务,是此前基准无法系统评测的。robocasa、behavior-1k、ARNOLD 等虽在任务规模/资产量上有所突破,但仍主要在指令形式上偏模板化,未把语言的引导作用当作评测重点。
VLABench 的定位是:为”基于基础模型做语言条件操作(LCM)“这条路线(无论是像 RT-2/OpenVLA 那样预训练 VLA,还是像 VoxPoser/CoPA 那样把 LLM/VLM 输出接到抓取预测和运动规划算法上的 workflow 方案)提供统一评测协议,同时评测策略执行能力(VLA/workflow)与语言模型本身的场景理解能力(VLM)。论文将现有基准的 12 个维度(语义丰富度、逻辑推理、常识要求、域随机化、任务数、物体类别数、物体总数、AI 生成资产、多相机、点云支持、跨本体、自动轨迹采集)逐一列表对比,VLABench 是其中唯一在”语义丰富度、逻辑推理、常识要求、强域随机化”这前四项全部打勾的基准(对照 rlbench、calvin、ManiSkill、libero、robocasa、ARNOLD、behavior-1k、Habitat 2.0、ALFRED——其余基准这四项均为空或部分缺失)。
模型架构
VLABench 本身是评测框架 + 数据生成平台,不提出新策略架构;实验中拿三类方法当”被试”:
VLA 策略(微调对象):
- Octo:Transformer 策略,single-view 224×224 图像输入。
- OpenVLA:7B 参数,基于 Llama2-7B 的 VLM 骨干;LoRA 微调(非全参);同样是 single-view 224×224 输入;动作离散化 token 化。
- RDT-1B:diffusion policy 架构;全参数微调;三视角(multi-view)输入;默认单轨迹推理用 64 个轨迹点的开环控制(open-loop)。
Workflow(免训练零样本方案): VoxPoser(纯文本 LLM 驱动运动规划,可选加 GPT-4V 视觉感知模块)、CoPA(结合 SoM 系列视觉定位 + GraspNet 抓取规划)。
VLM(仅评测语言/场景理解,不接实际动作执行): GPT-4-turbo-2024-04-09、GPT-4o-2024-08-06、GLM-4V-9B、MiniCPM-V2.6、Qwen2-VL-7B-Instruct、InternVL2-8B、LLaVA-NeXT。VLM 输出走一套领域特定语言(DSL)——技能库(Pick/Place/Lift 等原子操作)+ 参数(目标物体/朝向/夹爪状态)+ 执行序列,VLM 只需生成技能序列而非直接输出连续动作。
机器人本体:标准评测用 7-DoF Franka Emika Panda + 平行夹爪,末端位姿用 3D 坐标 + 四元数表示,经逆运动学解算到 7 个关节角;框架另支持 6/7 轴单臂、双臂、人形、带末端执行器的四足、移动底座等跨本体(cross-embodiment)配置。
数据
资产库:163 个物体类别,共 2164 个物体实例。来源:部分标注资产继承自 robocasa,大量 3D 模型取自 Objaverse;玩具主题等新任务类别从在线 3D 模型站手工收集,用 obj2mjcf 转成 MJCF;参照 RoboCasa/Behavior-1K 思路,额外用 Tripo.AI(text-to-3D / image-to-3D)与 Runway.ai(材质纹理生成)扩充常见简单物体资产。抓取点标注:先用 GraspNet 批量粗标再人工精修;容器(receptacle)用 SAM 辅助标注包围盒并给出默认放置点。
场景:20+ 种场景类型(厨房、客厅、餐厅、商场、超市、化学实验室、医疗室等),20+ 种墙面/地板材质纹理。
任务规模:100 个任务类别(60 原子 + 40 复合),每类任务下不同物体/受体组合视为同一任务的不同 rollout(而非像 libero 那样把”苹果放盘子""梨放盒子”当成两个任务)。原子任务平均 episode 长度约 120 步(10Hz 控制频率),复合任务平均 episode 长度超过 500 步——比 RoboCasa Atomic、RoboCasa Composite 分别长 27.0% 和 35.1%。
指令生成:用 GPT-4 按系统提示词模板生成语言指令,每个任务/数据点生成 10 条指向同一目标物体但表达方式完全不同的指令;常识类任务额外注入”目标物体独特特征”的提示(如强调 IP 而非直接报玩具名),语义类任务进一步要求隐含表达需求(不直接提物体名)。
域随机化:mesh 在同类别内随机换实例(如苹果从 20 个候选网格中随机选);位置偏移 x/y ∈ [-0.05, 0.05],朝向偏航角 ∈ [-π/10, π/10];网格缩放 ∈ [0.95, 1.05];光照强度 ∈ [0.8, 1.2];随机添加 1-2 个干扰物体(如 SelectToy 任务里混入水果)。
微调数据集(下游标准数据集):官方发布 10 个原子任务(Add Condiment、Insert Flower、Select Book、Select Chemistry Tube、Select Drink、Select Fruit、Select Mahjong、Select Painting、Select Poker、Select Toy)各 500 条 episode 的 HDF5 数据(VLABench/vlabench_primitive_ft_dataset);单条 episode 含 4 路相机 RGB-D(480×480)、点云、7 维关节位置/速度/加速度、8 维末端执行器状态与语言指令。论文原始实验里对每个原子任务类别采样 100 条轨迹用于微调,共计 1,600 条轨迹(覆盖论文所用的原子任务类别集合,与后续官方发布的 10 任务标准数据集规模不完全一致)。
训练方法
数据采集是自动化流水线而非人类遥操作:基于自建技能库的任务专属运动规划器,结合环境点云、物体抓取点、当前目标实体等先验信息选定技能与参数;轨迹由 RRT 生成,四元数插值用球面线性插值(SLERP),最终轨迹用贝塞尔曲线平滑;用拒绝采样 + 失败提前终止提升采集效率。
VLA 微调设置:对 OpenVLA(LoRA)、Octo、RDT-1B(全参)均沿用官方默认超参,固定训练 epoch 数而非固定步数以保证跨数据规模可比;Octo 收敛慢,训练超过 5 epoch 才达到较优拟合。VLM 评测走两种流程:非交互式(给四视角图 + 分割标注图 + 指令,让 VLM 输出 DSL 技能序列,与人工标注的 groundtruth 序列做图匹配打分)与交互式(DSL 序列经控制器解析为可执行动作,实际下发到仿真环境跑 progress score)。Workflow 评测按”执行→记录目标识别信息→按识别正确 20% + 任务成功满分的权重打分→多次评测取平均”的流程进行。
Infra(训练 / 推理工程)
论文原始实验:全部 VLA 微调在 4× NVIDIA A800(80GB) 上完成;未披露具体 GPU-hours、并行策略与训练精度。仿真基于 MuJoCo + dm_control control suite;未披露仿真侧渲染/物理帧率(FPS)等推理工程细节。控制频率标注为 10Hz(用于计算 episode 长度)。
评测 benchmark
指标为 Progress Score (PS) = α·(正确选中目标数/总目标数) + (1-α)·(完成子步骤数/总子步骤数),默认 α=0.2(比传统 0/1 成功率更细粒度);VLM 额外用 Skill Recall / Parameter Recall / Skill&Parameter Recall / Precise Matching Rate 四项指标加权求和。
VLA 微调结果(原始论文,均为 PS,8 个原子任务 Add Condiment/Insert Flower/Select Book/Select Drink/Select Toy/Select Tube/Select Painting/Select Fruit 的平均值):
| 模型 | 设置 | Seen 均值 | Unseen 均值 |
|---|---|---|---|
| Octo | Base | 1.34 | 0.77 |
| Octo | Common Sense | 1.16 | 0.96 |
| OpenVLA | Base | 11.74 | 7.93 |
| OpenVLA | Common Sense | 8.46 | 5.11 |
| RDT-1B | Base | 15.37 | 9.08 |
| RDT-1B | Common Sense | 11.97 | 3.61 |
其他泛化维度(均值 PS):语言指令泛化 — Octo 0.00 / OpenVLA 4.15 / RDT-1B 4.31;未见但相似任务泛化 — Octo 0.00 / OpenVLA 4.46 / RDT-1B 3.85;复合任务 — Octo 0.00 / OpenVLA 2.66 / RDT-1B 3.34。整体所有模型在所有维度上得分都很低(个位数至十几分),远未表现出 LLM 式的”预训练涌现”泛化。
消融(原子任务 Seen 设置,PS):
- 预训练 vs 从头训:Octo 1.02→1.34;OpenVLA 3.02→11.74;RDT-1B 6.26→15.37(预训练带来的提升在 OpenVLA/RDT-1B 上明显,Octo 上有限)。
- RDT-1B 开环 vs 闭环:开环 64 步 15.37、开环 32 步 15.52、闭环(cls)17.68——闭环略优,说明低成功率主要源于模型本身能力而非误差累积。
Workflow(VoxPoser / CoPA):基础任务 PS 约 30-40,但整体分数低;VoxPoser 加视觉感知模块后空间推理任务提升,但常识/语义维度略降;两者在高复杂度长时程任务上主要能做实体识别,规划分解普遍失败(Figure 4/5 为雷达图定性展示,论文未给出可提取的数值表)。
VLM 六维雷达图评测(1-shot,GLM-4V-9B 因不支持多图输入用 0-shot):Qwen2-VL-7B-Instruct 在部分维度超过 GPT-4-turbo-2024-04-09;仅 GPT-4o 在推理维度达到与其他维度相当的均衡水平,其余模型推理维度普遍只有约 20 分;语义维度从直接语义转向隐含语义时各模型分数明显下滑;LLaVA-NeXT 空间感知弱,GLM-4V-9B 空间/物理推理强但语义理解弱。CoT 提示对 InternVL2 有明显提升,对 LLaVA-NeXT/Qwen2-VL 在复杂推理/物理任务上有提升但常识任务上停滞或轻微下降;MiniCPM 加 CoT 后反而输出格式崩溃、全部得 0 分。few-shot 从 0 增到 7 对 Qwen2-VL 有提升但 2-3 shot 后收益递减。
后续(2025,非本论文数据,见 GitHub README):官方在 10 个原子任务的标准微调数据集上放出 pi0 系列 checkpoint,Track 1(in-distribution)成功率:pi0-fast-ft(官方 transform)29.1%、pi0.5-ft 40.6%、pi0-ft 47%、pi0-fast-ft(delta chunk,对齐版)51.2%——较论文原始 OpenVLA/RDT-1B 的个位数~十几 PS 有数量级提升,侧面印证了论文关于”更强预训练骨干+更好动作表征”的判断。
创新点与影响
- 首个把”世界知识迁移、隐含语义指令、长时程多步推理、VLA 与 VLM 分别评测”四点系统整合进机器人操作基准的工作,并给出 12 维度对比表证明与既有基准的差异化。
- 提出 Progress Score 细粒度指标与面向 VLM 的 DSL 技能序列图匹配评测(SR/PR/SPR/PM),把”策略执行能力”和”场景理解/规划能力”解耦评测。
- 构建可扩展的自动化数据采集框架(技能库 + RRT/SLERP/贝塞尔轨迹生成 + 拒绝采样),并发布对应标准微调数据集,免去人类遥操作的规模化瓶颈。
- 实证性结论:当时(2024 年底)SOTA 开源 VLA(OpenVLA/Octo/RDT-1B)在常识迁移、语义泛化、长时程规划上普遍表现很差,作者类比”VLA 现状远不及 GPT-2 阶段的 LLM”;workflow 类零样本方法受限于模块化设计的瓶颈效应与模块间连接误差;VLM 在具身场景中的推理/规划能力显著弱于其在通用多模态任务上的表现。已被 ICCV 2025 接收。
论文自陈局限:
- 复合任务的微调评测数据集当时仍在整理(“under management”),未与原子任务同规模发布。
- Workflow 类方法评测仅覆盖 VoxPoser/CoPA 两个代表性方案。
- VLA 预训练数据规模(几百万样本量级)与 LLM 差距巨大,VLA 预训练的 scaling 规律仍是未决问题。
- 仿真到真实的迁移(sim-to-real)未在本文验证。
原始链接
- arXiv abs:https://arxiv.org/abs/2412.18194
- arXiv PDF:https://arxiv.org/pdf/2412.18194
- 项目主页:https://vlabench.github.io/
- 代码(GitHub):https://github.com/OpenMOSS/VLABench
- Hugging Face 组织(模型/数据集):https://huggingface.co/VLABench
- 标准微调数据集:https://huggingface.co/datasets/VLABench/vlabench_primitive_ft_dataset
一手源存档(sources/)
- vlabench—github-readme.md — GitHub README(安装、评测 track 说明、2025 年新增 checkpoint 与 Track 1 成功率)
- vlabench—project-page.md — vlabench.github.io 主页快照(六维能力定义、任务示例、三类排行榜定性结论)
- vlabench—hf-dataset-card.md — HF 标准微调数据集卡(10 任务 × 500 episode,HDF5 结构示例)
- arXiv 原文 PDF(https://arxiv.org/pdf/2412.18194,arXiv 原文 PDF,不入 git)