一句话定位
RoboVLMs 不是一个”新模型”,而是一份系统性实证研究:用统一框架把 8 种 VLM backbone 接成 4 类 VLA 结构(历史建模方式 × 动作空间连续/离散),在 CALVIN、SimplerEnv 和真实机器人上跑了 600 余组对照实验,得出一份 VLA 建造配方——连续动作 + policy head 融合历史 + 选视觉语言预训练充分的 backbone(KosMos-2/PaliGemma)+ cross-embodiment 数据放在预训练阶段而非与目标数据共训;用这份配方搭出的 KosMos+Policy-Head 模型在 CALVIN 两个训练/测试切分上刷新开源 SOTA(ABCD→D 平均完成 4.49/5、ABC→D 平均完成 4.25/5 个连续子任务),论文被 NeurIPS 2024 收录为 Oral。
背景与定位
范式:VLA 设计空间的系统消融研究。2024 年前后 octo(interleaved-continuous)、gr-1(interleaved-continuous)、RoboFlamingo(policy-head-continuous)、openvla/RT-2(one-step-discrete)各自在”历史怎么建模、动作空间连续还是离散、用哪个 VLM 底座、要不要上 cross-embodiment 数据”这几个轴上各占了一个点,但没人把这些轴放在同一个可控实验里比较过。RoboVLMs 的定位就是把这些散落的设计选择收进一个统一框架(同一套数据处理、同一套评测协议、只换 backbone/结构/数据配方这一个变量),逐一回答四个问题:为什么要 VLA、VLA 该怎么搭、该选哪个 VLM 底座、cross-embodiment 数据该什么时候用。
关联工作:评测对比基线覆盖 MCIL、R3M、Voltron、RT-1、HULC、gr-1、RT-1-X、RT-2-X、Octo-Base/Small、openvla;cross-embodiment 数据用 open-x-embodiment(OXE);“post-train”(先在 OXE 上练、再在目标数据上微调)这一结论后来被 pi0 等工作采纳为标准训练阶段设计。
模型架构
不是单一 backbone/单一结构,而是一个可插拔框架,两个正交轴组合出 4 类 VLA 结构:
- 历史建模:one-step(只用当前观测)vs. history(滑动窗口历史);history 又分 interleaved(历史观测-动作对以交错格式喂入 VLM 主干做融合,如 octo、GR-2、ACT)和 policy head(VLM 每步只出单步多模态表征,历史融合和动作预测交给额外的 policy head——RNN/Transformer/扩散模型,如 RoboFlamingo、π0)。
- 动作空间:连续(MLP 回归)vs. 离散(RT-2 式 next-token 预测)。
- 四类组合:One-Step-Discrete(RT-2、OpenVLA 一类)、One-Step-Continuous、Interleaved-Continuous(Octo、GR-1/GR-2 一类)、Policy-Head-Continuous(RoboFlamingo、π0 一类)。interleaved/policy-head 与离散动作空间的组合未实现(下三角注意力掩码无法有效屏蔽后续动作步)。
VLM backbone 覆盖 8 个(Table V,含 Flamingo 三档规模各算一个):Flamingo 家族(编码器-解码器结构,3B/4B/9B 三档,64 图像 token,~1B+ 级 VL 预训练数据)、Qwen-VL(9B,256 token,350K 级预训练数据)、MoonDream(3B,576 token)、UForm(1.3B,256 token,10M 级预训练数据)、PaliGemma(3B,256 token,10B 级预训练数据)、KosMos-2(2B,64 token,90M 级预训练数据);另在结构消融(Table III)里单独测过 LLaVA(解码器结构)。编码器-解码器结构靠交叉注意力融合视觉-语言;解码器结构把视觉/语言/动作 token 拼接后自注意力融合。LLaVA、Qwen-VL 若不加 perceiver resampler 把视觉 token 降采样,VLA 表现异常差。
动作预处理:先按训练数据中每维动作的第 1/99 分位数做 clamp+归一化到 [-1,1];离散化时把归一化动作按维度均匀分成 256 个 bin,加 offset=10 后覆写词表中最不常用的 token 位。7 维动作 = 3 维平移 + 3 维欧拉角旋转 + 1 维夹爪开合。
最优配置 = KosMos-2 + Policy Head(连续动作),window_size(历史长度)8 或 16(依实验而定),fwd_pred_next_n(动作 chunk 长度)= 10,policy head 支持 LSTMDecoder/GPTDecoder/FCDecoder/DiscreteDecoder 多种实现(GitHub 配置里默认 LSTMDecoder,hidden_size 1024)。
数据
- CALVIN:24K 条人类遥操作演示,34 个基础技能(rotate/lift/push/turn on/off 等桌面操作),4 个场景切分 A/B/C/D;训练常用 ABCD→D(同分布)与更难的 ABC→D(跨场景零样本泛化)。评测在 D 切分跑 1000 次 rollout,每次 5 个连续子任务。
- SimplerEnv:real-to-sim 仿真评测套件,覆盖 Google Robot(Pick Coke Can 75 trial、Move Near 60 trial、Open/Close Drawer 54 trial、Open Drawer+Place Apple 27 trial)和 WidowX+Bridge(Put Spoon on Towel、Put Carrot on Plate、Stack Green on Yellow、Put Eggplant in Basket,各 24 trial)。
- Open X-Embodiment(OXE):作为 cross-embodiment 数据源,用于研究预训练/后训练/共训三种引入方式;具体混合配比本文未单独披露,代码库配置项
data_mix提供oxe_magic_soup等预设。 - 真实机器人数据(ByteDance Robot Benchmark):论文正文/附录两处给出略有出入的规模——引言处称”100 个操作任务、共 74K 条轨迹”,附录 C 更精确地给出”超过 70K 条遥操作轨迹,覆盖 105 个操作任务”。公开发布的子集是 HF 上的 BDRBench-20(20 个任务,train 7,440 episodes / 1,170,490 samples,val 638 episodes / 97,985 samples,共 8K+ 条轨迹),与 GR-2 论文共享同一份数据。动作/状态均为 7 维(3 平移+3 欧拉角+1 夹爪),采用相对末端执行器坐标系标注。
- 真实机器人平台:Kinova Gen-3 机械臂 + Robotiq 2F-85 平行夹爪,静态 Kinect Azure 相机 + 腕部 RealSense D435i,55cm×24cm 工作台,40+ 物体分布在评测场景中。
训练方法
- 损失:连续动作 = 前 6 维(位姿)MSE + 第 7 维(夹爪)BCE(权重 λ 平衡);离散动作 = 7 维各自的交叉熵(与文本 next-token 预测同形式)。
- 超参网格:weight decay ∈ {0, 1e-1},learning rate ∈ {1e-4, 2e-5, 1e-5},网格搜索取最优;优化器 AdamW,学习率 schedule 为 constant + warmup(0.25 epoch,OXE 预训练用 5K steps);精度 bf16。不同消融实验的具体配置(Table VI):CALVIN 主结果/泛化/数据效率/骨干对比等实验统一用 window_size 16(骨干对比实验用 8)、chunk_size 10、batch_size 128、5 epoch;SimplerEnv 训练配置写的是 batch_size 128、5K-iter warmup、共 50K iter。
- checkpoint 选择(附录 B 正文另有一套协议,与上述 Table VI 部分数值不完全一致,如实记录):CALVIN 上固定训练 5 epoch、batch size 128,报告最终 epoch 结果(因长时序 rollout 的复合误差,离线 loss 无法可靠指示在线成功率);SimplerEnv 训练 100K 迭代、batch size 512,每 10K 迭代评一次取最优 checkpoint;真实机器人训练 5 epoch、batch size 512,只报告最后一个 checkpoint。
- cross-embodiment 三种引入方式:Pre-train(与目标数据共同预训练,RT-2/OpenVLA/Octo 路线)、Post-train(先在 OXE 上预训练,再单独在目标数据上微调,π0 路线)、Finetune(仅用目标域数据,作为基线);Google Robot 上另设 RT-Partial-Finetune(只用同任务轨迹)/RT-Finetune(同机器人全部任务共训)两个基线,Bridge 上设 Bridge-Finetune(全量 Bridge 数据微调)。
Infra(训练 / 推理工程)
- 训练集群:论文注明所有模型训练于 4×8 A100 GPU 集群(32 卡 A100 资源池);总 GPU-小时未披露。
- 推理:帧率/控制频率/延迟均未披露。
评测 benchmark
CALVIN ABCD→D(同分布,5 个连续子任务成功率 1→5 及 Avg. Len.):
| 方法 | VLA? | 1 | 2 | 3 | 4 | 5 | Avg. Len. |
|---|---|---|---|---|---|---|---|
| RT-1 | ✗ | 0.844 | 0.617 | 0.438 | 0.323 | 0.227 | 2.45 |
| HULC | ✗ | 0.889 | 0.733 | 0.587 | 0.475 | 0.383 | 3.06 |
| GR-1 | ✓ | 0.949 | 0.896 | 0.844 | 0.789 | 0.731 | 4.21 |
| KosMos P.H.(RoboVLMs) | ✓ | 0.967 | 0.930 | 0.899 | 0.865 | 0.826 | 4.49 |
CALVIN ABC→D(跨场景零样本泛化):GR-1 0.854/0.712/0.596/0.497/0.401(Avg. Len. 3.06)→ KosMos P.H. 0.980/0.936/0.854/0.778/0.704(Avg. Len. 4.25),单任务绝对提升 12.6 个百分点,5 连续任务绝对提升 30.3 个百分点。
Backbone 消融(Table V,CALVIN,单侧视图,5 epoch,Avg. Len.):KosMos-2B 3.59、PaliGemma-3B 3.82 明显领先;Flamingo-3B/4B/9B 1.57/1.71/1.83、Qwen-VL-9B 0.30(未加 resampler)、MoonDream-3B 1.81、UForm-1.3B 2.28。
结构消融(Table III,KosMos backbone,Avg. Len.):One-Step-Discrete 0.55 → One-Step-Continuous 2.19 → Interleaved-Continuous 4.12 → Policy-Head-Continuous 4.49(最优),验证”连续 > 离散""历史 > 单步""policy head > interleaved”。
数据效率/泛化(Table IV):KosMos P.H. 在 0.1x/1x/5x CALVIN ABCD 数据规模下 Avg. Len. 分别为 2.52/4.49/4.51,且零样本泛化到 D 切分时性能降幅明显小于其余结构。
SimplerEnv - WidowX+Bridge(Table X,最终成功率):RoboVLMs:Put Spoon on Towel 0.458、Put Carrot on Plate 0.208、Stack Green on Yellow 0.042、Put Eggplant in Basket 0.792;对比最强基线 Octo-Small:0.472/0.097/0.042/0.569,OpenVLA-7b:0.000/0.000/0.000/0.041。
SimplerEnv - Google Robot(Table XI,各子任务平均成功率):RoboVLMs:Pick Coke Can 0.903、Move Near 0.625、Open/Close Drawer 0.324、Open Drawer+Place Apple 0.241;对比 RT-2-X:0.787/0.779/0.250/0.037,RT-1(Converged):0.857/0.442/0.730/0.000,OpenVLA-7b:0.163/0.462/0.356/0.000。RoboVLMs 在 Pick Coke Can、Open/Close Drawer、Open+Place Apple 三项领先,但 Move Near 上不敌 RT-2-X(0.625 vs 0.779)。
真实机器人 20 任务基准(Fig 7,定性):KosMos P.H.(RoboVLMs)在 Simple / Unseen Distractor / Unseen Background / Unseen Object / Novel Skill Description 全部 5 类设置上超过 Octo-Base、OpenVLA 微调基线,Simple 和 Unseen Background 上领先幅度最大;并出现基线未展现、训练数据中也不存在的自我纠错行为(Open Oven 任务中第一次未够到把手,第二次自主调整末端位置重新定位)。
Cross-embodiment(Fig 10/11):单纯 OXE Pre-train 不显著优于 RT-Partial-Finetune;Post-train(OXE 预训练 → 目标数据微调)最优:Google Robot 平均成功率 52%(vs. Finetune-only 基线 48%),Bridge 平均成功率 38%(vs. Finetune-only 基线 31%)。CALVIN few-shot(每任务仅 10 条轨迹):OXE 预训练使单任务成功率提升 17.2 个百分点、平均任务长度提升 0.25。
创新点与影响
贡献:
- 首个系统性、大规模(600+ 实验,8 backbone × 4 结构 × 3 数据配方)横向对比 VLA 设计空间的实证研究,把此前各家 VLA(octo/gr-1 的 interleaved、RoboFlamingo/π0 的 policy-head、RT-2/openvla 的 one-step-discrete)统一进同一套框架、同一套评测协议下公平比较。
- 给出可操作的 VLA 建造配方:连续动作 + policy head 融合历史 + 选视觉语言预训练充分的 backbone(KosMos-2/PaliGemma),据此搭出的模型刷新 CALVIN 两个切分的 SOTA。
- 首次系统回答”cross-embodiment 数据何时用”:预训练阶段引入 + 后训练在目标数据微调(post-train),优于与目标数据直接共训(pre-train/co-train)。
- 开源 RoboVLMs 框架(声称 30 行代码即可接入新 VLM)、KosMos+Policy-Head 权重,以及真实机器人数据子集 BDRBench-20(20 任务/8K+ 轨迹)。
影响:NeurIPS 2024 Oral 收录;据 GitHub README(2026-02 更新)披露,扩展改稿后被 Nature Machine Intelligence 接收。“post-train 优于 co-train”的结论与 policy-head 架构选择被后续工作(如 pi0)采纳。
论文自述局限:
- 8 个 VLM backbone 之间训练数据、架构、模型规模、LLM 底座等因素高度纠缠,不足以完全拆解各因素对 VLA 性能的独立贡献。
- LLaVA、Qwen-VL 若不加 perceiver resampler 降采样视觉 token,VLA 表现异常差,作者推测与分辨率/视觉 token 数相关,但未完全查清机制。
- interleaved/policy-head 结构与离散动作空间的组合因下三角注意力掩码限制未实现。
- 仍是模拟/真实两套仿真 + 一套真实机器人上的研究,sim-to-real gap 仍是开放问题。
原始链接
- arXiv 论文:https://arxiv.org/abs/2412.14058
- PDF:https://arxiv.org/pdf/2412.14058
- 项目页:https://robovlms.github.io/
- GitHub(RoboVLMs 框架):https://github.com/Robot-VLAs/RoboVLMs
- HuggingFace 模型:https://huggingface.co/robovlms/RoboVLMs
- HuggingFace 数据集(BDRBench-20):https://huggingface.co/datasets/robovlms/bytedance_robot_benchmark_20
一手源存档(sources/)
- robovlm—github-readme — GitHub README(结构支持矩阵、配置示例、Bibtex),https://github.com/Robot-VLAs/RoboVLMs
- robovlm—project-page — 项目主页文本快照(六大发现摘要),https://robovlms.github.io/
- robovlm—hf-card — HuggingFace 模型卡(三个开源 checkpoint 说明),https://huggingface.co/robovlms/RoboVLMs
- robovlm—hf-dataset-card — HuggingFace 数据集卡(BDRBench-20 规模与结构),https://huggingface.co/datasets/robovlms/bytedance_robot_benchmark_20
- arXiv 全文 PDF(2412.14058,arXiv 原文 PDF,不入 git):https://arxiv.org/pdf/2412.14058