一句话定位

GraspVLA 是完全用仿真合成动作数据(SynGrasp-1B,10 亿帧)预训练出来的抓取基础模型:用 Progressive Action Generation(PAG)把 2D 视觉定位、3D 抓取姿态预测串成 Chain-of-Thought 中间步骤,再驱动 flow-matching 动作专家生成动作块,使合成数据(提供几何/动作监督)与互联网 grounding 数据 GRIT(只提供语义、不含动作标注)能在同一模型里联合训练,从而不依赖任何真实机器人数据即可零样本 sim-to-real 部署,并对互联网覆盖的新物体类别开放词表泛化。论文已被 CoRL 2025 接收。

背景与定位

VLA(Vision-Language-Action)范式的核心瓶颈是动作数据不像图文数据那样天然存在于互联网语料中,现有工作(rt-2openvlapi0)主要靠遥操作采集真实世界数据(Open-X-Embodiment、DROID),代价高、周期长,且模型主要靠域内后训练部署,零样本能力有限。GraspVLA 反其道而行:聚焦抓取这一基础操作技能,系统性验证”完全不使用任何真实机器人数据、纯靠仿真合成动作数据预训练”能否训出可直接部署的 VLA 基础模型。论文称这是第一个证明合成数据在 VLA 预训练中巨大潜力的工作。

与并发工作 π0.5 的路线对比:π0.5 靠海量多模态网络数据与跨具身真实机器人数据实现开放世界泛化;GraspVLA 则完全不触碰任何真实机器人动作数据,仅用仿真轨迹 + 互联网 grounding 数据(仅语义、无动作标注)达到类似的零样本部署目标。

合成数据此前多用于开环抓取检测(Dex-Net、ACRONYM 等)或对少量人类演示做数据增广(mimicgen 系列、文本到图像扩增等),仍依赖真人演示做种子;GraspVLA 是第一个完全脱离真人演示、纯靠仿真轨迹训出闭环、语言条件 VLA 并直接 sim-to-real 部署的工作。基线对比选用三个真实数据预训练的 VLA 通才模型——π0openvlaocto——以及不支持语言条件的 Diffusion Policy 专家模型,并与传统抓取检测 SOTA AnyGrasp 做零样本对比。

模型架构

整体结构:一个可训练的自回归视觉-语言骨干(VLM)+ 一个 flow-matching 动作专家(架构上参照 π0 的 action expert 设计),二者通过 Progressive Action Generation(PAG) 机制串联,形成统一的 Chain-of-Thought 推理流程。

  • VLM 骨干:可训练的 InternLM2 1.8B 大语言模型;视觉编码器融合冻结的 DINO-v2SigLIP 两路特征(做法沿用 openvla 的双编码器融合),外加一个可训练投影层把视觉特征映射到语言空间。
  • ACTION 头:conditional flow matching 动作专家(连续动作,非离散 token、非扩散去噪),对末端执行器的分块(chunked)delta 动作做流匹配回归;论文未单独披露该动作专家的参数量。
  • PAG 三段式推理链:
    1. VLM 先自回归生成目标物体的 2D 边界框 token(8 个 token——面向双相机(前视 + 侧视)各输出一组框坐标),互联网 grounding 数据(GRIT)与合成数据在此步共享同一格式、同一 prompt 模板;
    2. 仅对合成数据,VLM 继续自回归生成 6-DoF 抓取姿态 token(6 个 token,机器人基座坐标系下),生成前先把**最近两个时间步的本体感知(proprioception)**token 化并插入序列以辅助 3D 感知;
    3. 动作专家基于 VLM 前面全部输入 + 中间推理 token 的 key-value cache,生成动作块。
  • 互联网数据对齐处理:为了让单目 GRIT 图像匹配 SynGrasp-1B 的双相机设置,输入图像被复制成两路,并独立做随机缩放/裁剪/水平翻转/颜色抖动增强,二者共享文本 prompt 模板(都先生成 bbox token)。
  • 本模型未披露:视觉/语言/动作专家的合计总参数量、输入图像分辨率、动作专家具体网络结构与层数。

数据

SynGrasp-1B(自建合成数据集,论文称是全球首个此规模的抓取数据集):

  • 规模:1000 万条轨迹,每条约 100 帧,合计约 10 亿帧;动作以 10 Hz 存储。
  • 物体资产:取自 Objaverse 的 LVIS 子集,过滤掉武器等不合适类目后剩 240 个类别、10,680 个物体实例;人工为每个类别设定尺寸上下限以对齐真实世界尺度(例如模型可抓取从 2cm 到 35cm 各种尺寸的”狗”玩具)。
  • 场景多样性:约 1,000 种桌布材质 × 1,200 种地面/墙面材质做纹理随机化(论文正文据此描述为约 100 万种独特场景);另在与其他数据集的横向对比表中,SynGrasp-1B 的”Scenes”一栏直接填 1000 万(与轨迹数 1:1,即把每条轨迹的物体摆放/光照/相机位姿组合都算作一个独立场景)——这是论文中两处对”scene”口径不同的表述,此处如实并列,不替作者取舍。
  • 标注:是同类数据集里第一个同时提供相机标定、2D 边界框、目标物体与夹爪 3D 位姿标注的数据集(对比表格列出 RoboSet/BridgeData V2/RT-1/DROID/AgiBot World/Open-X-Embodiment 均缺失至少一类标注)。
  • 生成流程:从 Objaverse 随机选取并按物理规律摆放物体(随机缩放、随机姿态落于桌面);用抓取合成算法(BoDex)生成稳定对映(antipodal)抓取,CuRobo 做无碰撞轨迹规划,MuJoCo 校验轨迹能成功举起物体;Isaac Sim 做光线追踪级真实感渲染,随机化点光源/方向光/穹顶光、材质、双相机外参(相机在 15cm 半径球内平移、±5° 旋转随机化)。
  • 面向模仿学习的两处专门优化:①放弃”预抓取定位+闭合抓取”两段式开环流程(会让模仿策略学出停顿犹豫),改为单步平滑运动规划,优先轨迹平滑度而非规划成功率;②随机化机器人初始位姿,增加工作空间探索与观测多样性。
  • 互联网协同训练数据:GRIT(Kosmos-2 使用的 grounding 数据集),只用来监督 VLM 的边界框预测(自回归),不涉及抓取姿态或动作,每个训练 batch 中与合成数据混合随机采样。
  • 成本对比(附录 B):真人遥操作单人单日约采 1000 条轨迹;合成数据用 160 张 NVIDIA RTX 4090 GPU、跑 10 天生成 1000 万条轨迹(约 3.84 万 GPU 小时);全程无需任何物理空间/机器人本体(对比 AgiBot World 需要 4000 平方米场地);总生成成本约 5000 美元
  • 快速迁移到新本体/相机(附录 D):仅需额外 5000 条合成轨迹、在单张 RTX 4090 上一天内生成,即可微调适配新机械臂/夹爪或新相机布局(见”评测”节)。

训练方法

  • 联合训练目标:VLM 侧损失 L_S2 为边界框 token 序列的自回归交叉熵,叠加”仅合成数据”的抓取姿态 token 序列自回归交叉熵(用指示函数 1_synthetic 屏蔽互联网数据的这一项);动作专家侧损失 L_S1 为分块 delta 动作上的 flow matching 回归损失(预测流场 v_t 与真值流场 u_t 的均方误差)。论文实证发现直接对 L_S2 与 L_S1 求和作为总损失即可取得良好效果,未做额外加权。
  • 训练超参(附录 E,Table 9):batch size 384,learning rate 1.6e-4;论文观察到 GraspVLA 在 12 万步后能稳定达到高成功率,并据此选取用于真实世界评测的 checkpoint。
  • 动作分块:附录 E 说明”所有在 SynGrasp-1B 上训练/微调的模型均使用 4 步动作分块(ACT 式 action chunking),OpenVLA 除外(不支持分块)“——该表述紧邻 GraspVLA 自身超参一并给出,故此处理解为包含 GraspVLA 本身,但原文未对此单独逐条明示,已如实标注推断依据。
  • 真实机器人适配的工程细节:Franka Panda 原装夹爪指长过短、抓不稳侧躺的凸形物体(如平放的瓶子),故在合成数据生成与真实实验中均将夹爪指延长 2cm。
  • PAG-3D 抓取姿态标签构造:夹爪闭合前的时间步用该轨迹的开环抓取姿态做监督;闭合后的时间步则用下一步的末端执行器位姿做监督。
  • 物理域随机化对 sim-to-real gap 的三个缓解设计(附录 J):①简化控制——用位置控制,夹爪动作简化为离散开/合指令,规避复杂动力学建模;②稳定性过滤——只保留在低摩擦系数(0.15)下仍构成力封闭(force-closure)的抓取,让模型偏向鲁棒策略;③几何驱动规划——依赖基于网格几何的抓取姿态而非依赖动力学的策略。论文承认这套方案主要适配”抓取”这类对精细动力学不敏感的任务,难以直接推广到需要精细接触动力学理解的非抓取式操作。

Infra(训练 / 推理工程)

  • 数据生成算力:160 张 NVIDIA RTX 4090 GPU、连续运行 10 天生成 SynGrasp-1B(约 3.84 万 GPU 小时);新本体/相机适配仅需单张 RTX 4090 一天生成 5000 条轨迹。
  • VLA 模型训练算力(GPU 数、总训练时长、并行策略):论文正文与附录均未披露,仅给出了 batch size 与学习率(见”训练方法”)。
  • 推理:单张 NVIDIA L40S GPU、使用 Torch Compile 编译后,端到端延迟约 200ms(约合 5 Hz),显存占用约 9GB(数据来自 GitHub README;论文正文与之一致,称”约 200ms”)。附录 K 给出各阶段延迟拆解(Table 15):
    • 视觉编码器:9ms
    • 边界框预测(8 token):72ms
    • 抓取姿态预测(6 token):50ms
    • flow matching 动作生成:64ms
    • 合计约 195ms,与”约 200ms”整体延迟吻合;PAG 引入的 14 个额外 token(8 bbox + 6 grasp pose)贡献约 63% 的推理延迟。论文同时观察到 prefill 阶段延迟与 decode 阶段相近,推测与单样本推理下 GPU 利用率低有关。
    • 对比基线 AnyGrasp 在 NVIDIA RTX 3090 上跑到 37 Hz,凸显 GraspVLA 大型视觉-语言骨干带来的推理速度代价。
  • 非阻塞控制器(附录 L,用于演示数据采集而非评测):基于 Franka ROS 与 SERL Franka Controllers 改造的笛卡尔空间阻抗控制器,配合级联滤波器与位置插值缓解模型延迟造成的抖动;正式评测统一使用阻塞式(blocking)控制,以确保测量的严谨性。

评测 benchmark

1. 真实世界零样本对比(Table 1,Franka Panda + 前/侧双 RealSense 相机,合成类别与网络类别各 5 个测试维度 × 15 物体 × 2 次试验 = 300 次试验/组):

方法合成类别 SR (basic/light/bg/dis/height)合成 SPL网络类别 SR网络 SPL
Diffusion Policy(仅大象类目)30.0/16.6/16.6/13.3/13.312.3--
Octo16.6/3.3/0.0/0.0/3.33.20.0/3.3/0.0/0.0/0.00.4
OpenVLA20.0/13.3/16.6/0.0/13.38.83.3/6.6/13.3/0.0/6.64.1
π0(载入 π0 预训练)66.6/63.3/60.0/60.0/56.642.333.3/36.6/30.0/26.6/26.617.8
π0(仅载入 VLM 权重,无跨具身预训练)80.0/76.6/80.0/86.6/76.651.840.0/40.0/36.6/36.6/33.336.9
GraspVLA(本文)93.3/96.6/93.3/93.3/90.087.293.3/90.0/93.3/86.6/86.684.7

所有基线均在 SynGrasp-1B 上微调以保证公平对比;有趣的是,π0 不载入其跨具身机器人预训练权重反而表现更好,提示跨具身预训练对该特定机械臂上的抓取任务未必是最优起点。

2. LIBERO 仿真基准零样本对比(Table 2,简化指令”pick up {object}“,仅评估抓取子任务):

方法LongGoalObject
OpenVLA(微调)33.756.665.4
π0(微调)62.779.493.8
GraspVLA(零样本)82.091.294.1

附录 G 显示原始完整指令格式(“pick up {object} and place it in {container}“)下微调基线分数更高(OpenVLA 70.9/78.6/91.2,π0 88.7/95.4/98.4),简化指令后两个微调基线分数大幅下降,说明它们对指令措辞不够鲁棒,而 GraspVLA 零样本在简化指令下即可超过二者微调后的表现。

3. 与 AnyGrasp 零样本对比(Table 3):

指标AnyGraspGraspVLA
语言条件-整体成功率91.693.3
语言条件-抓取成功率96.693.3
任意抓取-常见材质物体100.093.3
任意抓取-透明物体10.086.6
推理速度37 Hz(RTX 3090)5 Hz(L40S)

AnyGrasp 依赖深度感知,在透明物体上因深度缺失/点云不完整而大幅失效;GraspVLA 纯 RGB 输入使其在透明材质上显著更鲁棒,但推理速度远慢于专用抓取检测模型。

4. 高效后训练(Table 4,10 次试验/任务,数字为 overall/grasp 成功率):

方法训练数据Task1 新词表(工业零件)Task2 避免碰内壁(马克杯)Task3 密集顺序抓取(瓶子)
OpenVLA(零样本预训练)-0/00/200/0
π0(零样本预训练)-10/200/300/0
GraspVLA(零样本预训练)-40/900/800/20
Diffusion Policy完整轨迹(100/10-per-bottle demo)-20/6010/30
OpenVLA完整轨迹0/020/300/20
π0完整轨迹60/8060/7050/60
GraspVLA仅边界框标注90/100--
GraspVLA(不加载 SynGrasp-1B 预训练,从零训练)边界框+完整轨迹10/3010/300/20
GraspVLA边界框+完整轨迹90/10080/9090/90

仅用边界框标注(无需任何动作标签)后训练,GraspVLA 在 Task1 上即超过 π0 用完整轨迹标注训练的结果(90 vs 60),说明扩展到新词表物体不需要动作标注;对照”从零训练”与”完整预训练+后训练”两行,合成预训练带来的增益十分显著。

5. PAG 设计消融(Table 5,basic 测试集,SR/SPL):

配置合成类别网络类别
vanilla(仅与 GRIT 联合训练,无 PAG)66.6 / 39.353.3 / 27.7
+ PAG-2D(加边界框中间步骤)80.0 / 59.276.7 / 48.9
+ PAG-3D(完整版,再加抓取姿态中间步骤)93.3 / 90.293.3 / 91.7

6. 相机视角消融(附录 I,Table 14):仅用单视角(前视)时,GraspVLA 合成/网络类别分别为 60.0/56.6,比同为单视角的 OpenVLA(20.0/3.3)高约 40 个百分点,但比自身双视角版本(93.3/93.3)低约 30 个百分点。

7. 数据规模/多样性扩展规律(5.4 节 + 附录 F,定性描述,原文未在正文给出具体数字):真实世界性能随训练帧数增加而稳步提升,网络类别的扩展速度慢于合成类别;仿真环境下的扩展趋势与真实世界一致,但仿真更早饱和、真实世界扩展更慢,且 sim-to-real gap 随训练帧数增加而缩小。固定总帧数时,增加训练类别数主要提升网络类别(跨类泛化)性能、合成类别较早饱和;增加每类别实例数则对合成与网络类别都有持续增益。

8. 新本体/新相机快速适配(附录 D):仅用 5000 条额外合成轨迹微调,UR5e + Robotiq 2F-85 夹爪(仿真评测)成功率 82.1%,前视+腕部相机配置(真实世界评测)成功率 76.6%

9. 失败模式分析(附录 M,专门构造的高难度密集杂乱场景测试集):指令歧义导致犹豫(31%)、密集杂乱场景物体误识别(27%)、光滑物体(如塑料球)抓取打滑(21%)、目标物体被遮挡(14%)、其余次要错误如提前闭合夹爪/碰撞环境(7%)。

创新点与影响

  • 核心贡献:第一个系统验证”完全脱离真实机器人数据、纯用仿真合成动作数据”可以训出可直接零样本部署的 VLA 基础模型,并给出一条实操配方——SynGrasp-1B(1000 万轨迹/10 亿帧,160×RTX4090 跑 10 天,成本约 5000 美元)+ PAG 机制(2D 定位→3D 抓取姿态→flow-matching 动作的 CoT 化)。
  • 对领域的影响:证明合成数据不再只是”廉价但效果打折”的替代品——GraspVLA 在真实世界零样本评测中全面超过真实数据预训练的 π0openvlaocto,并在透明物体抓取上大幅超过专用检测模型 AnyGrasp,同时保留了对新场景的高效少样本后训练能力(仅靠边界框标注即可扩展新词表,无需动作标注)。为后续”仿真优先”的 VLA 预训练路线(如同期 GR00T N1 等)提供了一个把 CoT 中间监督(2D/3D 感知步骤)嵌入动作生成、以此弥合 sim-to-real 与合成/真实语义鸿沟的具体方案。
  • 论文自陈的局限(第 7 节 + 附录):①目前仅在 Franka Panda + 前/侧双视角上验证,扩展到其他机械臂/相机配置留作未来工作(尽管附录 D 展示了初步的低成本迁移可行性);②对歧义指令(如”pick up food”、“pick up the leftmost object”)处理能力弱;③抓取姿态标签基于力封闭合成,把可变形物体(如毛巾)当刚体处理,不建模其物理属性;④密集杂乱场景与非桌面环境下表现仍受限;⑤当前模型架构并非专为抓取定制,论文计划把数据生成管线扩展到摆放、推动等其他操作任务,并探索用强化学习替代当前基于模块化专家策略的数据生成方式(以覆盖非抓取式操作等更复杂任务);⑥PAG 引入的额外 token 带来约 200ms 推理延迟(其中 PAG 部分贡献约 63%),对动态场景(如快速移动物体)可能不够,蒸馏与量化是待探索方向。

原始链接

一手源存档(sources/)

  • graspvla—project-page.md — 项目主页快照(摘要、6 项零样本泛化维度、3 项高效后训练场景视频描述)
  • graspvla—github-readme.md — GitHub README 快照(模型服务器部署、推理延迟/显存、仿真 playground、真实世界控制接口、更新日志)
  • graspvla—hf-card.md — Hugging Face 模型卡快照(许可证 cc-by-nc-4.0,标签)
  • arXiv 原文 PDF(2505.03233,含附录 A–M,不入 git)