一句话定位

SpatialVLA 给 VLA 的观测输入和动作输出各加一层”3D 对齐”:用单目深度反投影出的自我中心(egocentric) 3D 坐标去调制 2D 视觉特征(Ego3D Position Encoding),再把连续动作按数据集统计的高斯分布而非均匀分箱离散化为自适应动作网格(Adaptive Action Grids),使单步动作只需 3 个 token(而非 RT-1/RT-2/OpenVLA 的 7 个),在 1.1M 条真实机器人轨迹上预训练后于 SimplerEnv、LIBERO 与真实 WidowX/Franka 机器人上取得当时最优的零样本与微调成功率;论文已被 RSS 2025 接收。

背景与定位

范式:这是 VLA 领域”离散动作 token 化 + 自回归预测”路线(RT-2、openvla)上的空间感知改造,核心论点是——现有 VLA 只吃 2D 观测、缺乏对 3D 物理世界的精确感知,而不同机器人具身的相机标定、动作空间彼此不对齐,是跨具身泛化的两大瓶颈。SpatialVLA 用两个”具身无关”的设计分别解决这两个瓶颈:Ego3D Position Encoding 靠自我中心坐标系(而非外参标定)解决观测对齐问题;Adaptive Action Grids 靠对整个数据混合做统计分布拟合解决动作对齐问题。

骨干沿用 openvla 之后 VLA 领域的主流做法——微调预训练 VLM(paligemma2)做动作生成,直接对比基线覆盖 rt-2/RT-1-X(open-x-embodiment 预训练)、octoopenvlacogact、TraceVLA、robovlm,并在 v5(RSS camera-ready)版本追加了与 pi0 的对比(经第三方开源复现 open-pi-zero,而非官方数字)。论文将 3D-LLM/LLaVA-3D/LEO/3D-VLA 等”3D 基础模型”路线归为相关工作,但指出这些工作聚焦 3D 世界理解与预测,忽视了机器人动作空间本身的 3D 特性——这正是 SpatialVLA 的差异化定位。预训练数据集沿用并调整了 openvlaopen-x-embodiment 混合配比,并新增了 rh20t

模型架构

整体PaliGemma2-3B-pt-224(SigLIP 视觉塔 + Gemma2 解码器)为骨干,论文正文称模型本体约 3.5B 参数(对比 RT-2-X 的 55B);HuggingFace 模型命名为 “spatialvla-4b-224”,把额外挂载的 ZoeDepth 深度模型也算入后总参数量凑整为 4B 量级(ZoeDepth 冻结不参与训练,据 v5 附录披露仅占总参数量的 8.6%)。

  • 视觉编码:SigLIP 视觉塔,27 层 SiglipEncoderLayer,隐藏维 1152,patch 14,输入 224×224 RGB,输出 (B, 1152, H/14, W/14)。
  • 语言/动作解码器:Gemma2Model,26 层 Gemma2DecoderLayer,隐藏维 2304,含 SpatialVLAMultiModalProjector(Linear 1152→2304)对齐视觉 token 到语言嵌入空间。
  • Ego3D Position Encoding(观测侧 3D 注入):用 ZoeDepth(单目深度估计模型)预测深度图 D,结合相机内参把每个像素反投影为自我中心 3D 坐标系下的位置 p={x,y,z}(全程不需要机器人-相机外参标定,因此对不同具身通用);3D 坐标经正弦函数 γ(·) + 一个 MLP(Ego3DPositionEmbeddingMLP:Linear 204→1152 → LayerNorm → ReLU → Linear 1152→1152)编码为位置嵌入 P′,与 SigLIP 的 2D patch 视觉特征 X 相加得到 O₃d = X + MLP(γ(P))。
  • Adaptive Action Grids(动作侧离散化):单臂动作 7 维 {x,y,z,roll,pitch,yaw,grip} 拆成平移 a_trans(转极坐标 φ,θ,r,解耦方向与距离)、旋转 a_rot{roll,pitch,yaw}、夹爪 a_grip(2 个离散 token:开/合)。对每个动作变量在整个训练混合数据集上做归一化后拟合参数化高斯分布 N(μ,Σ),再用该分布的 CDF/PPF 把值域切成 M 个等概率(而非等间距)区间——即网格密度随数据分布自适应,高频动作区间划分更细。
    • 论文主配置:θ 16 格(范围 [0,π])、φ 32 格(范围 [−π,π])、r 8 格(范围 [0,√3])→ M_trans=16×32×8=4096;roll/pitch/yaw 各 16 格(范围 [−1,1])→ M_rot=16³=4096;夹爪 2 格。总动作 token 词表 V = M_trans + M_rot + 2 = 8194,线性化后与 LLM 词表共享嵌入参数,训练时随机初始化并与骨干一起优化。
    • 单步动作只需预测 3 个 token(平移 1 个 + 旋转 1 个 + 夹爪 1 个),而非 RT-1/RT-2/OpenVLA 的 7 个 token,直接带来推理加速。
  • 动作 chunk:每次推理预测 T=4 步未来动作(12 个 spatial action token),执行时做动作 ensemble 后再预测下一 chunk。
  • 训练细节:文本 token 嵌入 E_text 在预训练中冻结(消融显示这有利于指令遵循能力和训练速度),视觉编码器与 LLM 骨干本身正常训练。
  • 后训练:Spatial Embedding Adaptation——迁移到新具身/新任务时,在新数据集上重新拟合高斯分布 N(μ_new, Σ_new)、重新划分网格 G_new,新网格 token 嵌入用预训练网格中**相邻网格的三线性插值(trilinear interpolation)**初始化(按新旧网格质心归一化距离加权),而非随机初始化,使预训练动作知识可迁移到新的离散化方案上。

数据

  • 预训练总量1.1M 条真实机器人演示轨迹,来自 OXE 子集 + rh20t,覆盖 28 个数据源(数据集)、多种机器人具身/场景/任务。
  • 混合配比(按采样权重,附录 Table):Bridge 15.34%(60,064 条轨迹/2,135,463 样本)、Fractal 14.71%(87,212/3,786,400)、Droid 11.66%(92,233/27,044,326)、BC-Z 8.64%(43,264/6,015,535)、Kuka 7.06%(209,880/2,455,879)、RH20T 5.67%(104,392/52,644,433)、Stanford Hydra 5.15%、Language Table 5.06%、Taco Play 3.42%、Furniture Bench 2.84%、Roboturk 2.69%、Utaustin Mutex 2.60%、Austin Sailor 2.54%、Austin Sirius 2.01%、DobbE 1.64%、FMB Dataset 1.63%、Berkeley Autolab UR5 1.41%、Toto 1.17%、Viola 1.10%、IAMLab CMU Pickup Insert 1.05%、NYU Franka 0.97%、Jaco Play 0.56%、Berkeley Cable Routing 0.30%、Austin Buds 0.25%、Berkeley Fanuc Manipulation 0.22%、CMU Stretch 0.18%、DLR EDAN Shared Control 0.06%、UCSD Kitchen 0.06%。
  • 配比调整依据:在 openvla 混合配比基础上新增 RH20T,并按逐数据集在真实机器人上的实测表现下调 Kuka、Toto、Berkeley Fanuc Manipulation、FMB Dataset 的权重——原文指出 FMB 占比过高会让机器人产生明显的”向右偏”运动倾向,Kuka 数据集缺乏清晰的语言 prompt。
  • DROID 移除策略:沿用 openvla 的做法,预训练最后三分之一阶段将 DROID 数据集移出混合以提升最终模型质量。
  • 深度来源:预训练阶段统一用 ZoeDepth(单目深度估计)而非传感器深度,因为 28 个 OXE+RH20T 数据源里深度信息并非全部可得;下游微调阶段可选 ZoeDepth 或传感器深度(消融显示 ZoeDepth 更优,见”评测”节)。
  • 数据增强:随机裁剪(random crop)+ 色彩抖动(color jitter),附录指出这对 SimplerEnv/WidowX 零样本任务与真实机器人后训练任务的性能提升是关键因素。
  • 仿真 vs 真实:预训练全部为真实机器人演示(无仿真数据);评测覆盖 3 个仿真环境(SimplerEnv Google Robot、SimplerEnv WidowX、LIBERO)+ 24 个真实机器人任务(WidowX 7 个零样本任务 + Franka 13 个微调任务 + 4 个空间理解专项任务)。
  • 微调数据采集:真实机器人后训练数据均通过人工遥操作采集,Franka 平台用 SpaceMouse 遥操作,采样频率 10Hz。

训练方法

  • 目标函数:标准自回归下一 token 交叉熵损失,对齐骨干真实预测的 spatial action token 与专家动作离散化后的 ground-truth token。
  • 预训练两阶段:第一阶段用全量数据训练 160k 步,达到 90% token 预测准确率;第二阶段移除 Kuka 数据集后继续微调 40k 步,准确率提升到 95% 以上(训练曲线显示移除 Kuka 后准确率和 loss 均有明显改善)。
  • 优化器与超参:AdamW,学习率 2e-5,线性衰减 scheduler,无 weight decay,warmup 比例 0.005;batch size 2048。
  • 微调(post-training):LIBERO 等小规模数据集用 LoRA(r=32, α=32) 微调 200 epoch,并叠加 Spatial Embedding Adaptation(重新拟合高斯分布 + 三线性插值初始化新网格嵌入);大规模数据集(Fractal/BridgeData V2)上对比全参数微调与 +Gaussian adaption,后者仅带来边际收益(如 Move Near 任务 Visual Matching +2.9%),因为大规模数据分布已与预训练接近。消融额外证明 LoRA 在小数据集任务上优于全参数微调。
  • 消融专用训练配置(与主模型分离):Table IV 的动作离散化消融在 8 张 A100 上、batch size 128、训练 120k 步,数据为 Fractal + BridgeData V2 的混合子集,从头训练。

Infra(训练 / 推理工程)

  • 预训练集群64 张 NVIDIA A100 GPU,训练约 10 天,batch size 2048。
  • 训练框架:完全基于 HuggingFace Transformers,集成 DeepSpeed ZeRO stage 1 做显存高效的分布式训练。
  • 微调硬件:大多数微调实验用 4 或 8 张 A100 GPU。
  • 推理:单张 NVIDIA RTX 4090 GPU,占用 8.5GB 显存,运行频率约 20Hz(摘要/引言口径),论文讨论章节另称达到 21Hz 推理速度;单步只需生成 3 个动作 token 是加速的直接原因。
  • 动作 ensemble 与部署细节:真实机器人部署时用 ensemble horizon 1 或 4;夹爪的”粘滞步数”(sticky step)从 1 优化到 15,为真实部署的关键调整。
  • 真实机器人硬件:WidowX 250(BridgeData V2 配置)+ 静态安装 Realsense D435;Franka Emika Panda(阻抗控制)+ 三脚架安装 Realsense D435。
  • ZoeDepth 开销:v5 附录披露 ZoeDepth 在整个模型中占 8.6% 参数量,训练时冻结不更新,每次动作推理额外增加约 0.06 秒耗时。

评测 benchmark

SimplerEnv · Google Robot(Table I,视觉匹配 Visual Matching / 变体聚合 Variant Aggregation)

模型VM 均值VA 均值
RT-2-X(55B,闭源)60.7%64.3%
OpenVLA27.7%39.8%
RoboVLM(零样本/微调)56.3%/63.4%46.3%/51.3%
π₀*(BF16 uniform,第三方复现 open-pi-zero,非官方数字)70.1%
SpatialVLA(零样本)71.9%68.8%
SpatialVLA(微调)75.1%70.7%

SpatialVLA 零样本以 3.5B 参数超过闭源 55B 的 RT-2-X(71.9% vs 60.7% VM;68.8% vs 64.3% VA);v5 追加的 π₀* 对比中 SpatialVLA 零样本(71.9%)仍略优于 π₀* 复现版(70.1%)。

SimplerEnv · WidowX(Table II,总体平均):SpatialVLA 零样本 34.4%、微调 42.7%,均高于此前最优 RoboVLM(零样本 13.5%/微调 31.3%);“Put Eggplant in Yellow Basket” 任务微调后抓取与放置成功率均达 100%

LIBERO 四套件微调(Table III,LoRA):SpatialVLA 平均成功率 78.1%(四套件排名第一),其中 LIBERO-Spatial 88.2%、LIBERO-Object 89.9%、LIBERO-Goal 78.6%、LIBERO-Long 55.5%(四套件中最低,论文承认长时程任务是短板);对比 OpenVLA 微调 76.5%、TraceVLA 74.8%、Octo 75.1%、Diffusion Policy 72.4%。

空间理解专项(Franka/WidowX/LIBERO-Spatial):Franka 空间提示任务(#1,如”把离机械臂最近的毛绒玩具放到车上”)准确率 73%;WidowX 零样本高度变化任务与 LIBERO-Spatial 布局变化任务上同样领先,Octo/Diffusion Policy/OpenVLA 等无深度信息的策略在这些任务上成功率普遍低于 50%。

真实 Franka 微调(13 任务):单任务(pick/place/push/close)SpatialVLA 约 82% vs Diffusion Policy 约 81%(接近);指令遵循任务 SpatialVLA 比 OpenVLA 高 12 个百分点(Diffusion Policy 仅 26%);多任务混合训练 SpatialVLA 达 57% 准确率,超过其余通用策略。

消融 · 动作离散化(Table IV,8×A100 从头训练,Fractal+BridgeV2)

  • 自适应网格 vs 传统线性 256 分箱:Google Robot 两任务(Pick Coke Can + Move Near)均值提升 +36.5%(变体聚合)/+42.1%(视觉匹配)。
  • 高斯自适应网格 vs 均匀网格:泛化能力更强(如 Pick Coke Can 变体聚合 81.6% vs 均匀网格 77.9%,但视觉匹配 70.7% vs 28.0% 差距更大)。
  • 网格分辨率 8194(M_trans=M_rot=4096) vs 1026(M_trans=M_rot=512):Move Near 视觉匹配 +31.2%,Put Eggplant 成功率 +33.3%;v5 附录扩展了 1026→4610→6166→8194 的连续消融,性能在 8194 附近趋于平台甚至在超过 6166 后略降,且 8194 自适应网格可用仅 4610 均匀分辨率一半的网格数打平/超过 8196 均匀分箱基线。
  • 去掉 Ego3D Position Encoding:变体聚合从 81.6%/79.2%(Pick Coke Can/Move Near)降至 68.9%/66.7%。
  • 不冻结 LLM 文本嵌入:训练速度与指令遵循能力受影响(各任务涨跌不一)。

消融 · 后训练(Table V):大规模数据集(Fractal/BridgeV2)上 +Gaussian adaption 相对全参数微调收益有限(Move Near 视觉匹配 +2.9%);LIBERO 小数据集上 +Spatial embedding adaptation 相对纯 LoRA 微调在四套件上分别提升 +4.6/+5.1/+2.2/+5.4 个百分点。

v5 附录新增:深度来源消融(4 个新灵巧任务:clean table / push-T / insert charger / make tea):SpatialVLA + ZoeDepth 均值 72.7%,优于传感器深度 70.5%、无深度 45.4%,以及 OpenVLA 基线 54.5%。

创新点与影响

  • Ego3D Position Encoding:用单目深度(ZoeDepth)反投影构造自我中心 3D 坐标系,免去机器人-相机外参标定,是”具身无关”设计能跨机器人复用的关键,消融显示去掉它会显著损害对光照/纹理/相机位姿变化的鲁棒性。
  • Adaptive Action Grids:把动作离散化从”固定 256 均匀分箱”改为”按数据集统计的高斯分布做等概率网格划分”,用更少的 token(单步 3 个 vs RT 系列的 7 个)取得更好的生成质量与更快的推理速度,同时通过网格质心的三线性插值实现向新具身/新任务的知识迁移(Spatial Embedding Adaptation)。
  • 以 3.5B 参数超越 55B 闭源模型(RT-2-X),说明空间表示设计比单纯堆参数量更有效。
  • 作者自陈局限(第 V 节):(1) 用高斯分布拟合动作分布并非最优,单轴运动等极端场景会导致网格在特定坐标轴上聚集,数据集噪声也会扭曲网格分布,未来可探索 VAE 等隐式分布建模与显式网格划分结合;(2) 自回归 token 解码(21Hz)比扩散解码(pi0、Diffusion Policy、robovlm)慢,且仅依赖当前帧观测和历史 token,在长时程任务(LIBERO-Long 55.5%,四套件最低)上表现较弱;(3) 预训练数据(OXE)质量参差,尚未做高质量子集蒸馏。
  • v5(RSS camera-ready)追加的局限(附录 Q1):更高分辨率/更高维度的动作空间会给词表带来额外参数开销,对人形机器人等高自由度具身可能造成参数膨胀,作者提出未来可在灵巧手、双臂、腿等不同具身间共享动作网格。

原始链接

一手源存档(sources/)