一句话定位

WholeBodyVLA 是 AgiBot(智元)与 OpenDriveLab/港大 MMLab 联合出的一套人形整机 loco-manipulation VLA:用两个分开训练的 VQ-VAE 隐动作模型(manipulation LAM 吃 AgiBot World、locomotion LAM 吃自采的 300 小时无动作标签的第一人称行走视频)给一个 Prismatic-7B 骨干的 VLA 做统一隐动作监督,再配一个把连续速度跟踪换成离散前进/侧移/转身/蹲高指令的 LMO 强化学习下肢控制器,跑在 AgiBot X2 原型机上,第一次做到无需分段调度、单一端到端策略在大空间里连续完成”走位—蹲下—抓取—转身—放置—推车”这类长序列整机操作。作者维护的 GitHub 论文列表将其标注为 ICLR 2026。

背景与定位

人形整机 loco-manipulation 的核心范式分裂由来已久:一条路是模块化——用高层规划器在导航和抓取之间切换(如 Being-0、HEAD、R²S²),闭环反馈弱、易在切换点留下不利于操作的姿态;另一条是端到端模仿学习直接输出全身关节(如 Boston Dynamics 的演示),但需要昂贵的 MoCap 或遥操作数据才能覆盖”移动中操作”的样本空间。论文把问题归结为两点:(1) 人形 loco-manipulation 的遥操作数据几乎不存在,很难低成本采集;(2) 现有 RL 下肢控制器普遍用连续速度跟踪目标训练,这个目标对巡航够用,但对 loco-manipulation 需要的精确起停、朝向控制来说过冗余,导致控制器本身不稳、拖累上层策略学习。

方法论上直接站在隐动作学习(latent action learning)这条线上——Genie、LAPA(见 lapa-latent-action-pretraining)、IGOR、UniVLA 已经证明动作无标注视频可以被 VQ-VAE 压成离散隐动作token去监督 VLA 训练;WholeBodyVLA 的差异化贡献是把这条线第一次用到人形整机场景,并发现 manipulation 视频(相机基本静止、画面变化主要来自手臂运动)和 locomotion 视频(相机持续移动、画面变化主要来自场景相对运动)混在一起训一个共享 LAM 会互相干扰,于是拆成两个 LAM 分开训、联合监督 VLA。下肢执行侧则提出 LMO(loco-manipulation-oriented)RL 策略,用离散指令接口取代速度跟踪,是对 HOMIEAMOFALCON 一脉 velocity-tracking 全身控制器的针对性改造。基线对比里的 GR00T N1.5OpenVLA-OFT(与本工作同用 Prismatic-7B 初始化)、LEVERB 都被归为”偏科”——GR00T/Humanoid-VLA 各自只强于操作或移动一侧,LEVERB 不支持操作,只有 WholeBodyVLA 声称同时满足 vision+language 输入、双臂操作、闭环、多任务、无需额外传感器输入(如 MoCap/物体位姿/导航目标点)五项全勾。

模型架构

双 LAM(隐动作模型):manipulation LAM 和 locomotion LAM 各自是一个 VQ-VAE:编码器 ℰ_i 建在 DINOv2 特征之上(具体 backbone 型号、输入分辨率论文未披露),是一个时空 transformer,吃相邻帧 (o_t, o_{t+k}) 输出连续隐向量 z_t,再量化到码本 𝒞_i 中最近的条目 c_t^i(码本大小、隐维度未披露);解码器 𝒟_i 用当前帧 o_t + 量化后的隐动作 c_t 重建未来帧 ô_{t+k},训练目标是标准 VQ-VAE 损失(重建 MSE + 停梯度码本损失 + commitment 项,commitment 权重 β 未给出具体数值)。两个 LAM 完全独立训练,之后联合给 VLA 提供监督。

VLA 策略骨干:π_θ 从 Prismatic-7B 初始化(与 OpenVLA / OpenVLA-OFT / UniVLA 同一血统的 prismatic VLM),预训练阶段用交叉熵/极大似然联合预测两路离散隐动作 c_t^mani、c_t^loco,条件是图像观测 o_t 和语言指令 ℓ:min_θ [−log π_θ(c_t^mani, c_t^loco | o_t, ℓ)]。这一步没有机器人真实动作标签,纯靠 LAM 码本当伪标签。

动作头/执行解码器:预训练完的 VLA 只会预测隐动作 token,真正落地靠一个轻量解码器 f:a_t = f(ĉ_t^mani, ĉ_t^loco, s_t),s_t 是机器人本体状态。f 的输出是两类:(i) 双臂上肢关节角(连续回归,不是 diffusion/flow,也不是离散 token 直接执行);(ii) 一条离散 locomotion 命令,交给下面的 LMO RL 策略去转成腿部力矩。这个解码器是在 Stage III 用遥操作数据 LoRA 微调整个 VLA 时一起学出来的。

LMO 下肢 RL 控制器(独立网络,不在 VLA 里):观测纯本体感受、带短历史堆栈:O_t = [u_t, ω_t, g_t, q_t, q̇_t, a_{t-1}](上一步指令、基座角速度、重力向量、关节位置/速度、上一步动作),不依赖仿真特权信息。控制接口是离散三元指令 u_t = [s_x, s_y, s_ψ, h⋆] ∈ {−1,0,1}³ × ℝ(前后/左右/转向的启停标志 + 目标蹲高),区别于连续速度跟踪;通过 tanh 软门函数把三元标志转成平滑的参考速度,避免指令切换时的冲击加速度。训练用两阶段课程:Stage I 学基础步态(速度目标在 [0, v_max] 内均匀采样,上肢跟随固定节奏重采样的姿态目标,关节范围随课程因子逐步放开);Stage II 针对精度与稳定性专项优化(巡航速度固定为常数抑制无意漂移,引入朝向偏差终端惩罚 𝒥_dir、从 AgiBot World 采样并插值回放真实手臂扰动片段迫使腿部补偿结构化惯性耦合、静止时施加站立惩罚 𝒥_stand)。奖励函数覆盖 5 大类近 25 项(意图执行、姿态与关节、步态结构、能耗与平滑、稳定性),域随机化覆盖动力学(关节力矩注入、驱动偏置、连杆质量 [0.8,1.2]×)、接触属性(摩擦系数 [0.1,3.0]、恢复系数、负载 [-5,10]kg)、控制器增益 K_p/K_d(±10%)、感知延迟(动作滞后 2–8 步、IMU 滞后 1–10 步)。

跨具身性上,论文自己的定位是”人类第一视角视频 ↔ AgiBot X2 遥操作演示”共享同一个隐动作空间(附录 C.5:检索到的 “Go Forward” 隐动作在人类视频和机器人遥操作片段里语义一致),而非多机器人本体间的跨具身迁移。

数据

  • locomotion LAM 训练数据:自采集约 300 小时第一人称无动作标签视频,单人操作员头戴 Intel RealSense D435i(RGB-D)或 GoPro(更大 FOV,更适合捕捉行走场景)拍摄;采集原则三条——低成本单人可采、覆盖前进/转向/蹲下等人形运动基元、目标导向(操作者需靠近潜在可操作物体直到接触,但不需要真的完成抓取动作)。
  • manipulation LAM 训练数据:直接用 AgiBot World 真机双臂操作数据集(论文原话”其中之一最大的真机操作数据集”,具体子集小时数本文未单独披露)。
  • 消融用的 shared LAM 在两类数据规模不均衡的情况下做平衡采样(每个 batch 两个来源各取一部分)。
  • 遥操作微调数据:主基准三任务(Bag Packing / Box Loading / Cart Pushing)各采 50 条执行轨迹(Meta Quest Pro VR 控制上肢 + 手柄下发移动指令),共 150 条,三个任务联合微调成一个模型(而非分任务各训一个)。
  • 12 个泛化/扩展实验各自的遥操作规模不等:地形穿越 50 条、长时序操作 200 条、视觉导航 50 条、吸尘 50 条、擦拭污渍 100 条。
  • 数据规模消融(4.3 节):固定 100% AgiBot World,把人类第一视角视频用量在 0%/25%/50%/100% 间变化(评估 locomotion 泛化);反过来固定 100% 人类视频、变化 AgiBot World 用量(评估 manipulation 泛化)。结果:人类视频预训练占比超过 50% 时,只用 25 条遥操作轨迹微调即可追平”低于 25% 人类视频预训练”变体用 200 条轨迹才能达到的效果——即隐动作预训练能把下游遥操作数据需求压缩近一个数量级。
  • 全流程不涉及仿真到真实的数据(仿真只用于训练/评测 LMO 控制器本身,不用于 VLA 数据)。

训练方法

三阶段流水线:Stage I 分别预训练 manipulation LAM 与 locomotion LAM(VQ-VAE,纯视觉、无机器人动作标签,30,000 步,batch size 256);Stage II 用两个 LAM 的码本作为伪标签,在人类视频+AgiBot World 混合语料上以交叉熵/MLE 训练 VLA 联合预测两路隐动作(从 Prismatic-7B 初始化,20,000 步,batch size 1024);Stage III 用 AgiBot X2 遥操作轨迹对 VLA 做 LoRA 微调,把隐动作落地为机器人可执行指令(上肢关节角 + 下肢离散指令),三任务联合微调、batch size 64、10,000 步。LMO RL 策略与 VLA 分开训练,训练全程固定不参与遥操作采集与最终部署时的联合优化(即 VLA 与 LMO 之间没有端到端反传,靠离散命令接口解耦)。GR00T/OpenVLA-OFT 基线用各自公开发布的预训练权重,同样在 Stage III 用相同的 AgiBot X2 遥操作数据微调、并接同一个 LMO 控制器执行下肢,以隔离”高层决策能力”与”下肢执行稳定性”两个变量。

消融设计覆盖两条主线:(a) LMO 侧——WholeBodyVLA w/o RL(VLA 直接出下肢关节)、w/ 速度跟踪 RL(复现并改良自 HOMIE);(b) 隐动作侧——w/o LAM(Prismatic-7B 直接微调,跳过隐动作预训练)、w/ manipulation-only LAM(只做操作隐动作预训练,不含 locomotion 视频)、w/ shared LAM(混合数据训一个共享 LAM,不做模态区分)。

Infra(训练 / 推理工程)

  • LAM + VLA 训练:8× NVIDIA H100。
  • LMO RL 策略训练:单张 NVIDIA H100。
  • GPU-hours、精度(fp16/bf16/fp32)、并行策略均未披露。
  • 部署推理:VLA 策略跑在一台 RTX 4090 GPU 工作站上;LMO RL 控制器跑在机载 NanoPi 上;VLA 与机器人之间通过 ZeroMQ(以太网)做低延迟指令流传输。
  • 控制频率:LMO 下肢闭环 50 Hz;VLA 骨干感知+推理约 10 Hz(隐动作 token 在此频率下被解码为双臂关节指令与下肢移动命令)。
  • 机器人本体:AgiBot X2 原型机——双臂各 7 自由度 + Omnipicker 末端夹爪,双腿各 6 自由度,腰部 1 自由度,头部搭载 Intel RealSense D435i 作为第一人称相机。

评测 benchmark

主基准(真机,3 任务 × 25 次试验,双盲人工评判、子目标顺序打分——前一子目标失败则后续自动记为失败):

MethodBag Packing (Grasp/Move&Squat)Box Loading (Squat&Grasp/Rise&Turn)Cart Pushing (Grab/Push)Avg.
Modular Design(人操导航+VLA操作,近oracle上限)22/25, 12/259/25, 9/2522/25, 22/2564.0%
GR00T N1.5 w/ LMO20/25, 10/256/25, 4/2512/25, 11/2542.0%
OpenVLA-OFT w/ LMO19/25, 6/2512/25, 12/2522/25, 14/2556.7%
WholeBodyVLA(本作)23/25, 13/2519/25, 17/2523/25, 22/2578.0%

消融(同一基准):w/ 速度跟踪 RL 54.0%(-24.0pp);w/o LAM 39.3%(-38.7pp);w/ manipulation-only LAM 63.3%(-14.7pp);w/ shared LAM 66.0%(-12.0pp)。论文摘要/正文引用的”超过 baseline 21.3% / 24.0%“分别对应 78.0% 相对 OpenVLA-OFT w/LMO(同 Prismatic-7B 初始化的最公平基线,56.7%)和相对速度跟踪 RL 消融(54.0%)的差值。

LMO 控制器 MuJoCo 仿真消融(X2 模型,位置误差[m] / 姿态(yaw)误差[rad] + Center-of-Mass Sway 站立/蹲姿指标):LMO 完整版前后向误差 0.21±0.01 / 0.05±0.01,左右 0.55±0.01 / 0.06±0.01,转向 0.05±0.01 / 0.19±0.01,站立 CoMS 0.03±0.02,蹲姿 CoMS 0.03±0.02;去掉朝向奖励(Eq. 3)、去掉 Stage II、去掉 Stage I、纯速度跟踪基线均全面劣化(去掉 Stage I 误差最大:转向项位置误差达 0.46±0.01 m、姿态误差 0.34±0.04 rad)。真机层面,速度跟踪控制器的失败中 91.7% 集中在每个任务”含大部分移动量”的第二子目标。

任务执行时长(成功试验平均秒数,越低越快):6 个子目标中 WholeBodyVLA 在 4 个上最快(18.4/16.8/7.6/11.3 秒),但”移动+下蹲”(29.7秒)和”推车前进”(12.7秒)两项慢于人操导航的 Modular Design 基线(23.0/11.7秒),仍全面快于 GR00T w/LMO 与 OpenVLA-OFT w/LMO。

12 项泛化实验(C.1,起始距离 X/Y、朝向、桌高、未见物体/桌面/物体位置共 7 项 + 崎岖地形穿越、长时序操作、视觉导航、吸尘、擦拭污渍共 5 项扩展任务):前 7 项本质是 WholeBodyVLA 自身的数据规模消融(4.3 节,变化人类视频/AgiBot World 预训练占比),不是与 GR00T/OpenVLA-OFT 的横向对比;后 5 项扩展任务在 4.4/4.5 节被引用来说明 WholeBodyVLA 相对速度跟踪 RL 变体(4.4 节原话:“速度跟踪 RL 变体失败明显更多”)及扩展场景下的可扩展性,逐项成功率仅以 Fig. 3 图示呈现,正文未给出可摘录的数字。换物体/换负载的视觉扰动实验(C.2/Fig. 6:换包、换塑料容器、50kg→60kg 杠铃片)则明确对比了 WholeBodyVLA、GR00T w/LMO、OpenVLA-OFT w/LMO 三者,结论是”WholeBodyVLA 在所有扰动设置下保持最高成功率”,但同样只有图示、无逐项数字。去掉本体状态输入的消融显示性能小幅下降但仍可比,说明策略主要靠视觉而非本体状态泛化(具体数值因原文附录表格解析存在歧义,未在此页采信)。

失败模式分析(起始位姿泛化场景下 50 条失败 rollout 人工标注):水平类运动基元(前进/侧移/转向)里,失败大多经过”物体/篮筐不可达”节点(源于早停/路径偏移/超调/朝向错误),严重碰撞或踉跄占比很低;蹲姿基元失败在移动误差和抓取/摆放误差间大致对半。作者认为这反映的是渐进式的姿态/朝向系统性偏差,而非灾难性失控。

LAM 质量代理指标 RRG(Relative Reconstruction Gain,相对于”直接复制前帧”基线的重建误差下降比例):在下游任务视频上,分离式 LAM(各自的 manipulation LAM / locomotion LAM)在对应模态上普遍优于共享 LAM,支持”locomotion 与 manipulation 目标存在冲突,分开训练更好”的设计判断。

创新点与影响

  • 统一隐动作学习首次落到人形整机场景,并且用实证证明了”操作视频”和”移动视频”必须分开建模(各自训一个 VQ-VAE LAM)而不是共享一个 LAM——这是对 UniVLA/LAPA 一脉隐动作学习方法论的具体推广,核心贡献是揭示了两种视觉变化模式(手臂主导 vs 相机自运动主导)混训时的相互干扰问题,并给出简单有效的解法。
  • LMO 离散命令接口把下肢控制从”连续速度跟踪回归”改造成”目标条件调节”,用显式起停语义、朝向偏差终端惩罚、结构化扰动回放(复用 AgiBot World 手臂动作片段做腿部扰动课程)解决了速度跟踪目标在 loco-manipulation 场景下精度不足、步态碎片化的问题,真机对比显示由此带来 24pp 的成功率提升,且大部分增益来自失败模式集中的”移动子目标”。
  • 论文自称的核心叙事贡献:第一个做到大空间、无需离散技能切换调度器的端到端人形 loco-manipulation 系统,并在起始位姿、物体外观/位置、地形、长时序四类泛化实验中验证鲁棒性,还展示了向擦桌子、吸尘、倒水、搬椅子、上台阶等日常场景的可扩展性。
  • 论文自陈局限:仍难以应对长时序和高灵巧度任务;未来方向是引入轻量建图/记忆做扩展规划,以及主动感知策略应对杂乱/动态环境。
  • 需要注意的边界:GitHub 仓库目前只是一个”人形 VLA 论文导览列表”(Awesome list),作者明确写”暂无开源代码的具体时间表”,因此本工作的代码、权重、遥操作/自采视频数据集均未公开发布,可复现性完全依赖论文附录里的超参数与奖励表。

原始链接

一手源存档(sources/)

  • wholebodyvla—project-page — 项目主页快照,含方法总览图 caption、任务演示、泛化实验说明(sources/embodied/2025/wholebodyvla—project-page.md)
  • wholebodyvla—github-readme — GitHub README 快照,确认 ICLR 2026 与”开源代码暂无时间表”(sources/embodied/2025/wholebodyvla—github-readme.md)
  • 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)