一句话定位

LeVERB 是首个面向人形机器人全身控制(WBC)的分层”隐动作”视觉-语言-动作(VLA)模型:一个视觉-语言 System-2(LeVERB-VL,102.6M)把语言指令+视觉观测编码成一个 10 Hz 的隐式”动词”(latent verb),一个反应式全身控制 System-1(LeVERB-A,1.1M)以 50 Hz 把这个 latent verb 解码成关节位置动作,全程只用合成数据训练,零样本部署到真实 Unitree G1。

背景与定位

现有 VLA(pi-0、RT-2、OpenVLA、gr00t-n1)大多假设底层已有一个精确的低层控制器,并用人工设计的动作”词表”(末端位姿、根部速度等)作为 VLA 与控制器之间的接口。这种显式接口把任务限制在准静态(quasi-static)场景,无法表达人形机器人需要的敏捷全身动作与场景交互(如坐下)。人形机器人是高维非线性动力系统,需要”快慢双系统”:慢的皮层做视觉语言推理与长程规划,快的脊髓反射做高频反应控制。

论文把这道 gap 命名为 vision-language 驱动的人形全身控制,并给出两件缺失的东西:(1) 一个足够表达全身动作+语义的”学到的隐式词表”(latent vocabulary),(2) 一个能把该词表动态翻译成人形可行、可零样本迁移到真机的全身控制层。相关工作里,物理动画方向的 PULSE / MaskedMimic / TokenHSI 用 CVAE/Transformer 学隐式可控策略,但依赖特权仿真状态(物体全位姿)、无视觉输入;真实人形系统(ExBody、HumanPlus、OmniH2O、ExBody2、AMO)改用显式速度/位姿/关键帧接口,模块化但动作抖、泛化差;LangWBC 用语言条件 CVAE 做 WBC 但无视觉 grounding、只能处理简单命令。LeVERB 自称是首个用分层隐式架构在真机上实现视觉-语言驱动全身控制的工作。范式:hierarchical latent VLA / dual-process System-1–System-2 / latent-conditioned WBC。

模型架构

分层公式(推理时):πθ(at|ot) = ∫ τθA(at | zt, o_prop, at−1) · ρθVL(zt | It, c) dzt。z 是 System-2 → System-1 的单向隐式接口;观测 ot = [o_prop, It, at−1, c],It 含自视角(头戴)+ 随机第三人称两路相机,c 是文本指令。

LeVERB-VL(System 2,10 Hz,102.56M 可训练参数) — 视觉语言 policy,残差 CVAE:

  • 视觉编码器:冻结的 SigLIP ViT-B/16(WebLI 预训练),两路图像各自过编码器再 attention-pool 得到 iego、iexo(768 维)。
  • 文本编码器:同一 SigLIP 模型,输出语言 token lt(768 维);因对比预训练,视觉/文本嵌入语义对齐。
  • 主干:标准 Transformer + MLP head,输入序列 obst=[lt, iego, iexo],只用当前帧、不带时间历史(防过拟合),输出对隐分布的均值 µρ、方差 σρ(观测条件先验 p(zt)=N(µρ, σρ²))。主干做了 ViT-Tiny→ViT-Base 的消融,最终选 ViT-Base。
  • 运动学编码器 Eψ(MLP):吃 ground-truth 未来状态 st+1..st+M,输出 µE、σE,捕获视觉语言里推不出的细粒度运动信息。
  • 残差隐空间:后验 q(zt)=N(µρ+µE, σE²),均值是 VLA 先验与运动编码器的残差连接(µ=µρ+µE),方差取自编码器(σ=σE);KL 只约束编码器捕获”增量信息”,让 VLA 专注语义。
  • 运动学解码器 Dψ(MLP):从采样的 zt + 当前状态 st 重建未来位姿 ŝt+1..ŝt+M。
  • 判别器 fψ + 梯度反转层(GRL):把”有图”与”喂白噪声图的盲轨迹(text-only)“两类数据的隐分布对齐成模态不变(modality-invariant)表示,思路借鉴 NeuralFly。
  • latent / 运动编码器 / 解码器统一 256 维;视觉、文本编码器均 768 维。

LeVERB-A(System 1,50 Hz,1.1M 参数) — 反应式全身控制专家:

  • Transformer:2 层、4 注意力头、隐藏维 128、attention dropout 0.3,ELU;把 o_prop 和 latent code zt 作为两个独立 token 输入,输出关节位置动作(实为重参数化到力矩层的动作)。发现加观测历史反而变差(policy 会从历史直接推动作、削弱 latent 的作用)。
  • 教师策略 Tξ:3 层 MLP(512/256/128),ELU;吃特权 proprioception + 参考运动命令,输出专家动作。
  • 机器人建模为 13 关节(1 根关节 + 12 身体关节);根关节位姿用位置(x,y,z)+6D 旋转表示 保证连续可微,其余关节仅位置。动作预测为相对当前步的 delta。
  • System 2 / System 1 频率比 10:50 → 每 5 步重采一次 latent 并保持不变。

数据

全部为合成数据,核心思路:把重定向到人形的人类 MoCap 运动在 IsaacSim 里回放并光线追踪渲染成照片级 rollout(去掉数据采集阶段对可靠动力学控制的依赖)。

LeVERB-Bench:150+ 任务、10 类。

  • 视觉-语言部分:154 条轨迹,每条随机化 100 次 → 17.1 小时 光真实 rollout。Table 1 分布(# motions / 总秒 / 均秒):Navigation 101 / 465.6 / 4.61(其中 Towards 80、Around 21)、Locomotion 20 / 64.4 / 3.22、Sitting 23 / 74.4 / 3.23、Reaching 10 / 17.4 / 1.74;合计 154 / 621.7 / 4.04。
  • 纯语言增强部分:用 VLM 标注、无需渲染,2.7 小时、正文称 500 条(Table 1 计 460 条):Locomotion 399 / 1052.8s、Reaching 61 / 101.6s,合计 460 / 1154.5s;对缺失视觉用文本注入空间线索(“左边那把红椅子”)。
  • System-2 训练数据混配(Table 3):共 5,996 条 demo(视觉语言 3,696,61.6%;纯语言 2,300,38.4%),614 条唯一轨迹。视觉语言环境:Modern House 1,872(50.6%,89 traj)、Kitchens 960(26%,34 traj)、Brown Stone 456(12.3%,19 traj)、Living Room 408(11%,12 traj)。纯语言来源:Run/LAFAN 1,115(48.5%,219 traj)、Walk/LAFAN 520(22.6%,104 traj)、Whole-Body/AMASS 425(18.5%,85 traj)、RL Motions/In-House 240(10.4%,52 traj)。
  • 采集流程(Appendix A):场景级+物体级颜色/材质随机化 → 沿轨迹放 objective/distractor 物体以生成”walk towards the yellow desk”类指令 → 每条轨迹程序化生成 100 个 demo(1 路第一人称 + 2–3 路固定第三人称,随机位姿保证任务在画框内)→ 镜像一半增广。渲染分辨率正文未披露(1080×720 仅见于真机部署相机,见 Infra 节),VLM 用 VILA。
  • 每条 demo = 图像 I0..IN + 文本指令 c + 机器人运动学状态 s0..sN。数据处理针对 13 关节:根关节位置(x,y,z)+欧拉角(yaw/roll/pitch)转 6D,其余关节仅相对根的位置;动作为 delta。

训练方法

三步、解耦流水线(避免并行仿真里做昂贵图形渲染):

Step 1 采集合成 demo(上节)。

Step 2 训练 LeVERB-VL(运动学重建 + CVAE):目标函数(Eq.2)三项——

  • 轨迹重建:‖Dψ(st,z) − s^R_{t+1:t+H}‖²(MSE,重建未来位姿);
  • 分布对齐:β1·D_KL(q(zt) ‖ p(zt)),β1 = 1e-1
  • 对抗分类:β2·L_disc(zt)(判别器 + GRL),β2 = 5e-4
  • 对分布对齐与对抗两项各用调度器,前 40% epoch 从 0 线性升到 1。训练后冻结隐空间,把每条 rollout 的 latent verb zt 缓存下来。
  • Appendix C 验证 CVAE 目标有效:把随机采样 latent 喂给解码器会收敛到高得多的重建 loss,说明当前状态本身不足以重建未来、latent 确实携带信息。

Step 3 训练 LeVERB-A(教师 PPO + DAgger 蒸馏)

  • 先训视觉语言无关的教师 Tξ,PPO 跟踪各类重定向运动学轨迹,用 DeepMimic 式跟踪奖励 + 平滑项(action rate、软关节限位为硬限位 90%)+ 大跟踪误差早停;域随机化(地面摩擦[0.3,0.8]、恢复系数[0,0.5]、关节默认位[−0.05,0.05]、armature 缩放[0.2,2.0]、每 10–15s 推一次 x-y 速度[−0.5,0.5])保证零样本 sim2real。
  • 再把多个教师 DAgger 蒸馏成条件于 latent 的学生(Huber loss 对抗离群)。每 episode 从 LeVERB-VL 训练集取一条轨迹的隐分布 (µρ, σρ),随机起始步,每 H 步 从分布采样 zt~N(µρ,σρ)(而非用均值——因为 VL 是多峰映射,用均值会退化成单峰、损性能),保持到下次重采。部署时 LeVERB-A 用 LeVERB-VL 的均值 µρ

Infra(训练 / 推理工程)

  • 训练(System 2)2× NVIDIA RTX 6000 Ada GPU,global batch size 512。GPU-hours 未披露。System-1(教师 PPO + 学生 DAgger)的具体 GPU 数/时长 未披露(IsaacSim 并行仿真)。
  • 推理 / 部署(真机 Unitree G1)
    • LeVERB-A(System 1)跑在机器人板载 CPU50 Hz,ONNX runtime,全 C++ 以满足实时;传感器(关节编码器、IMU、自研状态估计器)500 Hz;latent 命令接口暴露为 ROS2 topic;板载 RealSense 图像压缩后也走 ROS2 topic。
    • LeVERB-VL(System 2)跑在外接台式机 RTX 4090~10 Hz;输入为 USB 第三人称相机 + 板载相机,两路 30 FPS、1080×720;输出 latent verb 广播到 ROS2 topic。
  • 精度、edge 端功耗等 未披露

评测 benchmark

LeVERB-Bench 闭环评测(每任务/环境 20 次、报成功率%,均为训练分布内单体但组合未见的场景)。无同类前作可公平对比,故与自身消融变体比:

  • 总成功率 58.5%(正文另处提到 58.9%),在 10 类里 9 类居首;相比朴素分层 VLA(NS,7.5%)高 7.8 倍
  • 关键消融总分:LeVERB 58.5 > No-Encoder(NE) 53.0 > No-Discriminator(ND) 33.0 > No-LeVERB-VL(NVL) 25.5 > No-Sampling(NS) 7.5 > No-Low-level-Sampling(NLS) 6.5
  • 视觉导航(VNF,正前方,逐难度):Objective 80%、Distractor 75%、Cluttered 50%(对应 VNR 后方需转身:30/30/25);视觉导航+坐下 VNS 仅 5%。
  • 纯语言任务:Sit 100%、Stand 90%、Locomotion 100%
  • 结论支撑:去判别器(ND)视觉导航掉得最狠(视觉/纯语言两类隐分布分裂,学不到跨源技能);去 CVAE 采样(NS/NLS)几乎全崩(隐空间无结构、插值差、动作模块频繁 OOD);NVL(直接把 VL 嵌入喂低层)在视觉语言任务近乎全 0,但纯语言 locomotion 仍 100%——印证”原子语言命令无需高层推理,一旦引入视觉反馈低层策略就不够”。
  • 真机(Unitree G1)零样本 sim2real:展示词表泛化(“rest on the box” 等训练未见动词+物体组合能触发正确动作)与从视觉的空间推理(椅子在正前/侧方时执行不同的走-转-坐机动)。注意真机是开环回放 LeVERB-VL 输出的 latent verb 给 LeVERB-A,验证动力学层 sim2real 就绪,尚未做真机视觉闭环。

创新点与影响

  • 首个人形全身控制的视觉-语言隐动作模型,也是首个 sim-to-real-ready、照片级的视觉语言 WBC benchmark/数据集(LeVERB-Bench,Apache-2.0)。
  • 学到的 latent “verb” 词表替代显式速度/位姿接口,兼顾全身动作表达力与语义 grounding;解耦训练避开端到端里的渲染开销。
  • CVAE + 判别器/GRL 把视觉数据与纯语言增强数据统一进同一隐分布,是拿到泛化的关键(消融证实)。
  • 极小模型 + 极小数据的 proof-of-concept:全系统仅 102.6M+1.1M 参数、仅 154 条渲染轨迹,作者明确指出像 π0 这样的大模型在此小规模数据上易过拟合。
  • 作者自陈局限:缺真正的长程历史与规划能力(horizon 仅数秒,同期 manipulation VLA 通病);LeVERB-A 缺快速视觉反馈回路(限制更敏捷/灵巧任务);真机尚为 latent 开环回放。未来:加后训练、尤其 RL fine-tuning 对齐闭环 latent 分布。

原始链接

一手源存档(sources/)

  • leverb—project-page — 项目页正文(架构参数、benchmark 计数、消融表)快照
  • leverb—hf-dataset-card — HF 数据集卡(仅 Apache-2.0 许可声明)快照
  • arXiv 原文 PDF(arxiv 2506.13751,不入 git),正文/附录数字均引自此 PDF