一句话定位

villa-X 是一个 ViLLA(Visual-Language-Latent-Action)框架,同时改进「潜动作怎么学」(给 LAM 加一个本体感受 proprio FDM 分支,把潜动作和真实机器人状态/动作对齐)和「潜动作怎么用」(用联合扩散/flow matching 把潜动作专家和机器人动作专家串起来,前者条件化后者),在 SIMPLER、LIBERO 两个仿真基准和两个真机平台(夹爪 + 12 自由度灵巧手)上都取得当时最优表现。

背景与定位

范式:潜动作预训练(latent-action pretraining)用于 VLA——把无动作标注的人类/机器人视频压缩成离散”伪动作”token,作为模仿学习的额外监督信号,从而把海量无标注视频也纳入策略预训练。这条线最早由游戏领域的 LAPO 和 Genie 开创,Dynamo 把 IDM+FDM 架构搬到状态表征学习,LAOM 在 Mujoco 环境用监督信号处理干扰物;机器人领域则有 LAPA(先用 VLM 预测潜动作再替换成动作头微调)、IGOR(人-机统一潜动作空间迁移)、Moto-GPT(联合微调潜动作和真实动作标签)、GR00T(把潜动作当成一种独立的”具身”和真实动作一起丢进共享扩散 transformer)、GO-1(潜动作 token 作为真实动作生成的条件)、UniVLA(两阶段学习任务中心化潜动作)。

villa-X 的定位是:这些先驱工作要么在学习阶段完全丢弃机器人本体状态/动作信号(潜动作和物理动力学脱节),要么在使用阶段把潜动作和真实动作当同类拼在一起训练、缺乏显式的层级结构(GR00T 式)或只做一步预测、没有长时序规划(LAPA、GO-1 式)。villa-X 针对这两点分别提出 proprio FDM 监督和”潜动作作为中层桥梁 + 显式条件化 + 多步序列建模”三点设计,并在论文里用同架构复现了 LAPA-style 和 GO-1-style 两种基线做受控对比。

模型架构

LAM(Latent Action Model,两阶段中的第一阶段,独立预训练后冻结供 ACT 使用)——四个子模块:

  • IDM(逆动力学模型):ST-Transformer(Spatial-Temporal Transformer)编码器,输入 8×224×224 的视频片段,patch size 14 做 patch embedding,12 个 ST-block,每 block 隐藏维度 768、32 个注意力头;随后做向量量化(VQ),codebook size = 32;实际实现中一次接收 T_LAM 帧序列,输出 T_LAM − 1 个潜动作 z ∈ R^{N_z × D_d}(连续两帧间隔 K 为可配置窗口,论文正文未给出主实验用的具体数值,仅在 ACT 部分举例 K=2)。
  • 图像重建 FDM:12 层 ViT-base,给定当前帧 o_t 和潜动作 z_t 预测未来帧 ô_{t+K}
  • 新增:proprio FDM(本文核心改动):2 层 MLP,隐藏维度 768,双输出头,给定当前机器人本体状态 q_t 和潜动作 z_t,预测 K 步之后的机器人状态和动作;额外拼接一个可学习的具身上下文嵌入(如数据集 ID、控制频率)以隔离和具身强相关的特征,避免潜动作把平台特有信息也编码进去、阻碍跨具身迁移。
  • 训练时对无机器人标签的数据(纯视频)省略 proprio FDM 分支,只优化图像 FDM 重建损失;两个 FDM 损失权重相同。推理时只需要 IDM 提取潜动作,FDM/proprio FDM 仅作为诊断可视化工具(不参与下游策略推理)。

ACT(Actor 模块,第二阶段,VLA 主干)——三部分:

  • VLM:预训练 PaliGemma(3B 参数,224×224 图像 + 128-token 文本预训练)。
  • ACT-latent:18 层 Transformer(结构镜像 PaliGemma),隐藏维度 1024、8 个注意力头,用 flow matching 目标训练,条件于 VLM 特征,建模长度 N=6 的未来潜动作序列 z_t, z_{t+K}, …, z_{t+(n−1)K}
  • ACT-robot:同规格 18 层 Transformer,同样用 flow matching 训练,条件于 VLM 特征 以及 ACT-latent 的中间特征(经单向注意力,“虚线”所示),建模长度 M=4 的低层机器人动作序列;可选接入腕部相机(wrist camera)输入,经预训练 ResNet-18 提取特征、通过共享跨注意力头映射为 16 个 token(借鉴 HPT 的 tokenize 方式),训练时腕部视图 50% 概率被随机 mask。
  • 潜动作序列长度 N 与机器人动作序列长度 M 不要求相等m = nK 非必须),只需共享起始时刻 t——例如可以规划 10 步潜动作(对应 K=2 时相当于 20 步机器人动作)但只实际预测 4 步机器人动作。
  • 正则化:训练时以 50% 概率完全屏蔽从潜动作到机器人动作的注意力,否则随机 mask 掉 50% 的潜动作 token(借鉴 Moto 和 RDT 的做法),防止机器人动作专家过度依赖/过拟合潜动作表征。
  • 每个专家(latent-action expert / robot-action expert)约 300M 参数,从头训练;embodiment 上下文嵌入同样接入 ACT-robot 处理具身特有信息。
  • 推理时 ACT-Latent 与 ACT-Robot 的去噪(denoising)步骤同时进行。

数据

预训练数据混合机器人轨迹与人类第一视角视频:

  • 机器人数据:主要来自 OpenX 混合集(基础配比参照 OpenVLA、Octo 的方案)与 AgiBot World Beta。论文原文写”in total, we use 223.5M trajectories with 1.6M frames of robot data”(原文如此表述——数量级顺序与常规直觉相反,可能是论文笔误,此处按原文数字转录,未做校正)。
  • 人类视频:Ego4D、EgoPAT3D、EGTEA Gaze+、EPIC-KITCHENS、HO-Cap、HOI4D、HoloAssist、RH20T、Something-Something V2,合计 3.6M 段人类视频片段
  • 数据混合配比(Table 6,预训练阶段,机器人+人类视频合并统计):RT-1 9.70%、AgiBot World Beta 20.0%、Kuka 1.97%、Bridge 5.47%、Taco Play 0.76%、Jaco Play 0.12%、Berkeley Autolab UR5 0.31%、Language Table 0.11%、Stanford Hydra 1.61%、NYU Franka Play 0.22%、Furniture Bench 0.63%、Austin Sailor 0.57%、Austin Sirius 0.45%、BC-Z 3.47%、DLR EDAN Shared Control 0.01%、CMU Stretch 0.04%、FMB Dataset 0.73%、DobbE 0.37%、DROID 3.46%、Ego4D 21.46%、EgoPAT3D 0.94%、EGTEA Gaze+ 0.89%、EPIC-KITCHENS 6.95%、HO-Cap 0.63%、HOI4D 1.99%、HoloAssist 4.77%、RH20T 5.56%、Something-Something V2 6.82%。
  • 数据清洗:采用 EgoHOD(Ego4D 的精选子集)并进一步按视觉质量过滤视频;机器人和人类视频均做亮度/对比度/饱和度/色调随机增强;机器人本体状态与动作统一用欧拉角表示。
  • 相机视角:LAM 预训练只用主第三人称视角;策略(ACT)预训练时可选接入腕部视角(若存在),以 50% 概率随机 dropout。
  • 微调数据(下游具身适配,见评测节):Realman 夹爪平台 375 条遥操轨迹(5 任务 × 75 条);Xhand 灵巧手平台复用外部 Xhand Dataset,约 4,000 条轨迹、13 类任务、50+ 独特物体。
  • 无强化学习数据;全部为模仿学习 + 潜动作自监督信号,动作标注直接来自机器人本体记录(欧拉角状态/动作),无需额外人工标注。

训练方法

三阶段流水线:(1) 预训练 LAM;(2) 预训练 ACT(VLM + ACT-latent + ACT-robot 联合训练,损失同时作用于潜动作和真实动作);(3) 在目标具身数据上微调 ACT(未见具身则新初始化一个 context embedding,其余流程与预训练相同)。

  • LAM 训练目标:IDM+VQ 编码潜动作 → 图像 FDM 重建损失 + proprio FDM 的机器人状态/动作预测损失,两者权重相同联合优化;缺机器人标签的数据只用图像 FDM 损失。
  • ACT 训练目标:ACT-latent 与 ACT-robot 均为 flow matching(而非离散自回归)生成式建模,ACT-robot 通过单向注意力显式条件于 ACT-latent 的中间表征,实现”结构化”的潜动作→真实动作信息传递(而非仅靠预训练权重初始化的隐式迁移,如 LAPA/GR00T;也避免了 GO-1 式 teacher forcing 带来的训练-推理不一致)。
  • 消融/对比基线(用同一套 villa-X 架构复现,控制变量对比”如何引入潜动作”):
    • LAPA-style:两阶段——先训 VLM 预测潜动作,再把潜动作预测头替换成机器人动作预测头继续训练。
    • GO-1-style:单独训练一个自回归”潜动作规划器”,机器人动作预测部分基本沿用 villa-X 主体设计不变。
    • wo/pp(LAM 去掉 proprio FDM 分支)、wo/LAM(完全不用潜动作,只训练机器人动作预测)作为 LAM 侧消融。
  • 超参数:LAM——学习率 1.5e-4,batch size 512,2000 步线性 warmup;ACT——学习率 5e-5,200 步线性 warmup,梯度裁剪最大范数 1.0。
  • LIBERO 微调:50k 梯度步/任务套件(全参数微调,除视觉编码器外重新初始化线性状态/动作编码解码器)。Realman 微调:60k 梯度步。Xhand 微调:重新初始化状态/动作线性编解码模块以适配灵巧手更高维度。

Infra(训练 / 推理工程)

  • LAM 预训练:128 × NVIDIA A100,耗时 4 天 → 折合约 12,288 GPU-hours
  • ACT(Actor)预训练:64 × NVIDIA A100,耗时 4 天 → 折合约 6,144 GPU-hours
  • 并行策略、混合精度方案:未披露。
  • 推理侧 FPS / 控制频率 / 延迟:论文未披露(仅提到 Realman 遥操数据采集频率为 10Hz,这是数据采集频率而非策略推理频率);边缘硬件部署信息未披露。

评测 benchmark

Table 1(LAM/引入方式消融,SIMPLER,8 任务,预训练用 10% Fractal + 10% Bridge V2 + 100% SSv2 缩减配比)

  • Google Robot 平均成功率:Ours(w/pp) 44.9% > wo/pp 43.8% > LAPA-style 34.2% > wo/LAM 26.3% > Go-1-style 25.7%。
  • WidowX Robot 平均成功率:Ours(w/pp) 40.8% > wo/LAM 33.1% > wo/pp 32.3% > Go-1-style 14.8% > LAPA-style 1.0%(LAPA-style 与 Go-1-style 在 WidowX 上几乎失效)。
  • Probing 实验:冻结训好的 LAM,训一个 3 层 MLP 从潜动作预测 LIBERO 8 维机器人动作(3 位置+4 旋转+1 夹爪),用最大 L1 误差分桶统计——w/pp 变体低误差样本数量明显多于 wo/pp(定性结果,Figure 4,未给出具体数字表)。

Table 2(SIMPLER 主对比,完整预训练配方):villa-X 全模型在 Google Robot 平均成功率 59.6%、WidowX Robot 平均成功率 62.5%,均为该表最高;对照:RT-1-X* 42.4/1.1,Octo-base* 11.0/16.0,OpenVLA* 24.5/1.0,RoboVLMs*(仅预训练) 50.5/13.5,RoboVLMs(微调) 51.7/37.5,GR00T 1.4/3.8,MoTo Google 侧 N/A(Pick 74.0/Move 60.4/Drawer 43.1,Place 与整体 Avg 未披露)、WidowX 全 N/A,LAPA 仅 WidowX 侧 57.3(Google 侧 N/A);villa-X w/o latent 消融为 30.8/49.0,显著低于全模型,确认潜动作专家的贡献。

Table 3(LIBERO 四套件微调后评测,10 任务×20 trial/套件):villa-X 全模型 Spatial 97.5 / Object 97.0 / Goal 91.5 / Long 74.5,平均 90.1%,全部四项均超过 Diffusion Policy(平均 72.4)、Octo-base(75.1)、OpenVLA(76.5);villa-X w/o latent 平均 81.9,3/4 套件低于全模型(仅 Object 套件持平/略高)。

Table 4(Xarm + 12-DoF Xhand 灵巧手真机,seen/unseen 两组,5 类代表性任务):villa-X 全模型在 seen/unseen 上分别为 Pick&Place 84/68、Stack Cube 75/50、Place Cup Upright 60/30、Pour Water 60/30、Flick Ball 50/40,全面优于 GR-1(56/40, 15/5, 0/0, 0/0, 40/10)、GR00T(44/28, 20/0, 20/0, 0/0, 30/0)及 villa-X w/o latent 消融。Pick&Place 50 次评测、Stack Cube 20 次、其余各 10 次。

Table 5(Realman 六自由度机械臂 + Inspire 一自由度夹爪,7 组×10 trial,前 5 组为训练同分布任务,后 2 组为泛化测试):villa-X 全模型 Pick in 30、Pick out 100、Push 50、Stack 50、Unstack 100、Change block color 60、Change table cover 60,多数指标优于 GR00T(30, 70, 10, 10, 60, 50, 30)与 villa-X w/o latent 消融(40, 80, 30, 60, 70, 40, 30)。

定性结果:LAM 潜动作可视化(相似潜动作对应相似底层机器人行为,跨人类/机器人具身一致);ACT-latent 长时序运动规划(配合世界模型渲染出的未来视频,能正确识别 emoji 这类罕见于机器人数据集的抽象目标,说明预训练后仍保留 PaliGemma 的通用视觉-语言能力)。

创新点与影响

  • 贡献:① 给 LAM 加入 proprio FDM 辅助解码器,用机器人本体状态/动作信号约束潜动作学习,让潜动作首次显式对齐物理动力学(而非只对齐视觉变化),并可用具身上下文嵌入隔离平台特有特征以提升跨具身可迁移性;② 提出用联合扩散(flow matching)同时建模潜动作专家与机器人动作专家,机器人动作生成显式条件于潜动作生成过程(单向注意力),比先前工作(LAPA/GR00T 隐式迁移、Moto/GO-1 单步或 teacher-forcing 式条件)结构上更有效;③ 在 SIMPLER、LIBERO 两个仿真基准和两个真机平台(夹爪 + 灵巧手)上系统验证,并用同架构受控复现 LAPA-style/GO-1-style 基线做公平消融。
  • 改变了什么:把”潜动作学习”和”潜动作使用”两个此前被割裂处理的问题在同一框架下联合改进,给出了可复现的对照实验(而非仅靠外部基线的跨论文数字对比),证明了”潜动作显式条件化 + 物理量监督对齐”比”潜动作当普通动作类别混训”或”仅靠权重初始化隐式迁移”更有效。
  • 作者自陈局限:论文承认提出的潜动作专家虽然能通过视觉和本体状态两种规划有效预测未来,但其能力”未被充分挖掘”(not fully explored)——作者提出的未来方向是训练一个带视觉-语言基础模型先验知识的 critic,对潜动作专家采样出的多条候选轨迹做拒绝采样,剔除不符合语言指令的规划,以进一步提升 ViLLA 框架的能力。
  • 发布现状(据 GitHub/HF,2025-08-01 首次发布):仅开源了预训练 LAM 权重(microsoft/villa-x/lam,955M 参数)及 LAM 推理代码;论文的 ACT/Actor 模块权重与训练代码在本文写作时尚未发布(GitHub Release plan 勾选框显示 Actor Model 待发布)。

原始链接

一手源存档(sources/)