一句话定位
用 VQ-VAE 从无动作标签的视频(含人类操作视频)里学出一套离散「潜动作」码本,先把 VLM 预训练成预测潜动作的策略,再用极少量真机轨迹把潜动作映射到真实动作——第一个不需要机器人动作标签的 VLA 预训练方法,实机上反超用 97 万条带标签轨迹训练的 OpenVLA,预训练算力还省 30-40 倍。
背景与定位
VLA(rt-2、OpenVLA)的范式是把 VLM 在多样机器人数据上微调以获得物理落地能力,但这些数据几乎都靠人类遥操作采集,规模受限。互联网视频有海量人类动作,却有两个障碍:大多没有动作标签,且分布与机器人本体/环境差异巨大。LAPA 走的是「无监督潜动作预训练」路线:把「从无动作视频学控制」这件事拆成先学一套与本体无关的离散动作词表,再让 VLM 学预测它。
思想上与 open-x-embodiment 的「共享动作空间跨本体正迁移」一脉相承,但把共享空间从「真实动作」换成了「潜动作」。方法直接借鉴 GENIE(Bruce et al. 2024,用潜动作构建可交互生成环境)的潜动作量化器,并对比了两条从视频学策略的基线路线:视频生成 + 逆动力学(UniPi,Du et al. 2023)和「小样本训 IDM 打伪标签再预训练」(VPT,Baker et al. 2022)。与把真实动作转成潜变量的工作(Behavior Generation with Latent Actions 等)不同,LAPA 的潜动作直接从观测(帧差)里导出,不依赖任何真实动作。论文中稿 ICLR 2025,获 CoRL 2024 LangRob Workshop 最佳论文(75 篇中)。
模型架构
三段式:潜动作量化 → 潜动作预训练 → 动作微调。
① 潜动作量化模型(Latent Action Quantization, LAQ)
- Encoder-decoder,架构是 C-ViViT tokenizer(Phenaki/Villegas 系)的变体,复刻 GENIE 的潜动作模型。Encoder 同时含空间 + 时间 transformer,decoder 只含空间 transformer(因为输入只有两帧)。
- 输入当前帧 x_t 与固定窗口后的未来帧 x_{t+H},输出潜动作 z_t;decoder 用 z_t + x_t 重建 x_{t+H}。Encoder 即逆动力学模型(IDM),decoder 即世界模型——LAPA 同时得到能生成 rollout 的世界模型和能产潜动作的策略。
- 与 GENIE 的差异:用 cross-attention 让 z_t 关注 x_t(而非 GENIE 的加性 embedding),经验上潜动作更语义化;因算力只用两帧、不含历史帧。
- 训练目标 VQ-VAE,用 NSVQ(把量化误差替成「原误差 × 归一化噪声向量」)防梯度坍缩,早期步用 codebook replacement 提升码本利用率。
- 潜动作 = 从码本词表 |C| 里取长度 s 的序列。主实验统一用 8⁴(序列长 4、词表 8)的生成空间;Language Table 分析里用过词表 8、序列长 1。(对比 OpenVLA 的动作空间 256⁷,LAPA 的 8⁴ 小得多,学习更容易。)
② 潜动作预训练(把 VLM 变策略)
- Backbone VLM = LWM-Chat-1M(Large World Model,7B,Jax;Liu et al. 2024,LLaMA 系 + RingAttention 长视频语言模型)。
- 用 LAQ 的 encoder 当 IDM,给所有 x_t 打上潜动作标签 z_t;再让 VLM 在「当前图像 + 语言指令」条件下预测 z_t。不复用语言头,另接一个 vocab=|C| 的潜动作头(单层 MLP)。默认冻结视觉编码器、解冻语言模型。图像先经 vqgan 编成 256 个离散视觉 token。
③ 动作微调(潜→真)
- 潜动作不可直接执行,故在少量带真实动作(delta end-effector)的轨迹上微调。每维连续动作离散化分箱(每箱数据点数相等,沿用 OpenVLA/rt-2 做法)。
- 丢弃潜动作头,重新初始化一个新动作头——经验上比保留潜动作头再加解码头效果好(作者归因于 7B 策略模型体量)。仍冻结视觉编码器、解冻全部 LM 参数(未用 LoRA,留作 future work)。
- 支持 7-DOF 单臂 Franka 与 14-DOF 双臂本体。
数据
预训练数据(不使用其真实动作标签)
| 数据集 | 规模 | 用途 |
|---|---|---|
| Language Table(sim) | 181k 轨迹,5 子任务 | in-domain / cross-task 预训练 |
| Language Table(real) | 442k(≈440k)轨迹 | cross-env 预训练;全库共 87k 条自然语言行为 |
| BridgeV2(WidowX) | 60k 轨迹 | SIMPLER / 实机 cross-embodiment |
| Open-X Embodiment | 970k 真机轨迹(多本体) | 多本体预训练(最佳模型) |
| Something-Something V2 | 220k 人类操作视频 | 纯人类视频预训练 |
微调数据(带真实动作,量极小)
- Language Table:in-domain 1k(占 181k 的 0.5%)、cross-task 7k、cross-env 1k。
- SIMPLER:100 条(每任务 25 条 × 4 任务),由 BridgeV2 策略成功 rollout 采集。
- 实机单臂:450 条(每任务 150 条 × 3 任务,每任务 15 个物体),polymetis 遥操作采集。
- 实机双臂:150 条(Open-X 里无双臂数据,纯 cross-embodiment)。
动作标注:预训练阶段的「标注」全部由 LAQ encoder 自动打潜动作,不需人工/真实动作。Sim vs real / 人类 vs 机器:cross-env 测 real→sim(440k 真实 → 1k sim),human-video 测人类→机器(220k Sthv2 → 机器)。任务分布分析(词法匹配,Table 3):Knocking 在 BridgeV2/Open-X/Sthv2 各 2 / 7,969 / 6,655 条;Covering 898 / 5,026 / 6,824;Pick&Place 10,892 / 911,166 / 3,272——预训练数据里对应任务多寡直接影响下游表现(如 BridgeV2 几乎无 knocking,故该任务反不如 Sthv2 预训练)。
训练方法
- 目标函数:LAQ 用 VQ-VAE 重建 + NSVQ;潜动作预训练是行为克隆(预测离散潜动作,交叉熵);动作微调是离散化动作 token 的自回归预测。
- 单臂/Language Table 技巧:Language Table 实验里先生成语言方向(如 ‘move up’)再生成动作(沿用 RT-H/Belkhale),显著提点;7-DOF 上收益边际、为省推理成本而弃用。
- 收敛效率:潜动作预训练 1 个 epoch 即够(BridgeV2/Open-X/Human 都是)。README 给出经验:70K 步、batch 256 足够;论文 §4.7 报 batch 128。同数据下以 LWM 为骨干的 ActionVLA 仅 3 epoch 达最优 action-token 精度,而 OpenVLA(Prismatic 骨干)需 30 epoch。
- 微调超参:实机微调 batch 128 + 图像增强;OpenVLA 基线用 LoRA(batch 32,训到 train action accuracy 95%);LAPA 用全参微调。
- 基线 OpenVLA(Bridge) 在 BridgeV2 上 30 epoch、batch 1024 预训练;OpenVLA(Open-X) 直接用官方 checkpoint。
Infra(训练 / 推理工程)
- 预训练 LAPA(Open-X)(最佳模型):8× H100,34 小时,batch 128 → 合计 272 H100-hours。
- 对照 OpenVLA:21,500 A100-hours,batch 2048。按 H100 比 A100 快 2-3× 折算,LAPA 约省 30-40× 预训练算力,且实机反超。效率来源:(1) LWM 骨干的预训练目标含「生成下一帧」,隐式学到高层动作;(2) 潜动作空间 8⁴ ≪ OpenVLA 256⁷。
- 微调:4× 80GB A100(脚本可调 GPU 数)。
- 基线工程:UniPi 扩散模型 4× A100(batch 128,每执行 2 步重规划一次);VPT 的 IDM = ResNet18+MLP,单张 A6000,Adam lr 1e-4。
- 推理:论文承认与既有 VLA 一样有实时推理延迟问题,提出未来用分层架构(小头高频出动作)缓解——具体推理 FPS / 控制 Hz / 延迟数值未披露。LAQ decoder 可做纯神经的闭环 rollout(neural simulation),但非实机执行路径。
评测 benchmark
一手结果(成功率 %,均来自论文表格;baselines:Scratch、UniPi、VPT、ActionVLA=同骨干但用真实动作预训练=上界、OpenVLA)。
Language Table(seen / unseen)
| 设置 | Scratch | UniPi | VPT | LAPA | ActionVLA |
|---|---|---|---|---|---|
| In-domain(1k FT) | 15.6 / 15.2 | 22.0 / 13.2 | 44.0 / 32.8 | 62.0 / 49.6 | 77.0 / 58.8 |
| Cross-task(7k) | 27.2 / 22.4 | 20.8 / 16.0 | 72.0 / 60.8 | 73.2 / 54.8 | 77.0 / 58.8 |
| Cross-env(1k, real→sim) | 15.6 / 15.2 | 13.6 / 12.0 | 18.0 / 18.4 | 33.6 / 29.6 | 64.8 / 54.0 |
SIMPLER(4 任务平均成功率)
- BridgeV2 预训练:Scratch 34.4,UniPi 1.3,VPT 51.0,LAPA 57.3,ActionVLA 63.5(LAPA 抓取率 71.9、移动率 77.1)。
- 纯人类视频(Sthv2)预训练:UniPi 0.7,VPT 45.8,LAPA 52.1(ActionVLA 无法训,因人类视频无动作标签)。
实机桌面操作(3 任务平均,Table 12)
| 模型 | 平均 |
|---|---|
| Scratch | 21.2 |
| ActionVLA (Bridge) | 32.6 |
| OpenVLA (Bridge) | 30.8 |
| LAPA (Bridge) | 36.8 |
| OpenVLA (Open-X) | 43.9 |
| LAPA (Open-X) | 50.1 |
| LAPA (Human Videos) | 34.0 |
- 头条结论:LAPA(Open-X) 50.1 > OpenVLA(Open-X) 43.9,+6.22%,且三种泛化设置(未见组合/未见物体/未见指令)全面领先。Pairwise 胜率:忽略平局 LAPA 胜 65.4%;含平局 LAPA 31.5% / OpenVLA 16.7% / 平局 51.9%。
- 跨本体反直觉发现:LAPA(Bridge) 36.8 反超用真实动作预训练的 ActionVLA(Bridge) 32.6 与 OpenVLA(Bridge) 30.8——作者认为带真实动作的模型过拟合了 WidowX 动作空间,跨本体迁到 Franka 时受损,而 LAPA 无此包袱。
- 纯人类视频:LAPA(Human, 34.0) 平均反超 OpenVLA(Bridge, 30.8),尽管本体差距更大(人→机 vs 机→机)。
- 双臂 14-DOF(Open-X 预训练):LAPA 30.21% > OpenVLA 26.04%,但两者绝对值都低。
- 失败模式:Pick&Place 上 LAPA 逊于 OpenVLA,失败多在过早抓取;但 reaching 上 LAPA 83.33% > OpenVLA 66.67%——语言条件/粗粒度规划强,抓取等细粒度技能弱(150 条微调不足以覆盖多样物体的抓取)。
Scaling 消融(BridgeV2→SIMPLER):模型参数、数据量、潜动作序列长、潜动作词表四个维度都随规模提升;但潜动作空间存在「甜点」,最优尺度取决于预训练数据的动作维度复杂度(Language Table 这种视觉简单环境,扩词表比扩序列长更有效)。
创新点与影响
- 贡献:首个无需机器人动作标签的 VLA 预训练方法。把「原子动作」像 BPE 一样无监督 tokenize 成离散潜动作码本,不需任何动作先验(末端位姿/关节角/力矩)。
- 改变了什么:证明可以用互联网规模的无标签视频甚至纯人类视频预训练出比带标签 SOTA(OpenVLA,970k 遥操作轨迹)更强的实机策略,且算力省 30-40×,为「机器人基础模型脱离遥操作数据瓶颈」提供了可扩展路径。同一 LAQ 同时给出 IDM(encoder)与世界模型(decoder),可做闭环神经 rollout,指向 TAMP / test-time compute 扩展的可能。潜动作被验证是与本体无关的共享表示(多本体、人类视频里同一潜动作对应相似语义动作,甚至能编码相机运动)。
- 作者自陈局限:(1) 细粒度动作(抓取)逊于真实动作预训练,寄望扩大潜动作生成空间;(2) 与既有 VLA 一样有实时推理延迟,需分层架构;(3) 目前只在操作视频上验证,尚未扩到自动驾驶/导航/风景视频;(4) 双臂绝对性能仍低,需引入双手人类操作视频。
原始链接
- arXiv: https://arxiv.org/abs/2410.11758 (PDF: https://arxiv.org/pdf/2410.11758)
- 项目页: https://latentactionpretraining.github.io/
- 代码: https://github.com/LatentActionPretraining/LAPA (MIT License)
- 模型(HF): https://huggingface.co/latent-action-pretraining/LAPA-7B-openx (base: LargeWorldModel/LWM-Chat-1M-Jax;含 LAQ 权重 laq_openx.pt)
一手源存档(sources/)
- lapa-latent-action-pretraining—github-readme — GitHub README(getting-started / 三段式脚本 / 8×H100 34h / 4×A100 微调 / news)
- lapa-latent-action-pretraining—hf-card — HF model card(base_model=LWM-Chat-1M-Jax,MIT,jax/robotics)
- lapa-latent-action-pretraining—project-page — 项目页快照(abstract / 方法概览 / cross- & multi-embodiment / human-video 结论)
- arXiv 全文(PDF)见上方链接,不入 git。