一句话定位
UniVLA 用一个两阶段 VQ-VAE 隐动作模型,从跨本体、跨视角、甚至无动作标签的人类视频中解耦出”任务相关”的隐动作 token,再把这套统一隐动作空间接到 Prismatic-7B VLM 上做下一隐动作预测预训练;不到 openvla 1/20 的预训练算力(960 A100-hours vs 21,500 A100-hours)就在 libero、calvin、R2R 导航和真机部署上全面反超 openvla 与 LAPA。
背景与定位
范式:任务中心隐动作(task-centric latent action)预训练 + 统一动作空间的跨本体 VLA,延续 LAPA、Genie、IGOR 这条”从无标签视频里学隐动作码本、绕开动作标注瓶颈”的路线,但直接回应了这条路线此前的核心痛点:LAPA/Genie 式的隐动作是对像素做朴素重建,会把摄像头抖动、其他主体(非本体)运动、光照变化这些”任务无关动态”一并编码进码本,污染下游策略学习。UniVLA 的解法是显式解耦——用语言指令做条件,把”任务无关动态”和”任务中心动态”训练成两套独立码本,只把后者喂给策略。
对比对象上,论文点名的基线包括 openvla(把动作离散化成 LLaMA 词表里的 bin token,直接在低维动作空间自回归规划)、LAPA(无监督隐动作但未解耦任务相关性)、octo(跨本体统一动作表征的 transformer 策略)、Diffusion Policy、MDT、MaIL。方法论上呼应 JEPA(Joint-Embedding Predictive Architecture)思路:预测目标不是原始像素而是预训练 dinov2 的 patch 特征,理由是 DINOv2 特征自带物体中心、空间感知先验,比像素空间预测更抗噪声。
组织上这是 OpenDriveLab、AgiBot 和港大的合作(一作 Qingwen Bu 亦是 RoboDual 双系统操作策略工作的作者),后来发表于 RSS 2025(HF 模型卡确认)。同批工作里,AgiBot World 提供了另一条”扩大高质量真机数据”的路线,UniVLA 则押注”用视频而非动作标签规模化”。
模型架构
隐动作模型(两阶段 VQ-VAE,训练于连续帧对 {o_t, o_{t+k}},帧间隔按各数据集采样频率标定为约 1 秒):
- Encoder:时空 Transformer(spatial-temporal transformer,带因果时序掩码,沿用 Villegas et al. Phenaki 设计),输入为 DINOv2 编码的帧对特征 + 一组可学习动作 token;Decoder:仅用量化后的动作 token(不喂历史帧,避免模型走捷径记忆数据集)预测未来帧的 DINOv2 特征,目标是特征空间 L2 重建误差 ‖Ô_{t+k} − O_{t+k}‖²。
- Stage 1(任务无关码本):编码器/解码器都额外接收 T5 文本编码器产出的语言指令 embedding 作为条件;因为语言已经提供了任务相关语义,被约束的隐动作码本(容量有限)被迫只编码”任务无关”信息(新物体出现、他人/其他agent运动、镜头抖动等)。
- Stage 2(任务中心码本):冻结 Stage 1 的任务无关码本和参数,新初始化一套 VQ_TC 码本,替换掉语言输入的角色,专门学习”任务中心”隐动作 a_TC;训练时编码器同时输出任务无关、任务中心两组量化动作,解码器融合三者(O_t、任务无关、任务中心)重建下一帧特征。
- 码本容量:|C| = 16,动作 token 组长度 N = 4,即隐动作空间 16^4(相比 openvla 的 256^7 离散 bin 空间大幅压缩),论文指出这一压缩显著加速收敛。
生成式策略(下一隐动作预测):
- Backbone 直接采用 Prismatic-7B VLM(融合 SigLIP + dinov2 视觉编码器 + 投影层 + LLaMA-2 LLM),与 openvla 对齐以保证可比性。
- ACTION-conditioning:不像 openvla/RT-2 把动作映射到 LLaMA 词表里”不常用词”对应的均匀 bin,而是扩展词表新增 |C| 个专用 token(ACT_1…ACT_C),隐动作按码本索引直接映射进这些新 token;完整保留 VLM 原有架构和训练目标。训练目标是下一隐动作 token 的负对数似然(自回归,N=4)。
- Post-training 动作解码:轻量解码头——摘要/引言处表述为 10.8M 参数,III-C 正文与附录 Table A-V(真机实验架构明细)给出的具体数字是 12.6M(含 proprioception 投影模块,两处数字在原文中不完全一致,如实并列);配合 LoRA 微调后总可训练参数约 123M(正文 III-C)。解码机制:视觉 embedding 先用 multi-head attention pooling 聚合成单 token;再以该 token 为 query 从隐动作 embedding 中提取信息(两级注意力池化,8 head,head dim 64,hidden size 512,MLP ratio 4),最终线性投影到目标机器人动作空间,可直接扩展输出维度解码成 action chunk(真机用 chunk size 12)。整个策略端到端联合训练:下一隐动作预测 loss + 预测低层动作与真值的 L1 loss。
- 历史隐动作(history latent action):把上一步隐动作(编码为 N=4 token)拼进指令输入,作为类 CoT 的反馈信号,让策略在长程任务中隐式利用自己此前的决策;消融显示仅用一步历史即可提升 R2R 16.5%、LIBERO-Long 3.9%,继续加长历史收益递减。
数据
隐动作模型 + 策略预训练数据混合(Table A-I,来自 OXE、GNM、Ego4D 三个来源,具体占比):Fractal 13.9%、Kuka 6.3%、Bridge 6.8%、Taco Play 3.5%、Jaco Play 0.6%、Berkeley Cable Routing 0.3%、Roboturk 2.8%、Viola 1.1%、Berkeley Autolab UR5 1.4%、Toto 2.4%、Language Table 5.2%、Stanford Hydra 5.3%、Austin Buds 0.3%、NYU Franka Play 1.0%、Furniture Bench 2.9%、UCSD Kitchen <0.1%、Austin Sailor 2.6%、Austin Sirius 2.0%、DLR EDAN 0.1%、IAMLab CMU Pickup Insert 1.1%、UTAustin Mutex 2.6%、Berkeley Fanuc 0.9%、CMU Stretch 0.2%、BC-Z 8.8%、FMB 8.4%、DobbE 1.7%、RECON 8.9%(GNM 导航子集)、CoryHall 2.3%(GNM)、SACSoN 3.5%(GNM)、Ego4D 3.0%(人类视频)。
- 来源类别:跨本体机器人操作数据(OXE 子集,单臂末端执行器控制)+ 导航数据(GNM 数据集子集,室内/越野场景,鱼眼自我视角相机)+ 无动作标签的人类第一人称视频(Ego4D)。
- 动作标注(action-labeling):预训练阶段完全不使用机器人数据集自带的真实动作/本体感知标签——只用帧序列和文本指令;所有隐动作标签由自训练的隐动作模型自动打标。
- Sim vs Real / 迁移验证:除 SimplerEnv(刻意复现 Bridge-V2 环境)外,libero、calvin、R2R 及真机部署环境在预训练中均未出现,用来验证隐动作模型和策略的泛化能力。
- 数据规模效应(Data scalability,Fig. 9):仅用 Bridge-V2 预训练已刷新 LIBERO SOTA;加入 OXE 跨本体数据和 Ego4D 人类视频后 LIBERO 均值再涨 2.0%;真机评测中,Bridge→OXE 使平均分升 0.3,再加人类数据(尽管无动作标签、本体差异巨大)再升 0.28;R2R 导航基准也观察到同样的规模化收益。
- 数据效率(Fig. 10):仅用 10% 下游演示数据,UniVLA 在 LIBERO-Goal 上已达 86.3%,超过用 100% 数据训练的 openvla(79.2%);用 10%/50% 训练数据即分别在 LIBERO-Goal/LIBERO-Long 刷新 SOTA。
训练方法
- 隐动作模型训练目标:VQ-VAE 重建 loss(DINOv2 特征空间 L2),两阶段分别学习任务无关码本(语言条件)和任务中心码本(冻结前者、新码本专注剩余动态)。
- 策略预训练目标:下一隐动作 token 的自回归负对数似然(N=4 token/步)。
- 超参(Full 预训练,全数据):联合优化视觉编码器 + LLM backbone + token 预测头;global batch size 1024(单卡 32),恒定学习率 2e-5,20,000 步优化即达到稳健下游性能,约 30 小时 on 32×A100。
- 超参(Bridge-only / Human-only 消融预训练):global batch size 258,8 GPU,约 200 A100-GPU-hours。
- CALVIN 微调:100k 步,batch size 128,学习率前 80k 步 1.5e-4、之后 1.5e-5;openvla 对照用官方 checkpoint + LoRA 微调 200k 步、action chunk size 8。
- LIBERO 微调:LIBERO-Long 训练 40k 步,其余三个子集训练 30k 步,global batch size 128;仅用第三人称图像 + 语言指令。
- 动作解码头设计消融(Table IV,LIBERO 四子集):Auto-regressive(openvla/LAPA 式离散 bin 自回归解码)Spatial/Object/Goal/Long/Avg = 85.2/81.2/79.0/49.0/73.6;本文解码头去掉视觉 query(“w/o Visual”)= 95.0/95.4/93.7/86.0/92.5;完整版(视觉引导注意力池化)= 96.5/96.8/95.6/92.0/95.2。三者均值依次 73.6%→92.5%→95.2%,LIBERO-Long 单项从 49.0%→86.0%→92.0%(正文另称”42.1%改进”和”额外2.2%均值提升”,与表中精确差值 43.0/2.7 个百分点略有出入,以表格数值为准)。
- 隐动作解耦消融(Table III,仅用 Ego4D 人类视频预训练):任务中心隐动作 88.7% 均值,显著优于 Genie 式”编码全部视觉变化”的隐动作(82.3%)和”任务无关”隐动作(56.5%,其中 LIBERO-Long 近乎归零 0.2%),验证了解耦设计本身的必要性。
- 历史隐动作消融(Table V,列为 LIBERO-Goal / LIBERO-Long / R2R):Instruction-only = 95.0 / 88.1 / 30.6;加入一步历史隐动作后 = 95.6 / 92.0 / 47.1——LIBERO-Goal 基本持平(+0.6)、LIBERO-Long 提升 3.9 个百分点、R2R 提升 16.5 个百分点,长程任务收益最明显。
Infra(训练 / 推理工程)
- 训练硬件:全数据主预训练用 32× NVIDIA A100,20,000 步约 30 小时(约 960 A100-GPU-hours,对应摘要中”less than 1/20 of OpenVLA 预训练算力”的比较基准,openvla 为 21,500 A100-hours);Bridge-only/Human-only 消融预训练用 8× A100,约 200 A100-GPU-hours。
- 并行策略/精度:论文未披露具体的并行切分方式(数据并行/张量并行)与训练精度(bf16/fp16)。
- 推理:真机部署在 NVIDIA RTX 4090 上实现 10Hz 闭环控制频率(action chunk size 12),对比 openvla 单步动作预测延迟 0.18s、chunk-4 预测延迟 0.68s(因此出现执行卡顿)。
- 边缘硬件:真机实验用 AgileX Robotics Piper 机械臂(7-DoF 动作空间)+ Orbecc DABAI RGB-D 相机(仅用 RGB)。
- 未披露:具体分布式训练框架、混合精度设置、训练/推理显存占用。
评测 benchmark
LIBERO(Table I,四子集 Spatial/Object/Goal/Long,500 trials/子集,3 seed 均值):
| 方法 | Spatial | Object | Goal | Long | Avg |
|---|---|---|---|---|---|
| LAPA* | 73.8 | 74.6 | 58.8 | 55.4 | 65.7 |
| Diffusion Policy | 78.3 | 92.5 | 68.3 | 50.5 | 72.4 |
| Octo | 78.9 | 85.7 | 84.6 | 51.1 | 75.1 |
| MDT† | 78.5 | 87.5 | 73.5 | 64.8 | 76.1 |
| OpenVLA | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 |
| MaIL† | 74.3 | 90.1 | 81.8 | 78.6 | 83.5 |
| UniVLA (Human-pt) | 91.2 | 94.2 | 90.2 | 79.4 | 88.7 |
| UniVLA (Bridge-pt) | 95.2 | 95.4 | 91.9 | 87.5 | 92.5 |
| UniVLA (Full) | 96.5 | 96.8 | 95.6 | 92.0 | 95.2 |
Full 预训练均值 95.2%,超 OpenVLA 18.5 个百分点、超 LAPA 29.3 个百分点(LAPA 用作者复现于同一 Prismatic-7B backbone 上的结果);仅用 Bridge-V2 预训练已达 93.0%(原文正文,Fig.4 中标注 92.5),超过用额外腕部相机的 MaIL(83.5%)、MDT(76.1%)。
CALVIN ABC→D(Table A-II,1000 条 5 任务序列,成功完成连续 N 个任务的比例 + 平均完成长度 Avg.Len / 满分 5):UniVLA 完成全部 5 任务的比例 56.5%,超此前最优 CLOVER(45.4%)11.1 个百分点、超 OpenVLA*(43.5%)13 个百分点;平均完成长度 3.80(OpenVLA* 3.27,RoboDual 3.66)。UniVLA 是对照方法中唯一仅用第三人称 RGB 输入的。
R2R 导航(VLN-CE,oracle success rate,OpenVLA/UniVLA 在完整 1839 条 val-unseen 上评测,NaVid 因历史观测计算成本高只报 100-episode 子集):UniVLA 相比 Seq2Seq/CMA 把 oracle SR 从 8.10% 提升到 47.1%;超 LLaVA-Nav 33.1 个百分点、超 OpenVLA 29.6 个百分点;与编码全部历史观测的 NaVid 表现相当(UniVLA 仅用单帧 RGB + 历史隐动作)。
SimplerEnv-Bridge(Fig. A-2,4 个 WidowX+Bridge 任务,24 trials/任务):仅微调解码头(decoder-only,因为 Bridge-V2 已在预训练中见过)达 35.4% 成功率;进一步全量 LoRA 微调后综合 task success rate 42.7%,超 OpenVLA 41.7 个百分点、超 Octo-Base 26.7 个百分点。
真机部署(Table A-IV,4 任务:收纳螺丝刀/清理砧板/两次对折毛巾/汉诺塔堆叠,成功率 + 三分制阶段得分):UniVLA(Full) 平均成功率 81.7%、平均得分 2.63,对比 LAPA(OXE) 45%/1.95、OpenVLA 38.3%/1.63、Diffusion Policy 33.3%/1.45——超第二名 LAPA 36.7 个百分点、0.68 分。
泛化性评测(Table II,光照变化/视觉干扰物/新物体,3 种设定各自 succ./score):UniVLA 均值成功率 68.9%、均值得分 2.49,显著超 LAPA(28.9%/1.36)、OpenVLA(20.0%/0.98)、Diffusion Policy(24.4%/0.69);新物体设定下 UniVLA 成功率仅比原任务下降 6.6 个百分点。
创新点与影响
- 核心贡献:把”从无动作标签视频学隐动作”这条路线(Genie / LAPA / IGOR)推进到能显式过滤任务无关动态——用语言条件把隐动作解耦为任务无关码本 + 任务中心码本两阶段,用 dinov2 特征空间预测替代像素重建以获得更强的物体中心先验,用词表扩展式 token 化替代 bin 化以保留 VLM 原生架构。
- 实际影响:以 <1/20 的预训练算力(960 vs 21,500 A100-hours)、<1/10 的下游数据在多个操作和导航基准上反超 OpenVLA;证明统一隐动作空间可以把导航(GNM/R2R)和操作(OXE/LIBERO)、甚至人类视频(Ego4D)拉进同一预训练语料,无需手工对齐动作空间(区别于 Yang et al. 需手动对齐腕部相机与自我中心导航运动的方案)。
- 论文自陈局限(VI Limitations and Future Work):(1) 隐动作粒度和码本大小固定,对所有任务/本体未必最优,双臂/灵巧手场景需要更精细的动作空间建模,本文只在单臂操作上验证;(2) 对语言标注粒度有一定要求——训练数据多为描述短程动作的细粒度指令而非高层目标,隐动作模型倾向编码本体(ego-agent)动作、可能忽略非本体动态(如”烧水”任务里的蒸汽);(3) 隐动作解码器本质上是个世界模型(预测未来观测),论文认为可进一步接入强化学习式的 reference alignment、测试时规划树搜索,以及把人类演示视频编码为隐动作序列做免微调的 in-context 技能获取,留作未来工作。
原始链接
- arXiv: https://arxiv.org/abs/2505.06111
- PDF: https://arxiv.org/pdf/2505.06111
- GitHub: https://github.com/OpenDriveLab/UniVLA
- HF 模型(policy): https://huggingface.co/qwbu/univla-7b
- HF 模型(latent action model): https://huggingface.co/qwbu/univla-latent-action-model
一手源存档(sources/)
- univla—github-readme — GitHub README 快照(模型 zoo、训练流程、各 benchmark 复现脚本)
- univla—hf-card — HuggingFace 模型卡快照(univla-7b,确认 RSS 2025 发表)
- arXiv 原文 PDF(2505.06111)——不入 git,见上方原始链接