一句话定位

论文诊断当前 VLA(vision-language-action)模型常用的视觉表征——DINO 系的图像自监督特征、CLIP/SigLIP 系的图文对比特征——都不能同时提供「环境理解」(精确捕捉任务相关状态、丢弃无关噪声)和「策略先验」(预判成功执行下环境如何演化)两种知识;而 v-jepa-2 这类视频预测式表征恰好补上这一缺口。据此提出 JEPA-VLA:冻结 V-JEPA 2 编码器,用早期拼接或 Flamingo 式门控交叉注意力两种融合方式,把它作为额外条件注入现有 VLA,在 LIBERO、LIBERO-plus、RoboTwin2.0 和真实机械臂任务上取得 6–19 个百分点量级的成功率提升。

背景与定位

当前主流 VLA 建立在预训练 VLM 骨干之上(如 openvla-oft),但样本效率低、跨分布泛化差,论文将其归因于视觉骨干本身:DINO 家族的图像级自监督目标鼓励对增强变换的不变性(如随机裁剪),会削弱对物体位置等任务相关信息的敏感度;CLIP/SigLIP 的图文对比目标只强化指令里明确提到的实体语义,容易漏掉未被语言描述但仍与任务相关的线索(如障碍物);且两者都基于静态图像预训练,缺乏时序监督,无法编码「成功执行时环境如何演化」这种策略先验。论文转向 LeCun (2022) 提出的 JEPA 范式,具体采用在互联网规模视频上做掩码隐空间预测的 v-jepa-2,假设其预测目标天然会保留可预测的任务相关动态、丢弃不可预测的噪声因素。

方法定位上,JEPA-VLA 不是新的 VLA 架构,而是一个即插即用的表征注入模块——与显式感知模块、视觉思维链、3D/点云建模等提升 VLA 视觉理解的路线相比,论文强调自己「极简且通用」。相关工作还提到用视频生成模型直接做策略(video generation models as policies)这一路线,JEPA-VLA 则只取视频预训练的表征而非生成式目标,意在利用「只关注可预测部分、忽略不可预测细节」带来的效率优势。

模型架构

问题形式化:将操作任务建模为 POMDP $\langle\mathcal{S},\mathcal{O},\phi,\mathcal{A},p\rangle$,动作模型 $\pi_\theta$ 原本以 $a_t\sim\pi_\theta(a_t\mid l,o_{1:t}^{0:N},s_t)$ 生成动作($l$ 为语言指令,$o^{0:N}$ 为 $N$ 路相机的多视角观测,$s_t$ 为本体感知状态)。JEPA-VLA 额外引入冻结的 V-JEPA 2 编码器 $E_\phi$(ViT 骨干),把最近的视频片段 $o_{t-h:t}\in\mathbb{R}^{T\times H\times W\times 3}$ 映射为表征 $h_t\in\mathbb{R}^{N\times C}$($N$ 随时空分辨率 $H,W,T$ 变化),再让动作模型条件在 $h_t$ 上:$a_t\sim\pi_\theta(a_t\mid l,o_{1:t}^{0:N},s_t,h_t)$。实践中固定用最近两帧喂给 V-JEPA 2 编码器提取表征(正文与附录 E 训练细节均如此说明);V-JEPA 2 编码器本身在整个训练过程中保持冻结,不做微调。论文未说明主实验(LIBERO/LIBERO-plus/RoboTwin2.0/真实机械臂)具体用的 V-JEPA 2 checkpoint 尺寸;唯一明确给出规格的是 4.4 节 CortexBench 对比实验,用的是 V-JEPA 2 (ViT-L)

两种表征融合策略(Appendix B、Figure 4):

  • 早期拼接(Early Fusion):把 V-JEPA 2 表征当作额外输入 embedding,过一层线性投影对齐维度后直接与原 token 序列拼接。适用于没有大规模机器人操作预训练、策略基本从零学起的 VLA。论文的 “Basic VLA” 用此策略:VLM 骨干采用 Chameleon(仿照 WorldVLA 架构),动作离散化为 256 个 token,线性动作头做自回归预测。
  • 门控交叉注意力(Gated Fusion):受 Flamingo 启发,以原 VLA token 为 query、V-JEPA 2 表征为 key/value,按固定间隔(论文两个主实验均为每 8 层解码器插入一次)稀疏地插入门控交叉注意力层,用门控机制自适应控制预测嵌入的贡献,从而在已经过大规模机器人数据预训练的 VLA(如 OpenVLA-OFT)上避免朴素拼接改变输入分布、干扰已学到的先验。新引入融合层的学习率显著低于原 VLA 参数(LIBERO/RoboTwin2.0 上融合层 lr 取 $1\times10^{-5}$–$1\times10^{-4}$,原 OpenVLA-OFT 参数 lr 为 $5\times10^{-4}$)。

Mainstream VLA 实验具体沿用 OpenVLA-OFT 的一种标准配置:第三人称图像 + 语言指令输入、并行解码、动作分块(action chunking)、连续动作预测、$\ell_1$ 回归损失。

数据

  • libero(主评测):4 个任务套件(Spatial/Object/Goal/Long)各 10 个任务、每任务 50 条示教演示,共 2000 条。
  • LIBERO-plus:在 LIBERO 基础上引入相机视角、机器人本体、语言指令、光照、背景、噪声、场景布局等受控扰动维度,用于测泛化。
  • RoboTwin2.0:50 个任务、731 个物体实例(147 类),含域随机化(杂物、光照、背景、桌面高度、语言指令);实验采用 Aloha-AgileX 双臂设置,评测 6 个任务,训练用官方提供的每任务 50 条干净轨迹,评测同时覆盖 clean 与域随机化两种设置。
  • 真实世界任务(单臂 Piper 机械臂,pick-and-place):Appendix E 数据采集小节称人工采集 100 条演示轨迹用于训练 baseline 与 JEPA-VLA;正文 4.1 节另称额外用「五分之一子集(22 条轨迹)」训练以验证数据稀缺场景——100 的五分之一应为 20,与正文 22 存在轻微不一致,本页按原文两处数字如实并列,不强行调和。
  • CortexBench(4.4 节,广义 embodied AI 任务):官方基准共 17 个任务,论文因 VC-1 基线在部分任务上无法用公开代码稳定复现,只取能稳定复现 baseline 的 10 个代表性任务(MetaWorld 5 个:assembly / bin picking / button press / drawer open / hammer;DMControl 5 个:walker stand / walker walk / reacher easy / cheetah run / finger spin)做 V-JEPA 2 vs VC-1 对比。
  • Section 2 的表征分析实验用 LIBERO-10(LIBERO-Long 套件的 10 个任务)与 LIBERO-plus 的光照/背景扰动标签做回归/预测探针,训练/验证/测试按 8:1:1 切分。
  • 全文无仿真到真实的域适配数据、无跨具身混合训练数据;真实机械臂数据为单具身单任务的人工采集轨迹。

训练方法

表征分析探针(Section 2 / Appendix A):冻结视觉编码器,训练轻量 ViT 头做三类探针——(1) 任务相关状态回归:用最近两帧表征预测机械臂与任务物体的状态(MSE);(2) 任务无关状态回归:仅用首帧表征回归光照/背景等扰动参数(光照另加 [CLS] token 头,背景用线性上采样头 + MAE 重建损失);(3) 任务相关状态预测(策略先验探针):预测当前状态与 10 步之后状态的残差,以规避帧间状态变化过细的问题。探针头统一超参:12 层 decoder、16 个注意力头、FFN 维度 3072、dropout 0.1、AdamW、lr $1\times10^{-4}$、weight decay $1\times10^{-5}$、batch size 32、最多训练 100 epoch,验证损失 10 epoch 不下降即早停,取验证损失最低的 checkpoint 做测试。

JEPA-VLA 主训练

  • Basic VLA(LIBERO / LIBERO-plus / 真实世界,早期拼接):仅用 1/10 的 LIBERO 数据做实验性验证;batch size 16,训练 40 epoch。
  • OpenVLA-OFT(LIBERO / RoboTwin2.0,门控交叉注意力):LIBERO 上 batch size 16、训练 150k 步(沿用官方 schedule);RoboTwin2.0 上 batch size 8、约训练 100k 步;融合层 lr 显著低于原 VLA 参数(见「模型架构」节)。
  • 真实世界任务:动作分块大小 10,学习率 $5\times10^{-6}$,batch size 32,训练 30 epoch。
  • 推理阶段沿用 WorldVLA 提出的注意力掩码机制(阻止动作 token 关注未来动作),从而支持并行解码,并在连续动作之间插值以获得平滑轨迹。
  • 全程为模仿学习/行为克隆,无 RL、无蒸馏;动作 tokenization 因基座不同而异——Basic VLA 用 256-token 离散化,OpenVLA-OFT 路线用连续动作 + $\ell_1$ 回归。

Infra(训练 / 推理工程)

论文全文未披露训练所用 GPU 型号、数量、总 GPU-hours、并行策略与训练精度(bf16/fp16/fp32 均未提及)——训练细节只给到 batch size、步数/epoch 数、学习率这一层级。推理侧同样未给出 FPS、control-Hz 或端到端延迟数字;唯一涉及推理工程的信息是真实机械臂评测中启用了「并行解码 + 动作插值」以加速评测(见「训练方法」),没有量化的速度或延迟指标。真实世界评测每个设置跑 10 次独立试验。边缘硬件、部署环境均未披露。

评测 benchmark

Section 2 表征分析(Finding 1–3,定性结论,论文未给出具体 MSE 数字表格,以柱状图呈现):V-JEPA 2 在任务相关状态回归、任务相关状态预测(10 步残差)上的 MSE 均低于 DINOv2 与 SigLIP;在任务无关(光照/背景)回归上误差反而更高——即更不擅长编码任务无关信息,恰是期望的「筛选」效果。

Table 1 — LIBERO,Basic VLA(仅用 1/10 LIBERO 数据),成功率(%)

SpatialObjectGoalLongAverage
Baseline58.274.887.825.861.65
w/ ours69.278.287.841.069.05
Δ+11.0+3.40.0+15.2+7.40

Table 2 — LIBERO-plus,Basic VLA,成功率(%)

CameraRobotLanguageLightBackgroundNoiseLayoutTotal
WorldVLA(官方)0.127.941.643.717.110.938.025.0
Baseline(本文复现)0.120.843.926.310.14.126.918.9
w/ ours0.425.754.438.023.94.132.825.6
Δ(对 baseline)+0.3+4.9+10.5+11.7+13.80.0+5.9+6.7

论文强调:仅用 1/10 动作模型数据、且不依赖任何世界模型训练数据,JEPA-VLA 在 LIBERO-plus 总分上已反超使用完整数据训练的官方 WorldVLA。

Table 3 — LIBERO,Mainstream VLA(OpenVLA-OFT),成功率(%)

SpatialObjectGoalLongAverage
OpenVLA-OFT(官方论文数字)96.298.396.290.795.35
OpenVLA-OFT(本文复现 baseline)84.491.895.289.890.30
w/ ours97.298.095.694.896.40
Δ(对本文 baseline)+12.8+6.2+0.4+5.0+6.10

Table 4 — RoboTwin2.0,Mainstream VLA,6 任务 Easy/Hard 成功率(%),平均:baseline Easy 54.8 / Hard 9.3;Ours Easy 73.5 / Hard 17.7;Δ Easy +18.7 / Hard +8.4。单任务里 Beat Block Hammer 提升最大(Easy 18.0→65.0,+47.0;Hard 0.0→13.0,+13.0),Place Fan 在 Hard 上两者均为 0.0(唯一未见提升的子项)。

Table 5 — 真实世界(拾取黄色碗放入盘子),成功率(%):baseline 平均 50.0(layout 0.0 / light 0.0);w/ ours 用 1/5 数据平均 60.0(layout 33.3 / light 66.7);w/ ours 用全量数据平均 80.0(layout 100.0 / light 100.0)——仅用 1/5 数据已超过用全量数据训练的 baseline。

Table 6 — CortexBench(10 个代表任务):MetaWorld 成功率均值,CLIP(ViT-B)75.5、VC-1(ViT-L)88.8、V-JEPA 2(ViT-L)90.4;DMControl episode reward 均值,VC-1(ViT-L)536.0、V-JEPA 2(ViT-L)583.8

Table 7 — LIBERO-Long,视觉表征替换消融,成功率(%):Baseline 25.8;Baseline+DINOv2 26.0;第二行同样标注为「Baseline+DINOv2」但数值为 31.2(与上一行标签重复,疑似原文表格排版/宏定义错误,本页按原文数字如实记录,不代为修正);Baseline+SigLIP 33.6;Baseline+V-JEPA 2 41.0(最优)。论文据此指出直接替换 DINOv2 收益边际甚至为负,SigLIP 只有小幅提升,唯有 V-JEPA 2 带来显著更大的增益。

创新点与影响

  • 贡献:把「环境理解」与「策略先验」明确拆解为 VLA 视觉表征必须同时满足的两种知识,并用三组对照探针(任务相关/无关状态回归 + 状态残差预测)定量论证 DINO/CLIP/SigLIP 系表征在这两个维度上均有欠缺,而视频预测式的 V-JEPA 2 同时满足;进而给出一个不改动 VLA 主体架构、只需额外融合层的即插即用注入方案(早期拼接 / 门控交叉注意力二选一),在 4 类基准(LIBERO、LIBERO-plus、RoboTwin2.0、真实机械臂)和 2 种不同预训练程度的 VLA 骨干(Basic VLA、OpenVLA-OFT)上都取得一致提升。
  • 改变了什么:提供了明确证据表明「视觉骨干选型」本身是 VLA 泛化与样本效率的关键瓶颈,而非只能靠更多机器人轨迹数据或更复杂的动作头设计来解决;门控交叉注意力 + 低学习率的融合设计为「如何在不破坏大规模机器人预训练先验的前提下注入外部表征」给出了一个可复用的工程模式。真实世界实验显示 1/5 数据即可反超全量数据训练的 baseline,提示这类表征注入对数据稀缺场景尤其有价值。
  • 论文自陈的局限:Conclusion 部分明确指出当前只探索了一种「简单的融合策略」,更系统的融合机制仍待探索;CortexBench 对比因 VC-1 基线在公开代码下无法在全部 17 个任务上稳定复现,被迫把评测范围收窄到 10 个任务,这是评测覆盖面上的自我承认限制。此外,论文没有披露任何算力/GPU 细节,也未公开代码或模型权重,可复现性目前无法独立核实;真实世界数据规模的两处描述(100 条总量 vs 1/5 子集=22 条)存在原文内部不一致(见「数据」节)。

原始链接

一手源存档(sources/)

  • 未找到官方博客 / GitHub / HuggingFace / 项目主页(论文正文与 arXiv 页面均未提供代码或模型发布链接),故本条目无 sources/ 快照可归档。
  • 全文以 arXiv HTML(v1)通读,原文不入 git,见上方 arXiv 链接。