一句话定位

阿里达摩院把 VLA 策略和世界模型塞进同一个 chameleon 权重里联合训练——不是”世界模型辅助 VLA”的两阶段套路,而是让同一组参数既能被问”下一步动作是什么”也能被问”下一帧长什么样”,在 libero 上不做任何预训练就拿到 97.4% 平均成功率,在真实 SO100 机械臂上世界模型联合训练把成功率从不到 30% 拉到 80% 以上。

背景与定位

范式:VLA 与世界模型的统一自回归框架(unified action-world model)。作者指出标准 VLA(如 openvlapi0)有三个根本缺陷——动作只在输出侧出现导致模型无法真正”理解”动作、不会想象动作执行后世界如何演变、缺乏对物理规律的显式建模;而世界模型(如 DreamGen)虽能预测未来观测却无法直接产生动作输出。RynnVLA-002 的解法是用同一个自回归 Transformer 同时建模两个方程:VLA 是 $a_t \sim \pi(a_t \mid l, s_{t-1}, o_{t-h:t})$,世界模型是 $\hat{o}t \sim f(o_t \mid o{t-h:t-1}, a_{t-h:t-1})$,混合两种数据训练出一个共享参数 $M_\psi$。

这是团队 WorldVLA(Cen et al., 2025,论文中引用为 cen2025worldvla,尚未见独立 arXiv 编号)的直接升级:WorldVLA 只把动作离散化后塞进统一词表做自回归生成,本作在此基础上新增了连续 Action Transformer 头、腕部相机输入/生成、以及本体状态(proprioceptive state)输入,并做了真实机器人验证。同一团队还有前作 RynnVLA-001(用生成式先验增强 VLA)。底座 chameleon 是 Meta 提出的图文统一理解生成模型;Action Transformer 头借鉴自 ACT(Zhao et al. 2023 的双臂低成本硬件模仿学习论文)的动作查询 + 并行解码机制。

模型架构

Policy backbone:初始化自 chameleon(GitHub 训练脚本里 tokenizer 路径指向 models--Alpha-VLLM--Lumina-mGPT-7B-768 快照,提示底座量级在 7B 附近;论文正文本身未直接给出参数量数字)。

四个独立 tokenizer,共享一张词表(词表大小 65536):

  • 图像 tokenizer:VQ-GAN,对人脸/显著物体区域加感知损失,压缩比 16,codebook 大小 8192;256×256 图像编成 256 个 token,512×512 图像编成 1024 个 token。
  • 文本 tokenizer:继承自 Chameleon 的 BPE。
  • 状态/动作 tokenizer:把本体状态和动作的每一维连续值按训练数据的取值范围离散化进 256 个 bin(做法同 openvla/RT-2)。
  • 连续动作(Action Transformer 输出)不做 token 化,直接回归原始值。

两条数据格式共用一个模型

  • VLA 序列:{text}{state}{image-front-wrist}×M{action}×K,文本指令固定模板”What action should the robot take to + + ?”,用离散动作 token 的交叉熵损失 $\mathcal{L}_{dis_action}$ 监督。
  • 世界模型序列:{text}{images-front-wrist}{action}{images-front-wrist} 重复 N 次,固定 prompt “Generate the next frame based on the current image and the action.”(无其他任务指令,因为动作已完全决定下一状态),用图像 token 交叉熵 $\mathcal{L}_{img}$ 监督。
  • 总损失(离散版):$\mathcal{L}{dis} = \mathcal{L}{dis_action} + \mathcal{L}_{img}$。

动作生成的两种机制(论文的核心创新点):

  1. 离散动作 + 专用注意力掩码:直接沿用因果掩码做连续多步动作自回归生成会导致误差累积(MLLM 预训练几乎没见过动作模态,泛化能力弱,后一步动作过度依赖前一步而非视觉输入)。作者为动作生成设计了一种掩码,让当前动作只能 attend 文本和图像 token、禁止 attend 之前生成的动作,从而让 chunk 内每个动作相对独立地生成,缓解误差传播;世界模型部分仍用常规因果掩码。
  2. 连续 Action Transformer 头:一个独立于主干 LLM 的小模块(借鉴 ACT),吃全部上下文(语言/图像/状态 token),用可学习的 action query 一次前向并行输出整段动作 chunk,L1 回归损失 $\mathcal{L}{conti_action}$ 监督,联合总损失 $\mathcal{L} = \mathcal{L}{dis} + \alpha \mathcal{L}_{conti}$,实验中 $\alpha=10$。离散自回归模型体量大、在有限真机数据上易过拟合,且掩码机制让 chunk 内动作”各自独立生成”缺乏轨迹连续性,导致真机上抖动明显;更紧凑的 Action Transformer 缓解了这两个问题。

输入配置:历史帧数 M=2;动作 chunk 长度 LIBERO-Long/Spatial 用 K=10,LIBERO-Object/Goal 用 K=5;世界模型单轮预测 N=1(为计算效率考虑)。真机相机为前视 + 腕部双视角,另叠加本体状态。

数据

LIBERO(仿真):4 个套件——Spatial(放碗到不同位置)、Object(物体识别抓取)、Goal(固定物体变任务目标)、Long(10 个长程复杂任务)。数据清洗沿用 openvla 的做法:剔除失败轨迹、过滤”无操作”(no-op)动作;用于世界模型评估的数据额外按 90% 训练 / 10% 验证切分。训练完全不做大规模机器人数据预训练,直接在 LIBERO 自身演示数据上从头训练。

真机(LeRobot SO100):自建数据集,人类遥操作专家演示。两个抓放任务:

  • “把方块放进圆圈”(248 条演示)——测基础物体检测和抓取执行;
  • “把草莓放进杯子”(249 条演示)——需要精细定位和抓取点预测。

对照基线 GR00T N1.5pi0 用官方预训练权重在同一 SO100 数据集上微调,微调 recipe 沿用各自官方代码库。

训练方法

单阶段联合训练:把 VLA 数据和世界模型数据混合喂给同一模型,不区分”先训世界模型再训 VLA”的顺序(默认设置),但论文单独做了一组”世界模型预训练”消融(见评测)。训练目标:

  • 离散路径:$\mathcal{L}{dis} = \mathcal{L}{dis_action} + \mathcal{L}_{img}$(动作 token 与图像 token 的交叉熵之和)。
  • 混合路径:额外加上连续 Action Transformer 的 L1 回归损失,$\mathcal{L} = \mathcal{L}{dis_action} + \mathcal{L}{img} + \alpha \mathcal{L}_{conti_action}$,$\alpha=10$。
  • 保留离散动作 token 训练(即便最终用连续头出动作):消融显示离散动作能加速连续动作生成的收敛,尤其在训练初期优势明显(Fig. 8),因此论文选择离散 + 连续混合训练而非只训连续头。
  • 动作掩码策略是训练期设计(非推理期 trick):只改变动作 token 之间的注意力可见性,不改变模型结构。

Infra(训练 / 推理工程)

训练:GPU 型号、GPU 数量、训练时长均未披露。

推理效率(Table 7,LIBERO,单位 Hz,数值为论文实测):

  • 离散、无 chunking、无腕部相机、无历史帧:2.50 Hz;
  • 离散 + 本文动作掩码 chunking(chunk=5/10 两栏频率相同,因为离散自回归耗时随生成动作数线性增长):3.69 Hz;
  • 离散 + chunking + 腕部相机 + 1 帧历史(最优离散配置):2.74 Hz;
  • 连续 Action Transformer、chunk=5:24.94 Hz(无腕部相机/历史)→ 7.75 Hz(加腕部相机+历史,最优真机配置);
  • 连续、chunk=10:48.20 Hz → 15.78 Hz(加腕部相机+历史)。

论文原话:连续动作因并行解码,频率几乎随 chunk size 线性提升(多生成几步动作代价几乎为零);离散自回归则不然,frequency 与 chunk size 基本无关,但 chunking 本身(相对于逐步生成)仍带来频率和成功率的双重提升。真机边缘硬件、具体延迟 ms 数未披露。

评测 benchmark

LIBERO(Table 1,四套件 Spatial/Object/Goal/Long/Average,均为成功率 %,均不做预训练)

  • RynnVLA-002-Discrete:94.2 / 96.8 / 94.6 / 87.6 / 93.3
  • RynnVLA-002-Continuous:99.0 / 99.8 / 96.4 / 94.4 / 97.4(四项中三项拿到当期最优或次优,整体超过预训练过的 OpenVLA-OFT(97.1,需预训练)、UniVLA(95.2,预训练)等强基线,也超过未预训练的 π₀-FAST(85.5)、FlowVLA(88.1)等。

真实 SO100 机器人(Table 2,成功率 %,10 次试验/任务)

  • “放方块进圆圈”:单目标 RynnVLA-002 90.0(与 GR00T N1.5 持平,略低于 pi0 的 100);多目标 90.0(GR00T 60.0,π₀ 70.0);带干扰物 80.0(GR00T/π₀ 均 50.0)——RynnVLA-002 在多目标/干扰场景下反超两个预训练基线 10–30 个百分点。
  • “草莓进杯子”:单目标 80.0(GR00T 50.0,π₀ 80.0);多目标 80.0(GR00T 50.0,π₀ 70.0);带干扰物 50.0(GR00T 70.0,π₀ 40.0)。

关键消融

  • 世界模型帮 VLA:离散动作在 LIBERO 上均值从 62.8%(无世界模型数据)→ 67.2%(混入世界模型数据;论文正文写”67.8%“,经四项子分均值 (73.1+88.0+80.2+27.3)/4=67.15 核对,判断正文数字为笔误,表格 67.2 为准);带掩码+chunking 的最终配置从 76.6% → 78.1%。连续动作从 91.6%(Line 2)→ 94.6%(Line 3),两处均与四项子分均值精确吻合。真机上更悬殊:无世界模型数据的模型成功率 <30%(Table 5 Line 4:30.0/10.0/0),加入世界模型数据后单目标/多目标场景冲到 80.0/80.0(带干扰物 50.0)。
  • VLA 帮世界模型(Table 6,视频生成质量,越低越好的 FVD/LPIPS,越高越好的 PSNR/SSIM):联合训练的 Action World Model 在 Object/Spatial/Long 三个套件的全部四项指标上都优于纯世界模型(如 Object 套件 FVD 1141.6→877.2,PSNR 20.31→22.18);Goal 套件上 FVD/SSIM/LPIPS 三项占优,仅 PSNR 纯世界模型略高(22.25 vs 22.13)。
  • 动作掩码消融(Fig. 6):chunk 变长时,vanilla 因果掩码自回归的成功率持续下降,本文掩码显著更稳;但 chunk 过长也会因策略调整不够及时而性能下降。
  • 腕部相机 + 本体状态消融:仿真中缺失二者仍有基本可用性能(Table 4 Line 1 均值 84.5),补上后提升到 97.4(Line 4);真机上(Table 5)缺腕部相机或本体状态时成功率直接归零——腕部相机提供夹爪-物体相对位姿的关键视觉反馈(尤其超出前视相机视野时),本体状态对精确把握”何时闭合夹爪/何时抬起物体”的时机至关重要。
  • 离散动作加速连续收敛(Fig. 8):保留离散 token 一起训练比单训连续头收敛更快、最终成功率更高,训练初期优势最明显。
  • 世界模型预训练消融(Table 8,冷启动 VLA 前先做世界模型预训练 vs 不做,4 项子任务):Goal/Object/Spatial/Long 从 67.3/82.9/77.8/23.0 提升到 73.1/84.0/79.8/30.2,全面提升。

创新点与影响

三点贡献(论文自述):(1) 提出 RynnVLA-002,在单一框架里统一 VLA 与世界模型;(2) 提出离散动作 chunk 生成的专用注意力掩码,解决自回归误差累积问题,并加入连续 Action Transformer 头提升泛化性与轨迹平滑度;(3) 实证验证世界模型与 VLA 相互增强——不做任何预训练即在 LIBERO 上拿到 97.4% 均分,真机上世界模型联合训练把成功率提升 50 个百分点量级。

论文坦承的局限(散见于方法与消融讨论,无独立 Limitations 小节):纯离散自回归动作模型在真机上因(a)大自回归架构在有限真机数据上易过拟合、(b)专用掩码让 chunk 内动作彼此独立生成、缺乏轨迹连续性而产生明显抖动,两个原因导致成功率骤降,是作者引入连续 Action Transformer 头的直接动机;动作 chunk 长度过长会削弱策略的及时调整能力,导致性能下降;真机验证仅覆盖 2 个简单抓放任务(单臂 SO100,每任务约 250 条演示、10 次试验评测),任务多样性和评测规模有限。

原始链接

一手源存档(sources/)

  • rynnvla-002—github-readme — GitHub README(模型库、四套件成功率/FVD 等指标、训练与推理流程)
  • rynnvla-002—hf-card — HuggingFace model card(与 GitHub README 内容一致)
  • arXiv 原文 HTML(arxiv.org/html/2511.17502v1,已读全文,不入 git,可用上方 arXiv 链接重新访问)