一句话定位

阿里达摩院把动作模型和世界模型塞进同一个自回归 Transformer、共享同一张 token 词表,让”预测下一步动作”和”预测下一帧图像”这两个任务在训练时互相监督——不额外加数据、不额外做大规模机器人预训练,仅靠这种架构合并就在 libero 上把同骨架的离散动作模型(openvla)从 76.5% 平均成功率拉到 79.1%~81.8%,并顺手发现”多动作并行解码”在自回归模型里会因误差累积而崩掉、需要专门设计的注意力掩码来救。

背景与定位

范式:统一自回归动作-世界模型(unified autoregressive action-world model),是”用同一套离散 token 词表把图像/文本/动作全部塞进一个 LLM 做自回归生成”这条路线(源头是 Meta 的 chameleon)在具身智能上的落地。论文把已有工作分成三类并列了一张对照表:动作模型(如 openvlapi0,输入文本+视频、只输出动作);视频预测模型(如 MAGVIT、SVD,输入文本+视频、输出视频,不看动作);世界模型(如 iVideoGPT、DWS,输入文本+视频+动作、输出视频,但不能直接产生动作)。WorldVLA 把自己定位成第四类——“动作世界模型”,输入文本+视频+动作、同时输出视频和动作,与同期的 Unified Video Action Model(UVA,用两个独立扩散头分别出图像和动作)形成路线对照:UVA 是”扩散头 + 分离”,WorldVLA 是”离散 token + 统一自回归”。

作者指出两类模型各自的根本缺陷:VLA 模型里动作只出现在输出侧、模型从未把动作当输入去”理解”过;世界模型虽然能吃动作、预测物理演变,却没有输出动作的能力,存在功能缺口。WorldVLA 的解法是用同一个 Chameleon 初始化的自回归 Transformer 同时建模两个方程:动作模型 $a_t=\pi_\theta(a_t\mid o_{t-h:t},l)$,世界模型 $o_t=f_\phi(o_t\mid o_{t-h:t-1},a_{t-h:t-1})$,混合两种训练数据得到共享参数的统一模型 $M_\psi$。这是该团队后续 RynnVLA-002(2025-11,同一 GitHub 仓库已直接升级改名)的前作——RynnVLA-002 在 WorldVLA 基础上新增连续 Action Transformer 头、腕部相机输入/生成、本体状态输入,并补了真实机器人(SO100)验证;同团队还有 RynnVLA-001(2025-09,用生成式先验增强 VLA)。基线对比对象包括连续动作路线的 Diffusion PolicyOcto、DiT Policy、Seer、OpenVLA-OFT,以及离散动作路线里骨架完全相同的 OpenVLA

模型架构

Backbone:从 Chameleon(Team, 2024)初始化,三种模态(图像/文本/动作)共享同一张自回归 Transformer 与同一张词表。GitHub 训练脚本里 tokenizer 路径指向 Alpha-VLLM/Lumina-mGPT-7B-768 快照,提示骨架量级在 7B 附近;论文正文本身未直接给出参数量数字。

三套独立 tokenizer,共享一张词表(大小 65,536)

  • 图像 tokenizer:VQ-GAN(Esser et al., 2021),对人脸、显著物体等区域加感知损失(做法沿用 Make-A-Scene);压缩比 16,codebook 大小 8192。256×256 图像编成 256 个 token,512×512 图像编成 1024 个 token
  • 动作 tokenizer:把连续机器人动作的每一维按训练数据的取值范围离散化进 256 个 bin(做法同 OpenVLA/RT-2)。动作表示为 7 个 token:3 个相对位置 + 3 个相对角度 + 1 个绝对夹爪开合状态。
  • 文本 tokenizer:训练的 BPE,词表 65,536,其中包含上述 8192 个图像 token 和 256 个动作 token。

所有文本、动作、图像统一离散化为 token,在自回归框架下联合训练。

ACTION-conditioning / 序列格式

  • 动作模型序列:[BOS]{text}[BOI]{image}…{image}[EOI]×M [BOA]{action}…{action}[EOA]×K[EOS],只对动作 token 段计算损失 $\mathcal{L}_{action}$;text 提示词固定为”What action should the robot take to + 任务指令 + ?”。
  • 世界模型序列:[BOS]{text}[BOI]{image}[EOI][BOA]{action}[EOA][EOS] [BOI]{image}[EOI][EOS]重复 N 次,只对生成的图像 token 段计算损失 $\mathcal{L}_{world}$;世界模型不需要任务指令(动作本身已能决定下一状态),text 固定为”Generate the next frame based on the current image and the action.”。

注意力掩码(核心设计):标准因果掩码(a)在生成多个连续动作(action chunk)时会让后一个动作过度依赖前一个已生成动作、而不是视觉输入本身——因为预训练 MLLM 几乎没见过动作模态、泛化能力弱,导致误差逐步累积、成功率随 chunk 变长而下滑。论文提出的动作专属掩码(b)让当前动作的生成只能看文本和图像输入、屏蔽掉之前生成的动作 token,从而把多动作生成变成可并行的过程,思路上呼应 OpenVLA-OFT、$\pi_0$ 的并行解码。世界模型部分(c)仍用常规因果掩码。

记忆/一致性:动作模型默认输入 M=2 帧历史图像观测;世界模型为控制计算量,单轮只预测 N=1 帧未来图像(即一步式而非多步 rollout)。

跨本体:论文未做跨本体实验,仅在 LIBERO 单一模拟环境的机械臂上验证。

数据

  • 数据集:LIBERO 基准的四个子集——LIBERO-Spatial、LIBERO-Object、LIBERO-Goal、LIBERO-Long(另有 LIBERO-90 用于该基准本身的预训练,论文未使用)。
  • 预处理:参照 OpenVLA 做法,过滤掉未成功的轨迹和 no-op(无操作)动作
  • 训练/验证切分:因为世界模型评测需要图像-动作严格配对的 ground truth,90% 轨迹作训练集、10% 作验证集;唯一例外是主结果表(Table 2)为了和基线公平比较,使用全部可用数据训练
  • 数据混合:同一批 LIBERO 轨迹被分别转换成”动作模型数据”(text+image→action)和”世界模型数据”(image+action→image)两种格式混合训练,无额外网络规模数据或跨任务预训练语料;Chameleon 骨架本身继承的图文预训练是唯一的”先验知识”来源。
  • Table 2 中 WorldVLA 的 Pretraining 列标记为 (不同于 Octo、DiT Policy、OpenVLA、OpenVLA-OFT 等基线在大规模机器人数据上做过预训练),即结果是在没有额外机器人规模预训练的情况下取得的。

训练方法

  • 目标函数:$\mathcal{L}=\mathcal{L}{action}+\alpha\mathcal{L}{world}$,两项都是交叉熵损失;因为图像 token 数量(256/1024)远多于动作 token(7 个),用 α=0.04 下调世界模型损失权重,避免图像重建损失淹没动作损失。
  • 默认配置:历史图像数 M=2;动作 chunk 大小 K=10(LIBERO-Long)/ K=5(其余三个 LIBERO 子集);世界模型预测轮数 N=1
  • 注意力掩码训练策略:动作模型分支训练时使用”屏蔽历史动作、只保留视觉/文本可见”的专属掩码(见”模型架构”),世界模型分支保持标准因果掩码,两者共享同一套模型权重、在同一次前向/反向传播中混合优化。
  • 两种消融路线:①直接用动作+世界模型混合数据从 Chameleon 权重联合训练(主方法);②先用纯世界模型数据训练,把得到的权重作为动作模型的预训练起点再微调(Table 6),后者比”无世界模型预训练”平均成功率高 4 个百分点(62.8%→66.8%)。
  • 训练/推理数据格式、tokenize 脚本细节写在 GitHub 仓库的 libero_util/data 目录下(Pretokenize 与 NoPretokenize 两条流水线,论文本身未展开这部分工程细节)。

Infra(训练 / 推理工程)

  • 训练所用 GPU 数量、GPU-hours、并行策略(TP/PP/ZeRO)、训练精度(fp16/bf16):论文正文均未披露,仅给出 batch/学习率之外的算法超参(M、K、N、α)。
  • 推理速度(FPS):论文 Table 5 给出了不同历史图像输入长度、是否使用动作 chunking 组合下的控制回路 FPS——
    • 1 帧历史:不加 chunking SR 58.4% / FPS 2.27;加 chunking SR 74.0% / FPS 3.67
    • 2 帧历史(默认配置):不加 chunking SR 67.3% / FPS 1.77;加 chunking SR 84.4% / FPS 3.13
    • 4 帧历史:不加 chunking SR 78.7% / FPS 1.22;加 chunking SR 84.7% / FPS 2.78 可见动作 chunking(一次生成多个动作、减少自回归前向次数)能把控制频率提升 60%~130%,但具体测试用的 GPU/硬件型号论文未注明。
  • 边缘设备部署:未涉及。

评测 benchmark

主结果(Table 2,LIBERO,discrete action 类别,含 Spatial/Object/Goal/Long 四子集 SR% 及平均)

  • OpenVLA(有预训练):Spatial 84.7 / Object 88.4 / Goal 79.2 / Long 53.7 / 平均 76.5
  • WorldVLA(256×256,无预训练):Spatial 85.6 / Object 89.0 / Goal 82.6 / Long 59.0 / 平均 79.1
  • WorldVLA(512×512,无预训练):Spatial 87.6 / Object 96.2 / Goal 83.4 / Long 60.0 / 平均 81.8

同表列出的连续动作模型基线(非同类直接对比,仅供参照):Diffusion Policy 72.4、Octo 75.1、DiT Policy 82.4、Seer(预训练)Long 87.7、OpenVLA-OFT(预训练)95.4、UVA(无预训练)Long 93.0——说明 WorldVLA 在离散 token 路线内跑赢同骨架 OpenVLA,但仍落后于专门优化过的连续动作/并行解码模型(OpenVLA-OFT)。论文将 512 分辨率优于 256 归因于 Chameleon 骨架的图像 tokenizer 和 LLM 本身就是在 512×512 上预训练/优化的,分辨率提升也直接带来抓取任务所需的细节精度。

世界模型与动作模型互相增益的消融(Table 3,四子集 SR% + 平均)

  • 仅动作模型(无 chunking):Goal 67.3 / Object 82.9 / Spatial 77.8 / Long 23.0 / 平均 62.8
  • 动作模型+世界模型(无 chunking):Goal 73.1 / Object 88.0 / Spatial 80.2 / Long 27.3 / 平均 67.2(比上一行平均 +4.4pp,对应摘要所称”提升 4% 抓取成功率”)
  • 动作模型+朴素 chunking(默认因果掩码,无世界模型):Goal 79.6 / Object 82.9 / Spatial 36.7 / Long 16.9 / 平均 54.0(可见 Spatial/Long 因误差累积严重崩溃)
  • 动作模型+chunking+本文注意力掩码(无世界模型):Goal 84.4 / Object 90.9 / Spatial 81.8 / Long 49.3 / 平均 76.6(相比上一行大幅回升)
  • 完整 WorldVLA(动作+世界模型+chunking+本文掩码):Goal 85.1 / Object 90.9 / Spatial 84.0 / Long 52.4 / 平均 78.1(全部四项里最优)

世界模型生成质量(Table 4,FVD↓/PSNR↑/SSIM↑/LPIPS↓,10 帧与 50 帧 rollout)

  • 10 帧:World Model FVD 250.0/PSNR 29.62/SSIM 90.73/LPIPS 11.97;Action World Model FVD 255.1/PSNR 29.77/SSIM 90.40/LPIPS 11.94(短程二者接近)
  • 50 帧(长程更能体现差异):World Model FVD 718.6/PSNR 23.98/SSIM 83.41/LPIPS 15.60;Action World Model FVD 674.1/PSNR 24.30/SSIM 83.55/LPIPS 15.44(动作模型联合训练在长 rollout 上全面优于纯世界模型)。摘要中”FVD 降低约 10%“的表述与这里 50 帧数值(718.6→674.1,约 -6.2%)量级一致但不完全吻合,论文未给出更细的加权口径,此处以 Table 4 实测数字为准。

世界模型 vs. 纯视频预测模型(无动作条件,Fig. 7,仅文字描述无表格数值):论文指出”世界模型在全部评测任务上都提升动作模型表现”,而”视频预测模型在两个任务上有正面效果、在一个任务上有负面效果”——因为没有动作输入时下一帧本质上是欠定的(同一起始帧可能对应多个合理的未来),训练时引入噪声。

动作 chunking 长度消融(Fig. 6,仅图,无表格数值):朴素自回归下 chunk 越长成功率越低;本文掩码显著缓解该趋势,但 chunk 过长时机器人无法及时根据新观测调整策略,性能仍会下降——论文未给出该图的具体数字,仅描述趋势。

历史图像输入长度消融:见上方 Infra 节 Table 5,2 帧输入已能让性能接近饱和,是精度与算力的最优折衷,故设为默认配置。

世界模型预训练消融(Table 6):不用世界模型预训练:Goal 67.3/Object 82.9/Spatial 77.8/Long 23.0/平均 62.8;用世界模型预训练:Goal 73.1/Object 84.0/Spatial 79.8/Long 30.2/平均 66.8(+4pp)。

创新点与影响

  • 贡献:①提出 WorldVLA,把动作模型和世界模型统一进同一个离散 token、自回归 Transformer 框架,验证了二者互相增益——世界模型学到的物理/状态转移先验帮助动作生成,动作生成过程又反过来提升世界模型对视觉/行为模式的理解;②发现并解决了自回归动作 chunk 生成中的误差累积问题,提出一个只需要改注意力掩码、无需额外参数的简单方案。
  • 影响:该团队随后把这套框架升级为 RynnVLA-002(2025-11,同仓库直接改名),补上了连续 Action Transformer 头、腕部相机、本体状态输入与真实机器人验证,说明 WorldVLA 提出的”统一动作-世界模型”框架具备可扩展性,不是一次性实验。
  • 作者自陈的局限(Conclusion 部分原文):①数据和模型规模的进一步扩展是未来方向,当前实验只在 LIBERO 单一仿真基准、无额外机器人规模预训练数据上验证;②当前图像 tokenizer(VQ-GAN 离散表示)在感知表达力上有限,设计一个能同时兼顾理解与高质量生成的统一 tokenizer 是重要改进方向;③加一个辅助动作头(auxiliary action head)是另一个可能提升抓取性能的策略——这几点后续在 RynnVLA-002 中部分得到了回应(连续 Action Transformer 头、真实机器人)。

原始链接

一手源存档(sources/)

  • worldvla—github-readme — GitHub README 快照(当前状态,仓库已演变为 RynnVLA-002,含 WorldVLA 时期共享的 Chameleon/Lumina-mGPT 起点权重下载说明与 LIBERO 数据流水线)
  • arXiv 论文全文(2506.21539)——已读全文(HTML arxiv.org/html/2506.21539v1),按规范不入 git,见上方原始链接直接访问或重下