一句话定位

上海AI实验室(InternRobotics)把 internvla-a1 的三专家 Mixture-of-Transformers 简化为”VLM 主干 + 轻量统一专家”两模块,用一小撮可学习的 foresight token 向冻结的 WAN2.2-5B 视频生成模型查询未来潜变量(而不是自己从零学像素级生成),既保住 VLM 语义、又继承预训练视频模型的动力学先验,在六个仿真 benchmark 上全部拿到最优或次优、真实世界长时序化学实验任务成功率把 π0.5 从 29.3% 拉到 76.4%。

背景与定位

延续同实验室前作 internvla-a1 的统一模型路线——把语义理解、未来预测、动作生成缝进一个策略——但反思了 A1 一代(以及 UniUGP、BAGEL-VLA、MMaDA、Being-H0.7 等同类”统一模型”)共享的三个问题:(1) 一旦叠加沉重的生成/动作目标,理解模块常被挤出大规模 VQA/语言训练之外,预训练 VLM 骨干的语义逐渐漂移;(2) 回归未来视觉潜变量、flow-matching 动作预测、语言建模这几种形式和尺度都不同的目标联合训练时相互干扰;(3) 视觉预测模块通常从零训练重建未来状态,浪费了 wan-2-2 这类大规模预训练视频生成模型里已有的时空/动力学先验。

InternVLA-A1.5 的应对:VLM 主干在整个策略学习阶段持续做 VQA + 子任务预测 + 离散动作 token 训练(沿用 pi0-5 的配方),保住并强化语义与指令遵循能力;未来预测不再自己生成像素,而是重新表述为”隐变量查询”问题——一小组可学习的 foresight token 从共享多模态上下文里读出与任务相关的未来,投影进冻结的 wan-2-2 的 conditioning 空间,靠视频预测 loss 反传到 foresight token(WAN 本身参数不动)。这样策略”继承”了预训练视频生成模型的时空先验,却从未真正学会像素级生成;视频分支只在训练时用,推理时整个丢弃,不产生 genie-envisioner 之类”世界模型策略”在部署时逐帧想象的开销。对比基线覆盖 pi0pi0-5groot-n1groot-n1-5、Motus、LingBot-VA 等同期 VLA / Video-Action / World-Action 模型。

模型架构

Mixture-of-Transformers(MoT),两模块:(1) 预训练 VLM 主干负责多模态感知与推理;(2) 轻量统一专家(unified expert)与 VLM 共享同一套完整注意力层,但保持各自独立的线性注意力层,只在共享的 full-attention 层交换信息。

  • VLM 主干:Qwen-3.5 2B,混合注意力——每 3 层 gated-deltanet 线性注意力后接 1 层标准全注意力;VLM 与统一专家仅在这层全注意力上交互,各自保留独立的 Gated DeltaNet 层做模态特定处理。
  • 输入结构:每个时间步 $t$ 输入包含 $K$ 路视角观测 $o_t$、语言指令 $l$、控制模式 token $m\in{$<joint>, <end_effector>, <vqa>$}$,机器人本体状态 $q_t\in\mathbb{R}^D$($D\le32$,逐维均匀离散化成 256 bins,范围 $[-1,1]$)。图像走 Qwen3.5 视觉管线,编码为 <|vision_start|><|image_pad|><|vision_end|> token 块。
  • 离散动作通道(Stage1):动作 chunk 用 FAST tokenizerpi0-fast)编码为短 token 序列,动作词表大小 2048,直接拼进 VLM 原有词表,与语言 token 共享同一套 embedding 表和输出头;VQA 与机器人样本共用同一套 chat-template(prompt 拼图像块+指令+控制模式+离散状态,label 是子任务描述+FAST 动作段),只对 label 部分做 next-token 交叉熵。
  • 统一专家(Stage2 引入):与 VLM 主干同款混合架构(Qwen-3.5-Text),但隐藏维度更小,参数量 460M。输入两部分:
    • 50 个可学习 foresight token($Q^f\in\mathbb{R}^{M\times d}$,$M=50$):作为未来的隐变量查询,经统一专家的全注意力层关注共享多模态上下文,得到的输出嵌入 $Z_t^f$ 投影($P_{\mathrm{WAN}}$)进 冻结的 WAN2.2-5B 视频生成模型的 conditioning 空间,替换掉 WAN 原本的 T5 文本编码器,通过 WAN 原生 cross-attention 层注入;每个动作 chunk 均匀采样 N=4 帧未来视频作为预测目标,用标准 flow-matching 视频 loss 监督(WAN 参数冻结,梯度只经 conditioning 通路回传到 foresight token 和上游统一专家层)。
    • 动作 query token:紧随 foresight token 之后,经 flow matching 头解码为连续动作 chunk(chunk size = 50),动作头可以看到前面所有非动作 token(含 foresight token 的未来感知信号)。推理时从高斯噪声出发用 Euler 积分($K$ 步)求解学到的速度场。
  • 注意力掩码模式:VLM 部分(图像/指令/状态/子任务 token)沿用 Qwen3.5 原生因果注意力;统一专家内 foresight token 组与带噪动作嵌入组之间是跨组因果(foresight 看 VLM 上下文;动作嵌入看 VLM 上下文 + foresight),组内双向注意力(匹配 flow matching 整块并行去噪的非自回归特性)。训练时统一专家被显式屏蔽、看不到 FAST 动作 token 段,避免信息泄漏和两个动作分支之间的梯度干扰;统一专家的 position id 被安排成”紧跟在子任务段之后”而非”跟在 FAST 段之后”,保证训练/推理时位置布局一致。
  • 推理:不解码 FAST token;统一专家在去噪过程中复用 VLM 的 KV cache;视频生成分支完全丢弃,真实世界单张 NVIDIA RTX 5090、静态图执行 + SDPA + flash-linear-attention 库下,单步推理约 0.1s

数据

机器人操作语料:6 个来源(1 个合成 + 5 个真机),合计 1.2M episodes、861M frames(论文正文汇总数;逐源数字来自官方项目主页表格,与论文汇总数吻合):

来源类型EpisodesFrames采样权重
InternData-A1(internvla-a1 同源合成数据)仿真587,946395.9M0.20
agibot-world-colosseo(AgiBotWorld)真机112,988206.3M0.25
UMI真机377,018201.3M0.10
droid真机95,65827.6M0.15
galaxea-g0真机19,08525.0M0.20
robomind 1.0真机8,6385.4M0.10

所有来源统一映射进 InternVLA-A1 的动作空间,不同本体的 morphology-specific 槽位补齐到共享 layout,让每个 embodiment 共用一个动作头。每条 episode 同时供给三个监督信号:连续动作 chunk(flow matching)、未来帧(foresight token 的视频 loss)、FAST 离散化动作(VLM 的 stage1 目标)。

多模态协同训练数据(来自 internvla-m1 语料):约 3M 样本,四类:General QA 637K(图像描述/VQA/OCR/知识型 grounding,维持通用多模态能力)、Box QA 879K(指代检测)、Point QA 832K(自由空间/物体点定位)、Trajectory QA 684K(末端执行器路点预测);grounding 目标统一用绝对图像坐标的 QA 格式,与机器人子任务/FAST 目标共用同一个 next-token 目标。

采样策略:机器人来源在两个层级上不均衡——跨来源帧数差一个数量级以上(InternData-A1 的 395.9M 到 RoboMind 的 5.4M),源内子数据集又长尾。论文采用两级分组采样:组内子数据集按 $(#\mathrm{frames})^\gamma$ 概率采样($\gamma=1$ 即按帧数比例采样),组间权重先用 Re-Mix 算法得到再人工微调,结果是上调小体量真机来源(DROID、Galaxea、RoboMind 1.0)、下调占绝对帧数优势的合成来源。最终机器人语料与多模态语料按固定 0.15 : 0.85 比例混合,让每个 batch 里大部分数据仍服务于 VLM 的语义/grounding 能力,机器人流驱动动作与 foresight 学习。

训练方法

多阶段 pipeline

  1. Pretrain Stage 1(VLM Transferring):把机器人数据和 VQA 数据统一编码进同一 tokenized 格式,联合训练 VLM 预测问答答案 / 子任务 / 离散 FAST 动作 chunk;目标按 $\pi_\theta(\mathbf{a}{t:t+H},\hat\ell\mid o_t,\ell)=\pi\theta(\mathbf{a}{t:t+H}\mid o_t,\hat\ell),\pi\theta(\hat\ell\mid o_t,\ell)$ 分解,子任务预测在动作预测之前,自回归地把动作预测条件化在预测出的子任务上;训练目标是 label 部分标准交叉熵(VQA 样本动作项消失)。
  2. Pretrain Stage 2(Foresight and Action Generation):引入统一专家,做 MoT 联合注意力;引入上述 foresight-reasoning 机制;同时用 flow matching 训练连续动作预测(采样噪声 $\epsilon\sim\mathcal N(0,I)$、插值时间步 $\tau\sim\mathrm{Beta}(1.5,1.0)$,目标速度为 $\mathbf a_{t:t+H}-\epsilon$)。总目标 $\mathcal L_{\mathrm{stage2}}=\mathcal L_{\mathrm{stage1}}+\alpha\mathcal L_{\mathrm{video}}+\beta\mathcal L_{\mathrm{action}}$,论文取 α=1,β=10
  3. Post-train:与 Stage2 同配方,视频生成分支可选择性保持激活以在下游演示上继续微调 foresight token。

超参数(Table 1):AdamW;Stage1 恒定学习率 5e-5,训练 300K 步,batch 1024;Stage2 恒定学习率 5e-5,训练 600K 步,batch 1024;Post-train batch 128,学习率余弦衰减 5e-5 → 5e-660K 步;三阶段 warmup 均为 2000 步,weight decay 0.01,梯度裁剪 1.0bfloat16 精度;foresight token 数固定 50,动作 chunk 固定 50。RoboTwin 2.0 微调另有独立配置:100K 步 / 24 GPU / batch 16/GPU / 峰值学习率 1e-4 / 140K 步衰减(附录 A.2)。

Infra(训练 / 推理工程)

  • 预训练(Stage1/Stage2/Post-train)GPU 数、总卡时:未披露(论文只给出优化器/步数/批大小,无 GPU 型号与总卡时)。
  • 下游微调实例:RoboTwin 2.0 全量微调用 24 GPU,每卡 batch 16,训练 100K 步。
  • 推理:真实世界实验单张 NVIDIA RTX 5090;静态图执行(static-graph)+ SDPA + flash-linear-attention 库(gated-deltanet 同源实现),单步推理约 0.1s;视频生成分支完全丢弃于部署,因此没有 world-action 类模型在测试时逐步生成未来帧的秒级开销,支持实时闭环控制。
  • 精度:全程 bfloat16。

评测 benchmark

六个仿真 benchmark + 四个真实世界任务,主要对照基线为 pi0-5(各 benchmark 均有报告):

SimplerEnv(WidowX,视觉匹配成功率 %):InternVLA-A1.5 平均 80.8(最优),比 π0.5(57.1)高 23.7 点;4 个子任务 Put Spoon on Towel 92.4(次优,Xiaomi-Robotics-0 95.8 最优)、Put Carrot on Plate 85.4(最优)、Stack Green Block on Yellow Block 69.5、Put Eggplant in Yellow Basket 75.7。对比:π0 27.1、GR00T-N1.5 61.9、internvla-m1 71.7、EO-1 72.7、Xiaomi-Robotics-0 79.2(次优平均)。

RoboTwin 2.0(50 个双臂任务,clean / 随机化 / 平均,%):InternVLA-A1.5 93.3 / 93.0 / 93.2(平均最优,clean→randomized 几乎不掉点)。对比:π0 62.2、π0.5 79.8、LingBot-VLA 85.9、StarVLA 88.3、internvla-a1 89.5、Motus 87.8、LingBot-VA 92.2(次优平均)、Fast-WAM 91.8、Being-H0.7 89.9。

DOMINO(RoboTwin 基础上的动态操作,Level-1 clean,SR/MS %):InternVLA-A1.5 零样本(RoboTwin 微调 checkpoint 直接迁移)27.7 / 39.8(零样本最优),微调后 29.3 / 42.5(全表最优)。对比:OpenVLA-OFT 6.7/20.0、π0.5 7.5/20.4、LingBot-VLA w/depth 11.8/26.7、LingBot-VA 24.1/36.1、Qwen-VLA-Base 21.1/37.4、Qwen-VLA-Instruct 26.6/39.5(零样本次优)。

LIBERO(Spatial/Object/Goal/Long,平均 %):InternVLA-A1.5 98.6 / 99.8 / 98.6 / 98.4,平均 98.9(全表最优平均)。对比:π0 94.4、π0.5 96.9、GR00T-N1.7 97.0、OpenVLA-OFT 97.1、internvla-m1 95.9、Xiaomi-Robotics-0 98.7(次优平均)、Motus 97.7、LingBot-VA 98.5、Fast-WAM 97.6。

LIBERO-Plus(零样本,LIBERO checkpoint 直接评测,Camera/Robot/Language/Light/Background/Noise/Layout/Total %):InternVLA-A1.5 83.1 / 55.1 / 86.9 / 96.4 / 98.2 / 95.6 / 85.2 / 84.8(Total 最优,Background、Noise、Camera 单项也最优)。对比:π0 Total 53.6、π0.5 Total 84.4(次优)、StarVLA 74.1、Abot-M0 80.5、Cosmos-Policy 82.2。

EBench(室内移动操作,Val-Train / Val-Unseen / Test,SR/Score %):InternVLA-A1.5 43.1/54.1、32.8/46.4、35.2/49.5(三个 split 的 SR 均最优)。对比:π0 30.5/42.9,25.4/39.3,24.4/38.4;XVLA 28.3/42.1,22.7/35.9,24.7/37.5;internvla-a1 33.1/44.2,20.8/33.8,27.6/40.2;π0.5 32.1/48.1,26.5/42.9,29.5/45.6;LingBot-VA 38.3/55.9,26.6/43.3,30.9/47.6(多项次优)。

真实世界(单臂/双臂管子分拣与化学实验,与 π0.5、Motus 对比,成功率 %,NVIDIA RTX 5090)

  • Sort Tubes(15 试次/binding/setting):InternVLA-A1.5 75.9,π0.5 77.8(唯一落后 π0.5 的任务,因为该任务接近纯 pick-and-place,π0.5 本身已很强;但在held-out binding 上 InternVLA-A1.5 仍领先)。
  • Insert Tubes(15 试次/binding/setting):领先 π0.5 20.8 个百分点。
  • Move Tubes(16 试次/binding/setting):领先 π0.5 7.8 个百分点。
  • MOF(13 步长时序 MOF 化学合成流程,20 试次随机初始摆放):InternVLA-A1.5 76.4%,π0.5 仅 29.3%,Motus 0 次成功(未能完整走完流程)。
  • 三个指令跟随任务均设计了 held-out(arm, color/hole)组合(训练时不出现),用来排除”记住固定动作/固定颜色-手臂绑定”的捷径;在 held-out 组合上 InternVLA-A1.5 在三个任务上都是最优。

消融(Table 8,四个 zero-shot/微调 benchmark:LIBERO / LIBERO-Plus / RoboTwin / DOMINO)

  • 完整版:98.9 / 84.8 / 93.2 / 27.7
  • 去掉视频监督 loss:97.9 / 78.0 / 91.1 / 25.3(LIBERO-Plus、DOMINO 这类零样本泛化测试掉点最明显)
  • 去掉可学习 foresight token:98.6 / 77.9 / 90.2 / 23.8(同样零样本泛化掉点最大)

训练效率(定性,图示 SFT loss 曲线):在 RoboTwin 上用同一微调配置对比 π0.5、InternVLA-A1、InternVLA-A1.5,三者训练 60K 步(约 1.2 epoch),InternVLA-A1.5 收敛最快、最终 loss 最低;论文将其归因于预训练阶段学到的表示为下游 SFT 提供了更优的优化地形(无具体 loss 数值给出)。

世界模型利用度分析(定性):对冻结 WAN 模型在 foresight embedding 条件下做 $t\sim t+4$ 未来 rollout 可视化,能准确追踪精细铰接机器人运动,并在第二个例子里体现出对容器内液位变化等”环境状态改变类”因果效应的建模;即使在零样本场景下 rollout 依然时序连贯、物理合理。

创新点与影响

  • internvla-a1 一代”理解-生成-动作”三专家、生成专家从零学像素级未来预测的设计,简化为两模块 + “向冻结预训练视频模型查询隐变量”,用一个数量级更小的接口(50 个 token)继承 wan-2-2 的时空动力学先验,而不必付出学习像素生成的成本,也不给推理引入额外延迟(视频分支训练后即弃用)。
  • 沿用并印证 pi0-5 的经验:把机器人数据和 VQA 数据统一进同一套 chat-template / 同一套词表 / 同一个 next-token loss,能让训练更稳定,也更完整地把预训练 VLM 的语义与指令遵循能力迁移进策略。
  • 论文自陈的两条”教训”:(1) prompt 设计很重要——统一格式本身就是稳定性的来源;(2) 统一模型不需要从零学像素级生成也能吃到未来预测的好处——一小撮隐变量 token 足够编码动作学习需要的未来信息,策略只需学”该想象什么”,而预训练生成器已经知道”世界如何演化”。
  • 论文自陈的局限性:(1) foresight 监督的时间跨度只覆盖一个动作 chunk 的短视界,策略吸收的是局部动力学先验,尚不能对世界模型做长时序想象或显式规划;(2) 视频生成器保持冻结且通用,继承的先验因此受限于 WAN 预训练对具身场景覆盖程度的好坏。

原始链接

一手源存档(sources/)