一句话定位

上海AI实验室提出的 VLA 模型 InternVLA-A1:用 Mixture-of-Transformers 把”理解专家(MLLM)+ 生成专家(预测未来帧的世界模型)+ 动作专家(flow matching)“绑进同一个模型、共享一套 masked self-attention,让动作预测能”参考”对未来场景的想象,在传送带分拣、运动中拣配料等高动态场景上比 π0、GR00T N1.5 高出 40%~73.3 个百分点。

背景与定位

主流 VLA(如 pi0groot-n1)把视觉映射进文本特征空间,语义理解强但难以建模物理动力学(动量、惯性、接触),在传送带一类动态场景上就露怯;另一条路是 genie-envisioner、VPP 这类基于视频预测的世界模型式方法,能”想象”未来但语义 grounding 弱、对预测误差敏感。InternVLA-A1 想把两者缝合:既有 MLLM 的语义理解,又有世界模型式的动力学预见。

架构上延续同实验室前作 internvla-m1 的谱系,直接的方法学前身是团队自己的 $\mathcal{F}_1$(用 next-resolution 范式做视觉前瞻,但需要多次迭代前向、拖累实时推理)——InternVLA-A1 转向一次性预测未来帧潜变量的更激进设计以换取速度。数据侧延续团队自己的合成数据集 InternData-A1(robotwin-2 之外另一条”仿真规模化”路线的证据)与开源真机数据 agibot-world-colosseo(AgiBot World)做混合预训练,对标基线为 pi0 与 GR00T N1.5(groot-n1-5)。

模型架构

Mixture-of-Transformers(MoT),三个 decoder-only transformer 专家 + 统一 masked self-attention,信息流强制单向:理解 → 生成 → 动作(后面的 block 可看前面,前面看不到后面;理解 block 内部双向,生成 block 内部双向)。

  • 理解专家(Understanding Expert):直接采用 MLLM 骨干——2B 版用 InternVL3(0.94B),3B 版用 Qwen3-VL(2.13B)。多视角观测 $o_t$ 经视觉编码器转视觉 token,语言指令 $l$ 转文本 token,拼成前缀 $h_{\mathrm{und}}=f_{\mathrm{und}}(l,o_t)$,作为下游专家的条件(推理时缓存为 K/V)。
  • 生成专家(Generation Expert):受 Janus-Pro(janus-pro)启发采用解耦视觉编码——理解用 ViT 语义特征,生成用 VAE 保细节。具体用 Cosmos CI8×8 连续 VAE tokenizercosmos-predict 系列)把 256×256 输入图编码成 32×32 潜变量,再用卷积压到 4×4(每帧仅 16 个 token)投影进 transformer 隐维;给定历史帧 $z_{t-m}$ 与当前帧 $z_t$ 的潜变量,经多层 masked self-attention 关注理解前缀 $h_{\mathrm{und}}$,池化预测未来帧潜变量 $\hat z_{t+m}$,再经反卷积 + Cosmos 解码器重建图像。间隔 $m=15$(帧)。
  • 动作专家(Action Expert):以语言目标 $l$、当前观测前缀 $h_{\mathrm{und}}$、本体状态 $q_t$、生成专家预测的 $\hat z_{t+m}$ 为条件,用 flow matching 预测动作 chunk $\hat a_{t:t+k}$;动作 block 内部拆成状态 token(只看自己和更早 block)与动作 token(互看 + 看状态 token)。采样 $\tau \sim \mathrm{Beta}(1.5, 1.0)$,Euler 法迭代求解 ODE。
  • 两档参数规模(Table 1,均 bfloat16):
变体总参数理解专家生成专家动作专家FPS(RTX 4090,torch.compile)
InternVLA-A1 (2B)1.8BInternVL3 (0.94B, 448×448 输入)Qwen2.5 (0.36B)Qwen2.5 (0.36B)~13 Hz
InternVLA-A1 (3B)3.2BQwen3-VL (2.13B, 224×224 输入)Qwen3 (0.44B)Qwen3 (0.44B)~13 Hz

2B 版参数更少但推理并不更快——因为 InternVL3 骨干需要更高输入分辨率(448×448 对 224×224),更长视觉 token 序列抵消了参数量优势。生成/动作专家的 transformer block 直接取自对应理解专家的底层 LLM(InternVL3 用 Qwen2.5,Qwen3-VL 用 Qwen3)。

数据

预训练总量 >533M 帧(论文摘要),来自”数据金字塔”三层:

  1. 合成仿真数据 InternData-A1(团队自家前作数据集):630k+ 轨迹、7,433 小时,覆盖 4 种本体(Genie-1、Franka、ARX Lift-2、AgileX)、18 种技能、70 个任务、227 个场景,含刚体/铰接体/可变形体/流体操作;由高度自动化、完全解耦、可组合的仿真流水线生成。
  2. 开源真机数据 agibot-world-colosseo(AgiBot-World):100 万+轨迹,217 个任务,覆盖家居/零售/工业/餐饮/办公 5 大场景域。
  3. 专项真机数据:小规模、任务导向的遥操作数据,用于 post-training 阶段针对具体部署场景校准。

预训练数据配比(Table 3,按帧数):

数据源帧数占比
InternData-A1 (ARX Lift-2)96M0.18
InternData-A1 (AgileX)122.5M0.23
InternData-A1 (Franka)90.5M0.17
InternData-A1 (Genie-1)16M0.03
AgiBot-World (Beta)208M0.39

合计 533M 帧,与摘要数字吻合。消融显示:InternData-A1 单独预训练已能匹配/超过纯真机数据基线,且在 RoboTwin 仿真评测上单独用它比混合更强(跨本体多样性 + sim-to-sim 无域差);混合预训练在真机任务(尤其精细操作,如 Sort Parts 提升约 20%)上收益最大——证实”仿真多样性 + 真机物理保真度”互补。

工程侧提出 LPT(Load-balanced Parallel Training):把异质数据集贪心分配给 workers(按数据量降序、每次分给当前负载最小的 worker),解决单 worker 装不下全量混合数据集导致 OOM、以及数据集规模差异带来的隐性重加权问题;worker 数多于数据集数时允许受控复制(独立随机种子)以避免空闲。

限制:论文正文未披露具体训练 batch 内各来源的采样权重曲线(只给静态帧比例),也未提及 egocentric 人类视频作为预训练数据源——虽然官方项目主页文案提到”human videos”作为联合训练数据来源之一,但正文 Data Corpus 一节及 Table 3 并未列出对应数据集或数字,本页不采信该未见量化的说法。

训练方法

两阶段:预训练 + 后训练,共享统一优化目标(Eq. 4):

$$\mathcal{L}{\mathrm{total}} = \lambda \cdot \mathcal{L}{\mathrm{gen}} + \mathcal{L}_{\mathrm{action}}, \quad \lambda=0.01$$

  • 视觉前瞻生成损失(Eq. 1):$\mathcal{L}{\mathrm{gen}} = \mathbb{E}\big[|f{\mathrm{gen}}(z_{t-m}, z_t; h_{\mathrm{und}}) - \mathrm{sg}[z_{t+m}]|^2\big]$ —— MSE 回归未来帧 Cosmos 潜变量,监督信号($z_{t+m}$)来自冻结的 Cosmos 编码器、stop-gradient。
  • flow matching 动作损失(Eq. 2):对插值动作 $a^\tau_{t:t+k} = (1-\tau)\epsilon + \tau a_{t:t+k}$($\tau \sim \mathrm{Beta}(1.5,1.0)$,$\epsilon \sim \mathcal{N}(0,I)$)回归速度场 $v_\theta$。

超参数(Table 2)

配置预训练后训练
OptimizerAdamWAdamW
Batch size512128
LR5e-5(constant)5e-5 → 5e-6
Warmup / Decay steps2,000 / 60,000
Training steps700K60,000
Betas(0.9, 0.95)(0.9, 0.95)
Eps1e-81e-8
Weight decay0.010.01
Grad clip1.01.0
Precisionbfloat16bfloat16

历史帧/未来帧与当前帧的间隔 $m$ 统一设为 15。动作分词无需离散化(直接连续 flow matching),与 RT-2 的离散 token 路线、pi0 的 flow matching 路线一脉相承但把生成专家的未来帧预测也纳入同一模型联合优化。

Infra(训练 / 推理工程)

  • 训练 GPU 数 / 总 GPU 小时 / 并行策略:论文未披露(只披露了 LPT 这一数据加载层面的负载均衡策略,未给出具体集群规模、显卡型号、总训练时长)。
  • 训练精度:bfloat16(两阶段一致)。
  • 推理速度:2B 与 3B 两个变体均为 ~13 Hz(NVIDIA RTX 4090,开 torch.compile)——2B 版参数少但输入分辨率更高(448×448 vs 224×224),视觉 token 序列更长,抵消了参数优势,故两者速度相当。
  • 对比参照:论文指出同类视觉生成方案里,即便优化过的 SANA-Sprint 单次生成也要 0.16 秒(<6 Hz),凸显 InternVLA-A1 生成专家轻量化设计(16-token 压缩表示 + 一次前向预测)对实时控制的意义。

评测 benchmark

12 个真机任务(3 种机器人本体:Genie-1、ARX Lift-2、ARX AC One),每任务 30 次预定义初始条件 rollout,报告平均成功率。

通用任务(10 项,Table 4),对比 $\pi_0$(3.3B)与 GR00T N1.5(3B):

方法Zip BagUnscrew CapSort PartsMake SandwichSweep TrashOperate OvenSort RubbishWipe StainPlace MarkpenPlace Flower平均
$\pi_0$40.066.753.366.743.373.396.073.353.340.060.6
GR00T N1.533.30.06.746.716.746.766.740.040.033.333.0
InternVLA-A1 (2B)66.733.346.773.363.353.397.380.066.766.764.7
InternVLA-A1 (3B)73.366.753.393.366.786.797.386.766.760.075.1

2B 模型(64.7%)已超过参数量更大的 $\pi_0$(60.6%);3B 模型达 75.1%,比 $\pi_0$ 绝对提升 14.5 个百分点。

高动态专项任务(2 项,图 6)——Express Sorting(传送带包裹分拣)与 In-motion Ingredient Picking(运动中双臂协同拣三明治食材):$\pi_0$ 与 GR00T N1.5 在 Express Sorting 上均不超过 40.0%,在 Ingredient Picking 上仅 20.0%;InternVLA-A1 (2B) 达 70.0% / 46.7%;InternVLA-A1 (3B) 达 80.0% / 93.3%,在多机协同任务上比基线高出 70+ 个百分点。

RoboTwin 2.0 仿真基准(robotwin-2,50 个双臂任务,Easy/Hard 两种域随机化设置,每任务 100 条演示微调、100 次评测)

方法Avg. EasyAvg. Hard
$\pi_0$54.5%19.8%
InternVLA-A1 (2B)58.6%20.5%
InternVLA-A1 (3B)65.0%25.4%

3B 版比 $\pi_0$ 分别提升 10.5%(Easy)与 5.6%(Hard)。

(补充:GitHub 仓库 2026/01/23 news 披露了一个之后发布的专用微调 checkpoint InternVLA-A1-3B-RoboTwin,在 RoboTwin 2.0 上取得 Easy 89.40% / Hard 89.64%,对比同条件下 $\pi_0$ 79.98%/79.50%、$\pi_{0.5}$(pi0-5)86.76%/86.96%——这是论文之外、更新的微调结果,不是本论文 Table 5 的基线预训练模型分数,两者不可直接比较。)

消融研究

  • 预训练有效性:去掉预训练、从头训练,12 项真机任务平均成功率从 77.0% 骤降到 25.4%(降 51.6 个百分点),部分任务完全失败;预训练被证实是稳定优化、继承基础操作能力的关键归纳偏置。
  • 生成专家有效性:去掉生成专家(仅保留理解 + 动作两个专家),12 项真机任务中 11 项性能下降(降幅 6.7%~53.3%),平均成功率从 77.0% 降到 57.6%——验证了”预测未来再决策”的架构价值。
  • 预训练数据来源消融:纯 AgiBot-World、纯 InternData-A1、混合三种设置对比——纯 InternData-A1 已匹配/超过纯真机基线(验证合成数据高保真度),且在 RoboTwin(sim-to-sim)上单独使用比混合更优;混合策略在真机任务上收益最大,尤其 Sort Parts 提升约 20%。

创新点与影响

  • 贡献:提出 Mixture-of-Transformers 架构下的”理解-生成-动作”三专家统一框架,用一套 masked self-attention 把 MLLM 语义理解与世界模型式的未来帧预测直接绑进动作生成流程,而非像 VPP/Genie Envisioner 那样把视频预测和动作预测分成松散耦合的两阶段;同时验证了合成数据(InternData-A1)与真机数据(AgiBot-World)混合预训练在高动态场景下的必要性。
  • 改变了什么:把”预见未来”这件事从独立的视频生成模块内化成与动作预测联合优化的单一目标(Eq. 1+2 同权重反传),换来在传送带分拣等场景下相对 $\pi_0$/GR00T N1.5 数十个百分点的成功率提升;证明了轻量 16-token 压缩表示 + 一次前向预测的生成专家设计能在不牺牲 ~13 Hz 实时性的前提下获得动力学先验。
  • 作者自陈局限(原文 Conclusion):① 理解专家未与多模态 VQA 数据联合训练,导致通用语义推理与复杂指令跟随能力有所退化;② 为保证视觉前瞻模块的推理效率,牺牲了图像预测的保真度,限制了生成未来帧的细粒度程度。

原始链接

一手源存档(sources/)