一句话定位

在 DexVLA 骨架上引入动态 MoE + 两阶段训练,专门解决 VLA 微调后”预训练 VLM 知识被侵蚀”的问题,使机器人能对训练数据里从未出现过的数学题、物体、方位指令做开放世界推理并据此执行动作。

背景与定位

VLA 的卖点本应是继承 VLM 的预训练知识(常识、OCR、数学、空间推理),但作者观察到(引用其前作 chatvla)在机器人数据上微调会显著侵蚀这些能力——模型甚至答不出训练数据里没见过的简单算式。本文是 chatvla 一代的延续,基座沿用 pi0-5、DexVLA(均引用其”用推理短语标注动作数据”的做法)一类”推理先行、动作跟随”范式,对比对象包括 pi0openvlagroot-n1、DexVLA、chatvla。核心论点拆成两条:(1) 多模态理解与机器人控制的特征空间存在竞争,需要在参数空间上解耦又保留共享部分;(2) 需要保证动作输出真正”跟随”模型内部推理,而不是推理和动作两张皮。为验证,作者设计了两个域外(out-of-distribution)任务:白板数学配对游戏、玩具空间摆放任务,题面/物体/方位在训练集中从未出现。论文已被 NeurIPS 2025 接收。

模型架构

  • 骨架:采用 DexVLA 的整体架构作为基础,VLM 用 Qwen2-VL,动作专家为预训练的 1B ScaleDP(diffusion 式动作生成模块)。视觉观测经图像编码器投影到与语言 token 相同的嵌入空间;多相机视角的视觉embedding 直接拼接(concatenate)。VLM 同时输出两类 token:推理(reasoning)token 与动作(action)token,动作 token 再经过一个由两层线性层+LayerNorm 组成的投影模块送入动作专家。
  • 动态 Mixture-of-Experts(核心创新):在 VLM 骨干上引入动态 MoE(参考 DeepSeekMoE),共 8 个专家,推理时动态选择 top-2 激活;专家 MLP 权重用预训练 MLP 权重初始化。作者明确不用静态/共享专家——因为 Qwen2-VL 的 LLM 部分原生不支持 MoE,引入静态/共享专家会破坏原有结构、加速侵蚀预训练知识;动态 MoE 在保持 LLM 结构不变的前提下选择性激活专家模块,从而在”保留知识”和”任务适配”间取得平衡。消融显示专家数与 top-k 越大,开放世界泛化越好(见评测)。
  • 推理跟随增强模块(Reasoning-following enhancement module):用 MLP 把推理 token 投影后,替换动作专家原本的观测 embedding,并与当前时间步 embedding 结合,用于生成 FiLM 式的 scale/shift 参数,把推理上下文注入动作生成过程。该机制只加在动作专家的后半部分层,而非全部层——参考 PointVLA、GR00T N1 的发现:动作专家更深层的改动对机器人控制影响更小。消融证实”后半层注入”优于”全层注入”和”前半层注入”(见评测)。
  • 骨干参数量:论文正文未给出 ChatVLA-2 主模型 VLM 骨干的确切参数量;仅在消融中以 “3B Dense Model” 与 “7B Dense Model” 作为不含 MoE 的稠密基线对照,暗示其默认骨干规模约为 3B 量级,但未明确写出。

数据

  • 图文数据(第一阶段共训):COCO(约 32k)、TextVQA(约 20k)、GQA(约 54k);另构造了约 2k 条来自 RoboPoint(仿真环境,视觉质量较低但有助空间理解)、约 5k 条真实环境(桌面 + 更广场景,采用类 LLaVA 问答格式)的机器人相关图文对,使用与玩具摆放任务相同的推理模板。
  • 数据预处理:每条图文样本最多保留 5 轮对话(超过则保留首轮+随机采样 4 轮);TextVQA 中特意剔除含数字 OCR token 或数学符号的样本,避免图文预训练阶段”提前泄漏”OCR/数学能力,以确保后续开放世界表现来自 VLM 原生预训练知识而非本任务数据。图像分辨率 320×240。
  • 机器人数据:数学配对游戏采集 600 条轨迹,玩具摆放任务采集 300 条轨迹;所有机器人数据都标注了子推理短语(做法类似 π0.5 和 DexVLA):先用固定模板初始化,再用 GPT-4o 做文本增强扩充多样性,避免动作专家被单一模板”锁死”。
  • 配比:图文数据与机器人数据维持 1:3 的比例(沿用前人做法)。
  • 论文未评测仿真 benchmark,明确说明”当前仿真 benchmark 无法衡量本方法展现的能力”。

训练方法

两阶段训练,均使用 AdamW + FP16 混合精度:

  • Stage 1(赋予开放世界推理/理解能力):VLM 与动作专家联合训练,在图文数据与机器人数据上共训,建立预训练知识与机器人动作之间的联系。学习率 2e-5,训练 15k steps
  • Stage 2(增强推理跟随):冻结整个 VLM,只训练动作专家(ScaleDP),让动作生成更紧密地跟随上层推理输出。学习率 2e-5,前 3k steps warm-up,随后余弦调度降至 2e-6,训练 50k steps
  • 两阶段消融证实必要性:只训 Stage 1(无 Stage 2)在数学配对游戏开放世界成功率仅 12/52;只训 Stage 2(无 Stage 1)近乎归零(3/52,OCR/数学得分接近 0);两阶段都训练才达到 43/52(见评测表)。

Infra(训练 / 推理工程)

  • 训练总成本:340 GPU-hours(论文未披露具体 GPU 型号与卡数、并行策略)。
  • 数据采集频率:数学配对游戏遥操作采集 50 Hz;玩具摆放任务遥操作采集 15 Hz(这是数据采集频率,论文未给出推理时的控制 Hz 或延迟数值)。
  • 推理 FPS/延迟/边缘硬件:未披露。

评测 benchmark

两个真实机器人任务,均评测 in-domain(训练分布内)与 open-world(训练时未见过的题面/物体/方位)两种设置,对比 Octo、Diffusion Policy、OpenVLA、GR00T N1、DexVLA、ChatVLA(v1)、π0。

数学配对游戏(ARX-R5 双臂机器人,每臂 6 自由度,顶置 RealSense L515 相机,14 维联合状态/动作空间,遥操作 50 Hz 采集):

方法In-Domain 推理分/6In-Domain 成功率Open-World OCR/4Open-World 数学推理/2Open-World 成功率
Octo/2/13//0/52
Diffusion Policy/7/13//3/52
OpenVLA/2/13//0/52
GR00T N1/4/13//3/52
DexVLA5.2/612/130.21/40.06/210/52
ChatVLA(v1)5.8/610/131.08/40.42/24/52
π0/12/13//8/52
ChatVLA-2(本文)6.0/611/133.58/41.73/243/52

玩具摆放任务(7 自由度 Franka Emika + Robotiq 夹爪,ZED 2 相机,遥操作 15 Hz 采集):

方法In-Domain 物体识别In-Domain 空间可供性In-Domain 成功率/67Open-World 物体识别Open-World 空间可供性Open-World 成功率/156
Octo//19/67//13/156
Diffusion Policy//52/67//17/156
OpenVLA//23/67//10/156
GR00T N1//31/67//12/156
DexVLA10.9763/670.230.1236/156
ChatVLA(v1)10.9760/670.710.3522/156
π0//61/67//25/156
ChatVLA-2(本文)10.9961/670.940.88127/156

关键结论:in-domain 场景下 ChatVLA-2 并不显著优于 π0/DexVLA(它们已接近满分),但 open-world 场景下差距巨大——数学配对游戏成功率 43/52 vs 其余方法全部 ≤10/52;玩具摆放成功率 81.4%(127/156),相当于 DexVLA(36/156≈23%)的 3.52 倍

消融实验:

  • MoE 结构消融(数学配对游戏,满分 52):Dynamic MoE(本文,8 专家 top-2)OCR 3.58/Math 1.73/Avg 43/52;Static MoE+Dynamic MoE 2.38/0.92/11/52;Shared MoE+Dynamic MoE 3.07/1.12/25/52;3B Dense 模型(无 MoE)0.04/0.00/2/52;7B Dense 模型 0.08/0.00/8/52——说明单纯堆参数(7B)不能替代 MoE 解耦。
  • 两阶段训练消融:仅 Stage1: OCR 3.20/Math 1.33/Avg 12/52;仅 Stage2: 0.15/0.04/3/52;Stage1+Stage2(本文): 3.58/1.73/43/52
  • 专家数量消融(附录 Table 5):8 专家 top-2 → OCR 3.58/Math 1.73(最优);6 专家 top-3 → 2.42/1.26;4 专家 top-2 → 1.87/0.94——专家数越多、top-k 越大,开放世界泛化越好。
  • 推理跟随注入层位置消融(附录 Table 6,成功率/52):后半层注入(本文)43/52;全层注入 36/52;前半层注入 22/52——前半层注入会破坏动作生成稳定性(作者推测因为替换掉了观测 embedding 中对动作生成关键的信息)。

创新点与影响

  • 首次把”动态 MoE + 冻结 VLM 只训动作专家”的两阶段配方系统地用于解决 VLA 微调导致的预训练知识侵蚀问题,并用可复现的域外数学/空间任务定量证明了效果(而非仅靠定性 demo)。
  • 明确论证”单纯堆大模型参数(3B→7B dense)不能替代 MoE 解耦”,为后续 VLA 架构设计提供了消融证据。
  • 论文自陈局限:(1) 目前仍无法完全保留 VLM 的预训练知识,微调机器人数据时能力退化不可避免,这是最难解决的部分,留待未来工作;(2) 当前方法仅在桌面(table-top)任务上验证,未来计划扩展到移动操作(mobile manipulator)以完成更长时程、更复杂的真实世界任务。
  • 未公开代码/模型权重(GitHub、HuggingFace 均无发布),复现依赖论文与项目页描述。

原始链接

一手源存档(sources/)