一句话定位

ChatVLA 用两阶段”分阶段对齐训练”(Phased Alignment Training)+ 只在 MLP 层做的二专家 Mixture-of-Experts,让同一个 qwen2-vl-2B 底座既能像 VLM 一样正常对话答题,又能像 VLA 一样做机械臂操作——目标是治好”一训练机器人任务,模型就完全失语”的通病。

背景与定位

范式:理解-控制统一 VLA,聚焦”如何不牺牲对话能力”。作者观察到当时的 VLA 训练主流做法(openvlatinyvlaπ0 等只用机器人示范数据训练)会让模型彻底丧失对话能力(“只会喃喃自语”);加入类似 ECoT、DiffusionVLA 的推理短语(chain-of-thought 式动作前置说明)能部分挽回理解能力;而 RT-2 开创的视觉-文本与机器人数据联合训练(co-training)范式虽然保留了对话能力,却会显著拖累真实机器人的操作成功率。论文把这两种此消彼长的现象分别命名为**“虚假遗忘”(spurious forgetting,权重没有真丢知识,只是对齐被机器人数据训练带偏了)和”任务干扰”(task interference,控制和理解两个任务在共享参数空间里相互拖累)**,并提出 ChatVLA 作为同时解决这两个问题的框架。方法设计受 Dual Coding Theory(人类认知中运动技能与视觉-语言理解由两套既独立又互联的系统处理)启发。项目页显示论文已被 EMNLP 2025 主会 Oral 收录;同团队后续发布了 ChatVLA-2(NeurIPS 2025,arXiv:2505.21906),是独立的下一代工作,不在本页覆盖范围。

模型架构

VLM 骨干:直接沿用官方 Qwen2-VL-2B-Instruct 权重,不对 VLM 本体做任何额外预训练(“off-the-shelf … without any post training on VLM itself”)。据 GitHub 发布的 VLA 专用 config.jsonhidden_size=1536num_hidden_layers=28num_attention_heads=12num_key_value_heads=2(GQA)、intermediate_size=8960、视觉塔 depth=32embed_dim=1280patch_size=14spatial_merge_size=2、M-RoPE mrope_section=[16,24,24]vocab_size=151936,架构类名为 Qwen2VLForConditionalGenerationForVLA

动作头policy_head_typescale_dp_policy(ScaleDP,可扩展扩散策略头),沿用作者团队自己 DiffusionVLA(论文中的 “DiVLA” 基线)的动作头设计,即连续动作、扩散式生成,而非 OpenVLA 式的离散动作 token 自回归。

Mixture-of-Experts(仅作用于 MLP 层):每个 Transformer block 先过共享的多头自注意力 x^{l'} = MHA(x^{l-1}) + x^{l-1},注意力层本身不做专家切分、两类任务共享,理由是控制和理解共享”识别物体、判断位置”这类高层语义表征;随后 FFN 层按数据来源路由到两个互斥的专家分支之一:f(FFN_{v-l}) 处理视觉-文本/对话数据(路由 m=0),f(FFN_{robot}) 处理机器人控制数据(1≤m≤M_r)。区分任务靠不同的 system prompt(理解用 “Answer based on question”,控制用 “Predict robot action”)。两个专家的 FFN 权重都从原始 Qwen2-VL 的 MLP 权重初始化(GitHub save_mlp_weights_for_init_moe.py),推理时只激活一条路径,故推理算力开销与原始 2B 模型基本持平。

参数规模:VLM 骨干约 2B(Qwen2-VL-2B),相比 ECoT 使用的 7B(OpenVLA 骨干)少 3.5×(论文摘要与结论重复强调这一比值)。动作头/MoE 额外参数量论文未给出具体数字。

机器人硬件细节论文正文未披露(无机械臂型号、自由度、末端表示等描述);GitHub 训练任务模板里的相机命名为 left / right / wrist(三目设置),提示与该团队 DexVLA/DiffusionVLA/TinyVLA 一脉相承的双臂 ALOHA 类平台,但这是仓库示例配置而非论文正文明确交代的实验硬件。

数据

初步范式分析实验(3.2 节,非最终 ChatVLA 训练):以 DiffusionVLA 为测试床,比较三种数据配方(纯机器人数据 / 机器人数据+推理短语 / 机器人数据+视觉文本 3:1 co-training)对 5 个真实机器人任务和 6 个理解基准的影响,视觉-文本数据从 LLaVA 中随机采样 54K 图文对

最终 ChatVLA 训练数据

  • 视觉-文本:LLaVA-1.5 数据集(GitHub 指向 llava_v1_5_mix665k.json,即标准 LLaVA-1.5 665K 指令微调图文对混合集),由 COCO、GQA、OCR-VQA、TextVQA、VisualGenome 五个子数据集构成(附录列出,用于检测/分割/图文标注、视觉推理、OCR+VQA、文本阅读理解、场景标注)。作者在消融中指出这批数据缺乏艺术理论、检验医学、药学、文学、心理学等专业知识,是 ChatVLA 在 MMMU 部分子类(艺术、医学、社会科学)落后 Qwen2-VL 的原因。
  • 机器人:25 个真实世界操作任务,覆盖三类难度——直接高层指令的长时序任务(Task 1-4)、带高层规划器中间指令的长时序任务(Task 5-13)、跨技能多任务(Task 14-25,分浴室/厨房/桌面三个场景)。论文只公开了评测阶段的试验规模——528 次真实机器人试验,未披露训练用的示范轨迹数(episode)数量。
  • 视觉-文本 : 机器人 数据配比消融(Table 5,仅影响理解/VQA 指标,未报告对应机器人任务成功率):1:1、3:1、1:3(最终选择)三档,结果反直觉——视觉-文本数据占比更小(1:3)反而在 MMMU/MMStar 等大多数理解基准上最优,作者解释为少量视觉-文本数据已足以”重新激活”视觉-文本对齐,数据量继续加大并不进一步帮助理解、反而可能挤占机器人数据的训练步数。
  • 数据格式:机器人数据转为 h5py 格式,与团队另一工作 DexVLA 一致。

训练方法

Phased Alignment Training(两阶段分阶段对齐)

  • Stage 1--init_moe True --freeze_vl_expert True):只用机器人数据训练,只激活控制专家及其动作头;训练中额外混入(DiffusionVLA 式)推理短语数据,以维持视觉-文本对齐不完全断裂。
  • Stage 2--init_moe False--vl_ratio 0.33 对应约 1:3 的 VL:机器人比例):视觉-文本数据(LLaVA-1.5)与机器人数据联合训练,解冻并训练理解专家,帮助模型同时保住两种能力。
  • 控制专家与理解专家统一学习率 2e-5(论文正文唯一给出的具体训练超参)。
  • 目标函数:理解/对话侧为标准语言建模(下一 token 交叉熵);控制侧为 ScaleDP 扩散动作头的去噪目标(continuous action, diffusion loss)。无强化学习环节,纯监督(模仿学习 + 指令微调)。

Infra(训练 / 推理工程)

  • 训练 GPU 型号、数量、GPU 小时:未披露(论文与 GitHub 均未给出)。
  • Batch size / save steps:GitHub README 说明可按算力自行调整,未给出具体数值
  • 推理帧率 / 控制频率 / 端到端延迟:未披露
  • 唯一有工程量级参考的是真实机器人评测规模:528 次试验(25 个任务)。

评测 benchmark

Table 1:多模态理解 + VQA(对比 MLLM 与 VLA 基线,均为原文表格数值)

MethodParamsMMMUMMStarMMEOCRBenchHallBenchMMBTextVQADocVQAInfoVQAAI2DChartQAMTVQARealWorldQA
Qwen2-VL(底座上界)2B41.148.01872.080941.774.979.788.5761.3774.773.518.162.9
OpenVLA7B0000000000000
ECoT7B5.400120.9000001.70
DiVLA(DiffusionVLA)2B17.221.1186.52949.07.515.214.743.117.26.225.2
ChatVLA(本文)2B37.447.21435.272939.969.071.283.353.367.659.911.557.0

ChatVLA 相对 DiVLA / ECoT 在 MMMU 上分别提升 2.2×6.9×(代入 Table 1 数值核算:37.4/17.2≈2.17、37.4/5.4≈6.93,与 abstract “MMMU 六倍” 的概括吻合;论文 4.1 节原句把这组倍数写成是 “On the MMStar benchmark”,但 37.4 及两个倍数都只对得上 Table 1 的 MMMU 列,MMStar 列实际是 47.2——应为原文笔误,本页仅采信 Table 1 表格数值);MMStar 从两个 VLA 基线的 21.1 / 0 提升到 47.2。论文 4.1 节另有一句”TextVQA 相对 ECoT / DiVLA 提升 9.2×/9.5ד,但 ECoT 的 TextVQA 在 Table 1 中为 0、DiVLA 为 15.2(对应比值应为 71.2/15.2≈4.7×),无法用 Table 1 数值复核出 9.2×/9.5×,疑似原文另一处笔误,本页不采信该具体倍数,仅以 Table 1 的 71.2 分本身为准。

Table 2:长时序任务·直接指令(4 项桌面玩具任务,Avg. Len. 为多步序列的平均完成长度)

MethodTask1 AvgLenTask2 AvgLenTask3 AvgLenTask4 AvgLen
Octo0.080.210.110.33
OpenVLA0.060.290.150.42
ChatVLA0.540.641.000.75

Table 3:长时序任务·高层规划器(Task5-8 / 9-10 / 11-13,Avg. Len.)

MethodTask5-8Task9-10Task11-13
Octo0.230.280.08
OpenVLA0.310.330.10
ChatVLA0.940.830.59

Table 4:跨技能多任务(Task14-25,浴室/厨房/桌面,成功次数/总试次) — 总计 Octo 18/107、OpenVLA 20/107、ChatVLA 55/107(约 51%,OpenVLA 的 2.75×)。逐任务成功率均由 ChatVLA 领先(如 Task25 ChatVLA 满分 7/7)。全部 528 次真实机器人试验来自这三张表的加总。

Table 5:视觉-文本:机器人 数据配比消融(仅影响理解/VQA 指标)——1:1 得 MMMU 36.1 / MMStar 44.7;3:1 得 35.3 / 45.3;1:3(最终采用)得 37.4 / 47.2,为三者最优

创新点与影响

贡献:(1)系统性拆解了 VLA 训练范式对”理解”与”控制”两种能力此消彼长的具体机制,命名并区分”虚假遗忘”与”任务干扰”两个不同现象;(2)提出的分阶段对齐训练 + MLP 层二专家 MoE 是一个不改预训练、只调训练策略/轻量架构改动的简单方案,同时在 25 个真实机器人任务和多个理解/VQA 基准上取得改善;(3)以 2B 参数(3.5× 小于 ECoT 所用 7B 骨干)取得对多个更大 VLA 基线的显著优势。

作者自陈的局限:(a) 消融显示 LLaVA-1.5 数据本身缺乏专业领域知识(艺术理论/医学/心理学等),是 ChatVLA 在 MMMU 部分子类落后原始 Qwen2-VL 的直接原因,作者认为换用更合适的专业数据有进一步提升空间;(b) 数据配比的”反直觉”结果(更少视觉-文本数据反而更好)只在理解类指标上验证过,论文没有报告不同配比下机器人任务成功率的对应变化;(c) 论文承认精心筛选/构造数据(而非简单换配比)对缓解虚假遗忘可能更关键,但这留作未来工作,未在本文验证。

原始链接

一手源存档(sources/)

  • chatvla—project-page — 项目主页(摘要、demo 视频描述、EMNLP 2025 Oral 收录信息、ChatVLA-2 指向)
  • chatvla—github-readme — GitHub README(安装、VLM 权重来源、数据准备、两阶段训练脚本关键参数、权重下载链接)
  • arXiv 原文 PDF(2502.14420)未入 git,引用见上「原始链接」