一句话定位
ChatVLA 用两阶段”分阶段对齐训练”(Phased Alignment Training)+ 只在 MLP 层做的二专家 Mixture-of-Experts,让同一个 qwen2-vl-2B 底座既能像 VLM 一样正常对话答题,又能像 VLA 一样做机械臂操作——目标是治好”一训练机器人任务,模型就完全失语”的通病。
背景与定位
范式:理解-控制统一 VLA,聚焦”如何不牺牲对话能力”。作者观察到当时的 VLA 训练主流做法(openvla、tinyvla、π0 等只用机器人示范数据训练)会让模型彻底丧失对话能力(“只会喃喃自语”);加入类似 ECoT、DiffusionVLA 的推理短语(chain-of-thought 式动作前置说明)能部分挽回理解能力;而 RT-2 开创的视觉-文本与机器人数据联合训练(co-training)范式虽然保留了对话能力,却会显著拖累真实机器人的操作成功率。论文把这两种此消彼长的现象分别命名为**“虚假遗忘”(spurious forgetting,权重没有真丢知识,只是对齐被机器人数据训练带偏了)和”任务干扰”(task interference,控制和理解两个任务在共享参数空间里相互拖累)**,并提出 ChatVLA 作为同时解决这两个问题的框架。方法设计受 Dual Coding Theory(人类认知中运动技能与视觉-语言理解由两套既独立又互联的系统处理)启发。项目页显示论文已被 EMNLP 2025 主会 Oral 收录;同团队后续发布了 ChatVLA-2(NeurIPS 2025,arXiv:2505.21906),是独立的下一代工作,不在本页覆盖范围。
模型架构
VLM 骨干:直接沿用官方 Qwen2-VL-2B-Instruct 权重,不对 VLM 本体做任何额外预训练(“off-the-shelf … without any post training on VLM itself”)。据 GitHub 发布的 VLA 专用 config.json:hidden_size=1536、num_hidden_layers=28、num_attention_heads=12、num_key_value_heads=2(GQA)、intermediate_size=8960、视觉塔 depth=32、embed_dim=1280、patch_size=14、spatial_merge_size=2、M-RoPE mrope_section=[16,24,24]、vocab_size=151936,架构类名为 Qwen2VLForConditionalGenerationForVLA。
动作头:policy_head_type 为 scale_dp_policy(ScaleDP,可扩展扩散策略头),沿用作者团队自己 DiffusionVLA(论文中的 “DiVLA” 基线)的动作头设计,即连续动作、扩散式生成,而非 OpenVLA 式的离散动作 token 自回归。
Mixture-of-Experts(仅作用于 MLP 层):每个 Transformer block 先过共享的多头自注意力 x^{l'} = MHA(x^{l-1}) + x^{l-1},注意力层本身不做专家切分、两类任务共享,理由是控制和理解共享”识别物体、判断位置”这类高层语义表征;随后 FFN 层按数据来源路由到两个互斥的专家分支之一:f(FFN_{v-l}) 处理视觉-文本/对话数据(路由 m=0),f(FFN_{robot}) 处理机器人控制数据(1≤m≤M_r)。区分任务靠不同的 system prompt(理解用 “Answer based on question”,控制用 “Predict robot action”)。两个专家的 FFN 权重都从原始 Qwen2-VL 的 MLP 权重初始化(GitHub save_mlp_weights_for_init_moe.py),推理时只激活一条路径,故推理算力开销与原始 2B 模型基本持平。
参数规模:VLM 骨干约 2B(Qwen2-VL-2B),相比 ECoT 使用的 7B(OpenVLA 骨干)少 3.5×(论文摘要与结论重复强调这一比值)。动作头/MoE 额外参数量论文未给出具体数字。
机器人硬件细节论文正文未披露(无机械臂型号、自由度、末端表示等描述);GitHub 训练任务模板里的相机命名为 left / right / wrist(三目设置),提示与该团队 DexVLA/DiffusionVLA/TinyVLA 一脉相承的双臂 ALOHA 类平台,但这是仓库示例配置而非论文正文明确交代的实验硬件。
数据
初步范式分析实验(3.2 节,非最终 ChatVLA 训练):以 DiffusionVLA 为测试床,比较三种数据配方(纯机器人数据 / 机器人数据+推理短语 / 机器人数据+视觉文本 3:1 co-training)对 5 个真实机器人任务和 6 个理解基准的影响,视觉-文本数据从 LLaVA 中随机采样 54K 图文对。
最终 ChatVLA 训练数据:
- 视觉-文本:LLaVA-1.5 数据集(GitHub 指向
llava_v1_5_mix665k.json,即标准 LLaVA-1.5 665K 指令微调图文对混合集),由 COCO、GQA、OCR-VQA、TextVQA、VisualGenome 五个子数据集构成(附录列出,用于检测/分割/图文标注、视觉推理、OCR+VQA、文本阅读理解、场景标注)。作者在消融中指出这批数据缺乏艺术理论、检验医学、药学、文学、心理学等专业知识,是 ChatVLA 在 MMMU 部分子类(艺术、医学、社会科学)落后 Qwen2-VL 的原因。 - 机器人:25 个真实世界操作任务,覆盖三类难度——直接高层指令的长时序任务(Task 1-4)、带高层规划器中间指令的长时序任务(Task 5-13)、跨技能多任务(Task 14-25,分浴室/厨房/桌面三个场景)。论文只公开了评测阶段的试验规模——528 次真实机器人试验,未披露训练用的示范轨迹数(episode)数量。
- 视觉-文本 : 机器人 数据配比消融(Table 5,仅影响理解/VQA 指标,未报告对应机器人任务成功率):1:1、3:1、1:3(最终选择)三档,结果反直觉——视觉-文本数据占比更小(1:3)反而在 MMMU/MMStar 等大多数理解基准上最优,作者解释为少量视觉-文本数据已足以”重新激活”视觉-文本对齐,数据量继续加大并不进一步帮助理解、反而可能挤占机器人数据的训练步数。
- 数据格式:机器人数据转为 h5py 格式,与团队另一工作 DexVLA 一致。
训练方法
Phased Alignment Training(两阶段分阶段对齐):
- Stage 1(
--init_moe True --freeze_vl_expert True):只用机器人数据训练,只激活控制专家及其动作头;训练中额外混入(DiffusionVLA 式)推理短语数据,以维持视觉-文本对齐不完全断裂。 - Stage 2(
--init_moe False,--vl_ratio 0.33对应约 1:3 的 VL:机器人比例):视觉-文本数据(LLaVA-1.5)与机器人数据联合训练,解冻并训练理解专家,帮助模型同时保住两种能力。 - 控制专家与理解专家统一学习率 2e-5(论文正文唯一给出的具体训练超参)。
- 目标函数:理解/对话侧为标准语言建模(下一 token 交叉熵);控制侧为 ScaleDP 扩散动作头的去噪目标(continuous action, diffusion loss)。无强化学习环节,纯监督(模仿学习 + 指令微调)。
Infra(训练 / 推理工程)
- 训练 GPU 型号、数量、GPU 小时:未披露(论文与 GitHub 均未给出)。
- Batch size / save steps:GitHub README 说明可按算力自行调整,未给出具体数值。
- 推理帧率 / 控制频率 / 端到端延迟:未披露。
- 唯一有工程量级参考的是真实机器人评测规模:528 次试验(25 个任务)。
评测 benchmark
Table 1:多模态理解 + VQA(对比 MLLM 与 VLA 基线,均为原文表格数值)
| Method | Params | MMMU | MMStar | MME | OCRBench | HallBench | MMB | TextVQA | DocVQA | InfoVQA | AI2D | ChartQA | MTVQA | RealWorldQA |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2-VL(底座上界) | 2B | 41.1 | 48.0 | 1872.0 | 809 | 41.7 | 74.9 | 79.7 | 88.57 | 61.37 | 74.7 | 73.5 | 18.1 | 62.9 |
| OpenVLA | 7B | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| ECoT | 7B | 5.4 | 0 | 0 | 12 | 0.9 | — | 0 | 0 | 0 | 0 | 0 | 1.7 | 0 |
| DiVLA(DiffusionVLA) | 2B | 17.2 | 21.1 | 186.5 | 294 | 9.0 | — | 7.5 | 15.2 | 14.7 | 43.1 | 17.2 | 6.2 | 25.2 |
| ChatVLA(本文) | 2B | 37.4 | 47.2 | 1435.2 | 729 | 39.9 | 69.0 | 71.2 | 83.3 | 53.3 | 67.6 | 59.9 | 11.5 | 57.0 |
ChatVLA 相对 DiVLA / ECoT 在 MMMU 上分别提升 2.2× 和 6.9×(代入 Table 1 数值核算:37.4/17.2≈2.17、37.4/5.4≈6.93,与 abstract “MMMU 六倍” 的概括吻合;论文 4.1 节原句把这组倍数写成是 “On the MMStar benchmark”,但 37.4 及两个倍数都只对得上 Table 1 的 MMMU 列,MMStar 列实际是 47.2——应为原文笔误,本页仅采信 Table 1 表格数值);MMStar 从两个 VLA 基线的 21.1 / 0 提升到 47.2。论文 4.1 节另有一句”TextVQA 相对 ECoT / DiVLA 提升 9.2×/9.5ד,但 ECoT 的 TextVQA 在 Table 1 中为 0、DiVLA 为 15.2(对应比值应为 71.2/15.2≈4.7×),无法用 Table 1 数值复核出 9.2×/9.5×,疑似原文另一处笔误,本页不采信该具体倍数,仅以 Table 1 的 71.2 分本身为准。
Table 2:长时序任务·直接指令(4 项桌面玩具任务,Avg. Len. 为多步序列的平均完成长度)
| Method | Task1 AvgLen | Task2 AvgLen | Task3 AvgLen | Task4 AvgLen |
|---|---|---|---|---|
| Octo | 0.08 | 0.21 | 0.11 | 0.33 |
| OpenVLA | 0.06 | 0.29 | 0.15 | 0.42 |
| ChatVLA | 0.54 | 0.64 | 1.00 | 0.75 |
Table 3:长时序任务·高层规划器(Task5-8 / 9-10 / 11-13,Avg. Len.)
| Method | Task5-8 | Task9-10 | Task11-13 |
|---|---|---|---|
| Octo | 0.23 | 0.28 | 0.08 |
| OpenVLA | 0.31 | 0.33 | 0.10 |
| ChatVLA | 0.94 | 0.83 | 0.59 |
Table 4:跨技能多任务(Task14-25,浴室/厨房/桌面,成功次数/总试次) — 总计 Octo 18/107、OpenVLA 20/107、ChatVLA 55/107(约 51%,OpenVLA 的 2.75×)。逐任务成功率均由 ChatVLA 领先(如 Task25 ChatVLA 满分 7/7)。全部 528 次真实机器人试验来自这三张表的加总。
Table 5:视觉-文本:机器人 数据配比消融(仅影响理解/VQA 指标)——1:1 得 MMMU 36.1 / MMStar 44.7;3:1 得 35.3 / 45.3;1:3(最终采用)得 37.4 / 47.2,为三者最优。
创新点与影响
贡献:(1)系统性拆解了 VLA 训练范式对”理解”与”控制”两种能力此消彼长的具体机制,命名并区分”虚假遗忘”与”任务干扰”两个不同现象;(2)提出的分阶段对齐训练 + MLP 层二专家 MoE 是一个不改预训练、只调训练策略/轻量架构改动的简单方案,同时在 25 个真实机器人任务和多个理解/VQA 基准上取得改善;(3)以 2B 参数(3.5× 小于 ECoT 所用 7B 骨干)取得对多个更大 VLA 基线的显著优势。
作者自陈的局限:(a) 消融显示 LLaVA-1.5 数据本身缺乏专业领域知识(艺术理论/医学/心理学等),是 ChatVLA 在 MMMU 部分子类落后原始 Qwen2-VL 的直接原因,作者认为换用更合适的专业数据有进一步提升空间;(b) 数据配比的”反直觉”结果(更少视觉-文本数据反而更好)只在理解类指标上验证过,论文没有报告不同配比下机器人任务成功率的对应变化;(c) 论文承认精心筛选/构造数据(而非简单换配比)对缓解虚假遗忘可能更关键,但这留作未来工作,未在本文验证。
原始链接
- 论文 arXiv:https://arxiv.org/abs/2502.14420
- PDF:https://arxiv.org/pdf/2502.14420
- 项目主页:https://chatvla.github.io/
- 代码 GitHub:https://github.com/tutujingyugang1/ChatVLA_public
- 模型权重(HF):https://huggingface.co/zzymeow/ChatVLA
- VLM 底座权重:https://huggingface.co/Qwen/Qwen2-VL-2B-Instruct
一手源存档(sources/)
- chatvla—project-page — 项目主页(摘要、demo 视频描述、EMNLP 2025 Oral 收录信息、ChatVLA-2 指向)
- chatvla—github-readme — GitHub README(安装、VLM 权重来源、数据准备、两阶段训练脚本关键参数、权重下载链接)
- arXiv 原文 PDF(2502.14420)未入 git,引用见上「原始链接」