一句话定位
第一篇系统综述 vision-language-action(VLA)模型的论文:把「用视觉+语言输入直接产出机器人动作」的一整片工作,按动作解码层级拆成 VLA 组件 / 低层控制策略 / 高层任务规划器 三条主线,并给出 generalized VLA 与 Large VLA 的定义区分。附带一个持续更新的仓库 Awesome-VLA(截至 v8 追踪约 400 篇 VLA 相关论文)。发表于 IEEE TNNLS 2025,arXiv 由 v1(2024-05)滚动更新到 v8(2026-05)。
背景与定位
作者:Yueen Ma、Zixing Song、Irwin King(香港中文大学 CUHK)+ Yuzheng Zhuang、Jianye Hao(华为诺亚方舟实验室,深圳)。注意:本条目元数据里「Midea Group」有误,v8 一手署名机构是 CUHK + Huawei Noah’s Ark Lab(Zixing Song 在 arXiv v8 标注为 University of Bristol)。
“VLA” 这个术语由 RT-2 首创,指代把大 VLM 适配到机器人任务、直接输出动作的模型。本文提出广义化:把 VLA 定义为「任何处理视觉+语言多模态输入、产出机器人动作以完成具身任务的模型」,并沿用 LLM 与一般语言模型的类比,把 RT-2 那类基于 LLM/大 VLM 的原始 VLA 称为 Large VLA(LVLA)。
范式定位(Fig. 2 维恩图 + 三条时间线):
- 组件线(§III-A):预训练视觉表征 PVR、视频表征、动力学学习、世界模型、推理、policy steering——都是 VLA 的可复用零件,多来自 CV/NLP/RL 的迁移。
- 控制策略线(§III-B):语言指令 + 视觉观测 → 低层动作(平移/旋转),是 VLA 最典型的落点。
- 任务规划线(§IV):把长程任务分解成子任务序列,指导底层控制策略,即分层机器人系统。多数现代机器人系统采用「高层规划器(高容量)+ 底层控制(快、精)」的分层框架,类比分层 RL。
与相关综述的区分:Firoozi et al.(机器人基础模型,至 2023)、Wang et al.(机器人中的 LLM)、Hu et al.(通用机器人基础模型)、Kawaharazuka et al.(真实世界机器人应用);本文强调聚焦 VLA 本身。可与本库 aligning-cyber-physical-embodied-ai-survey(具身 AI 综述)、以及被本综述收录的 openvla、pi0、rdt-1b、octo、lapa-latent-action-pretraining、dp3-3d-diffusion-policy、3d-diffuser-actor、rekep 对照阅读。
模型架构
综述本身不训练模型,其「架构」贡献是一套 VLA 架构分类学。VLA 通用架构(Fig. 1)= 视觉编码器(vision foundation model 取 PVR)+ 语言编码器(LLM token embedding)+ 动作解码器;视觉-语言对齐沿用 Flamingo/BLIP-2/LLaVA 等策略,LLM 经机器人数据微调后当动作解码器用。
九类代表性架构(Fig. 5,对应 Table III 的 Architecture 列),按视觉-语言-动作的融合与解码方式划分:
- FiLM:指令 embedding 经 FiLM 层调制视觉特征(RT-1/BC-Z/MOO 一系,RT-1 用 FiLM 后续模型继承)。
- Cross-attention(Xattn):小模型下常有更优性能(VIMA、RoboFlamingo、RDT-1B)。
- Concatenation(Concat):实现最简单,大模型下可与 xattn 相当(RT-2、OpenVLA、π0 等)。
- Tool Use:LLM 生成调用感知/动作 API 的代码(Instruct2Act、VoxPoser、CaP)。
- Standard LVLA(Fig 5e):ViT+LLM,动作作为离散 token 直接由 VLM 解码(RT-2)。
- Action Expert / MoE(Fig 5f):在 VLM 上挂一个 MoE 动作专家,保留 VLM 的互联网知识(π0 flow-matching 动作专家)。
- Dual-System(Fig 5g):System 2(VLM)低频处理观测+指令,System 1(diffusion)高频闭环出动作(GR00T N1:System 2 @10Hz,System 1 @120Hz)。
- VLA + World Model(Fig 5h):把世界模型与 VLA 装进同一(视频)生成框架(Genie Envisioner、NORA-1.5)。
- Quantization(Fig 5i):把多模态数据量化成离散 token,构成共享词表,全模态自回归建模,同时能生成动作/文本/图像(WorldVLA、UniVLA)。
动作解码/动作头类型(对生成 embodied 页面尤其关键):
- 连续动作 BC:MSE 回归(Diffusion Policy 之外的连续策略、ACT)。
- 离散动作 BC:动作值域切 bin + 交叉熵(RT-1/RT-2/OpenVLA)。RT-1 里离散动作表现更好,但 Octo 指出会导致 early-grasping。
- SE(2) 动作:只预测 pick/place 两个末端位姿(CLIPort),桌面任务够用;更复杂任务需 SE(3)(ReKep)。
- Diffusion 动作:DDPM/DDIM 噪声预测(Diffusion Policy、DP3、Octo、3D Diffuser Actor、MDT、RDT-1B 用 DiT)。
- Flow matching:rectified flow(π0)。
- Action chunking:一次预测一段动作序列 + temporal ensembling(ACT / MT-ACT)。
- Point-based actions:VLM 零样本产出 2D/3D 关键点作为动作(PIVOT、RoboPoint、ReKep)——比造完整 VLA 便宜但偏粗。
- Latent action:从无标注视频用 VQ-VAE 抽取帧间隐动作(LAPA、Genie)。
Backbone/编码器选型(Table III 摘录):视觉编码器多用 CLIP-ViT/ResNet、SigLIP、DINOv2、EfficientNet、VQ-GAN;VLM 底座覆盖 PaliGemma(π0)、Prismatic-7B(OpenVLA)、LLaMA-2、Qwen2-VL-2B、Chameleon、Emu3、Vicuna 等;动作头有 TFM/MLP/DiT/UNet/Mamba/action-expert。
组件层(§III-A)里被系统对比的子模块:
- PVR(Table I):CLIP(WIT 4 亿图文对,VL 对比)、R3M(时间对比+视频语言对齐)、MVP(MAE)、VIP、VC-1(系统性搜 ViT 配置)、Voltron(语言条件 MAE)、DINOv2(自蒸馏,被 OpenVLA 采用)、I-JEPA(联合嵌入预测,非生成)、Theia(蒸馏多个视觉基础模型)。
- 动力学学习(Table II):前向/逆向动力学,Vi-PRoM、MaskDP、MIDAS、SMART、PACT、VPT、GR-1。
- 世界模型:Dreamer 系(latent dynamics,DreamerV2 离散隐状态、V3 定超参、DayDreamer 上真机)、IRIS(GPT 式自回归 + VQ-VAE)、TWM;LLM-induced(DECKARD、LLM-DM/PDDL、RAP+MCTS、Tree-Planner、LLM-MCTS);visual(Genie 生成式交互环境、3D-VLA diffusion 目标生成、UniSim、E2WM)。
- 推理:ECoT(给 OpenVLA 加 embodied CoT,不加机器人数据就提升泛化)、CoT-VLA(视觉 CoT)。
- Policy steering(测试时增强,无需重训):V-GPS(价值函数重排动作)、RoboMonkey(VLM verifier 选最优动作)。
数据
综述系统汇总具身数据资源(真实机器人数据集 Table V、模拟器 Table VI、人类数据、自动采集、EQA benchmark Table VII),关键规模数字:
真实/仿真机器人数据集(Table V,episodes 口径):
- OXE(Open X-Embodiment):1M+ episodes、527 skills、160K tasks、311 scenes、22 robots(聚合数据),是当时数量级最大的开源集。
- DROID:76K episodes、564 tasks、86 skills、Franka、人类遥操、RGBD。
- RH20T:110K+ episodes、42 skills、147 tasks、人类遥操。
- BridgeV2:60.1K episodes、13 skills、WidowX。
- Fractal(RT-1 数据):130K episodes、12 skills、700+ tasks、EDR、人类遥操。
- RoboSet:98.5K episodes、12 skills、38 tasks。
- MT-Opt:800K episodes(脚本+RL)。
- VIMA(仿真):650K episodes、17 skills(脚本采集)。
- 更小的:MIME 8.3K(Baxter)、RoboTurk 2.1K、BC-Z 25.9K、MOO 59.1K。
采集方式:human teleop / script / RL / aggregate;观测多为 RGB(D);指令形态覆盖 demo、goal image、task ID、language、multimodal。
模拟器(Table VI):Gibson/iGibson、SAPIEN、AI2-THOR、Habitat 等,配套 benchmark 如 BEHAVIOR-100/1K、SIMPLER、ALFRED;讨论 sim-to-real gap(渲染真实度、物理仿真误差、物体属性与运动规划器的域偏移;可变形物/液体尤难;real-to-sim/数字孪生用于提升保真)。
自动化数据采集:RoboGen(生成式仿真提技能)、AutoRT(LLM 编排、按 affordance 过滤任务)、DIAL(VLM 扩充语言指令)、RoboPoint(程序化随机场景)。
人类数据:借人手/人体运动的灵巧与多样性;难点是人-机具身迁移、第一/第三视角不一致、过滤成本高;UMI(手持夹爪)用于缓解。
EQA benchmark(Table VII):EQA/IQUAD/MT-EQA/MP3D-EQA/EgoVQA/EgoTaskQA/EQA-MX(8.2M QA 对,最大)/OpenEQA;区别于普通 VQA 在于 agent 可主动探索后再作答。
任务规划 benchmark:EgoPlan-Bench、PlanBench、LoTa-Bench、Embodied Agent Interface(EAI,主张用超越成功率的细粒度指标定位 LLM 问题)。
Awesome-VLA 仓库 Trends 小节另用脚本+人工混合方式,检索 2020-01~2025-12 关键词「VLA / Vision-language-action」并按 embodied AI/robotics 相关性过滤,得到约 400 篇 VLA 相关论文做趋势可视化(时间线/机构分布/统计图,原始数据在 data/vla_models.json)。
训练方法
综述归纳的训练目标与流程(不含自身训练):
模仿学习 BC 目标(Eq. 4-7):连续 L_Cont=Σ MSE(a_t, â_t);离散 L_Disc=Σ CE(a_t, â_t)(动作切 bin);L_SE(2)=CE(a_pick)+CE(a_place);扩散 L_DDPM=MSE(ε_k, ε_θ(a_t^k,k))。
RL 路线:Q-Transformer(把 RT-1 换成自回归 Q-learning + 保守正则,能用失败轨迹);RLHF 用于机器人(SEED:RLHF+skill-based RL 缓解稀疏奖励、靠人评估提安全);LLM 反哺 RL(Reflexion 用语言反馈替代权重更新;Eureka 让 LLM 设计奖励函数超过人工;π0.6 用 RL 让 VLA 从经验中学)。
多阶段/预训练配方:
- co-fine-tuning(RT-2):互联网 VQA 数据 + 机器人数据联合训练,激发涌现能力与泛化。
- symbol-tuning(RT-2/RT-H/RT-X 系)。
- latent-action 预训练(LAPA 三阶段):① VQ-VAE 学帧间量化隐动作 → ② VLA 预测隐动作 → ③ 小机器人数据微调把隐动作映射到真实动作,是首个 VLA 无监督预训练法。
- 动力学预训练:前向/逆向动力学、masked hindsight control(SMART/MaskDP/PACT/GR-1),逆动力学还可给「只有状态」的视频打动作标签。
- embodied curriculum learning(DexVLA 渐进训 diffusion action expert)。
高效微调/推理侧训练技巧:LoRA + 模型量化(OpenVLA)、OFT recipe(OpenVLA-OFT,并行解码+chunking)、early-exit 动态推理(DeeR-VLA 部分激活)、小 VLM+diffusion 头(TinyVLA)。
Scaling laws:机器人上也观察到 scaling law,强调模型规模、数据规模、环境/物体多样性的重要性(可参 data-scaling-laws-imitation)。
Infra(训练 / 推理工程)
作为综述,无自身训练 GPU/GPU-hours/并行/精度披露(未披露)。它汇总的是被收录工作的推理/工程侧要点:
- 实时性是核心矛盾:LVLA 和任务规划器在速度 vs 容量间权衡;推理跟不上环境变化会反复产出「过期动作」。
- 双系统解耦(GR00T N1):VLM System 2 @10Hz 慢思考,diffusion System 1 @120Hz 实时闭环出电机动作——survey 里最具体的推理频率数字。
- 线性复杂度 backbone:RoboMamba 用 Mamba 状态空间模型换掉 Transformer,推理复杂度线性。
- 效率法:TinyVLA(更小 VLM + diffusion 头,主打推理速度与数据效率)、DeeR-VLA(early-exit 动态推理只部分激活)。
- 分层框架的工程代价:系统复杂度、失败点增多;频繁失败触发 replan → 显著延迟;monolithic 规划器与 LVLA 架构相近,两个大模型并存冗余、伤可扩展性。
评测 benchmark
本文是综述,不做新实验、不给自有定量榜单,而是系统性地梳理评测资源与横向对比表:
- Table I(PVR,网络/目标函数/机器人任务)、Table II(动力学学习)、Table III(低层控制策略:视觉编码器/语言编码器/动作头/架构/训练目标/数据集/环境-本体-任务)、Table IV(高层任务规划器)、Table V(数据集规模)、Table VI(模拟器)、Table VII(EQA benchmark)。
- 收录工作评测所用的仿真环境:VIMA-Bench、CALVIN、LIBERO、RLBench、SimplerEnv、Meta-World、Franka Kitchen、Ravens、ALFRED、VirtualHome、Habitat、AI2-THOR 等;真机本体覆盖 Franka、WidowX、UR5、EDR、ALOHA、AgileX、Sawyer 等。
- 定量对比留给被引原文(如 VC-1 对各 PVR、Theia 对多数 PVR 的评测),综述以「谁在什么环境上做过什么技能」的结构化对照为主。
- 唯一的自产统计是 Awesome-VLA 仓库对约 400 篇论文的趋势可视化(年份/机构/类别分布)。
创新点与影响
贡献:
- 首篇聚焦 VLA 的综述,覆盖组件、架构、训练目标、机器人任务四个维度。
- 提出基于分层机器人系统的 VLA 分类学(低层控制策略 + 高层任务规划器两层),并明确 generalized VLA 与 Large VLA 的定义区分(把 RT-2 式定义收窄为 LVLA)。
- 系统汇总训练/评测资源(真实+仿真数据集、模拟器、benchmark),并讨论数据稀缺与不一致等应对方案。
- 提出安全、基础模型、真机部署等挑战与未来方向。
- 配套持续更新的 Awesome-VLA 仓库(CC BY 4.0),成为社区 VLA 索引之一。
它改变了什么:把「VLA」从 RT-2 的单点术语,扩成一个可被系统组织的研究领域框架;后续大量 VLA 综述(RL-VLA、efficient-VLA、action-tokenization 视角、pure-VLA 等,README 已列 10+ 篇)延续或对话其分类。arXiv 从 2024-05 滚到 2026-05 的 v8,并入选 IEEE TNNLS,说明其作为「活文档」被长期维护。
作者自陈的挑战/局限(§VI):安全(需 guardrail/风险评估/HRI 协议、可解释性);数据集与 benchmark 覆盖不足、需超越成功率的细粒度指标;VLA 基础模型泛化仍远不及 NLP 的 LLM;多模态对齐(是否只靠 embedding 存疑;audio/haptics/gaze 等模态引入复杂度);长程任务框架(分层复杂、两大模型冗余、模块化非即插即用);实时响应;多智能体协作;伦理社会影响;应用面窄(多集中家庭/工业,医疗等高安全场景待拓展)。综述本身的局限:约 400 篇的自动检索可能有漏检/误检(作者主动征集勘误)。
原始链接
- arXiv 摘要页:https://arxiv.org/abs/2405.14093
- arXiv PDF(v8, 2026-05-01):https://arxiv.org/pdf/2405.14093
- IEEE TNNLS DOI:https://doi.org/10.1109/TNNLS.2025.3650584
- 官方仓库 Awesome-VLA:https://github.com/yueen-ma/Awesome-VLA
一手源存档(sources/)
- vla-survey-embodied-ai—github-readme.md — Awesome-VLA 官方 README 快照(含定义、Trends 约 400 篇统计、分类学、相关综述清单)
- arXiv 全文 PDF(2405.14093v8)为 arXiv 原文,不入 git,见上方 PDF 链接