一句话定位

哈尔滨工业大学(深圳)团队撰写的首篇专门聚焦”大型 VLM 驱动”这一子范式的机械臂操作 VLA 综述:提出”Monolithic(单/双系统)vs. Hierarchical(规划器-only / 规划器+策略)“二级分类法,把 242 篇引文按架构、进阶方向(RL/免训练/人类视频学习/世界模型)、特性、数据集与未来方向系统归档。

背景与定位

作者 Rui Shao、Wei Li、Lingsen Zhang、Renshan Zhang、Zhiyang Liu、Ran Chen、Liqiang Nie 均来自哈尔滨工业大学(深圳)计算机科学与技术学院。论文 2025 年 8 月 18 日提交 arXiv v1(cs.RO,2508.13073),GitHub 配套仓库标注”Under Major Revision at IEEE TPAMI”(截至抓取时仍在 TPAMI 审稿中)。

论文给出一个明确定义区分”大型 VLM 驱动的 VLA”与更早期的 VLA 工作:模型需同时满足 (1) 用大型 VLM 理解视觉观测与自然语言指令;(2) 其推理过程直接或间接服务于机器人动作生成。基于此定义提出两大范式:

  • Monolithic Models(单体模型):感知、语言理解、动作生成融合在同一(或紧耦合两个)系统内,进一步分单系统(如 openvlart-2)与双系统(VLM 骨干 + 独立动作专家,如 groot-n1bytedance-gr-3)。
  • Hierarchical Models(分层模型):显式解耦规划与执行,规划器输出可解释的中间表征(关键点/子任务/程序),策略模块据此生成可执行动作;进一步分 Planner-Only 与 Planner+Policy。

作者指出此前综述要么偏 VLM 侧(如多模态大模型综述),要么偏机器人操作侧,缺乏二者交叉地带的系统梳理:Ma et al.(arXiv:2405.14093)综述 VLA 架构但未聚焦”大型 VLM 驱动”这一近年主导范式;Sapkota et al.(arXiv:2505.04769)覆盖自动驾驶/AR 导航/精准农业等广泛 VLA 应用,稀释了机器人特有挑战(实时执行约束、传感器噪声、长时决策)的深度;Wang et al. 的早期综述聚焦纯文本 LLM 做任务规划,未处理 VLM 在视觉感知与动作决定上的落地问题。本文即填补这一缺口,与本库 embodied-benchmark-surveyefficient-vla-models-surveydexterous-manipulation-imitation-survey 等其他视角的 VLA 综述互为参照——后两者分别聚焦评测基准与效率优化,本文聚焦”VLM 驱动”这一架构范式本身的分类学。

模型架构

论文本身不提出新模型,而是把已发表 VLA 方法按架构范式系统分类(Table I-III,共收录约 70 个代表性模型):

单系统模型(Table I):VLM 同时处理视觉/语言/机器人状态并直接解码动作。

  • 经典范式:自回归解码(AD)——rt-2(PaLI-X/PaLM-E 骨干,把动作离散化为文本 token 与网络级视觉-语言数据共训);RT-2-X(ViT-22B + UL2,在 Open X-Embodiment 上做跨机器人共微调);openvla(DINOv2+SigLIP 视觉编码器 + LLaMA2-7B,替换 RT 系列大参数视觉编码器后用更少参数取得更优性能,成为后续研究的常用基线)。
  • 模型能力增强的范式衍生(三方向):
    • 感知模态扩展——LEO agent(ConvNext + Vicuna-7B,接 PointNet++ 3D 点云);SpatialVLA(SigLIP+Gemma2,Ego3D 位置编码把 2D 深度反投影为自我中心 3D 坐标);BridgeVLA(SigLIP+Gemma,RGB-D 重建点云生成三正交投影视图);TraceVLA(叠加运动轨迹点生成”Trace”信息);4D-VLA(InternVL-4B,融合 3D 坐标+关键帧记忆库);ST-VLA(PaliGemma2,融合历史 Trace + 空间深度,在部分任务上超越 SpatialVLA 与 TraceVLA);VTLA(Qwen2-VL-7B,触觉编码对齐视觉序列构建”Vision-Tactile-Language-Action”);VLAS(CLIP+Vicuna-7B,Whisper Encoder 引入语音模态);FuSe(PaliGemma-3B,对齐 Touch/Audio 与语言概念)。
    • 推理能力增强——ECoT(DINOv2+SigLIP+LLaMA2-7B,链式推理结合高层规划与视觉落地特征);CoT-VLA(VILA-U 骨干,视觉链式推理预测子目标观测图像);LoHoVLA(SigLIP+Gemma-2B,层级闭环控制处理长时程任务);ReFineVLA(SigLIP+Gemma2,选择性迁移微调仅上层)。
    • 泛化能力增强——UniAct(LLaVA-0.5B,“通用动作码本”抽象异构机器人动作实现跨具身推理);ReVLA(DINOv2+SigLIP+LLaMA2-7B,可逆训练逐步恢复视觉编码器原始预训练状态,缓解灾难性遗忘);HybridVLA(LLaMA2-7B,融合扩散与自回归解码 + “协作动作集成”机制自适应选择);VOTE(DINOv2+SigLIP+LLaMA2-7B,按相似度对历史动作预测分组投票,平衡响应性与稳定性);WorldVLA(Chameleon 骨干,统一自回归框架内联合世界模型与动作模型互相增强);UnifiedVLA(Emu3 骨干,把世界模型预测作为后训练任务从无标注视频学习物理动态);UP-VLA(ViT+VQ-GAN,Phi1.5-1.3B,预训练阶段预测下一帧图像隐式学习物理动态)。
  • 推理效率优化范式(三方向):
    • 架构优化——MoLe-VLA(DINOv2+SigLIP+LLaMA2-7B,时空感知路由器 STAR 动态选择激活的 LLM 层);DeeR-VLA(CLIP ViT-L/14 + MPT-1B/7B,多重早退出口,比较相邻退出一致性判断是否提前终止);RoboMamba(CLIP/SigLIP ViT-L + Mamba-2.8B/1.4B,线性复杂度带来 >3× 推理加速)。
    • 参数优化——BitVLA(SigLIP b1.58 + BitNet b1.58 2B4T,首个”1-bit”权重 VLA 模型,蒸馏感知训练量化视觉编码器);NORA(Qwen2.5-VL-3B + FAST+ 分词器,证明精心设计的小模型可超越更大模型)。
    • 推理加速——RoboFlamingo(ViT+MPT-1B,独立 MLP 动作头单次前向生成堆叠动作);OpenVLA-OFT(DINOv2+SigLIP+LLaMA2-7B,双向注意力掩码替代因果掩码单次前向填充动作嵌入);PD-VLA(CLIP ViT-L + Vicuna1.5-7B,把自回归解码重构为不动点迭代的非线性方程组实现并行解码);Spec-VLA(DINOv2+SigLIP+LLaMA2-7B,“Relaxed Acceptance” 推测解码相对基线 1.42× 加速);FlashVLA(DINOv2+SigLIP+LLaMA,FlashTrigger 评估动作/环境稳定性决定是否跳过当前推理)。

双系统模型(Table II):System 2(VLM 骨干,慢速深度推理)+ System 1(动作专家,快速反应),二者通过潜在表征传递信息(不产生人类可解释中间输出,区别于分层模型)。

  • 级联式(Cascade-based)——groot-n1(Eagle-2 骨干 + DiT 动作模型,端到端联合训练);CogACT(OpenVLA 骨干 + DiT,自适应动作集成算法平滑轨迹);RoboDual(OpenVLA 通才推理 + DiT 专家控制);HiRT(InstructBLIP,System 2 低频运行提取长期场景理解,轻量视觉动作策略高频部署);Fast-in-Slow(Prismatic 骨干,动作专家复用 VLM 最终若干 Transformer block,两系统不同频率运行于同一预训练模型内);ChatVLA / ChatVLA-2(Qwen2-VL,MoE 共享注意力分离感知/控制 FFN,ChatVLA-2 增加动态 MoE 路由与 Reasoning-Following MLP);TriVLA(Eagle-2,三模块含视频生成模型预测未来帧作为”System 3”);VQ-VLA(OpenVLA 骨干,卷积残差 VQ-VAE 替代 OpenVLA 的分箱动作离散化,随仿真数据增多呈线性性能提升且 sim-to-real gap 更小)。
  • 并行式(Parallel-based)——共享注意力架构(MoE 风格):π0(PaliGemma 骨干 + 从零训练的流匹配动作专家);π0-FAST(DCT 驱动动作分词支持高效自回归训练);π0.5(在 π0 基础上先把高层提示转为更细粒度子任务预测再喂入双系统);π0.5-KI(训练时阻断动作专家梯度回传 VLM 骨干,保护 VLM 知识优势);ForceVLA(π0 骨干 + FVLMoE 引入力觉模态);OneTwoVLA(π0 骨干,可在显式推理与基于最近推理生成动作两种模式间切换,支持两系统异步运行)。交叉注意力架构:SmolVLA(冻结轻量 SmolVLM-2 骨干 + 仅训练下游流匹配 Transformer 动作专家);GR-3(Qwen2.5-VL 骨干,流匹配统一视觉-语言理解与机器人轨迹学习)。

分层模型(Table III):规划器输出关键点(K)/子任务(S)/程序(P)等可解释中间表征,策略据此生成动作。

  • Planner-Only:程序类——CoM(Gemini 1.5 Pro,多轮多模态提示生成可执行 Python 程序复现任务)、Instruct2Act(ChatGPT,生成调用 API 的 Python 代码);关键点类——MoManipVLA(OpenVLA-7B 预测路点后接双层轨迹优化)、RoboPoint(Vicuna-v1.5-13B 解析指令生成视觉关键点)、ManipLVM-R1(Qwen2.5-VL-3B,GRPO 训练同时预测抓取可供性区域与目标轨迹);子任务类——PaLM-E(PaLM 骨干,统一通用 VQA 与机器人指令生成)、Embodied-Reasoner(Qwen2-VL-7B,Observation-Thought-Action 轨迹)、Reinforced Planning(Qwen2.5-VL-7B,SFT 后接 GRPO 强化微调提升未见场景泛化)、RoboBrain(LLaVA + A-LoRA/T-LoRA 模块统一规划/可供性/轨迹预测)。
  • Planner+Policy:关键点类——HAMSTER(VILA-1.5-13B 预测轨迹关键点串成带渐变色的有序路径叠加给策略,相对 OpenVLA 在七个泛化维度上提升 20% 成功率)、ReKep(GPT-4o 把 DINOv2+SAM 关键点转为代价函数再由优化器求解)、A0(Qwen2.5-7B,具身无关的可供性表征:接触点+接触后运动);子任务类——HiRobot(PaliGemma-3B 规划器 + π0 策略)、DexVLA(Qwen2-VL 规划器 + 最高 1B 参数扩散动作头 + 三阶段训练配方,在长时程复杂操作任务上超越 OpenVLA 和 π0 等基线)、PointVLA(在 DexVLA 基础上加点云编码器+注入器增强空间感知)、RT-H(PaLI-X 55B 骨干,用语言化”动作原语”作为中间层构建动作层级)、RoboMatrix(Vicuna 1.5,三层:调度层生成子任务序列/技能层编码可复用行为/硬件层执行控制)。

数据

第 7 章按四类系统梳理 VLA 训练与评测所用的数据资源:

  • 真实机器人数据集:BC-Z 覆盖 100 个任务的语言标注专家示范;RT-1 及其厨房变体扩展到 700+ 项日常活动;RT-2 引入网络级视觉-语言数据扩充词汇与指令泛化;BridgeData V2 与 RH20T 通过大规模语言标注示范增强跨域泛化,RH20T 支持跨 147 个任务的单样本学习;DROID 提供”in the wild”遥操作示范,覆盖 564 个任务的多样视觉场景;OXE(Open X-Embodiment)统一 22 个机器人平台、500+ 项技能上的 超过 100 万条多模态示范,是迈向网络级跨具身泛化的关键一步。作者指出开放世界物体/场景/技能的长尾分布仍未被充分覆盖,真实数据仍需进一步扩大规模与多样性。
  • 仿真数据集与基准:BEHAVIOR(杂乱家居环境多步语义控制)、ALFRED(第一人称语言指令长时程任务)、RLBench(RGB-D 桌面操作精细策略学习)、RLBench2(扩展到双臂操作+语言条件动作预测)、Meta-World / Franka Kitchen / LIBERO(多技能场景,配语言标注与视觉-语言奖励)、CALVIN(无约束语言指令多阶段操作)、MIKASA-Robo(部分可观测下的记忆中心挑战)、SIMPLER(校准仿真环境对齐真实机器人配置,缩小 sim-to-real gap)、Habitat/SAPIEN(高保真 3D 环境支持空间推理)、COLOSSEUM(评估分布偏移下的鲁棒性)、VLABench(通用语言条件操作评测)。
  • 人类行为数据集:Ego4D、Ego-Exo4D、EgoPlan-Bench、EgoVid-5(第一人称日常活动视频语料);EPIC-Kitchens、COM-Kitchens(细粒度、时序结构化的烹饪任务);EgoVQA、EgoTaskQA(第一人称视频上的空间/时间/因果推理问答);EgoDex 提供 829 小时第一人称视频配稠密 3D 手指跟踪,填补 Ego4D 一类通用语料缺乏精确操作信号的空白;DexCap、EgoMimic、PH2D 提供手-物协调与具身感知策略学习的细粒度监督;R2R2R 用手机扫描+人类视频替代遥操作,生成可扩展的高保真示范流水线。
  • 具身问答/规划基准:EmbodiedQA、IQUAD(3D 环境中视觉-语言-空间导航问答的早期整合);MT-EQA(多目标推理)、MP3D-EQA(3D 点云输入增强空间落地)、EQA-MX(引入非语言线索的自然多模态交互)、OpenEQA(涵盖功能性与常识推理的开放式问题)、LoTa-Bench(在仿真中直接部署 LLM 生成的计划评估其可执行性)。

训练方法

强化学习:论文区分在线(实时交互优化策略)与离线(从预收集轨迹学习)两类,并指出 VLA 长时程(单条轨迹数百步)导致基于规则的奖励极易稀疏/不稳定,因此多数方法引入学习式稠密奖励——VLA-RL 训练机器人过程奖励模型(RPRM)预测动作序列成功概率(PPO,TC 稀疏奖励+RM 稠密奖励);ReWiND 把奖励建模为向最终目标状态的进度(离线 IQL + 在线 SAC 混合训练);Grape(TPO,DPO)与 TGRPO(GRPO)借助强大 VLM 提示生成反馈式奖励信号(TC+GPT 奖励)。为解决在线学习采样低效问题,HIL-SERL(基于 RLPD)引入训练中人在环干预;ConRFT 采用两阶段方案:离线 Cal-ConRFT(行为克隆+Q learning)初始化策略,随后在线 HIL-ConRFT 平衡监督与 RL 损失并保留人在环干预。此外 RLDG 用 HIL-SERL 把专家策略训练至 100% 任务成功率后通过 SFT 蒸馏进基础模型;iRe-VLA 交替进行在线 RL(收集新成功轨迹)与在扩充数据集上的 SFT,迭代式模仿+探索提升模型。

免训练效率方法:FlashVLA(FlashTrigger 判断动作/视觉线索稳定时跳过完整解码)、EfficientVLA(剪枝冗余语言层+过滤任务相关视觉 token+缓存中间特征)、VLA-Cache(复用静态 token 的键值缓存+任务相关性过滤+分层自适应复用)、SP-VLA(时空语义 token 剪枝 + 动作感知调度器把直觉步骤路由给轻量生成器、复杂步骤路由给完整 VLA)、PD-VLA(动作分块下自回归重构为并行不动点迭代)、FAST(离散余弦变换+字节对编码压缩动作序列,训练最多 加速 5×)、RTC(监控任务进度动态调整控制频率减少不必要计算)。

从人类视频学习:Human-Robot Semantic Alignment(配对人类-机器人视频对齐跨域视觉编码器);UniVLA(从无标注人类+机器人视频学习任务中心的潜在动作统一策略规划);LAPA(VQ-VAE 量化潜在动作在大规模视频-语言对上预训练,实现从无动作标注人类视频迁移);VPDD(在统一视频 token 上做离散扩散,通过未来动态预测促进跨域知识迁移);3D-VLA(融合人-物交互视频与机器人示范做更丰富的 3D 推理);Humanoid-VLA(利用姿态恢复的在线视频运动轨迹增强运动多样性)。

世界模型驱动的 VLA:WorldVLA(统一 token 化自回归框架内联合学习预测视觉结果与生成动作,世界模型与动作模型互相强化,支持更鲁棒的长时程规划);World4Omni(大规模世界模型生成描绘中间任务状态的子目标图像,指导模块化低层策略实现跨环境/跨具身零样本操作);3D-VLA(生成式世界模型预测未来目标图像与点云模拟场景动态);RIGVid(扩散式世界模型生成候选任务视频,经 VLM 筛选可行性后由 FoundationPose 提取夹爪位姿执行);V-JEPA 2-AC(基于海量自监督视频编码器构建的潜在动作条件世界模型,推理时基于目标图像模拟未来潜在状态实现零样本机器人操作规划)。

Infra(训练 / 推理工程)

本文是综述,不涉及作者自有的训练实验,因此没有自身的 GPU 数量/GPU-hours/并行策略/精度设置或统一口径的推理延迟表。文中作为背景引用、且能追溯到具体表述的推理效率数字仅有三处:RoboMamba 因 Mamba 线性复杂度相对 Transformer 基线实现 >3× 推理加速;Spec-VLA 的”Relaxed Acceptance”推测解码相对基线达到 1.42× 加速;FAST 的 DCT+BPE 动作分词使训练最多 加速 5×。除此以外,论文未给出统一的控制频率(Hz)、端到端延迟(ms)或边缘硬件部署实测数字(不同于同类的 efficient-vla-models-survey 专门列了 Table I 延迟/频率对比表),故其余 infra 维度标记为未披露。

评测 benchmark

本文不构建统一新基准,也不做跨方法的重新实测;文中出现的量化结果均为逐篇转述各原始工作自报的数字:DexVLA 称在长时程复杂操作任务上超越 OpenVLA 与 π0 等 SOTA 基线(未给出具体数值);HAMSTER 在七个泛化维度上相对 OpenVLA 取得 20% 成功率提升;π0.5 一类”基础 VLA”模型在新家庭环境中执行洗碗等多阶段任务时,分布外(OOD)成功率超过 90%(引自 π0.5 原论文 pi0-5,非本综述自行实测)。综述系统整理了领域内四类数据集/基准清单(真实世界、仿真、人类行为、具身问答),并对比了单/双系统模型在骨干规模上的分布(如 UniAct 用 0.5B 级 LLaVA、BitVLA 用 1-bit 三值化 BitNet b1.58 2B4T、RT-H 规划器用 PaLI-X 55B),而非提供自身统一评测的成功率表格。

创新点与影响

贡献

  1. 首篇专门针对”大型 VLM 驱动的 VLA 模型”这一子范式、面向机器人操作的系统性、分类学导向综述,填补 VLM 综述与机器人操作综述之间的交叉空白。
  2. 提出二级分类法——Monolithic(单系统/双系统)vs. Hierarchical(Planner-Only/Planner+Policy),并按中间表征类型(关键点/子任务/程序)进一步细分,统一了此前碎片化的术语体系。
  3. 横向综合四个进阶研究方向(强化学习优化、免训练方法、从人类视频学习、世界模型集成),并总结 VLA 的三大特性(多模态融合、指令跟随、多维度泛化)。
  4. 系统组织四类数据集/基准(真实机器人、仿真、人类行为、具身问答),并提出七个未来方向:数据集与评测体系、记忆机制与长时规划、3D/4D 感知、移动操作、多智能体协作、开放世界终身学习、模型效率。
  5. 维护持续更新的 GitHub 配套仓库(JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation),作为该子领域的活文档;论文本身仍在 IEEE TPAMI 大修阶段。

它改变了什么:在此之前,“大型 VLM 驱动 VLA”相关工作分散引用不同的架构定义(有的称”dual-system”、有的称”cascade”、有的与分层规划混淆);本文之后,Monolithic/Hierarchical 二分法及其四个子类为后续工作提供了统一的定位坐标系,尤其明确区分了”双系统模型的潜在表征传递”与”分层模型的显式可解释中间输出”这一此前常被混淆的边界。

论文自陈的局限/挑战(第 8 节 Future Directions,针对整个领域而非本综述自身方法论):现有仿真数据集与真实场景存在视觉复杂度落差(reality gap),真实数据采集成本高、规模与多样性受限;现有基准多聚焦短时程抓取放置任务且仅报告简单成功率,难以反映长时规划、移动操作、多智能体协作等实际挑战;多数 VLA 依赖逐帧推理,缺乏记忆机制导致短视行为;现有模型主要处理静态 2D 视觉输入,缺乏 3D/4D 时空推理能力;移动操作场景下导航与操作耦合不足;开放世界终身学习能力欠缺;模型计算/内存成本高,难以在资源受限平台部署。论文未设置针对综述本身覆盖范围或方法论的独立”局限性”讨论。

原始链接

一手源存档(sources/)