一句话定位
中科院自动化所团队发表在《自动化学报》(中文期刊,英文摘要/图表)上的 VLA 综述:从”具身操作三要素——操作环境、机器人本体、进化算法”这一具身智能框架出发,把 VLA 相关工作沿模型架构、训练数据、预训练方法、后训练方法、模型评估五个维度系统盘点,并专门补上此前综述普遍缺失的”模型评估”一环(真实环境 / 仿真器 / 世界模型三种评估范式),最后归纳出泛化能力、精细操作、实时推理三大待解挑战。
背景与定位
作者李浩然、陈宇辉、崔文博、刘卫恒、刘锴、周明才、张正涛、赵冬斌,分属中国科学院自动化研究所、北京中科慧灵机器人技术有限公司、中国科学院大学人工智能学院,受国家自然科学基金(62136008、62173324)资助。论文 2025-08-25 投稿、2025-11-06 录用,发表于《自动化学报》(Acta Automatica Sinica,DOI 10.16383/j.aas.c250394),arXiv 标注”in Chinese language”——正文为中文,图表标题与摘要为中英双语。v1 于 2025-08-21 提交(3,634 KB),v2 于 2025-11-12 修订(9,883 KB)。
论文在引言中用一张对比表把自己放进已有 5 篇 VLA 综述的坐标系里:Ma et al.(2024)梳理了 2024 年前的 VLA 方法,但技术路线随后已大幅迭代,且模型评估只谈仿真基准;Sapkota et al.(2025)从概念、架构、训练、应用角度较全面地综述了 2025 上半年前的 VLA;Zhong et al.(2025)专门从”动作空间/动作分词”视角切入;Xiang et al.(2025)从人类运动学习类比的角度梳理 VLA 后训练方法;Din et al.(2025)梳理了模型结构、发展历程与训练数据,并用成功率和零样本泛化做定性评估。本文自陈与上述工作的区别在于:从具身智能系统的环境、本体、进化算法三大核心要素出发,把 VLA 拆解为模型结构(对应本体的基础硬件+基础智能)、训练数据(对应环境中的数字/物理数据)、预训练与后训练方法、模型评估(对应进化算法)共五个维度,并首次系统补上模型评估这一环。
论文把 VLA 发展史划分为三个阶段(第 2 节,图 2 时间线):萌芽阶段——VLA 概念尚未提出,但已有基于 CNN/RNN 的语言条件模仿学习(CLIPort 结合 CLIP 语义表征与 Transporter 空间推理、BC-Z 用 FiLM 融合 ResNet 特征);探索阶段——2023 年 7 月 rt-2 首次提出 VLA 概念并推出 55B 参数模型,open-x-embodiment(OXE)汇聚 21 家机构、1M+ 轨迹、22 种机器人形态的数据集随后发布,octo、HPT、rdt-1b 相继探索轻量化与跨形态骨干,同时”继承 LLM/VLM 权重”成为主流(RT-2 继承 PaLM-E、RoboFlamingo 继承 Flamingo、openvla/cogact 继承 LLaMA、pi0 继承 PaliGemma);快速发展阶段——2024 年底起,分层架构(S2 慢速场景理解 + S1 快速动作生成)与跨域联合训练成为解决”虚假遗忘”问题的主流方案,同时空间/触觉/力等新模态、思维链增强、推理效率优化多线并进。
本文四点自陈贡献:(1) 提出萌芽/探索/快速发展三阶段历史框架;(2) 把预训练方法归纳为单一领域训练、跨域分阶段训练、跨域联合训练、思维链增强四类;(3) 把后训练方法归纳为监督微调、强化微调、推理扩展三类;(4) 首次从真实环境、仿真器、世界模型三个角度系统盘点 VLA 模型评估现状。
模型架构
论文不提出新模型,而是把主流 VLA 拆解为三段式流水线(观测编码 → 特征推理 → 动作解码),并单列”分层系统”作为架构变体(第 3 节,图 3):
观测编码(§3.1):
- 彩色图像:早期用 CNN(Octo 用简单 CNN、CLIPort 用 ResNet-50、rt-2 前身 RT-1 用 EfficientNet-B3、ACT 用 ResNet-18),逐步转向 ViT——RT-2 用 PaLI-X 视觉编码器,随后 DINOv2+SigLIP 联合表征成为趋势,pi0/π0.5/π0-FAST 直接复用 PaliGemma 的视觉编码器。
- 几何信息:3D-VLA、FP3、PointVLA、CL3R、QDepth-VLA 直接编码点云/深度,但受限于三维具身数据规模难以对齐二维语义;OG-VLA、BridgeVLA、spatialvla、Lift3D 转而用二维编码器辅助三维理解——SpatialVLA 提出 Ego3D 位置编码,OG-VLA/BridgeVLA 借鉴 RVT/RVT-2 把点云投影到正交视图上复用成熟 2D 编码器。
- 触觉/力:TLA、VTLA 在触觉模态上微调 Qwen-VL 的 ViT 模块;Tactile-VLA 用 MLP 把连续触觉测量融合成一个特征令牌后与视觉/语言令牌拼接;ForceVLA 用线性投影编码六维力/力矩信号,并引入 MoE 融合视觉-语言-力三模态。
特征推理骨干(§3.2):Transformer 由 rt-2 首次引入 VLA;Diffusion Transformer(DiT)路线下 rdt-1b 用 QKNorm+RMSNorm 解决大规模训练数值不稳定问题,groot-n1 与 TriVLA 都用 DiT 作为 S1(动作专家)骨干;MoE 路线下 chatvla 用 MoE 替换 FFN 隔离图文理解与机器人控制两类任务,chatvla-2 进一步引入动态混合专家架构缓解知识遗忘;Mamba 路线下 RoboMamba 利用线性推理复杂度换取更快的多模态序列推理速度。
动作解码(§3.3):动作空间分末端相对位姿(跨形态易统一,rt-2/Octo/openvla 等采用)与关节角度空间(免逆运动学但跨形态难泛化,rdt-1b/pi0 采用)两类;动作分布建模分离散(均匀分箱、SpatialVLA 的自适应动作网格基于数据集动作分布拟合高斯再按概率密度划分网格、BeT 的 k-means 聚类、VQ-BeT 的残差向量量化、FAST 把时序压缩与 NLP 分词结合、在 15 种机器人形态上验证有效)与连续(ACT 用条件变分自编码器建模多模态行为、Diffusion Policy 首次把扩散模型引入策略建模、pi0/π0.5 用流匹配直接预测去噪向量场以减少采样步数)两类;HybridVLA 融合扩散连续动作与自回归离散动作,π0 团队提出联合训练机制——用 FAST 离散动作做表征学习加速收敛、连续动作做推理时精确控制,并用梯度隔离阻止连续动作训练时污染 VLM 骨干。
分层系统(§3.4):区别于单层 VLA 用单个 Transformer 同时处理任务理解与动作生成,分层架构把长时域任务理解(S2,通常是预训练 VLM)与短时域动作生成(S1)拆成两个模型,通信原语分三类——文本语言(Hi Robot 用一个模型把复杂指令拆成原子指令、DexGraspVLA 直接用语言生成抓取目标位置)、动作轨迹(S2 生成长时域轨迹作为 S1 条件)、隐空间向量(HiRT 池化 S2 特征作为 S1 条件、groot-n1 用交叉注意力融合、GO-1 设计隐空间规划作为跨领域数据的桥梁);TriVLA 在 S2/S1 之间额外嵌入视频预测模块作为 S3(运动感知),构成三层系统。
数据
论文借用英伟达 groot-n1 提出的”数据金字塔”概念,把 VLA 预训练数据细分为互联网图文数据、视频数据、仿真数据、真实机器人数据四类(第 4 节,表 2):
- 互联网图文数据:COCO(330k 图片,80 类目标+91 种材料标注)、CapsFusion(120M 图文对)、LAION-400M(400M 图文对)、PixMo(712k 图像,1.3M 描述)、TextVQA(28k 图片/45.3k 问题/453k 回答)、VQAv2(265k 图片/443k 问题/4.43M 回答)、GQA(22.6M 问题/113K 图像,侧重组合推理)、WebLI(覆盖 36 种语言、13 亿图文对)——多数 VLA 并不显式用这些数据,而是通过继承预训练 VLM 权重间接获得。
- 视频数据:Ego-4D(3670 小时,74 地点/9 国家/931 名参与者第一人称视角)、Ego-Exo-4D(在 Ego-4D 基础上扩展多视角同步捕捉,1286 小时)、EPIC-KITCHENS-100(100 小时/20M 帧,45 个厨房环境,90k 动作)、HowTo100M(136M 视频片段,教学视频)、Kinetics-700(650k 视频,700 类人类动作)、Something-Something V2(220k 视频片段,174 种基本动作)。三种利用方式:视频预测辅助任务、关键点检测映射人手动作到机械臂空间生成动作标签、自监督学习隐式动作标注。
- 仿真数据:RoboCasa(RoboSuite 上构建,120+ 厨房场景、2500+ 3D 物体、100k+ 条机生轨迹)、SynGrasp-1B(Isaac Sim,10B 帧、10k 物体实例/240 类别,光追渲染+域随机化)、robotwin-2(多模态大模型+仿真在环反馈自动生成专家轨迹,731 物体实例/147 类别资产库,100k+ 条专家轨迹,覆盖 50 种任务/5 种机器人形态)、DexMimicGen(从少量人类演示自动合成灵巧双手轨迹,21k 轨迹,9 个任务)、FetchBot(Isaac Gym 上的 UniVoxGen 体素场景生成,数十万条轨迹)。
- 真实机器人数据:Bridge/Bridge Data V2(WidowX,10/24 个环境,71 个厨房任务,7.2k/60k 条轨迹)、droid(13 家机构联合,76k 条轨迹/350 小时交互数据,564 个场景/86 种任务,同步视觉+力觉+关节轨迹)、rdt-1b(300+ 挑战性任务、6k+ 条自采轨迹,整合含 RT-1 在内 5 个公开数据集共 1M 条轨迹用于预训练)、RoboMIND(107k 条成功轨迹+5k 失败轨迹,479 种任务/96 种物体类别/38 种操作技能)、agibot-world-colosseo(智元机器人,1M+ 条人工遥操轨迹,217 种任务/87 种技能,另有表 2 口径为 2976.4 小时交互数据/100+ 真实场景/3000+ 日常物品,80% 为长程任务)、open-x-embodiment(OXE,谷歌汇聚 60 个公开数据集,22 种机器人形态、527 种技能、160k 项任务、1M+ 条轨迹,RLDS 标准化格式)、RH20T(上海交通大学,110k 个密集接触操作序列/50M 帧,4 种机械臂×4 种夹爪×3 种力传感器共 7 种硬件组合,147 种任务/42 种技能)、ARIO(鹏城实验室,整合 2D 图像/3D 点云/声音/文本/触觉 5 种模态,3M 条轨迹)、Mobile ALOHA(500 条轨迹,双臂移动操作)、FrodoBots-2k(2k 小时交互数据,覆盖 10+ 城市的移动机器人导航数据)。
论文指出:相比 LLM/VLM 预训练数据规模,机器人数据在物体种类、视角、场景多样性上仍差距悬殊;仅用机器人轨迹数据训练会导致严重泛化问题;目前轨迹数据模态仍以视觉+本体状态为主,缺乏深度/触觉/听觉/力觉等多维信息。
训练方法
预训练(第 5 节)分四类:(1) 单一领域数据训练——Octo 在 OXE 上预训练再任务微调,rdt-1b 先在公开数据集预训练再在自采双臂数据上微调,局限是数据多样性远不及大模型预训练数据;(2) 跨域分阶段训练——openvla 继承 LLaMA 权重对齐视觉编码器与动作序列;利用视频数据的路线包括 UniPi(文本条件视频生成+逆动力学模型)、GR-1/GR-2(视频预测与动作生成联合训练,GR-2 引入 VQ-GAN 处理多视角)、LAPA(用 VQ-VAE 从视频连续帧学习离散潜在动作,再用少量机器人数据映射到真实动作)、GO-1(VQ-VAE+图像重建构建隐空间桥接文本-图像-视频到机器人动作)、univla(把图像变化分解为动作导致与外部因素导致两部分,构建任务中心的隐动作空间)、EgoVLA/Being-H0(用第一人称人类手部动作数据预训练再少量真机数据微调);(3) 跨域数据联合训练——早期 GATO 融合 604 个任务联合训练一个策略;UP-VLA 结合多模态理解与未来预测两个任务;chatvla 用 MoE 隔离机器人控制与环境理解任务,chatvla-2 用动态混合专家进一步保持 LLM 完整架构;(4) 思维链增强——ECoT 强制模型先做任务分解/子任务规划再生成动作,EMMA-X 用 VLM 标注运动轨迹与空间状态生成更精细推理,RAD 用语言推理同时利用带思维链的机器人数据与无动作人类视频,DiVLA 通过推理注入模块把推理结果注入动作解码网络;为控制推理带来的延迟,OneTwoVLA 用特殊令牌让模型只在关键时刻思考,ECoT-Lite 训练时随机丢弃推理步骤,Fast ECoT 通过缓存复用中间推理步骤实现推理与动作生成的部分并行。
后训练(第 6 节,表 3)分三类:(1) 监督微调——目前最广泛使用,代表工作 pi0(流匹配动作解码器)、GO-1(MoE+少量真机数据快速适应新场景)、groot-n1(双系统架构,兼顾反应速度与规划能力)、GR-1/GR-2/GR-3(依次增强视频自监督规模与跨环境泛化)、Helix(首个人形 VLA,上半身高频连续控制)、HPT(分层提示微调,拆分层次化结构与语义文本两路提示);数据采集分主-从臂映射、动作捕捉映射、末端映射(斯坦福团队设计不依赖机械臂的采集方案)三大类,局限是遥操作数据一致性差、连续决策任务存在复合误差。(2) 强化微调——分两条路线:用 RL 训练小模型/收集数据再监督微调(RIPT-VLA 用 RLOO 估计 PPO 值函数,1-demo 起点仿真中成功率提至 97%;RLDG 把 RL 自监督轨迹蒸馏回大模型),或直接用 RL 微调 VLA 权重(ConRFT 两阶段+人在回路在线强化微调,45–90 分钟内把任务成功率提升至 96%;GRAPE 用 VLM 分解子目标+DPO 做轨迹级偏好对齐;TGRPO 在 GRPO 基础上融合时间步级与轨迹级奖励;VLA-RL 用微调后的 VLM 作过程奖励模型缓解稀疏奖励)。(3) 推理扩展——V-GPS 用离线 RL 值函数对采样动作打分选优;FOREWARN 用 VLM 评估候选动作规划避免奖励函数设计;ITPS 允许人类交互式输入轨迹偏好引导扩散过程;RoboMonkey 提出”采样-验证”框架并证明动作误差与采样数量近似符合幂律关系,为测试时扩展提供理论基础;Hume 在分层系统 S2 训练值函数评估动作序列质量。
Infra(训练 / 推理工程)
本文为纯综述,不训练自有模型,未披露任何 GPU 数量、GPU-hours、并行策略或训练精度数字。第 9.3 节以定性方式讨论了 VLA 实时推理面临的三个挑战:模型继承 VLM 权重导致参数量/计算量偏大,难以在机器人有限算力上满足高频实时控制;机器人本体算力远不及云端算力池;模型部署方式不合理会导致算力资源利用不充分。论文归纳了两类缓解方向:(1) 不改变吞吐量的前提下提高动作输出频率——动作分块机制(预测未来多个时间步动作,用历史预测动作缓解推理延迟,但对高动态环境响应不足)、异步分层机制(上层大模型推理场景信息、下层小模型高频生成动作,兼顾云端与端侧算力,但对训练方式和通信实时性提出更高要求);(2) 对 VLA 模型本身做精简(如 SmolVLA)、量化(如 BitVLA)与高效推理优化。全文未给出任何模型的具体推理 FPS/控制频率/边缘硬件延迟数字。
评测 benchmark
论文把评估方法分三类(第 7 节):
真实环境评估(表 4,来自 RoboArena 在 droid 场景基础上的众包双盲测试,指标为”能力对数” Score,越高越强):π0.5-DROID 最优(Score 1883,SD 26.1,339 次双盲测试),其后依次为 PaliGemma-FAST-specialist-DROID(1851)、π0-FAST-DROID(1814)、PaliGemma-VQ-DROID(1765)、PaliGemma-FAST-DROID(1759)、PaliGemma-Diffusion-DROID(1585)、DAM(1213)、π0-DROID(894)、PaliGemma-Binning-DROID(734)。结论:FAST 离散化整体优于均匀离散化与 VAE 离散化;模型对视角/光照/背景鲁棒、颜色形状识别强,但工具使用、布料操作、插入/堆叠等精细对齐任务成功率低。
仿真器评估(表 5-7):常用仿真基准包括 CALVIN(PyBullet,Franka Panda,长序列语言指令桌面任务)、FrankaKitchen(MuJoCo)、spatialvla 引用的 SimplerEnv(SAPIEN,WindowX/Google Robot 双机器人)、libero(MuJoCo,130 个终身学习任务)、Meta-World(50 种元学习任务)、RLBench(100 种带语言标注任务)、RoboMimic。
- LIBERO 上任务成功率(Spatial/Object/Goal/Long/Average):Hume 最优(97/99/99/97/98%),其后 π0(97/99/96/85/94%)、BitVLA(97/99/94/88/94%)、GR00T N1(94/98/93/91/94%)、univla(97/97/96/92/95%)、OpenVLA-OFT(96/98/96/91/95%)、SmolVLA(89%)、TriVLA(87%)、π0-FAST(86%)、CoT-VLA(84%)、Fast ECoT(80%)、UniAct/SpatialVLA(78%)、NORA(74%)、SP-VLA(75%)、openvla(77%)、WorldVLA(67%)。
- SimplerEnv 上(Google Robot 三任务 + WidowX 四任务):Hume 在 Pick Coke Can 达 97%、Move Near 80%;CogACT 在 Open/Close Drawer 达 72%、Put Eggplant in Basket 达 68%;spatialvla 在 Put Object in Drawer 达 75%;RoboVLMs 在 Put Carrot in Plate 达 79%;univla 在同项达 81%;早期模型如 RT-1(3–14%)、openvla(0–46%)、Octo-Base(0–43%)普遍偏低。
针对真实环境评估的公平性与可扩展性问题,论文还介绍了 FMB(66 种可 3D 打印标准化物体集+开源模仿学习框架建立可复现体系)、Star-GEN(视觉-语义-行为三模态定义 22 个泛化轴与 7 个任务类别)、AutoEval(自动化场景重置+成功检测,全天候自主评估)、RoboEval(轨迹/空间/协调三类细粒度行为指标)、INT-ACT(用意图评估任务理解与推理能力,也在仿真侧扩展了 SimplerEnv 的物体多样性/语言复杂性/场景复杂度)、AGNOSTOS(在 RLBench 上按训练重叠度设置两级未见任务难度,发现现有 VLA 跨任务泛化能力严重不足)、VLATest(视觉匹配增强的 Maniskill2,评估 7 个流行 VLA 模型)。
世界模型评估(第 7.4 节):1XWM 是首个预测人形机器人接触与全身操作的世界模型;Vid2World 改造预训练视频扩散模型使其能根据机器人动作生成图像,用于评估 RT-1;WorldEval 用 LoRA 微调视频生成模型,把 VLA 解码前的动作表征输入世界模型评估 openvla 和 pi0,结果与真机评估呈强相关性。论文指出该路线仍处起步阶段,视频生成式世界模型无法建立准确物理交互关系,且对分布外动作响应能力有限。
产业界 VLA 模型盘点(表 8):国外——Google(RT-2、Gemini Robotics,通用桌面操作)、NVIDIA(groot-n1、GR00T N1.5,人形移动操作)、Figure AI(figure-helix,家居/工业/物流场景)、Physical Intelligence(pi0、π0.5,家居场景);国内——字节跳动(RoboFlamingo、GR-1、bytedance-gr-2、GR-3,通用桌面操作场景)、阿里巴巴(RynnVLA-001,桌面操作)、美的(dexvla、chatvla、chatvla-2,通用桌面操作场景)、银河通用(GraspVLA,桌面抓放场景)、智元(GO-1,桌面操作场景)、星海图(G0,移动操作场景)、星尘智能(DuoCore-WB、ControlVLA,移动操作/家居场景)、自变量(WALL-OSS,桌面操作场景)、灵初智能(DexGraspVLA,桌面操作场景)。
创新点与影响
贡献:(1) 首次按萌芽/探索/快速发展三阶段梳理 VLA 发展史,并标注每阶段的架构与数据里程碑;(2) 把预训练方法系统归纳为单一领域训练/跨域分阶段训练/跨域联合训练/思维链增强四类,指出跨域联合训练与思维链增强是更有潜力的方向;(3) 把后训练方法归纳为监督微调/强化微调/推理扩展三类,指出监督微调是主流但面临复合误差与数据一致性问题,强化微调虽有更高性能上限但训练难度大、尚无里程碑式工作;(4) 首次系统补上”模型评估”维度,从真实环境(RoboArena 能力对数指标)、仿真器(LIBERO/SimplerEnv 等)、世界模型(1XWM/Vid2World/WorldEval)三个角度盘点评估现状与工具链空白。
三大待解挑战(第 9 节,论文自陈):
- 泛化能力——视觉泛化(对背景/光照/视角变化敏感)、形态泛化(跨机器人形态难以共享同一参数)、任务泛化(现有工作发现 VLA 几乎不具备跨任务泛化能力)三个维度均面临瓶颈;论文指出突破口可能在于跨域数据联合训练、大规模合成数据预训练与多传感器融合。
- 精细操作——密集接触的精细操作任务成功率低,原因一是遥操作数据的动作一致性差导致模型拟合难度高,二是现有 VLA 缺乏触觉/力等模态难以理解”轻轻地""用力地”等修饰性交互;论文提出高质量数据采集与离线强化学习(避免对不一致动作做均匀化)是可能方向。
- 实时推理——VLA 继承 VLM 的大参数量与机器人有限算力之间存在结构性矛盾;论文归纳动作分块、异步分层、模型精简/量化三条缓解路径,但均需在速度与泛化能力/规划能力之间做权衡。
论文最后指出:VLA 目前产业关注度虽高,但大部分工作仍处研究阶段,尚未形成规模化落地验证,建议先在仓储物流、无人商超等相对封闭场景小范围商业化,再逐步向开放场景扩展,积累场景数据以转动”数据飞轮”。
原始链接
- arXiv 摘要页:https://arxiv.org/abs/2508.15201
- arXiv PDF:https://arxiv.org/pdf/2508.15201
- DOI(自动化学报正式发表版):https://doi.org/10.48550/arXiv.2508.15201
一手源存档(sources/)
- 本篇为纯 arXiv 综述预印本(中文正文,发表于《自动化学报》),未见配套官方博客、GitHub 仓库、HF/ModelScope 模型卡或独立项目页可供归档;一手原文(arXiv PDF,含 v1/v2 两版)不入 git,见上方”原始链接”。