一句话定位
同济大学团队领衔(联合西南交通大学、电子科技大学、意大利特伦托大学)的 Efficient VLA 综述:第一篇覆盖”数据-模型-训练”全流程的高效 VLA 综述,把散落的加速/压缩/省数据工作统一到”高效模型设计、高效训练、高效数据采集”三大支柱下,并逐一列出具体数字(延迟、参数量、成功率提升幅度)。
背景与定位
作者 Zhaoshu Yu、Bo Wang、Pengpeng Zeng、Haonan Zhang、Zheng Wang、Jingkuan Song、Heng Tao Shen(IEEE Fellow)来自同济大学计算机科学与技术学院;Ji Zhang 来自西南交通大学计算与人工智能学院;Lianli Gao 来自电子科技大学计算机科学与工程学院;Nicu Sebe 来自意大利特伦托大学信息工程与计算机科学系。2025 年 10 月 27 日提交 arXiv v1(2026 年 2 月 2 日有 v2 修订,本文内容以 v1 全文为准)。项目主页 https://evla-survey.github.io/ 与配套 GitHub 论文列表持续更新,GitHub README 显示截至 2026 年 6 月已把 2025.11-2026.05 的新论文补入分类表。
论文开篇即用具体数字点出问题:π₀(pi0)预训练需要 10,000 小时机器人轨迹数据,OpenVLA(openvla)消耗 21,500 个 A100-GPU-小时(跑在 64-GPU 集群上)。同时综述汇总了一张延迟/频率对比表(Tab. I):RT-2-PaLI-X 55B 版本延迟 330-1000ms、控制频率仅 1-3Hz,5B 版本 200ms/5Hz;OpenVLA 7B 为 166ms/6Hz;π₀ 3.3B 为 73ms/20-50Hz;HiRobot 3B 同为 73ms/10-50Hz;groot-n1(GR00T N1)2.2B 为 63.9ms。作者据此论证:VLA 的骨干模型继承了 LLM/VLM 的计算量级,但机器人控制要求亚秒级响应,二者存在结构性矛盾,这正是”高效 VLA”这一子领域存在的理由。
论文明确把自己定位在六篇既有 VLA/具身智能综述的空白处:Ma et al. 综述涵盖 VLA 各组件(含低层控制策略与高层任务规划器)及数据集/基准,但不专门谈效率;Shao et al. 从”大型 VLM 驱动”视角梳理 VLA 架构演进,同样效率覆盖不系统;Xiang et al. 把 VLA 后训练类比人类运动学习,提出对应分类学;Zhong et al. 把动作分词器(action tokenizer)设计视为 VLA 架构核心并系统分类。作者指出 [16][17] 虽略微触及高效 VLA 相关工作,但既不全面也未形成公认分类体系,因此本文是第一篇专门聚焦”高效 VLA”、贯穿数据-模型-训练全生命周期的综述。与本库 embodied-benchmark-survey 等其他综述类工作互为参照,但后者关注的是评测基准而非效率技术本身。
模型架构
本文不提出新模型,而是把 VLA 的效率技术系统拆成两条主线(§3):高效架构与模型压缩。前置的规范 VLA 流水线是视觉编码器(ViT/SigLIP/DINOv2/CLIP)→ LLM 骨干(LLaVA/Qwen/PaLM/Gemma/Llama/Mamba/Vicuna 等)→ 动作解码器(扩散/流匹配/自回归/MLP)。
高效架构六类:
- 高效注意力——SARA-RT 用 up-training 把二次复杂度 Transformer 转成线性注意力;Long-VLA 用相位感知输入掩码(运动阶段聚焦静态相机 token,交互阶段聚焦夹爪 token);dVLA 用前缀注意力掩码配合 KV 缓存压缩扩散骨架的推理开销;RetoVLA 把丢弃的寄存器 token 重新注入动作专家做 KV 增强;KV-Efficient VLA 用轻量循环门控把历史 KV 缓存压缩成分块表征。
- Transformer 替代——RoboMamba 首次把 Mamba 用作 VLA 的语言骨干,摆脱二次复杂度瓶颈;FlowRAM 把 Mamba 与条件流匹配、动态半径调度结合。
- 高效动作解码——并行解码(OpenVLA-OFT 用双向注意力掩码单次前向预测长度 K 的动作块;PD-VLA 把自回归重构为并行 Jacobi 迭代不动点方程;CEED-VLA 放松收敛阈值做提前退出;Spec-VLA 引入带松弛接受机制的推测解码)与生成式解码(TinyVLA 首次把 Diffusion Policy 用作专用解码器;HybridVLA 把扩散与自回归共置于单一 Transformer,把 DDIM 采样压缩到 4 步;FreqPolicy 用频域一致性约束线性化概率流实现单步推理;VQ-VLA 用 VQ-VAE 离散化动作轨迹;Discrete Diffusion VLA 融合离散扩散与”易先难后”的重掩码纠错)。
- 轻量化组件——RoboMamba 的 MLP 策略头仅 370 万参数(占总参数 0.1%)即可预测 6 自由度末端位姿;TinyVLA 配对 <1.4B 参数的轻量 VLM 与扩散策略解码器;EdgeVLA / MiniVLA 用 Qwen2-0.5B SLM 骨干整合 SigLIP + DINOv2 视觉编码器组装出 1B 参数模型;CLIP-RT 复用冻结 CLIP 编码器,把参数压到 OpenVLA 7B 的 1/7(约 1B),平均成功率反而高出 24%;Diffusion-VLA 的 DiVLA-2B 用 Qwen2-VL-2B 做 VLM 骨干,单张 A6000 上跑到 82 Hz;NORA 用 Qwen-2.5-VL-3B 配合 FAST+ 动作分词器。
- 混合专家(MoE)——GeRM 首次把稀疏 MoE 用于四足强化学习;FedVLA 提出双门控 MoE(DGMoE)做双向亲和路由;TAVP 用任务感知 MoE 视觉编码器解耦跨任务特征。
- 分层系统(双系统)——HiRT/DP-VLA/SmolVLA 把慢速 VLM(System 2)与快速策略(System 1)解耦异步执行;RoboDual 用 OpenVLA 做高层规划器搭配轻量 Diffusion Transformer 专家;HAMSTER 用高层 VLM 产出 2D 轨迹指导低层策略;FiS 通过部分参数共享把 System 1 嵌入 System 2;MinD 用低频生成式世界模型规划长时程、高频扩散策略实时控制。
模型压缩三类:
- 层剪枝——RLRC 用 Taylor 重要性准则实现整体 90% 稀疏度;SmolVLA 朴素跳过 N=L/2 层;FLOWER 对编码器-解码器式 VLM(如 Florence-2)整段丢弃解码器、对纯解码器式 VLM(如 SmolFlow2-Video)剪掉末尾 30% 层。
- 量化——OpenVLA 系统验证 4-bit 训练后量化可减半 GPU 显存且不损失真实任务成功率;SQIL 用显著性感知量化在 4-bit 下接近全精度,带来 2.5× 推理加速;BitVLA 实现 1-bit 三值量化({-1,0,1})并配合蒸馏对齐视觉编码器,达到 3.36× 显存压缩;RLRC 用 RL 微调恢复剪枝后模型对后续 4-bit 量化的鲁棒性;SQAP-VLA 把 Hadamard 变换用于 Q/K 层量化前预处理,联合做量化与 token 剪枝。
- Token 优化——压缩(SmolVLA 用 pixel shuffle 把每帧视觉 token 压到 64 个;VOTE 用单个
<ACT>token 编码整段动作轨迹;FAST 用 DCT + BPE 压缩动作 token)、剪枝(FlashVLA 的 ICS 引导剪枝、EfficientVLA 的任务相关性+多样性双驱动剪枝、SP-VLA 的速度自适应剪枝比例、LightVLA 的 Gumbel-softmax 可微分选择)、缓存(VLA-Cache 缓存静态视觉 token、HybridVLA 把 KV 缓存扩展到扩散去噪迭代、CronusVLA 用 FIFO 队列缓存跨帧运动特征、AMS 维护 GPU 常驻 Context Pool)。
数据
第 5 章按五类范式梳理高效数据采集:
- 人在环采集——CLIP-RT 用自然语言遥操作接口降低专业门槛;GCENT 让人退化为”监督者”,只在检测到失败/临近失败时用回退-纠正机制介入,逐步降低介入频率,最终实现一人多机。
- 仿真数据采集——GraspVLA 构建 SynGrasp-1B,一个十亿帧级的合成抓取数据集(模块化专家策略生成无碰撞轨迹,MuJoCo 验证、Isaac Sim 渲染);GeRM 构建 QUARD-Auto(Isaac Gym 大规模并行生成四足操作数据);RoboTwin 2.0 用代码生成智能体从自然语言合成任务程序,双重反馈闭环迭代直至达到目标成功率;ReBot 用真实机器人轨迹在多种仿真场景中回放再合成背景补全的 real-to-sim-to-real 流水线;R2R2R 仅用一次手机扫描 + 一段人类示范视频合成大规模照片级真实演示;RealMirror 用轻量 WebXR 通信协议显著降低端到端时延。
- 互联网规模与跨域数据利用——SmolVLA 聚合 HuggingFace 上大量社区小规模数据集,用 VLM 自动清洗生成一致任务描述、手动统一相机视角映射,证明数据规模比 SOTA 小一个数量级依然能取得高性能;EgoVLA 构建大规模第一视角人类操作数据集并基于 MANO 参数建立人-机共享动作空间;RynnVLA-001 用姿态估计(无人脸特征点+有手部关键点)自动筛选第一视角视频;EgoScaler 直接从第一视角视频提取 6 自由度物体轨迹而无需人工标注;Being-H0 在大规模 UniHand 数据集上做基于部位级动作分词(离散化 MANO 参数)的 Physical Instruction Tuning;MimicDreamer / DreamTransfer 用视频扩散模型把人类演示合成为符合机器人外观与动力学的照片级视频。
- 自主探索采集——AnyPos 用 RL 驱动的 ATARA 框架系统覆盖末端执行器工作空间,生成任务无关的 ⟨image, action⟩ 数据;SimpleVLA-RL 用”生成-评估-优化”循环把 VLA 自身变成轨迹生成器;World-Env 在 LIBERO 等既有高保真仿真器里用 VLM 引导奖励做受控随机探索;VLA-RFT 直接从离线交互数据学习世界模型作为可控模拟器做大规模并行 rollout。
- 数据增强——LLaRA 用模板把行为克隆数据集重构为对话式指令-响应对;InstructVLA 用 GPT-4o 生成场景描述/QA/指令改写等分层标注以缓解灾难性遗忘;RoboChemist 显式注入遥操作失败场景与重试尝试提升自我纠错能力;ERMV 用 Epipolar Motion-Aware Attention 把单帧编辑一致地传播到多视角多时间步。
此外第 2.1.2 节列出 VLA 领域基础数据集/基准:真实数据集 Open X-Embodiment (OXE)、BridgeData/BridgeData V2、DROID;仿真数据集 RLBench、RoboCasa、RoboGen;评测基准 Meta-World、LIBERO、CALVIN、SIMPLER、VLABench。
训练方法
第 4 章按”VLA 中心视角”重新定义预训练/后训练边界:只要目标是把通用 VLM 迁移为具备动作能力的初版策略,就算预训练(即便某些方法在别的领域被称为”后训练”);后训练专指把这个通用策略进一步适配到具体任务/场景/资源约束。
高效预训练:
- 数据高效预训练——自监督类:DTP 用扩散式轨迹预测作为预训练目标桥接视觉-语言输入与连续动作空间;LAPA 完全绕开真机动作标签,从无标注视频学习离散潜在动作空间;Bu et al. 指出 LAPA 基于像素重建的目标会编码相机抖动等任务无关动态,提出用两阶段 VQ-VAE 解耦出任务中心的潜在动作;LAWM 把该思路迁移到 BAKU、DreamerV3(RSSM) 等更紧凑架构;EgoVLA 放弃潜在动作空间,改用基于 MANO 参数的共享动作空间把人类第一视角视频直接转成可用的 VLA 训练数据;Being-H0 在 UniHand 数据集上做部位级动作分词的 Physical Instruction Tuning;RynnVLA-001 用三阶段生成式预训练(I2V 未来帧预测)学习环境动力学再接动作 token 微调。混合数据联合训练:GeRM 用保守 Q 学习(CQL)离线 RL 框架联合利用专家与次优数据;AnyPos 用 Arm-Decoupled Estimation + Direction-Aware Decoder 从任务无关大规模数据集提取可泛化的运动基元。
- 高效动作表征——LAPA / Bu et al. / RynnVLA-001(ActionVAE)/ LAWM(借 DreamerV3 世界模型)均用自编码器把连续高维动作压到潜在空间;FAST 通过 DCT + BPE 直接压缩动作序列,实现预训练时间最多减少 5×;EgoVLA、VLA-Adapter 用跨模态特征联结(分别是 MANO 共享动作空间、Bridge Attention 模块)提升训练效率;cVLA 放弃机器人基座坐标系改用图像坐标系表示动作降低维度;ReSET 把稠密动作状态分布压缩为一组锚点状态。
- 其他策略——多阶段训练(解耦模态对齐/认知推理/动作微调三阶段);RL 用于预训练(GeRM 的 CQL、TAVP 的伪环境加速收敛);LoRA 用于资源受限预训练(HiRT、TinyVLA)。
高效后训练:
- 监督微调——OpenVLA 系统对比五种 PEFT 策略(全量微调 / 仅微调最后一层 / 冻结视觉 / sandwich 微调 / LoRA),发现 LoRA 性能-算力权衡最优;OpenVLA-OFT 整合并行解码 + 动作分块 + 连续动作表示 + L1 回归目标;MoManipVLA 仅用 50 个真实样本双层轨迹优化迁移到移动操作;ControlVLA 用 ControlNet 式零初始化投影层实现 10-20 条演示的高效微调;OpenHelix 冻结全部 MLLM 参数只训练一个可学习
<ACT>token;RICL 把上下文学习(ICL)引入后训练,模拟 RAG 拼接检索到的 (image, state, action) 序列。 - RL 后训练——在线:RIPT-VLA 用带拒绝采样的 PPO 变体,把成功率从 SFT 的 4% 提升到 97%,仅需 15 次迭代和单条演示;VLA-RL 把轨迹重构为多轮对话,用 PPO + VLM 密集奖励在 4 个 LIBERO 任务套件上比 OpenVLA(SFT) 提升 4.5% 成功率;SimpleVLA-RL 用 GRPO + 交互式采样把成功率从 17.3% 提升到 91.7%(每任务仅一条轨迹);RPD 用 MSE 引导 PPO 把教师 VLA 蒸馏为紧凑策略;人在环双演员框架用”Talk-and-Tweak”方案,101 分钟内达到 100% 成功率,多机效率提升 2×;World-Env 用 VLM 引导奖励的视频式虚拟环境,仅用 5 条演示后训练即达到 79.6% 的 LIBERO 成功率。离线:ConRFT / CO-RFT 均用 Cal-QL 缓解离线 RL 价值高估;ConRFT 从 20-30 条演示初始化,在线交接后达到 96.3% 真实世界成功率,相对基线提升 144%;CO-RFT 在 30-60 条样本上把成功率提升 57%,周期缩短 22.3%;ARFM 在流匹配损失中引入自适应缩放因子,相对 π₀ 基线多任务提升 4.5%、扰动鲁棒性提升 11.4%。
Infra(训练 / 推理工程)
本文是综述,不做自己的训练实验,因此不存在自有 GPU 数量/GPU-hours/并行策略/精度设置。文中作为”问题背景”引用的关键 infra 数字均来自被综述的一手工作,且都能追溯到具体来源:OpenVLA 预训练消耗 21,500 个 A100-GPU-小时(64-GPU 集群);π₀ 预训练用了 10,000 小时机器人轨迹数据(数据采集时长而非算力);Tab. I 汇总的推理延迟/频率——RT-2-PaLI-X 55B 版 330-1000ms/1-3Hz、5B 版 200ms/5Hz,OpenVLA 7B 166ms/6Hz,π₀ 3.3B 73ms/20-50Hz,HiRobot 3B 73ms/10-50Hz,GR00T N1 2.2B 63.9ms;DiVLA-2B 单张 A6000 GPU 上跑到 82 Hz;OpenVLA 4-bit 训练后量化可减半 GPU 显存;SQIL 4-bit 量化下 2.5× 推理加速;BitVLA 1-bit 三值量化 3.36× 显存压缩;FAST 动作分词使预训练时间最多减少 5×。除此之外,综述未给出自身或统一口径下的边缘设备部署实测数字(未披露)。
评测 benchmark
本文不构建统一新基准,也不做跨方法的公平复现对比;文中出现的量化结果均是逐篇转述各原始工作自报的数字(已在”模型架构""训练方法”两节列出,例如 CLIP-RT 相对 OpenVLA 参数少 7 倍却成功率高 24%、RIPT-VLA 4%→97%、SimpleVLA-RL 17.3%→91.7%、ConRFT 96.3%、World-Env 79.6% 等),而非本综述自行测得的统一 benchmark 表。综述系统整理了领域内常用的数据集与基准清单(OXE、BridgeData(V2)、DROID、RLBench、RoboCasa、RoboGen、Meta-World、LIBERO、CALVIN、SIMPLER、VLABench),并给出一张跨模型的延迟/参数/频率对比表(Tab. I,见上)。因此本篇提供的是”二手但可溯源”的量化证据集合,而非原创评测。
创新点与影响
贡献:
- 首篇覆盖”数据-模型-训练”全流程的高效 VLA 综述,填补了此前六篇 VLA/具身智能综述(Ma et al.、Shao et al.、Xiang et al.、Zhong et al. 等)均未系统覆盖效率维度的空白。
- 提出三支柱统一分类学——高效模型设计(架构 + 压缩)、高效训练(预训练 + 后训练)、高效数据采集(人在环/仿真/互联网规模/自探索/增强)——把散落在近 180 篇引文中的技术点归入同一坐标系,并逐一标注具体创新点(Tab. II-VI)。
- 从模型/训练/数据三个维度总结当前瓶颈:模型层面是”紧凑性与表达力”的根本张力(激进压缩损伤细粒度时空动态建模、分层/模块化范式引入路由开销);训练层面是”可扩展性与稳定性”的权衡(RL 后训练面临高方差梯度与奖励稀疏、动作压缩扭曲连续运动学);数据层面是”质量-多样性-可获得性”的三重壁垒(人类采集成本高、合成数据 sim-to-real gap 持续存在、缺乏标准化跨域数据仓库)。
- 维护持续更新的项目主页与 GitHub 论文列表(GitHub README 显示已追加 2025.11-2026.05 的后续论文),作为跟踪该子领域的活文档。
它改变了什么:在此之前,“高效 VLA”相关工作分散在各自的架构/训练/数据论文中,缺乏统一术语和坐标系;本文之后,研究者可以用”高效架构 / 模型压缩 / 高效预训练 / 高效后训练 / 高效数据采集”这套三支柱语言直接定位一项新工作在全景图中的位置。
论文自陈的挑战/局限(§7.1,本文对整个子领域而非自身工作的诊断):模型侧长时程推理与未见任务适应在追求亚十亿参数效率时会退化,且难以从仿真无缝迁移到真实物理世界;训练侧预训练即便冻结视觉-语言骨干仍需可观算力对齐动作头,后训练 RL 面临高方差与奖励稀疏,动作压缩会扭曲连续运动学从而妨碍跨具身迁移;数据侧高保真、任务多样的轨迹持续稀缺,人类采集成本高、合成数据物理真实感不足导致 sim-to-real gap 持续存在,自监督/探索式范式产生大量噪声信号需要额外昂贵的清洗,且缺乏标准化、符合伦理的跨域数据仓库,加剧了具身智能研究的资源不平等。
原始链接
- arXiv 摘要页:https://arxiv.org/abs/2510.24795
- arXiv PDF:https://arxiv.org/pdf/2510.24795
- 项目主页:https://evla-survey.github.io/
- GitHub(持续更新论文列表):https://github.com/YuZhaoshu/Efficient-VLA-Survey
一手源存档(sources/)
- efficient-vla-models-survey—project-page — 项目主页快照(作者信息、摘要、六张配图说明、BibTeX)
- efficient-vla-models-survey—github-readme — GitHub README 快照(含分类论文列表、更新日志)
- arXiv 原文 PDF,不入 git(https://arxiv.org/pdf/2510.24795,v1,2025-10-27)