具身智能范式对比:VLA · 扩散策略 · 人形全身控制 · 足式运动/导航
概述:具身智能这十年沿”控制对象”分成四大范式,每条范式有各自的数据来源、学习目标与动作表征,但都在向”跨本体基础策略”收敛。(1) 通用 VLA——把机器人动作当成大模型的又一种输出模态,从 LLM 高层落地(saycan palm-e)到把动作离散成 token 塞进 VLM 词表(rt-2 openvla),再到用 flow matching / 扩散头生成连续动作块(pi0 groot-n1),数据是海量真机遥操作 + 网页图文;(2) 专用扩散 / 3D 操作策略——不追语义泛化、追单任务样本效率与精度,用 action chunking + 去噪(diffusion-policy aloha-act)或点云 / 关键帧 3D 表征(peract act3d dp3-3d-diffusion-policy)从每任务几十条演示学会精细操作;(3) 人形全身控制——目标不是”抓什么”而是”整个身体怎么动得像人且不摔”,主力是仿真里的动作跟踪 RL + teacher-student 蒸馏(phc-perpetual-humanoid-control exbody hover gmt),数据是 AMASS 动捕与人体视频;(4) 足式运动 / 导航——四足/腿式机器人的运动与穿越,几乎全靠仿真 RL 零样本 sim-to-real(rma-rapid-motor-adaptation extreme-parkour-legged-robots)和视觉导航基础模型(gnm-general-navigation-model vint-foundation-model-visual-navigation)。四条线的共同归宿是基础策略:一套权重跨多本体、跨任务、可微调迁移,靠跨本体数据池化(open-x-embodiment)、隐动作预训练(univla lapa-latent-action-pretraining)与人类视频(ego4d r3m)把数据瓶颈打通。
一、四范式全景:分野在哪里,为什么收敛
先用一张表把四条范式的”基因”对齐。真正区分它们的不是模型骨架(大家都在用 Transformer / DiT),而是控制对象决定了数据从哪来、目标函数怎么写、动作怎么表示。
| 范式 | 控制对象 | 主数据源 | 学习目标 | 动作表征 | sim-to-real | 代表作 |
|---|---|---|---|---|---|---|
| 通用 VLA | 单臂 / 双臂 / 移动操作 | 真机遥操作演示 + 网页图文 + 人类视频 | 模仿学习(离散 token AR / 扩散 / flow) | 离散动作 token 或连续 action chunk | 真机训练为主,仿真辅助评测 | rt-2 openvla pi0 gemini-robotics groot-n1 |
| 专用扩散 / 3D 策略 | 桌面精细操作 | 每任务 10–50 条真机演示 | 模仿学习(去噪 / 关键帧检测) | 动作块去噪 / 3D keypose / 点云 token | 多为真机直采,少量 real-to-sim 评测 | diffusion-policy aloha-act peract dp3-3d-diffusion-policy |
| 人形全身控制 | 全身 20–60 DoF | AMASS 动捕 + 人体视频 + 遥操作 | 仿真 RL 动作跟踪 + teacher-student 蒸馏 | 关节位置 / 关键点跟踪 / 隐动作 | 纯仿真训练 + 域随机化,零样本上真机 | phc-perpetual-humanoid-control hover asap gmt |
| 足式运动 / 导航 | 四足 / 腿式移动 | 仿真采样(几乎无真机数据)+ 网络视频(导航) | 仿真 RL(PPO)/ 视觉目标模仿 | 电机关节角 / 归一化航点 | 仿真训练零样本 sim-to-real 是范式底线 | rma-rapid-motor-adaptation extreme-parkour-legged-robots gnm-general-navigation-model |
三条主线索贯穿全表:
- 数据决定目标函数。操作有海量真机演示可采,于是模仿学习(BC)成主流;腿部运动无法安全地在真机上试错,于是仿真 RL + 域随机化成主流;人形介于两者之间,既要跟踪人类动捕(有参考、可用 RL 跟踪),又要用人类视频扩数据。
- 动作表征在互相借用。action chunking(一次预测一段动作)从 ACT 起源,成了扩散策略、VLA 的标配;扩散 / flow 从专用策略(diffusion-policy)扩散进 VLA 的动作头(pi0 octo);离散 token 从 VLA(rt-2)反向进入人形动作生成(uh-1)。
- 终点都是”基础策略”。四范式各自都长出了”一套权重管多本体”的通用模型:操作有 octo / crossformer-cross-embodied-learning,人形有 hover / sonic,导航有 vint-foundation-model-visual-navigation,甚至跨越范式的 crossformer-cross-embodied-learning(机械臂 + 四足 + 无人机一套权重)。
二、操作范式(上):模仿学习与动作表征的四次跃迁
操作是数据最富的一域,也是范式演进最快的一域。它的主线不是”换更大的模型”,而是”动作到底怎么表示”——因为人类演示天生是多模态、含噪声的(同一场景有多种正确解法),怎么建模这种分布决定了策略的上限。
2.1 从规模化 BC 到动作分块(2021–2023)
早期路线是”大数据 + 高容量 Transformer + 实时架构”的暴力模仿:bc-z 用 25877 条真机 + 18726 条人类视频训 ResNet+FiLM,对 29 个未见任务零样本平均 44%;rt-1 把它推到 13 万条 / 700+ 任务、35M Transformer、真机 3Hz 实时;interactive-language 更是采了近 60 万条语言标注轨迹、单策略执行 87588 条指令(93.5% 成功率)。这条路证明了规模换泛化,但都用逐步回归单个动作,在接触密集、多模态任务上容易学成”平均动作”而失败。
转折点是 ACT:用不到 2 万美元的开源双臂遥操作硬件,配一个 80M 的 Action Chunking with Transformers——核心是”一次预测未来 k 步动作块”并用 CVAE 建模人类演示的噪声与多模态,每任务仅 50 条演示就在装电池、开调料杯等精细任务上做到 80–90%。action chunking 从此成为整个操作领域的默认设计,后来被 pi0 openvla 一代 VLA 全盘继承。
2.2 显式建模多模态:能量模型、离散化、扩散(2022–2023)
同期另一条线专攻”怎么建模多模态动作分布”,几种思路百花齐放:
- 隐式能量模型:implicit-bc-ibc 把 BC 从显式回归
â=F(o)改写成”能量模型 + 推理时 argmin”,在接触密集、不连续任务上系统超过 MSE / MDN,甚至在 D4RL 上不用奖励逼近 offline RL。 - 动作离散化 / tokenize:BeT 把连续动作 k-means 成”动作簇 + 残差偏移”套进 GPT,是”动作 tokenize”路线的开山;VQ-BeT 进一步用 Residual VQ-VAE 分层量化,单次前向生成多模态动作,比 Diffusion Policy 快 5 倍(仿真)/ 25 倍(真机板载 CPU)。
- 扩散去噪:diffusion-policy 把策略表示成”以观测为条件的 DDPM,对整段未来动作序列去噪”,天然建模多模态、稳定易训,15 个任务 4 个基准平均比 SOTA 提升 46.9%。“动作分块去噪 + 滚动时域重规划”自此成为模仿学习的主流配方(RSS 2023 最佳论文)。
扩散路线随后被放大验证:ALOHA Unleashed 在 26000+ 条双臂演示上训 217M 扩散 Transformer,证明”大规模数据 + 表达力更强的扩散策略”这一极简配方就能掌握系鞋带、挂衬衫等可变形物体双臂任务。
2.3 扩散太慢:加速与稀疏化(2024–2025)
扩散策略的死穴是推理要几十上百步去噪,装不进算力受限的机器人。2024–2025 一大批工作专攻”把去噪步数砍到个位数甚至 1 步”,路线分蒸馏、改公式、改采样三类:
| 方法 | 加速思路 | 步数 / NFE | 延迟或吞吐 | slug |
|---|---|---|---|---|
| Consistency Policy | 从教师蒸馏一致性模型 | 1–3 步 | 真机 192ms→21ms(约 9×) | consistency-policy |
| ManiCM | consistency 蒸馏进 3D 点云扩散 | 10 步→1 步 | 178ms→17ms(约 10×) | manicm |
| AdaFlow | rectified-flow + 逐状态自适应步长 | 平均 1.12–1.56 NFE | 对标 DDPM 的 20–100 NFE | adaflow |
| Streaming Diffusion Policy | 持久化动作缓冲区、滚动去噪,免蒸馏 | 每步少量去噪 | 与蒸馏路线打平 | streaming-diffusion-policy |
| One-Step Flow | 自一致性 + 自引导,从零蒸馏单步生成器 | 1 步 | 加速 100×+,超 100 步扩散 | one-step-flow-policy |
| MoDE | 噪声等级路由的去噪专家 MoE | — | FLOPs 砍九成、激活少 40% | mode-mixture-of-denoising-experts |
| Sparse Diffusion Policy | FFN 位置塞 MoE,专家=技能、路由=规划器 | — | 多任务仅多约 1% 激活参数 | sparse-diffusion-policy |
MoDE 在 CALVIN ABC→D 预训练后拿到 4.01、LIBERO-90 拿到 0.95,平均比第二名高 57.5%;Sparse DP 持续学习新任务时激活参数恒定(不像 LoRA 随任务线性增长)。这类工作和 RL 微调(DPPO 把去噪链当 MDP 让 PPO 回传奖励;ReinFlow 把这套搬到 flow matching)一起,把扩散 / flow 策略从”实验室 demo”打磨成”能上真机连续跑”的工程件。
2.4 从视频与 flow 学操作:把”运动”而非”动作”当跨域接口
一支越来越重要的路线不直接学机器人动作,而是学一层与本体无关的运动中间表征(点轨迹 / 光流 / 物体 flow),用它当”人类↔机器人、仿真↔真实”之间的桥,从而能吃海量无动作标注的人类 / 网络视频。这和后面 4.6 的”隐动作”是同一动机(绕开动作标注稀缺)的两种表征选择——一个学显式几何轨迹,一个学离散潜码。
| 方法 | 中间表征 | 训练数据 | 关键数字 | slug |
|---|---|---|---|---|
| ATM | 任意 2D 点未来轨迹 | 无动作视频 | LIBERO 130 任务 63% vs 视频基线 37% | any-point-trajectory-model-atm |
| Track2Act | 初始→目标帧点轨迹→3D 刚体变换 | ~40 万段网络视频 | Spot 25 项未见任务零样本 | track2act |
| General Flow | 任意查询点未来 3D 轨迹 | RGBD 人类视频 | Franka 零样本 18 任务 81% | general-flow |
| Im2Flow2Act | 排除本体/背景的物体 flow | 人类视频 + 仿真 play | 真实四类任务平均 81% | im2flow2act |
| CogRobot | text→flow→video→动作 | 有限双臂数据 | 双臂基座策略泛化 | bimanual-flow-video-prediction-policy |
| Vid2Robot | 第三人称演示视频直接编码 | 人 / 机视频 | 比 bc-z +20 点 | vid2robot |
生成式一支走得更远:把”预测未来视频”当预训练目标再迁到动作——GR-1 在 Ego4D 80 万段视频做语言条件未来帧预测再微调出动作,CALVIN 88.9%→94.9%;GR-2(3800 万视频、105 任务平均 97.7%)、GR-3、RynnVLA-001 一脉延续。这类”视频生成 → 动作”和”世界模型 VLA”(4.5)本质相通,区别只在生成的帧是当训练信号还是当在线规划。
2.5 换一种”任务指定”接口:草图 / 轨迹 / 图像化动作
动作表征之外,“怎么告诉机器人要干什么”本身也是范式轴。语言常有歧义、目标图像又过度指定,几种折中被提出:RT-Trajectory 用叠在初始图像上的 2D 末端轨迹草图指定”怎么做”(可从演示无标注自动提炼),7 个未见技能 67% 对 rt-1 的 16.7%、rt-2 的 11.1%;RT-Sketch 用手绘草图当目标,介于语言与图像之间。把动作本身渲进图像空间的一支——Genima 微调 Stable Diffusion 直接”画”未来关节目标球再交 ACT 执行(RLBench 25 任务 49.6%),Render and Diffuse 把候选动作渲成虚拟夹爪图叠到观测上、在图像空间去噪——用”观测-动作空间统一”的归纳偏置换空间泛化,与第三节的 3D 图像化渲染(rvt 一脉)同源。
2.6 末端与感知模态:灵巧手、触觉、听觉
末端从平行夹爪走向多指灵巧手、感知从纯视觉走向触觉 / 听觉,构成一条正在成形的”灵巧 + 接触”子范式。灵巧手操作靠专门的接触 / 几何先验补样本效率:CordViP 显式建”手-物接触图”预训练 3D 编码器(真机四任务平均 90%),GraspVLA 纯仿真 10 亿帧 SynGrasp 训抓取基础模型、零样本 sim-to-real 且开放词表泛化,DemoStart 仅 2–60 条次优仿真演示把三指手训到仿真 98.6–99.9% 再蒸馏上真机。感知模态上,ManiWAV 给手持夹爪装接触麦克风用声音感知接触事件(擦白板 40%→85%),ViTaMIn 把 UMI 升级成视觉-触觉双模态采集。数据入口则是一批灵巧遥操作 / 手持采集系统(anyteleop dexcap dexumi bunny-visionpro ace-f-foldable-teleop),把”没有力 / 触觉传感器也能采到接触信息”做成工程件。
三、操作范式(下):3D / 点云 / 关键帧几何策略
与”2D 图像进、动作出”的扩散策略平行,另一支操作路线坚持把 3D 几何显式做进策略——理由是操作本质是空间任务,2D 表征丢掉了深度和视角不变性,样本效率天然吃亏。这一支主要在 RLBench / ManiSkill 仿真基准上比拼,演进脉络清晰。
关键帧 / 体素路线从 PerAct 起步:把场景体素化成 100³ 网格、用 Perceiver 逐体素分类”下一个最佳动作体素”,每任务几条示范就学会语言条件 6-DoF 操作。但体素化算力随分辨率立方爆炸,后续工作各出招绕开:Act3D 改成”连续 3D 特征场里递归采样 ghost point”,RVT 把点云重渲染成多个虚拟正交视角图像喂多视角 Transformer,RVT-2 再加由粗到细两阶段,SAM-E 把视觉编码器换成预训练 SAM。
3D 扩散路线把动作扩散和 3D 表征缝合:ChainedDiffuser 用扩散生成器取代关键帧之间的运动规划器连接段,3D Diffuser Actor 用带 RoPE 相对注意力的 3D 去噪 Transformer 对整段 6-DoF 轨迹条件扩散。另一分支彻底走点云:DP3 用极简 MLP 点编码器 + 单视角稀疏点云喂进 Diffusion Policy,开创”3D 点云 diffusion policy”路线,衍生出 iDP3(改到相机坐标系、去掉标定与分割,上人形野外泛化)、RISE(稀疏卷积编码器)、SGRv2(动作局部性归纳偏置)。
| 方法 | 3D 表征 | RLBench 多任务成功率 | 相对基线 | slug |
|---|---|---|---|---|
| PerAct | 100³ 体素 + Perceiver 分类 | 49.4% | 关键帧路线起点 | peract |
| Act3D | 连续 3D 特征场 + ghost point | 65%(249 变体) | 比 PerAct +22 绝对点、算力 <1/3 | act3d |
| RVT | 多视角虚拟渲染 Transformer | 62.9% | 比 PerAct +26% 相对、训练 36× 快 | rvt |
| RVT-2 | 渲染 + 由粗到细两阶段 | 81.4% | 训练 6× / 推理 2× 快,真机毫米级 | rvt-2 |
| SAM-E | SAM 编码器 + 动作序列头 | 70.6% | 比 RVT +7.7 点、推理步 5.5× 少 | sam-e |
| 3D Diffuser Actor | 3D token + 动作扩散 + 相对注意力 | 81.3% | 比 Act3D +18.1 点 | 3d-diffuser-actor |
| ChainedDiffuser | Act3D keypose + 局部轨迹扩散 | 80.9%(运动规划器难任务集) | 比纯 keypose +60 点 | chaineddiffuser |
3D 路线的另一贡献是等变性:Equivariant Diffusion Policy 给去噪网络塞 SO(2) 等变结构,MimicGen 12 任务上 100 条演示成功率从 42.0% 拉到 63.9%,200 条即追平基线 1000 条;EquiBot 做到 SIM(3) 等变(平移/旋转/缩放全等变),5 分钟人类视频即可泛化未见物体尺度。到 2026,R3D 诊断出”3D 点云策略无法从更强骨干获益”的 scaling paradox 根因在 BatchNorm 与 3D 增强缺失,用高容量点云 Transformer + 空间保真 DiT 解码器在 RoboTwin 2.0 上刷到 83.8%(Easy)/ 64.8%(Hard)。
值得点出的是:3D 几何策略和 VLA 是两种哲学。前者靠归纳偏置换样本效率(每任务几十条演示、不吃网页数据、不追语义泛化);后者靠海量数据 + 大模型换语义泛化。两者在 2025 后开始互相渗透——VLA 里出现了 3D 表征(SpatialVLA 用 Ego3D 位置编码、internvla-m1 用空间提示、MolmoAct 先吐深度 token)。
四、通用 VLA:把动作当成大模型的输出模态
VLA 是过去三年最热的范式,本质是”用互联网预训练的语义先验补机器人数据的稀缺”。它的谱系可按”动作怎么接进大模型”分成几代。
4.1 前身:LLM 做高层规划(2022)
最早不是端到端 VLA,而是用冻结 LLM 做高层任务分解,底层交给现成技能:SayCan 用 LLM 列候选技能、用 RL 价值函数(affordance)给”当前场景真能不能做成”打分,两者相乘选下一步;Inner Monologue 给规划器接环境反馈闭环,真实厨房总成功率从 SayCan 的 30.8% 升到 60.4%;Code as Policies 直接让 Codex 把指令写成 Python 策略代码。PaLM-E 是关键跳板:把图像、状态、3D 场景表示用编码器投影进 PaLM 词嵌入空间与文本交错,端到端联合训练出最大 562B 的具身多模态模型,核心发现是”网页数据 + 多机器人数据混训带来正迁移”。
4.2 命名与奠基:动作即 token(2023)
RT-2 是”VLA”这个词的命名之作:把 PaLI-X(5B/55B)或 PaLM-E-12B 直接拿来,把 6-DoF 动作离散成 256 个 bin 当普通文本 token 塞进词表,与网页 VQA 数据 co-fine-tune,不加任何动作专用参数,未见泛化从 rt-1 的 32% 提到 62%,还涌现出”挑能当锤子的石头”这类推理能力。同期 RT-H 在任务和动作之间插一层”语言运动”层级,Q-Transformer 把动作逐维离散做离线 TD 学习,SARA-RT 把 RT-2 的 softmax 注意力换成线性注意力提速 14%。
4.3 跨本体池化与开源基座(2023–2024)
Open X-Embodiment 是这一代的数据地基:把 21 家机构 60 个数据集汇成统一 RLDS 格式(1M+ 轨迹、22 本体、527 技能),证明”不做任何对齐、只把数据池化一起训”就能正向跨本体迁移(RT-2-X 涌现技能提升约 3×)。基于它长出两个开源基座:Octo(transformer + 扩散头,27M/93M,可单卡微调到新本体)和 OpenVLA(Prismatic-7B,离散 AR,970k 轨迹,7B 参数超闭源 55B 的 RT-2-X 达 16.5%,首证 LoRA + 量化能消费级微调)。跨本体的更极致版本是 CrossFormer(一套 130M 权重管 20 种具身含无人机,不做任何对齐)和 HPT(每本体一个 stem tokenizer、共享 trunk,52 个数据集预训练,首次系统展示策略预训练的 scaling)。
4.4 连续动作专家:flow / 扩散头(2024–2025)
离散 token AR 在高频灵巧任务上吞吐不够,主流转向”VLM 主干 + 连续动作专家”。旗舰是 Physical Intelligence 的 π 系列:π0 在 PaliGemma 3B 上外挂 300M action expert,用 flow matching 直接生成 action chunk(H=50),3.3B 参数、最高 50Hz;π0-FAST 提出 DCT+BPE 动作分词器让 AR 也能高频;π0.5 靠异构数据 co-training 做到开箱进陌生家庭干 10–15 分钟长活;知识隔热 用 stop-gradient 防止 action expert 训坏 VLM 知识;π*0.6 用 RECAP 让 VLA 从真实部署经验自我提升;π0.7 靠多模态上下文条件展示接近 LLM 的组合泛化。同架构路线还有 CogACT(认知 token + DiT 动作模块,7.6B 超 OpenVLA/RT-2-X)、RDT-1B(DiT 扩散、1.2B、双臂)、Dita(去噪 token in-context 条件化)。
一个反例点出了”配方 > 数据”:OpenVLA-OFT 不换模型、不加预训练,只把 OpenVLA 改成”并行解码 + 动作分块 + 连续 L1 回归”,LIBERO 从 76.5% 拉到 97.1%、吞吐提高 26–43×,真机上反超在双臂数据上预训练过的 π0 / RDT-1B。
4.5 双系统与世界模型 VLA(2025–2026)
前沿是”慢思考 + 快动作”双系统解耦,把语义推理和高频控制分频异步跑:
| 模型 | System-2(慢/推理) | System-1(快/动作) | 关键数字 | slug |
|---|---|---|---|---|
| Figure Helix | 7B VLM @7–9Hz | 80M transformer @200Hz | 单权重输出 35-DoF、双机零样本协作、板载 GPU | figure-helix |
| GR00T N1 | Eagle-2 VLM | 扩散 DiT flow @120Hz | 2.2B、四层数据金字塔、全开放 | groot-n1 |
| GR00T N1.5 | 冻结 Eagle 2.5 | + FLARE 世界建模 | 语言跟随 46.6%→93.3% | groot-n1-5 |
| Gemini Robotics | Gemini 2.0 (ER) | 端到端 VLA @50Hz | 云端 backbone + 机载 decoder | gemini-robotics |
| Gemini Robotics 1.5 | ER 1.5(会思考、调工具) | Motion Transfer 多本体 VLA | ALOHA/Franka/Apollo 零样本迁移 | gemini-robotics-1-5 |
| Galaxea G0 | VLM 高层规划 | VLA 精细执行 | 500+ 小时单本体数据 | galaxea-g0 |
| InternVLA-A1 | 理解专家 MLLM | 生成专家 + flow 动作专家 | 高动态场景比 π0/GR00T 高 40–73 点 | internvla-a1 |
同期涌现”动作模型 + 世界模型同权重联合”的一支:WorldVLA 让”预测动作”和”预测下一帧”共享词表互相监督,LIBERO 从 76.5% 提到 79.1–81.8%;RynnVLA-002 把 VLA 和世界模型塞进同一 Chameleon 权重,真机从 <30% 拉到 80%+;DreamGen 用视频世界模型”造梦”出神经轨迹当训练数据,让人形从单环境数据学会 22 个新动词。
4.6 隐动作与人类视频:破解动作标注稀缺
VLA 最贵的是带动作标注的真机数据。一条重要支线是从无动作视频学”隐动作”:LAPA 用 VQ-VAE 从无标签视频学离散潜动作码本,第一个不需动作标签的 VLA 预训练,实机反超用 97 万带标签轨迹的 OpenVLA、算力省 30–40×;UniVLA 用两阶段 VQ-VAE 解耦”任务相关”隐动作,仅 960 A100-hours(OpenVLA 的 1/20)全面反超;Moto、villa-X、UniAct(256 条跨本体动作码本)、UMI 一脉的手持采集(数据缩放律 证明多样性比数量重要)都在补这块。轻量化方向则有 TinyVLA(70M–1.4B + 扩散头,延迟低 20×)、SmolVLA(450M、481 个社区数据集、CPU 可推)、DeeR-VLA(多出口提前退出,算力砍 1/5–1/6)。
4.7 推理增强与 VLM 知识保持
VLA 微调有个普遍副作用:一学动作,预训练 VLM 的对话 / 推理能力就被”训坏”。一支工作专治这个:ChatVLA 用分阶段对齐训练 + 只在 MLP 层的二专家 MoE 让同一 Qwen2-VL-2B 既能答题又能操作,ChatVLA-2 进一步用动态 MoE 保住开放世界推理,DexVLA 挂 10 亿参数可插拔扩散专家 + 三阶段具身课程,DiVLA 用 FiLM 把 VLM 推理 embedding 注入扩散动作头(不必二次前向),知识隔热 则用 stop-gradient 从梯度层面隔开动作专家对 backbone 的侵蚀。**显式”先推理再动作”**的一支:RT-H 在任务与动作间插一层语言运动层级(比 RT-2 高 15%、语言纠错把成功率 40%→63%),MolmoAct 在动作 token 前先自回归吐深度 token + 视觉推理轨迹(仅 26.3M 样本超 pi0 的 9 亿样本),WALL-OSS / WALL-OSS 0.5 用统一 Cross-Level CoT 把”指令→推理→子任务→连续动作”串进单一可微框架。系统性实证方面 RoboVLMs 用 600+ 组对照实验给出 VLA 建造配方——连续动作 + policy head 融合历史 + 选视觉语言预训练充分的 backbone + 跨本体数据放预训练阶段(CALVIN ABC→D 平均完成 4.25/5)。这条线也解释了为何”具身大脑”MLLM(RoboBrain RoboBrain 2.0 RoboBrain 2.5)与端到端 VLA 越来越分工:前者管高层空间推理 / 可供性 / 价值估计,后者管低层动作。
五、人形全身控制:从动作跟踪到全身操作基础模型
人形是控制维度最高(20–60 DoF)、稳定性最脆的一域。它和操作的根本差别在于:没有”演示动作”可直接采(人形和人类身体不一样),主力范式是”在仿真里 RL 跟踪人类动作参考 + teacher-student 蒸馏上真机”。演进按能力分层。
5.1 动作跟踪基座:从模仿单条到模仿整库
奠基是 PHC:单一策略在不施加外力下模仿整个 AMASS 库的 98.9%,还能从摔倒自然爬起继续跟踪,成为后续大量人形工作的底层 tracker。规模化沿”数据 × 模型 × 算力”三轴放大:SONIC 用 700 小时 / 100M+ 帧、1.2M→42M 参数、128 GPU 训单一通用策略,还用统一 token 空间把机器人动作、人体动作、遥操作、视频/文本/音乐乃至 VLA 全接到同一策略;GMT 靠 Adaptive Sampling 课程 + Motion MoE 让单策略跟踪从走路到功夫的全身动作;UniTracker 用 CVAE 学生跟踪 8179 条 AMASS 动作。数据侧的关键工具是 OmniRetarget(交互网格 + 硬约束优化的”保交互”重定向,让 RL 只用 5 条奖励零样本上真机)。
5.2 模式统一:一套权重管多种控制接口
HOVER 是范式代表:先 RL 训一个吃 AMASS 的全身模仿 oracle,再蒸馏进统一多模态学生,同一套权重靠”掩码”在关键点跟踪 / 关节角跟踪 / root 速度跟踪之间任意切换(>15 种模式、上下半身独立),逐项超过 exbody、H2O、OmniH2O、HumanPlus 等 specialist。前身 ExBody 用”上半身严格模仿、下半身只跟 root 速度”的解耦让 H1 复现人类动作,ExBody2 升级为真·全身跟踪;MHC 用同一 LSTM 跟踪”任意子集被 mask”的目标姿态,把手柄/VR/视频三种输入统一成一种接口。
5.3 遥操作:人形数据采集的入口
人形数据靠遥操作采,硬件/算法花样最多:H2O 首个 RL 实时全身遥操作(一台 RGB 相机驱动 H1);OmniH2O 只用 VR 三点稀疏输入做灵巧全身操作;HumanPlus 用 40 小时 AMASS 训低层策略 + 一台 RGB 相机”影随”33-DoF 人形;TWIST / TWIST2(免动捕、PICO 4 + 脚踝追踪器)、CLONE(VR 三点 + LiDAR 闭环把漂移压到厘米级)、HOMIE($0.5k 等构外骨骼驾驶舱)、AMO(轨迹优化扩展可达工作空间)、Mobile-TeleVision(上身 IK / 下身 RL + CVAE 运动先验)各补一环。
5.4 敏捷极限动作与全身操作
跟踪打底后,工作转向”更难的动作”和”边走边操作”:
| 工作 | 本体 | 方法要点 | 达成的极限 | slug |
|---|---|---|---|---|
| ASAP | Unitree G1 | 残差 delta action 补 sim-to-real 失配 | C 罗 Siuuu 跳、1.5m 前跳 | asap |
| KungfuBot | G1 | 双层优化在线自适应跟踪容差 | 拳击组合拳、360° 回旋踢、太极 | kungfubot |
| HuB | G1 | 参考精修 + balance-aware 学习 | 极限单腿平衡,真机 24/25 | hub-extreme-balance |
| HumanUP | G1 | 两阶段课程 RL(发现→跟踪) | 首个真机学习式起身 | humanoid-getup |
| Humanoid Parkour | Unitree H1 | 分形噪声 reward + 视觉蒸馏 | 跳 0.42m 台、跨 0.8m 沟、1.8m/s | humanoid-parkour-learning |
| FALCON | 人形 | 双智能体 + 力课程 | 抗 0–100N 外力做负重操作 | falcon |
| WoCoCo | H1 | 接触序列分解 + 稠密接触奖励 | 跳石头、搬箱、攀爬 | wococo |
全身 loco-manipulation(边移动边操作)是当前主攻点:SkillBlender(预训练 4 原语技能再混合)、ResMimic(GMT 打底 + 残差修正做负重搬运)、VisualMimic(视觉高层 + 关键点低层)、PhysHSI(AMP 学搬箱/坐椅/躺床)都在这一层。
5.5 人形也在做 VLA 与行为基础模型
人形范式最新趋势是把 VLA 和”行为基础模型(BFM)“引进来:LeVERB 首个人形 WBC 的分层隐动作 VLA(VL 塔 102.6M 出 10Hz latent verb、A 塔 1.1M 出 50Hz 动作、纯合成数据零样本上 G1);WholeBodyVLA 用两个 VQ-VAE 隐动作模型让 Prismatic-7B 做统一监督、单策略连续完成”走位—蹲下—抓取—转身—放置—推车”;Ψ₀(人类视频 + 真机两阶段)、Galaxea G0.5(纯自回归、跨本体 ActionCodec)、Being-0(三层分层智能体)各走一路。BFM 侧,BFM-Zero 用无监督 RL(Forward-Backward + FB-CPR)把动作、目标位姿、奖励嵌进同一潜空间 Z,零样本被”提示”做多种任务,是第一个把这套范式跑到真实 G1 的模型;BeyondMimic 用 loss-guided diffusion 把跟踪策略蒸馏成单一联合扩散策略做下游导航/遥操/避障。
六、足式运动与导航:仿真 RL 零样本 sim-to-real 的大本营
这一域和操作几乎是”镜像”:操作以真机模仿为主,运动几乎全在仿真里 RL、零样本上真机——因为腿部高速运动无法在真机上安全试错,且仿真吞吐足够(Isaac Gym 单卡上万环境)。
6.1 四足运动的 sim-to-real 配方
奠基是”仿真训练、真机零样本部署”:谷歌 Minitaur 工作 把执行器建模 + 延迟仿真 + 动力学随机化叠进 PyBullet 学出 trotting/galloping,比手调步态省电 23–35%。核心难题是”仿真里没有的真实环境参数怎么在线适应”,几条经典解法:
| 工作 | 本体 | 方法要点 | 关键数字 | slug |
|---|---|---|---|---|
| RMA | Unitree A1 | base policy + 在线估计 extrinsics 的 adaptation module | <1s 估出 8 维环境隐向量 | rma-rapid-motor-adaptation |
| Learning Quadrupedal | ANYmal | 特权 teacher→纯本体感觉 student + 地形课程 | SubT 竞赛四场零失败 | learning-quadrupedal-locomotion-challenging-terrain |
| Learn to Walk in Minutes | ANYmal C | Isaac Gym 数千并行 on-policy RL | 平地 <4min / 崎岖 <20min | learning-to-walk-in-minutes-massively-parallel-rl |
| Walk These Ways | Go1 | 8 维行为参数编码”多种解法”(MoB) | 部署时旋旋钮零样本跨场景,50Hz | walk-these-ways |
| DreamWaQ | A1 | 隐式地形想象(CENet 推断特权信息) | 纯本体感觉走完 430/465m 户外 | dreamwaq |
| Perceptive Locomotion | ANYmal | GRU belief encoder 融合外感 + 本体感觉 | 阿尔卑斯徒步零跌倒 | learning-robust-perceptive-locomotion-wild |
legged_gym + rsl_rl(learning-to-walk-in-minutes-massively-parallel-rl 随附)成了整个领域被反复 fork 的基线。
6.2 跑酷:把运动推到敏捷极限
2023–2024 一批”学习式跑酷”把腿式运动推到极限,共同点是”纯 RL 无参考动作 + 单目深度相机 + 端到端上真机”:Extreme Parkour 用一个前置深度相机让 A1 跳 2 倍身高的箱、跨 2 倍身长的沟、跑 37° 坡、倒立行走;Robot Parkour 用”软/硬动力学两阶段 + DAgger 蒸馏纯视觉策略”训五个专家技能;ANYmal Parkour 用感知/运动/导航三模块分层,2 m/s 敏捷穿越。安全 / 精确落脚的补充有 ABS(双策略 + Hamilton-Jacobi 可达-规避,3.1 m/s 保避障)、DTC(轨迹优化 + RL 跟踪混合)、NVM(SE(3) 等变体素记忆)、Barkour(犬类敏捷赛 benchmark)。
6.3 四足 loco-manipulation:装上手臂
四足加机械臂后进入 loco-manipulation:Deep Whole-Body Control 用单策略同时输出腿关节和臂关节(不分层),提出 Advantage Mixing 和 Regularized Online Adaptation;UMI-on-Legs 把 UMI 手持采集的操作策略”装”到四足狗上,两策略只靠末端轨迹握手;WildLMa(全身控制 + CLIP 技能库 + LLM 规划器做长程野外任务)、Helpful DoggyBot(Go2 + 咬合夹爪 + 现成 VLM 零训练开放世界抓取)各补一环。
6.4 视觉导航:从目标条件基础模型到 VLN
导航是唯一大量用网络视频的运动子域。目标条件导航基础模型一脉:GNM 首个跨具身 image-goal omnipolicy(6 本体 60 小时),ViNT 是 31M 图像目标基础模型(80 小时 8 本体,零样本控 Go1),NoMaD 用目标掩码扩散把定向导航和探索合进 19M 模型(比 335M SOTA 高 25%),CityWalker 从 2522 小时 YouTube 城市视频学(214M),LeLaN 用基础模型自动打标 130 小时野外视频学语言导航(89% SR)。
语义 / 视觉语言导航(VLN)一脉:
| 模型 | 类型 | 方法要点 | 关键数字 | slug |
|---|---|---|---|---|
| VLFM | 零训练 ObjectNav | BLIP-2 算图文相似度铺价值地图找前沿 | Gibson/HM3D/MP3D +11.7/8.1/3.3 SPL | vlfm-vision-language-frontier-maps |
| Mobility VLA | 零训练分层导航 | Gemini 1.5 Pro 看导览视频 + 拓扑图 | 复杂推理/多模态指令 86%/90% | mobility-vla |
| NaVid | 视频 VLM VLN-CE | 单目 RGB 流出下一步动作,无地图/里程计 | 真实四场景约 66% SR | navid-video-vlm-vln |
| NaVILA | 腿式机器人 VLA | VILA 8B 出中层语言动作 + LiDAR RL 执行 | 跨 Go2/H1/G1,真机 88% SR | navila-legged-robot-vla-navigation |
| Uni-NaVid | 统一 4 导航任务 | 单视频 VLA、next-token 出动作 | 3.6M 样本、约 5Hz | uni-navid-video-vla-navigation |
| TrackVLA | 具身视觉跟踪 | 识别语言头 + 跟踪扩散头共享 7B 主干 | 四足真机 10 FPS | trackvla-embodied-visual-tracking |
到 2026,导航也出现”完全不训练”的组合式智能体 Uni-LaViRA(两个通用 MLLM 三级翻译 + agent-loop 机制,零训练打平百万轨迹训练的导航基础模型),呼应了 VLM 直接当具身控制器(PIVOT 把控制变视觉多选题)的思路。
七、四范式的汇流:跨本体基础策略
四条范式看似分立,2024 后明显向”基础策略”合流——一套权重跨本体、跨任务、可微调迁移。汇流靠三股力量:
- 跨本体数据池化 + 统一动作接口。从 open-x-embodiment 池化,到 octo / crossformer-cross-embodied-learning / hpt-heterogeneous-pretrained-transformers 用共享 trunk + 逐本体 stem/head,再到 RoboCat 用冻结 VQ-GAN token 控多本体(自我改进从 36% 提到 74%),甚至 CrossFormer 把机械臂、四足、无人机塞进一套权重。Skild Brain 号称在 10 万个仿真形态上训单一低层策略、零样本适应断腿/锁膝并展现 in-context learning。
- 人类视频当第三条数据源。Ego4D(3670 小时第一人称)、Ego-Exo4D、EgoDex(829 小时 + 配对 3D 手姿)撑起视觉预训练(R3M、MVP、VC-1)和”隐动作从视频学”(前述 LAPA/UniVLA),把机器人数据稀缺问题绕过去。GR-1 / GR-2 / GR-3 一脉靠视频生成预训练迁移到操作。
- 数据飞轮与经验自提升。RoboCat 自生成数据并回训、π*0.6 用 RECAP 从真实部署经验迭代、DYNA-1 用奖励模型在环连续 24 小时自主运行(折 850+ 份餐巾、99.4%),标志范式从”离线模仿固定数据集”转向”在线经验闭环”。评测基础设施同步跟上:SIMPLER(real-to-sim 评测,Pick Coke Can r=0.976)、RoboArena(机器人版 Chatbot Arena,成对真机盲评)、RoboReward / RoboBrain 2.5(通用奖励模型)让通用策略可复现比较。
空白与趋势
- 四范式的动作接口尚未真正统一。操作用 action chunk、人形用关节跟踪 / 关键点、导航用航点,跨范式的”通用动作表示”仍在探索(UniAct 的跨本体码本、UniVLA 的隐动作、CrossFormer 的无对齐池化是几种尝试,但还没有一个”动作层的 tokenizer”像语言 token 那样被公认)。
- 人形与操作正在合并成”全身操作”。纯 locomotion 和纯 manipulation 之间的边界在 loco-manipulation(wholebodyvla skillblender falcon psi-0-humanoid-loco-manipulation)里消融,但”移动 + 精细操作 + 全身平衡”三者同时高质量仍是硬骨头。
- RL 与模仿的界限在松动。运动范式(RL 为主)和操作范式(BC 为主)开始互相借:BC 策略上加 RL 微调(DPPO ReinFlow π*0.6),人形 RL 里加模仿参考(asap omniretarget)。“预训练用模仿、后训练用 RL / 经验”正在成为共识配方。
- 世界模型作为第四种角色进场。VLA 里越来越多把世界模型当训练数据来源(dreamgen-groot-dreams)、当联合训练目标(worldvla rynnvla-002 internvla-a1-5)、甚至当直接控制器(1XWM),可能重塑”策略”本身的定义。
- 评测滞后于能力。长程、跨本体、真实世界的可复现评测仍是瓶颈;roboarena / simpler-env / robocerebra / embodiedbench / vlabench 各补一块,但缺一个被公认的”具身 MMLU”。多篇综述(foundation-models-in-robotics vla-survey-embodied-ai behavior-foundation-model-humanoid-survey generalist-robot-internet-video-survey)都把”数据稀缺、安全评测、实时性、不确定性量化”列为四范式共同的长期拦路虎。