具身智能范式对比:VLA · 扩散策略 · 人形全身控制 · 足式运动/导航

概述:具身智能这十年沿”控制对象”分成四大范式,每条范式有各自的数据来源、学习目标与动作表征,但都在向”跨本体基础策略”收敛。(1) 通用 VLA——把机器人动作当成大模型的又一种输出模态,从 LLM 高层落地(saycan palm-e)到把动作离散成 token 塞进 VLM 词表(rt-2 openvla),再到用 flow matching / 扩散头生成连续动作块(pi0 groot-n1),数据是海量真机遥操作 + 网页图文;(2) 专用扩散 / 3D 操作策略——不追语义泛化、追单任务样本效率与精度,用 action chunking + 去噪(diffusion-policy aloha-act)或点云 / 关键帧 3D 表征(peract act3d dp3-3d-diffusion-policy)从每任务几十条演示学会精细操作;(3) 人形全身控制——目标不是”抓什么”而是”整个身体怎么动得像人且不摔”,主力是仿真里的动作跟踪 RL + teacher-student 蒸馏(phc-perpetual-humanoid-control exbody hover gmt),数据是 AMASS 动捕与人体视频;(4) 足式运动 / 导航——四足/腿式机器人的运动与穿越,几乎全靠仿真 RL 零样本 sim-to-real(rma-rapid-motor-adaptation extreme-parkour-legged-robots)和视觉导航基础模型(gnm-general-navigation-model vint-foundation-model-visual-navigation)。四条线的共同归宿是基础策略:一套权重跨多本体、跨任务、可微调迁移,靠跨本体数据池化(open-x-embodiment)、隐动作预训练(univla lapa-latent-action-pretraining)与人类视频(ego4d r3m)把数据瓶颈打通。


一、四范式全景:分野在哪里,为什么收敛

先用一张表把四条范式的”基因”对齐。真正区分它们的不是模型骨架(大家都在用 Transformer / DiT),而是控制对象决定了数据从哪来、目标函数怎么写、动作怎么表示。

范式控制对象主数据源学习目标动作表征sim-to-real代表作
通用 VLA单臂 / 双臂 / 移动操作真机遥操作演示 + 网页图文 + 人类视频模仿学习(离散 token AR / 扩散 / flow)离散动作 token 或连续 action chunk真机训练为主,仿真辅助评测rt-2 openvla pi0 gemini-robotics groot-n1
专用扩散 / 3D 策略桌面精细操作每任务 10–50 条真机演示模仿学习(去噪 / 关键帧检测)动作块去噪 / 3D keypose / 点云 token多为真机直采,少量 real-to-sim 评测diffusion-policy aloha-act peract dp3-3d-diffusion-policy
人形全身控制全身 20–60 DoFAMASS 动捕 + 人体视频 + 遥操作仿真 RL 动作跟踪 + teacher-student 蒸馏关节位置 / 关键点跟踪 / 隐动作纯仿真训练 + 域随机化,零样本上真机phc-perpetual-humanoid-control hover asap gmt
足式运动 / 导航四足 / 腿式移动仿真采样(几乎无真机数据)+ 网络视频(导航)仿真 RL(PPO)/ 视觉目标模仿电机关节角 / 归一化航点仿真训练零样本 sim-to-real 是范式底线rma-rapid-motor-adaptation extreme-parkour-legged-robots gnm-general-navigation-model

三条主线索贯穿全表:

  • 数据决定目标函数。操作有海量真机演示可采,于是模仿学习(BC)成主流;腿部运动无法安全地在真机上试错,于是仿真 RL + 域随机化成主流;人形介于两者之间,既要跟踪人类动捕(有参考、可用 RL 跟踪),又要用人类视频扩数据。
  • 动作表征在互相借用。action chunking(一次预测一段动作)从 ACT 起源,成了扩散策略、VLA 的标配;扩散 / flow 从专用策略(diffusion-policy)扩散进 VLA 的动作头(pi0 octo);离散 token 从 VLA(rt-2)反向进入人形动作生成(uh-1)。
  • 终点都是”基础策略”。四范式各自都长出了”一套权重管多本体”的通用模型:操作有 octo / crossformer-cross-embodied-learning,人形有 hover / sonic,导航有 vint-foundation-model-visual-navigation,甚至跨越范式的 crossformer-cross-embodied-learning(机械臂 + 四足 + 无人机一套权重)。

二、操作范式(上):模仿学习与动作表征的四次跃迁

操作是数据最富的一域,也是范式演进最快的一域。它的主线不是”换更大的模型”,而是”动作到底怎么表示”——因为人类演示天生是多模态、含噪声的(同一场景有多种正确解法),怎么建模这种分布决定了策略的上限。

2.1 从规模化 BC 到动作分块(2021–2023)

早期路线是”大数据 + 高容量 Transformer + 实时架构”的暴力模仿:bc-z 用 25877 条真机 + 18726 条人类视频训 ResNet+FiLM,对 29 个未见任务零样本平均 44%;rt-1 把它推到 13 万条 / 700+ 任务、35M Transformer、真机 3Hz 实时;interactive-language 更是采了近 60 万条语言标注轨迹、单策略执行 87588 条指令(93.5% 成功率)。这条路证明了规模换泛化,但都用逐步回归单个动作,在接触密集、多模态任务上容易学成”平均动作”而失败。

转折点是 ACT:用不到 2 万美元的开源双臂遥操作硬件,配一个 80M 的 Action Chunking with Transformers——核心是”一次预测未来 k 步动作块”并用 CVAE 建模人类演示的噪声与多模态,每任务仅 50 条演示就在装电池、开调料杯等精细任务上做到 80–90%。action chunking 从此成为整个操作领域的默认设计,后来被 pi0 openvla 一代 VLA 全盘继承。

2.2 显式建模多模态:能量模型、离散化、扩散(2022–2023)

同期另一条线专攻”怎么建模多模态动作分布”,几种思路百花齐放:

  • 隐式能量模型:implicit-bc-ibc 把 BC 从显式回归 â=F(o) 改写成”能量模型 + 推理时 argmin”,在接触密集、不连续任务上系统超过 MSE / MDN,甚至在 D4RL 上不用奖励逼近 offline RL。
  • 动作离散化 / tokenize:BeT 把连续动作 k-means 成”动作簇 + 残差偏移”套进 GPT,是”动作 tokenize”路线的开山;VQ-BeT 进一步用 Residual VQ-VAE 分层量化,单次前向生成多模态动作,比 Diffusion Policy 快 5 倍(仿真)/ 25 倍(真机板载 CPU)。
  • 扩散去噪:diffusion-policy 把策略表示成”以观测为条件的 DDPM,对整段未来动作序列去噪”,天然建模多模态、稳定易训,15 个任务 4 个基准平均比 SOTA 提升 46.9%。“动作分块去噪 + 滚动时域重规划”自此成为模仿学习的主流配方(RSS 2023 最佳论文)。

扩散路线随后被放大验证:ALOHA Unleashed 在 26000+ 条双臂演示上训 217M 扩散 Transformer,证明”大规模数据 + 表达力更强的扩散策略”这一极简配方就能掌握系鞋带、挂衬衫等可变形物体双臂任务。

2.3 扩散太慢:加速与稀疏化(2024–2025)

扩散策略的死穴是推理要几十上百步去噪,装不进算力受限的机器人。2024–2025 一大批工作专攻”把去噪步数砍到个位数甚至 1 步”,路线分蒸馏、改公式、改采样三类:

方法加速思路步数 / NFE延迟或吞吐slug
Consistency Policy从教师蒸馏一致性模型1–3 步真机 192ms→21ms(约 9×)consistency-policy
ManiCMconsistency 蒸馏进 3D 点云扩散10 步→1 步178ms→17ms(约 10×)manicm
AdaFlowrectified-flow + 逐状态自适应步长平均 1.12–1.56 NFE对标 DDPM 的 20–100 NFEadaflow
Streaming Diffusion Policy持久化动作缓冲区、滚动去噪,免蒸馏每步少量去噪与蒸馏路线打平streaming-diffusion-policy
One-Step Flow自一致性 + 自引导,从零蒸馏单步生成器1 步加速 100×+,超 100 步扩散one-step-flow-policy
MoDE噪声等级路由的去噪专家 MoE—FLOPs 砍九成、激活少 40%mode-mixture-of-denoising-experts
Sparse Diffusion PolicyFFN 位置塞 MoE,专家=技能、路由=规划器—多任务仅多约 1% 激活参数sparse-diffusion-policy

MoDE 在 CALVIN ABC→D 预训练后拿到 4.01、LIBERO-90 拿到 0.95,平均比第二名高 57.5%;Sparse DP 持续学习新任务时激活参数恒定(不像 LoRA 随任务线性增长)。这类工作和 RL 微调(DPPO 把去噪链当 MDP 让 PPO 回传奖励;ReinFlow 把这套搬到 flow matching)一起,把扩散 / flow 策略从”实验室 demo”打磨成”能上真机连续跑”的工程件。

2.4 从视频与 flow 学操作:把”运动”而非”动作”当跨域接口

一支越来越重要的路线不直接学机器人动作,而是学一层与本体无关的运动中间表征(点轨迹 / 光流 / 物体 flow),用它当”人类↔机器人、仿真↔真实”之间的桥,从而能吃海量无动作标注的人类 / 网络视频。这和后面 4.6 的”隐动作”是同一动机(绕开动作标注稀缺)的两种表征选择——一个学显式几何轨迹,一个学离散潜码。

方法中间表征训练数据关键数字slug
ATM任意 2D 点未来轨迹无动作视频LIBERO 130 任务 63% vs 视频基线 37%any-point-trajectory-model-atm
Track2Act初始→目标帧点轨迹→3D 刚体变换~40 万段网络视频Spot 25 项未见任务零样本track2act
General Flow任意查询点未来 3D 轨迹RGBD 人类视频Franka 零样本 18 任务 81%general-flow
Im2Flow2Act排除本体/背景的物体 flow人类视频 + 仿真 play真实四类任务平均 81%im2flow2act
CogRobottext→flow→video→动作有限双臂数据双臂基座策略泛化bimanual-flow-video-prediction-policy
Vid2Robot第三人称演示视频直接编码人 / 机视频比 bc-z +20 点vid2robot

生成式一支走得更远:把”预测未来视频”当预训练目标再迁到动作——GR-1 在 Ego4D 80 万段视频做语言条件未来帧预测再微调出动作,CALVIN 88.9%→94.9%;GR-2(3800 万视频、105 任务平均 97.7%)、GR-3、RynnVLA-001 一脉延续。这类”视频生成 → 动作”和”世界模型 VLA”(4.5)本质相通,区别只在生成的帧是当训练信号还是当在线规划。

2.5 换一种”任务指定”接口:草图 / 轨迹 / 图像化动作

动作表征之外,“怎么告诉机器人要干什么”本身也是范式轴。语言常有歧义、目标图像又过度指定,几种折中被提出:RT-Trajectory 用叠在初始图像上的 2D 末端轨迹草图指定”怎么做”(可从演示无标注自动提炼),7 个未见技能 67% 对 rt-1 的 16.7%、rt-2 的 11.1%;RT-Sketch 用手绘草图当目标,介于语言与图像之间。把动作本身渲进图像空间的一支——Genima 微调 Stable Diffusion 直接”画”未来关节目标球再交 ACT 执行(RLBench 25 任务 49.6%),Render and Diffuse 把候选动作渲成虚拟夹爪图叠到观测上、在图像空间去噪——用”观测-动作空间统一”的归纳偏置换空间泛化,与第三节的 3D 图像化渲染(rvt 一脉)同源。

2.6 末端与感知模态:灵巧手、触觉、听觉

末端从平行夹爪走向多指灵巧手、感知从纯视觉走向触觉 / 听觉,构成一条正在成形的”灵巧 + 接触”子范式。灵巧手操作靠专门的接触 / 几何先验补样本效率:CordViP 显式建”手-物接触图”预训练 3D 编码器(真机四任务平均 90%),GraspVLA 纯仿真 10 亿帧 SynGrasp 训抓取基础模型、零样本 sim-to-real 且开放词表泛化,DemoStart 仅 2–60 条次优仿真演示把三指手训到仿真 98.6–99.9% 再蒸馏上真机。感知模态上,ManiWAV 给手持夹爪装接触麦克风用声音感知接触事件(擦白板 40%→85%),ViTaMIn 把 UMI 升级成视觉-触觉双模态采集。数据入口则是一批灵巧遥操作 / 手持采集系统(anyteleop dexcap dexumi bunny-visionpro ace-f-foldable-teleop),把”没有力 / 触觉传感器也能采到接触信息”做成工程件。


三、操作范式(下):3D / 点云 / 关键帧几何策略

与”2D 图像进、动作出”的扩散策略平行,另一支操作路线坚持把 3D 几何显式做进策略——理由是操作本质是空间任务,2D 表征丢掉了深度和视角不变性,样本效率天然吃亏。这一支主要在 RLBench / ManiSkill 仿真基准上比拼,演进脉络清晰。

关键帧 / 体素路线从 PerAct 起步:把场景体素化成 100³ 网格、用 Perceiver 逐体素分类”下一个最佳动作体素”,每任务几条示范就学会语言条件 6-DoF 操作。但体素化算力随分辨率立方爆炸,后续工作各出招绕开:Act3D 改成”连续 3D 特征场里递归采样 ghost point”,RVT 把点云重渲染成多个虚拟正交视角图像喂多视角 Transformer,RVT-2 再加由粗到细两阶段,SAM-E 把视觉编码器换成预训练 SAM。

3D 扩散路线把动作扩散和 3D 表征缝合:ChainedDiffuser 用扩散生成器取代关键帧之间的运动规划器连接段,3D Diffuser Actor 用带 RoPE 相对注意力的 3D 去噪 Transformer 对整段 6-DoF 轨迹条件扩散。另一分支彻底走点云:DP3 用极简 MLP 点编码器 + 单视角稀疏点云喂进 Diffusion Policy,开创”3D 点云 diffusion policy”路线,衍生出 iDP3(改到相机坐标系、去掉标定与分割,上人形野外泛化)、RISE(稀疏卷积编码器)、SGRv2(动作局部性归纳偏置)。

方法3D 表征RLBench 多任务成功率相对基线slug
PerAct100³ 体素 + Perceiver 分类49.4%关键帧路线起点peract
Act3D连续 3D 特征场 + ghost point65%(249 变体)比 PerAct +22 绝对点、算力 <1/3act3d
RVT多视角虚拟渲染 Transformer62.9%比 PerAct +26% 相对、训练 36× 快rvt
RVT-2渲染 + 由粗到细两阶段81.4%训练 6× / 推理 2× 快,真机毫米级rvt-2
SAM-ESAM 编码器 + 动作序列头70.6%比 RVT +7.7 点、推理步 5.5× 少sam-e
3D Diffuser Actor3D token + 动作扩散 + 相对注意力81.3%比 Act3D +18.1 点3d-diffuser-actor
ChainedDiffuserAct3D keypose + 局部轨迹扩散80.9%(运动规划器难任务集)比纯 keypose +60 点chaineddiffuser

3D 路线的另一贡献是等变性:Equivariant Diffusion Policy 给去噪网络塞 SO(2) 等变结构,MimicGen 12 任务上 100 条演示成功率从 42.0% 拉到 63.9%,200 条即追平基线 1000 条;EquiBot 做到 SIM(3) 等变(平移/旋转/缩放全等变),5 分钟人类视频即可泛化未见物体尺度。到 2026,R3D 诊断出”3D 点云策略无法从更强骨干获益”的 scaling paradox 根因在 BatchNorm 与 3D 增强缺失,用高容量点云 Transformer + 空间保真 DiT 解码器在 RoboTwin 2.0 上刷到 83.8%(Easy)/ 64.8%(Hard)。

值得点出的是:3D 几何策略和 VLA 是两种哲学。前者靠归纳偏置换样本效率(每任务几十条演示、不吃网页数据、不追语义泛化);后者靠海量数据 + 大模型换语义泛化。两者在 2025 后开始互相渗透——VLA 里出现了 3D 表征(SpatialVLA 用 Ego3D 位置编码、internvla-m1 用空间提示、MolmoAct 先吐深度 token)。


四、通用 VLA:把动作当成大模型的输出模态

VLA 是过去三年最热的范式,本质是”用互联网预训练的语义先验补机器人数据的稀缺”。它的谱系可按”动作怎么接进大模型”分成几代。

4.1 前身:LLM 做高层规划(2022)

最早不是端到端 VLA,而是用冻结 LLM 做高层任务分解,底层交给现成技能:SayCan 用 LLM 列候选技能、用 RL 价值函数(affordance)给”当前场景真能不能做成”打分,两者相乘选下一步;Inner Monologue 给规划器接环境反馈闭环,真实厨房总成功率从 SayCan 的 30.8% 升到 60.4%;Code as Policies 直接让 Codex 把指令写成 Python 策略代码。PaLM-E 是关键跳板:把图像、状态、3D 场景表示用编码器投影进 PaLM 词嵌入空间与文本交错,端到端联合训练出最大 562B 的具身多模态模型,核心发现是”网页数据 + 多机器人数据混训带来正迁移”。

4.2 命名与奠基:动作即 token(2023)

RT-2 是”VLA”这个词的命名之作:把 PaLI-X(5B/55B)或 PaLM-E-12B 直接拿来,把 6-DoF 动作离散成 256 个 bin 当普通文本 token 塞进词表,与网页 VQA 数据 co-fine-tune,不加任何动作专用参数,未见泛化从 rt-1 的 32% 提到 62%,还涌现出”挑能当锤子的石头”这类推理能力。同期 RT-H 在任务和动作之间插一层”语言运动”层级,Q-Transformer 把动作逐维离散做离线 TD 学习,SARA-RT 把 RT-2 的 softmax 注意力换成线性注意力提速 14%。

4.3 跨本体池化与开源基座(2023–2024)

Open X-Embodiment 是这一代的数据地基:把 21 家机构 60 个数据集汇成统一 RLDS 格式(1M+ 轨迹、22 本体、527 技能),证明”不做任何对齐、只把数据池化一起训”就能正向跨本体迁移(RT-2-X 涌现技能提升约 3×)。基于它长出两个开源基座:Octo(transformer + 扩散头,27M/93M,可单卡微调到新本体)和 OpenVLA(Prismatic-7B,离散 AR,970k 轨迹,7B 参数超闭源 55B 的 RT-2-X 达 16.5%,首证 LoRA + 量化能消费级微调)。跨本体的更极致版本是 CrossFormer(一套 130M 权重管 20 种具身含无人机,不做任何对齐)和 HPT(每本体一个 stem tokenizer、共享 trunk,52 个数据集预训练,首次系统展示策略预训练的 scaling)。

4.4 连续动作专家:flow / 扩散头(2024–2025)

离散 token AR 在高频灵巧任务上吞吐不够,主流转向”VLM 主干 + 连续动作专家”。旗舰是 Physical Intelligence 的 π 系列:π0 在 PaliGemma 3B 上外挂 300M action expert,用 flow matching 直接生成 action chunk(H=50),3.3B 参数、最高 50Hz;π0-FAST 提出 DCT+BPE 动作分词器让 AR 也能高频;π0.5 靠异构数据 co-training 做到开箱进陌生家庭干 10–15 分钟长活;知识隔热 用 stop-gradient 防止 action expert 训坏 VLM 知识;π*0.6 用 RECAP 让 VLA 从真实部署经验自我提升;π0.7 靠多模态上下文条件展示接近 LLM 的组合泛化。同架构路线还有 CogACT(认知 token + DiT 动作模块,7.6B 超 OpenVLA/RT-2-X)、RDT-1B(DiT 扩散、1.2B、双臂)、Dita(去噪 token in-context 条件化)。

一个反例点出了”配方 > 数据”:OpenVLA-OFT 不换模型、不加预训练,只把 OpenVLA 改成”并行解码 + 动作分块 + 连续 L1 回归”,LIBERO 从 76.5% 拉到 97.1%、吞吐提高 26–43×,真机上反超在双臂数据上预训练过的 π0 / RDT-1B。

4.5 双系统与世界模型 VLA(2025–2026)

前沿是”慢思考 + 快动作”双系统解耦,把语义推理和高频控制分频异步跑:

模型System-2(慢/推理)System-1(快/动作)关键数字slug
Figure Helix7B VLM @7–9Hz80M transformer @200Hz单权重输出 35-DoF、双机零样本协作、板载 GPUfigure-helix
GR00T N1Eagle-2 VLM扩散 DiT flow @120Hz2.2B、四层数据金字塔、全开放groot-n1
GR00T N1.5冻结 Eagle 2.5+ FLARE 世界建模语言跟随 46.6%→93.3%groot-n1-5
Gemini RoboticsGemini 2.0 (ER)端到端 VLA @50Hz云端 backbone + 机载 decodergemini-robotics
Gemini Robotics 1.5ER 1.5(会思考、调工具)Motion Transfer 多本体 VLAALOHA/Franka/Apollo 零样本迁移gemini-robotics-1-5
Galaxea G0VLM 高层规划VLA 精细执行500+ 小时单本体数据galaxea-g0
InternVLA-A1理解专家 MLLM生成专家 + flow 动作专家高动态场景比 π0/GR00T 高 40–73 点internvla-a1

同期涌现”动作模型 + 世界模型同权重联合”的一支:WorldVLA 让”预测动作”和”预测下一帧”共享词表互相监督,LIBERO 从 76.5% 提到 79.1–81.8%;RynnVLA-002 把 VLA 和世界模型塞进同一 Chameleon 权重,真机从 <30% 拉到 80%+;DreamGen 用视频世界模型”造梦”出神经轨迹当训练数据,让人形从单环境数据学会 22 个新动词。

4.6 隐动作与人类视频:破解动作标注稀缺

VLA 最贵的是带动作标注的真机数据。一条重要支线是从无动作视频学”隐动作”:LAPA 用 VQ-VAE 从无标签视频学离散潜动作码本,第一个不需动作标签的 VLA 预训练,实机反超用 97 万带标签轨迹的 OpenVLA、算力省 30–40×;UniVLA 用两阶段 VQ-VAE 解耦”任务相关”隐动作,仅 960 A100-hours(OpenVLA 的 1/20)全面反超;Moto、villa-X、UniAct(256 条跨本体动作码本)、UMI 一脉的手持采集(数据缩放律 证明多样性比数量重要)都在补这块。轻量化方向则有 TinyVLA(70M–1.4B + 扩散头,延迟低 20×)、SmolVLA(450M、481 个社区数据集、CPU 可推)、DeeR-VLA(多出口提前退出,算力砍 1/5–1/6)。

4.7 推理增强与 VLM 知识保持

VLA 微调有个普遍副作用:一学动作,预训练 VLM 的对话 / 推理能力就被”训坏”。一支工作专治这个:ChatVLA 用分阶段对齐训练 + 只在 MLP 层的二专家 MoE 让同一 Qwen2-VL-2B 既能答题又能操作,ChatVLA-2 进一步用动态 MoE 保住开放世界推理,DexVLA 挂 10 亿参数可插拔扩散专家 + 三阶段具身课程,DiVLA 用 FiLM 把 VLM 推理 embedding 注入扩散动作头(不必二次前向),知识隔热 则用 stop-gradient 从梯度层面隔开动作专家对 backbone 的侵蚀。**显式”先推理再动作”**的一支:RT-H 在任务与动作间插一层语言运动层级(比 RT-2 高 15%、语言纠错把成功率 40%→63%),MolmoAct 在动作 token 前先自回归吐深度 token + 视觉推理轨迹(仅 26.3M 样本超 pi0 的 9 亿样本),WALL-OSS / WALL-OSS 0.5 用统一 Cross-Level CoT 把”指令→推理→子任务→连续动作”串进单一可微框架。系统性实证方面 RoboVLMs 用 600+ 组对照实验给出 VLA 建造配方——连续动作 + policy head 融合历史 + 选视觉语言预训练充分的 backbone + 跨本体数据放预训练阶段(CALVIN ABC→D 平均完成 4.25/5)。这条线也解释了为何”具身大脑”MLLM(RoboBrain RoboBrain 2.0 RoboBrain 2.5)与端到端 VLA 越来越分工:前者管高层空间推理 / 可供性 / 价值估计,后者管低层动作。


五、人形全身控制:从动作跟踪到全身操作基础模型

人形是控制维度最高(20–60 DoF)、稳定性最脆的一域。它和操作的根本差别在于:没有”演示动作”可直接采(人形和人类身体不一样),主力范式是”在仿真里 RL 跟踪人类动作参考 + teacher-student 蒸馏上真机”。演进按能力分层。

5.1 动作跟踪基座:从模仿单条到模仿整库

奠基是 PHC:单一策略在不施加外力下模仿整个 AMASS 库的 98.9%,还能从摔倒自然爬起继续跟踪,成为后续大量人形工作的底层 tracker。规模化沿”数据 × 模型 × 算力”三轴放大:SONIC 用 700 小时 / 100M+ 帧、1.2M→42M 参数、128 GPU 训单一通用策略,还用统一 token 空间把机器人动作、人体动作、遥操作、视频/文本/音乐乃至 VLA 全接到同一策略;GMT 靠 Adaptive Sampling 课程 + Motion MoE 让单策略跟踪从走路到功夫的全身动作;UniTracker 用 CVAE 学生跟踪 8179 条 AMASS 动作。数据侧的关键工具是 OmniRetarget(交互网格 + 硬约束优化的”保交互”重定向,让 RL 只用 5 条奖励零样本上真机)。

5.2 模式统一:一套权重管多种控制接口

HOVER 是范式代表:先 RL 训一个吃 AMASS 的全身模仿 oracle,再蒸馏进统一多模态学生,同一套权重靠”掩码”在关键点跟踪 / 关节角跟踪 / root 速度跟踪之间任意切换(>15 种模式、上下半身独立),逐项超过 exbody、H2O、OmniH2O、HumanPlus 等 specialist。前身 ExBody 用”上半身严格模仿、下半身只跟 root 速度”的解耦让 H1 复现人类动作,ExBody2 升级为真·全身跟踪;MHC 用同一 LSTM 跟踪”任意子集被 mask”的目标姿态,把手柄/VR/视频三种输入统一成一种接口。

5.3 遥操作:人形数据采集的入口

人形数据靠遥操作采,硬件/算法花样最多:H2O 首个 RL 实时全身遥操作(一台 RGB 相机驱动 H1);OmniH2O 只用 VR 三点稀疏输入做灵巧全身操作;HumanPlus 用 40 小时 AMASS 训低层策略 + 一台 RGB 相机”影随”33-DoF 人形;TWIST / TWIST2(免动捕、PICO 4 + 脚踝追踪器)、CLONE(VR 三点 + LiDAR 闭环把漂移压到厘米级)、HOMIE($0.5k 等构外骨骼驾驶舱)、AMO(轨迹优化扩展可达工作空间)、Mobile-TeleVision(上身 IK / 下身 RL + CVAE 运动先验)各补一环。

5.4 敏捷极限动作与全身操作

跟踪打底后,工作转向”更难的动作”和”边走边操作”:

工作本体方法要点达成的极限slug
ASAPUnitree G1残差 delta action 补 sim-to-real 失配C 罗 Siuuu 跳、1.5m 前跳asap
KungfuBotG1双层优化在线自适应跟踪容差拳击组合拳、360° 回旋踢、太极kungfubot
HuBG1参考精修 + balance-aware 学习极限单腿平衡,真机 24/25hub-extreme-balance
HumanUPG1两阶段课程 RL(发现→跟踪)首个真机学习式起身humanoid-getup
Humanoid ParkourUnitree H1分形噪声 reward + 视觉蒸馏跳 0.42m 台、跨 0.8m 沟、1.8m/shumanoid-parkour-learning
FALCON人形双智能体 + 力课程抗 0–100N 外力做负重操作falcon
WoCoCoH1接触序列分解 + 稠密接触奖励跳石头、搬箱、攀爬wococo

全身 loco-manipulation(边移动边操作)是当前主攻点:SkillBlender(预训练 4 原语技能再混合)、ResMimic(GMT 打底 + 残差修正做负重搬运)、VisualMimic(视觉高层 + 关键点低层)、PhysHSI(AMP 学搬箱/坐椅/躺床)都在这一层。

5.5 人形也在做 VLA 与行为基础模型

人形范式最新趋势是把 VLA 和”行为基础模型(BFM)“引进来:LeVERB 首个人形 WBC 的分层隐动作 VLA(VL 塔 102.6M 出 10Hz latent verb、A 塔 1.1M 出 50Hz 动作、纯合成数据零样本上 G1);WholeBodyVLA 用两个 VQ-VAE 隐动作模型让 Prismatic-7B 做统一监督、单策略连续完成”走位—蹲下—抓取—转身—放置—推车”;Ψ₀(人类视频 + 真机两阶段)、Galaxea G0.5(纯自回归、跨本体 ActionCodec)、Being-0(三层分层智能体)各走一路。BFM 侧,BFM-Zero 用无监督 RL(Forward-Backward + FB-CPR)把动作、目标位姿、奖励嵌进同一潜空间 Z,零样本被”提示”做多种任务,是第一个把这套范式跑到真实 G1 的模型;BeyondMimic 用 loss-guided diffusion 把跟踪策略蒸馏成单一联合扩散策略做下游导航/遥操/避障。


六、足式运动与导航:仿真 RL 零样本 sim-to-real 的大本营

这一域和操作几乎是”镜像”:操作以真机模仿为主,运动几乎全在仿真里 RL、零样本上真机——因为腿部高速运动无法在真机上安全试错,且仿真吞吐足够(Isaac Gym 单卡上万环境)。

6.1 四足运动的 sim-to-real 配方

奠基是”仿真训练、真机零样本部署”:谷歌 Minitaur 工作 把执行器建模 + 延迟仿真 + 动力学随机化叠进 PyBullet 学出 trotting/galloping,比手调步态省电 23–35%。核心难题是”仿真里没有的真实环境参数怎么在线适应”,几条经典解法:

工作本体方法要点关键数字slug
RMAUnitree A1base policy + 在线估计 extrinsics 的 adaptation module<1s 估出 8 维环境隐向量rma-rapid-motor-adaptation
Learning QuadrupedalANYmal特权 teacher→纯本体感觉 student + 地形课程SubT 竞赛四场零失败learning-quadrupedal-locomotion-challenging-terrain
Learn to Walk in MinutesANYmal CIsaac Gym 数千并行 on-policy RL平地 <4min / 崎岖 <20minlearning-to-walk-in-minutes-massively-parallel-rl
Walk These WaysGo18 维行为参数编码”多种解法”(MoB)部署时旋旋钮零样本跨场景,50Hzwalk-these-ways
DreamWaQA1隐式地形想象(CENet 推断特权信息)纯本体感觉走完 430/465m 户外dreamwaq
Perceptive LocomotionANYmalGRU belief encoder 融合外感 + 本体感觉阿尔卑斯徒步零跌倒learning-robust-perceptive-locomotion-wild

legged_gym + rsl_rl(learning-to-walk-in-minutes-massively-parallel-rl 随附)成了整个领域被反复 fork 的基线。

6.2 跑酷:把运动推到敏捷极限

2023–2024 一批”学习式跑酷”把腿式运动推到极限,共同点是”纯 RL 无参考动作 + 单目深度相机 + 端到端上真机”:Extreme Parkour 用一个前置深度相机让 A1 跳 2 倍身高的箱、跨 2 倍身长的沟、跑 37° 坡、倒立行走;Robot Parkour 用”软/硬动力学两阶段 + DAgger 蒸馏纯视觉策略”训五个专家技能;ANYmal Parkour 用感知/运动/导航三模块分层,2 m/s 敏捷穿越。安全 / 精确落脚的补充有 ABS(双策略 + Hamilton-Jacobi 可达-规避,3.1 m/s 保避障)、DTC(轨迹优化 + RL 跟踪混合)、NVM(SE(3) 等变体素记忆)、Barkour(犬类敏捷赛 benchmark)。

6.3 四足 loco-manipulation:装上手臂

四足加机械臂后进入 loco-manipulation:Deep Whole-Body Control 用单策略同时输出腿关节和臂关节(不分层),提出 Advantage Mixing 和 Regularized Online Adaptation;UMI-on-Legs 把 UMI 手持采集的操作策略”装”到四足狗上,两策略只靠末端轨迹握手;WildLMa(全身控制 + CLIP 技能库 + LLM 规划器做长程野外任务)、Helpful DoggyBot(Go2 + 咬合夹爪 + 现成 VLM 零训练开放世界抓取)各补一环。

6.4 视觉导航:从目标条件基础模型到 VLN

导航是唯一大量用网络视频的运动子域。目标条件导航基础模型一脉:GNM 首个跨具身 image-goal omnipolicy(6 本体 60 小时),ViNT 是 31M 图像目标基础模型(80 小时 8 本体,零样本控 Go1),NoMaD 用目标掩码扩散把定向导航和探索合进 19M 模型(比 335M SOTA 高 25%),CityWalker 从 2522 小时 YouTube 城市视频学(214M),LeLaN 用基础模型自动打标 130 小时野外视频学语言导航(89% SR)。

语义 / 视觉语言导航(VLN)一脉:

模型类型方法要点关键数字slug
VLFM零训练 ObjectNavBLIP-2 算图文相似度铺价值地图找前沿Gibson/HM3D/MP3D +11.7/8.1/3.3 SPLvlfm-vision-language-frontier-maps
Mobility VLA零训练分层导航Gemini 1.5 Pro 看导览视频 + 拓扑图复杂推理/多模态指令 86%/90%mobility-vla
NaVid视频 VLM VLN-CE单目 RGB 流出下一步动作,无地图/里程计真实四场景约 66% SRnavid-video-vlm-vln
NaVILA腿式机器人 VLAVILA 8B 出中层语言动作 + LiDAR RL 执行跨 Go2/H1/G1,真机 88% SRnavila-legged-robot-vla-navigation
Uni-NaVid统一 4 导航任务单视频 VLA、next-token 出动作3.6M 样本、约 5Hzuni-navid-video-vla-navigation
TrackVLA具身视觉跟踪识别语言头 + 跟踪扩散头共享 7B 主干四足真机 10 FPStrackvla-embodied-visual-tracking

到 2026,导航也出现”完全不训练”的组合式智能体 Uni-LaViRA(两个通用 MLLM 三级翻译 + agent-loop 机制,零训练打平百万轨迹训练的导航基础模型),呼应了 VLM 直接当具身控制器(PIVOT 把控制变视觉多选题)的思路。


七、四范式的汇流:跨本体基础策略

四条范式看似分立,2024 后明显向”基础策略”合流——一套权重跨本体、跨任务、可微调迁移。汇流靠三股力量:

  • 跨本体数据池化 + 统一动作接口。从 open-x-embodiment 池化,到 octo / crossformer-cross-embodied-learning / hpt-heterogeneous-pretrained-transformers 用共享 trunk + 逐本体 stem/head,再到 RoboCat 用冻结 VQ-GAN token 控多本体(自我改进从 36% 提到 74%),甚至 CrossFormer 把机械臂、四足、无人机塞进一套权重。Skild Brain 号称在 10 万个仿真形态上训单一低层策略、零样本适应断腿/锁膝并展现 in-context learning。
  • 人类视频当第三条数据源。Ego4D(3670 小时第一人称)、Ego-Exo4D、EgoDex(829 小时 + 配对 3D 手姿)撑起视觉预训练(R3M、MVP、VC-1)和”隐动作从视频学”(前述 LAPA/UniVLA),把机器人数据稀缺问题绕过去。GR-1 / GR-2 / GR-3 一脉靠视频生成预训练迁移到操作。
  • 数据飞轮与经验自提升。RoboCat 自生成数据并回训、π*0.6 用 RECAP 从真实部署经验迭代、DYNA-1 用奖励模型在环连续 24 小时自主运行(折 850+ 份餐巾、99.4%),标志范式从”离线模仿固定数据集”转向”在线经验闭环”。评测基础设施同步跟上:SIMPLER(real-to-sim 评测,Pick Coke Can r=0.976)、RoboArena(机器人版 Chatbot Arena,成对真机盲评)、RoboReward / RoboBrain 2.5(通用奖励模型)让通用策略可复现比较。

空白与趋势