具身智能架构演进:从 RT-1 离散 token 到统一 VLA 与人形全身控制

概述:机器人策略架构这几年沿四条互相缠绕的主线推进。(1) 感知—策略骨干:从”冻结视觉编码器 + 轻量动作头”(bc-z 的 ResNet18+FiLM、r3m/mvp-masked-visual-pretraining/vc-1-cortexbench 的 PVR),到从头训练的小 decoder-only Transformer(rt-1 35M),再到”把互联网预训练 VLM 直接当策略骨干”(rt-2/palm-eopenvla/pi0),骨干从 35M 一路涨到 3–8B。(2) 动作头/动作表示离散 token([[rt-1]]/[[rt-2]]/[[openvla]] 逐维 256 bin)→ 连续回归([[octo]] 扩散头 / [[openvla-oft]] L1)→ 扩散([[diffusion-policy]]/[[dp3-3d-diffusion-policy]]/[[cogact]] DiT)→ flow matching([[pi0]]/[[groot-n1]]/[[smolvla]]),再分岔出”更好的动作分词器”(pi0-fast 的 DCT+BPE、vq-bet/wall-oss-0-5 的残差 VQ)与”潜动作预训练”(lapa-latent-action-pretraining/univla/villa-x)。(3) 动作分块(action chunking)aloha-act 的 CVAE+chunk=100 把 π(aₜ|sₜ) 换成 π(a_{t:t+k}|sₜ),此后几乎所有 VLA/扩散策略都以 chunk 为动作单元。(4) 系统结构:从”单塔 VLM 直接吐动作”走向”慢 VLM 规划 + 快动作专家”的双系统groot-n1/figure-helix/gemini-robotics/pi0-5)。与此并行,扩散/3D 策略diffusion-policy 系)与人形全身控制(motion-tracking RL → 行为基础模型 → 人形 VLA)各成一支,最终在 psi-0-humanoid-loco-manipulation/leverb 这类”上层 VLA + 下层 RL 跟踪”的三系统里汇流。


一、前 VLA 时代:冻结感知 + 轻量动作头(2018–2022)

早期真机策略的共同范式是”一个(常冻结的)视觉编码器 + 一个逐任务从头训练的小动作头”,架构创新集中在动作表示而非骨干。

  • 感知前端(PVR,冻结)r3m(ResNet50 + 视频-语言时序对比 + DistilBERT 打分头)、mvp-masked-visual-pretraining(ViT-S/B/L 的 MAE 自监督,ViT-L 307M)、vc-1-cortexbench(ViT-L MAE,24 层/1024 维)都只训一个图像编码器,下游各套一个 2–4 层 MLP BC 头,编码器权重全程冻结。
  • 判别式 BC + FiLM 条件bc-z 是这一范式的代表——ResNet18 主干、512 维任务嵌入经 FiLM 调制 4 个 block,多个 2 层 MLP 头分别回归 delta-XYZ / delta-axis-angle / 夹爪连续值;saycan 的底层技能沿用同款 USE-embedding→FiLM→ResNet18。
  • 动作表示的三条早期路线(都在解决”演示是多峰的、L2 回归会取均值”这个病):
    • 能量模型(隐式 BC)implicit-bc-ibc 不输出动作而输出能量 E_θ(o,a),推理时对 a 求 argmin,用 DFO/自回归-DFO/Langevin 三种采样按动作维度选用(≤5 维用 DFO,高维用 Langevin)。
    • 离散 bin + 连续残差behavior-transformer-bet 对全数据集动作跑 k-means 得 k 个中心,minGPT 双头分别预测”属哪个 bin”与”每个 bin 的残差向量”;vq-bet 进一步把 k-means 换成残差 VQ-VAE(N_q=2 层码本,primary 粗聚类 + secondary 细修正,码本 8–16、模式数 k²=64–256),GPT 预测码 + 连续 offset 头补精度。
    • action chunking 的起点aloha-act 用 DETR 式 CVAE 一次预测 k=100 步动作、配 temporal ensemble,是”动作块”成为默认动作单元的开端;roboagent-mt-act(MT-ACT)把它扩到多任务、mobile-aloha 加移动底盘。

表 1 · 前 VLA 时代动作表示对比

工作骨干动作头/表示动作维度关键数字
bc-zResNet18 + FiLM多 MLP 头回归 delta 位姿 + 连续夹爪6-DoF + 夹爪自适应 N 步预测;辅助 10 步开环
implicit-bc-ibcConvMLP(late fusion)EBM 能量 E(o,a),argmin 推理2–32 维Langevin 推理跑训练 2× 步数
behavior-transformer-betminGPT(1–6 层)k-means bin 分类头 + k×dim offset 头低维状态Kitchen 64 bin,10⁴–10⁶ 参数
vq-betminGPT(6 层/120 维)残差 VQ(N_q=2)+ offset 头视/状态码本 8–16,模式数 64–256
rt-1decoder-only Transformer 35M逐维 256 bin 离散 token11 维(7 臂+3 底盘+1 模式)FiLM-EffNet-B3 tokenizer + TokenLearner,3Hz
aloha-actResNet18 + DETR-CVAE 80M连续回归 + chunk=10014 维(双臂关节)temporal ensemble;k=90 实机

rt-1 是承前启后的关键节点:6 帧 300×300 图经 FiLM-EfficientNet-B3(语言 identity-init FiLM 早融合)产出 81 个图文 token、TokenLearner 压到 8 个、8 层 decoder-only Transformer 出 11 维×256 bin 离散动作——确立了”动作即离散 token”这条后来被 rt-2/openvla 继承的主线。q-transformer 把 RT-1 的分类头换成逐维 Q 值做离线 RL(每维 256 bin,自回归 8 次出一个动作);rt-trajectory/rt-sketch 拼接轨迹/目标草图、去掉语言 FiLM。平行的 3D 分支(peract 100³ 体素 + PerceiverIO、rvt 多视角重渲染、act3d 幽灵点)把动作定位建成”逐体素/逐点离散分类 + 运动规划器执行”。


二、VLA 范式确立:把动作写进 VLM 词表(2022–2024)

“用互联网预训练的 VLM 当机器人策略骨干”是 2023 年最大的范式跳变,动机是借 VLM 的世界知识做语义泛化。三种奠基形态:

  • LLM 主干 + 多模态注入(无独立动作头)palm-e 把连续观测经编码器 φ 映射成”与语言 token 同维的向量”,动态嵌进 PaLM(8B/62B/540B)的文本序列里,输出是”低层技能序列”文本——是”VLM 当高层规划器”的原型。saycan/inner-monologue/code-as-policies 是同类”LLM 规划器 + 现成技能库”的组合系统,尚未把 VLM 拉进闭环控制。
  • 动作即语言rt-2 把 6-DoF delta 位姿 + 夹爪 + 终止各维离散成 256 bin、拼成整数字符串,让 VLM(PaLI-X 5B/55B 或 PaLM-E-12B)直接自回归吐这串数字;关键工程是”输出约束”(动作任务只从合法动作 token 采样)与 token 绑定(PaLI-X 用整数 token,PaLM-E 覆写最不常用的 256 个 token)。sara-rt 给这条重骨干做线性注意力加速。
  • Transformer-first 通用策略octo 反其道——图像只过很浅的卷积切 patch(第三人称 256 token/腕部 64 token),把算力堆在 Transformer 骨干(Small 27M / Base 93M),用 readout token(BERT 式 [CLS]) + 扩散动作头(3 层 MLP,DDPM 20 步,只跑一次骨干前向)预测连续 chunk;模块化设计让微调时能自由增删观测/head。
  • 开源 VLA 基线定型openvla 把骨干换成 Prismatic-7B(DINOv2 ViT-L + SigLIP ViT-So400M 双编码器拼接 + Llama-2 7B),动作沿用 RT-2 式离散化但改用1/99 分位数划 bin、覆写词表尾部 256 token;两条被反复引用的经验——“微调视觉编码器而非冻结对 VLA 至关重要”、“224² 与 384² 精度无差但快 3×”。

表 2 · VLA 骨干 × 动作头谱系(2022–2025)

工作VLM 骨干视觉编码器动作头动作表示规模
palm-ePaLM 8/62/540BViT-4B/22B无(输出技能文本)语言子目标12–562B
rt-2PaLI-X / PaLM-EViT-22B / ViT-4B自回归离散 token8 整数×256 bin5–55B
octo从头 Transformer浅卷积 patch扩散头(MLP,DDPM 20 步)连续 chunk=427–93M
openvlaLlama-2 7BDINOv2+SigLIP离散 token7 维×256 bin(分位数)7.5B
cogactLlama-2(Prismatic 7.5B)DINOv2+SigLIPDiT 扩散(认知 token 条件)连续 15 步+DiT 13/89/308M
pi0PaliGemma 3BSigLIPflow-matching action expert连续 chunk H=503.3B
groot-n1Eagle-2(SmolLM2)SigLIP-2DiT + flow matchingpad 到 32 维 / H=162.2B
molmoactQwen2.5-7BSigLIP2 ViT自回归(深度→轨迹→动作三段链)顺序保持 256 token8.6B
magmaLlama-3-8BConvNeXt-XXL文本 token(SoM/ToM)复用尾部 256 token8.6B

三、动作头的四范式分化:离散 / 连续 / 扩散 / flow(2023–2026)

VLA 骨干趋同到 VLM 之后,架构竞争集中到动作头。四条路线及其代表:

3.1 离散 token 及其”更好的分词器”

rt-2/openvla 的均匀/分位数 bin 简单但有两个病:逐维自回归慢、高频轨迹的 DCT 频谱被均匀量化糟蹋。两类改进:

  • FAST(频域分词)pi0-fast 对动作序列逐维做 DCT → 缩放取整 → 列优先展平 → BPE 压缩(词表 1024),把 1 秒动作块压成稠密 token;FAST+ 是在 ~100 万条跨本体动作上训的通用词表。wall-oss/graspvla/galaxea-g0/psi-0-humanoid-loco-manipulation 都用 FAST 做预训练期的离散动作表示。
  • 可学习 RVQ 分词器wall-oss-0-5 的 Vision-Aligned RVQ、galaxea-g0-5 的 ActionCodec(残差 VQ + 时序对比目标)用可学习码本取代规则化 FAST,联合视觉-动作对齐、下一帧预测、DCT 域重建三个目标;molmoact 则把 256 bin 一一映射到 Qwen2 tokenizer 尾部按字典序排好的 256 个 byte-level token,实现”顺序保持”加速收敛。

3.2 连续回归(并行解码)

把因果自回归换成”一次前向出整块动作”:openvla-oft 把 OpenVLA 的因果掩码换成双向、输入换成空动作 embedding,配 4 层 MLP L1 头 + action chunking(LIBERO K=8 / ALOHA K=25),把 D 次串行 decoder 前向压成 1 次(LIBERO 配置 279M 可训 / ALOHA OFT+ 853M);crossformer-cross-embodied-learning 用 readout token + L1 连续回归统一 4 类本体(单臂 7 维/导航 2 维/双臂 14 维/四足 12 维);hpt-heterogeneous-pretrained-transformers 的 Stem→Trunk→Head 里 Head 默认连续回归(消融后弃用离散 token,Trunk 3.1M→1.1B 五档)。

3.3 扩散动作头(DiT / ScaleDP)

把去噪网络挂在 VLM 特征上:cogact 用”认知 token”浓缩 VLM 输出、再喂 DiT-Base(89M,DDIM 10 步 + CFG 1.5)——VLM 只产条件向量、不直接吐动作;dexvla/chatvla/chatvla-2/diffusion-vla 用 ScaleDP(32 层/1280 维/16 头的 Diffusion Transformer,最大 1B)当动作专家、推理 token 经 FiLM 注入;rdt-1b 是纯 DiT-with-CrossAttention(28 层/2048 维/1.2B),三处机器人专用改造(QKNorm+RMSNorm 稳数值、MLP decoder、图文交替 cross-attention 注入)+ 128 维物理可解释统一动作空间。

3.4 flow matching(当前主流)

pi0 确立了模板——PaliGemma 主干 + 从头初始化的 action expert(1024 宽/300M),二者只在 self-attention 层交互(token 级 2 专家 MoE),条件流匹配损失、τ 从 shifted-Beta(1.5,1) 采样、blockwise-causal 三块掩码 [图文]→[状态]→[噪声动作]。此后 groot-n1/groot-n1-5(DiT + AdaLN + flow,K=4 步去噪)、bytedance-gr-3(DiT 层数为 VLM 一半、只用后半 KV cache)、smolvla(SmolVLM2 + 交替 CA/SA 动作专家、层跳过 N=L/2)、figure-helix(7B S2 + 80M S1 直接回归连续 35-DoF)、galaxea-g0graspvlahume-vla 全走 flow。pi-knowledge-insulation 提出关键 trick——action expert 对 backbone 的注意力 key/value 套 stop-gradient(信息单向流、梯度不回灌 VLM),使离散 FAST token 与连续 flow 双损失可 α=1 联合训练。

表 3 · 四种动作头范式对比

范式代表机制推理成本长处 / 短板
离散 tokenrt-2 openvla pi0-fast逐维 bin / FAST 分词,自回归解码D×decoder 前向(慢)复用 VLM 词表,训练简单 / 逐维串行慢、量化损精度
连续回归(并行)openvla-oft crossformer-cross-embodied-learning hpt-heterogeneous-pretrained-transformers双向掩码 + MLP/L1 头一次前向出整块1 次前向(快)极快、无量化损 / 单峰、多峰分布易糊
扩散octo cogact rdt-1b dexvlaDiT/UNet 去噪,DDPM/DDIM 多步多步去噪(可 DDIM 压到 4–10)天然多峰、精细 / 采样步数换延迟
flow matchingpi0 groot-n1 smolvla figure-helix学速度场,Euler 积分 4–10 步少步 flow(快)直线轨迹、少步高质、易与 VLM 联训 / 需调 τ 采样

几个值得单挑的动作头设计:action chunking 的三种平滑术——aloha-act 的时间集成 w_i=exp(-m·i)aloha-unleashed 的开环整段执行、cogact 按预测间余弦相似度加权的 Adaptive Action Ensemble;rdt-1b 的”物理可解释统一动作空间”(各维明确 SI 单位、除夹爪外不归一化)。


四、扩散策略与 3D 策略分支(2022–2026)

与 VLA 主线平行,“纯扩散做视觉运动策略”自成一支,起点是 diffusion-policy

4.1 Diffusion Policy 母架构

diffusion-policy 把动作生成建成条件 DDPM:观测 T_o 步为条件、预测 T_p 步、执行 T_a 步再重规划(receding horizon);两种去噪骨干——CNN 版(1D 时序 U-Net + FiLM 注入观测,开箱即用但对高频动作过平滑)与 Transformer 版(minGPT decoder,观测做 cross-attention、动作 token 因果掩码,精度高但难调);视觉编码器是 ResNet-18(GAP 换 spatial softmax、BN 换 GroupNorm 以兼容 EMA),平方余弦噪声调度。这套骨干被 droid/data-scaling-laws-imitation(换 DINOv2 ViT-L 全量微调)/scaling-up-distilling-down-sudd(加语言条件)/dexcap/im2flow2act/genima 等大量工作直接复用。

4.2 3D 表征分支

“把 3D 几何显式喂进策略”是提升空间精度与泛化的主流:

  • 体素/幽灵点/多视角peract(100³ 体素 + PerceiverIO 2048 latent,逐体素 Q 分类)、act3d(CLIP-RN50 特征抬升成 3D 点云 + 由粗到细幽灵点采样 + RoFormer 相对 3D 注意力,绝对→相对位置编码 55.4%→98.1%)、rvt/3d-mvp(重渲染正交虚拟视角 + 多视角 Transformer)、gembench 的 3D-LOTUS(PointTransformerV3 U-Net)、sgrv2(PointNeXt-XL 逐点相对位置预测 + 加权聚合,涌现 affordance 聚焦)。
  • 点云扩散dp3-3d-diffusion-policy(极简:点云→64 维 MLP 编码器 + 原装 Diffusion Policy UNet,证明”3D 模态本身有效”)、idp3-improved-3d-diffusion-policy(金字塔卷积编码器 + egocentric 相机系点云免标定 + 加长 horizon,为上人形而生)、rise-3d-perception-imitationr3d-revisiting-3d-policy-learning(Point-SAM 编码器保留 point token 不池化 + DiT 交叉注意力)。
  • 轨迹扩散 + keypose3d-diffuser-actor(3D relative denoising Transformer,位置/旋转用不同噪声调度)、chaineddiffuser(Act3D 出 macro-action keypose + DDPM 补中间轨迹)、hierarchical-diffusion-policy-hdp(PerAct 高层 + RK-Diffuser 低层)、render-and-diffuse(渲染动作表示,图像/动作双空间去噪)。

4.3 等变与加速

表 4 · 扩散 / 3D 策略分支对比

工作输入表征去噪骨干动作空间关键设计
diffusion-policyRGB(ResNet18)1D UNet / TransformerEE 位姿 chunkreceding horizon,spatial softmax
dp3-3d-diffusion-policy点云(64 维 MLP)1D UNet关节/EE,H=4丢颜色 + FPS 512 点,DDIM sample-pred
idp3-improved-3d-diffusion-policyegocentric 点云 4096金字塔卷积 + UNet25 维关节相机系免标定,加长 horizon
3d-diffuser-actorCLIP 特征抬升 3D3D relative Transformerloc R³+rot 6D+open位置/旋转异构噪声调度,RoPE 相对注意力
aloha-unleashed4×ResNet50(85M)Transformer decoder(55M)14 维绝对关节 / chunk=50开环执行,0.043s@4090
equivariant-diffusion-policy图像/体素C8 等变 UNetSE(3) 位姿escnn,去噪函数等变归纳偏置
consistency-policyRGB(DP 骨干)CTM 蒸馏10 维 chunk单步/3 步链式,dropout 保训练信号
r3d-revisiting-3d-policy-learningPoint-SAM tokenDiT 交叉注意力关节 + 任务空间双头保留 point token 不池化,4 层足够

五、Action chunking、视频预训练与潜动作(2023–2026)

三条”从更弱标注里榨动作先验”的线,都靠架构技巧把”视频/人类演示”接进策略。

  • 动作分块的扩散化aloha-act 的 CVAE-chunk 之后,aloha-unleashed 把动作头换成 Transformer 扩散解码器(55M,50×14 加噪块 cross-attend 编码器 latent,DDIM 50 步)、open-television 把 ACT 视觉换 DINOv2、humanoid-policy-human-policy-ph2d 用 DINOv2-ACT + 54 维统一人-机状态空间。
  • 视频生成预训练 + 动作头bytedance-gr-2(GPT 式自回归视频预测 + cVAE 动作头,VQGAN 离散图像 token,30M–719M 谱系)、bytedance-gr-3(Qwen2.5-VL + DiT flow)、seer-predictive-inverse-dynamics(GPT-2 骨干里 foresight token [FRS] 与 action token [INV] 单向融合,把”预测未来帧 + 逆动力学出动作”塞进一个网络,可训 65M)。
  • 潜动作(latent action)预训练:核心是”无动作标签的视频也能学策略”——用 IDM 从相邻帧对提取离散潜动作、让 VLM 预测它,再用少量真机数据解码。lapa-latent-action-pretraining(C-ViViT tokenizer,潜空间 8⁴ 远小于 OpenVLA 的 256⁷)、moto(Latent Motion Token + Moto-GPT 98M + 协同微调)、univla(两阶段 VQ-VAE 分离任务无关/任务中心码本,扩词表新增 |C|=16 个 ACT token)、villa-x(LAM 加 proprio-FDM + ACT-latent/ACT-robot 双专家)、wholebodyvla(manipulation/locomotion 双 LAM)、worldvla(Chameleon 骨干统一图像/文本/动作 token + 动作专属注意力掩码)。

六、双系统:慢 VLM 规划 + 快动作专家(2024–2026)

单塔 VLM 既要语义推理又要高频控制存在根本张力(大模型慢、机载跑不动、延迟不满足实时)。解法是把”慢系统 S2(VLM,几赫兹)“与”快系统 S1(动作专家,几十到几百赫兹)“解耦,靠一个连续 latent 单向传信息。

  • 级联式(S2 出 latent/token cache,S1 去噪)groot-n1/groot-n1-5(Eagle VLM 取第 12 层 + DiT flow,S2 10Hz / S1 120Hz)、cogactgemini-robotics(云端 backbone <160ms + 机载 decoder,端到端 ≈250ms、有效 50Hz)、gemini-robotics-1-5(ER 1.5 orchestrator + VLA,Motion Transfer 跨本体)、figure-helix(7B S2 @7-9Hz + 80M S1 @200Hz,S1 直接回归 35-DoF 连续量)、galaxea-g0(Qwen2.5-VL 慢规划 + PaliGemma flow 快执行)、hume-vla(S2 生成 N=5 个”故意留噪”候选 + value-query 头 Best-of-N,S1 级联去噪到 τ=1,6Hz×15=90Hz)、internvla-m1(Qwen2.5-VL + 86M DiT + 梯度衰减保护 VLM)。
  • 并行式(共享注意力 MoE)pi0 系全属此类——pi0-5(先自回归出高层子任务 ℓ̂ 再 flow 出动作,分层 πθ(a|o,ℓ̂)·πθ(ℓ̂|o,ℓ))、pi0-fastpi-knowledge-insulationpi-star-0-6(Gemma3 4B + advantage conditioning + 分布式价值函数做经验学习)、pi0-7(5B = Gemma3 4B + MEM 视频历史 + 860M flow,多模态 prompt + BAGEL 世界模型生成子目标图 + RTC 实时分块)。
  • 感知 + 未来预测联合internvla-a1(理解/生成/动作三专家 MoT + Cosmos VAE 生成未来帧)、internvla-a1-5(50 个 foresight token 驱动冻结 WAN2.2 视频生成 + flow 动作)、robobrain/robobrain-2/robobrain-2-5(“具身大脑”VLM,轨迹/价值都以文本 token 输出)。
  • MoE 路由分离感知与控制chatvla/chatvla-2(注意力共享、FFN 按任务路由到理解/控制专家)、wall-oss/wall-oss-0-5(静态路由 MoT,VL/Action 双专家 + Uni-CoT 跨层级思维链)。

表 5 · 双系统架构对比

工作S2(慢/规划)S1(快/控制)动作头频率(S2 / S1)
groot-n1-5Eagle 2.5(Qwen3-1.7B+SigLIP2,2.1B)DiT 16 层flow K=410Hz / 120Hz
figure-helix7B 开源 VLM80M cross-attn enc-dec连续回归 35-DoF7-9Hz / 200Hz
gemini-roboticsER 蒸馏 backbone(云)机载 decoderaction chunk<160ms / 有效 50Hz
pi0-5PaliGemma 2B(先出子任务)300M action expertflow H=50,10 步分层同模型
pi0-7Gemma3 4B + MEM860M expertflow,50 token+ BAGEL 世界模型
hume-vlaπ0 骨干 + value-queryDINOv2-s + 轻 Transformerflow 级联去噪 Best-of-54Hz / 6Hz→90Hz
galaxea-g0-5Qwen3.5-2B 单塔同塔(可选 flow 头)RVQ 自回归 + 可选 flow单塔自回归

七、人形全身控制:从 motion-tracking 到人形 VLA

人形/足式控制自成一支,动作头几乎清一色是”MLP 输出 PD 目标关节角”(连续控制、非 token/扩散),架构创新在观测设计、teacher-student 蒸馏、命令空间与上层生成。四足运动控制奠定了 teacher-student 范式(learning-quadrupedal-locomotion-challenging-terrain TCN 学生、learning-robust-perceptive-locomotion-wild 注意力门控 belief encoder、extreme-parkour-legged-robots/robot-parkour-learning GRU 短期记忆),deep-whole-body-control-loco-manipulation 首次用单个 MLP 非分层同时输出腿+臂关节目标。

7.1 Motion-tracking RL(teacher-student 蒸馏)

主流是”特权 oracle teacher(RL)→ 可部署 student(蒸馏)“两段式,MLP 骨干(多为 [512,256,128]),动作 = 19–29 维目标关节角经 PD:

  • 奠基phc-perpetual-humanoid-control(SMPL 24 刚体、PMCP 渐进原语 + 失败恢复 + MCP 组合)、real-world-humanoid-locomotion-rl(1.4M 因果 Transformer,context=16 隐式记忆,Digit 30-DoF)。
  • 人到人形跟踪h2o-human2humanoid(H1 19-DoF、纯 MLP、8 关键点目标、状态 138 维)→ omnih2o(加 25 步历史、教师 913 维/学生 1665 维、3 点 VR 输入 + MDM/GPT-4o 多接口)→ hover(统一命令空间:上/下半身各 3 模式靠 one-hot mask 任意组合,覆盖 >15 种模式)。
  • 精度与鲁棒性gmt(G1 23-DoF、局部 key body + 卷积编码 2 秒未来 + soft-MoE teacher)、exbody/exbody2(解耦 DoF/keypoint 跟踪 + CVAE 长时程合成)、asap(残差动作模型补 sim2real、非对称 actor-critic 免里程计)、hub-extreme-balance(COM 滤波 + 平衡塑形 + OU 噪声,极限平衡)、kungfubot(自适应跟踪因子 σ*=误差均值,高动态动作)、unitracker(三阶段 + 残差 KL 的 CVAE 学生 + 快速自适应残差解码器)、sonic(encoder-decoder + FSQ universal token,人/机/混合三源指令共享隐空间免显式重定向)。
  • 实时遥操作twist/twist2(teacher 看 2 秒未来 → student 单帧 + 免动捕 VR)、clone-teleoperation(3 层×4 专家 MoE 学生 + LiDAR 闭环误差修正)、humanplus(HST 低层 + HIT 技能,HIT 用前向动力学正则防忽略图像)、humanoid-getup(起身,纯本体感受 MLP + ROA)、humanoid-parkour-learning(GRU+CNN 深度编码器)、wococo(按接触阶段的扩展 MDP)。

7.2 行为基础模型(BFM,前向-后向表征)

把”策略学习与任务目标解耦”:bfm-zero 与 FB-CPR/Motivo 一脉用前向-后向表征 M^π(X|s,a)≈F(s,a,z)ᵀB(s')——学到后可对任意奖励/目标状态零样本推断值函数(z_g=B(s_g)、z_r=E[B·r]);bfm-zero 用带残差块+LayerNorm 的 Transformer 风格 critic(F 135.8M,总 440.5M)+ FB-CPR 判别器正则把行为拉向人类风格,四个 sim2real 工程设计(非对称训练、大规模并行、域随机化、奖励正则)首次把无监督 RL 推上真机。综述 behavior-foundation-model-humanoid-survey 梳理了目标条件/内在奖励/FB 三条 BFM 路线。

7.3 Loco-manipulation 与人形 VLA

上层加语义、下层保跟踪:

  • 分层 loco-manipamo(多目标 IK 遥操上肢 + AMO 自适应模块 + RL 下肢 + ACT 自主上肢)、hugwbc(命令空间 = 任务命令 × 行为命令,相位参数直接指定走/跳/站/单脚跳)、homie(下肢 RL + 上肢外骨骼直接设定,HIMLoco 架构)、skillblender(4 个冻结原语技能 + 高层 Softmax 权重 Hadamard 混合)、resmimic(GMT 基座 + 残差策略学物体交互)、physhsi/visualmimic(AMP 判别器 / 视觉关键点生成 + 跟踪器分层)。
  • 人形 VLA / 三系统leverb(System2 SigLIP-CVAE VL policy 出 latent z → System1 RL 跟踪,z 是单向隐接口,S2 102M / S1 1.1M)、being-0(GPT-4o + VideoLLaMA2 connector + RL 移动 + ACT 操作三层)、psi-0-humanoid-loco-manipulation(Qwen3-VL-2B S2 + 500M MM-DiT flow S1 + 现成 amo RL 底层 S0,整机 43-DoF、FAST 在 EgoDex 重训)、wholebodyvla(双 LAM + Prismatic-7B + LMO 下肢 RL)。

表 6 · 人形全身控制架构对比

工作机器人/DoF骨干训练范式动作 / 命令
phc-perpetual-humanoid-controlSMPL 24 刚体MLP [1024,512]PMCP 渐进原语 + MCP 组合23×3 PD 目标
real-world-humanoid-locomotion-rlDigit 30-DoF因果 Transformer 1.4Mteacher(MLP)→student16 关节 PD + 8 增益
omnih2oH1 19-DoFMLP [512,256,128]oracle→蒸馏 + 25 步历史19 关节,3 点 VR 目标
hoverH1 19-DoFMLP [512,256,128]统一命令空间(>15 模式)上/下半身各 3 模式 mask
gmtG1 23-DoFsoft-MoE teacher + student局部 keybody + 2s 未来卷积23 关节目标
bfm-zeroG1 29-DoFTransformer critic 440.5MFB-CPR 无监督 + 判别器29 PD,零样本 z 推断
hugwbcH1 19-DoFAAC 全 MLP命令 = 任务 × 行为(相位步态)关节偏移,固定增益 PD
leverb人形SigLIP-CVAE VL(102M) + RL(1.1M)latent z 单向接口S2→S1 隐式命令
psi-0-humanoid-loco-manipulationG1 29-DoF + 手Qwen3-VL-2B + MM-DiT 500M + amo三系统 S2/S1/S043-DoF 全身,FAST

八、跨本体(cross-embodiment)的架构处理

“一套权重控多种机器人”催生了几类统一动作空间设计:

  • 维度对齐 + padding/maskpi0(统一取最大 18 维、低维零填充 + 相机 mask)、rdt-1b(128 维物理可解释统一空间 + 0-1 mask 区分静止/填充)、groot-n1(每 embodiment 一套 state/action 编解码 MLP,pad 到 32 维)、galaxea-g0-5(27 维槽位 + noop 填充,14 本体)。
  • 共享骨干 + 轻量解码头uniact(256×128 通用动作码本 + 28 个 MLP 异构解码头,0.5B)、crossformer-cross-embodied-learning(4 个动作头按本体路由)、hpt-heterogeneous-pretrained-transformers(Stem 本体专属、Trunk 共享、Head 任务专属)、diffusion-vla(只新初始化一个 MLP、扩散主干共享)。
  • 潜动作作为跨本体桥lapa-latent-action-pretraining/univla/moto(人类视频与机器人共享同一潜动作空间)、wholebodyvla
  • 自适应网格 / 空间编码spatialvla(Ego3D 位置编码免外参 + 自适应动作网格 + 相邻网格三线性插值迁移)、dita(靠 OXE 混合数据 + in-context 条件化,不设本体 embedding)。

九、空白与趋势

  • 动作头正在”收敛到 flow + 分层”:2025 下半年起新 VLA 几乎默认”VLM 主干 + flow-matching action expert + action chunking”,离散 token 退居”预训练期表示学习信号”(pi-knowledge-insulation 的双损失、stop-gradient 知识隔离);纯扩散在精度上仍有阵地,但被一致性/流蒸馏(consistency-policy/one-step-flow-policy)逼向少步。
  • “更好的动作分词器”是新战场:规则化 FAST(pi0-fast)→ 可学习 RVQ(wall-oss-0-5/galaxea-g0-5)→ 顺序保持词表(molmoact),核心矛盾是”复用 VLM 词表的便利”与”动作分布的物理结构”如何两全。
  • 世界模型正被焊进策略:从”视频预测预训练”(bytedance-gr-2/seer-predictive-inverse-dynamics)走向”推理期生成子目标图/未来帧当条件”(pi0-7 的 BAGEL、internvla-a1-5 的 WAN、internvla-a1 的 Cosmos)——动作头开始吃”自己想象的未来”。
  • 人形与操作两支在 VLA 层面汇流psi-0-humanoid-loco-manipulation/leverb/being-0 证明”上层通用 VLA + 下层 RL 全身跟踪”可行,但上下层接口(latent z / 语言子任务 / 关键点命令)与频率配比(Helix 200:9 vs LeVERB 50:10)尚无定论;行为基础模型(bfm-zero)的零样本任务推断与 VLA 的语义泛化还是两套体系,未打通。
  • 仍缺的:动作扩散骨干的可扩展性尚未被证明(data-scaling-laws-imitation 观察到”视觉编码器越大越好、动作 UNet 放大反而无益”,动作专家普遍仅 100–860M);跨本体统一动作空间(padding/mask vs 码本 vs 潜动作)没有胜出者;双系统 S2↔S1 的信息瓶颈(单 latent 是否够)、以及”动作头该多大”(cogact 论证 300M DiT 相对 7B VLM 算小、相对 7 维动作算大)都还是开放问题。