具身智能架构演进:从 RT-1 离散 token 到统一 VLA 与人形全身控制
概述:机器人策略架构这几年沿四条互相缠绕的主线推进。(1) 感知—策略骨干:从”冻结视觉编码器 + 轻量动作头”(bc-z 的 ResNet18+FiLM、r3m/mvp-masked-visual-pretraining/vc-1-cortexbench 的 PVR),到从头训练的小 decoder-only Transformer(rt-1 35M),再到”把互联网预训练 VLM 直接当策略骨干”(rt-2/palm-e→openvla/pi0),骨干从 35M 一路涨到 3–8B。(2) 动作头/动作表示:
离散 token([[rt-1]]/[[rt-2]]/[[openvla]] 逐维 256 bin)→ 连续回归([[octo]] 扩散头 / [[openvla-oft]] L1)→ 扩散([[diffusion-policy]]/[[dp3-3d-diffusion-policy]]/[[cogact]] DiT)→ flow matching([[pi0]]/[[groot-n1]]/[[smolvla]]),再分岔出”更好的动作分词器”(pi0-fast 的 DCT+BPE、vq-bet/wall-oss-0-5 的残差 VQ)与”潜动作预训练”(lapa-latent-action-pretraining/univla/villa-x)。(3) 动作分块(action chunking):aloha-act 的 CVAE+chunk=100 把 π(aₜ|sₜ) 换成 π(a_{t:t+k}|sₜ),此后几乎所有 VLA/扩散策略都以 chunk 为动作单元。(4) 系统结构:从”单塔 VLM 直接吐动作”走向”慢 VLM 规划 + 快动作专家”的双系统(groot-n1/figure-helix/gemini-robotics/pi0-5)。与此并行,扩散/3D 策略(diffusion-policy 系)与人形全身控制(motion-tracking RL → 行为基础模型 → 人形 VLA)各成一支,最终在 psi-0-humanoid-loco-manipulation/leverb 这类”上层 VLA + 下层 RL 跟踪”的三系统里汇流。
一、前 VLA 时代:冻结感知 + 轻量动作头(2018–2022)
早期真机策略的共同范式是”一个(常冻结的)视觉编码器 + 一个逐任务从头训练的小动作头”,架构创新集中在动作表示而非骨干。
- 感知前端(PVR,冻结):r3m(ResNet50 + 视频-语言时序对比 + DistilBERT 打分头)、mvp-masked-visual-pretraining(ViT-S/B/L 的 MAE 自监督,ViT-L 307M)、vc-1-cortexbench(ViT-L MAE,24 层/1024 维)都只训一个图像编码器,下游各套一个 2–4 层 MLP BC 头,编码器权重全程冻结。
- 判别式 BC + FiLM 条件:bc-z 是这一范式的代表——ResNet18 主干、512 维任务嵌入经 FiLM 调制 4 个 block,多个 2 层 MLP 头分别回归 delta-XYZ / delta-axis-angle / 夹爪连续值;saycan 的底层技能沿用同款 USE-embedding→FiLM→ResNet18。
- 动作表示的三条早期路线(都在解决”演示是多峰的、L2 回归会取均值”这个病):
- 能量模型(隐式 BC):implicit-bc-ibc 不输出动作而输出能量
E_θ(o,a),推理时对 a 求 argmin,用 DFO/自回归-DFO/Langevin 三种采样按动作维度选用(≤5 维用 DFO,高维用 Langevin)。 - 离散 bin + 连续残差:behavior-transformer-bet 对全数据集动作跑 k-means 得 k 个中心,minGPT 双头分别预测”属哪个 bin”与”每个 bin 的残差向量”;vq-bet 进一步把 k-means 换成残差 VQ-VAE(N_q=2 层码本,primary 粗聚类 + secondary 细修正,码本 8–16、模式数 k²=64–256),GPT 预测码 + 连续 offset 头补精度。
- action chunking 的起点:aloha-act 用 DETR 式 CVAE 一次预测 k=100 步动作、配 temporal ensemble,是”动作块”成为默认动作单元的开端;roboagent-mt-act(MT-ACT)把它扩到多任务、mobile-aloha 加移动底盘。
- 能量模型(隐式 BC):implicit-bc-ibc 不输出动作而输出能量
表 1 · 前 VLA 时代动作表示对比
| 工作 | 骨干 | 动作头/表示 | 动作维度 | 关键数字 |
|---|---|---|---|---|
| bc-z | ResNet18 + FiLM | 多 MLP 头回归 delta 位姿 + 连续夹爪 | 6-DoF + 夹爪 | 自适应 N 步预测;辅助 10 步开环 |
| implicit-bc-ibc | ConvMLP(late fusion) | EBM 能量 E(o,a),argmin 推理 | 2–32 维 | Langevin 推理跑训练 2× 步数 |
| behavior-transformer-bet | minGPT(1–6 层) | k-means bin 分类头 + k×dim offset 头 | 低维状态 | Kitchen 64 bin,10⁴–10⁶ 参数 |
| vq-bet | minGPT(6 层/120 维) | 残差 VQ(N_q=2)+ offset 头 | 视/状态 | 码本 8–16,模式数 64–256 |
| rt-1 | decoder-only Transformer 35M | 逐维 256 bin 离散 token | 11 维(7 臂+3 底盘+1 模式) | FiLM-EffNet-B3 tokenizer + TokenLearner,3Hz |
| aloha-act | ResNet18 + DETR-CVAE 80M | 连续回归 + chunk=100 | 14 维(双臂关节) | temporal ensemble;k=90 实机 |
rt-1 是承前启后的关键节点:6 帧 300×300 图经 FiLM-EfficientNet-B3(语言 identity-init FiLM 早融合)产出 81 个图文 token、TokenLearner 压到 8 个、8 层 decoder-only Transformer 出 11 维×256 bin 离散动作——确立了”动作即离散 token”这条后来被 rt-2/openvla 继承的主线。q-transformer 把 RT-1 的分类头换成逐维 Q 值做离线 RL(每维 256 bin,自回归 8 次出一个动作);rt-trajectory/rt-sketch 拼接轨迹/目标草图、去掉语言 FiLM。平行的 3D 分支(peract 100³ 体素 + PerceiverIO、rvt 多视角重渲染、act3d 幽灵点)把动作定位建成”逐体素/逐点离散分类 + 运动规划器执行”。
二、VLA 范式确立:把动作写进 VLM 词表(2022–2024)
“用互联网预训练的 VLM 当机器人策略骨干”是 2023 年最大的范式跳变,动机是借 VLM 的世界知识做语义泛化。三种奠基形态:
- LLM 主干 + 多模态注入(无独立动作头):palm-e 把连续观测经编码器 φ 映射成”与语言 token 同维的向量”,动态嵌进 PaLM(8B/62B/540B)的文本序列里,输出是”低层技能序列”文本——是”VLM 当高层规划器”的原型。saycan/inner-monologue/code-as-policies 是同类”LLM 规划器 + 现成技能库”的组合系统,尚未把 VLM 拉进闭环控制。
- 动作即语言:rt-2 把 6-DoF delta 位姿 + 夹爪 + 终止各维离散成 256 bin、拼成整数字符串,让 VLM(PaLI-X 5B/55B 或 PaLM-E-12B)直接自回归吐这串数字;关键工程是”输出约束”(动作任务只从合法动作 token 采样)与 token 绑定(PaLI-X 用整数 token,PaLM-E 覆写最不常用的 256 个 token)。sara-rt 给这条重骨干做线性注意力加速。
- Transformer-first 通用策略:octo 反其道——图像只过很浅的卷积切 patch(第三人称 256 token/腕部 64 token),把算力堆在 Transformer 骨干(Small 27M / Base 93M),用 readout token(BERT 式 [CLS]) + 扩散动作头(3 层 MLP,DDPM 20 步,只跑一次骨干前向)预测连续 chunk;模块化设计让微调时能自由增删观测/head。
- 开源 VLA 基线定型:openvla 把骨干换成 Prismatic-7B(DINOv2 ViT-L + SigLIP ViT-So400M 双编码器拼接 + Llama-2 7B),动作沿用 RT-2 式离散化但改用1/99 分位数划 bin、覆写词表尾部 256 token;两条被反复引用的经验——“微调视觉编码器而非冻结对 VLA 至关重要”、“224² 与 384² 精度无差但快 3×”。
表 2 · VLA 骨干 × 动作头谱系(2022–2025)
| 工作 | VLM 骨干 | 视觉编码器 | 动作头 | 动作表示 | 规模 |
|---|---|---|---|---|---|
| palm-e | PaLM 8/62/540B | ViT-4B/22B | 无(输出技能文本) | 语言子目标 | 12–562B |
| rt-2 | PaLI-X / PaLM-E | ViT-22B / ViT-4B | 自回归离散 token | 8 整数×256 bin | 5–55B |
| octo | 从头 Transformer | 浅卷积 patch | 扩散头(MLP,DDPM 20 步) | 连续 chunk=4 | 27–93M |
| openvla | Llama-2 7B | DINOv2+SigLIP | 离散 token | 7 维×256 bin(分位数) | 7.5B |
| cogact | Llama-2(Prismatic 7.5B) | DINOv2+SigLIP | DiT 扩散(认知 token 条件) | 连续 15 步 | +DiT 13/89/308M |
| pi0 | PaliGemma 3B | SigLIP | flow-matching action expert | 连续 chunk H=50 | 3.3B |
| groot-n1 | Eagle-2(SmolLM2) | SigLIP-2 | DiT + flow matching | pad 到 32 维 / H=16 | 2.2B |
| molmoact | Qwen2.5-7B | SigLIP2 ViT | 自回归(深度→轨迹→动作三段链) | 顺序保持 256 token | 8.6B |
| magma | Llama-3-8B | ConvNeXt-XXL | 文本 token(SoM/ToM) | 复用尾部 256 token | 8.6B |
三、动作头的四范式分化:离散 / 连续 / 扩散 / flow(2023–2026)
VLA 骨干趋同到 VLM 之后,架构竞争集中到动作头。四条路线及其代表:
3.1 离散 token 及其”更好的分词器”
rt-2/openvla 的均匀/分位数 bin 简单但有两个病:逐维自回归慢、高频轨迹的 DCT 频谱被均匀量化糟蹋。两类改进:
- FAST(频域分词):pi0-fast 对动作序列逐维做 DCT → 缩放取整 → 列优先展平 → BPE 压缩(词表 1024),把 1 秒动作块压成稠密 token;FAST+ 是在 ~100 万条跨本体动作上训的通用词表。wall-oss/graspvla/galaxea-g0/psi-0-humanoid-loco-manipulation 都用 FAST 做预训练期的离散动作表示。
- 可学习 RVQ 分词器:wall-oss-0-5 的 Vision-Aligned RVQ、galaxea-g0-5 的 ActionCodec(残差 VQ + 时序对比目标)用可学习码本取代规则化 FAST,联合视觉-动作对齐、下一帧预测、DCT 域重建三个目标;molmoact 则把 256 bin 一一映射到 Qwen2 tokenizer 尾部按字典序排好的 256 个 byte-level token,实现”顺序保持”加速收敛。
3.2 连续回归(并行解码)
把因果自回归换成”一次前向出整块动作”:openvla-oft 把 OpenVLA 的因果掩码换成双向、输入换成空动作 embedding,配 4 层 MLP L1 头 + action chunking(LIBERO K=8 / ALOHA K=25),把 D 次串行 decoder 前向压成 1 次(LIBERO 配置 279M 可训 / ALOHA OFT+ 853M);crossformer-cross-embodied-learning 用 readout token + L1 连续回归统一 4 类本体(单臂 7 维/导航 2 维/双臂 14 维/四足 12 维);hpt-heterogeneous-pretrained-transformers 的 Stem→Trunk→Head 里 Head 默认连续回归(消融后弃用离散 token,Trunk 3.1M→1.1B 五档)。
3.3 扩散动作头(DiT / ScaleDP)
把去噪网络挂在 VLM 特征上:cogact 用”认知 token”浓缩 VLM 输出、再喂 DiT-Base(89M,DDIM 10 步 + CFG 1.5)——VLM 只产条件向量、不直接吐动作;dexvla/chatvla/chatvla-2/diffusion-vla 用 ScaleDP(32 层/1280 维/16 头的 Diffusion Transformer,最大 1B)当动作专家、推理 token 经 FiLM 注入;rdt-1b 是纯 DiT-with-CrossAttention(28 层/2048 维/1.2B),三处机器人专用改造(QKNorm+RMSNorm 稳数值、MLP decoder、图文交替 cross-attention 注入)+ 128 维物理可解释统一动作空间。
3.4 flow matching(当前主流)
pi0 确立了模板——PaliGemma 主干 + 从头初始化的 action expert(1024 宽/300M),二者只在 self-attention 层交互(token 级 2 专家 MoE),条件流匹配损失、τ 从 shifted-Beta(1.5,1) 采样、blockwise-causal 三块掩码 [图文]→[状态]→[噪声动作]。此后 groot-n1/groot-n1-5(DiT + AdaLN + flow,K=4 步去噪)、bytedance-gr-3(DiT 层数为 VLM 一半、只用后半 KV cache)、smolvla(SmolVLM2 + 交替 CA/SA 动作专家、层跳过 N=L/2)、figure-helix(7B S2 + 80M S1 直接回归连续 35-DoF)、galaxea-g0、graspvla、hume-vla 全走 flow。pi-knowledge-insulation 提出关键 trick——action expert 对 backbone 的注意力 key/value 套 stop-gradient(信息单向流、梯度不回灌 VLM),使离散 FAST token 与连续 flow 双损失可 α=1 联合训练。
表 3 · 四种动作头范式对比
| 范式 | 代表 | 机制 | 推理成本 | 长处 / 短板 |
|---|---|---|---|---|
| 离散 token | rt-2 openvla pi0-fast | 逐维 bin / FAST 分词,自回归解码 | D×decoder 前向(慢) | 复用 VLM 词表,训练简单 / 逐维串行慢、量化损精度 |
| 连续回归(并行) | openvla-oft crossformer-cross-embodied-learning hpt-heterogeneous-pretrained-transformers | 双向掩码 + MLP/L1 头一次前向出整块 | 1 次前向(快) | 极快、无量化损 / 单峰、多峰分布易糊 |
| 扩散 | octo cogact rdt-1b dexvla | DiT/UNet 去噪,DDPM/DDIM 多步 | 多步去噪(可 DDIM 压到 4–10) | 天然多峰、精细 / 采样步数换延迟 |
| flow matching | pi0 groot-n1 smolvla figure-helix | 学速度场,Euler 积分 4–10 步 | 少步 flow(快) | 直线轨迹、少步高质、易与 VLM 联训 / 需调 τ 采样 |
几个值得单挑的动作头设计:action chunking 的三种平滑术——aloha-act 的时间集成 w_i=exp(-m·i)、aloha-unleashed 的开环整段执行、cogact 按预测间余弦相似度加权的 Adaptive Action Ensemble;rdt-1b 的”物理可解释统一动作空间”(各维明确 SI 单位、除夹爪外不归一化)。
四、扩散策略与 3D 策略分支(2022–2026)
与 VLA 主线平行,“纯扩散做视觉运动策略”自成一支,起点是 diffusion-policy。
4.1 Diffusion Policy 母架构
diffusion-policy 把动作生成建成条件 DDPM:观测 T_o 步为条件、预测 T_p 步、执行 T_a 步再重规划(receding horizon);两种去噪骨干——CNN 版(1D 时序 U-Net + FiLM 注入观测,开箱即用但对高频动作过平滑)与 Transformer 版(minGPT decoder,观测做 cross-attention、动作 token 因果掩码,精度高但难调);视觉编码器是 ResNet-18(GAP 换 spatial softmax、BN 换 GroupNorm 以兼容 EMA),平方余弦噪声调度。这套骨干被 droid/data-scaling-laws-imitation(换 DINOv2 ViT-L 全量微调)/scaling-up-distilling-down-sudd(加语言条件)/dexcap/im2flow2act/genima 等大量工作直接复用。
4.2 3D 表征分支
“把 3D 几何显式喂进策略”是提升空间精度与泛化的主流:
- 体素/幽灵点/多视角:peract(100³ 体素 + PerceiverIO 2048 latent,逐体素 Q 分类)、act3d(CLIP-RN50 特征抬升成 3D 点云 + 由粗到细幽灵点采样 + RoFormer 相对 3D 注意力,绝对→相对位置编码 55.4%→98.1%)、rvt/3d-mvp(重渲染正交虚拟视角 + 多视角 Transformer)、gembench 的 3D-LOTUS(PointTransformerV3 U-Net)、sgrv2(PointNeXt-XL 逐点相对位置预测 + 加权聚合,涌现 affordance 聚焦)。
- 点云扩散:dp3-3d-diffusion-policy(极简:点云→64 维 MLP 编码器 + 原装 Diffusion Policy UNet,证明”3D 模态本身有效”)、idp3-improved-3d-diffusion-policy(金字塔卷积编码器 + egocentric 相机系点云免标定 + 加长 horizon,为上人形而生)、rise-3d-perception-imitation、r3d-revisiting-3d-policy-learning(Point-SAM 编码器保留 point token 不池化 + DiT 交叉注意力)。
- 轨迹扩散 + keypose:3d-diffuser-actor(3D relative denoising Transformer,位置/旋转用不同噪声调度)、chaineddiffuser(Act3D 出 macro-action keypose + DDPM 补中间轨迹)、hierarchical-diffusion-policy-hdp(PerAct 高层 + RK-Diffuser 低层)、render-and-diffuse(渲染动作表示,图像/动作双空间去噪)。
4.3 等变与加速
- 等变扩散:equibot(SIM(3)-等变 PointNet++ + SO(3)-等变 UNet)、equivariant-diffusion-policy(escnn 实现 C8 离散旋转群,证明专家策略等变则去噪函数也等变)。
- 少步/实时:consistency-policy(CTM 蒸馏,单步/3 步链式推理)、manicm(3D 一致性模型)、adaflow(rectified flow + 方差自适应 ODE 步长)、streaming-diffusion-policy(缓冲区各元素独立噪声等级,滚动采样每步只 N/h 步去噪)、one-step-flow-policy(区间平均速度场,NFE=1 与 4 免重训切换)、dppo-diffusion-policy-policy-optimization/reinflow(把扩散/flow 策略当两层 MDP 做 RL 微调)。
- MoE 与记忆:sparse-diffusion-policy(每层 FFN 换 MoE,专家=可复用技能,持续学习只加专家)、seedpolicy(Self-Evolving Gated Attention 循环隐状态 + 扩散头,参数比 RDT 少 1–2 数量级)、baku(可插拔动作头 MLP/GMM/BeT/VQ-BeT/Diffusion 五选一)。
表 4 · 扩散 / 3D 策略分支对比
| 工作 | 输入表征 | 去噪骨干 | 动作空间 | 关键设计 |
|---|---|---|---|---|
| diffusion-policy | RGB(ResNet18) | 1D UNet / Transformer | EE 位姿 chunk | receding horizon,spatial softmax |
| dp3-3d-diffusion-policy | 点云(64 维 MLP) | 1D UNet | 关节/EE,H=4 | 丢颜色 + FPS 512 点,DDIM sample-pred |
| idp3-improved-3d-diffusion-policy | egocentric 点云 4096 | 金字塔卷积 + UNet | 25 维关节 | 相机系免标定,加长 horizon |
| 3d-diffuser-actor | CLIP 特征抬升 3D | 3D relative Transformer | loc R³+rot 6D+open | 位置/旋转异构噪声调度,RoPE 相对注意力 |
| aloha-unleashed | 4×ResNet50(85M) | Transformer decoder(55M) | 14 维绝对关节 / chunk=50 | 开环执行,0.043s@4090 |
| equivariant-diffusion-policy | 图像/体素 | C8 等变 UNet | SE(3) 位姿 | escnn,去噪函数等变归纳偏置 |
| consistency-policy | RGB(DP 骨干) | CTM 蒸馏 | 10 维 chunk | 单步/3 步链式,dropout 保训练信号 |
| r3d-revisiting-3d-policy-learning | Point-SAM token | DiT 交叉注意力 | 关节 + 任务空间双头 | 保留 point token 不池化,4 层足够 |
五、Action chunking、视频预训练与潜动作(2023–2026)
三条”从更弱标注里榨动作先验”的线,都靠架构技巧把”视频/人类演示”接进策略。
- 动作分块的扩散化:aloha-act 的 CVAE-chunk 之后,aloha-unleashed 把动作头换成 Transformer 扩散解码器(55M,50×14 加噪块 cross-attend 编码器 latent,DDIM 50 步)、open-television 把 ACT 视觉换 DINOv2、humanoid-policy-human-policy-ph2d 用 DINOv2-ACT + 54 维统一人-机状态空间。
- 视频生成预训练 + 动作头:bytedance-gr-2(GPT 式自回归视频预测 + cVAE 动作头,VQGAN 离散图像 token,30M–719M 谱系)、bytedance-gr-3(Qwen2.5-VL + DiT flow)、seer-predictive-inverse-dynamics(GPT-2 骨干里 foresight token [FRS] 与 action token [INV] 单向融合,把”预测未来帧 + 逆动力学出动作”塞进一个网络,可训 65M)。
- 潜动作(latent action)预训练:核心是”无动作标签的视频也能学策略”——用 IDM 从相邻帧对提取离散潜动作、让 VLM 预测它,再用少量真机数据解码。lapa-latent-action-pretraining(C-ViViT tokenizer,潜空间 8⁴ 远小于 OpenVLA 的 256⁷)、moto(Latent Motion Token + Moto-GPT 98M + 协同微调)、univla(两阶段 VQ-VAE 分离任务无关/任务中心码本,扩词表新增 |C|=16 个 ACT token)、villa-x(LAM 加 proprio-FDM + ACT-latent/ACT-robot 双专家)、wholebodyvla(manipulation/locomotion 双 LAM)、worldvla(Chameleon 骨干统一图像/文本/动作 token + 动作专属注意力掩码)。
六、双系统:慢 VLM 规划 + 快动作专家(2024–2026)
单塔 VLM 既要语义推理又要高频控制存在根本张力(大模型慢、机载跑不动、延迟不满足实时)。解法是把”慢系统 S2(VLM,几赫兹)“与”快系统 S1(动作专家,几十到几百赫兹)“解耦,靠一个连续 latent 单向传信息。
- 级联式(S2 出 latent/token cache,S1 去噪):groot-n1/groot-n1-5(Eagle VLM 取第 12 层 + DiT flow,S2 10Hz / S1 120Hz)、cogact、gemini-robotics(云端 backbone <160ms + 机载 decoder,端到端 ≈250ms、有效 50Hz)、gemini-robotics-1-5(ER 1.5 orchestrator + VLA,Motion Transfer 跨本体)、figure-helix(7B S2 @7-9Hz + 80M S1 @200Hz,S1 直接回归 35-DoF 连续量)、galaxea-g0(Qwen2.5-VL 慢规划 + PaliGemma flow 快执行)、hume-vla(S2 生成 N=5 个”故意留噪”候选 + value-query 头 Best-of-N,S1 级联去噪到 τ=1,6Hz×15=90Hz)、internvla-m1(Qwen2.5-VL + 86M DiT + 梯度衰减保护 VLM)。
- 并行式(共享注意力 MoE):pi0 系全属此类——pi0-5(先自回归出高层子任务 ℓ̂ 再 flow 出动作,分层 πθ(a|o,ℓ̂)·πθ(ℓ̂|o,ℓ))、pi0-fast、pi-knowledge-insulation、pi-star-0-6(Gemma3 4B + advantage conditioning + 分布式价值函数做经验学习)、pi0-7(5B = Gemma3 4B + MEM 视频历史 + 860M flow,多模态 prompt + BAGEL 世界模型生成子目标图 + RTC 实时分块)。
- 感知 + 未来预测联合:internvla-a1(理解/生成/动作三专家 MoT + Cosmos VAE 生成未来帧)、internvla-a1-5(50 个 foresight token 驱动冻结 WAN2.2 视频生成 + flow 动作)、robobrain/robobrain-2/robobrain-2-5(“具身大脑”VLM,轨迹/价值都以文本 token 输出)。
- MoE 路由分离感知与控制:chatvla/chatvla-2(注意力共享、FFN 按任务路由到理解/控制专家)、wall-oss/wall-oss-0-5(静态路由 MoT,VL/Action 双专家 + Uni-CoT 跨层级思维链)。
表 5 · 双系统架构对比
| 工作 | S2(慢/规划) | S1(快/控制) | 动作头 | 频率(S2 / S1) |
|---|---|---|---|---|
| groot-n1-5 | Eagle 2.5(Qwen3-1.7B+SigLIP2,2.1B) | DiT 16 层 | flow K=4 | 10Hz / 120Hz |
| figure-helix | 7B 开源 VLM | 80M cross-attn enc-dec | 连续回归 35-DoF | 7-9Hz / 200Hz |
| gemini-robotics | ER 蒸馏 backbone(云) | 机载 decoder | action chunk | <160ms / 有效 50Hz |
| pi0-5 | PaliGemma 2B(先出子任务) | 300M action expert | flow H=50,10 步 | 分层同模型 |
| pi0-7 | Gemma3 4B + MEM | 860M expert | flow,50 token | + BAGEL 世界模型 |
| hume-vla | π0 骨干 + value-query | DINOv2-s + 轻 Transformer | flow 级联去噪 Best-of-5 | 4Hz / 6Hz→90Hz |
| galaxea-g0-5 | Qwen3.5-2B 单塔 | 同塔(可选 flow 头) | RVQ 自回归 + 可选 flow | 单塔自回归 |
七、人形全身控制:从 motion-tracking 到人形 VLA
人形/足式控制自成一支,动作头几乎清一色是”MLP 输出 PD 目标关节角”(连续控制、非 token/扩散),架构创新在观测设计、teacher-student 蒸馏、命令空间与上层生成。四足运动控制奠定了 teacher-student 范式(learning-quadrupedal-locomotion-challenging-terrain TCN 学生、learning-robust-perceptive-locomotion-wild 注意力门控 belief encoder、extreme-parkour-legged-robots/robot-parkour-learning GRU 短期记忆),deep-whole-body-control-loco-manipulation 首次用单个 MLP 非分层同时输出腿+臂关节目标。
7.1 Motion-tracking RL(teacher-student 蒸馏)
主流是”特权 oracle teacher(RL)→ 可部署 student(蒸馏)“两段式,MLP 骨干(多为 [512,256,128]),动作 = 19–29 维目标关节角经 PD:
- 奠基:phc-perpetual-humanoid-control(SMPL 24 刚体、PMCP 渐进原语 + 失败恢复 + MCP 组合)、real-world-humanoid-locomotion-rl(1.4M 因果 Transformer,context=16 隐式记忆,Digit 30-DoF)。
- 人到人形跟踪:h2o-human2humanoid(H1 19-DoF、纯 MLP、8 关键点目标、状态 138 维)→ omnih2o(加 25 步历史、教师 913 维/学生 1665 维、3 点 VR 输入 + MDM/GPT-4o 多接口)→ hover(统一命令空间:上/下半身各 3 模式靠 one-hot mask 任意组合,覆盖 >15 种模式)。
- 精度与鲁棒性:gmt(G1 23-DoF、局部 key body + 卷积编码 2 秒未来 + soft-MoE teacher)、exbody/exbody2(解耦 DoF/keypoint 跟踪 + CVAE 长时程合成)、asap(残差动作模型补 sim2real、非对称 actor-critic 免里程计)、hub-extreme-balance(COM 滤波 + 平衡塑形 + OU 噪声,极限平衡)、kungfubot(自适应跟踪因子 σ*=误差均值,高动态动作)、unitracker(三阶段 + 残差 KL 的 CVAE 学生 + 快速自适应残差解码器)、sonic(encoder-decoder + FSQ universal token,人/机/混合三源指令共享隐空间免显式重定向)。
- 实时遥操作:twist/twist2(teacher 看 2 秒未来 → student 单帧 + 免动捕 VR)、clone-teleoperation(3 层×4 专家 MoE 学生 + LiDAR 闭环误差修正)、humanplus(HST 低层 + HIT 技能,HIT 用前向动力学正则防忽略图像)、humanoid-getup(起身,纯本体感受 MLP + ROA)、humanoid-parkour-learning(GRU+CNN 深度编码器)、wococo(按接触阶段的扩展 MDP)。
7.2 行为基础模型(BFM,前向-后向表征)
把”策略学习与任务目标解耦”:bfm-zero 与 FB-CPR/Motivo 一脉用前向-后向表征 M^π(X|s,a)≈F(s,a,z)ᵀB(s')——学到后可对任意奖励/目标状态零样本推断值函数(z_g=B(s_g)、z_r=E[B·r]);bfm-zero 用带残差块+LayerNorm 的 Transformer 风格 critic(F 135.8M,总 440.5M)+ FB-CPR 判别器正则把行为拉向人类风格,四个 sim2real 工程设计(非对称训练、大规模并行、域随机化、奖励正则)首次把无监督 RL 推上真机。综述 behavior-foundation-model-humanoid-survey 梳理了目标条件/内在奖励/FB 三条 BFM 路线。
7.3 Loco-manipulation 与人形 VLA
上层加语义、下层保跟踪:
- 分层 loco-manip:amo(多目标 IK 遥操上肢 + AMO 自适应模块 + RL 下肢 + ACT 自主上肢)、hugwbc(命令空间 = 任务命令 × 行为命令,相位参数直接指定走/跳/站/单脚跳)、homie(下肢 RL + 上肢外骨骼直接设定,HIMLoco 架构)、skillblender(4 个冻结原语技能 + 高层 Softmax 权重 Hadamard 混合)、resmimic(GMT 基座 + 残差策略学物体交互)、physhsi/visualmimic(AMP 判别器 / 视觉关键点生成 + 跟踪器分层)。
- 人形 VLA / 三系统:leverb(System2 SigLIP-CVAE VL policy 出 latent z → System1 RL 跟踪,z 是单向隐接口,S2 102M / S1 1.1M)、being-0(GPT-4o + VideoLLaMA2 connector + RL 移动 + ACT 操作三层)、psi-0-humanoid-loco-manipulation(Qwen3-VL-2B S2 + 500M MM-DiT flow S1 + 现成 amo RL 底层 S0,整机 43-DoF、FAST 在 EgoDex 重训)、wholebodyvla(双 LAM + Prismatic-7B + LMO 下肢 RL)。
表 6 · 人形全身控制架构对比
| 工作 | 机器人/DoF | 骨干 | 训练范式 | 动作 / 命令 |
|---|---|---|---|---|
| phc-perpetual-humanoid-control | SMPL 24 刚体 | MLP [1024,512] | PMCP 渐进原语 + MCP 组合 | 23×3 PD 目标 |
| real-world-humanoid-locomotion-rl | Digit 30-DoF | 因果 Transformer 1.4M | teacher(MLP)→student | 16 关节 PD + 8 增益 |
| omnih2o | H1 19-DoF | MLP [512,256,128] | oracle→蒸馏 + 25 步历史 | 19 关节,3 点 VR 目标 |
| hover | H1 19-DoF | MLP [512,256,128] | 统一命令空间(>15 模式) | 上/下半身各 3 模式 mask |
| gmt | G1 23-DoF | soft-MoE teacher + student | 局部 keybody + 2s 未来卷积 | 23 关节目标 |
| bfm-zero | G1 29-DoF | Transformer critic 440.5M | FB-CPR 无监督 + 判别器 | 29 PD,零样本 z 推断 |
| hugwbc | H1 19-DoF | AAC 全 MLP | 命令 = 任务 × 行为(相位步态) | 关节偏移,固定增益 PD |
| leverb | 人形 | SigLIP-CVAE VL(102M) + RL(1.1M) | latent z 单向接口 | S2→S1 隐式命令 |
| psi-0-humanoid-loco-manipulation | G1 29-DoF + 手 | Qwen3-VL-2B + MM-DiT 500M + amo | 三系统 S2/S1/S0 | 43-DoF 全身,FAST |
八、跨本体(cross-embodiment)的架构处理
“一套权重控多种机器人”催生了几类统一动作空间设计:
- 维度对齐 + padding/mask:pi0(统一取最大 18 维、低维零填充 + 相机 mask)、rdt-1b(128 维物理可解释统一空间 + 0-1 mask 区分静止/填充)、groot-n1(每 embodiment 一套 state/action 编解码 MLP,pad 到 32 维)、galaxea-g0-5(27 维槽位 + noop 填充,14 本体)。
- 共享骨干 + 轻量解码头:uniact(256×128 通用动作码本 + 28 个 MLP 异构解码头,0.5B)、crossformer-cross-embodied-learning(4 个动作头按本体路由)、hpt-heterogeneous-pretrained-transformers(Stem 本体专属、Trunk 共享、Head 任务专属)、diffusion-vla(只新初始化一个 MLP、扩散主干共享)。
- 潜动作作为跨本体桥:lapa-latent-action-pretraining/univla/moto(人类视频与机器人共享同一潜动作空间)、wholebodyvla。
- 自适应网格 / 空间编码:spatialvla(Ego3D 位置编码免外参 + 自适应动作网格 + 相邻网格三线性插值迁移)、dita(靠 OXE 混合数据 + in-context 条件化,不设本体 embedding)。
九、空白与趋势
- 动作头正在”收敛到 flow + 分层”:2025 下半年起新 VLA 几乎默认”VLM 主干 + flow-matching action expert + action chunking”,离散 token 退居”预训练期表示学习信号”(pi-knowledge-insulation 的双损失、stop-gradient 知识隔离);纯扩散在精度上仍有阵地,但被一致性/流蒸馏(consistency-policy/one-step-flow-policy)逼向少步。
- “更好的动作分词器”是新战场:规则化 FAST(pi0-fast)→ 可学习 RVQ(wall-oss-0-5/galaxea-g0-5)→ 顺序保持词表(molmoact),核心矛盾是”复用 VLM 词表的便利”与”动作分布的物理结构”如何两全。
- 世界模型正被焊进策略:从”视频预测预训练”(bytedance-gr-2/seer-predictive-inverse-dynamics)走向”推理期生成子目标图/未来帧当条件”(pi0-7 的 BAGEL、internvla-a1-5 的 WAN、internvla-a1 的 Cosmos)——动作头开始吃”自己想象的未来”。
- 人形与操作两支在 VLA 层面汇流:psi-0-humanoid-loco-manipulation/leverb/being-0 证明”上层通用 VLA + 下层 RL 全身跟踪”可行,但上下层接口(latent z / 语言子任务 / 关键点命令)与频率配比(Helix 200:9 vs LeVERB 50:10)尚无定论;行为基础模型(bfm-zero)的零样本任务推断与 VLA 的语义泛化还是两套体系,未打通。
- 仍缺的:动作扩散骨干的可扩展性尚未被证明(data-scaling-laws-imitation 观察到”视觉编码器越大越好、动作 UNet 放大反而无益”,动作专家普遍仅 100–860M);跨本体统一动作空间(padding/mask vs 码本 vs 潜动作)没有胜出者;双系统 S2↔S1 的信息瓶颈(单 latent 是否够)、以及”动作头该多大”(cogact 论证 300M DiT 相对 7B VLM 算小、相对 7 维动作算大)都还是开放问题。