具身智能训练方法:横向综述
把整个 scope 里三百来篇工作的”训练方法”横切来看,具身智能其实只有两条大动脉——模仿学习(IL/BC)和强化学习(RL)——外加把二者接到大模型上的 VLA 预训练+后训练范式。桌面操作几乎全走 IL(因为可以遥操作采数据、奖励难设计);腿足/人形全身控制几乎全走 RL(因为可以在仿真里大规模并行、真机采数据危险);两条动脉在 2024 年后被 VLA 缝合到一起,又衍生出 flow-matching 动作专家、动作 tokenize、web/人类视频协同训练、扩散策略的 RL 微调等一批横向技术。这一页按”IL 的生成式演进 → 生成式策略的加速与 RL 微调 → 腿足/人形 RL → VLA 预训练后训练 → 动作 tokenize → 协同训练 → sim-to-real”七条线索展开,每条尽量抠出一手数字,全部 [[slug]] 内链。
一、模仿学习:从确定性 BC 到生成式动作建模
1.1 早期确定性 BC 与”动作是多峰的”这个核心难题
最朴素的行为克隆就是回归——bc-z 用确定性策略 + Huber 损失(100·Huber(ΔXYZ)+10·Huber(Δaxis-angle)+0.5·LogLoss(gripper)),并对任务嵌入加 N(0,0.1) 噪声防”抄近路”,验证了”确定性策略已足以泛化”;gnm-general-navigation-model(ℓ2 回归路点、action 头只在正样本训)、interactive-language(MSE,500K 步)、r3m 下游 2 层 MLP(‖a−π(z,p)‖²)都是这一路。但确定性回归有个致命缺陷:人类演示天然多峰(同一状态可以左绕也可以右绕),MSE 会把多个模式平均成一个不可行的中间动作。
rt-1 给出的第一个答案是动作离散化——把每维切 256 个 bin 做 categorical 交叉熵,消融证明离散远优于连续高斯(离散能表达多峰、高斯只能单峰),且不必自回归(自回归慢 2× 且无收益)。这条离散路线一直延续到 open-x-embodiment、rt-2、openvla。
围绕”如何建多峰分布”,2022 年前后同时冒出三条互相竞争的路线:
- 隐式能量模型:implicit-bc-ibc 用 InfoNCE 对比损失把策略写成能量地形
p∝exp(−E_θ),靠负采样(batch 512、每样本 256 counter-examples)估配分函数。表达力强,但训练不稳——diffusion-policy 直接点名它”评测成功率剧烈震荡、难选 checkpoint”。 - 离散化 + 残差 offset:behavior-transformer-bet 先 k-means 出 bin,分类头用 Focal loss(抗 bin 频率不均)、offset 头用掩码多任务损失(只回传 ground-truth bin 的偏移)。vq-bet 把它升级成 Residual VQ-VAE,用 primary/secondary code 的 Focal loss + L1 offset,消融显示残差层和非对称 β 加权都不可省。
- 扩散:diffusion-policy 用 DDPM 噪声预测 MSE,无需负采样、无需估归一化常数,因此比 IBC 稳得多。它成了后续两年的事实标准。
1.2 Action Chunking:ACT 打开的时序建模开关
aloha-act 是另一条正交主线:用 CVAE(β-VAE,β=10)一次预测一段 action chunk(长度 k),重建用 L1 而非 L2(作者发现 L1 对动作序列更精确),推理时对重叠预测做指数加权平均(temporal ensemble)。动作分块 + 时序平滑后来几乎成了标配——baku、mobile-aloha、open-television(chunk 60)、aloha-unleashed 都沿用,data-scaling-laws-imitation 把 chunking + 时序集成写进标准配方。ACT 的另一个经验值得记:真机数据”抖动/中途停顿多半是训练不够”,README 建议 loss 平台后再训 3–4 倍长。
1.3 Diffusion Policy 系与它的 3D 化
Diffusion Policy 之后迅速分化出几个方向:
- 3D 化:dp3-3d-diffusion-policy 把观测换成点云(约 500 epoch 收敛,快于 2D 版),idp3-improved-3d-diffusion-policy 用金字塔编码器 + 4096 点 + 加长 horizon 做到无标定跨场景,rise-3d-perception-imitation、3d-diffuser-actor(L1 噪声 + BCE 开合,
w1=30/w2=10,位置用 scaled-linear、旋转用 square-cosine 分通道噪声调度)、r3d-revisiting-3d-policy-learning(诊断出 3D 策略学不动的根因是 BN 应换 LN + 缺数据增强)都在这条线上。 - 等变化:equivariant-diffusion-policy、equibot 用 SO(3)/SIM(3) 等变架构替代数据增强,靠架构而非增强获得旋转/尺度泛化。
- 专家混合:mode-mixture-of-denoising-experts(噪声条件路由的 MoE 去噪器)、sparse-diffusion-policy(用任务-专家互信息损失替代负载均衡损失,因为机器人技能本就该被频繁复用)。
- 规模化通才:rdt-1b(x0-prediction、1M 步预训练 + 130K 步微调、batch 1536)、octo(DDPM 20 步、300k 步、batch 2048,作者实测扩散头在 zero-shot 与微调上都优于 MSE/离散头)。
1.4 关键帧分类式:另一支被低估的主线
在体素/关键位姿空间做分类而非回归,是操作领域一条独立且强大的路线:peract(体素平移 + 欧拉角 bin 的四路交叉熵,用 LAMB 而非 Adam,600K 迭代)、rvt/rvt-2(多视角 heatmap 交叉熵,LAMB + 8-bit 优化器)、act3d(幽灵点 softmax,推理可加采样点无需重训)、3d-mvp、hierarchical-diffusion-policy-hdp(高层 PerAct 分类 + 低层扩散 + 运动学蒸馏项)、chaineddiffuser(关键位姿分类 + 轨迹扩散)。gembench 直接消融证明”分类式动作预测优于回归式且收敛更快”。
表 1 · 模仿学习目标函数与动作表示对比
| 工作 | 目标/损失 | 动作表示 | 多峰机制 | 关键训练数字 |
|---|---|---|---|---|
| implicit-bc-ibc | InfoNCE 对比(能量模型) | 连续/隐式 | 能量地形 | batch 512、256 负样本、lr 5e-4 |
| behavior-transformer-bet | Focal(分类)+掩码 MT(offset) | k-means bin + 残差 | 多 bin | lr 1e-4、wd 0.1 |
| vq-bet | Focal(primary+secondary)+L1 offset | Residual VQ-VAE | 码本 | Kitchen 1000 ep、真机 600 ep |
| aloha-act | CVAE ELBO:L1 重建 + KL | action chunk(k) | CVAE latent z | β=10、真机建议 ≥5000 ep |
| diffusion-policy | DDPM 噪声 MSE | 连续序列 | 扩散 | 训练 100 步 / 推理 16 步 DDIM |
| dp3-3d-diffusion-policy | DDPM 噪声 MSE | 点云条件 | 扩散 | 3000 ep(实测 ~500 收敛) |
| 3d-diffuser-actor | L1(平移/旋转)+BCE(开合) | 轨迹去噪 | 扩散 | w1=30/w2=10、分通道噪声调度 |
| peract | 交叉熵(四路分类) | 体素 + 欧拉 bin | 离散多峰 | LAMB、600K 迭代 |
| rt-1 | categorical CE | 逐维 256-bin 离散 | 离散多峰 | 不自回归(消融) |
| pi0 | 条件流匹配(无 RL) | 连续 flow | flow | 10 步 Euler 积分、H=50 |
二、生成式策略的加速与在线 RL 微调
扩散/流策略好用但慢(去噪要几十上百步),且纯 IL 无法超越演示上限。这催生了两块横向技术。
2.1 Flow matching 动作专家 —— π0 定下的新范式
pi0 第一个用条件流匹配替代离散 token 自回归:动作从 N(0,I) 出发前向 Euler 积分 10 步(δ=0.1)生成,action expert 只与 VLM 主干在 attention 层交互。这套”VLM 主干 + flow-matching 动作专家”迅速成为主流:bytedance-gr-3、smolvla(消融 flow matching LIBERO 80.25 > L1 回归 75.25)、groot-n1/groot-n1-5(flow + 目标检测/FLARE 辅助损失)、galaxea-g0、in-n-on-human0、graspvla、internvla-a1/internvla-a1-5(τ~Beta(1.5,1.0))都用它。
一个反复被验证的结论:在大容量骨干上,L1 回归 ≈ 扩散 ≈ flow,都能建模多任务多峰分布。openvla-oft 消融显示 L1 回归(95.3)与扩散(95.4)几乎持平,而 L1 收敛更快、推理更省。所以”用哪种生成头”越来越不是胜负手,“并行解码 + 动作分块”(OFT 相比自回归 OpenVLA +14%)反而是。
2.2 蒸馏 / 一致性 / 单步
为压推理延迟,一批工作把多步扩散蒸馏成少步或单步:
- consistency-policy:CTM 一致性蒸馏,学生对教师质量鲁棒(教师 .84→学生仍 .88)。
- manicm:manipulation consistency distillation,教师 100→10 步 DDIM 蒸馏后单步推理 17.3ms/SR 78.5%,相对教师约 57× 加速(994→17.4ms)。
- streaming-diffusion-policy:把”整段同噪声”换成”逐块/逐元素独立噪声”,单阶段无蒸馏,Push-T 得分 0.90。
- one-step-flow-policy:self-distillation(边界锚定 + 自一致性时间收缩 + 自引导),避开 MeanFlow 的 JVP 计算做到单步。
- adaflow:variance-adaptive flow,用方差估计头做自适应步长 ODE,NFE 低至 1.12–1.56。
2.3 用 RL 微调扩散/流策略 —— 突破 IL 上限
这是 2024–2026 最活跃的横向方向:先 IL 预训练一个扩散/流策略,再用 RL 微调。
- dppo-diffusion-policy-policy-optimization:把整条去噪链当 MDP 用 PPO 微调,引入环境折扣
γ_ENV与去噪折扣γ_DENOISE双折扣,value 只依赖环境状态(消融最关键),只微调最后 K’ 步省显存。 - reinflow:给 flow 的 ODE 注入噪声变成可精确算似然的离散马尔可夫过程再上 PPO,发现”噪声幅度是最显著因素”,越过阈值后能找到比预训练强 3 倍的新策略。
- pi-star-0-6(RECAP):迭代式 offline RL——蒙特卡洛回归离散化 return 的价值函数,再用 advantage-conditioned 策略训练(数学上等价于 classifier-free guidance),每次迭代都从预训练 checkpoint 微调以防漂移,“常常一次迭代就有显著提升”。
- seedpolicy:隐状态自演化扩散策略,训练窗口 ~120 帧但实测可外推到 ~640 帧长程 rollout。
efficient-vla-models-survey 汇总了 RL 后训练的一批惊人数字:RIPT-VLA 用带拒绝采样的 PPO 把成功率从 SFT 的 4% 提到 97%(15 次迭代、单条演示);SimpleVLA-RL 用 GRPO 把 17.3% 提到 91.7%;ConRFT 从 20–30 条演示达到真机 96.3%。
表 2 · 扩散/流策略的加速与 RL 微调
| 工作 | 手段 | 推理/加速 | 关键数字 |
|---|---|---|---|
| consistency-policy | CTM 一致性蒸馏 | 单步/几步 | 学生对教师质量鲁棒 |
| manicm | consistency distillation | 单步 17.3ms | ~57× 加速(994→17.4ms) |
| streaming-diffusion-policy | 逐块/逐元素噪声 | 缓冲流式 | Push-T 0.90 |
| one-step-flow-policy | self-distillation | 单步 | 避开 MeanFlow JVP |
| adaflow | variance-adaptive flow | NFE 1.12–1.56 | 对 η 鲁棒 |
| dppo-diffusion-policy-policy-optimization | PPO 微调去噪链 | — | 双折扣、value 只看 state |
| reinflow | 噪声注入 flow + PPO | — | 比预训练强 3× |
| pi-star-0-6 | 迭代 offline RL(RECAP) | — | advantage-conditioned,1 轮即提升 |
三、腿足与人形的 RL:并行仿真、teacher-student、motion tracking
这条线几乎独立于操作/VLA 发展,核心是 PPO + 大规模 GPU 并行仿真 + sim-to-real。
3.1 大规模并行 PPO 与”batch/步长”新权衡
learning-to-walk-in-minutes-massively-parallel-rl 是范式奠基:数千机器人并行后,必须选很小的 nsteps(实测低于 ~25 步 GAE 就不收敛),配数万级 mini-batch;关键 trick 是 time-out bootstrapping(对超时 reset 用 critic 自身预测 bootstrap),消融显示提升总奖励 10–20%。最佳权衡是 2048–4096 机器人 + batch ~100k/200k。isaac-gym 用 rl_games 在 4096–16384 环境上跑 PPO,默认对称 actor-critic、Shadow Hand 用非对称(policy 看真实观测、value 看特权状态)利于 sim2real。walk-these-ways 用 MoB(multiplicity of behavior)奖励结构训到 2.58B timesteps。同一大规模并行范式也支撑了敏捷运动(barkour-benchmark-quadruped-agility、agile-but-safe-legged-locomotion、dtc-deep-tracking-control)与跑酷(extreme-parkour-legged-robots、robot-parkour-learning、anymal-parkour-agile-navigation)。
3.2 特权 teacher → student 蒸馏
真机拿不到特权信息(真值速度、地形、摩擦),于是”仿真里训特权 teacher,再蒸馏出只用机载观测的 student”成为四足/人形的主导范式:
- learning-quadrupedal-locomotion-challenging-terrain:TRPO teacher → 监督 student(
L=(ā−a)²+(l̄−l)²,动作模仿 + latent 重构),DAgger 生成数据。 - learning-robust-perceptive-locomotion-wild:PPO teacher → student(
L_bc + 0.5·L_re),门控 belief encoder。 - rma-rapid-motor-adaptation:phase1 PPO 联合训 π+μ,phase2 监督训 φ 从历史估 latent
z(不是估环境参数e,只估”环境该如何改变行为”)。 - humanoid-parkour-learning(从 oracle 初始化 + 多卡蒸馏两者缺一不可)、helpful-doggybot(PPO teacher 20k 迭代 + ROA 蒸馏 5k 迭代)。
- neural-volumetric-memory-visual-locomotion:因图像观测把训练吞吐拖慢约 40×(高程图 4 万 fps → 图像 1 千 fps),才先训特权状态策略再蒸馏视觉。
3.3 人形全身控制与 motion tracking
人形是 2024–2026 的爆发点。主线是 DeepMimic 式跟踪奖励 + teacher-student:
- exbody/exbody2(ExBody2 用 25 帧历史 student 隐式恢复速度信息)、h2o-human2humanoid(直接 RL,不蒸馏)、omnih2o(PPO teacher + DAgger student,关键奖励 max feet height +1000 取代会导致原地踏步的 feet-air-time)、hover(多模态命令掩码蒸馏,一个 student 应付任意命令子集)、clone-teleoperation、hub-extreme-balance。
- motion tracking 专精:phc-perpetual-humanoid-control(渐进原语 + composer + AMP 贯穿)、gmt/twist/sonic(
L_recon+L_token+L_cycle显式跨本体对齐)/unitracker(CVAE 在线蒸馏)/kungfubot(自适应跟踪因子 + 双课程,单阶段无 teacher-student)/resmimic(两阶段残差 + 虚拟物体力课程)。 - 自适应采样成了跟踪训练的通用课程:beyondmimic、sonic、gmt 都按各段失败率加权采样,把训练力气压到难段。
- **AMP(对抗动作先验)**贯穿多条工作(isaac-gym 的 spin-kick、phc-perpetual-humanoid-control、physhsi、clone-teleoperation 用它给缺监督的下肢正则),用判别器
r=−log(1−D)让动作”像人”。 - loco-manipulation / 全身控制器:hugwbc、homie、skillblender(技能库 + 高层混合)、falcon(力矩可行性课程)、amo、wococo(好奇心哈希探索)、masked-humanoid-controller 都在把”跟踪”扩展到操作与接触。
3.4 奖励结构与 sim-to-real
腿足奖励几乎都是”任务跟踪项(指数型 exp(−误差))+ 一大堆正则/惩罚项(力矩/关节加速度/动作变化率/打滑/接触力)“。rma-rapid-motor-adaptation 的 10 项仿生能量学奖励、dreamwaq 的原创”功率分配”项 var(τ·θ̇)、extreme-parkour-legged-robots 的”世界坐标系速度跟踪防偷懒绕障”都是典型细节。sim-to-real 靠三件套:actuator network(walk-these-ways 建模 PD→真实力矩的非理想关系)、域随机化(摩擦/质量/PD 增益/控制延迟)、延迟建模(普遍 ~20ms)。asap 提供了另一条路——训一个 delta action 模型补齐仿真-真机的结构化 gap(126 MPJPE,优于均匀动作噪声的 ~150)。
表 3 · 腿足/人形 RL 训练配方对比
| 工作 | 算法/范式 | 并行环境 | teacher-student | sim2real 关键手段 | 训练量 |
|---|---|---|---|---|---|
| learning-to-walk-in-minutes-massively-parallel-rl | GPU-PPO | 2048–4096 | 单阶段 | time-out bootstrap +10–20% | — |
| isaac-gym | PPO(rl_games) | 4096–16384 | 非对称 AC | actuator net + 地形课程 | — |
| walk-these-ways | PPO(MoB) | 4096 | 单阶段 | actuator + 20ms 延迟 | 2.58B steps |
| rma-rapid-motor-adaptation | PPO + 监督 φ | — | 两阶段(估 z) | 能量学奖励 + 惩罚课程 | 15k+1k 迭代 |
| extreme-parkour-legged-robots | PPO+ROA→DAgger | — | 蒸馏纯视觉 | 8k 迭代后加延迟 | 10–15k + 5–10k |
| exbody2 | PPO teacher+DAgger | 4096 | 25 帧历史 student | DR + delay | — |
| omnih2o | PPO + DAgger | — | 多模态蒸馏 | penalty curriculum | — |
| twist | PPO teacher + RL+BC | 4096 | RL+BC 混合 | push EE 20N | 30k 更新 |
| asap | 两阶段 + delta action | 5000 | — | delta action(126 MPJPE) | 微调 1000 迭代 |
| sonic | 单阶段 PPO + retarget | 4096/GPU | — | 128 GPU 关键 | 收敛 3–7 天 |
| kungfubot | 单阶段 PPO + 自适应因子 | 4096 | 单阶段 | 终止+惩罚双课程 | — |
四、VLA 预训练 + 后训练
VLA 把”IL 的动作头”接到”预训练 VLM 的语义/视觉先验”上,训练范式对齐了 LLM 的 pretrain→posttrain。
4.1 co-fine-tuning:保住 web 知识
rt-2 的核心贡献是 co-fine-tuning——微调时把原始 web 数据一直留着与机器人数据一起训(~1:1),消融证明 co-fine-tune > fine-tune > from-scratch,且 open-x-embodiment 进一步显示 web 预训练对大模型是决定性的(从头训 emergent 掉到 0%,55B > 5B)。palm-e 同样发现”模型越大灾难性遗忘越少”,full mixture 里具身数据只占 8.9%。
4.2 两段式 / 三阶段课程
- 两段式(对齐 LLM 的 pretrain/posttrain):pi0(预训练 700k 步宽覆盖 → 后训练高质量数据专精)、openvla(反复迭代到动作 token 准确率 >95%,最终 27 epoch)、spatialvla(160k 步 90% 准确率 → 移除 Kuka 后 40k 步 >95%)。
- 三阶段课程:dexvla 的”具身课程学习”(跨具身预训练扩散专家 → 具身特定对齐 → 任务特定适配,各 5 epoch)、galaxea-g0/galaxea-g0-5(VLM 自回归预训练 → 单本体 flow-matching 预训练 → 任务微调)、groot-n1(异构金字塔数据 flow-matching 预训练 200k 步 → 单本体后训练冻结语言部分)、agibot-world-colosseo(LAM → latent planner → action expert 联合训练)、molmoact(预训练 → 中训练 → 任务微调)。
4.3 离散 + 连续联合,knowledge insulation
一批工作发现”离散动作 token 训练收敛快、连续动作推理快”,于是把两者拼起来:
- pi-knowledge-insulation(KI):VLM 主干用 FAST token 交叉熵监督,action expert 用 flow matching,但梯度不回流进主干(stop-gradient)。收敛速度惊人——bussing 任务上 KI 约 160K 步收敛,纯 flow 的 π0 要 1200K 步才追上(~7.5× 提速),单步训练开销只增 ~20%。
- pi0-5(FAST 预训练 α=0 → 后训练加 action expert α=10)、pi0-fast(纯 FAST 自回归)、pi0-7(KI + 世界模型子目标图像)。
- wall-oss/wall-oss-0-5:gradient-bridged co-training(离散动作 CE 当”梯度桥” + 多模态 CE + flow matching 端到端保留梯度流),消融 co-training 平均任务进度 57.0% > flow-only 36.6% > stop-gradient 31.9%——与 π0.5 的 stop-gradient 得出相反结论,是这一子领域有意思的分歧点。
4.4 推理增强 / thinking VLA / RL 后训练
- 显式推理:rt-h(语言运动中间层:动作查询 + 语言运动查询各 25% co-train,纠正数据上采样 ~50×)、gemini-robotics-1-5(Thinking VLA 生成自然语言思考轨迹再出动作)、diffusion-vla(
L_diff + α·L_ntp,α=10)、internvla-a1-5(foresight 视频生成 + flow action,α=1,β=10)、hume-vla(System2 慢思考 + value-query 头做离线 RL)。 - RL 后训练:见 §2.3 的 pi-star-0-6、efficient-vla-models-survey、large-vlm-vla-manipulation-survey 的系统梳理(VLA-RL 过程奖励模型、GRAPE 的 DPO、TGRPO 的 GRPO、ConRFT 的两阶段人在环)。
表 4 · VLA 预训练/后训练配方对比
| 模型 | 动作头 | 预训练(步/batch) | 后训练 | co-train 特征 |
|---|---|---|---|---|
| rt-2 | 离散 token CE | 55B:80K / 2048 | — | web+robot ~1:1 co-ft |
| openvla | 离散 token CE | 27 ep / 2048 / lr2e-5 | LoRA r32(省 8×算力) | OXE |
| pi0 | flow matching | 700k steps | 1/5/10h 专精 | — |
| pi0-5 | FAST→flow(α=10) | 280k + 80k | 家庭移动操作 | HL/WD 混训 |
| pi-knowledge-insulation | FAST CE + flow(stop-grad) | 160k(vs π0 1200k) | — | VLM 数据 co-train |
| groot-n1 | flow + 检测辅助 | 200k / 16384 | 20k–60k、冻结语言 | 神经轨迹 1:1 |
| groot-n1-5 | flow + FLARE(0.2) | 250k / 16384 / 1000×H100 | 20k、支持 LoRA | — |
| galaxea-g0-5 | next-token(FAST/RVQ) | ~120k steps | LIBERO 100k | 跨本体统一动作层 |
| dexvla | 扩散专家(三阶段) | 5/5/5 epoch | 100–200 条演示 | 跨具身多头 |
| wall-oss-0-5 | 离散+flow(gradient-bridged) | 至收敛 | lr5e-5 全模块 | co-train 57% > flow-only 36.6% |
五、动作 tokenize:从逐维分箱到 latent action
如何把连续动作变成可被 Transformer 消化的 token,是 VLA 的关键技术分岔。
- 逐维离散 binning:rt-1/rt-2/open-x-embodiment/openvla 每维 256 bin。简单、能表达多峰,但一个 chunk 要展开成大量 token、自回归解码慢。
- FAST(DCT + BPE):把动作序列先做离散余弦变换再字节对编码压缩,pi0-fast 首提,被 galaxea-g0、wall-oss、pi0-5/pi0-7 采用;efficient-vla-models-survey 与 large-vlm-vla-manipulation-survey 都记:训练最多提速 5×,且全程无需训练额外量化网络(对比 FSQ/VQ)。
- 无监督 latent action:不需要动作标签,从帧间变化里 VQ-VAE 出离散隐动作,让模型能吃无标注人类视频。lapa-latent-action-pretraining(LAQ 用 VQ-VAE + NSVQ,潜动作预训练 1 epoch 即够)、univla(解耦”任务无关”与”任务中心”两个码本,消融任务中心 88.7% > Genie 式 82.3% > 任务无关 56.5%)、moto、villa-x(ACT-latent 与 ACT-robot 均 flow matching,显式条件传递优于 LAPA 式隐式迁移)、wholebodyvla(操作/移动双 LAM)。
- VQ / RVQ 动作:uh-1(VQ-VAE 把 k=4 帧压进 1 token)、galaxea-g0-5(ActionCodec 残差 VQ + 时序对比)、wall-oss-0-5(RVQ tokenizer 消融:VQA 75.7→77.5%、任务进度 29.3→48.1%)。
- 通用/跨本体动作:uniact 用共享码本 + 异构解码头 + Gumbel-Softmax(避免 STE 的码本坍缩),迁移新接口只需训 0.8% 参数;hpt-heterogeneous-pretrained-transformers 用共享 trunk + 各本体 stem/head(迁移冻结 trunk,可训参数低至 2%);crossformer-cross-embodied-learning 让 20 种具身共享一套权重。
- 连续、不 tokenize:flow/扩散头一路(pi0、internvla-a1、cogact)直接连续回归,diffusion-vla 甚至发现 action chunking 会损害泛化而弃用。
表 5 · 动作 tokenize 方法对比
| 方法 | 机制 | 代表工作 | 关键收益/数字 |
|---|---|---|---|
| 逐维离散 binning | 每维 256 bin CE | rt-1 rt-2 openvla | 表达多峰,解码慢 |
| FAST | DCT + BPE 压缩序列 | pi0-fast galaxea-g0 wall-oss | 训练最多 5× 提速、免训练 |
| 无监督 latent action | VQ-VAE 帧间隐动作 | lapa-latent-action-pretraining univla villa-x | LAPA 预训练 1 epoch 即够 |
| VQ / RVQ 动作 | 残差矢量量化 | uh-1 galaxea-g0-5 wall-oss-0-5 | UH-1 k=4 帧/token |
| 通用/跨本体动作 | 共享码本 + 异构头 | uniact hpt-heterogeneous-pretrained-transformers | UniAct 迁移仅 0.8% 参数 |
| 连续(不 tokenize) | flow/扩散直接回归 | pi0 cogact diffusion-vla | 高容量下与离散持平 |
六、Web / 人类视频协同训练
数据稀缺是具身的根本约束,“把便宜的大数据(web 图文、人类视频)掺进机器人训练”因此成为横向主线。
6.1 协同训练配比是个可调超参
多篇工作把 co-training 比例做成消融变量,结论高度一致——co-training(联合训练)显著优于 pretrain-then-finetune:
- mobile-aloha:移动/静态数据 50/50 co-train 得 95%,而”先 pretrain 再 finetune”只有 40%(≈ 只用移动数据的 50%),因为微调会遗忘静态经验;co-train 用 35 条演示即超过不 co-train 用 50 条。
- bridge-data-original:bridge/target 联合训练明显强于分阶段,按规模重采样到 70/30 或 90/10;bridgedata-v2 延续。
- droid:in-domain 与 DROID 50/50 混,“简单 50/50 混就很好用”。
- rt-h:预训练查询 50% / 演示 46% / 纠正数据 4%(纠正样本相对上采样 ~50×)。
6.2 人类第一视角视频
人类视频比机器人数据便宜几个数量级,但有”具身 gap”。ego4d/ego-exo4d 是预训练语料基石(Ego4D 域内预训练相对 Kinetics 显著降低动作预判误差)。落到策略:
- 统一状态-动作空间 + 减速插值:humanoid-policy-human-policy-ph2d 消融显示”统一状态空间 + 速度插值”缺一不可(完整 4/10,缺任一项掉到 0–1/10),因为不减速会让预测速度在”像人”和”像遥操作”间跳变。
- 域适配对抗:in-n-on-human0 用 flow matching + GRL 对抗损失(
λ=0.1)对齐人类/机器人特征。 - 遮罩/表征对齐:egomimic(去掉人类数据掉 47%)、egodex、humanplus、vid2robot(TCC 时序循环一致性 + SigLIP 对比辅助损失)。
- 轨迹/光流作桥:any-point-trajectory-model-atm、track2act、general-flow、im2flow2act、bimanual-flow-video-prediction-policy 用点轨迹/光流当”动作无关的中间接口”,先在无动作视频上学,再接少量真机演示。
- 视频世界模型造数据:dreamgen-groot-dreams(微调视频世界模型 → rollout 合成视频 → IDM/LAPA 伪动作标注 → 训策略,真机:神经轨迹 1:1 co-train)、gr-1/bytedance-gr-2(先视频生成预训练再动作微调,微调仍保留视频预测损失)、onex-neo-redwood(世界模型多阶段预训练)。
表 6 · 协同训练配比与收益
| 工作 | 混配对象 | 比例 | 核心结论 |
|---|---|---|---|
| mobile-aloha | 移动 / 静态 | 50/50 | co-train 95% ≫ pretrain-ft 40% |
| bridge-data-original | bridge / target | 70/30、90/10 | joint > pretrain+finetune |
| droid | in-domain / DROID | 50/50 | 简单 50/50 就好用 |
| rt-2 | web / robot | ~1:1 | 保住 web 知识、承接泛化 |
| rt-h | 预训练/演示/纠正 | 50/46/4 | 纠正数据上采样 ~50× |
| egomimic | robot + human | — | 去人类数据掉 47% |
七、Sim-to-real 训练技术
跨越仿真-真机 gap 的手段在腿足/灵巧手上尤其成体系:
- 域随机化(DR):源头是 domain-randomization(纯监督 L2 回归 + 随机化纹理/光照即可零样本迁移,无 RL 无真机微调)。腿足普遍随机化摩擦/质量/质心/PD 增益/控制延迟(h2o-human2humanoid、hub-extreme-balance、wococo 的 DR 表基本同构)。omniretarget 反其道而行——只用 4 项 DR(对比前作一大堆),靠精确重定向 + 定向随机化。
- actuator network:把 PD 误差→真实力矩的非理想关系单独训一个网络(sim-to-real-agile-locomotion-quadruped 的直流电机模型 + 力矩饱和分段线性、learning-quadrupedal-locomotion-challenging-terrain 的 SEA 建模、walk-these-ways)。
- 延迟建模:普遍显式建 ~20ms action delay(walk-these-ways、umi-on-legs 扫描 0–30ms 发现 20ms 最匹配);real-world-humanoid-locomotion-rl 用虚拟弹簧 + 交替子步建模闭链欠驱动。
- 特权蒸馏 + 早停 + RSI:见 §3.2,普遍配 RSI(Reference State Initialization,exbody 消融显示去掉后策略”自杀”)与早停提升样本效率。
- delta action / system id:asap 训 delta action 模型闭环补 gap;simpler-env 反向做 real-to-sim——离线系统辨识(模拟退火调 PD 参数)+ Visual Matching(green-screen 合成)弥合控制/视觉 gap,让仿真评测与真机排序一致。
空白与趋势
把这三百篇横切完,几条趋势和空白很清楚:
-
生成头之争基本收敛,胜负手移到”如何喂梯度”。L1/扩散/flow 在大容量下几乎等价(openvla-oft),真正分胜负的是并行解码、动作分块、以及 discrete-CE 与 continuous-flow 如何联合(pi-knowledge-insulation 的 stop-gradient vs wall-oss-0-5 的 gradient-bridge 得出相反结论,尚无定论)。
-
RL 正在回归 VLA,但方式变了。不再是从头 RL,而是”IL 预训练 → RL 微调扩散/流策略”(dppo-diffusion-policy-policy-optimization、reinflow、pi-star-0-6)或”RL 训小模型/收数据再蒸馏回大模型”。offline RL + advantage-conditioning 与 flow-matching 的结合(RECAP、hume-vla 的 Cal-QL value head)是最前沿的缝合点。
-
latent action / 世界模型正在成为”人类视频→机器人动作”的标准桥。从 lapa-latent-action-pretraining 到 univla 的解耦码本、villa-x 的显式条件传递、dreamgen-groot-dreams 的合成轨迹,方向是把无标注视频的价值榨干;但 latent action 会不会编码任务无关的相机抖动(efficient-vla-models-survey 转述 Bu et al. 指出的问题)仍是隐患。
-
人形全身控制的训练已高度模板化(DeepMimic 跟踪奖励 + teacher-student + 自适应采样 + AMP + DR 五件套),但跟踪之外的接触密集 loco-manipulation 仍缺通用配方——falcon 的力矩可行性课程、resmimic 的虚拟物体力课程、twist 的训练期施力都是点状解法,尚未收敛成范式。
-
明显的空白:(a) 真机在线 RL 仍稀少且脆弱(多数”RL 后训练”仍在仿真或靠人在环);(b) 触觉/力反馈的训练目标基本还是把触觉当额外观测通道(vitamin-visuo-tactile-interface、cordvip、maniwav),缺乏原生的接触感知训练目标;(c) 超参披露普遍不全——大量 VLA(gemini-robotics、figure-helix、skild-brain、dyna-1)只给范式不给学习率/步数,复现门槛高;(d) 训练与部署的对齐(figure-helix 的 temporal offset、psi-0-humanoid-loco-manipulation 的训练时 Real-Time Chunking、deer-vla 的随机出口采样)刚起步,是把实验室成功率搬到真机实时约束下的关键缺口。