具身智能训练方法:横向综述

把整个 scope 里三百来篇工作的”训练方法”横切来看,具身智能其实只有两条大动脉——模仿学习(IL/BC)强化学习(RL)——外加把二者接到大模型上的 VLA 预训练+后训练范式。桌面操作几乎全走 IL(因为可以遥操作采数据、奖励难设计);腿足/人形全身控制几乎全走 RL(因为可以在仿真里大规模并行、真机采数据危险);两条动脉在 2024 年后被 VLA 缝合到一起,又衍生出 flow-matching 动作专家、动作 tokenize、web/人类视频协同训练、扩散策略的 RL 微调等一批横向技术。这一页按”IL 的生成式演进 → 生成式策略的加速与 RL 微调 → 腿足/人形 RL → VLA 预训练后训练 → 动作 tokenize → 协同训练 → sim-to-real”七条线索展开,每条尽量抠出一手数字,全部 [[slug]] 内链。


一、模仿学习:从确定性 BC 到生成式动作建模

1.1 早期确定性 BC 与”动作是多峰的”这个核心难题

最朴素的行为克隆就是回归——bc-z 用确定性策略 + Huber 损失(100·Huber(ΔXYZ)+10·Huber(Δaxis-angle)+0.5·LogLoss(gripper)),并对任务嵌入加 N(0,0.1) 噪声防”抄近路”,验证了”确定性策略已足以泛化”;gnm-general-navigation-model(ℓ2 回归路点、action 头只在正样本训)、interactive-language(MSE,500K 步)、r3m 下游 2 层 MLP(‖a−π(z,p)‖²)都是这一路。但确定性回归有个致命缺陷:人类演示天然多峰(同一状态可以左绕也可以右绕),MSE 会把多个模式平均成一个不可行的中间动作。

rt-1 给出的第一个答案是动作离散化——把每维切 256 个 bin 做 categorical 交叉熵,消融证明离散远优于连续高斯(离散能表达多峰、高斯只能单峰),且不必自回归(自回归慢 2× 且无收益)。这条离散路线一直延续到 open-x-embodimentrt-2openvla

围绕”如何建多峰分布”,2022 年前后同时冒出三条互相竞争的路线:

  • 隐式能量模型implicit-bc-ibc 用 InfoNCE 对比损失把策略写成能量地形 p∝exp(−E_θ),靠负采样(batch 512、每样本 256 counter-examples)估配分函数。表达力强,但训练不稳——diffusion-policy 直接点名它”评测成功率剧烈震荡、难选 checkpoint”。
  • 离散化 + 残差 offsetbehavior-transformer-bet 先 k-means 出 bin,分类头用 Focal loss(抗 bin 频率不均)、offset 头用掩码多任务损失(只回传 ground-truth bin 的偏移)。vq-bet 把它升级成 Residual VQ-VAE,用 primary/secondary code 的 Focal loss + L1 offset,消融显示残差层和非对称 β 加权都不可省。
  • 扩散diffusion-policy 用 DDPM 噪声预测 MSE,无需负采样、无需估归一化常数,因此比 IBC 稳得多。它成了后续两年的事实标准。

1.2 Action Chunking:ACT 打开的时序建模开关

aloha-act 是另一条正交主线:用 CVAE(β-VAE,β=10)一次预测一段 action chunk(长度 k),重建用 L1 而非 L2(作者发现 L1 对动作序列更精确),推理时对重叠预测做指数加权平均(temporal ensemble)。动作分块 + 时序平滑后来几乎成了标配——bakumobile-alohaopen-television(chunk 60)、aloha-unleashed 都沿用,data-scaling-laws-imitation 把 chunking + 时序集成写进标准配方。ACT 的另一个经验值得记:真机数据”抖动/中途停顿多半是训练不够”,README 建议 loss 平台后再训 3–4 倍长。

1.3 Diffusion Policy 系与它的 3D 化

Diffusion Policy 之后迅速分化出几个方向:

1.4 关键帧分类式:另一支被低估的主线

在体素/关键位姿空间做分类而非回归,是操作领域一条独立且强大的路线:peract(体素平移 + 欧拉角 bin 的四路交叉熵,用 LAMB 而非 Adam,600K 迭代)、rvt/rvt-2(多视角 heatmap 交叉熵,LAMB + 8-bit 优化器)、act3d(幽灵点 softmax,推理可加采样点无需重训)、3d-mvphierarchical-diffusion-policy-hdp(高层 PerAct 分类 + 低层扩散 + 运动学蒸馏项)、chaineddiffuser(关键位姿分类 + 轨迹扩散)。gembench 直接消融证明”分类式动作预测优于回归式且收敛更快”。

表 1 · 模仿学习目标函数与动作表示对比

工作目标/损失动作表示多峰机制关键训练数字
implicit-bc-ibcInfoNCE 对比(能量模型)连续/隐式能量地形batch 512、256 负样本、lr 5e-4
behavior-transformer-betFocal(分类)+掩码 MT(offset)k-means bin + 残差多 binlr 1e-4、wd 0.1
vq-betFocal(primary+secondary)+L1 offsetResidual VQ-VAE码本Kitchen 1000 ep、真机 600 ep
aloha-actCVAE ELBO:L1 重建 + KLaction chunk(k)CVAE latent zβ=10、真机建议 ≥5000 ep
diffusion-policyDDPM 噪声 MSE连续序列扩散训练 100 步 / 推理 16 步 DDIM
dp3-3d-diffusion-policyDDPM 噪声 MSE点云条件扩散3000 ep(实测 ~500 收敛)
3d-diffuser-actorL1(平移/旋转)+BCE(开合)轨迹去噪扩散w1=30/w2=10、分通道噪声调度
peract交叉熵(四路分类)体素 + 欧拉 bin离散多峰LAMB、600K 迭代
rt-1categorical CE逐维 256-bin 离散离散多峰不自回归(消融)
pi0条件流匹配(无 RL)连续 flowflow10 步 Euler 积分、H=50

二、生成式策略的加速与在线 RL 微调

扩散/流策略好用但慢(去噪要几十上百步),且纯 IL 无法超越演示上限。这催生了两块横向技术。

2.1 Flow matching 动作专家 —— π0 定下的新范式

pi0 第一个用条件流匹配替代离散 token 自回归:动作从 N(0,I) 出发前向 Euler 积分 10 步(δ=0.1)生成,action expert 只与 VLM 主干在 attention 层交互。这套”VLM 主干 + flow-matching 动作专家”迅速成为主流:bytedance-gr-3smolvla(消融 flow matching LIBERO 80.25 > L1 回归 75.25)、groot-n1/groot-n1-5(flow + 目标检测/FLARE 辅助损失)、galaxea-g0in-n-on-human0graspvlainternvla-a1/internvla-a1-5τ~Beta(1.5,1.0))都用它。

一个反复被验证的结论:在大容量骨干上,L1 回归 ≈ 扩散 ≈ flow,都能建模多任务多峰分布openvla-oft 消融显示 L1 回归(95.3)与扩散(95.4)几乎持平,而 L1 收敛更快、推理更省。所以”用哪种生成头”越来越不是胜负手,“并行解码 + 动作分块”(OFT 相比自回归 OpenVLA +14%)反而是。

2.2 蒸馏 / 一致性 / 单步

为压推理延迟,一批工作把多步扩散蒸馏成少步或单步:

  • consistency-policy:CTM 一致性蒸馏,学生对教师质量鲁棒(教师 .84→学生仍 .88)。
  • manicm:manipulation consistency distillation,教师 100→10 步 DDIM 蒸馏后单步推理 17.3ms/SR 78.5%,相对教师约 57× 加速(994→17.4ms)。
  • streaming-diffusion-policy:把”整段同噪声”换成”逐块/逐元素独立噪声”,单阶段无蒸馏,Push-T 得分 0.90。
  • one-step-flow-policy:self-distillation(边界锚定 + 自一致性时间收缩 + 自引导),避开 MeanFlow 的 JVP 计算做到单步。
  • adaflow:variance-adaptive flow,用方差估计头做自适应步长 ODE,NFE 低至 1.12–1.56。

2.3 用 RL 微调扩散/流策略 —— 突破 IL 上限

这是 2024–2026 最活跃的横向方向:先 IL 预训练一个扩散/流策略,再用 RL 微调。

  • dppo-diffusion-policy-policy-optimization:把整条去噪链当 MDP 用 PPO 微调,引入环境折扣 γ_ENV 与去噪折扣 γ_DENOISE 双折扣,value 只依赖环境状态(消融最关键),只微调最后 K’ 步省显存。
  • reinflow:给 flow 的 ODE 注入噪声变成可精确算似然的离散马尔可夫过程再上 PPO,发现”噪声幅度是最显著因素”,越过阈值后能找到比预训练强 3 倍的新策略。
  • pi-star-0-6(RECAP):迭代式 offline RL——蒙特卡洛回归离散化 return 的价值函数,再用 advantage-conditioned 策略训练(数学上等价于 classifier-free guidance),每次迭代都从预训练 checkpoint 微调以防漂移,“常常一次迭代就有显著提升”。
  • seedpolicy:隐状态自演化扩散策略,训练窗口 ~120 帧但实测可外推到 ~640 帧长程 rollout。

efficient-vla-models-survey 汇总了 RL 后训练的一批惊人数字:RIPT-VLA 用带拒绝采样的 PPO 把成功率从 SFT 的 4% 提到 97%(15 次迭代、单条演示);SimpleVLA-RL 用 GRPO 把 17.3% 提到 91.7%;ConRFT 从 20–30 条演示达到真机 96.3%

表 2 · 扩散/流策略的加速与 RL 微调

工作手段推理/加速关键数字
consistency-policyCTM 一致性蒸馏单步/几步学生对教师质量鲁棒
manicmconsistency distillation单步 17.3ms~57× 加速(994→17.4ms)
streaming-diffusion-policy逐块/逐元素噪声缓冲流式Push-T 0.90
one-step-flow-policyself-distillation单步避开 MeanFlow JVP
adaflowvariance-adaptive flowNFE 1.12–1.56对 η 鲁棒
dppo-diffusion-policy-policy-optimizationPPO 微调去噪链双折扣、value 只看 state
reinflow噪声注入 flow + PPO比预训练强 3×
pi-star-0-6迭代 offline RL(RECAP)advantage-conditioned,1 轮即提升

三、腿足与人形的 RL:并行仿真、teacher-student、motion tracking

这条线几乎独立于操作/VLA 发展,核心是 PPO + 大规模 GPU 并行仿真 + sim-to-real。

3.1 大规模并行 PPO 与”batch/步长”新权衡

learning-to-walk-in-minutes-massively-parallel-rl 是范式奠基:数千机器人并行后,必须选很小的 nsteps(实测低于 ~25 步 GAE 就不收敛),配数万级 mini-batch;关键 trick 是 time-out bootstrapping(对超时 reset 用 critic 自身预测 bootstrap),消融显示提升总奖励 10–20%。最佳权衡是 2048–4096 机器人 + batch ~100k/200kisaac-gym 用 rl_games 在 4096–16384 环境上跑 PPO,默认对称 actor-critic、Shadow Hand 用非对称(policy 看真实观测、value 看特权状态)利于 sim2real。walk-these-ways 用 MoB(multiplicity of behavior)奖励结构训到 2.58B timesteps。同一大规模并行范式也支撑了敏捷运动(barkour-benchmark-quadruped-agilityagile-but-safe-legged-locomotiondtc-deep-tracking-control)与跑酷(extreme-parkour-legged-robotsrobot-parkour-learninganymal-parkour-agile-navigation)。

3.2 特权 teacher → student 蒸馏

真机拿不到特权信息(真值速度、地形、摩擦),于是”仿真里训特权 teacher,再蒸馏出只用机载观测的 student”成为四足/人形的主导范式:

3.3 人形全身控制与 motion tracking

人形是 2024–2026 的爆发点。主线是 DeepMimic 式跟踪奖励 + teacher-student

3.4 奖励结构与 sim-to-real

腿足奖励几乎都是”任务跟踪项(指数型 exp(−误差))+ 一大堆正则/惩罚项(力矩/关节加速度/动作变化率/打滑/接触力)“。rma-rapid-motor-adaptation 的 10 项仿生能量学奖励、dreamwaq 的原创”功率分配”项 var(τ·θ̇)extreme-parkour-legged-robots 的”世界坐标系速度跟踪防偷懒绕障”都是典型细节。sim-to-real 靠三件套:actuator networkwalk-these-ways 建模 PD→真实力矩的非理想关系)、域随机化(摩擦/质量/PD 增益/控制延迟)、延迟建模(普遍 ~20ms)。asap 提供了另一条路——训一个 delta action 模型补齐仿真-真机的结构化 gap(126 MPJPE,优于均匀动作噪声的 ~150)。

表 3 · 腿足/人形 RL 训练配方对比

工作算法/范式并行环境teacher-studentsim2real 关键手段训练量
learning-to-walk-in-minutes-massively-parallel-rlGPU-PPO2048–4096单阶段time-out bootstrap +10–20%
isaac-gymPPO(rl_games)4096–16384非对称 ACactuator net + 地形课程
walk-these-waysPPO(MoB)4096单阶段actuator + 20ms 延迟2.58B steps
rma-rapid-motor-adaptationPPO + 监督 φ两阶段(估 z)能量学奖励 + 惩罚课程15k+1k 迭代
extreme-parkour-legged-robotsPPO+ROA→DAgger蒸馏纯视觉8k 迭代后加延迟10–15k + 5–10k
exbody2PPO teacher+DAgger409625 帧历史 studentDR + delay
omnih2oPPO + DAgger多模态蒸馏penalty curriculum
twistPPO teacher + RL+BC4096RL+BC 混合push EE 20N30k 更新
asap两阶段 + delta action5000delta action(126 MPJPE)微调 1000 迭代
sonic单阶段 PPO + retarget4096/GPU128 GPU 关键收敛 3–7 天
kungfubot单阶段 PPO + 自适应因子4096单阶段终止+惩罚双课程

四、VLA 预训练 + 后训练

VLA 把”IL 的动作头”接到”预训练 VLM 的语义/视觉先验”上,训练范式对齐了 LLM 的 pretrain→posttrain。

4.1 co-fine-tuning:保住 web 知识

rt-2 的核心贡献是 co-fine-tuning——微调时把原始 web 数据一直留着与机器人数据一起训(~1:1),消融证明 co-fine-tune > fine-tune > from-scratch,且 open-x-embodiment 进一步显示 web 预训练对大模型是决定性的(从头训 emergent 掉到 0%,55B > 5B)。palm-e 同样发现”模型越大灾难性遗忘越少”,full mixture 里具身数据只占 8.9%。

4.2 两段式 / 三阶段课程

  • 两段式(对齐 LLM 的 pretrain/posttrain):pi0(预训练 700k 步宽覆盖 → 后训练高质量数据专精)、openvla(反复迭代到动作 token 准确率 >95%,最终 27 epoch)、spatialvla(160k 步 90% 准确率 → 移除 Kuka 后 40k 步 >95%)。
  • 三阶段课程dexvla 的”具身课程学习”(跨具身预训练扩散专家 → 具身特定对齐 → 任务特定适配,各 5 epoch)、galaxea-g0/galaxea-g0-5(VLM 自回归预训练 → 单本体 flow-matching 预训练 → 任务微调)、groot-n1(异构金字塔数据 flow-matching 预训练 200k 步 → 单本体后训练冻结语言部分)、agibot-world-colosseo(LAM → latent planner → action expert 联合训练)、molmoact(预训练 → 中训练 → 任务微调)。

4.3 离散 + 连续联合,knowledge insulation

一批工作发现”离散动作 token 训练收敛快、连续动作推理快”,于是把两者拼起来:

  • pi-knowledge-insulation(KI):VLM 主干用 FAST token 交叉熵监督,action expert 用 flow matching,但梯度不回流进主干(stop-gradient)。收敛速度惊人——bussing 任务上 KI 约 160K 步收敛,纯 flow 的 π0 要 1200K 步才追上(~7.5× 提速),单步训练开销只增 ~20%。
  • pi0-5(FAST 预训练 α=0 → 后训练加 action expert α=10)、pi0-fast(纯 FAST 自回归)、pi0-7(KI + 世界模型子目标图像)。
  • wall-oss/wall-oss-0-5gradient-bridged co-training(离散动作 CE 当”梯度桥” + 多模态 CE + flow matching 端到端保留梯度流),消融 co-training 平均任务进度 57.0% > flow-only 36.6% > stop-gradient 31.9%——与 π0.5 的 stop-gradient 得出相反结论,是这一子领域有意思的分歧点。

4.4 推理增强 / thinking VLA / RL 后训练

表 4 · VLA 预训练/后训练配方对比

模型动作头预训练(步/batch)后训练co-train 特征
rt-2离散 token CE55B:80K / 2048web+robot ~1:1 co-ft
openvla离散 token CE27 ep / 2048 / lr2e-5LoRA r32(省 8×算力)OXE
pi0flow matching700k steps1/5/10h 专精
pi0-5FAST→flow(α=10)280k + 80k家庭移动操作HL/WD 混训
pi-knowledge-insulationFAST CE + flow(stop-grad)160k(vs π0 1200k)VLM 数据 co-train
groot-n1flow + 检测辅助200k / 1638420k–60k、冻结语言神经轨迹 1:1
groot-n1-5flow + FLARE(0.2)250k / 16384 / 1000×H10020k、支持 LoRA
galaxea-g0-5next-token(FAST/RVQ)~120k stepsLIBERO 100k跨本体统一动作层
dexvla扩散专家(三阶段)5/5/5 epoch100–200 条演示跨具身多头
wall-oss-0-5离散+flow(gradient-bridged)至收敛lr5e-5 全模块co-train 57% > flow-only 36.6%

五、动作 tokenize:从逐维分箱到 latent action

如何把连续动作变成可被 Transformer 消化的 token,是 VLA 的关键技术分岔。

  • 逐维离散 binningrt-1/rt-2/open-x-embodiment/openvla 每维 256 bin。简单、能表达多峰,但一个 chunk 要展开成大量 token、自回归解码慢。
  • FAST(DCT + BPE):把动作序列先做离散余弦变换再字节对编码压缩,pi0-fast 首提,被 galaxea-g0wall-osspi0-5/pi0-7 采用;efficient-vla-models-surveylarge-vlm-vla-manipulation-survey 都记:训练最多提速 5×,且全程无需训练额外量化网络(对比 FSQ/VQ)。
  • 无监督 latent action:不需要动作标签,从帧间变化里 VQ-VAE 出离散隐动作,让模型能吃无标注人类视频lapa-latent-action-pretraining(LAQ 用 VQ-VAE + NSVQ,潜动作预训练 1 epoch 即够)、univla(解耦”任务无关”与”任务中心”两个码本,消融任务中心 88.7% > Genie 式 82.3% > 任务无关 56.5%)、motovilla-x(ACT-latent 与 ACT-robot 均 flow matching,显式条件传递优于 LAPA 式隐式迁移)、wholebodyvla(操作/移动双 LAM)。
  • VQ / RVQ 动作uh-1(VQ-VAE 把 k=4 帧压进 1 token)、galaxea-g0-5(ActionCodec 残差 VQ + 时序对比)、wall-oss-0-5(RVQ tokenizer 消融:VQA 75.7→77.5%、任务进度 29.3→48.1%)。
  • 通用/跨本体动作uniact 用共享码本 + 异构解码头 + Gumbel-Softmax(避免 STE 的码本坍缩),迁移新接口只需训 0.8% 参数;hpt-heterogeneous-pretrained-transformers 用共享 trunk + 各本体 stem/head(迁移冻结 trunk,可训参数低至 2%);crossformer-cross-embodied-learning 让 20 种具身共享一套权重。
  • 连续、不 tokenize:flow/扩散头一路(pi0internvla-a1cogact)直接连续回归,diffusion-vla 甚至发现 action chunking 会损害泛化而弃用。

表 5 · 动作 tokenize 方法对比

方法机制代表工作关键收益/数字
逐维离散 binning每维 256 bin CErt-1 rt-2 openvla表达多峰,解码慢
FASTDCT + BPE 压缩序列pi0-fast galaxea-g0 wall-oss训练最多 5× 提速、免训练
无监督 latent actionVQ-VAE 帧间隐动作lapa-latent-action-pretraining univla villa-xLAPA 预训练 1 epoch 即够
VQ / RVQ 动作残差矢量量化uh-1 galaxea-g0-5 wall-oss-0-5UH-1 k=4 帧/token
通用/跨本体动作共享码本 + 异构头uniact hpt-heterogeneous-pretrained-transformersUniAct 迁移仅 0.8% 参数
连续(不 tokenize)flow/扩散直接回归pi0 cogact diffusion-vla高容量下与离散持平

六、Web / 人类视频协同训练

数据稀缺是具身的根本约束,“把便宜的大数据(web 图文、人类视频)掺进机器人训练”因此成为横向主线。

6.1 协同训练配比是个可调超参

多篇工作把 co-training 比例做成消融变量,结论高度一致——co-training(联合训练)显著优于 pretrain-then-finetune

  • mobile-aloha:移动/静态数据 50/50 co-train 得 95%,而”先 pretrain 再 finetune”只有 40%(≈ 只用移动数据的 50%),因为微调会遗忘静态经验;co-train 用 35 条演示即超过不 co-train 用 50 条。
  • bridge-data-original:bridge/target 联合训练明显强于分阶段,按规模重采样到 70/30 或 90/10;bridgedata-v2 延续。
  • droid:in-domain 与 DROID 50/50 混,“简单 50/50 混就很好用”。
  • rt-h:预训练查询 50% / 演示 46% / 纠正数据 4%(纠正样本相对上采样 ~50×)。

6.2 人类第一视角视频

人类视频比机器人数据便宜几个数量级,但有”具身 gap”。ego4d/ego-exo4d 是预训练语料基石(Ego4D 域内预训练相对 Kinetics 显著降低动作预判误差)。落到策略:

表 6 · 协同训练配比与收益

工作混配对象比例核心结论
mobile-aloha移动 / 静态50/50co-train 95% ≫ pretrain-ft 40%
bridge-data-originalbridge / target70/30、90/10joint > pretrain+finetune
droidin-domain / DROID50/50简单 50/50 就好用
rt-2web / robot~1:1保住 web 知识、承接泛化
rt-h预训练/演示/纠正50/46/4纠正数据上采样 ~50×
egomimicrobot + human去人类数据掉 47%

七、Sim-to-real 训练技术

跨越仿真-真机 gap 的手段在腿足/灵巧手上尤其成体系:

  • 域随机化(DR):源头是 domain-randomization(纯监督 L2 回归 + 随机化纹理/光照即可零样本迁移,无 RL 无真机微调)。腿足普遍随机化摩擦/质量/质心/PD 增益/控制延迟(h2o-human2humanoidhub-extreme-balancewococo 的 DR 表基本同构)。omniretarget 反其道而行——只用 4 项 DR(对比前作一大堆),靠精确重定向 + 定向随机化。
  • actuator network:把 PD 误差→真实力矩的非理想关系单独训一个网络(sim-to-real-agile-locomotion-quadruped 的直流电机模型 + 力矩饱和分段线性、learning-quadrupedal-locomotion-challenging-terrain 的 SEA 建模、walk-these-ways)。
  • 延迟建模:普遍显式建 ~20ms action delay(walk-these-waysumi-on-legs 扫描 0–30ms 发现 20ms 最匹配);real-world-humanoid-locomotion-rl 用虚拟弹簧 + 交替子步建模闭链欠驱动。
  • 特权蒸馏 + 早停 + RSI:见 §3.2,普遍配 RSI(Reference State Initialization,exbody 消融显示去掉后策略”自杀”)与早停提升样本效率。
  • delta action / system idasap 训 delta action 模型闭环补 gap;simpler-env 反向做 real-to-sim——离线系统辨识(模拟退火调 PD 参数)+ Visual Matching(green-screen 合成)弥合控制/视觉 gap,让仿真评测与真机排序一致。

空白与趋势

把这三百篇横切完,几条趋势和空白很清楚:

  1. 生成头之争基本收敛,胜负手移到”如何喂梯度”。L1/扩散/flow 在大容量下几乎等价(openvla-oft),真正分胜负的是并行解码、动作分块、以及 discrete-CE 与 continuous-flow 如何联合(pi-knowledge-insulation 的 stop-gradient vs wall-oss-0-5 的 gradient-bridge 得出相反结论,尚无定论)。

  2. RL 正在回归 VLA,但方式变了。不再是从头 RL,而是”IL 预训练 → RL 微调扩散/流策略”(dppo-diffusion-policy-policy-optimizationreinflowpi-star-0-6)或”RL 训小模型/收数据再蒸馏回大模型”。offline RL + advantage-conditioning 与 flow-matching 的结合(RECAP、hume-vla 的 Cal-QL value head)是最前沿的缝合点。

  3. latent action / 世界模型正在成为”人类视频→机器人动作”的标准桥。从 lapa-latent-action-pretrainingunivla 的解耦码本、villa-x 的显式条件传递、dreamgen-groot-dreams 的合成轨迹,方向是把无标注视频的价值榨干;但 latent action 会不会编码任务无关的相机抖动(efficient-vla-models-survey 转述 Bu et al. 指出的问题)仍是隐患。

  4. 人形全身控制的训练已高度模板化(DeepMimic 跟踪奖励 + teacher-student + 自适应采样 + AMP + DR 五件套),但跟踪之外的接触密集 loco-manipulation 仍缺通用配方——falcon 的力矩可行性课程、resmimic 的虚拟物体力课程、twist 的训练期施力都是点状解法,尚未收敛成范式。

  5. 明显的空白:(a) 真机在线 RL 仍稀少且脆弱(多数”RL 后训练”仍在仿真或靠人在环);(b) 触觉/力反馈的训练目标基本还是把触觉当额外观测通道(vitamin-visuo-tactile-interfacecordvipmaniwav),缺乏原生的接触感知训练目标;(c) 超参披露普遍不全——大量 VLA(gemini-roboticsfigure-helixskild-braindyna-1)只给范式不给学习率/步数,复现门槛高;(d) 训练与部署的对齐(figure-helix 的 temporal offset、psi-0-humanoid-loco-manipulation 的训练时 Real-Time Chunking、deer-vla 的随机出口采样)刚起步,是把实验室成功率搬到真机实时约束下的关键缺口。