一句话定位

这一族回答的是模仿学习里最底层的一个问题:给定观测,怎样把”该做什么动作”这件事表示、生成、并稳定训练出来。从 2021 年 IBC 把行为克隆重写成能量模型,到 2023 年 Diffusion PolicyACT 分别用「动作块去噪」和「动作块 + CVAE」把多模态、高精度、复合误差三个老大难一次性压下去,再到 3D 表征(PerActRVTAct3DDP33D Diffuser Actor)、加速蒸馏(Consistency Policy/ManiCM/One-Step Flow)、RL 微调(DPPO/ReinFlow)、以及从无标签视频里学动作先验(ATM/General Flow/Moto),整族其实是围绕同一根主轴在做正交扩展。这根主轴可以概括成一句话:「预测一段动作 chunk 的条件生成分布」逐渐取代「回归单步动作」,成为操作策略的默认参数化;此后所有工作要么换生成器(扩散/流/一致性/VQ),要么换观测表征(2D/体素/点云/多视角渲染),要么换训练信号(BC/RL/视频预训练)

本页把这个大族按「动作表征演进 → 3D 表征分化 → 归纳偏置注入 → 加速与 RL 微调 → 从视频学动作 → 数据与预训练配方」六条支线梳理,给出谱系时间线、五张 head-to-head 对比表、贯穿全族的设计模式,以及走向判断。


为什么它们是一个”族”:共同的三个敌人

几乎所有成员的立意都能追溯到行为克隆(BC)的三个结构性缺陷,区别只在攻击哪一个、用什么武器:

  • 多模态(multimodality):同一观测下人类演示可左可右、可抓可推。用 MSE 回归会取模态平均,输出无效的中间动作(BeT Fig.2 里 MSE 干脆输出 0 动作)。
  • 复合误差(compounding error):单步误差沿时间累积,把机器人推出训练分布。这是 ACT 引入「动作分块」的直接动机——一次预测 k 步、把有效时域缩短 k 倍。
  • 高精度 / 接触密集:插销、系鞋带、1mm 插入这类任务差几毫米就不可恢复,纯回归策略学不动。

三个敌人催生了两条最根本的答案,也是全族的两块基石:

  1. 生成式动作分布——不学 o↦a 的确定映射,而学 p(a|o)IBC 用能量模型(EBM)、BeT/VQ-BeT 用离散 token + 残差、Diffusion Policy 用条件扩散、ACT 用 CVAE,都是在给同一个多模态分布找可训练的参数化。扩散最终胜出,因为它同时避开了 EBM 的归一化常数、GMM 的模式坍塌、离散化的精度损失。
  2. 动作分块 + 滚动时域(action chunk + receding horizon)——ACTDiffusion Policy 几乎同时把「预测未来 T_p 步、只执行前 T_a 步、再重规划」定为标准配方。这套东西此后成了 Pi0、OpenVLA 一代 VLA 动作头的标配。

理解了这两块基石,后面所有分化都是在它们之上做正交替换。


谱系与演化时间线

时间工作攻击的问题 / 一句话贡献范式坐标
2021-09IBC把 BC 从显式回归改写成能量模型 + 推理时 argmin,首次系统论证「策略的表示形式」本身是 BC 失败主因隐式/EBM
2022-06BeTk-means 把动作离散成「bin token + 残差」,让 minGPT 原生克隆多模态数据离散 token
2022-09PerAct场景与动作都体素化(100³),Perceiver 逐体素分类「下一个最佳体素动作」体素 3D 检测
2022BC-Z / Interactive Language用规模化模仿数据换任务级泛化(BC-Z 25.8k 演示;LAVA 60 万条语言轨迹)数据配方
2023-03Diffusion Policy「动作 chunk 去噪 + 滚动时域」——全族的算法基石,RSS 2023 最佳论文条件扩散
2023-04ALOHA动作分块 + CVAE + 时间集成 + <$20k 双臂遥操平台,50 条演示做精细双臂分块 + CVAE
2023-06RVT / Act3D各自绕开体素的立方级开销:RVT 重渲染多视角、Act3D 采样「幽灵点」做相对 3D 注意力渲染 / 幽灵点
2023-06RoboCat / Q-Transformer自我改进闭环 / 离线 TD 学习把 Transformer 策略推向 RL通才 / 离线 RL
2023-10ChainedDiffuser用学出来的轨迹扩散取代运动规划器连接 keypose分层 keypose+扩散
2023-12ATM / General Flow从无标签视频学「任意点未来轨迹」作为跨本体动作先验(ATM 2D、General Flow 3D)flow-from-video
2024-023D Diffuser Actor / AdaFlow3D tokenized 表征 + 动作扩散合并;rectified flow + 方差自适应求解器3D 扩散 / 流匹配
2024-03DP3 / HDP / VQ-BeT单视角稀疏点云 + 极简编码器塞进扩散;分层 + 可微运动学;残差 VQ 替 k-means点云扩散 / 分层 / VQ
2024-04~06RISE·RVT-2·SGRv2·BAKU·SAM-E·3D-MVP·Consistency Policy·ManiCM·SDP·Im2Flow2Act3D 精度/效率/局部性/预训练的一轮密集迭代 + 一致性蒸馏起步多支线并进
2024-07Equivariant DP / EquiBot把 SO(2)/SIM(3) 等变性写进扩散去噪网络换样本效率等变
2024-09~12DPPO·ALOHA Unleashed·MoDE·Sparse-DP·Genima扩散策略的 RL 微调 / 26k 数据纯规模 / MoE 提效 / 把动作画成图RL / 规模 / MoE
2025ReinFlow·CordViP·GraspVLA·Bimanual Flow·DYNA-1流策略 RL 微调 / 手-物接触 / 纯仿真抓取基座 / 24h 无人自主微调 / 专用化
2026One-Step Flow·R3D·SeedPolicy无教师单步自蒸馏 / 推翻「小编码器更好」 / 循环记忆反转「窗口越长越差」反思与再审视

一句话读这张表:2023 年 3-4 月是全族的分水岭——Diffusion Policy 与 ACT 把「chunk 化生成动作」这件事钉死之后,2023 下半年到 2025 年的绝大部分工作都是在往这套骨架上「换观测表征、换生成器、换训练信号、加归纳偏置」,2026 年则进入「反思前期经验结论」的阶段(R3D 推翻 DP3 的小编码器论断、SeedPolicy 反转 DP 的观测窗口论断、One-Step Flow 去掉一致性蒸馏对教师的依赖)。


支线一:动作表征的三次跃迁(IBC → 离散 token → 扩散/分块)

这是全族最核心的一条主轴,回答「怎么表示 p(a|o)」。

第一跳:显式 → 隐式。 IBC(CoRL 2021)把 â=F_θ(o) 改写成 â=argmin_a E_θ(o,a),用 InfoNCE 对比损失训条件 EBM。它的理论贡献(Thm 1/2:任意集值函数都存在 1-Lipschitz 连续 g 使 argmin 逼近它)第一次把 BC 的失败归因于策略表示形式而非算法,在 1mm 精密插入上比显式 MSE 高约 12×。代价是 EBM 训练不稳(要负采样估归一化常数 Z)——这个「不稳」直接催生了下一跳。

第二跳:连续 → 离散 token。 BeT(NeurIPS 2022)绕开 EBM,用 k-means 把动作聚成「bin 分类 + 逐 bin 残差偏移」两部分,套在 minGPT 上用 Focal loss + 掩码回归训练。它极轻(10⁴–10⁶ 参数、单桌面卡一小时训完),却在 Kitchen p4(0.44)、Block-push p2(0.71)上碾压 IBC。VQ-BeT(ICML 2024 Spotlight)把不可微、难扩展的 k-means 换成可学习的残差 VQ-VAE(primary code 粗聚类 + secondary code 细修 + 连续 offset),单次前向即出动作,比 Diffusion Policy 快 5×(仿真)/ 25×(真机板载 CPU)。BAKU(NeurIPS 2024)则把「感知编码器 / 观测 trunk / 动作头」解耦成三段可插拔模块系统消融,发现真机上 VQ-BeT 头反超 MLP 头 5%,是这条离散路线的集大成消融。

第三跳:生成式扩散 / 分块。 Diffusion Policy(RSS 2023)用条件 DDPM 对一整段动作 chunk 去噪,三个工程决策让它真机可用:① 动作序列 + 滚动时域(长时程一致 vs 响应性);② 视觉作条件而非联合分布(特征只提一次、不进去噪循环,可实时、可端到端训编码器);③ time-series diffusion transformer 缓解 CNN 过平滑。15 个任务平均 +46.9%。同期 ACT 走的是 CVAE 路线——动作分块 + 时间集成 + CVAE 建模人类演示噪声,消融显示 CVAE 在人类数据上把成功率从 2% 拉到 35.3%,chunk size 从 k=1 的 1% 拉到 k=100 的 44%。二者殊途同归地确立了「chunk 化」。到 ALOHA Unleashed(CoRL 2024)时,作者做了个决定性对照:同一 150M 架构把扩散损失换回 ACT 的 L1 回归,ShirtMessy 成功率从 70% 骤降到 25%——证明在大数据灵巧任务上,扩散损失是必要而非锦上添花

Table A — 动作表征 head-to-head

工作表征方式多模态处理规模 / 训练代表数字推理成本
IBC能量模型 EBM,推理时 argmin天然(可表任意可归一化分布)小 MLP/ConvMLP,TPUv3 3.4h真机 1mm 插入 83.3% vs MSE 6.7%Langevin/DFO 多步搜索,~7ms
BeTk-means bin token + 残差 offset离散类别分布10⁴–10⁶ 参数,RTX 3080 <1hKitchen p4 0.44、Block-push p2 0.712.8ms(比 IBC 快 ~20×)
VQ-BeT残差 VQ-VAE(N_q=2,码本 8–16)+ offset分层离散码 + 连续修正与 minGPT 同量级PushT 0.78、Kitchen 3.66单次前向,真机 CPU 快 DP 25×
BAKU可插拔头(MLP/GMM/BeT/VQ-BeT/Diffusion)视头而定~10M,RTX A4000 6–26hLIBERO-90 0.90、真机 0.9110Hz 闭环
ACTCVAE 编码「风格变量 z」+ chunk 回归CVAE 建模噪声/多模态80M,RTX 2080Ti 5h真机精细任务 80–96%0.01s(~100Hz 能力,50Hz 部署)
Diffusion Policy条件 DDPM 对动作 chunk 去噪扩散(score 采样)ResNet18 + UNet/T15 任务 +46.9%100→16 步 DDIM,RTX3080 0.1s
ALOHA UnleashedACT 骨架 + 扩散损失,50 步 chunk扩散217M,64×TPUv5e系鞋带 70%、挂衬衫 75%(26k 演示)RTX4090 0.043s,开环执行 1s

支线二:3D 表征的四条支线(体素 → 渲染 → 幽灵点 → 点云 → tokenized-3D)

2D 图像策略对相机位姿敏感、3D 推理弱(RLBench 上 <2%)。这条支线的共同信念是:把视觉 token 和机器人动作放进同一个 3D 空间交互,就不用网络隐式学 2D→3D 映射,跨视角泛化天然更强。四条子路线依次解决「精度—算力」的权衡:

  1. 体素路线PerAct(CoRL 2022)把场景与动作都体素化成 100³ 网格,Perceiver 用 2048 个 latent 压缩百万级体素、逐体素分类「下一个最佳关键帧动作」。开山之作,但体素随分辨率立方增长,8×V100 训 18 任务要 16 天、推理 4.9 fps。

  2. 渲染路线RVT(CoRL 2023)把点云重渲染成围绕机器人底座的 5 个虚拟正交视角图像,多视角 Transformer 逐视角出 heatmap 反投影 3D keypose——用「渲染解耦」绕开体素立方开销,同硬件训练 16 天→1 天、4.9→11.6 fps,RLBench-18 从 PerAct 的 49.4% 提到 62.9%。RVT-2(RSS 2024)加「由粗到细」两阶段(放大 4× 重渲染精修)+ 自研 CUDA point-renderer + 混合精度,把成功率推到 81.4%、20.6 fps,真机 10 条演示做毫米级插头。SAM-E 把 RVT 编码器换成 SAM ViT-B(LoRA)+ 动作头加时间维一次预测 5 步,70.6%;3D-MVP 把 RVT 拆成编码器 + 动作头,先在 Objaverse 20 万物体上做掩码视角重建预训练,67.5%。

  3. 幽灵点 / 连续特征场路线Act3D(CoRL 2023)完全放弃网格,在自由空间递归采样「幽灵点」、用 RoFormer 式相对 3D 注意力打分检测 keypose(相对编码消融单项贡献 42.7 点);推理可采 10000 点(训练仅 1000)换精度。ChainedDiffuser 在其上用轨迹扩散取代运动规划器连接 keypose,RLBench「规划器困难」10 任务从 21.0% 提到 80.9%。

  4. 点云 / tokenized-3D 扩散路线DP3(RSS 2024)把单视角稀疏点云 + 一个 64 维 MLP 编码器塞进 Diffusion Policy 的条件里,72 任务相对 2D DP +55.3%、10 条演示、安全违规 0%,且推理 12.7 fps(Simple DP3 25.3 fps)颠覆「3D 必慢」的成见;它开创的路线衍生出 iDP3(egocentric 上人形)、ManiCM、PointVLA 等一长串。3D Diffuser Actor(CoRL 2024)走另一条:把每个 patch 抬升成一个带 3D 坐标的 token(而非 DP3 的 1D 整体池化)、用相对注意力 RoPE 的 3D 去噪 Transformer 对整段 6-DoF 轨迹扩散,RLBench-18 多视角 81.3%、CALVIN 零样本 Avg.Len 3.35(超 GR-1)。RISE 用稀疏卷积(MinkowskiEngine)把点云压成 60–80 个 token 做连续动作扩散,证明单视角点云在视角/光照/桌高扰动下泛化远超 2D。SGRv2 引入动作局部性(逐点相对位置预测 + 可学权重聚合),RLBench 5-demo 从 SGR 23.6% 提到 53.2%。R3D(2026)则回头推翻 DP3 的「小 PointNet 更好」结论——证明那是 BatchNorm 在小批量下失效 + 缺 3D 增强共同造成的假象,换 LayerNorm + 高容量 Transformer 编码器(可 ScanNet 预训练)后强骨干反而更好,RoboTwin 2.0 Easy 83.8%。

Table B — 3D 策略 head-to-head(RLBench-18 多任务协议为主锚点)

工作3D 表征动作头RLBench-18 均值训练成本推理速度
PerAct100³ 体素 + Perceiver逐体素分类 keypose49.4%8×V100 × 16 天4.9 fps
Act3D幽灵点 + 相对 3D 注意力检测 keypose65.0%(256² 输入)8×V100 × 5 天
RVT5 虚拟正交视角渲染多视角 heatmap keypose62.9%8×V100 × 1 天11.6 fps
RVT-2渲染 + 粗到细放大 4× + CUDA rendererheatmap keypose(局部旋转)81.4%8×V100 × 0.83 天20.6 fps
SAM-ERVT 渲染 + SAM ViT-B(LoRA)时序动作序列(5 步)70.6%推理步 6158→1130
3D-MVPRVT 渲染 + Objaverse MAE 预训练RVT keypose67.5%8×V100(预训练+精调)
3D Diffuser Actor每 patch 抬升 3D token + RoPE 相对注意力整段 6-DoF 轨迹扩散81.3%未披露2080Ti 10Hz
ChainedDiffuserAct3D 检测 + 局部轨迹扩散keypose + 轨迹扩散80.9%(10 难任务子集)
DP3单视角稀疏点云 + 64 维 MLPDiffusion Policy 扩散自建 72 任务 +55.3% vs 2D DP单 A40 ~3h/任务12.7 fps(Simple 25.3)
RISE稀疏卷积 60–80 tokenDiffusion Policy 扩散真机 6 任务全面领先2×A100支持实时闭环
SGRv2语义-几何点云 + 动作局部性逐点相对位置 + 加权聚合5-demo 53.2%(26 任务)单 RTX3090 5–7h10/30 fps
R3DLayerNorm 高容量 Transformer(ScanNet 预训练)+ 密集 tokenDiT 交叉注意力扩散RoboTwin2.0 Easy 83.8%8×H20 预训练~30Hz 点云融合

口径提示:DP3 用自建 72 任务基准、RISE/R3D 用真机 + RoboTwin/ManiSkill,与 RLBench-18 不可直接横比;表内同列只在 PerAct/Act3D/RVT/RVT-2/SAM-E/3D-MVP/3D-Diffuser-Actor 之间严格可比。RVT-2 的 81.4% 与 3D Diffuser Actor 的 81.3% 是同协议下的两条并列 SOTA(前者 keypose 检测 + 渲染、后者轨迹扩散 + 点 token)。


支线三:把归纳偏置写进网络(等变 / 局部 / 层级 / 记忆 / MoE)

当 3D 表征把「空间」这个先验喂进去之后,一批工作转向把其它结构先验直接写进架构,用架构级保证换样本效率——这是与「堆数据」正交的一条省数据路线。

  • 等变(equivariance)Equivariant DP(CoRL 2024 Outstanding 入围)证明「专家策略 SO(2) 等变 ⟹ 去噪函数也等变」,用 escnn/C8 把 SE(3) 动作按不可约表示分解,MimicGen 100 demos 从 42.0% 提到 63.9%,200 条演示即追平基线 1000 条;消融显示等变结构比换体素输入贡献更大。EquiBot(CoRL 2024)把它推到 SIM(3)(平移+旋转+缩放全等变),15 条 / 5 分钟人类视频就训出可零样本泛化到未见物体尺度的移动双臂策略,真机 6/10–10/10 vs 基线 0/10。

  • 层级 + 运动学(hierarchy + kinematics)HDP(CVPR 2024)高层复用 PerAct 出 keypose、低层用 RK-Diffuser 同时扩散末端位姿与关节轨迹,再用可微运动学把精度从位姿空间蒸馏进关节空间取代 IK 求解器——把长轨迹的 IK 违例率从 24.55% 降到 0%,RLBench-11 从 71.27% 提到 80.18%。

  • 记忆(memory)SeedPolicy(2026)反转了 Diffusion Policy「观测窗口越长性能越差」的反直觉现象:用固定大小的循环隐状态 + 复用交叉注意力 logits 自身作门(不加额外参数)取代堆叠帧窗口,RoboTwin 50 任务 clean +36.8% / randomized +169%,且能外推到 5× 训练窗口的分钟级任务(640 帧 vs 训练 120 帧上限)。

  • MoE(提容量不提算力)MoDE(ICLR 2025)的核心巧思是路由只看噪声等级 σ_t、不看 token 内容——于是同一噪声等级下专家路径确定、可推理前预计算并融合专家 MLP,砍掉 >80% MoE FLOPs、提速 2×;CALVIN ABC→D 零样本 4.01、LIBERO-90 0.95。Sparse-DP(CoRL 2024)走相反思路——把 MoE 专家当「可复用技能」、按任务路由,持续学习新任务时激活参数恒定、任务迁移只微调 <0.5% 参数的路由器。

Table C — 归纳偏置注入 head-to-head

工作注入的先验实现方式代表数字
Equivariant DPSO(2)/C8 等变escnn 逐层等变去噪网络MimicGen 100demo 63.9% vs DP 42.0%;200demo≈基线1000demo
EquiBotSIM(3) 等变(含缩放)等变 PointNet++ + 等变 U-net真机移动双臂 6/10–10/10 vs 基线 0/10
HDP层级 + 运动学约束高层 keypose + 低层双扩散 + 可微 FK 蒸馏RLBench-11 80.18%;IK 违例 24.55%→0%
SeedPolicy时序记忆循环隐状态 + 复用注意力 logits 的门RoboTwin 50 任务 +36.8%/+169%;外推 640 帧
MoDE去噪阶段专精噪声条件路由(可缓存)+ 4 专家CALVIN ABC→D 4.01;LIBERO-90 0.95;-90% FLOPs
Sparse-DP技能可复用任务路由 MoE + 互信息正则持续学习激活参数恒定;迁移微调 <0.5% 参数

支线四:让扩散/流跑得起来(加速蒸馏 + 流匹配 + RL 微调)

Diffusion Policy 的代价是几十到上百步迭代去噪(T4 上约 1 秒/次),只能容忍准静态任务、且装不进算力受限平台。这条支线是全族最工程化的一支,四种互补路线:

  1. 一致性蒸馏(consistency distillation)Consistency Policy(RSS 2024)把 Diffusion Policy 从 DDPM 换成更适合蒸馏的 EDM 教师、再用 CTM 目标蒸出学生,1–3 步出动作,真机 8GB 笔记本 GPU 上 192ms→21ms(~9×),Square 3 步 0.96 反超 DDPM;关键发现是 dropout 对 CTM 的 s→0 步训练信号至关重要。ManiCM 把一致性蒸馏搬到 3D 点云的 DP3 上,10→1 步、178ms→17ms(~10×);核心工程判断是低维(~28)动作流形上必须预测动作样本而非噪声(78.5% vs 24.4%),与图像生成默认预测噪声相反。

  2. 流匹配 / 自蒸馏AdaFlow(NeurIPS 2024)用 rectified flow 取代去噪链,证明「确定性状态 ⟹ ODE 轨迹是直线 ⟹ 一步 Euler 可解」,训个方差估计头做逐状态自适应步长,1.12–1.56 NFE 达到 DP 20–100 NFE 的成功率,且不需要蒸馏阶段。One-Step Flow(2026)更进一步——无教师从零自蒸馏,把一致性蒸馏(trajectory-matching)与得分蒸馏(score-distillation)统一进一个目标 + 免训练 warm-start,56 任务单步 71.6% 超过 DP3 100 步 66.4%,17.58ms vs DP3 3225ms(183×),接到 π0.5 骨干上单步 94.7% 也超原版 10 步 91.5%。

  3. 免蒸馏的流式生成SDP(ICRA 2025)借「滚动噪声缓冲区」——缓冲区里每个未来动作携带递增噪声(第一个干净可执行),每步只对缓冲区做 N/h 步去噪、弹出干净动作、末尾补纯噪声,完全不需要蒸馏/教师却获得可比加速;真机 Push-T 0.85 反超 DP 0.50 / CP 0.40(因持久缓冲区减少了整段重规划带来的振荡失败)。

  4. RL 微调(把 IL 策略再优化)DPPO(2024)反证「PG 微调扩散策略低效」的成见:把去噪链当 MDP 嵌进环境 MDP(每步去噪有解析高斯似然),配合「value 只看环境状态、去噪折扣、只微调后几步」等设计,成为微调扩散策略的最强解法,首次把 Transport 从 state/pixel 都做到 >50%,sim-to-real One-leg 真机 80% vs 高斯策略 0%。ReinFlow(NeurIPS 2025)把这套搬到流匹配策略——在 ODE 路径上注入可学噪声把确定性 ODE 变成离散时间马尔可夫过程,任意步数(含 1 步)都有精确似然,比 DPPO 省 62.82% 墙钟(locomotion 省 82.63%),去噪步 10→4。

Table D — 加速 / 微调 head-to-head

工作技术路线是否需教师NFE / 步数延迟 / 加速成功率口径
Consistency PolicyCTM 一致性蒸馏(EDM 教师)需(但对教师质量鲁棒)1–3 步真机 192→21ms(~9×)Square 3步 0.96 反超 DDPM
ManiCM一致性蒸馏(DP3 教师,预测样本)1 步178→17ms(~10×)78.5% vs DP3 77.5%
AdaFlowrectified flow + 方差自适应求解1.12–1.56 NFEvs DP 20–100 NFEMaze/RoboMimic/LIBERO 持平或更优
One-Step Flow无教师自蒸馏(一致性+得分统一)+ warm-start1 步(可切 4 步)17.58ms vs DP3 3225ms(183×)3D 56 任务 71.6% vs DP3 66.4%
SDP滚动噪声缓冲区(逐 token 递增噪声)N/h 步随缓冲区块数下降真机 Push-T 0.85 vs DP 0.50
DPPO去噪即 MDP + PPO 微调—(RL 微调)微调后 5 步 DDIMon-policy 高并行Transport >50%;sim2real 80% vs 0%
ReinFlow注入噪声把流 ODE 变马尔可夫 + PPO—(RL 微调)4 步(vs DPPO 10)省 62.82% 墙钟操作平均净增 40.34%

支线五:从视频 / 流学动作,与「把动作画出来」

真机演示昂贵(RT-1 类 130k 轨迹采了 17 个月),而无标签视频便宜量大。这条支线的共同思路是找一个跨本体、可从视频监督的中间表征当动作先验,或干脆把动作生成变成图像生成。

  • flow-from-video(点轨迹作动作先验)ATM(RSS 2024)先在无动作视频上学「任意 2D 点的未来轨迹」(用 CoTracker 自监督标注),再用预测轨迹当稠密子目标训策略;轨迹解耦了运动与纹理光照、轻量可闭环(15ms/次 vs UniPi 8s),LIBERO 63% vs 37%。General Flow(RSS 2024)把它抬到 3D——从 HOI4D 人类 RGBD 视频学 3D flow(ScaleFlow-B 仅 5.6M,靠 Total Length Normalization 解决轨迹尺度差异),零训练零机器人数据即零样本人→机器人迁移 81%。Im2Flow2Act(CoRL 2024)用物体中心 flow(排除本体运动)当跨本体+跨仿真真实的统一接口,flow 生成网络只在人类视频训、flow-条件策略只在仿真 play data 训,全程无真机演示,真机 81%。Bimanual Flow(2025)则把双臂操作重述成 text-to-flow-to-video 两级视频预测再解动作。

  • latent motion token(潜运动 token)Moto 用 VQ-VAE 从无标签视频学离散「潜运动 token」(两帧间变化压成 8 个 token),98M GPT 自回归预训练 + 动作查询协同微调,SIMPLER 上以 98M 打平 RT-2-X(55B)/OpenVLA(7B),CALVIN 1% 标注数据微调即 52.5%。

  • video pretraining(视频生成预训练)GR-1 在 Ego4D 80 万视频片段上做未来帧预测,再微调到机器人同时输出未来图像 + 动作,CALVIN 零样本 53.3→85.4。Seer(ICLR 2025 Oral)把「预测未来视觉」和「逆动力学推动作」端到端揉进一次前向,CALVIN ABC-D Avg.Len 4.28。Vid2Robot 用第三人称演示视频直接当任务条件,让机器人「看一遍就会做」。

  • render-as-action(把动作画成图)Genima(CoRL 2024)微调 Stable Diffusion 在 RGB 上画出未来关节目标位置(彩色球),再用 ACT 控制器翻译成动作,RLBench 25 任务 49.6%、对场景扰动有「自动复原画风」的涌现鲁棒性。Render-and-Diffuse 把候选动作渲染成虚拟夹爪叠到观测上、让扩散在图像空间去噪,20 条演示 68.6%。RT-Trajectory 用一张 2D 末端轨迹草图指定任务、可从演示自动提取草图标签,新技能 67%(是 RT-1/RT-2 的 2.6×+);RT-Sketch 用手绘草图当介于语言与图像之间的目标条件。

Table E — 从视频 / 流学动作 head-to-head

工作中间表征数据源迁移能力代表数字
ATM任意 2D 点未来轨迹无动作视频 + CoTracker人类/跨本体视频→机器人LIBERO 63% vs 37%;15ms 闭环
General Flow3D 点轨迹(scale-aware)HOI4D 人类 RGBD 视频零训练零机器人数据迁移人→机器人 81%(ScaleFlow-B 5.6M)
Im2Flow2Act物体中心 flow人类视频 + 仿真 play data跨本体 + 跨仿真真实真机 81%,无真机演示
MotoVQ-VAE 潜运动 token无标签视频(含人类视频)视频先验→动作SIMPLER 打平 RT-2-X/OpenVLA;1% 数据 52.5%
GR-1未来帧生成预训练Ego4D 80 万片段视频预训练→操作CALVIN 零样本 53.3→85.4
Seer预测视觉 + 逆动力学DROID 等大规模机器人数据两阶段揉成一次前向CALVIN ABC-D Avg.Len 4.28
Genima关节目标画成图(SD 生成)RLBench 演示动作=图像RLBench 25 任务 49.6%
Render-and-Diffuse虚拟夹爪渲染叠加RLBench 演示观测-动作空间统一20 demo 68.6%
RT-Trajectory2D 末端轨迹草图自动提取 hindsight 标签草图指定新技能新技能 67%(2.6× RT-1)

支线六:数据、通才与预训练配方(较短)

不完全属于「动作表征」但同族并进的一批工作,回答「数据与预训练怎么配」:BC-Z(25.8k 演示 + 18.7k 人类视频,语言条件零样本 44%)与 Interactive Language(60 万条语言轨迹、单策略执行 87588 条指令)是「规模化模仿换任务级泛化」的早期配方;RoboCat 用自我改进闭环(专才自采数据并回训通才)把新任务成功率从 36% 提到 74%;Q-Transformer 把动作逐维离散化做离线 TD 学习,比 RT-1 高约 70%;HPT(NeurIPS 2024 Spotlight)给每个本体配小 stem tokenizer(固定 16 token)、共享 Transformer trunk,在 52 个异构数据集上首次系统展示策略预训练的 scaling;DemoStart 用 2–60 条次优演示 + 稀疏奖励做自动课程 RL 再蒸馏成视觉策略;SUDD 用 LLM 递归分解 + 采样规划器零人工生成数据再蒸馏进语言条件扩散策略;GraspVLA 纯仿真 10 亿帧合成动作数据预训练抓取基座;专用感知方向有 CordViP(手-物接触图预训练)、ManiWAV(指尖接触麦克风做声音感知)、ReKep(GPT-4o 自动写关键点约束、零训练闭环 10Hz);产品化极端则是 DYNA-1(奖励模型在环,双臂 VLA 折餐巾连续 24h 无人自主、99.4%)。


贯穿全族的设计模式

把 57 个成员横过来看,有几条模式反复出现,可当作这一族的「共识」:

  1. 动作 chunk + 滚动时域是默认底座。从 ACT/Diffusion Policy 起,几乎所有成员都预测一段动作、只执行前几步、再重规划。分歧只在 chunk 内是扩散、流、VQ 还是回归。

  2. 观测作条件、只提一次特征。Diffusion Policy 的关键工程决策——视觉特征不进去噪循环——被后续几乎所有扩散/流策略继承,是它们能实时的前提。

  3. 「换表征」比「换算法」常常更本质。多篇消融给出同一结论:DP3(3D vs 2D)、RISE(把稀疏 3D 编码器接到 ACT/DP 就大涨)、Equivariant DP(等变结构比换体素输入贡献更大)、SGRv2(只改动作局部性、基座不变就翻倍)——都在说「正确的归纳偏置 > 更大的模型/数据」。

  4. 相对表示带来平移/视角等变Act3D3D Diffuser Actor 的 RoPE 相对 3D 注意力、SGRv2 的相对位置预测、等变网络的不可约表示分解,本质都是把「场景平移/旋转不该改变动作的相对结构」写进网络。

  5. 小编码器/小模型反复被证明够用、又反复被质疑。DP3 的 64 维 MLP、BeT 的 10⁴ 参数、BAKU 的 10M、Moto 的 98M 都在「小即够」一侧;但 R3D 用 LayerNorm 修复训练后证明「小更好」是 BN 失效的假象、BAKU 发现 114M 在 LIBERO 上崩溃——容量甜点高度依赖数据规模与归一化选择,这是尚未收敛的活跃争论。

  6. 加速的三条路是正交的:蒸馏(CP/ManiCM)、改生成器(AdaFlow/One-Step Flow 流匹配)、改采样调度(SDP 滚动缓冲区)可叠加,且都能再叠 RL 微调(DPPO/ReinFlow)。


走向判断

  • 单步生成正在成为默认。从「100 步 DDPM」到「1 步」的压缩已基本完成(ManiCM/One-Step Flow),且 One-Step Flow 证明单步能超过 100 步基线、还能在 1 步与多步间自由切换——扩散策略「慢」这个原罪基本被解决,后续会默认单/少步。

  • 专用策略正被 VLA 吸收,但作动作头留下来。动作 chunk 化、扩散/流动作头、3D 点 token 这些本族成果,正被 Pi0/π0.5/OpenVLA/RDT 一代 VLA 当组件复用(One-Step Flow 接 π0.5、ReinFlow 后续微调 π0/π0.5/GR00T、SeedVLA 把记忆模块塞进 MemoryVLA)。本族的未来更可能是「作 VLA 的动作专家 + 提效模块」而非独立系统。

  • 3D 表征回到「怎么用大编码器/大预训练」R3D 打开了「把 ScanNet/Point-SAM 级 3D 分割预训练迁进策略」的口子、3D-MVP 打开了「3D 掩码视角预训练」的口子——3D 策略的下一步是从「手搓小编码器」转向「复用 3D 基础模型」。

  • 从视频学动作是解数据瓶颈的最有希望方向,但仍卡在两点:2D flow 无法消歧 3D 动作(Im2Flow2Act 倒水失败)、以及仍需少量目标域带动作演示。潜运动 token(Moto)和 3D flow(General Flow)是两条最有前景的接口。

  • 记忆与长时程是新前沿。SeedPolicy 刚把「循环记忆能反转窗口越长越差」这件事立起来,分钟级任务的长时程建模(而非 chunk 内的短时程)会是下一波焦点。


一手源与页面

本页为横向综合,全部事实取自本 vault 内各成员的一手考据页(每页已通读官方论文 / 技术报告 / 博客 / GitHub / 项目页并抠具体数字),未引入页面外信息。逐一手链接与逐工作的 infra / 数据 / 训练 / benchmark 六维细节见各成员自己的考据页(即本页各处的 wikilink 目标)。若数字在横表与某工作页正文冲突,以该工作页正文(及其标注的原文口径)为准。