一句话定位
这一族回答的是模仿学习里最底层的一个问题:给定观测,怎样把”该做什么动作”这件事表示、生成、并稳定训练出来。从 2021 年 IBC 把行为克隆重写成能量模型,到 2023 年 Diffusion Policy 与 ACT 分别用「动作块去噪」和「动作块 + CVAE」把多模态、高精度、复合误差三个老大难一次性压下去,再到 3D 表征(PerAct → RVT → Act3D → DP3 → 3D Diffuser Actor)、加速蒸馏(Consistency Policy/ManiCM/One-Step Flow)、RL 微调(DPPO/ReinFlow)、以及从无标签视频里学动作先验(ATM/General Flow/Moto),整族其实是围绕同一根主轴在做正交扩展。这根主轴可以概括成一句话:「预测一段动作 chunk 的条件生成分布」逐渐取代「回归单步动作」,成为操作策略的默认参数化;此后所有工作要么换生成器(扩散/流/一致性/VQ),要么换观测表征(2D/体素/点云/多视角渲染),要么换训练信号(BC/RL/视频预训练)。
本页把这个大族按「动作表征演进 → 3D 表征分化 → 归纳偏置注入 → 加速与 RL 微调 → 从视频学动作 → 数据与预训练配方」六条支线梳理,给出谱系时间线、五张 head-to-head 对比表、贯穿全族的设计模式,以及走向判断。
为什么它们是一个”族”:共同的三个敌人
几乎所有成员的立意都能追溯到行为克隆(BC)的三个结构性缺陷,区别只在攻击哪一个、用什么武器:
- 多模态(multimodality):同一观测下人类演示可左可右、可抓可推。用 MSE 回归会取模态平均,输出无效的中间动作(BeT Fig.2 里 MSE 干脆输出 0 动作)。
- 复合误差(compounding error):单步误差沿时间累积,把机器人推出训练分布。这是 ACT 引入「动作分块」的直接动机——一次预测 k 步、把有效时域缩短 k 倍。
- 高精度 / 接触密集:插销、系鞋带、1mm 插入这类任务差几毫米就不可恢复,纯回归策略学不动。
三个敌人催生了两条最根本的答案,也是全族的两块基石:
- 生成式动作分布——不学
o↦a的确定映射,而学p(a|o)。IBC 用能量模型(EBM)、BeT/VQ-BeT 用离散 token + 残差、Diffusion Policy 用条件扩散、ACT 用 CVAE,都是在给同一个多模态分布找可训练的参数化。扩散最终胜出,因为它同时避开了 EBM 的归一化常数、GMM 的模式坍塌、离散化的精度损失。 - 动作分块 + 滚动时域(action chunk + receding horizon)——ACT 与 Diffusion Policy 几乎同时把「预测未来 T_p 步、只执行前 T_a 步、再重规划」定为标准配方。这套东西此后成了 Pi0、OpenVLA 一代 VLA 动作头的标配。
理解了这两块基石,后面所有分化都是在它们之上做正交替换。
谱系与演化时间线
| 时间 | 工作 | 攻击的问题 / 一句话贡献 | 范式坐标 |
|---|---|---|---|
| 2021-09 | IBC | 把 BC 从显式回归改写成能量模型 + 推理时 argmin,首次系统论证「策略的表示形式」本身是 BC 失败主因 | 隐式/EBM |
| 2022-06 | BeT | k-means 把动作离散成「bin token + 残差」,让 minGPT 原生克隆多模态数据 | 离散 token |
| 2022-09 | PerAct | 场景与动作都体素化(100³),Perceiver 逐体素分类「下一个最佳体素动作」 | 体素 3D 检测 |
| 2022 | BC-Z / Interactive Language | 用规模化模仿数据换任务级泛化(BC-Z 25.8k 演示;LAVA 60 万条语言轨迹) | 数据配方 |
| 2023-03 | Diffusion Policy | 「动作 chunk 去噪 + 滚动时域」——全族的算法基石,RSS 2023 最佳论文 | 条件扩散 |
| 2023-04 | ALOHA | 动作分块 + CVAE + 时间集成 + <$20k 双臂遥操平台,50 条演示做精细双臂 | 分块 + CVAE |
| 2023-06 | RVT / Act3D | 各自绕开体素的立方级开销:RVT 重渲染多视角、Act3D 采样「幽灵点」做相对 3D 注意力 | 渲染 / 幽灵点 |
| 2023-06 | RoboCat / Q-Transformer | 自我改进闭环 / 离线 TD 学习把 Transformer 策略推向 RL | 通才 / 离线 RL |
| 2023-10 | ChainedDiffuser | 用学出来的轨迹扩散取代运动规划器连接 keypose | 分层 keypose+扩散 |
| 2023-12 | ATM / General Flow | 从无标签视频学「任意点未来轨迹」作为跨本体动作先验(ATM 2D、General Flow 3D) | flow-from-video |
| 2024-02 | 3D Diffuser Actor / AdaFlow | 3D tokenized 表征 + 动作扩散合并;rectified flow + 方差自适应求解器 | 3D 扩散 / 流匹配 |
| 2024-03 | DP3 / HDP / VQ-BeT | 单视角稀疏点云 + 极简编码器塞进扩散;分层 + 可微运动学;残差 VQ 替 k-means | 点云扩散 / 分层 / VQ |
| 2024-04~06 | RISE·RVT-2·SGRv2·BAKU·SAM-E·3D-MVP·Consistency Policy·ManiCM·SDP·Im2Flow2Act | 3D 精度/效率/局部性/预训练的一轮密集迭代 + 一致性蒸馏起步 | 多支线并进 |
| 2024-07 | Equivariant DP / EquiBot | 把 SO(2)/SIM(3) 等变性写进扩散去噪网络换样本效率 | 等变 |
| 2024-09~12 | DPPO·ALOHA Unleashed·MoDE·Sparse-DP·Genima | 扩散策略的 RL 微调 / 26k 数据纯规模 / MoE 提效 / 把动作画成图 | RL / 规模 / MoE |
| 2025 | ReinFlow·CordViP·GraspVLA·Bimanual Flow·DYNA-1 | 流策略 RL 微调 / 手-物接触 / 纯仿真抓取基座 / 24h 无人自主 | 微调 / 专用化 |
| 2026 | One-Step Flow·R3D·SeedPolicy | 无教师单步自蒸馏 / 推翻「小编码器更好」 / 循环记忆反转「窗口越长越差」 | 反思与再审视 |
一句话读这张表:2023 年 3-4 月是全族的分水岭——Diffusion Policy 与 ACT 把「chunk 化生成动作」这件事钉死之后,2023 下半年到 2025 年的绝大部分工作都是在往这套骨架上「换观测表征、换生成器、换训练信号、加归纳偏置」,2026 年则进入「反思前期经验结论」的阶段(R3D 推翻 DP3 的小编码器论断、SeedPolicy 反转 DP 的观测窗口论断、One-Step Flow 去掉一致性蒸馏对教师的依赖)。
支线一:动作表征的三次跃迁(IBC → 离散 token → 扩散/分块)
这是全族最核心的一条主轴,回答「怎么表示 p(a|o)」。
第一跳:显式 → 隐式。 IBC(CoRL 2021)把 â=F_θ(o) 改写成 â=argmin_a E_θ(o,a),用 InfoNCE 对比损失训条件 EBM。它的理论贡献(Thm 1/2:任意集值函数都存在 1-Lipschitz 连续 g 使 argmin 逼近它)第一次把 BC 的失败归因于策略表示形式而非算法,在 1mm 精密插入上比显式 MSE 高约 12×。代价是 EBM 训练不稳(要负采样估归一化常数 Z)——这个「不稳」直接催生了下一跳。
第二跳:连续 → 离散 token。 BeT(NeurIPS 2022)绕开 EBM,用 k-means 把动作聚成「bin 分类 + 逐 bin 残差偏移」两部分,套在 minGPT 上用 Focal loss + 掩码回归训练。它极轻(10⁴–10⁶ 参数、单桌面卡一小时训完),却在 Kitchen p4(0.44)、Block-push p2(0.71)上碾压 IBC。VQ-BeT(ICML 2024 Spotlight)把不可微、难扩展的 k-means 换成可学习的残差 VQ-VAE(primary code 粗聚类 + secondary code 细修 + 连续 offset),单次前向即出动作,比 Diffusion Policy 快 5×(仿真)/ 25×(真机板载 CPU)。BAKU(NeurIPS 2024)则把「感知编码器 / 观测 trunk / 动作头」解耦成三段可插拔模块系统消融,发现真机上 VQ-BeT 头反超 MLP 头 5%,是这条离散路线的集大成消融。
第三跳:生成式扩散 / 分块。 Diffusion Policy(RSS 2023)用条件 DDPM 对一整段动作 chunk 去噪,三个工程决策让它真机可用:① 动作序列 + 滚动时域(长时程一致 vs 响应性);② 视觉作条件而非联合分布(特征只提一次、不进去噪循环,可实时、可端到端训编码器);③ time-series diffusion transformer 缓解 CNN 过平滑。15 个任务平均 +46.9%。同期 ACT 走的是 CVAE 路线——动作分块 + 时间集成 + CVAE 建模人类演示噪声,消融显示 CVAE 在人类数据上把成功率从 2% 拉到 35.3%,chunk size 从 k=1 的 1% 拉到 k=100 的 44%。二者殊途同归地确立了「chunk 化」。到 ALOHA Unleashed(CoRL 2024)时,作者做了个决定性对照:同一 150M 架构把扩散损失换回 ACT 的 L1 回归,ShirtMessy 成功率从 70% 骤降到 25%——证明在大数据灵巧任务上,扩散损失是必要而非锦上添花。
Table A — 动作表征 head-to-head
| 工作 | 表征方式 | 多模态处理 | 规模 / 训练 | 代表数字 | 推理成本 |
|---|---|---|---|---|---|
| IBC | 能量模型 EBM,推理时 argmin | 天然(可表任意可归一化分布) | 小 MLP/ConvMLP,TPUv3 3.4h | 真机 1mm 插入 83.3% vs MSE 6.7% | Langevin/DFO 多步搜索,~7ms |
| BeT | k-means bin token + 残差 offset | 离散类别分布 | 10⁴–10⁶ 参数,RTX 3080 <1h | Kitchen p4 0.44、Block-push p2 0.71 | 2.8ms(比 IBC 快 ~20×) |
| VQ-BeT | 残差 VQ-VAE(N_q=2,码本 8–16)+ offset | 分层离散码 + 连续修正 | 与 minGPT 同量级 | PushT 0.78、Kitchen 3.66 | 单次前向,真机 CPU 快 DP 25× |
| BAKU | 可插拔头(MLP/GMM/BeT/VQ-BeT/Diffusion) | 视头而定 | ~10M,RTX A4000 6–26h | LIBERO-90 0.90、真机 0.91 | 10Hz 闭环 |
| ACT | CVAE 编码「风格变量 z」+ chunk 回归 | CVAE 建模噪声/多模态 | 80M,RTX 2080Ti 5h | 真机精细任务 80–96% | 0.01s(~100Hz 能力,50Hz 部署) |
| Diffusion Policy | 条件 DDPM 对动作 chunk 去噪 | 扩散(score 采样) | ResNet18 + UNet/T | 15 任务 +46.9% | 100→16 步 DDIM,RTX3080 0.1s |
| ALOHA Unleashed | ACT 骨架 + 扩散损失,50 步 chunk | 扩散 | 217M,64×TPUv5e | 系鞋带 70%、挂衬衫 75%(26k 演示) | RTX4090 0.043s,开环执行 1s |
支线二:3D 表征的四条支线(体素 → 渲染 → 幽灵点 → 点云 → tokenized-3D)
2D 图像策略对相机位姿敏感、3D 推理弱(RLBench 上 <2%)。这条支线的共同信念是:把视觉 token 和机器人动作放进同一个 3D 空间交互,就不用网络隐式学 2D→3D 映射,跨视角泛化天然更强。四条子路线依次解决「精度—算力」的权衡:
-
体素路线。PerAct(CoRL 2022)把场景与动作都体素化成 100³ 网格,Perceiver 用 2048 个 latent 压缩百万级体素、逐体素分类「下一个最佳关键帧动作」。开山之作,但体素随分辨率立方增长,8×V100 训 18 任务要 16 天、推理 4.9 fps。
-
渲染路线。RVT(CoRL 2023)把点云重渲染成围绕机器人底座的 5 个虚拟正交视角图像,多视角 Transformer 逐视角出 heatmap 反投影 3D keypose——用「渲染解耦」绕开体素立方开销,同硬件训练 16 天→1 天、4.9→11.6 fps,RLBench-18 从 PerAct 的 49.4% 提到 62.9%。RVT-2(RSS 2024)加「由粗到细」两阶段(放大 4× 重渲染精修)+ 自研 CUDA point-renderer + 混合精度,把成功率推到 81.4%、20.6 fps,真机 10 条演示做毫米级插头。SAM-E 把 RVT 编码器换成 SAM ViT-B(LoRA)+ 动作头加时间维一次预测 5 步,70.6%;3D-MVP 把 RVT 拆成编码器 + 动作头,先在 Objaverse 20 万物体上做掩码视角重建预训练,67.5%。
-
幽灵点 / 连续特征场路线。Act3D(CoRL 2023)完全放弃网格,在自由空间递归采样「幽灵点」、用 RoFormer 式相对 3D 注意力打分检测 keypose(相对编码消融单项贡献 42.7 点);推理可采 10000 点(训练仅 1000)换精度。ChainedDiffuser 在其上用轨迹扩散取代运动规划器连接 keypose,RLBench「规划器困难」10 任务从 21.0% 提到 80.9%。
-
点云 / tokenized-3D 扩散路线。DP3(RSS 2024)把单视角稀疏点云 + 一个 64 维 MLP 编码器塞进 Diffusion Policy 的条件里,72 任务相对 2D DP +55.3%、10 条演示、安全违规 0%,且推理 12.7 fps(Simple DP3 25.3 fps)颠覆「3D 必慢」的成见;它开创的路线衍生出 iDP3(egocentric 上人形)、ManiCM、PointVLA 等一长串。3D Diffuser Actor(CoRL 2024)走另一条:把每个 patch 抬升成一个带 3D 坐标的 token(而非 DP3 的 1D 整体池化)、用相对注意力 RoPE 的 3D 去噪 Transformer 对整段 6-DoF 轨迹扩散,RLBench-18 多视角 81.3%、CALVIN 零样本 Avg.Len 3.35(超 GR-1)。RISE 用稀疏卷积(MinkowskiEngine)把点云压成 60–80 个 token 做连续动作扩散,证明单视角点云在视角/光照/桌高扰动下泛化远超 2D。SGRv2 引入动作局部性(逐点相对位置预测 + 可学权重聚合),RLBench 5-demo 从 SGR 23.6% 提到 53.2%。R3D(2026)则回头推翻 DP3 的「小 PointNet 更好」结论——证明那是 BatchNorm 在小批量下失效 + 缺 3D 增强共同造成的假象,换 LayerNorm + 高容量 Transformer 编码器(可 ScanNet 预训练)后强骨干反而更好,RoboTwin 2.0 Easy 83.8%。
Table B — 3D 策略 head-to-head(RLBench-18 多任务协议为主锚点)
| 工作 | 3D 表征 | 动作头 | RLBench-18 均值 | 训练成本 | 推理速度 |
|---|---|---|---|---|---|
| PerAct | 100³ 体素 + Perceiver | 逐体素分类 keypose | 49.4% | 8×V100 × 16 天 | 4.9 fps |
| Act3D | 幽灵点 + 相对 3D 注意力 | 检测 keypose | 65.0%(256² 输入) | 8×V100 × 5 天 | — |
| RVT | 5 虚拟正交视角渲染 | 多视角 heatmap keypose | 62.9% | 8×V100 × 1 天 | 11.6 fps |
| RVT-2 | 渲染 + 粗到细放大 4× + CUDA renderer | heatmap keypose(局部旋转) | 81.4% | 8×V100 × 0.83 天 | 20.6 fps |
| SAM-E | RVT 渲染 + SAM ViT-B(LoRA) | 时序动作序列(5 步) | 70.6% | — | 推理步 6158→1130 |
| 3D-MVP | RVT 渲染 + Objaverse MAE 预训练 | RVT keypose | 67.5% | 8×V100(预训练+精调) | — |
| 3D Diffuser Actor | 每 patch 抬升 3D token + RoPE 相对注意力 | 整段 6-DoF 轨迹扩散 | 81.3% | 未披露 | 2080Ti 10Hz |
| ChainedDiffuser | Act3D 检测 + 局部轨迹扩散 | keypose + 轨迹扩散 | 80.9%(10 难任务子集) | — | — |
| DP3 | 单视角稀疏点云 + 64 维 MLP | Diffusion Policy 扩散 | 自建 72 任务 +55.3% vs 2D DP | 单 A40 ~3h/任务 | 12.7 fps(Simple 25.3) |
| RISE | 稀疏卷积 60–80 token | Diffusion Policy 扩散 | 真机 6 任务全面领先 | 2×A100 | 支持实时闭环 |
| SGRv2 | 语义-几何点云 + 动作局部性 | 逐点相对位置 + 加权聚合 | 5-demo 53.2%(26 任务) | 单 RTX3090 5–7h | 10/30 fps |
| R3D | LayerNorm 高容量 Transformer(ScanNet 预训练)+ 密集 token | DiT 交叉注意力扩散 | RoboTwin2.0 Easy 83.8% | 8×H20 预训练 | ~30Hz 点云融合 |
口径提示:DP3 用自建 72 任务基准、RISE/R3D 用真机 + RoboTwin/ManiSkill,与 RLBench-18 不可直接横比;表内同列只在 PerAct/Act3D/RVT/RVT-2/SAM-E/3D-MVP/3D-Diffuser-Actor 之间严格可比。RVT-2 的 81.4% 与 3D Diffuser Actor 的 81.3% 是同协议下的两条并列 SOTA(前者 keypose 检测 + 渲染、后者轨迹扩散 + 点 token)。
支线三:把归纳偏置写进网络(等变 / 局部 / 层级 / 记忆 / MoE)
当 3D 表征把「空间」这个先验喂进去之后,一批工作转向把其它结构先验直接写进架构,用架构级保证换样本效率——这是与「堆数据」正交的一条省数据路线。
-
等变(equivariance)。Equivariant DP(CoRL 2024 Outstanding 入围)证明「专家策略 SO(2) 等变 ⟹ 去噪函数也等变」,用 escnn/C8 把 SE(3) 动作按不可约表示分解,MimicGen 100 demos 从 42.0% 提到 63.9%,200 条演示即追平基线 1000 条;消融显示等变结构比换体素输入贡献更大。EquiBot(CoRL 2024)把它推到 SIM(3)(平移+旋转+缩放全等变),15 条 / 5 分钟人类视频就训出可零样本泛化到未见物体尺度的移动双臂策略,真机 6/10–10/10 vs 基线 0/10。
-
层级 + 运动学(hierarchy + kinematics)。HDP(CVPR 2024)高层复用 PerAct 出 keypose、低层用 RK-Diffuser 同时扩散末端位姿与关节轨迹,再用可微运动学把精度从位姿空间蒸馏进关节空间取代 IK 求解器——把长轨迹的 IK 违例率从 24.55% 降到 0%,RLBench-11 从 71.27% 提到 80.18%。
-
记忆(memory)。SeedPolicy(2026)反转了 Diffusion Policy「观测窗口越长性能越差」的反直觉现象:用固定大小的循环隐状态 + 复用交叉注意力 logits 自身作门(不加额外参数)取代堆叠帧窗口,RoboTwin 50 任务 clean +36.8% / randomized +169%,且能外推到 5× 训练窗口的分钟级任务(640 帧 vs 训练 120 帧上限)。
-
MoE(提容量不提算力)。MoDE(ICLR 2025)的核心巧思是路由只看噪声等级 σ_t、不看 token 内容——于是同一噪声等级下专家路径确定、可推理前预计算并融合专家 MLP,砍掉 >80% MoE FLOPs、提速 2×;CALVIN ABC→D 零样本 4.01、LIBERO-90 0.95。Sparse-DP(CoRL 2024)走相反思路——把 MoE 专家当「可复用技能」、按任务路由,持续学习新任务时激活参数恒定、任务迁移只微调 <0.5% 参数的路由器。
Table C — 归纳偏置注入 head-to-head
| 工作 | 注入的先验 | 实现方式 | 代表数字 |
|---|---|---|---|
| Equivariant DP | SO(2)/C8 等变 | escnn 逐层等变去噪网络 | MimicGen 100demo 63.9% vs DP 42.0%;200demo≈基线1000demo |
| EquiBot | SIM(3) 等变(含缩放) | 等变 PointNet++ + 等变 U-net | 真机移动双臂 6/10–10/10 vs 基线 0/10 |
| HDP | 层级 + 运动学约束 | 高层 keypose + 低层双扩散 + 可微 FK 蒸馏 | RLBench-11 80.18%;IK 违例 24.55%→0% |
| SeedPolicy | 时序记忆 | 循环隐状态 + 复用注意力 logits 的门 | RoboTwin 50 任务 +36.8%/+169%;外推 640 帧 |
| MoDE | 去噪阶段专精 | 噪声条件路由(可缓存)+ 4 专家 | CALVIN ABC→D 4.01;LIBERO-90 0.95;-90% FLOPs |
| Sparse-DP | 技能可复用 | 任务路由 MoE + 互信息正则 | 持续学习激活参数恒定;迁移微调 <0.5% 参数 |
支线四:让扩散/流跑得起来(加速蒸馏 + 流匹配 + RL 微调)
Diffusion Policy 的代价是几十到上百步迭代去噪(T4 上约 1 秒/次),只能容忍准静态任务、且装不进算力受限平台。这条支线是全族最工程化的一支,四种互补路线:
-
一致性蒸馏(consistency distillation)。Consistency Policy(RSS 2024)把 Diffusion Policy 从 DDPM 换成更适合蒸馏的 EDM 教师、再用 CTM 目标蒸出学生,1–3 步出动作,真机 8GB 笔记本 GPU 上 192ms→21ms(~9×),Square 3 步 0.96 反超 DDPM;关键发现是 dropout 对 CTM 的 s→0 步训练信号至关重要。ManiCM 把一致性蒸馏搬到 3D 点云的 DP3 上,10→1 步、178ms→17ms(~10×);核心工程判断是低维(~28)动作流形上必须预测动作样本而非噪声(78.5% vs 24.4%),与图像生成默认预测噪声相反。
-
流匹配 / 自蒸馏。AdaFlow(NeurIPS 2024)用 rectified flow 取代去噪链,证明「确定性状态 ⟹ ODE 轨迹是直线 ⟹ 一步 Euler 可解」,训个方差估计头做逐状态自适应步长,1.12–1.56 NFE 达到 DP 20–100 NFE 的成功率,且不需要蒸馏阶段。One-Step Flow(2026)更进一步——无教师从零自蒸馏,把一致性蒸馏(trajectory-matching)与得分蒸馏(score-distillation)统一进一个目标 + 免训练 warm-start,56 任务单步 71.6% 超过 DP3 100 步 66.4%,17.58ms vs DP3 3225ms(183×),接到 π0.5 骨干上单步 94.7% 也超原版 10 步 91.5%。
-
免蒸馏的流式生成。SDP(ICRA 2025)借「滚动噪声缓冲区」——缓冲区里每个未来动作携带递增噪声(第一个干净可执行),每步只对缓冲区做 N/h 步去噪、弹出干净动作、末尾补纯噪声,完全不需要蒸馏/教师却获得可比加速;真机 Push-T 0.85 反超 DP 0.50 / CP 0.40(因持久缓冲区减少了整段重规划带来的振荡失败)。
-
RL 微调(把 IL 策略再优化)。DPPO(2024)反证「PG 微调扩散策略低效」的成见:把去噪链当 MDP 嵌进环境 MDP(每步去噪有解析高斯似然),配合「value 只看环境状态、去噪折扣、只微调后几步」等设计,成为微调扩散策略的最强解法,首次把 Transport 从 state/pixel 都做到 >50%,sim-to-real One-leg 真机 80% vs 高斯策略 0%。ReinFlow(NeurIPS 2025)把这套搬到流匹配策略——在 ODE 路径上注入可学噪声把确定性 ODE 变成离散时间马尔可夫过程,任意步数(含 1 步)都有精确似然,比 DPPO 省 62.82% 墙钟(locomotion 省 82.63%),去噪步 10→4。
Table D — 加速 / 微调 head-to-head
| 工作 | 技术路线 | 是否需教师 | NFE / 步数 | 延迟 / 加速 | 成功率口径 |
|---|---|---|---|---|---|
| Consistency Policy | CTM 一致性蒸馏(EDM 教师) | 需(但对教师质量鲁棒) | 1–3 步 | 真机 192→21ms(~9×) | Square 3步 0.96 反超 DDPM |
| ManiCM | 一致性蒸馏(DP3 教师,预测样本) | 需 | 1 步 | 178→17ms(~10×) | 78.5% vs DP3 77.5% |
| AdaFlow | rectified flow + 方差自适应求解 | 否 | 1.12–1.56 NFE | vs DP 20–100 NFE | Maze/RoboMimic/LIBERO 持平或更优 |
| One-Step Flow | 无教师自蒸馏(一致性+得分统一)+ warm-start | 否 | 1 步(可切 4 步) | 17.58ms vs DP3 3225ms(183×) | 3D 56 任务 71.6% vs DP3 66.4% |
| SDP | 滚动噪声缓冲区(逐 token 递增噪声) | 否 | N/h 步 | 随缓冲区块数下降 | 真机 Push-T 0.85 vs DP 0.50 |
| DPPO | 去噪即 MDP + PPO 微调 | —(RL 微调) | 微调后 5 步 DDIM | on-policy 高并行 | Transport >50%;sim2real 80% vs 0% |
| ReinFlow | 注入噪声把流 ODE 变马尔可夫 + PPO | —(RL 微调) | 4 步(vs DPPO 10) | 省 62.82% 墙钟 | 操作平均净增 40.34% |
支线五:从视频 / 流学动作,与「把动作画出来」
真机演示昂贵(RT-1 类 130k 轨迹采了 17 个月),而无标签视频便宜量大。这条支线的共同思路是找一个跨本体、可从视频监督的中间表征当动作先验,或干脆把动作生成变成图像生成。
-
flow-from-video(点轨迹作动作先验)。ATM(RSS 2024)先在无动作视频上学「任意 2D 点的未来轨迹」(用 CoTracker 自监督标注),再用预测轨迹当稠密子目标训策略;轨迹解耦了运动与纹理光照、轻量可闭环(15ms/次 vs UniPi 8s),LIBERO 63% vs 37%。General Flow(RSS 2024)把它抬到 3D——从 HOI4D 人类 RGBD 视频学 3D flow(ScaleFlow-B 仅 5.6M,靠 Total Length Normalization 解决轨迹尺度差异),零训练零机器人数据即零样本人→机器人迁移 81%。Im2Flow2Act(CoRL 2024)用物体中心 flow(排除本体运动)当跨本体+跨仿真真实的统一接口,flow 生成网络只在人类视频训、flow-条件策略只在仿真 play data 训,全程无真机演示,真机 81%。Bimanual Flow(2025)则把双臂操作重述成 text-to-flow-to-video 两级视频预测再解动作。
-
latent motion token(潜运动 token)。Moto 用 VQ-VAE 从无标签视频学离散「潜运动 token」(两帧间变化压成 8 个 token),98M GPT 自回归预训练 + 动作查询协同微调,SIMPLER 上以 98M 打平 RT-2-X(55B)/OpenVLA(7B),CALVIN 1% 标注数据微调即 52.5%。
-
video pretraining(视频生成预训练)。GR-1 在 Ego4D 80 万视频片段上做未来帧预测,再微调到机器人同时输出未来图像 + 动作,CALVIN 零样本 53.3→85.4。Seer(ICLR 2025 Oral)把「预测未来视觉」和「逆动力学推动作」端到端揉进一次前向,CALVIN ABC-D Avg.Len 4.28。Vid2Robot 用第三人称演示视频直接当任务条件,让机器人「看一遍就会做」。
-
render-as-action(把动作画成图)。Genima(CoRL 2024)微调 Stable Diffusion 在 RGB 上画出未来关节目标位置(彩色球),再用 ACT 控制器翻译成动作,RLBench 25 任务 49.6%、对场景扰动有「自动复原画风」的涌现鲁棒性。Render-and-Diffuse 把候选动作渲染成虚拟夹爪叠到观测上、让扩散在图像空间去噪,20 条演示 68.6%。RT-Trajectory 用一张 2D 末端轨迹草图指定任务、可从演示自动提取草图标签,新技能 67%(是 RT-1/RT-2 的 2.6×+);RT-Sketch 用手绘草图当介于语言与图像之间的目标条件。
Table E — 从视频 / 流学动作 head-to-head
| 工作 | 中间表征 | 数据源 | 迁移能力 | 代表数字 |
|---|---|---|---|---|
| ATM | 任意 2D 点未来轨迹 | 无动作视频 + CoTracker | 人类/跨本体视频→机器人 | LIBERO 63% vs 37%;15ms 闭环 |
| General Flow | 3D 点轨迹(scale-aware) | HOI4D 人类 RGBD 视频 | 零训练零机器人数据迁移 | 人→机器人 81%(ScaleFlow-B 5.6M) |
| Im2Flow2Act | 物体中心 flow | 人类视频 + 仿真 play data | 跨本体 + 跨仿真真实 | 真机 81%,无真机演示 |
| Moto | VQ-VAE 潜运动 token | 无标签视频(含人类视频) | 视频先验→动作 | SIMPLER 打平 RT-2-X/OpenVLA;1% 数据 52.5% |
| GR-1 | 未来帧生成预训练 | Ego4D 80 万片段 | 视频预训练→操作 | CALVIN 零样本 53.3→85.4 |
| Seer | 预测视觉 + 逆动力学 | DROID 等大规模机器人数据 | 两阶段揉成一次前向 | CALVIN ABC-D Avg.Len 4.28 |
| Genima | 关节目标画成图(SD 生成) | RLBench 演示 | 动作=图像 | RLBench 25 任务 49.6% |
| Render-and-Diffuse | 虚拟夹爪渲染叠加 | RLBench 演示 | 观测-动作空间统一 | 20 demo 68.6% |
| RT-Trajectory | 2D 末端轨迹草图 | 自动提取 hindsight 标签 | 草图指定新技能 | 新技能 67%(2.6× RT-1) |
支线六:数据、通才与预训练配方(较短)
不完全属于「动作表征」但同族并进的一批工作,回答「数据与预训练怎么配」:BC-Z(25.8k 演示 + 18.7k 人类视频,语言条件零样本 44%)与 Interactive Language(60 万条语言轨迹、单策略执行 87588 条指令)是「规模化模仿换任务级泛化」的早期配方;RoboCat 用自我改进闭环(专才自采数据并回训通才)把新任务成功率从 36% 提到 74%;Q-Transformer 把动作逐维离散化做离线 TD 学习,比 RT-1 高约 70%;HPT(NeurIPS 2024 Spotlight)给每个本体配小 stem tokenizer(固定 16 token)、共享 Transformer trunk,在 52 个异构数据集上首次系统展示策略预训练的 scaling;DemoStart 用 2–60 条次优演示 + 稀疏奖励做自动课程 RL 再蒸馏成视觉策略;SUDD 用 LLM 递归分解 + 采样规划器零人工生成数据再蒸馏进语言条件扩散策略;GraspVLA 纯仿真 10 亿帧合成动作数据预训练抓取基座;专用感知方向有 CordViP(手-物接触图预训练)、ManiWAV(指尖接触麦克风做声音感知)、ReKep(GPT-4o 自动写关键点约束、零训练闭环 10Hz);产品化极端则是 DYNA-1(奖励模型在环,双臂 VLA 折餐巾连续 24h 无人自主、99.4%)。
贯穿全族的设计模式
把 57 个成员横过来看,有几条模式反复出现,可当作这一族的「共识」:
-
动作 chunk + 滚动时域是默认底座。从 ACT/Diffusion Policy 起,几乎所有成员都预测一段动作、只执行前几步、再重规划。分歧只在 chunk 内是扩散、流、VQ 还是回归。
-
观测作条件、只提一次特征。Diffusion Policy 的关键工程决策——视觉特征不进去噪循环——被后续几乎所有扩散/流策略继承,是它们能实时的前提。
-
「换表征」比「换算法」常常更本质。多篇消融给出同一结论:DP3(3D vs 2D)、RISE(把稀疏 3D 编码器接到 ACT/DP 就大涨)、Equivariant DP(等变结构比换体素输入贡献更大)、SGRv2(只改动作局部性、基座不变就翻倍)——都在说「正确的归纳偏置 > 更大的模型/数据」。
-
相对表示带来平移/视角等变。Act3D 与 3D Diffuser Actor 的 RoPE 相对 3D 注意力、SGRv2 的相对位置预测、等变网络的不可约表示分解,本质都是把「场景平移/旋转不该改变动作的相对结构」写进网络。
-
小编码器/小模型反复被证明够用、又反复被质疑。DP3 的 64 维 MLP、BeT 的 10⁴ 参数、BAKU 的 10M、Moto 的 98M 都在「小即够」一侧;但 R3D 用 LayerNorm 修复训练后证明「小更好」是 BN 失效的假象、BAKU 发现 114M 在 LIBERO 上崩溃——容量甜点高度依赖数据规模与归一化选择,这是尚未收敛的活跃争论。
-
加速的三条路是正交的:蒸馏(CP/ManiCM)、改生成器(AdaFlow/One-Step Flow 流匹配)、改采样调度(SDP 滚动缓冲区)可叠加,且都能再叠 RL 微调(DPPO/ReinFlow)。
走向判断
-
单步生成正在成为默认。从「100 步 DDPM」到「1 步」的压缩已基本完成(ManiCM/One-Step Flow),且 One-Step Flow 证明单步能超过 100 步基线、还能在 1 步与多步间自由切换——扩散策略「慢」这个原罪基本被解决,后续会默认单/少步。
-
专用策略正被 VLA 吸收,但作动作头留下来。动作 chunk 化、扩散/流动作头、3D 点 token 这些本族成果,正被 Pi0/π0.5/OpenVLA/RDT 一代 VLA 当组件复用(One-Step Flow 接 π0.5、ReinFlow 后续微调 π0/π0.5/GR00T、SeedVLA 把记忆模块塞进 MemoryVLA)。本族的未来更可能是「作 VLA 的动作专家 + 提效模块」而非独立系统。
-
3D 表征回到「怎么用大编码器/大预训练」。R3D 打开了「把 ScanNet/Point-SAM 级 3D 分割预训练迁进策略」的口子、3D-MVP 打开了「3D 掩码视角预训练」的口子——3D 策略的下一步是从「手搓小编码器」转向「复用 3D 基础模型」。
-
从视频学动作是解数据瓶颈的最有希望方向,但仍卡在两点:2D flow 无法消歧 3D 动作(Im2Flow2Act 倒水失败)、以及仍需少量目标域带动作演示。潜运动 token(Moto)和 3D flow(General Flow)是两条最有前景的接口。
-
记忆与长时程是新前沿。SeedPolicy 刚把「循环记忆能反转窗口越长越差」这件事立起来,分钟级任务的长时程建模(而非 chunk 内的短时程)会是下一波焦点。
一手源与页面
本页为横向综合,全部事实取自本 vault 内各成员的一手考据页(每页已通读官方论文 / 技术报告 / 博客 / GitHub / 项目页并抠具体数字),未引入页面外信息。逐一手链接与逐工作的 infra / 数据 / 训练 / benchmark 六维细节见各成员自己的考据页(即本页各处的 wikilink 目标)。若数字在横表与某工作页正文冲突,以该工作页正文(及其标注的原文口径)为准。