一句话定位

这篇论文把「NLP/CV 里的 scaling law」第一次系统地搬到真实世界机器人模仿学习上,回答的是「该采什么数据、采多少」这个工程问题:作者用手持夹爪 UMI 采了 4 万+ 条演示、跑了 1.5 万+ 次真机 rollout,发现单任务策略对新物体 / 新环境的泛化能力,与训练用到的物体数、环境数、环境-物体对数呈幂律关系(相关系数 r=-0.98),而与「每个环境/物体采多少条演示」几乎无关——多样性远比数量重要。由此给出一份可照抄的采集配方:在尽可能多的环境(如 32 个)各放 1 个不同物体、每个采 50 条演示,训出的单任务 Diffusion Policy 就能在完全没见过的环境和物体上零样本达到约 90% 成功率,甚至能开进火锅店、咖啡馆、电梯里直接干活。ICLR 2025 Oral,CoRL 2024 X-Embodiment Robot Learning Workshop 最佳论文。

背景与定位

论文站在两个已被反复验证、但没人认真量化过的直觉交叉口:

  • scaling law 已在别处被验证:Kaplan 2020 在语言模型上发现 loss 与数据量/模型量/算力呈幂律,后续在判别式图像、生成式图像、视频等领域都复现。机器人领域也在拼命堆数据(Open X-Embodiment 汇集 100 万+ 条轨迹、22 种本体;DROID、RH20T 等),但目标是跨本体正迁移的基础模型,部署到新环境仍要采数据微调。本文把目标换成免微调、单任务、可直接零样本部署,并且第一次问:泛化能力到底和「环境数、物体数、演示数」各自是什么函数关系?
  • 模仿学习是主流但泛化差:行为克隆(BC)训出来的策略普遍在新场景崩掉。以往研究要么用特制灯光/3D 打印件孤立控制单个变差因子(只变颜色、只变尺寸),但真实部署面对的是多因子同时变化。本文干脆把泛化拆成环境泛化(光照、干扰物、背景)和物体泛化(同类物体的颜色、尺寸、几何),认为这两维覆盖了真实部署遇到的几乎所有变差。

这条路线的直接前身是 UMI(Chi 2024,手持夹爪采 in-the-wild 数据)和并行工作 RUMs(Etukuru 2024,零样本新环境部署)——但这两者都没有系统分析泛化与各数据维度的定量关系,正是本文补的洞。建模工具直接复用 Diffusion Policy(Chi 2023)。范式上它属于「data-centric 的模仿学习 scaling 研究」,与 RT-2 这类靠网络规模知识迁移的 VLA 路线互补:本文不追求任务级泛化,只把「单任务基元技能的环境/物体泛化」这一块做深做透。

模型架构

骨干就是 Diffusion Policy,作者在其上做了两处针对性改动,核心是「视觉编码器要够强、要全量微调」。

动作建模(Diffusion Policy 本体)

  • 噪声预测网络:CNN 结构的 1D U-Net(沿用 Chi 2023),对一段未来动作序列做条件去噪;推理用 DDIM 加速、去噪迭代 16 步,实现实时控制。
  • 动作表示:末端执行器位姿序列(UMI 采的是 6-DoF 末端轨迹 + 夹爪开合)。动作时域(action horizon)=16
  • 观测:图像观测分辨率 224×224;图像与本体感知(proprioception)观测时域 = 2 步(对应 0.05 秒),但对 Pour Water、Unplug Charger 两个「时序易混淆」的任务把观测时域加到 3 步——额外并入一个更远的历史帧(Pour Water 取 0.25 秒前、Unplug Charger 取 0.5 秒前),让策略能区分「正要开始倒水」和「已经倒完」这类状态。

改动一:DINOv2 视觉编码器(全量微调)。用 DINOv2 ViT-Large/14(Oquab 2023)替代常见的 ImageNet 预训练 ResNet 和 CLIP ViT。作者归因于 DINOv2 特征能显式刻画场景布局和物体边界,对机器人控制所需的空间推理更友好。为保证「扩数据时模型容量不成为瓶颈」,特意选了足够大的 ViT-L/14。视觉编码器 + 噪声预测网络两部分参数合计 超过 3.96 亿

改动二:时序集成(temporal ensemble)。Diffusion Policy 每隔若干步预测一整段动作、只执行前几步,切换时序列间断裂会导致抖动。作者引入 ACT(Zhao 2023)的时序集成:策略在每个时刻都预测、得到重叠的动作序列,对同一时刻的多个预测用指数加权(temporal ensemble steps=8,adaptation rate=-0.01)平均,平滑过渡、减少抖动。

模型侧消融(Pour Water,32 环境-物体对、50% 演示)明确了几条结论:视觉编码器预训练 + 全量微调缺一不可——从零学的 ViT-L 得分 0.03、冻结 DINOv2 得 0.00、LoRA(rank=8) 只到 0.72、全量微调 0.90;编码器越大越好(ViT-S 0.66 → ViT-B 0.81 → ViT-L 0.90);但动作扩散 U-Net 放大反而无益(small 0.88 / base 0.90 / large 0.83,最大特征维从 512 加到 2048 也没涨,最大的还略降)——作者推测小 U-Net 容量已足够建模当前动作分布,或尚未找到可扩展的动作扩散架构。

数据

数据是这篇论文的主角。全程共采集 超过 40,000 条演示、执行 超过 15,000 次真机 rollout

  • 采集工具UMI 手持夹爪(Chi 2024)。便携、直觉、低成本,能在不同 in-the-wild 环境间快速切换、几乎零布置时间。缺点是靠 SLAM 估末端动作,纹理稀缺(暗处、空白墙)会跟踪失败;作者用 Pangolin 可视化确认特征是否够,多加干扰物/纹理既增特征又当数据增广,多轮建图 + 批量 SLAM 提高有效率。最终约 90% 的演示有效
  • 两个主研任务的数据矩阵(每个 cell 采 120 条演示):
    • 物体泛化:同一环境放 32 个不同物体,共 3,840 条 → SLAM 过滤后 Pour Water 3,765 / Mouse Arrangement 3,820。
    • 环境泛化:同一物体跨 32 个不同环境 → 有效 Pour Water 3,424 / Mouse Arrangement 3,351。
    • 环境+物体联合32 个环境各配一个独有物体 → 有效 3,648 / 3,564。
    • 每环境多物体16 个环境各放 4 个独有物体 → 有效 6,896 / 6,505。
  • 数据来源与配比结论(本文最有价值的输出):
    • 多样性 >> 数量。固定环境/物体数时,加演示数很快饱和;而加环境/物体多样性持续涨分。
    • 每环境放几个物体? 环境数少时多放物体有用;一旦环境数 ≥16,多物体 vs 单物体差异可忽略——因此推荐每个环境只放 1 个独有物体、尽量多铺环境
    • 每对采多少演示? 最大采集设定(16 环境×4 物体)下,性能在 800 条总演示时饱和;按推荐的「环境-物体对」设定,8/16/32 对分别在 400 / 800 / 1600 条饱和 → 折算推荐每个环境-物体对采 50 条演示
  • 动作标注:无需人工标动作——UMI 靠 SLAM 直接从手持采集中恢复末端 6-DoF 轨迹和夹爪开合,即演示本身就是动作标签(sim-vs-real 全为真实世界,无仿真数据、无联合训练)。
  • 开源:4 个任务(pour water / arrange mouse / fold towel / unplug charger)的原始 GoPro 视频处理后可直接训练的数据集、以及每任务一个 32 环境-物体对 × 50 演示训出的策略模型全部在 HuggingFace 释出。

训练方法

  • 目标:行为克隆 / 模仿学习,用条件扩散(DDPM 训练、DDIM 推理)对末端动作序列去噪。全程无 RL(作者把 RL 列为 future work)。
  • 收敛控制:为让不同规模数据集的策略都充分收敛,按总演示数调 epoch——最小数据集 800 epoch、最大数据集 75 epoch(后者在 8×A800 上跑 75 小时)。数据集构造保证「大集包含小集」(如 8 环境的数据是 16 环境的子集),使不同规模下数据分布一致、比较公平。用每个策略的最终 checkpoint评测。
  • 关键超参(Table 3):优化器 AdamW;动作扩散 LR 3e-4、视觉编码器 LR 3e-5;cosine decay;batch size 256;推理去噪迭代 16;时序集成步数 8、adaptation rate -0.01;环境频率 5 Hz。
  • 精度BFloat16(3.96 亿参数下加速训练同时保数值稳定)。

Infra(训练 / 推理工程)

  • 训练8× NVIDIA A800 GPU;最大规模策略需 75 小时;BFloat16 混合精度。多卡用 accelerate 配置。GPU-hours / 并行策略(TP/PP/DP 细节)未披露,量级约为 8×75=600 A800·h(最大单个策略;全部策略未给汇总)。
  • 推理 / 边缘部署:策略推理跑在**单张 NVIDIA 4090(24 GB 显存)**工作站上,实时控制、环境频率 5 Hz;具体 FPS / 延迟数值未披露。
  • 真机硬件栈Franka Emika Panda 7-DoF 机械臂 + Weiss WSG-50 单自由度平行夹爪(用 Chi 2024 的转接件把夹爪转 90°补偿末端俯仰不足,指尖为紫色 95A TPU 柔性打印件);腕装 GoPro Hero 10 鱼眼相机(经 GoPro Media Mod + Elgato HD60 X 采集卡实时取流);**EcoFlow DELTA 2 Max 移动电源(2048 Wh)**兼作 23 kg 配重防倾;整套装在自制可升降移动台上,得以在非实验室场景测试。

评测 benchmark

所有指标来自一手论文,评测协议严格(只在未见环境/物体上测;用 tester 打分做主指标,因为成功率信号太稀疏、MSE 与真机表现不相关;同批多策略盲测、随机打乱顺序、同初始条件保证可比)。归一化得分 = 总测试分 /(3 × 步骤数),上限 1,每步满分 3、任务通常 2-3 步。

幂律拟合(核心结果,Fig 5):把「最优性差距」Y = 1 − score 对变量 X 做 log-log 线性拟合,Y=β·X^α。

  • 物体数 / 环境数 / 环境-物体对数,三者都呈清晰幂律,相关系数 r = −0.98(强)。
  • 演示数则只有弱幂律(Pour Water r=−0.73、Mouse Arrangement r=−0.79),性能先快涨后很快饱和 → 印证「演示数不是可靠的 scaling 轴」。
  • 定性观察:仅 8 个训练物体归一化得分就 >0.8,32 个物体 >0.9;物体泛化比环境泛化更容易(环境泛化曲线斜率更低)。
  • 幂律可外推预测:按拟合式,Mouse Arrangement 要在新环境+新物体上到 0.99 分需约 1,191 个环境-物体对(留作 future work 验证)。

策略验证(Table 1):用推荐配方(32 环境-物体对、每环境 50 演示)训 4 个任务,各在 8 个未见环境 × 2 个未见物体 × 5 次试验上测:

任务归一化得分成功率
Pour Water0.922 ± 0.07585.0 ± 19.4%
Mouse Arrangement0.933 ± 0.08892.5 ± 9.7%
Fold Towels0.95 ± 0.06287.5 ± 17.1%
Unplug Charger0.887 ± 0.1490.0 ± 14.1%

四个任务(含 2 个全新任务)都达到约 90% 成功率,而两个新任务的全部数据只需 4 个采集者、一个下午。没有与外部 baseline 的横向表格——论文本身就是一份 scaling 研究,对照组是「自己不同数据规模下的策略」,以及模型侧的编码器/U-Net 消融(见上)。

创新点与影响

  • 贡献:第一份真实世界机器人模仿学习的数据 scaling law。三条被广泛引用的结论——(1) Simple power laws:泛化能力对物体/环境/环境-物体对数呈幂律;(2) Diversity is all you need:多样性远胜每单元的演示数量;(3) Generalization is easier than expected:32 个环境各 1 物体各 50 演示即可训出 ~90% 零样本泛化的单任务策略。
  • 改变了什么:把「机器人该采什么数据」从玄学变成可操作配方,并给出幂律外推作为「再采多少能到目标分」的预算工具;同时用大量真机证据把「in-the-wild 零样本部署」拉近到工程可达(火锅店/咖啡馆/电梯实拍)。UMI + Diffusion Policy + DINOv2 全量微调这一组合成为后续 in-the-wild 操作研究的强基线参考。相比 遥操作大规模采集 路线,本文把「怎样用最少人力采到最泛化的数据」这一问题量化到了配方级。
  • 作者自述局限:(1) 只做单任务策略,未涉任务级泛化(那需上千任务的数据);(2) 只研究模仿学习,RL 可能进一步提升,其 scaling law 待探;(3) UMI 采集有 SLAM 带来的固有小误差,且只用 Diffusion Policy 一种算法建模,数据质量与算法如何影响 scaling law 未知;(4) 受资源限制只在 4 个任务上验证,更多、更复杂(尤其灵巧操作)任务待验证,且更难的任务可能需要更多演示。

原始链接

一手源存档(sources/)