一句话定位

EquiBot 把 diffusion-policy 的 conv-UNet 扩散骨干逐层改造成 SIM(3)-equivariant(对点云输入的平移、旋转、缩放都保证等变),点云编码器复用自作者前作 EquivAct(Yang et al., ICRA 2023)但不再做仿真预训练,从零训练即可让策略对未见物体尺度/朝向/位置零样本泛化——6 个仿真任务 + 6 个真机移动双臂任务(每任务仅 5 分钟单目人类演示视频、零机器人遥操作数据)验证了数据效率与泛化性。

背景与定位

范式:SIM(3)-equivariant diffusion policy(点云条件的等变扩散策略)。 作者把问题定位在模仿学习长期存在的矛盾——diffusion-policy(Chi et al., RSS 2023)等视觉运动策略要么需要大量数据,要么在未见物体/场景下退化严重。两条既有解法各有代价:数据增强(随机旋转/缩放/平移观测)能部分缓解,但增加训练时间且不保证对分布外几何变换的泛化;等变网络架构(Neural Descriptor Fields、Equivariant Transporter、SEIL、Fourier Transporter 等一串工作)能提供架构级泛化保证,但论文指出这些先驱大多局限于简单 pick-and-place、不支持闭环控制,或不支持缩放等变。

与本文关系最近的是作者前作 EquivAct(Yang et al., ICRA 2023,SIM(3)-equivariant 视觉运动策略),已经支持可变形/铰接物体的非 pick-place 任务,但只用简单行为克隆(无扩散),且编码器需要在生成的仿真数据上预训练。EquiBot 的贡献是把 EquivAct 的 SIM(3)-equivariant 点云编码器与扩散策略结合,使策略同时具备扩散模型的多模态与鲁棒性,并去掉了 EquivAct 的预训练阶段(不再需要为每个任务搭建专门仿真环境采集预训练数据)。

论文也把自己与”等变扩散架构”这一更窄的相关工作线区分开:EquiDiff(Ryu et al. 之流)只做 SO(2)-equivariant 2D 轨迹,不足以应对大多数 3D 操作;Diffusion-EDFs 只输出单个目标末端位姿,只能做 pick-and-place;EDGI 是开环策略且只在简单 2D 任务验证。EquiBot 声称是首个支持闭环 3D 操作的等变扩散策略。附录中还专门讨论了与同期 dp3-3d-diffusion-policy(3D Diffusion Policy, Ze et al.)的关系——DP3 的极简 MLP 点编码器可以直接替换进 EquiBot 架构并做成等变版本,性能与原版相当。

作者:Jingyun Yang、Zi-ang Cao(共一),Congyue Deng、Rika Antonova、Shuran Song、Jeannette Bohg,Stanford University;CoRL 2024(第八届机器人学习会议)收录,Toyota Research Institute 资助。

模型架构

Backbone:CNN-based Diffusion Policy(Chi et al. 2023)逐层等变化改造,整体是 PointNet-based 点云编码器 + SO(3)-equivariant conditional U-net 的条件扩散去噪网络。

编码器(SIM(3)-equivariant PointNet++,复用 EquivAct 架构)

  • 除 Push T 外所有任务:4 层,隐藏维度 128;Push T 因点数更少减到 2 层
  • 输出隐向量 Θ = (Θ_R, Θ_inv, Θ_c, Θ_s):Θ_R 为旋转等变表征,Θ_inv 为不变表征,Θ_c 为物体质心向量,Θ_s 为物体尺度标量。Θ_c、Θ_s 用于把后续层的输入归一化为位置/尺度不变,输出前再用它们把动作缩放回原始坐标系。
  • 与 EquivAct 的关键差异:本文不对编码器做仿真预训练,直接从零学习,省去为每个任务搭建专用仿真环境采集预训练数据的成本。

观测/动作表征(vector-scalar 分解):本体感知 S_t = (S_t^(x) 位置, S_t^(d) 方向, S_t^(s) 标量);动作 A_t = (A_t^(v) 速度/偏移, A_t^(d) 方向, A_t^(s) 标量)。除 Push T 外,本体感知为 13 维(3 维末端位置 + 6 维末端旋转矩阵两列 + 3 维重力方向 + 1 维夹爪开合标量),动作为 7 维(3 维末端位置速度 + 3 维轴角格式角速度 + 1 维夹爪标量);Push T 任务本体感知/动作各为 3 维(2D 位置 / 位置目标)。

SO(3)-equivariant conditional U-net

  • 1D 卷积层:把向量通道当作 batch 维度做原始卷积,从而天然获得 SO(3)-等变。
  • 上采样层:无需改动,本身天然 SO(3)-等变。
  • FiLM 层:把普通线性层换成 Vector Neuron(VN)层(Deng et al.)构成的向量化线性层,从而使 FiLM 调制本身也旋转等变。
  • 条件信息 Z_c 融合 Θ_inv、归一化后的本体感知位置/方向、扩散步 k 的位置编码;动作表征 Z_a 融合归一化后的动作速度/方向/标量。

扩散过程:DDPM 噪声预测网络,超参数继承自原版 Diffusion Policy。仿真实验用 DDPM 调度器、推理 100 步去噪;真机实验为优化推理速度改用 DDIM 调度器、仅 8 步去噪。 观测 horizon 2 步、预测 horizon 16 步、动作执行 horizon 8 步——与原版 Diffusion Policy 一致。

点云规模:真机与仿真移动操作任务统一用 1024 点;Robomimic 的 Can/Square 任务因训练数据更多,分别降到 256/512 点以加速训练且不掉点。

归一化:不同于原版 DP 对观测/动作分别归一化,本文把所有 3D 向量输入(位置+速度)联合归一化——取训练数据子集算出点云平均尺度 s_pc 与动作平均尺度 s_ac,所有位置/速度信息除以 s_pc/s_ac,使扩散过程始终在 [-1, 1] 范围内工作;不对位置/速度做平移偏置(因等变性假设)。

附录 C 给出理论证明:只要每步扩散的转移分布对 SO(3) 等变、初始高斯噪声天然自对称,则整条 Markov 链的边际输出分布在随机性下也保持等变(把 Köhler et al. 2020 / Xu et al. 2022 单步等变扩散的性质推广到闭环多步机器人动作扩散)。

数据

仿真(6 个任务,两组实验)

  • OOD 泛化实验用 4 个任务:Cloth Folding(27.5×27.5cm 布,双臂折叠)、Object Covering(27.5×27.5cm 布盖到 10×7×5cm 刚体盒上)、Box Closing(14.5×12×11.5cm 三翻盖纸箱,双臂合盖)——以上三个均为双移动机械臂操作可变形/铰接物体,由仿真深度相机第三人称采集点云;Push T(源自原版 Diffusion Policy 的 2D 多模态推箱benchmark,改造为 3D 空间 z=0 平面任务,策略输入 T 形物体 8 个角点位置)。论文正文未明确给出这 4 个任务各自使用的具体演示条数(GitHub 演示生成脚本默认 --num_demos 50,但该默认值是否等于论文实验设定未在正文中确认,标记未披露)。
  • 数据效率实验用 Robomimic 的 Can 与 Square 两个单臂任务,明确设置为 100 / 50 / 25 条演示三档对比。
  • 所有仿真实验:训练 2,000 epochs,3 个随机种子,每 50 epoch 存一次 checkpoint,评估最后 5 个 checkpoint(每个 10 条评估 episode,取平均 reward)。

真机(6 个移动操作任务,人类视频演示、零遥操作)

  • 每个任务采集 15 条人类演示视频,用单个 ZED 2 双目相机15 Hz 记录人类操作者用手指操纵物体的过程;采集后用现成的手部检测模型 + 物体分割模型 + 双目深度模型解析出人手位姿与物体点云,再降采样到 3 Hz 转换为策略训练格式。摘要口径:每个任务仅用 5 分钟人类演示即可完成训练。
  • 动作标注管道(无需机器人遥操作):(1) Grounded-SAM + DEVA 做物体检测追踪,得到逐帧物体点云 X_t;(2) HaMeR 做手部关键点检测,得到手部关键点 H_t;(3) 一个刚体配准对齐模块,把 H_t 配准到 X_t 所在坐标系,提取拇指+食指指尖位置作为伪”末端执行器”位姿 y_t,作为动作标签。作者强调该对齐模块是关键——没有它手部姿态与物体点云坐标系不对齐。
  • 真机部署:单个固定位置 ZED 2 相机获取单视角点云 → Grounded-SAM 按语言描述分割相关物体 → 降采样到 1024 点 → 与本体感知一起送入策略推理;运动捕捉系统追踪移动底座位姿。
  • 6 个真机任务的物体变化跨度:Push Chair(训练用 48×30 英寸站立桌,评测用 58×23 英寸长桌与直径 36 英寸圆桌两种未见桌型);Luggage Packing(训练打包白色 T 恤,评测额外测灰色毛巾卷、蓝色帽子、藏青短裤三种未见物体);Luggage Closing(训练用 55×40×23cm 小号登机箱,评测用 76×48×25cm 大号托运箱);Laundry Door Closing(同一台前开式洗衣机,同分布评测);Bimanual Folding(训练折 34×38cm 小布,评测折 140×75cm 大浴巾并平移旋转场景布局);Bimanual Make Bed(训练展开 34×38cm 小布,评测在床上展开更大的被子)。
  • 训练:1,000 epochs,评测每任务 10 条 episode 记录成功率。除 Laundry Door Closing 为同分布评测外,其余 5 个任务均引入未见物体(Object Variations)和/或场景平移旋转(Unseen Poses)构成分布外评测。
  • 无跨任务共训(co-training),每个任务独立训练一个策略;无 sim-to-real 迁移(真机策略直接从人类视频学习,不借助仿真数据)。

训练方法

  • 目标函数:标准 DDPM 噪声预测(继承原版 Diffusion Policy 超参数),论文正文未给出单独的等变版本损失公式改动——损失沿用扩散策略的噪声预测目标,等变性完全由架构(编码器 + SO(3)-equivariant U-net)保证,而非损失函数或数据增强。
  • 不使用数据增强:这是与 DP+Aug 基线的核心区别——DP+Aug 需要显式增强(绕 z 轴随机旋转 0–360°、均匀缩放 0.5×–1.5×、按工作空间尺寸 0.1 倍标准差的高斯位置扰动)才能部分获得泛化能力;EquiBot 靠架构等变性替代增强的作用(让网络在每步扩散更新中”看到”输入的不同变换版本)。
  • 单阶段模仿学习,无 RL、无蒸馏、无动作离散化(连续速度/角速度回归,通过扩散过程建模多模态动作分布)。
  • 三个基线对照:DP(原版扩散策略把图像编码器换成 PointNet++ 处理点云)、DP+Aug(DP 架构 + 上述数据增强)、EquivAct(作者前作的复现,去掉预训练阶段以公平对比)。附录额外对比 DP3 encoder 集成版本(把 EquiBot 的 PointNet-based 编码器换成 DP3 的极简编码器并改造为等变),在 Cloth Folding 任务上性能与完整方法相当。

Infra(训练 / 推理工程)

  • 训练硬件(GPU 数量、GPU-hours、并行策略、精度):论文正文与附录均未披露。GitHub README 仅注明代码开发/测试环境为 “Ubuntu 20.04 + 单张 RTX 4090 GPU + CUDA 11.8”,这是仓库声明的可复现开发环境,不代表论文正式实验所用的实际算力规模(2,000 epochs × 3 seeds 覆盖 4 个仿真任务 × 3+ 方法的完整对照实验,实际卡时未知)。
  • 推理去噪步数:仿真用 DDPM 100 步;真机为优化延迟改用 DDIM 8 步
  • 真机控制回路:工作站多进程架构,观测解析(Grounded-SAM 分割 + 降采样到 1024 点)、策略推理、动作执行三个进程并行;策略每次推理输出 16 步动作序列;执行时先计算推理时刻到执行时刻的耗时,若超过阈值则跳过若干条最前面的预测动作以补偿延迟,之后固定执行 8 条动作(跳过多少条不影响每次执行 8 条这一约定)。
  • 控制频率 / 端到端推理 FPS / 边缘硬件:论文未披露具体数值(仅披露人类演示采集 15 Hz、训练数据降采样到 3 Hz,这是数据频率而非策略推理频率或部署控制频率);策略部署在集中式工作站而非边缘设备。

评测 benchmark

仿真 OOD 泛化实验(Figure 4,4 任务 × 4 评测设定,DP / DP+Aug / EquivAct / Ours 对比):Original(与演示相同初始位姿)、OOD(R+Su)(随机旋转 + 1×–2× 均匀缩放)、OOD(R+Sn)(随机旋转 + 非均匀缩放,长宽比可变最高 1.33)、OOD(R+Sn+P)(在 R+Sn 基础上再加大幅位置随机化)。该结果以柱状图形式呈现,正文未给出具体数值表;定性结论:DP 在 Original 设定下表现最好但一到 OOD 设定性能大幅下滑;DP+Aug 因训练容量被增强数据分摊,Original 上略逊于 DP,但 OOD 上明显更稳;EquivAct 在 Cloth Folding 上表现好,但在 Object Covering、Box Closing 上因训练不稳定表现欠佳,且无法很好处理 Push T 的多模态演示;EquiBot 在全部 4 个任务上表现最稳定,OOD 性能下滑幅度全场最小

仿真数据效率实验(Figure 5,Robomimic Can/Square,DP vs Ours,100/50/25 条演示):同样只有柱状图,无数值表;定性结论:DP 演示从 100 降到 25 时性能大幅下滑,EquiBot 因等变性对未见初始物体位姿的泛化能力,在低数据量下性能保持相对更高。

真机主结果(Table 1,10 项任务变体 × DP / DP+Aug / Ours,各 10 次试验成功率)

任务变体DPDP+AugOurs (EquiBot)
Push Chair → 长桌0/100/108/10
Push Chair → 圆桌0/100/1010/10
Luggage Packing → T恤0/100/107/10
Luggage Packing → 毛巾卷0/100/103/10
Luggage Packing → 帽子0/100/108/10
Luggage Packing → 短裤0/100/108/10
Luggage Closing → 大号托运箱0/102/106/10
Laundry Door Closing(同分布)3/101/108/10
Bimanual Folding → 大浴巾+平移旋转0/100/106/10
Bimanual Make Bed → 被子0/100/108/10

EquiBot 在全部 10 项变体上大幅超过两个基线,尤其在物体形变/尺度剧烈变化(大号托运箱、大浴巾)和未见桌型上体现出等变架构的零样本泛化能力;两个基线在绝大多数分布外变体上成功率为 0。

附录 Table 2:Laundry Door Closing 按演示条数(10/25/50)细分(Success Rate / Close with Click Sound / Total Missing Angle 累计缺口角度 / Collision or Safety Issue):

演示条数方法Success RateClick Sound累计缺口角碰撞/安全问题
10Ours8/102/1017.46°0/10
10DP3/102/10140.42°2/10
25Ours9/102/107.18°0/10
25DP5/101/1033.85°0/10
50Ours10/105/106.3°0/10
50DP7/105/1021.55°0/10

即使演示条数相同,EquiBot 的成功率显著更高、累计未关闭角度更小、且几乎无碰撞/安全问题需人工急停终止,而 DP 即便在 50 条演示时仍有 2/10 次因碰撞/安全问题被迫终止(10 条演示时)。

附录失败分析(Section B.1,定性,无数值表):打包类任务(T恤/毛巾/帽子)主要失败模式是末端执行器过早松开;打包短裤任务一半因过晚松开、一半因短裤与末端执行器摩擦力过大未能滑落;Push Chair、Laundry Door Closing、Bimanual Folding 的主要失败原因是动作误差累积导致末端未能完成完整动作或未在正确时机开合夹爪;Bimanual Make Bed 因折叠状态的被子视觉上像两片布料叠放,导致物体分割模型时常无法完整分割出整个被子。

附录 DP3 编码器集成对比(Figure 7,定性,无数值表):把 dp3-3d-diffusion-policy 的 DP3 编码器替换进 EquiBot 并改造为等变版本后,在 Cloth Folding 任务上性能与原版(PointNet-based 编码器)相当略低;同时 DP3 原始(非等变)版本表现与 DP 基线相近——同分布内表现好、分布外差。

创新点与影响

贡献:

  1. 首个支持闭环 3D 操作的 SIM(3)-equivariant 扩散策略——把作者前作 EquivAct 的等变点云编码器与 diffusion-policy 的条件扩散生成骨干结合,逐层(编码器、FiLM、卷积、上采样)改造为等变,理论证明(附录 C)整条扩散 Markov 链在随机性下仍保持等变输出分布。
  2. 去掉了 EquivAct 必需的仿真预训练阶段:编码器直接从任务数据零训练,省去为每个新任务搭建专用仿真环境、生成预训练数据的工程成本,让方法更容易迁移到新任务。
  3. 验证了纯人类视频演示 + 无机器人遥操作的真机数据采集管道(手部检测 + 物体分割 + 刚体配准对齐,得到伪末端执行器位姿标签),配合等变架构,仅用 15 条 / 5 分钟人类视频就能训出可零样本泛化到未见物体、场景布局甚至物体尺度剧烈变化(如托运箱、大浴巾、被子)的移动双臂操作策略。
  4. 消融证明等变架构本身可替代数据增强:DP+Aug 需要显式增强且仍无法完全弥补与真正等变架构的差距,尤其在真机分布外场景中 DP/DP+Aug 成功率普遍为 0,而 EquiBot 保持 6/10–10/10。

改变了什么:把”等变网络能替代数据增强获得可证明的几何泛化保证”这一论点从简单 pick-and-place 场景扩展到了闭环、多模态、可变形/铰接物体的移动双臂操作任务,并证明该架构可与扩散策略(而非此前仅限行为克隆)结合。附录也验证了它与同期 DP3 极简编码器路线的可组合性。

作者自陈局限

  • 等变性由构造只严格保证对 SIM(3)(平移/旋转/缩放) 变换成立,不覆盖非线性形状变化(如演示中壶嘴很短、部署时壶嘴细长弯曲)或动力学变化(演示用硬布、部署用更易拉伸下垂的软布),这些超出 SIM(3) 的泛化并非架构保证,而是经验观察到的额外收益(作者推测与”训练网络对某类变换不变可带来更好特征表征”这一表征学习文献的观察有关,但未做系统性探测验证)。
  • 未验证多任务场景下如何处理这类非线性变换,留作未来工作。
  • 真机失败分析显示动作误差累积、物体分割鲁棒性(视觉相似的折叠布料)仍是限制因素。

原始链接

一手源存档(sources/)

  • equibot—github-readme — GitHub README 快照(含安装环境 RTX 4090/CUDA 11.8、演示生成/训练/评估命令、四种 OOD 评测设定的复现脚本)
  • equibot—project-page — 项目主页快照(CoRL 2024 venue 确认、摘要、真机任务与数据采集流程描述、BibTeX)
  • arXiv 全文(2407.01479,正文 + 附录 A–F 已通读):PDF/HTML 原文不入 git,见上方 arXiv 链接