一句话定位

CordViP 不再从单视角 RGB-D 直接合成全局点云喂给策略,而是分别用 6D 位姿估计重建物体点云、用机器人正运动学重建手部点云,再显式建两者的接触图(contact map)与手臂-手协同关系去预训练一个 3D 编码器,最后拿这套”手-物对应关系”特征去条件化一个扩散策略;北大团队在 UR5+Leap Hand 四个真实灵巧操作任务上做到平均 90% 成功率,RSS 2025 收录。

背景与定位

范式属于基于 3D 表征的模仿学习(3D imitation learning),直接对标 Diffusion Policy 的图像版和其 3D 变体 DP3(3D Diffusion Policy)。作者指出这条路线在灵巧手(多指手)真实场景中有两个具体短板:(1) 单视角 RGB-D 相机合成的点云质量强依赖相机分辨率/位置,且多指手操作时会严重遮挡物体,导致点云几何/语义丢失;(2) 全局点云(把手和物体混在一起的一整团点)不携带接触信息与手-物空间对应关系,难以支持精细操作。触觉传感器(如 Wu et al. 的 3D 触觉表示工作)是另一条补接触信息的路线,但成本高且易受温度/电磁干扰。CordViP 的解法是不依赖触觉、不依赖更好的相机,而是用视觉基础模型(TripoSR 生成数字孪生 + FoundationPose 做 6D 位姿跟踪)重建物体点云,用机器人正运动学重建手点云,两边独立生成、再建立对应关系,从根上避开遮挡问题。方法上与 ACT 系的动作分块 transformer 也做了可迁移性对比(见下)。

模型架构

三阶段流水线,策略骨干为条件扩散模型(DDPM 训练 / DDIM 推理加速),预训练用一个共享的双流 PointNet + 交叉注意力编码器:

  • 交互感知点云生成(Interaction-aware point cloud):
    • 物体侧: 用 TripoSR 从单视角图像重建 3D 数字孪生(digital twin),在其表面均匀采样得到初始物体点云;再用 SAM(Segment Anything)分割出待操作物体掩码,结合数字孪生跑 FoundationPose 做 6D 位姿估计,以点云质心为原点把估计位姿应用到点云上完成逐帧跟踪。
    • 手侧: 解析 URDF 得到各连杆(link)点云,搭建”机器人点云正运动学模型” F_pc,输入关节角 q 直接算出手部点云 P_hand ∈ R^{N_P×3}(N_P 下采样到 1024);该模型实测运行频率 8 Hz,高于策略实际推理所需的 5 Hz。
    • 两路点云都不带 RGB 颜色信息(颜色仅用于论文可视化对比,不进策略输入)。
  • 接触与协同增强的特征提取:
    • 用同结构 PointNet(三层全连接 + LayerNorm + ReLU,输出 1024 维)分别编码物体点云 f_θO(P_obj) 和手点云 f_θH(P_hand)
    • 两个 4-head 交叉注意力 transformer(架构沿用 Eisner et al.)让手、物特征互相 attend、再残差相加,得到对齐表示 φ^Hφ^O
    • 物体中心接触图(object-centric contact map):对物体表面每点 v_o 算到手表面最近点 v_h 的”法向加权距离” D_(O,H) = min_{v_h} e^{γ(1-|<v_h-v_o,n_o>|)}·‖v_o-v_h‖₂(γ=1),再经 C = 1 - 2(Sigmoid(θ·D)-0.5)(θ=10)映射到 [0,1];用一个三层 MLP 从点云特征预测 C_pred,MSE 监督。
    • 手臂-手协同增强:手臂状态(6-DoF)、手状态(16-DoF)各过线性层映射到 16 维,再用同款交叉注意力 transformer 融合;用点云+手状态预测手臂动作序列、用点云+手臂状态预测手动作序列,MSE 监督重建的动作与真实动作。
    • 预训练总损失 L = L_contact + λ·L_coordination(λ=1)。
  • 相关性条件扩散策略:预训练编码器输出的 φ^{H,O}(空间对应)与 ψ^{A,H}(手臂-手状态特征)作为条件,喂给条件去噪扩散模型;下游任务微调阶段编码器不冻结、继续微调。可迁移到 Transformer 骨干(即 CVAE + ACT 式架构),用相同预训练编码器替换 ACT 的图像输入。
  • 机器人本体:6-DoF UR5 机械臂 + 16-DoF 四指 Leap Hand,单个固定 RealSense L515 采集观测(另一台 D435 仅用于遥操作数据采集,不进策略)。

数据

  • 专家演示:人类遥操作采集,用 HaMeR 从单个 RealSense D435 图像跟踪人手位姿,经 AnyTeleop 框架重定向到机器人(机械臂走 6-DoF 末端位姿控制,灵巧手走重定向后的关节位置控制)。四个任务各采 50 条演示(合计 200 条),记录频率 5 Hz。任务/演示参数(Table IX):PickPlace(episode 长度 150、遥操时长 30 s、评测上限 400 步)、FlipCup(150 / 30 s / 300 步)、Assembly(175 / 35 s / 500 步)、ArtiManip(190 / 38 s / 600 步)。
  • 预训练(“play data”):论文正文称在”收集到的 play data”上预训练接触图与协同关系,未单独披露该数据集与上述 200 条专家演示的具体数量关系(未披露);GitHub 仓库给出的预训练脚本示例为 all_tasks160 条演示联合预训练(四任务数据池化后的示例配置,来自代码仓库而非论文正文,数字未必等于论文实际用量)。
  • 数据来源:全部为真实世界采集(无仿真数据、无 sim-to-real),点云观测裁剪范围 x∈[-0.4m,0.1m], y∈[-0.7,-0.4], z∈[0.1,0.51]
  • 动作标注:动作即遥操作记录的机械臂末端位姿+手关节角(弧度),训练前对每个动作/观测维度按 [-1,1] 线性归一化(DDIM/DDPM 要求)。
  • 相机:RealSense L515 采集 480×640 RGB-D,深度与 RGB 对齐;仅用于位姿跟踪,不合成传统意义上的场景点云喂给策略(这是与 DP3 等基线的关键数据管线区别——基线们直接从 RGBD 合成点云并做最远点采样)。

训练方法

  • 两阶段训练:先在接触图+协同预测任务上预训练编码器(损失见”模型架构”),再加载预训练编码器、接扩散策略头,在具体任务上端到端微调(编码器不冻结,消融显示微调比冻结更好,见评测)。
  • 扩散策略:条件 DDPM 训练目标为预测噪声 L=MSE(ε^k, ε_θ(ᾱ_k·A^0+β̄·ε^k, φ^{H,O}, ψ^{A,H}, k));推理用 DDIM 调度加速。
  • 关键超参(Table X):机器人点云 1024×3、物体点云 1024×3、接触图 1024×1、γ=1θ=10、协同损失权重 λ=1horizon=12n_obs_steps=4n_action_steps=6、优化器 AdamW
  • 点云编码器消融(Table VII):对比 PointNet / PointNet++ / PointNeXt,PointNet 平均成功率 90% 明显优于 PointNet++(26%)与 PointNeXt(0%,几乎无法学习);冻结 PointNet 编码器(记作 PointNet*)平均成功率降到 79%,说明下游微调编码器带来实打实的增益。
  • 基线训练配置(附录,来自代码/论文一致):Diffusion Policy 训 600 epoch(horizon 12/obs 4/action 8,ResNet18 视觉编码器+CNN backbone);DP3 训 8000 epoch(同 horizon/obs/action,DP3 官方点云编码器);ACT 训 5000 epoch(action_chunk=30);ACT+3D 训 1600 epoch(action_chunk=30,PointNet 编码点云+可学习位置编码);BCRNN 训 1500 epoch(horizon 10/obs 1/action 1);BCRNN+3D 训 3000 epoch(同上,PointNet 编码点云)。

Infra(训练 / 推理工程)

  • 论文未披露训练所用 GPU 型号、数量或总 GPU-hours(未披露)。
  • 推理速度:CordViP 网络前向达到最高 12.84 FPS,超过 DP3 的 11.79 FPS(得益于省去点云最远点采样、用紧凑的交互感知点云表示)。
  • 点云生成频率:机器人点云正运动学模型运行在 8 Hz;策略实际推理/控制约 5 Hz(与专家演示采集频率一致),8 Hz 的点云生成对 5 Hz 控制回路足够。
  • 物体位姿跟踪(FoundationPose)、SAM 分割等前处理模块的具体延迟未披露(未披露)。
  • 边缘/机载部署硬件、功耗等未披露(未披露)。

评测 benchmark

主实验(Table I,四任务、各 20 次试验,单位成功率):

方法PickPlaceFlipCupAssemblyArtiManip平均
BCRNN0%0%0%5%1%
BCRNN+3D0%5%0%10%4%
ACT45%70%25%65%51%
ACT+3D70%80%35%70%64%
DP55%65%20%35%44%
DP330%20%0%40%23%
CordViP(Ours)85%90%90%95%90%
  • DP3 在真实场景中反而弱于 2D 版 DP(与 Wang et al. 的观察一致),论文将其归因于 DP3 对点云质量(遮挡/噪声)极敏感;CordViP 对点云质量鲁棒性显著更强。
  • 样本效率(Fig. 7):在 PickPlace/FlipCup 上随演示数增长的对比曲线中,CordViP 仅用 10 条演示就已能建立有效对应关系并维持较高成功率,优于 ACT/DP/DP3。
  • 光照泛化(Table II,PickPlace/FlipCup,暗光/白光/彩光三种):DP 在多数光照条件下几乎失败(如 dim/colored 均 0%);ACT+3D 55–80% 区间;CordViP 保持 80–90%
  • 场景泛化(Table III,含 Scene-1/Scene-2/杂乱场景):DP 在所有场景均接近 0%;ACT+3D 在杂乱场景骤降到 5%/20%;CordViP 在杂乱场景仍维持 75%/85%
  • 未见物体泛化(Table IV,三个未见物体):CordViP 在 PickPlace 上 75–90%,FlipCup 上 45–75%,总体优于或持平 ACT+3D,明显优于 DP。
  • 视角泛化(Table V,三个相机视角):DP 在三种视角下全部 0%(对相机视角极敏感);ACT+3D 部分视角能到 60%,但有视角降到 0%;CordViP 在所有视角保持 60–80%
  • 组件消融(Table VI):去掉接触+协同预训练的 CordViP 平均降到 79%;仅去掉接触预训练降到 84%(FlipCup 单项从 90%→75%,显示接触信息对高接触任务更关键);仅去掉协同预训练降到 83%(Assembly/ArtiManip 等需要手臂-手连续协调的任务下降更明显);把交互感知点云直接喂给 DP3(不改 DP3 本身架构)也能把 DP3 从 23% 提到 71%,说明交互感知点云本身就是本文的核心贡献之一,不完全依赖后续的对应关系学习。
  • 骨干可迁移性(Table VIII):同一套预训练编码器接到 Transformer(ACT 式 CVAE)骨干上,四任务成功率为 PickPlace 90%(扩散骨干 85%,更优)、FlipCup 75%(扩散骨干 90%,更低)、Assembly 90%(与扩散骨干持平)、ArtiManip 80%(扩散骨干 95%,更低),整体证明该表征可迁移到扩散/Transformer 两类决策头,但具体任务上两种骨干各有优劣、并非全面碾压。
  • 失败案例分析:FlipCup 任务中手腕旋转后偶发悬停(推测因采集演示时人为放慢腕部速度导致的抖动被策略学成次优解,作者建议增大 horizon/n_action_steps 缓解);Assembly 任务中观察到策略能在插入失败后自我调整姿态并最终成功,体现较强的实时 3D 空间推理能力。

创新点与影响

  • 贡献:①提出”交互感知点云”生成管线——用数字孪生(TripoSR)+ 6D 位姿跟踪(FoundationPose)+ 机器人正运动学分别重建物体/手点云,替代传统 RGBD 直接合成点云的方式,从根本上规避多指手操作中的遮挡问题,并对相机视角变化天然鲁棒;②提出用物体中心接触图 + 手臂-手协同信息做编码器预训练任务,显式学习空间/时间对应关系;③把该表征接到扩散策略与 Transformer 策略两种骨干上都验证有效,四个真实灵巧操作任务平均 90% 成功率,大幅超过 2D/3D 基线,且样本效率更高(10 条演示即可用)、对光照/视角/物体/场景扰动的泛化能力更强。
  • 改变了什么:把 3D 模仿学习的”点云质量依赖相机”问题转化为”点云质量依赖位姿估计与正运动学模型”——用视觉基础模型的先验去补足传感器观测的缺陷,同时用显式接触图/协同关系预训练取代”指望扩散策略自己从全局点云学会关注哪里”的隐式学习方式;消融证明仅把交互感知点云喂给 DP3 就能带来 23%→71% 的巨大提升,说明表征本身(而非仅预训练目标)是主要增益来源。
  • 作者自陈局限:①方法难以准确估计可变形物体的 6D 位姿,受限于 FoundationPose 的表达能力;②数字孪生建模精度直接影响位姿跟踪与初始物体点云质量,这对精细灵巧操作是关键瓶颈,作者提出加装腕部相机作为可能的缓解方向。

原始链接

一手源存档(sources/)

  • cordvip—project-page — 项目主页快照,含作者/单位、摘要、GitHub/arXiv 链接(sources/embodied/2025/cordvip—project-page.md)
  • cordvip—github-readme — GitHub README 快照,含 RSS 2025 收录时间线、完整训练/评测命令示例、各 baseline 超参、致谢(DP3/DRO-Grasp/FoundationPose)(sources/embodied/2025/cordvip—github-readme.md)
  • 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)