一句话定位

RISE 是一个端到端的单视角点云操作策略:用一个浅层稀疏卷积(MinkowskiEngine)编码器把噪声点云压缩成 60~80 个 3D token,经稀疏位置编码后送入 transformer 编码器-解码器,再由一个读出 token 查询动作特征,交给 Diffusion Policy 式扩散头解出连续动作;每个真机任务仅用 50 条演示,就在 6 个自建真机任务上全面超越 2D 基线(ACT、Diffusion Policy)和 3D 基线(Act3D、DP3),并在相机视角、光照、桌面高度改变等分布外扰动下保持显著更强的泛化能力。

背景与定位

范式:single-view point-cloud-conditioned continuous-action imitation(3D 感知 + 连续动作模仿学习)。 论文把视觉模仿学习的痛点归结为两条路线的取舍:

  • 2D 图像策略ACTDiffusion Policy、RT-1、RH20T 等)从固定相机视角学习隐式空间表征,对相机位姿变化敏感,且往往需要多路相机、多个独立图像编码器来增强稳定性和精度,增加参数量与算力开销。
  • 3D 点云策略(PerAct、Act3D、RVT、HiveFormer、ChainedDiffuser、GNFactor 等)虽然天然带有空间信息,但大多预测关键帧(keyframe)而非连续动作——关键帧标注需要额外人工,且在接触密集、环境剧烈变化的场景中表现不佳;作者指出这类方法难以做连续控制的根本原因是高效 3D 特征编码的实时性没有解决好。同时这批工作大多只在 RLBench、CALVIN 等仿真基准上验证,未在真实机器人上评测连续控制。

RISE 的定位是填补这一空白:直接从单视角点云预测连续动作轨迹,用稀疏卷积换取高效率的 3D 编码,从而把 3D 感知的空间优势和 2D 端到端连续控制策略的实时性结合起来。论文与同期工作 DP3 明确对比——DP3 同样用点云 + 扩散头,但论文的真机实验发现 DP3 在其(更宽泛的物体摆放范围、非轴向自然动作表示的)演示数据上难以学到有意义的动作,因网络容量有限而受限。RISE 的 transformer 模块直接复用 ACT 的 transformer 结构(原用 DETR 实现),扩散动作解码器直接复用 Diffusion Policy 的 CNN 扩散头,3D 编码器基于 MinkowskiEngine 的稀疏卷积(choy2019minkowski),因此 RISE 本质上是”用一个浅层稀疏 3D 编码器替换 2D 图像编码器”这条最简干净路线的验证性基线(baseline)。数据采集流程沿用同实验室的 RH20T 触觉手柄遥操作方案。

作者:Chenxi Wang(Shanghai Noematrix Intelligence Technology)、Hongjie Fang、Hao-Shu Fang(通讯作者)、Cewu Lu(通讯作者),均来自/关联上海交通大学。发表于 IROS 2024(pp. 2870-2877, doi: 10.1109/IROS58592.2024.10801678)。

模型架构

RISE 由三个函数组成:稀疏 3D 编码器 h_E: O^t → F_P^t,transformer h_T: F_P^t → F_A^t,扩散动作解码器 h_D: F_A^t → A^t。

输入表示:单视角 RGB-D 点云 O^t = {P_i^t = (x,y,z,r,g,b)},来自单个固定”全局相机”(Intel RealSense D435,仅 3D 策略只用这一路相机;2D 图像基线额外用一路腕部相机)。裁剪范围 x,y∈[-0.5m,0.5m]、z∈[0m,1m];动作预测目标是接下来 n 步 A^t={A_{t+1},…,A_{t+n}},每个 A_i 含平移、旋转、夹爪宽度。

稀疏 3D 编码器 h_E:基于 MinkowskiEngine 稀疏卷积实现的浅层 ResNet 架构——1 个初始卷积层 + 4 个残差块 + 1 个末端卷积层,每两个组件之间插入共 5 个 2× 稀疏池化层;作者强调层数可自由增加,但浅层编码器已足够。体素大小 5mm,输出点特征维度 512。裁剪到 1×1×1 m³ 空间后,点云仅产生 ~60–80 个 token(少于 ACT 每张图像的 300 个 token,但消融显示点云版 ACT 仍优于原版)。

稀疏位置编码(SPE):因为点 token 不像图像/语言 token 那样分布在规则网格上,作者为每个点坐标 (x,y,z) 定义 pos_k=k/v+c(v、c 为固定偏移常量,实验里 v=5mm、c=400),再对每个轴分别做正弦/余弦位置编码(编码维度 d_x=d_y=⌊d/3⌋、d_z=d-d_x-d_y)拼接成完整 SPE,使 transformer 能建模无序点之间的相对空间关系。

Transformer h_T:编码器-解码器结构,4 个编码块、1 个解码块,d_model=512,d_ff=2048;解码阶段用**一个读出 token(readout token,维度 512)**查询动作特征 F_A^t(不额外输入本体感知/proprioception 信号)。

扩散动作解码器 h_D:采用 Diffusion Policy 式 CNN 扩散头,条件于 F_A^t 对高斯噪声 N(0,σ²I) 做迭代去噪(DDPM 简化目标函数),推理时用 DDIM 调度器加速;训练 100 步去噪迭代,推理仅 20 步。动作表示:平移用相机坐标系下绝对位置,旋转用连续的 6D 表示(rot6d),二者加夹爪宽度,均归一化到 [-1,1](平移归一化范围 x,y∈[-0.35m,0.35m]、z∈[0m,0.7m];夹爪宽度按 [0m,0.11m] 归一化)。输出动作视界(horizon)为 20 步

数据

  • 真机数据采集:Flexiv Rizon 机械臂 + Dahuan AG-95 夹爪,两台 Intel RealSense D435 RGBD 相机(一台固定”全局”视角、一台装在末端执行器上的”腕部”相机);工控机为 Intel Core i9-10900K + NVIDIA RTX 3090。数据采集流程与 RH20T 一致——基于触觉设备(haptic device)的末端执行器遥操作。
  • 6 个真机任务,4 种类型,每任务采集 50 条专家演示:拾取放置(Collect Cups、Collect Pens)、6 自由度任务(Pour Balls)、推向目标(Push Block、Push Ball,Push Ball 需用记号笔当工具)、长时程任务(Stack Blocks)。评估时每个策略跑 20 次连续试验,物体在约 50cm×70cm 工作空间内随机摆放。
  • Collect Cups/Pens 的演示细分:按 1/2/3/4/5 个物体各采 10 条演示(共 50 条),演示平均步数从 117.4(1 杯)递增到 520.0(5 杯),平均遥操作耗时 19.4s→76.0s。
  • Stack Blocks:2/3/4 个方块场景分别采 10/20/20 条演示(共 50 条)。
  • DP3 对照专用数据:为分析 DP3 失败原因,额外在 Collect Cups(1 杯) 任务上分别用**轴向动作表示(axis-wise,键盘遥操作)自然动作表示(natural,触觉设备遥操作)**各采 50 条演示;轴向表示步数更少(30.2 步)但遥操作耗时反而更长(45.9s vs 自然表示 17.1s),与 mandlekar2018roboturk 的发现一致。
  • 数据增广(仅训练时):点云沿 X/Y/Z 轴随机平移 [-0.2m,0.2m],随机旋转 [-30°,30°]。
  • 未使用仿真数据或跨任务/跨具身的数据混合——全部为单一实验室真机遥操作数据,无额外课程设计。

训练方法

  • 目标函数:扩散去噪的简化 DDPM 目标(ho2020denoising),条件是编码后的点云特征。
  • 训练配置2 张 NVIDIA A100 GPU,batch size 240,初始学习率 3e-4,warmup 2000 步,之后用 cosine 学习率调度器衰减。
  • 基线复现:ACT、Diffusion Policy、Act3D、DP3 均基于官方开源实现训练。Diffusion Policy 基线用 ResNet18 视觉编码器 + CNN 扩散骨干;Act3D 基线额外实现了一个简单的运动规划器(先水平移动、下降动作在后,抬升动作在前)避免拾取放置任务中的碰撞;“ACT(3D)“消融是把 ACT 的图像 token 替换成点云 token;“Diffusion Policy(3D)“消融是用一个 AvgPooling 层从点特征得到观测嵌入。
  • 推理执行:DDIM 采样,20 步去噪迭代(训练用 100 步)。

Infra(训练 / 推理工程)

  • 训练硬件:2× NVIDIA A100 GPU;GPU-hours 未披露;未披露是否使用混合精度。
  • 推理硬件:单张 NVIDIA RTX 3090 + Intel Core i9-10900K CPU 工作站(同时用于数据采集与实时评估)。
  • 推理延迟/控制频率(Hz)/FPS:论文未直接给出数值型 FPS 或延迟数字;仅定性指出 RISE 在 Push Block / Push Ball 等需要即时响应环境动态变化的任务中表现良好,说明其推理速度足以支撑实时闭环控制,但未披露具体 Hz。
  • 点云规模:单帧点云裁剪到 1×1×1 m³ 空间后仅含 ~60–80 个稀疏 token(体素 5mm),这是其效率的核心来源(对比 ACT 每图像 300 token)。

评测 benchmark

Pick-and-Place(Collect Cups / Collect Pens,正文描述,Fig.2):与 ACT、Diffusion Policy、Act3D 相比,RISE 在物体数 <3 时完成率超过 90%,即使 4-5 个物体也保持 65% 以上完成率,全面超越所有基线;Act3D 表现与图像基线相当,但因需要专门运动规划器、无法对突发环境变化即时响应,作者此后不再将其作为主基线。

6-DoF 任务 Pour Balls(Table I,动作成功率 / 完成率,10 个球,20 次试验)

MethodGraspPourPlaceOverall 完成率If-Poured 完成率
ACT30%30%0%13.0%43.3%
Diffusion Policy55%55%35%30.5%55.5%
RISE80%80%70%49.0%61.3%

Push-to-Goal(Table II,20 次试验)

TaskMethod成功率平均距离 d (cm)↓
Push BlockDiffusion Policy50%5.67
Push BlockRISE55%3.51
Push BallDiffusion Policy30%6.05
Push BallRISE60%4.89

长时程 Stack Blocks(Table III,平均堆叠块数/总块数,10 次试验)

Method2 blocks3 blocks4 blocks
ACT0.6/10.5/20.3/3
Diffusion Policy0.7/10.5/20.5/3
RISE0.8/11.5/20.9/3

3D 感知有效性消融(Table IV,Collect Cups 5 杯,10 次试验)

Method3D相机数完成率
ACT212%
ACT + 3D 编码器132%(↑20)
Diffusion Policy224%
Diffusion Policy + 3D 编码器136%(↑12)
DP310%
Act3D128%
RISE166%

即使只用 1 台相机,把稀疏 3D 编码器接到 ACT / Diffusion Policy 后完成率显著提升,甚至超过 3D 关键帧策略 Act3D,验证 3D 感知模块本身的效果;DP3 在此设置下完全学不到有效动作(0%)。

DP3 失败分析(Table V,Collect Cups 1 杯,10 次试验,不同动作表示)

Method轴向 (axis-wise)自然 (natural)
DP3, hor.40%0%
DP3, hor.80%0%
DP3, hor.1620%0%
DP3, hor.2440%0%
RISE80%100%

作者判断 DP3 编码器容量不足以建模真实遥操作数据中多样的状态-动作对,只能在轴向表示下勉强学到部分动作模式;RISE 在两种动作表示下都能保持高完成率。

泛化测试(Table VI,Collect Pens 1 支笔,10 次试验,四级环境扰动 L1 换碗颜色 / L2 换光照 / L3 抬升工作台 13cm / L4 换相机视角)

MethodOriginalBowl(L1)Light(L2)Height(L3)CamView(L4)
ACT80%70%(-10)40%(-40)0%(-80)0%(-80)
Diffusion Policy70%50%(-20)30%(-40)0%(-70)0%(-70)
Act3D70%40%(-30)60%(-10)50%(-20)10%(-60)
RISE90%80%(-10)80%(-10)80%(-10)50%(-40)

2D 图像策略在 L3/L4 涉及空间变换的扰动下几乎完全失效;Act3D 能扛住 L3 但在 L4(相机视角变化)近乎完全失败;RISE 在全部四级扰动(包括最难的相机视角变化)中都保持最强的泛化能力。

创新点与影响

  • 首个证明”单视角点云 + 连续动作扩散头”可行的真机端到端基线:不同于此前 3D 策略多预测关键帧、依赖运动规划,RISE 证明稀疏卷积编码器可以高效到支撑连续动作输出,在接触密集、环境快速变化的任务(Push-to-Goal、长时程堆叠)中优势明显。
  • 稀疏位置编码(SPE):为无序、非规则分布的点 token 设计了一种基于坐标的正弦/余弦位置编码方案,使标准 transformer 可以直接处理点云 token,而不需要专门的点云 transformer 架构。
  • 消融证明 3D 感知本身有效、非架构魔法:把同一个稀疏 3D 编码器接到 ACT / Diffusion Policy 上即可大幅提升两者在真实世界的表现(Table IV),说明性能提升主要来自 3D 模态而非 RISE 特有的网络设计;同时揭示 DP3 在其(更小容量点云编码器 + 更宽物体摆放范围)设置下会完全失效,指出网络容量是 3D 策略的一个关键瓶颈。
  • 单相机替代多相机:3D 感知让 RISE 仅用一路全局相机即达到甚至超过 2D 基线用两路相机(含腕部相机)的效果,降低硬件与部署复杂度。
  • 作者自陈局限 / 失败案例(附录 V-D):失败主要集中在抓取和放置阶段的位置误差;RISE 能自动纠正抓取时因位置误差导致的物体轻微移位(Failure #1),但许多关键帧类方法(Act3D、PerAct、ChainedDiffuser)缺乏这种即时纠错能力,容易放大错误。论文本身未在真机上测试跨具身/跨机器人泛化、也未量化推理延迟或控制频率。RISE-2(2025-05 后续工作,同一团队开源)进一步引入 2D 视觉基础模型的语义知识来弥补纯 3D 感知在语义理解上的不足。

原始链接

一手源存档(sources/)