一句话定位
RISE 是一个端到端的单视角点云操作策略:用一个浅层稀疏卷积(MinkowskiEngine)编码器把噪声点云压缩成 60~80 个 3D token,经稀疏位置编码后送入 transformer 编码器-解码器,再由一个读出 token 查询动作特征,交给 Diffusion Policy 式扩散头解出连续动作;每个真机任务仅用 50 条演示,就在 6 个自建真机任务上全面超越 2D 基线(ACT、Diffusion Policy)和 3D 基线(Act3D、DP3),并在相机视角、光照、桌面高度改变等分布外扰动下保持显著更强的泛化能力。
背景与定位
范式:single-view point-cloud-conditioned continuous-action imitation(3D 感知 + 连续动作模仿学习)。 论文把视觉模仿学习的痛点归结为两条路线的取舍:
- 2D 图像策略(ACT、Diffusion Policy、RT-1、RH20T 等)从固定相机视角学习隐式空间表征,对相机位姿变化敏感,且往往需要多路相机、多个独立图像编码器来增强稳定性和精度,增加参数量与算力开销。
- 3D 点云策略(PerAct、Act3D、RVT、HiveFormer、ChainedDiffuser、GNFactor 等)虽然天然带有空间信息,但大多预测关键帧(keyframe)而非连续动作——关键帧标注需要额外人工,且在接触密集、环境剧烈变化的场景中表现不佳;作者指出这类方法难以做连续控制的根本原因是高效 3D 特征编码的实时性没有解决好。同时这批工作大多只在 RLBench、CALVIN 等仿真基准上验证,未在真实机器人上评测连续控制。
RISE 的定位是填补这一空白:直接从单视角点云预测连续动作轨迹,用稀疏卷积换取高效率的 3D 编码,从而把 3D 感知的空间优势和 2D 端到端连续控制策略的实时性结合起来。论文与同期工作 DP3 明确对比——DP3 同样用点云 + 扩散头,但论文的真机实验发现 DP3 在其(更宽泛的物体摆放范围、非轴向自然动作表示的)演示数据上难以学到有意义的动作,因网络容量有限而受限。RISE 的 transformer 模块直接复用 ACT 的 transformer 结构(原用 DETR 实现),扩散动作解码器直接复用 Diffusion Policy 的 CNN 扩散头,3D 编码器基于 MinkowskiEngine 的稀疏卷积(choy2019minkowski),因此 RISE 本质上是”用一个浅层稀疏 3D 编码器替换 2D 图像编码器”这条最简干净路线的验证性基线(baseline)。数据采集流程沿用同实验室的 RH20T 触觉手柄遥操作方案。
作者:Chenxi Wang(Shanghai Noematrix Intelligence Technology)、Hongjie Fang、Hao-Shu Fang(通讯作者)、Cewu Lu(通讯作者),均来自/关联上海交通大学。发表于 IROS 2024(pp. 2870-2877, doi: 10.1109/IROS58592.2024.10801678)。
模型架构
RISE 由三个函数组成:稀疏 3D 编码器 h_E: O^t → F_P^t,transformer h_T: F_P^t → F_A^t,扩散动作解码器 h_D: F_A^t → A^t。
输入表示:单视角 RGB-D 点云 O^t = {P_i^t = (x,y,z,r,g,b)},来自单个固定”全局相机”(Intel RealSense D435,仅 3D 策略只用这一路相机;2D 图像基线额外用一路腕部相机)。裁剪范围 x,y∈[-0.5m,0.5m]、z∈[0m,1m];动作预测目标是接下来 n 步 A^t={A_{t+1},…,A_{t+n}},每个 A_i 含平移、旋转、夹爪宽度。
稀疏 3D 编码器 h_E:基于 MinkowskiEngine 稀疏卷积实现的浅层 ResNet 架构——1 个初始卷积层 + 4 个残差块 + 1 个末端卷积层,每两个组件之间插入共 5 个 2× 稀疏池化层;作者强调层数可自由增加,但浅层编码器已足够。体素大小 5mm,输出点特征维度 512。裁剪到 1×1×1 m³ 空间后,点云仅产生 ~60–80 个 token(少于 ACT 每张图像的 300 个 token,但消融显示点云版 ACT 仍优于原版)。
稀疏位置编码(SPE):因为点 token 不像图像/语言 token 那样分布在规则网格上,作者为每个点坐标 (x,y,z) 定义 pos_k=k/v+c(v、c 为固定偏移常量,实验里 v=5mm、c=400),再对每个轴分别做正弦/余弦位置编码(编码维度 d_x=d_y=⌊d/3⌋、d_z=d-d_x-d_y)拼接成完整 SPE,使 transformer 能建模无序点之间的相对空间关系。
Transformer h_T:编码器-解码器结构,4 个编码块、1 个解码块,d_model=512,d_ff=2048;解码阶段用**一个读出 token(readout token,维度 512)**查询动作特征 F_A^t(不额外输入本体感知/proprioception 信号)。
扩散动作解码器 h_D:采用 Diffusion Policy 式 CNN 扩散头,条件于 F_A^t 对高斯噪声 N(0,σ²I) 做迭代去噪(DDPM 简化目标函数),推理时用 DDIM 调度器加速;训练 100 步去噪迭代,推理仅 20 步。动作表示:平移用相机坐标系下绝对位置,旋转用连续的 6D 表示(rot6d),二者加夹爪宽度,均归一化到 [-1,1](平移归一化范围 x,y∈[-0.35m,0.35m]、z∈[0m,0.7m];夹爪宽度按 [0m,0.11m] 归一化)。输出动作视界(horizon)为 20 步。
数据
- 真机数据采集:Flexiv Rizon 机械臂 + Dahuan AG-95 夹爪,两台 Intel RealSense D435 RGBD 相机(一台固定”全局”视角、一台装在末端执行器上的”腕部”相机);工控机为 Intel Core i9-10900K + NVIDIA RTX 3090。数据采集流程与 RH20T 一致——基于触觉设备(haptic device)的末端执行器遥操作。
- 6 个真机任务,4 种类型,每任务采集 50 条专家演示:拾取放置(Collect Cups、Collect Pens)、6 自由度任务(Pour Balls)、推向目标(Push Block、Push Ball,Push Ball 需用记号笔当工具)、长时程任务(Stack Blocks)。评估时每个策略跑 20 次连续试验,物体在约 50cm×70cm 工作空间内随机摆放。
- Collect Cups/Pens 的演示细分:按 1/2/3/4/5 个物体各采 10 条演示(共 50 条),演示平均步数从 117.4(1 杯)递增到 520.0(5 杯),平均遥操作耗时 19.4s→76.0s。
- Stack Blocks:2/3/4 个方块场景分别采 10/20/20 条演示(共 50 条)。
- DP3 对照专用数据:为分析 DP3 失败原因,额外在 Collect Cups(1 杯) 任务上分别用**轴向动作表示(axis-wise,键盘遥操作)和自然动作表示(natural,触觉设备遥操作)**各采 50 条演示;轴向表示步数更少(30.2 步)但遥操作耗时反而更长(45.9s vs 自然表示 17.1s),与 mandlekar2018roboturk 的发现一致。
- 数据增广(仅训练时):点云沿 X/Y/Z 轴随机平移 [-0.2m,0.2m],随机旋转 [-30°,30°]。
- 未使用仿真数据或跨任务/跨具身的数据混合——全部为单一实验室真机遥操作数据,无额外课程设计。
训练方法
- 目标函数:扩散去噪的简化 DDPM 目标(ho2020denoising),条件是编码后的点云特征。
- 训练配置:2 张 NVIDIA A100 GPU,batch size 240,初始学习率 3e-4,warmup 2000 步,之后用 cosine 学习率调度器衰减。
- 基线复现:ACT、Diffusion Policy、Act3D、DP3 均基于官方开源实现训练。Diffusion Policy 基线用 ResNet18 视觉编码器 + CNN 扩散骨干;Act3D 基线额外实现了一个简单的运动规划器(先水平移动、下降动作在后,抬升动作在前)避免拾取放置任务中的碰撞;“ACT(3D)“消融是把 ACT 的图像 token 替换成点云 token;“Diffusion Policy(3D)“消融是用一个 AvgPooling 层从点特征得到观测嵌入。
- 推理执行:DDIM 采样,20 步去噪迭代(训练用 100 步)。
Infra(训练 / 推理工程)
- 训练硬件:2× NVIDIA A100 GPU;GPU-hours 未披露;未披露是否使用混合精度。
- 推理硬件:单张 NVIDIA RTX 3090 + Intel Core i9-10900K CPU 工作站(同时用于数据采集与实时评估)。
- 推理延迟/控制频率(Hz)/FPS:论文未直接给出数值型 FPS 或延迟数字;仅定性指出 RISE 在 Push Block / Push Ball 等需要即时响应环境动态变化的任务中表现良好,说明其推理速度足以支撑实时闭环控制,但未披露具体 Hz。
- 点云规模:单帧点云裁剪到 1×1×1 m³ 空间后仅含 ~60–80 个稀疏 token(体素 5mm),这是其效率的核心来源(对比 ACT 每图像 300 token)。
评测 benchmark
Pick-and-Place(Collect Cups / Collect Pens,正文描述,Fig.2):与 ACT、Diffusion Policy、Act3D 相比,RISE 在物体数 <3 时完成率超过 90%,即使 4-5 个物体也保持 65% 以上完成率,全面超越所有基线;Act3D 表现与图像基线相当,但因需要专门运动规划器、无法对突发环境变化即时响应,作者此后不再将其作为主基线。
6-DoF 任务 Pour Balls(Table I,动作成功率 / 完成率,10 个球,20 次试验):
| Method | Grasp | Pour | Place | Overall 完成率 | If-Poured 完成率 |
|---|---|---|---|---|---|
| ACT | 30% | 30% | 0% | 13.0% | 43.3% |
| Diffusion Policy | 55% | 55% | 35% | 30.5% | 55.5% |
| RISE | 80% | 80% | 70% | 49.0% | 61.3% |
Push-to-Goal(Table II,20 次试验):
| Task | Method | 成功率 | 平均距离 d (cm)↓ |
|---|---|---|---|
| Push Block | Diffusion Policy | 50% | 5.67 |
| Push Block | RISE | 55% | 3.51 |
| Push Ball | Diffusion Policy | 30% | 6.05 |
| Push Ball | RISE | 60% | 4.89 |
长时程 Stack Blocks(Table III,平均堆叠块数/总块数,10 次试验):
| Method | 2 blocks | 3 blocks | 4 blocks |
|---|---|---|---|
| ACT | 0.6/1 | 0.5/2 | 0.3/3 |
| Diffusion Policy | 0.7/1 | 0.5/2 | 0.5/3 |
| RISE | 0.8/1 | 1.5/2 | 0.9/3 |
3D 感知有效性消融(Table IV,Collect Cups 5 杯,10 次试验):
| Method | 3D | 相机数 | 完成率 |
|---|---|---|---|
| ACT | ✗ | 2 | 12% |
| ACT + 3D 编码器 | ✓ | 1 | 32%(↑20) |
| Diffusion Policy | ✗ | 2 | 24% |
| Diffusion Policy + 3D 编码器 | ✓ | 1 | 36%(↑12) |
| DP3 | ✓ | 1 | 0% |
| Act3D | ✓ | 1 | 28% |
| RISE | ✓ | 1 | 66% |
即使只用 1 台相机,把稀疏 3D 编码器接到 ACT / Diffusion Policy 后完成率显著提升,甚至超过 3D 关键帧策略 Act3D,验证 3D 感知模块本身的效果;DP3 在此设置下完全学不到有效动作(0%)。
DP3 失败分析(Table V,Collect Cups 1 杯,10 次试验,不同动作表示):
| Method | 轴向 (axis-wise) | 自然 (natural) |
|---|---|---|
| DP3, hor.4 | 0% | 0% |
| DP3, hor.8 | 0% | 0% |
| DP3, hor.16 | 20% | 0% |
| DP3, hor.24 | 40% | 0% |
| RISE | 80% | 100% |
作者判断 DP3 编码器容量不足以建模真实遥操作数据中多样的状态-动作对,只能在轴向表示下勉强学到部分动作模式;RISE 在两种动作表示下都能保持高完成率。
泛化测试(Table VI,Collect Pens 1 支笔,10 次试验,四级环境扰动 L1 换碗颜色 / L2 换光照 / L3 抬升工作台 13cm / L4 换相机视角):
| Method | Original | Bowl(L1) | Light(L2) | Height(L3) | CamView(L4) |
|---|---|---|---|---|---|
| ACT | 80% | 70%(-10) | 40%(-40) | 0%(-80) | 0%(-80) |
| Diffusion Policy | 70% | 50%(-20) | 30%(-40) | 0%(-70) | 0%(-70) |
| Act3D | 70% | 40%(-30) | 60%(-10) | 50%(-20) | 10%(-60) |
| RISE | 90% | 80%(-10) | 80%(-10) | 80%(-10) | 50%(-40) |
2D 图像策略在 L3/L4 涉及空间变换的扰动下几乎完全失效;Act3D 能扛住 L3 但在 L4(相机视角变化)近乎完全失败;RISE 在全部四级扰动(包括最难的相机视角变化)中都保持最强的泛化能力。
创新点与影响
- 首个证明”单视角点云 + 连续动作扩散头”可行的真机端到端基线:不同于此前 3D 策略多预测关键帧、依赖运动规划,RISE 证明稀疏卷积编码器可以高效到支撑连续动作输出,在接触密集、环境快速变化的任务(Push-to-Goal、长时程堆叠)中优势明显。
- 稀疏位置编码(SPE):为无序、非规则分布的点 token 设计了一种基于坐标的正弦/余弦位置编码方案,使标准 transformer 可以直接处理点云 token,而不需要专门的点云 transformer 架构。
- 消融证明 3D 感知本身有效、非架构魔法:把同一个稀疏 3D 编码器接到 ACT / Diffusion Policy 上即可大幅提升两者在真实世界的表现(Table IV),说明性能提升主要来自 3D 模态而非 RISE 特有的网络设计;同时揭示 DP3 在其(更小容量点云编码器 + 更宽物体摆放范围)设置下会完全失效,指出网络容量是 3D 策略的一个关键瓶颈。
- 单相机替代多相机:3D 感知让 RISE 仅用一路全局相机即达到甚至超过 2D 基线用两路相机(含腕部相机)的效果,降低硬件与部署复杂度。
- 作者自陈局限 / 失败案例(附录 V-D):失败主要集中在抓取和放置阶段的位置误差;RISE 能自动纠正抓取时因位置误差导致的物体轻微移位(Failure #1),但许多关键帧类方法(Act3D、PerAct、ChainedDiffuser)缺乏这种即时纠错能力,容易放大错误。论文本身未在真机上测试跨具身/跨机器人泛化、也未量化推理延迟或控制频率。RISE-2(2025-05 后续工作,同一团队开源)进一步引入 2D 视觉基础模型的语义知识来弥补纯 3D 感知在语义理解上的不足。
原始链接
- 论文(arXiv abs): https://arxiv.org/abs/2404.12281
- 论文 PDF: https://arxiv.org/pdf/2404.12281
- 代码(GitHub): https://github.com/rise-policy/rise
- 项目主页: https://rise-policy.github.io/
一手源存档(sources/)
- rise-3d-perception-imitation—github-readme — GitHub README(rise-policy/rise,含安装/标定/数据采集/训练/评测全流程说明)
- rise-3d-perception-imitation—project-page — 项目主页(摘要、方法图、任务视频描述,未见超出论文正文的额外数字)
- arXiv 全文 PDF(2404.12281,arXiv 原文 PDF,不入 git):见上「原始链接」