一句话定位
Render and Diffuse(R&D)把候选的末端执行器动作渲染成虚拟夹爪图像叠加到 RGB 观测上,让扩散去噪过程直接在图像空间里完成,靠这个「观测-动作空间统一」的归纳偏置换取样本效率和空间泛化能力;RLBench 11 个任务上用 20/10 条示范训练时,最佳变体 R&D-AI 平均成功率 68.6%/52.1%,比 Diffusion Policy(52.6%/32.1%)和 ACT(56.2%/35%)高出十几个百分点,且优势在示范稀疏、需要空间插值的场景下最明显。
背景与定位
论文把自己放进「对齐观测与动作空间」这一支脉络里:C2F-ARM、PerAct 把工作空间体素化,在体素网格里做下一最优位姿检测;Act3D、ChainedDiffuser 则把场景抬升成连续 3D 点云特征场,在同一 Cartesian 空间里采样候选点打分。这些方法都要求准确的深度信息(真实点云或体素化的场景),且多是分层结构——先用学习到的策略或运动规划器预测离散关键位姿(keypose),再开环执行。R&D 想要的是不依赖场景深度、直接学习逐步的低层控制策略,同时仍然保留”观测-动作对齐”这个归纳偏置。
它的解法是反过来:不去把 RGB 抬升成 3D 场景表示,而是利用已知的机器人运动学模型和相机模型,把”如果执行这个动作,夹爪会变成什么样子”这件事直接渲染成一张图,叠加在当前 RGB 观测上。这样,观测和动作被统一进同一个图像空间 I,不需要真实深度传感器,只需要相机外参/内参标定和夹爪的 CAD 网格。这与 Diffusion Policy(把动作扩散建立在观测的隐向量条件上,不显式对齐两个空间)和 ACT(CVAE + action chunking,同样不做空间对齐)形成对比——R&D 的消融显示,仅仅是把渲染的动作图像作为输入(不管去噪预测本身发生在动作空间还是图像空间),就能带来大部分性能提升。
同一个 Dyson Robot Learning Lab 两个月后发表的 Genima 是这条路线的自然延伸:把这里手工设计的 ViT + CAD 渲染管线换成预训练 Stable Diffusion + ControlNet,直接生成完整的未来机器人图像作为动作表示,呼应了本文”未来工作”里提到的”接入图像基础模型”的方向。
模型架构
渲染动作表示(Rendered Action Representation):给定动作 a(表示为末端执行器速度,属于 se(3)),先用指数映射 T(a)=Expmap(a) 得到相对位姿变换,再结合当前夹爪位姿 T_{w_g}、相机外参 T_{w_c}、夹爪 CAD 模型和相机内参 K_c,渲染出图像 R^c 和这次渲染自带的局部点云 P^c(渲染引擎自己产生的”合成深度”,不需要真实深度传感器): R^c, P^c = Render(T_{w_c}^{-1} × T_{w_g} × T(a) × Gripper, K_c)。 外部相机渲染完整夹爪;腕部相机为避免遮挡只渲染手指(用另一套简化网格);渲染的夹爪加了纹理色以打破两指夹爪的左右对称性,帮助模型判别完整 6D 位姿。真实世界实验里 Robotiq 2F-140 的网格因渲染耗时过高被”大幅简化”(在 128×128 分辨率下精细网格不带来额外信息)。
R&D 方法族(三个变体,区别在于去噪更新发生在哪个空间):
- R&D-A——直接在动作空间学噪声 ε(与 Diffusion Policy 相同的去噪目标),渲染图像只作为输入条件,让网络显式看到当前噪声动作的空间含义。
- R&D-I——在图像空间预测逐像素去噪方向 F∈R^{H×W×3}(可理解为相机系下的逐点 3D 光流/空间梯度),不直接在动作空间预测噪声。
- R&D-AI——同时在两个空间做预测:图像空间的 F 用于常规去噪迭代(且当渲染落在相机视野外时可退回到动作空间预测),动作空间的 ε 额外在最后一步扩散(负责高频、精细修正)时起作用。11 任务消融显示 R&D-AI(68.6/52.1)优于 R&D-A(63.9/46.7)和 R&D-I(62.8/46.3),验证了融合两个空间预测的价值。
夹爪开合:作为独立的二值变量 a_g,用专门的头单独预测(BCE 损失)——因为渲染表示只画了张开的夹爪,不包含开合状态本身。
骨干网络:ViT 风格 Transformer,8 层自注意力、embedding 维度 1024(16 头 × 64 维/头)、patch size 16、MLP ratio 4(GitHub 仓库 rendif_config.py 默认值,与论文正文一致)。图像 patch(RGB 观测 + 渲染动作表示)转成 token,拼接夹爪状态 s_g、扩散时间步 k 的 embedding 以及(R&D-A/AI 变体的)动作 token,经多层自注意力处理;不同相机视角、不同时间步(过去/未来)分别加上独立的可学习位置编码,让自注意力能区分信息来源;最终 token 线性解码为逐相机去噪方向 F、二值夹爪动作 a_g、以及动作空间噪声 ε。
历史/预测视界:H=2 帧过去观测,预测 T=8 步未来动作(与 Diffusion Policy 一致的约定),2 个相机视角(1 个外部 + 1 个腕部)。可训练参数约 90M–100M(与两个基线对齐以便公平比较)。
扩散调度:训练时 50 步去噪(标准 DDPM 前向过程),推理时借助 DDIM 噪声调度只需 4 步。
跨本体/动作空间:仅在单臂设置下验证(仿真 Franka Emika Panda 平行爪,真实世界 Franka + Robotiq 2F-140),不含跨本体设计;动作表示为相对末端执行器速度(6D,se(3))。论文明确说明当前只渲染张开的夹爪,若要覆盖完整机器人构型需要额外的正运动学(Forward Kinematics),留作未来工作。
数据
纯离线示范模仿学习(behaviour cloning),全文不含任何在线 RL。
仿真主实验(RLBench,Franka Emika Panda):11 个任务(Reach Target / Push Button / Close Microwave / Pick up Cup / Push Buttons / Close Laptop / Phone on Base / Slide Block to Target / Lift Lid of Saucepan / Open Box / Open Drawer),每任务采集 20 条示范(以及一个 10 条示范的低数据子集做对比),示范由直线末端执行器运动和 RRT-Connect 规划器路径混合而成(多模态数据集)。物体随机初始化,不保证工作空间覆盖均匀。为避免 RRT 轨迹主导数据集(丢失观测-动作相关性),Place Phone on Base 与 Slide Block to Target(以及 Close Laptop)把物体旋转限制在 ±45° 内。机器人起始位姿被设定为让整个夹爪在前置相机视野内(专门为了能评测纯图像空间预测的 R&D-I 变体)。每个设置在 100 个未见物体位姿上评测。
空间泛化实验:选 RLBench 里对空间泛化要求最高的 4 个任务(Open Box / Lift Lid of Saucepan / Place Phone on Base / Slide Block to Target),用贪心 Furthest Point Sampling 算法采集示范,使工作空间覆盖随示范数增加从稀疏(仅边缘)逐渐变密;因可达性限制,这批数据不含 RRT 轨迹。工作空间尺寸(x×y×θ):Lift Lid 35cm×44cm×90°、Phone on Base 5cm×44cm×90°、Open Box 5cm×20cm×45°、Slide Block 15cm×40cm×90°。评测在整个工作空间做网格状采样(同时变化位置和朝向)。
多任务实验:同上 4 个任务,各 20 条示范,单一网络加一个可学习的目标(goal)嵌入,联合训练后各评测 100 episode。
真实世界部署:Franka Emika Panda + Robotiq 2F-140 平行爪夹爪,6 个日常任务(放下马桶盖 / 清扫橱柜 / 放苹果入抽屉 / 打开纸箱 / 打开抽屉 / 关闭抽屉),每任务通过 2 台机器人主从关节镜像遥操采集 20 条示范,采集过程中机器人与物体的相对位姿被随机化(移动物体,或用带轮底座移动机器人)。观测来自 2 台标定过的 RealSense D415(1 个肩部外部相机 + 1 个腕部相机),纯 RGB(不用深度)。每任务做 10 次评测,位姿在示范凸包内重新随机(测试插值而非外推能力)。
数据组合/协同训练:无——除多任务实验外,仿真每个任务单独训练一个策略;不涉及仿真-真实协同训练、互联网规模数据或跨本体数据混合。动作标签直接来自遥操/规划器轨迹(相对末端执行器速度),不需要额外的动作标注流程。
训练方法
损失函数:Loss = L1(F, F_gt) + L1(ε, ε_gt) + BCE(a_g, a_g^gt)。图像空间目标 F_gt 由几何关系直接算出,不需要额外的编码器:F_gt = T(a_gt, a_noisy) × P − P,即渲染点云在”真实动作位姿”和”当前噪声动作位姿”下的位置差。用 L1 而非 MSE(消融显示换成 MSE 会掉点)。
推理时的多相机融合:每个相机独立预测去噪方向 F^c,按 DDIM 更新规则更新该相机渲染点云 P^{k-1} = √α_{k-1} P̂^0 + √((1-α_{k-1})/(1-α_k))(P^k − √α_k P̂^0),其中 P̂^0 = P^k + F^k。各相机点云投影到统一参考系后,用 SVD(Arun et al. 1987 的最小二乘刚体配准)求解对齐 P^{k-1} 与 P^k 的 SE(3) 变换 T_{k-1,k},再把该变换作用在动作上得到 a^{k-1}——网络本身不需要显式学习相机外参,多视角融合完全靠这个几何求解步骤完成。整个过程重复 K 次(推理 4 步)直至提取出最终 a^0。
超参数(论文 Sec V-B + GitHub rendif_config.py):batch size 8,训练 100k 迭代(论文正文);学习率 1e-4(1e-3 在小 batch 下训练不稳定);输出归一化到 [-1,1] 是”model 能学到任何有意义东西”的必要条件;patch size 16 是甜点(32×32 显著掉点,8×8 部分任务提升但算力代价明显增大)。
消融里”什么有用/什么没用”(附录):EMA 无明显影响;把图像先过 ResNet 编码器再输入 Transformer 会显著掉点;用 UNet(在隐空间融合多相机/多时间步)替代 Transformer 明显更差;推理开始时用确定性方式初始化(保证渲染初始都在腕部相机视野内)平均反而降低性能;加入本体感受(6D 位姿)信息无明显变化;训练时随机遮盖某个相机视角(view-masking)对不同任务效果有增有减,作者认为这个方向值得深入但本文未展开。
Infra(训练 / 推理工程)
- 训练硬件 / GPU 数量 / 训练时长:未披露——论文正文与附录均未给出训练用的 GPU 型号、数量或训练所需的 GPU-小时/挂钟时间,是本文相对同类工作(如 Act3D 明确报告 V100 数量和天数)的一个信息缺口。
- 并行策略、训练精度(fp16/bf16 等):未披露。
- 推理:论文给出的唯一具体推理数字——“在笔记本电脑的 NVIDIA RTX A3000 GPU 上,不做额外优化,以 4 Hz 跑完整个去噪过程”(对应 R&D-AI、推理 4 步 DDIM,即每个控制步 4 次完整前向 + 4 次渲染)。
- 真实机器人控制:用标准末端执行器位置控制器执行预测动作;论文未给出真实世界部署时的额外控制延迟或控制频率数字。
- 渲染开销的工程取舍:真实世界用的 Robotiq 2F-140 网格因原始网格渲染耗时过高、且在 128×128 分辨率下细节收益有限,被替换为大幅简化的 3D 模型(见论文 Fig. 13)。
评测 benchmark
Table I——RLBench 11 任务(10/20 条示范,各 100 次测试)成功率(%):
| 任务(#10/#20) | DP | ACT | R&D-A | R&D-I | R&D-AI |
|---|---|---|---|---|---|
| Reach Target | 8/29 | 11/36 | 28/49 | 31/53 | 36/61 |
| Push Button | 39/70 | 43/71 | 52/65 | 55/61 | 61/77 |
| Close Microwave | 62/87 | 59/81 | 53/87 | 59/88 | 65/91 |
| Pick up Cup | 29/46 | 34/50 | 65/81 | 53/75 | 67/84 |
| Push Buttons | 4/31 | 9/23 | 69/73 | 82/88 | 79/82 |
| Close Laptop | 35/70 | 31/64 | 43/73 | 37/68 | 44/71 |
| Phone on Base | 18/41 | 32/50 | 47/61 | 50/58 | 51/63 |
| Slide Block | 32/40 | 41/58 | 35/47 | 38/51 | 43/55 |
| Lift Lid of Saucepan | 63/81 | 70/89 | 68/89 | 71/90 | 71/92 |
| Open Box | 21/39 | 23/46 | 26/51 | 18/38 | 25/47 |
| Open Drawer | 42/45 | 32/50 | 28/27 | 15/21 | 31/32 |
| 平均 | 32.1/52.6 | 35/56.2 | 46.7/63.9 | 46.3/62.8 | 52.1/68.6 |
R&D 三个变体全面超过 DP 与 ACT,在需要显著空间泛化(Lift Lid)或有相似干扰物(Push Buttons)的任务上优势最大。R&D-I 与 R&D-A 表现接近,说明大部分收益来自”把渲染图像作为输入”这一点,而非去噪预测发生在哪个空间;R&D-AI 融合两者进一步小幅提升。唯一的例外是 Open Drawer:R&D 三个变体全部劣于两个基线(如 20 条示范下 R&D-A/I/AI 为 27/21/32,DP 为 45,ACT 为 50),作者将其归因于前置相机对抽屉手柄的严重遮挡 + 该任务示范中大量 RRT 生成的任意抓取动作,削弱了图像-动作对齐的价值;作者验证若固定抽屉位置使手柄始终可见,性能提升超过 25 个百分点。
Table II——多任务设置(4 任务,单网络,20 条示范/任务,括号内为相对单任务设置的成功率变化):
| 任务 | R&D | DP | ACT |
|---|---|---|---|
| Lift Lid | 75 (−17) | 60 (−21) | 67 (−22) |
| Open Box | 58 (+11) | 41 (+2) | 48 (+2) |
| Phone on Base | 40 (−23) | 38 (−3) | 42 (−8) |
| Slide Block | 45 (−10) | 26 (−14) | 40 (−18) |
多任务设置下所有方法均较单任务下降(数据更少样、动作空间归一化后不再针对单任务定制),但 R&D 仍相对领先;Open Box 反而提升,作者推测是更多样数据带来的正则化效果。
Table III——超参消融(相对 base 模型的成功率变化,4 任务/20 示范/100 episode):
| 变体 | Δ% |
|---|---|
| Base | 0 |
| No-Texture(渲染夹爪不加纹理) | −6 |
| No-Hist(只用当前观测,H=1) | −14 |
| Depth-6(6 层自注意力) | −1 |
| Depth-12(12 层自注意力) | −1 |
| Heads-8(8 头,64 维/头) | −10 |
| Heads-20(20 头,64 维/头) | +2 |
历史帧(H=2 vs 1)与纹理化渲染贡献最明确;Transformer 深度(6/8/12 层)影响不大,宽度(注意力头数)影响显著。论文文字另提到 R&D-Steps-2/8/16(推理时用不同扩散步数)“在超过某个阈值后基本不影响性能”,但未给出具体数值表格,故不列入上表。
Table IV——真实世界 6 任务(各 10 次评测,x/10):Toilet Seat Down 10/10、Sweep Cupboard 8/10、Place Apple(in Drawer) 8/10、Open Box 10/10、Open Drawer 10/10、Close Drawer 10/10。失败案例:Place Apple 因苹果被夹爪遮挡且不在腕部相机视野内;Sweep Cupboard 因海绵柔顺抓取偶尔未能扫净所有咖啡豆(策略未使用力反馈或纠正动作)。论文额外定性提到,在存在明亮干扰物或同类多物体(如多个苹果)时,R&D 在没有任何数据增强的情况下仍保持约 70% 的成功率(非正式基准表格数字,仅为文中定性描述)。
创新点与影响
贡献(作者自陈三点):(1)提出一种把低层机器人动作和 RGB 观测统一进同一图像空间的新方式——用已知机器人运动学 + 相机模型”渲染”动作,而非体素化或点云化整个场景;(2)基于这一表示提出去噪更新可发生在动作空间/图像空间/两者结合的 R&D 方法族(A/I/AI);(3)在仿真里系统评测空间泛化能力与样本效率,并在真实世界 6 个日常任务上验证可行性。
改变了什么:把”对齐观测-动作空间”这一此前依赖真实场景深度(体素化的 PerAct、点云化的 Act3D/ChainedDiffuser)的范式,变成只需要相机外参标定 + 机器人 CAD/运动学模型即可实现的纯 RGB 方法,且渲染点云的”合成深度”是渲染引擎免费提供的,不依赖真实深度传感器。在低数据、稀疏工作空间覆盖场景下相对基线优势最大,随示范数增加优势收窄(与预期一致,高容量基线在数据足够密集时也能隐式学到映射)。这一思路两个月后被同实验室的 Genima 直接继承并放大——用预训练 Stable Diffusion + ControlNet 取代本文手工设计的 ViT + CAD 渲染管线,呼应了本文”未来工作”里提到的”接入 DINO 等图像基础模型”的方向。
作者自陈局限(论文 VI 节):(1)推理是渲染+前向传播的多轮迭代过程,计算开销大(笔记本 GPU 上仅 4Hz,且未做额外优化);(2)依赖相机标定,某些场景下可能拿不到;(3)对严重遮挡、数据不一致的任务(如 Open Drawer)处理不好;(4)输入输出空间维度高,训练较难收敛,需要评估多个 checkpoint 才能拿到最佳效果;(5)方法变体和超参数组合多(A/I/AI×深度×头数×纹理×历史帧×推理步数),难以为具体任务找到最优配置。未来工作方向:扩展渲染表示以覆盖完整机器人构型(含夹爪开合,需要正运动学)、更高效的网络架构、更好的跨空间预测融合方式、以及接入 DINO 等预训练图像基础模型。
原始链接
- arXiv: https://arxiv.org/abs/2405.18196 (PDF: https://arxiv.org/pdf/2405.18196)
- 项目页: https://vv19.github.io/render-and-diffuse/
- 代码: https://github.com/vv19/rendiff
- 会议: RSS 2024(Robotics: Science and Systems)
一手源存档(sources/)
- render-and-diffuse—project-page — 项目主页快照(fetched 2026-07-16)
- render-and-diffuse—github-readme — GitHub
vv19/rendiffREADME 快照(fetched 2026-07-16) - 论文全文见上述 arXiv 链接(arXiv 原文 PDF,不入 git;已读 v1 全文 HTML)