一句话定位

R3D 系统诊断了 3D 点云策略学习为何无法从更强骨干中获益的”scaling paradox”,把根因锁定在 Batch Normalization 与 3D 数据增强缺失两点上,进而提出一个”高容量 Transformer 点云编码器 + 空间保真 Diffusion Transformer 解码器”架构,在 RoboTwin 2.0(Easy 83.8% / Hard 64.8% 平均成功率)、ManiSkill2(55.2%)与真机 6 任务实验上全面超过 DP3、ManiFlow、RDT、Pi0 等基线。

背景与定位

Diffusion PolicyACT 为代表的 2D 视觉运动策略靠扩散动作解码、动作分块两套范式被现代 VLA(RT-2、OpenVLA、pi0、UniVLA)沿用,但依赖 2D 图像投影天然限制了跨视角泛化与跨本体迁移。以 DP3iDP3、3D Diffuser Actor 为代表的 3D 策略学习路线试图通过规范化的 3D 场景表示解决这一问题——天然融合多视角、具备视角不变性、建立一致的世界坐标系——但一直被两个反直觉现象拖累:DP3 曾发现”轻量 PointNet 骨干反而优于更强大的架构”这一”scaling paradox”,以及训练本身的不稳定性。这两个问题此前阻止了 Point Transformer V3、Uni3D、Point-SAM 等更强 3D 架构真正被用到策略学习里。

R3D 的定位是纯粹的”诊断 + 修复 + 架构再设计”:先证明该 scaling paradox 的根因是 Batch Normalization 在小批量模仿学习设定下的失效(而非骨干容量本身的问题),以及此前实现普遍省略了 3D 数据增强;再基于修复后的稳定训练配方,设计一个能被大规模 3D 分割数据预训练、并保留密集空间分辨率的策略架构。基准环境为 RoboTwin 2.0(双臂平台,Easy/Hard 两档)与 ManiSkill2,并在 xArm6 真机上验证。对比基线覆盖 2D(DP、ACT)、隐式 3D/2.5D(Spatial Forcing、DP+eVGGT)、VLA(RDTPi0)与既有 3D 策略(DP3、ManiFlow)四条路线。

模型架构

整体流程:点云编码器(可在 3D 分割任务上预训练)编码输入点云为一组结构化 token,Diffusion Transformer 解码器通过交叉注意力对这些 token 去噪出动作。

3D 几何编码器(Backbone):借鉴 3D 分割模型 Point-SAM 的架构,编码器只用 LayerNorm(不用 BN)

  • 用 Farthest Point Sampling(FPS)采样 N_C 个中心点,k-NN 分组邻域патches;
  • 每个 patch 经带 LN 的轻量 PointNet 投影为 D 维 latent embedding;
  • patch embedding 叠加中心点位置编码后,送入若干层自注意力(权重从预训练 2D ViT 初始化);
  • 编码器输出 N_C 个结构化 point token F^geo ∈ R^(N_C×D),不做 CLS/全局池化——这是与 DP3(坍缩为单一全局描述符)和 Uni3D(附加 CLS token 取全局特征)的关键区别,刻意保留完整空间分辨率供下游解码器使用。
  • 编码器规模三档:tiny (53MB) / small (115MB) / base (366MB)(ViT 尺寸)。RoboTwin 2.0 默认 1024 点设置下 tiny 最优(Table 2:83.8% vs small 76.8% / base 73.0%);真机 8192 点设置下 small 更优(Table 4:81.8% vs tiny 68.0% / base 80.2%)——点云密度越高越需要更大的 ViT 容量。

动作解码器(Diffusion Transformer, DiT):基于条件扩散建模,学习把噪声动作序列 a^(K)~N(0,I) 迭代精炼为干净动作序列 a^(0)。解码器不再用全局 latent 向量 + FiLM 调制(DP3 做法),而是让噪声动作 query 直接与完整几何 token 集合做交叉注意力。三类 token 共享同一 D 维空间:

  1. 几何 token:观测窗口 T_o 内历史点云 token 拼接,F^geo ∈ R^((T_o·N_P)×D);
  2. 本体感知 token:每步关节状态 q_t 经 MLP 得到,F^prio ∈ R^(T_o×D);
  3. 动作 token:噪声动作序列 a_t^(k) 经 MLP embedding,F^act ∈ R^(T_a×D)。 所有 token 加相对时间步的可学习时序 embedding;扩散步 k 的正弦 embedding 前置于动作 token 序列。DiT 用几何+本体感知 token 作交叉注意力上下文,动作 token 作待去噪的 query,最终经 MLP 解码为动作块。解码器深度消融(4/8/12 层注意力块)表明 4、8 层显著优于更浅配置,超过 8 层无进一步收益;权衡效率后正式实验采用 4 层注意力块(对照:ManiFlow 用 12 层 DiTX)。

ACTION 头:连续动作空间的条件扩散(DDPM 风格去噪,非离散 token 化、非流匹配)。

多目标解码(proprioceptive grounding 辅助任务):额外引入一组 7 维任务空间动作 token(3D 平移 xyz + 4D 四元数 wxyz,机器人基座坐标系),与关节空间动作 token 同步去噪;解码器自注意力层加单向因果掩码——任务空间 token 可以看关节空间 token,反之不行——这样辅助监督不会干扰主要的关节控制目标,属于”free lunch”(末端位姿本就由正运动学与关节角唯一确定,无需额外数据采集)。

配置数字:观测/动作 horizon 上,RoboTwin 2.0/真机训练用 planning horizon = 16(DP3 默认为 8);点云分辨率仿真 1024 点、真机 8192 点;ManiSkill2 训练同时启用点云颜色(对照 DP3 在 ManiSkill2 上不用颜色)。

数据

3D 编码器预训练语料:ScanNet + ARKitScenes(室内场景扫描)+ PartNeXt(带 part 级标注的合成数据集)。为对齐策略输入配置,所有点云降采样到 1024 或 8192 点;由于用如此稀疏的点数直接表示完整室内场景会过度稀疏,采用**分块(block partitioning)**策略切分大场景以保留局部几何细节。沿用 Point-SAM 的训练协议,但把其原本的 Voronoi 细分 patchify 换成 k-NN 分组(更契合本任务的数据分布);Point-SAM 原用 Uni3D-large ViT 骨干处理高分辨率点云,本文换用更轻量的 ViT-tiny/small/base 三档(对应缩小 embedding 维度等超参)。

下游策略训练数据

  • RoboTwin 2.0:Easy/Hard 各选 5 个代表性双臂任务,每任务 50 条示范,点云裁剪桌面+地面后降采样到 1024 点。
  • ManiSkill2:3 个代表任务(PickCube、StackCube、PegInsertionSide),每任务 1000 条示范;PegInsertionSide 按 Point Cloud Matters 的做法拆成 Grasp/Align/Insert 三个子阶段;点云裁剪去地面后 FPS 降采样到 1024 点;PickCube 额外把目标位置可视化为绿色球体点云。
  • 真机(xArm6 + 2× Intel RealSense D435,1 eye-to-hand + 1 eye-in-hand):6 个任务(Place Kettle on Stove、Open Drawer、Fold Towel、Place Cup、Stack Three Blocks、Fit Banana on Plate),覆盖 pick-and-place / 铰接物体 / 软体 / 长程 4 类任务类型;每任务 50 条人工遥操作示范,训练 1000 epoch。原始深度用 CDM(Camera Depth Model)增强,多视角点云经 EasyHeC++ 手眼标定变换到基座坐标系后合并(合并后 200k–400k 点),固定 workspace box(x∈[-0.5, 0.82],y∈[-0.7, 0.8])裁剪,再用 FPS 降采样到 8192 点。推理时点云以 ~30Hz 实时融合更新(为降延迟关闭 CDM)。
  • 数据配比/来源:预训练三源室内/合成数据集与仿真/真机机器人轨迹数据完全分离,论文未做仿真-真机联合训练或第三方机器人数据 co-training;预训练权重仅用于初始化编码器,随后在各任务上端到端微调整个策略。
  • 数据清洗:过滤连续关节动作差为零的静止帧(借鉴 AirExo-2 的轨迹采样方法),避免策略学会在静止片段”僵住”从而在部署时无限冻结。
  • 数据增强三件套(训练期在线做,非离线扩充数据规模):① FPS Randomization——每步随机化点顺序,防止编码器依赖确定性采样顺序;② Point Cloud Color Jitter——RGB 通道亮度扰动范围 [-0.125, 0.125]、对比度/饱和度范围 [0.5, 1.5];③ 对点云坐标和本体感知向量加适度高斯噪声 + 随机点 dropout。
  • 相机视角消融:真机上对比单视角(仅 eye-to-hand)与双视角配置——所有方法双视角均优于单视角,R3D 在两种设置下都优于全部基线(Table 9)。

训练方法

目标函数:条件扩散去噪目标(模仿学习,非 RL)。

两阶段流程:(1) 编码器预训练——沿用 Point-SAM 协议,在 ScanNet/ARKitScenes/PartNeXt 上训练 40 epoch;(2) 策略端到端微调——用预训练编码器初始化,逐任务在 RoboTwin 2.0 / ManiSkill2 / 真机数据上联合训练编码器+DiT 解码器,训练 1000 epoch,batch size 256(RoboTwin 2.0)或 2048(ManiSkill2,同时启用点云颜色),planning horizon 16,点云分辨率 1024(仿真)/8192(真机)。

两条关键训练配方修复(第 3 节的诊断结论,是本文的核心贡献之一):

  • BN→LN:把编码器内所有 Batch Normalization 替换为 Layer Normalization。消融证实 BN 在小批量模仿学习场景下会让强骨干(Uni3D)完全训练失败(成功率 0%),换成 LN 后 Uni3D 反而显著超过 PointNet(64.7% vs 59.6%,Table 1);LN 对 PointNet 本身不掉点,故被定为更稳健的默认选择。
  • 数据增强:无增强时训练/验证曲线剧烈波动、成功率随训练推进反而下降(严重过拟合);引入前述三件套增强后训练明显稳定,成功率显著提升。

多目标解码训练细节:辅助末端位姿 token 与关节动作 token 在同一扩散过程里联合去噪,因果掩码保证信息单向流动(任务空间→关节空间,不反向),消融显示该辅助任务带来适度的平均成功率提升(Table 7:79.75% vs 无辅助的77.50%*,*注:Table 7 中带辅助 EE 的完整配置 79.75% 相较去掉 EE 辅助的”Dense Feat. Cond.”配置 77.50% 提升约 2.25pt)。

其余消融确认的设计选择:全局特征+FiLM 条件(62.50%)→ 换成本文的注意力式密集特征条件(77.50%)带来大幅提升且训练更稳定;预训练编码器(77.50%)优于从头训练(65.75%)。

Infra(训练 / 推理工程)

  • 编码器预训练:PointSAM 式 3D 编码器在 8 张 NVIDIA H20 GPU 上训练 40 epoch;具体 GPU-hours 未披露。
  • 策略主训练(R3D 本身):论文附录只给出 epoch(1000)、batch size(256/2048)、planning horizon(16)等超参,未明确说明使用的 GPU 型号/数量(对照附录里各基线均标注了具体硬件,例如 Spatial Forcing 用 1×NVIDIA H100、ManiFlow 用 1× 24GB RTX 4090、ACT+PonderV2/RDT 用多卡训练);GitHub 仓库的训练脚本支持通过传入多个 GPU id 启用 DDP 多卡训练,但未给出实际使用的卡数。
  • 精度(fp16/bf16/fp32):未披露。
  • 真机推理:点云实时融合更新频率 ~30Hz(推理时关闭 CDM 深度增强以降低延迟);策略前向推理的控制频率(control-Hz)或端到端动作延迟数字未披露
  • 边缘硬件:真机平台为 xArm6 机械臂 + 2× Intel RealSense D435 RGB-D 相机,无额外板载加速硬件信息披露。

评测 benchmark

BN vs LN(Table 1,RoboTwin 2.0 3 任务):DP3(PointNet+BN) 1.0% / DP3(PointNet+LN) 59.6% / DP3(Uni3D+BN) 0.0% / DP3(Uni3D+LN) 64.7%。

编码器规模(Table 2,1024 点,5 任务均值):tiny 83.8% > small 76.8% > base 73.0%。

编码器规模 × 示范数量(Table 3,5 个 Easy 任务均值):tiny 在 50/100/200 demos 下分别为 83.8% / 95.3% / 97.8%,均优于 small(76.8/89.0/92.4)与 base(73.0/86.5/88.2)。

编码器规模(Table 4,8192 点,真机点云密度设置):small 81.8% 最优,tiny 68.0%,base 80.2%。

RoboTwin 2.0 Easy(Table 5a,5 任务均值,成功率%):DP+eVGGT 25.6 / Spatial Forcing 50.2 / DP3 61.0 / RDT 45.4 / DP 30.6 / ManiFlow 73.0 / R3D 83.8(单任务:Beat Hammer 91、Move Card 85、Turn Switch 56、Open Micro. 100、Place Shoe 87)。

RoboTwin 2.0 Hard(Table 5b,5 任务均值):ACT+eVGGT 10.6 / DP+eVGGT 26.0 / DP3 22.6 / RDT 22.2 / ManiFlow 61.6 / R3D 64.8(单任务:Beat Hammer 37、Lift Pot 67、Adjust Bottle 98、Burger Fries 95、Press Stapler 27——Press Stapler 上 R3D 反而不如 ManiFlow 的 44%)。

ManiSkill2(Table 6,5 项均值):DP+SPuNet 33.4 / DP+PointNet 34.0 / ACT+PonderV2 42.4 / DP3 23.0 / R3D 55.2(PickCube 97、StackCube 24——弱于 ACT+PonderV2 的 35%、PegIns.-Grasp 97、Align 75、Insert 21)。长程精细任务 PegInsertion 的 Align/Insert 阶段,R3D(75%/21%)远超基线(如 ACT+PonderV2 仅 23%/2%)。

消融(Table 7,4 任务均值):全局特征条件 62.50% → 密集特征条件(预训练编码器)77.50% → 从头训练编码器(密集特征)65.75% → 完整版(预训练+密集特征+辅助 EE)79.75%

真机 3 任务(Table 8,各 50 trial):DP 48.7 / Pi0 52.0 / DP3 40.7 / ManiFlow 47.3 / R3D 68.7(Place Kettle 76、Open Drawer 64、Fold Towel 66)。

单视角 vs 双视角(Table 9,真机 3 任务均值):R3D 单视角 51.3% / 双视角 68.7%,均优于对应设置下的全部基线(DP 30.7/48.7,DP3 26.0/40.7,ManiFlow 38.0/47.3;Pi0 因预训练依赖双视角只报双视角 52.0%)。

光照鲁棒性(Table 10,正常光 vs disco 变色光干扰):R3D 68.7%→58.7%(降 10pt),相对降幅小于 DP3(40.7→30.7)等基线。

真机 6 任务(附录 Table A,4 类任务类型):DP3 29.7 / DP 44.0 / R3D 60.7(Stack Three Blocks 12、Place Cup 82、Fit Banana 64、Place Kettle 76、Open Drawer 64、Fold Towel 66)。

创新点与影响

贡献:(1) 首次系统定位 3D 策略学习”scaling paradox”(强骨干反而更差)与训练不稳定的根本原因——Batch Normalization 失效 + 缺失数据增强,而非架构容量本身的问题;(2) 提出把 3D 分割领域(Point-SAM/Uni3D)的高容量 Transformer 编码器接入策略学习的架构配方(LN-only + 保留密集空间 token),并证明该设计使编码器可在 ScanNet 等大规模 3D 分割数据上预训练再迁移到操作任务;(3) 用交叉注意力替代 DP3 的”全局特征+FiLM”条件方式,验证空间分辨率保留对精细操作任务(如 PegInsertion 的 Align/Insert 阶段)至关重要;(4) 提出”零额外数据”的末端位姿辅助解码任务,作为正运动学层面的免费监督信号。

改变了什么:推翻了 DP3 提出的”轻量 PointNet 优于更强 3D 骨干”这一此前被广泛引用的经验结论——证明该现象是 BN+缺失增强共同导致的训练失效假象,而非骨干容量的内在缺陷;把 LN 确立为 3D 策略更稳健的默认归一化方式;首次把大规模 3D 场景分割预训练(ScanNet/ARKitScenes/PartNeXt)的几何先验迁移进机器人操作策略,并在仿真与真机上都验证了增益;证明 3D 点云策略在多视角融合(单视角→双视角提升)与光照鲁棒性上优于 2D/2.5D 基线。

局限:论文正文未设专门的 Limitations 小节。从评测数据本身可以看到的具体短板包括:ManiSkill2 的 StackCube 任务成功率(24%)仍低于 ACT+PonderV2(35%);RoboTwin 2.0 Hard 场景的 Press Stapler 任务(27%)不如 ManiFlow(44%);真机场景在 disco 变色光干扰下成功率仍从 68.7% 降至 58.7%(降幅小于基线但并未消除);此外,主训练阶段的具体 GPU 型号/数量、精度设置、以及真机部署的控制频率/端到端延迟均未在论文中披露。

原始链接

一手源存档(sources/)