一句话定位
SGRv2 给点云操作策略加入”动作局部性”(action locality)归纳偏置——用编码器-解码器架构逐点预测目标的相对位置、再按可学权重加权聚合,而不是像前作 SGR 那样从一个全局向量直接回归动作——RLBench 上仅用 5 条示范就把平均成功率从 SGR 的 23.6% 推到 53.2%,在 ManiSkill2 + MimicGen 稠密控制上把成功率提到 SGR 的约 2.54 倍。
背景与定位
机器人操作的模仿学习长期依赖大量示范来达到可用的成功率,这与 CV/NLP 能低成本利用海量互联网数据形成鲜明对比。CNN 靠平移等变性、RNN/LSTM 靠时序依赖分别把对应的归纳偏置嵌进架构里提升样本效率;但机器人操作里一个同样关键、此前研究未充分利用的归纳偏置是动作局部性——末端执行器在执行阶段内的动作,主要由目标物体及其与局部环境的交互决定,而非整个场景的全局表征。
前作 SGR(CoRL 2023)已经把 2D 语义(CLIP 特征反投影到点云)与 3D 几何(PointNeXt 编码器)融合成一个表征,但动作仍靠 PointNeXt 编码器输出的单一全局特征向量回归,完全没有利用局部性,示范数从 100 降到 5 时性能大幅跳水。同期的体素化路线(PerAct)与多视角渲染路线(RVT、后续 RVT-2)虽然在 100 条示范设定下取得强成功率,但也没有专门针对少样本设计动作局部性;另一条侧重局部性/等变性的路线(EDFs、L-NDF、RiEMann 等基于 SE(3)-Transformer 的局部消息传递方法)需要手工指定感受野大小超参数,在局部性与表达能力之间存在权衡;Transporter Networks / PerAct / RVT 这类”预定义网格上打分取最大值”的方法则存在体素量化伪影。SGRv2 的定位是:在 SGR 的语义-几何融合表征基础上,通过逐点特征 + 相对位置预测 + 可学权重聚合,不依赖网格、不需要手工感受野超参数地把动作局部性系统性地注入整个框架,同时首次让同一套设计能同时支持关键帧控制(keyframe,如 RLBench)和稠密控制(dense control,如 ManiSkill2、MimicGen)两种模式。
模型架构
整体基座:沿用 SGR 的语义分支 + 几何分支 + 融合网络结构——RGB 过冻结 CLIP-ResNet-50 图像编码器提取语义特征并反投影到 3D 点上(语义分支),点云坐标与 RGB 过 PointNeXt 编码器提取几何特征(几何分支),两路特征在编码器与解码器(几何分支的第二阶段)交界处拼接融合。
locality 的 4 个核心设计(相对 SGR 的改动):
- 编码器-解码器架构:SGR 只用 PointNeXt 编码器(encoder-only),SGRv2 换成完整的 U-Net 式编码器-解码器(PointNeXt-XL),擅长逐点稠密预测(如分割)。解码器输出每个点一个逐点特征 f_i^raw ∈ ℝ^C,C=64;由于 PointNeXt 设计上特征只依赖相对坐标,f_i 对输入坐标的平移变换保持不变。之后过一个线性层+ReLU把特征维度升到 256,作为后续动作预测头的输入。
- 相对位置预测:不直接回归绝对目标位置,而对每个点预测”目标相对该点的位移” Δp(f_i)(3 层 MLP)。关键帧下 a_pos = p_i + Δp(f_i);稠密控制下把位置动作分解成方向和幅度分别预测——方向由 (p_i+Δp(f_i))/‖p_i+Δp(f_i)‖ 表示,幅度由另一个 3 层 MLP m(f_i) 预测。稠密控制下点云被转换到末端执行器坐标系(借鉴 FrameMiner),因此 p_i+Δp(f_i) 可解读为”目标相对末端执行器的位置”。这一设计不依赖非局部的质心减法(centroid subtraction)就实现了平移等变性。旋转 r(f_i)、夹爪开合 o(f_i)、(关键帧下的)避障标志位 c(f_i) 同样各由一个 3 层 MLP 逐点预测。
- 加权平均聚合(可学权重):对每个动作分量(位置的方向+幅度、旋转、夹爪、避障标志位)各配一个独立的 3 层 MLP 权重头 w_*(f_i)(跨点维度做 softmax 归一化),把逐点预测加权聚合成最终动作,让模型自动聚焦到最有信息量的局部区域(如抓取任务里聚焦在物体本身而非桌面)。论文可视化发现高权重点与物体的功能可供性(affordance)区域高度对齐(涌现能力,未额外监督)。
- 稠密监督:损失同时作用于聚合后的动作预测与每个点的逐点预测(ℒ_* = ℒ_^aggregated + ℒ_^points,同一套真值标签),为所有点提供反馈信号,加速局部特征学习。
关键帧 vs 稠密控制的动作定义:关键帧动作 a^keyframe = {a_pos, a_rot, a_open, a_collide}(跟随 PerAct 协议);稠密动作 a^dense = {a_Δpos, a_Δrot, a_open}(跟随 ManiSkill2/robosuite 协议)。旋转在关键帧下按每轴 R=5° 一格离散化为 one-hot 分类;稠密控制下旋转用轴角(axis-angle)连续 3 维向量直接回归。关键帧下额外输入本体感知数据 z(夹爪开合状态、左右指关节位置、动作序列时间步 4 个标量),稠密控制不使用本体感知输入。
配置数字汇总:3D 编码器-解码器 PointNeXt-XL;原始逐点特征维度 C=64→处理后 256;Δp/m/r/o/c/w_* 均为 3 层 MLP;语言指令编码用 CLIP 文本编码器(跟随 SGR);旋转离散化粒度 5°;仅面向单臂 Franka Panda 平行爪,未做跨本体(cross-embodiment)设计;参数总量论文未披露。
数据
RLBench(关键帧控制):26 个任务(8 个来自 SGR、18 个来自 PerAct/RVT),主实验每任务仅 5 条示范(另在附录测试了 10/20/50/100 条示范下的表现)。4 个 RGB-D 传感器相机(前/左肩/右肩/腕部),仿真采集分辨率 128×128。数据增强:平移扰动 ±0.125m、yaw 旋转扰动 ±45°;color drop 概率 0.4(随机把 RGB 置零,是 PointNeXt 的强增强手段);FPS 重采样到 4096 点;demo augmentation(从轨迹中间状态到关键帧状态的转移也纳入训练,而非只用初始状态到关键帧,显著扩充训练数据量)。
ManiSkill2(稠密控制):4 个任务——LiftCube、PickCube、StackCube、PickSingleYCB(后者用 8 个 YCB 物体:002_master_chef_can、004_sugar_box、005_tomato_soup_can、006_mustard_bottle、007_tuna_fish_can、008_pudding_box、010_potted_meat_can、011_banana)。前 3 个任务每任务 50 条示范,PickSingleYCB 每个物体 50 条示范。前视 + 腕部视 2 个 RGB-D 相机。
MimicGen(稠密控制):7 个任务(Stack、StackThree、Square、Threading、Coffee、HammerCleanup、MugCleanup),每任务 50 条示范,用更宽泛更具挑战性的 D1 初始分布(附录另测了 200/1000 条示范设定)。
数据增强(稠密控制):feature drop 概率 0.4(随机把语义特征置零、保留 RGB,弥补 color drop 会让部分依赖颜色的任务不可解的问题);FPS 重采样到 1200 点;点云坐标变换到末端执行器坐标系(而非关键帧下的机器人底座坐标系)。
评测协议:RLBench 训练 20,000 迭代、每 800 迭代存 checkpoint;ManiSkill2/MimicGen 训练 100,000 迭代、每 4,000 迭代存 checkpoint;均取最后 5 个 checkpoint 各评测 50 个 episode 取平均(而非 MimicGen 原论文取所有 checkpoint 中的最大值,作者认为平均值更能反映真实鲁棒性),并跑 3 个随机种子取平均。
真实机器人:Franka Emika Panda + 平行爪,Intel RealSense L515(前置单相机),关键帧控制 + MoveIt 运动规划。长程任务每任务 8 条示范(Tidy Up the Table 6 个子任务;Make Coffee 4 个子任务,共 10 个子任务,多任务联合训练一个模型,每子任务测 10 个 episode);泛化任务(Move Color Cup to Target)用 6 种颜色的杯子,每种见过的颜色(白/红/黄/橙)各采 5 条示范(共 20 条),在 4 个见过配色 + 2 个未见配色(黑/绿)场景上测试,每种颜色测 10 个 episode。RGB-D 原始分辨率 1280×720,最近邻插值下采样到 256×256(避免双线性插值给深度图引入伪影/噪声点云)。
训练方法
纯行为克隆(BC),无 RL 成分。
损失函数:关键帧 ℒ_keyframe = α₁ℒ_pos + α₂ℒ_rot + α₃ℒ_open + α₄ℒ_collide,其中 ℒ_pos 为 L1 loss,ℒ_rot/ℒ_open/ℒ_collide 为交叉熵;实验中 α₁=300,α₂=α₃=α₄=1。稠密控制 ℒ_dense = β₁(ℒ_dir+ℒ_mag) + β₂ℒ_rot + β₃ℒ_open + β₄ℒ_reg,其中 ℒ_dir/ℒ_mag/ℒ_rot 为 MSE,ℒ_open 为交叉熵,ℒ_reg 为平滑正则(惩罚不同点预测出的目标位置彼此不一致,缓解”仅约束方向”带来的欠定问题、防止 Δp 输出异常大值);实验中 β₁=10,β₂=β₃=1,β₄=0.3。
超参数(关键帧 / 稠密控制):训练迭代 20,000 / 100,000;学习率 0.003 / 0.0003;batch size 16 / 16;优化器均为 AdamW;调度器均为 Cosine;warmup 步数 200 / 0;weight decay 均为 1×10⁻⁶;color drop 0.4 / 0;feature drop 0 / 0.4;输入点数 4096 / 1200。
真实机器人训练:训练 40,000 步,取最终 checkpoint 评测(不做 last-5 平均)。
Infra(训练 / 推理工程)
- 训练硬件:每个任务的实验均在单张 NVIDIA GeForce RTX 3090 GPU 上完成;论文未披露多卡/分布式训练细节,无跨任务联合训练的大规模集群数字。
- 训练耗时:关键帧控制 20k 步约 5 小时;稠密控制 100k 步约 7 小时(均在单张 RTX 3090 上,论文 Appendix B.4 原文数字)。
- 推理速度:关键帧控制 10 FPS;稠密控制 30 FPS(同为单张 RTX 3090)。
- 并行策略/精度:论文未披露混合精度、模型并行等细节。
- 真实机器人:Intel RealSense L515 感知 + MoveIt 运动规划,控制频率/端到端延迟未披露。
评测 benchmark
RLBench,5 条示范(Table 1,26 任务平均):
| 方法 | 平均成功率 | 平均 Rank |
|---|---|---|
| R3M | 4.7 | 5.8 |
| PointNeXt | 25.3 | 3.4 |
| PerAct | 22.3 | 4.1 |
| SGR | 23.6 | 4.1 |
| RVT | 40.4 | 2.2 |
| SGRv2 | 53.2 | 1.2 |
SGRv2 比最强基线 RVT 平均提升 1.32×(53.2/40.4),在 26 个任务中的 23 个上超过 RVT。逐任务示例(成功率%,SGRv2 vs RVT):Toilet Seat Up 89.6 vs 47.6、Turn Tap 87.9 vs 38.4、Put In Drawer 75.9 vs 19.6、Slide Block 100.0 vs 85.1、Drag Stick 94.9 vs 45.7;SGRv2 落后的仅有 3 个任务(对应”23/26”里的另外 3 个):Open Fridge 13.2 vs 24.0、Take Out Umbrella 74.5 vs 85.3、Place Wine 53.1 vs 92.7。
RLBench 随示范数变化(Table 6,100→5 条示范):RVT 依次为 52.1/46.3/43.3/42.3/40.4;SGRv2 依次为 63.3/62.4/61.9/56.0/53.2 — SGRv2 从 100 条降到 5 条仅跌 10.1 个绝对点,RVT 跌 11.7 个点,但 SGRv2 在每个示范数下都显著领先。
RLBench,100 条示范(Table 5):PointNeXt 33.1、PerAct 36.7、SGR 47.8、RVT 52.1、SGRv2 63.3。
ManiSkill2,50 条示范(Table 2,4 任务):PointNeXt 16.8(Rank 2.5)、SGR 14.9(Rank 2.5)、SGRv2 55.8(Rank 1.0)——LiftCube 80.5、PickCube 72.9、StackCube 27.7、PickSingleYCB 42.2。
MimicGen,50 条示范(Table 2,7 任务,D1 分布):PointNeXt 13.6(Rank 2.9)、SGR 14.2(Rank 2.0)、SGRv2 26.0(Rank 1.0)——Stack 81.2、StackThree 37.9、Square 2.8、Threading 6.7、Coffee 27.9、HammerCleanup 16.1、MugCleanup 9.7。论文摘要称”在 ManiSkill2 和 MimicGen 上 SGRv2 成功率是 SGR 的 2.54 倍”(作者原话,未在正文给出该比值的具体计算口径)。
MimicGen 更多基线/示范数(Appendix D):50 条示范另加 R3M 5.3、2D BC 10.6、2D BC-RNN 10.0(均远低于 SGRv2 的 26.0);200 条示范下 2D BC 21.9、2D BC-RNN 41.1、SGRv2 55.8;1000 条示范下 SGR 42.1、PointNeXt 42.3、2D BC 32.3、2D BC-RNN 63.2、SGRv2 66.2(此时 2D BC-RNN 已能追近,说明时序建模与 SGRv2 的定位互补,而非替代)。
消融(Table 3,RLBench 5-demo 26 任务平均):
| 配置 | 平均成功率 |
|---|---|
| SGRv2(完整) | 53.2 |
| w/o 解码器(仅编码器全局特征) | 21.3 |
| w/ 绝对位置预测(非相对位置) | 21.0 |
| w/ 均匀点权重(非可学权重) | 44.2 |
| w/o 稠密监督 | 40.1 |
去掉解码器跌 31.9 点、改绝对位置预测跌 32.2 点(幅度最大,印证相对位置预测是核心)、均匀权重跌 9.0 点、去掉稠密监督跌 13.1 点。
真实机器人长程任务(10 子任务,10 episode/子任务,8 条示范/任务):PerAct 平均 30、RVT 平均 41、SGRv2 平均 63。子任务示例(PerAct/RVT/SGRv2):Put funnel onto carafe 0/20/80、Pour water 10/30/70、Open drawer 20/40/60、Put lollipop in drawer 10/10/30。
真实机器人泛化任务(颜色杯子,见过/未见过配色):PerAct 100/10、RVT 100/5、SGRv2 w/o 语义分支 100/0、SGRv2 100/70——去掉语义分支后模型在未见颜色上完全失效(0%),证明语义分支对颜色泛化是必要的。
视觉干扰物鲁棒性(Appendix E,3 个 RLBench 任务,训练时无干扰物、测试时加入无关物体):Meat Off Grill / Phone On Base / Push Buttons,RVT 无干扰 90.5/62.3/90.4 → 有干扰 65.0/2.5/67.5;SGRv2 无干扰 96.5/84.1/93.2 → 有干扰 92.4/80.4/81.7。SGRv2 掉点明显更小,作者将其归因于可学点权重天然聚焦物体可供性区域、对无关物体不敏感。
创新点与影响
贡献:(1)把”动作局部性”系统化为可训练的架构设计——编码器-解码器逐点特征 + 相对位置预测 + 可学权重聚合 + 稠密监督四件套——而不是像 EDFs/RiEMann/L-NDF 那样依赖手工感受野超参数,也不像 Transporter/PerAct/RVT 那样把动作离散到预定义网格上打分;(2)用相对位置预测在不依赖非局部质心减法的前提下实现了平移等变性;(3)首次让同一套表征框架同时支持关键帧控制(RLBench)与稠密控制(ManiSkill2/MimicGen)两种主流控制范式,此前工作大多只专注一种;(4)可学点权重自发学出与物体功能可供性对齐的可视化模式(涌现能力),并带来对视觉干扰物的鲁棒性和对未见颜色的语义泛化能力。
改变了什么:在与前作 SGR 完全相同的语义-几何融合表征基座上,仅靠改变动作建模方式(全局向量回归→逐点局部预测),就把 RLBench 5-demo 平均成功率从 23.6% 拉到 53.2%(按 Table 1 数字换算约 2.25 倍,非论文原文直接给出的比值),验证了”动作局部性”这一归纳偏置本身的价值,而不需要更强的视觉编码器或更多数据;也把 SGR 从”关键帧专用”扩展为”关键帧+稠密控制通用”框架。
作者自陈局限(论文第 5 节 Discussion):(1)目前仅用 vanilla BC 目标训练,未结合更擅长处理多模态/异构轨迹分布的 Diffusion Policy,作者认为这是提升真实世界表现的一个有前景方向;(2)由于论文聚焦于样本效率,对泛化能力(物体形状、相机位置、背景纹理等维度)的评测目前还不充分,作者计划后续扩展。此外官方 GitHub 仓库截至抓取时 TODO 列表显示:基线模型脚本、消融实验脚本、稠密控制的具体实现代码均尚未开源(仅开源了 RLBench 关键帧控制部分)。
原始链接
- arXiv:https://arxiv.org/abs/2406.10615 (PDF:https://arxiv.org/pdf/2406.10615)
- 项目页:https://sgrv2-robot.github.io
- 代码:https://github.com/TongZhangTHU/sgr (与前作 SGR 共用同一仓库;README 显示当前仅开源 RLBench 关键帧控制训练/评测代码,稠密控制实现与消融脚本待发布)
一手源存档(sources/)
- sgrv2—project-page — 项目主页快照(含摘要、真实机器人视频实验列表、BibTeX,fetched 2026-07-16)
- sgrv2—github-readme — GitHub
TongZhangTHU/sgrREADME 快照(含安装/训练/评测命令、TODO 列表,fetched 2026-07-16) - 论文全文见上述 arXiv 链接(arXiv 原文 PDF,不入 git;已读 v2 全文 HTML,含正文与全部附录 A-F)