一句话定位

GemBench 是 Inria WILLOW 组基于 RLBench 提出的语言-视觉机器人操作泛化能力基准——16 个训练任务(31 变体)、七类动作原语,测试集拆成难度递增的四级泛化(新摆放 / 新刚性物体 / 新铰接物体 / 长程任务,共 44 任务 92 变体);论文同时提出两个策略:纯 3D 点云 Transformer 的 3D-LOTUS(在已见任务上刷新 SOTA、训练效率极高),以及叠加 LLM 任务规划 + VLM 开放词表物体定位的 3D-LOTUS++(在 Level 2-4 未见任务上大幅反超前者与所有基线)。ICRA 2025 录用。

背景与定位

这属于「用系统化多级基准诊断语言-视觉操作策略的泛化边界」这一支路线,直接对标同为 RLBench 底座但只测已见任务分布的 RLBench-18Task/PerAct 与 3d-diffuser-actor,以及此前尝试引入泛化评测但覆盖面较窄的 VIMA-Bench(仅吸盘 pick-and-place)与 Colosseum(偏重光照/相机扰动而非新任务)。论文用一张对照表(Table I)把 RLBench-74/18Task、VLMBench、ALFRED、Calvin、Ravens、Arnold、VIMA-Bench、Colosseum 逐一并列,GemBench 是唯一同时具备「多技能 + 铰接物体 + 属性-物体新组合 + 动作-物体新组合 + 新实例 + 新类别 + 长程」全部七个维度的基准。

范式关键词:generalization benchmark、language-conditioned manipulation、point-cloud-transformer policy、LLM task planning、VLM open-vocabulary grounding、modular foundation-model pipeline。在本 vault 中可与仿真基准/家居长程的 behavior-1k、桌面操作的 robocasa、仿真基础设施 maniskill3、真机部署评测的 simpler-env 对照——GemBench 专注”新任务泛化”这一单一维度,且把 baseline(Hiveformer、RVT-2、PolarNet、3D diffuser actor)在同一套 RLBench 数据流水线上重训后统一评测,而非仅横向比较各自论文里的数字。

作者:Ricardo Garcia、Shizhe Chen(共同一作)、Cordelia Schmid(Inria/ENS/PSL,WILLOW 组)。

模型架构

3D-LOTUS(Language-cOnditioned poinT clOUd tranSformer)——端到端策略:

  • 观测:K=4 相机(front/left shoulder/right shoulder/wrist)RGB-D,分辨率 256×256,机械臂本体状态(关节+夹爪位姿)。
  • 点云预处理:沿用 PolarNet 方式,多视角 RGB-D 反投影融合为世界坐标系统一点云,按 1cm³ 体素下采样;用工作空间边界 + CAD 模型/关节位姿滤除机械臂自身点,只保留物体与夹爪点。每点特征为 XYZ + RGB 颜色 + 相对桌面高度。
  • 主干:PTV3(Point Transformer V3),U-Net 结构(下采样/上采样各 5 个 block,每 block 1 层 transformer),隐藏维度依次为 64/128/256/512/768
  • 语言条件化:CLIP 文本编码器编码指令为词嵌入序列;对比两种融合方式——(a) adaptive normalization:全局语言向量加权平均后回归各归一化层的 scale/shift;(b) cross-attention(每个 PTV3 self-attention 层后加一层 cross-attn,让每个点关注完整词嵌入序列)——消融显示 cross-attention 效果更好但算力开销更高,最终版本采用 cross-attention。
  • 动作预测头:分类式而非回归式——位置沿 X/Y/Z 三轴分别预测,围绕每个点定义序列 bin(bin 数 30,即 m=15,bin size 1cm),取全点最高概率 bin 作为坐标;旋转把欧拉角每轴离散为 72 个 bin(每 bin 5°);开合状态为二分类,均由全点 max-pooling 后预测。GT 概率用到 bin 与真值欧氏距离的倒数并做 L1 归一化(距离>0.01 或落在机械臂点集合内则置 0)。
  • 动作空间:夹爪位置 a^p∈ℝ³、旋转 a^r∈ℝ³、开合 a^o∈{0,1},waypoint 表示 + 逆运动学插值执行。

3D-LOTUS++——模块化框架,把端到端策略拆成三个可独立诊断的模块:

  1. 任务规划(LLM):用 LLaMA3-8B,将指令 L 分解为动作步骤序列 l₁…l_T;六个动作原语 grasp(object)move_grasped_object(target)push_down(object)push_forward(object, target)release()rotate_grasped_object();用 SentenceBERT 计算指令相似度、检索 top-20 训练集示例做 in-context 示例(few-shot prompting,无参数微调)。
  2. 物体定位(VLM):开放词表检测器 OWLv2 出高置信度 bbox 及语义嵌入(与 CLIP 文本嵌入对齐);SAM 在每个 bbox 内做分割得到 mask,结合 RGB-D 得到该物体的 3D 点云;跨相机观测按语义嵌入 + 点云距离阈值合并同一物体,得到物体级的合并点云 + 平均语义嵌入;用 CLIP 文本嵌入与各物体语义嵌入算余弦相似度取最高者为匹配。对铰接物体的局部(如”顶层抽屉”),VLM 只能框出整个物体(如抽屉柜),改用 LLM 依据 VLM 给出的整体高度预测目标部件的高度区间。
  3. 运动控制:复用 3D-LOTUS 架构改造——① 点特征用物体定位模块输出的四类点标签(目标物体/目标位置/机器人/障碍物)查表编码替代 RGB 颜色,聚焦几何而非纹理以提升对新纹理物体的泛化;② 引入时间步查找表编码轨迹内的时刻索引,与点嵌入拼接后预测该时刻动作(动作头跨时刻共享),并额外预测 stop 概率以支持变长轨迹(最大轨迹长度 s=5)。

数据

  • 训练集:16 个任务、31 变体,覆盖 20 种物体、20 种颜色、3 种物体部件,来自 RLBench 已有任务库;七类动作原语 press/pick/push/screw/close/open/put(stack)。每个任务变体生成 100 条演示,共 3,100 条演示(脚本化生成,非人类遥操)。
  • 测试集:44 任务、92 变体,四级泛化:
    • Level 1(新摆放):与训练同 16 任务 31 变体,仅随机化新的物体摆放位置 + 部分新增干扰物颜色。
    • Level 2(新刚性物体):15 个未见任务 28 变体;两类——新物体-颜色组合(20 种)、新物体形状(8 种,如立方体→玩具/星形)。
    • Level 3(新铰接物体):18 个未见任务 21 变体;三类——新动作-部件组合(8 种,如训练开底部抽屉、测试开中层)、新实例(11 种,如三抽屉柜→四抽屉柜)、新类别(2 种,如笔记本盖→烤架盖)。
    • Level 4(新长程任务):6 个长程任务 12 变体,需组合多个已学动作(如”把物品放入抽屉”= 开抽屉+依序拾取立方体/圆柱/月牙形物体+按指令顺序放入)。
    • 测试集中 23 个任务取自原始 RLBench 100 任务库,21 个为作者新脚本编写。
  • HF 数据集rjgpinel/GEMBench)实际存储规模:train_dataset 下 microsteps 567M(每回合初始配置)、keysteps_bbox 160G(抽取的关键步)、keysteps_bbox_pcd/voxel1cm 10G(3D-LOTUS 训练用点云)+ instr_embeds_clip.npy(CLIP 指令嵌入);motion_keysteps_bbox_pcd/voxel1cm 2.8G(3D-LOTUS++ 运动规划器训练用)+ action_embeds_clip.npy;val_dataset microsteps 110M + keysteps_bbox_pcd/voxel1cm 941M;test_dataset microsteps 2.2G。另配套发布同结构的 RLBench-18Task(PerAct 版)数据集 rjgpinel/RLBench-18Task
  • 评测协议:测试时用与训练不同的随机种子保证初始场景配置不同;每任务变体每种子跑 20 回合,共 5 个种子,合计 20×5×92 个评测回合;单回合最长 25 步;成功率 SR(0/1)取种子间均值±标准差。

训练方法

  • 3D-LOTUS:批大小 8,初始学习率 1e-4150k 迭代,线性学习率衰减;用 Level 1 上每变体 20 回合的验证集每 1万迭代评一次,选最优 checkpoint。
  • 3D-LOTUS++ 运动规划分支:复用 3D-LOTUS 结构改造(点特征替换 + 时间步嵌入 + stop 概率头),单独在 motion_keysteps_bbox_pcd 数据上训练。
  • 损失:位置/旋转/开合均用交叉熵分类损失(而非回归 L2),论文消融证明分类式动作预测优于回归式且收敛更快。
  • LLM 任务规划走纯 few-shot in-context prompting(LLaMA3-8B,top-20 相似示例检索),不做微调;VLM 定位模块(OWLv2+SAM+CLIP)同样零训练、纯 zero-shot 组合调用。
  • GitHub README 披露:3D-LOTUS 与 3D-LOTUS++ 运动规划器均”约 14 小时单 A100”训完(论文正文另有表述为 3D-LOTUS 在 GemBench 上”约 11 小时单 A100”——两处数字略有出入,均为作者自陈,未做进一步核实取舍,此处并列注明)。

Infra(训练 / 推理工程)

  • 训练硬件:单张 NVIDIA A100 训 3D-LOTUS(GemBench 训练集,论文正文称约 11 小时;GitHub README 称约 14 小时,两个策略—3D-LOTUS 与 3D-LOTUS++ 运动规划器—训练时间相近)。
  • RLBench-18Task 上的公平训练时长对比(Table II,统一用 1×V100 GPU 换算为 GPU-day):3D-LOTUS 仅 2.2 天,显著低于 PerAct 128.0 天、Act3D 40.0 天、3D diffuser actor 67.6 天,接近 RVT(8.0 天)/RVT-2(6.6 天)/PolarNet(8.9 天)同一量级。
  • 推理速度:3D-LOTUS 在 RLBench-18Task 上 9.5 FPS(单帧动作预测耗时的倒数,含点云预处理),同表中 PerAct 4.9 FPS、RVT 11.6 FPS(其余方法未披露)。
  • GPU 具体卡数(是否多卡分布式)未披露,仅确认单卡训练;3D-LOTUS++ 额外调用 LLaMA3-8B + OWLv2 + SAM 三个冻结的现成模型做推理,其推理延迟/吞吐未披露
  • 真机(UR5)部署延迟/控制频率未披露(仅报告成功率,非实时性指标)。

评测 benchmark

RLBench-18Task(Table II,训练测试同任务分布,18 任务 249 变体;此处采用 arXiv v2/camera-ready 数字):

方法Avg. SRAvg. Rank训练时长(V100-day)推理速度(FPS)
C2F-ARM-BC20.18.6--
Hiveformer45.36.9--
PolarNet46.46.48.9-
PerAct49.46.2128.04.9
RVT62.94.48.011.6
Act3D65.04.340.0-
RVT-281.42.46.620.6
3D diffuser actor81.32.367.6-
3D-LOTUS(本文)83.1±0.82.22.29.5

GemBench 四级泛化(Table III,主表数字 v1/v2 一致):

方法L1(新摆放)L2(新刚性物体)L3(新铰接物体)L4(长程)
Hiveformer60.3±1.526.1±1.435.1±1.70.0±0.0
PolarNet77.7±0.937.1±1.438.5±1.70.1±0.2
3D diffuser actor91.9±0.843.4±2.837.0±2.20.0±0.0
RVT-289.1±0.851.0±2.336.0±2.20.0±0.0
3D-LOTUS94.3±1.449.9±2.238.1±1.10.3±0.3
3D-LOTUS++68.7±0.664.5±0.941.5±1.817.4±0.4

要点:Level 1(仅换摆放)最简单,Level 4(长程)最难——所有已有 SOTA 方法在 L4 上都跌到接近 0%;3D-LOTUS++ 在 L2-L4 全面超越所有基线,但 L1 上反而低于纯 3D-LOTUS(原因是零样本定位模型混淆同类物体,如把”金枪鱼罐头”和”汤罐头”搞混)。

消融(Table IV,3D-LOTUS 组件):分类式动作头全面优于回归式(如 L2 从 29.3±1.9 提到 47.8±0.6/49.9±2.2);cross-attention 语言条件化优于 adaptive normalization(L1 94.3 vs 90.8),但算力开销更高。

消融(Table V,3D-LOTUS++ 模块隔离,人工标注 GT 任务规划/GT 物体定位对照):L1/L2 的主要瓶颈是物体定位模块(GT 定位可把 L2 从 64.5 提到 80.1);L3/L4 即便全部换成 GT 信息,成功率仍远不理想(GT+GT 组合 L3 仅 47.8、L4 仅 31.5),瓶颈转移到运动控制策略本身难以泛化到长程任务里初始配置大幅偏离训练分布的场景;L4 的任务规划也因 LLM 无视觉输入而降精度(如无法判断箱子是否已开启)。

真机实验(UR5 6-DoF + 3 台 RealSense D435,7 个训练任务变体、每变体 20 条人类遥操演示;以下取 arXiv v2/camera-ready 数字):

  • 已见任务(Table VI):3D-LOTUS 均值 8.1/10,优于 PolarNet 的 6.7/10
  • 未见任务变体(Table VII,7 个新任务变体):3D-LOTUS 完全失败(0/10 全部任务),3D-LOTUS++ 均值 7.9/10,体现 LLM+VLM 组合带来的真实世界泛化能力。

创新点与影响

  • 提出迄今泛化维度最全的语言-视觉操作基准:七类对照表维度(多技能、铰接物体、属性-物体新组合、动作-物体新组合、新实例、新类别、长程)里 GemBench 是唯一全部打勾的基准,填补了此前 RLBench-18Task/PerAct 只测同分布、VIMA-Bench/Colosseum 覆盖面窄的空白。
  • 3D-LOTUS:证明”3D 点云 + 分类式动作预测 + cross-attention 语言条件化”的简单组合即可用极低训练成本(2.2 GPU-day,对比 PerAct 128 天)取得 RLBench-18Task SOTA,凸显此前很多方法的复杂度并非泛化/精度所必需。
  • 3D-LOTUS++ 模块化解耦:把任务规划(LLM)、物体定位(VLM)与运动控制(3D 策略)拆开做可独立诊断的框架,通过 GT 消融精确定位泛化失败的瓶颈来源(Level 1-2 卡在定位、Level 3-4 卡在运动控制泛化),为后续研究指明改进方向而非笼统报告”泛化差”。
  • 论文自陈局限:① 3D-LOTUS++ 在已见任务(L1)上性能反低于端到端 3D-LOTUS,根源是零样本 VLM 定位混淆同类物体;② Level 4 长程任务性能整体偏低(GT 全给也只有 31.5%),运动控制策略对分布外初始配置的泛化仍是未解难题;③ LLM 任务规划无视觉输入,对场景状态的隐式假设可能出错(如误判箱子开合状态)。

原始链接

一手源存档(sources/)