一句话定位
THE COLOSSEUM(下称 Colosseum)是华盛顿大学 / USC / AI2 / NVIDIA 联合提出、以 rlbench 为底座扩展的机器人操作泛化基准:在 20 个任务上系统施加 14 类环境扰动因子(物体颜色/纹理/尺寸、桌面、光照、干扰物、相机位姿、物体摩擦与质量),量化行为克隆(BC)策略在分布偏移下的成功率跌幅,并用可复现的真实世界 3D 打印套件验证仿真结论的生态有效性(R²=0.614)。arXiv v1(2024-02,12 项扰动、4 个基线)后经 RSS 2024 录用扩为 v2(2024-05,14 项扰动、5 个基线,新增 VoxPoser 与真实场景对齐消融)。
背景与定位
论文指出的核心问题:绝大多数机器人操作研究只在与训练场景高度相似甚至相同的环境下汇报成功率,无法反映真实部署中光照、背景、干扰物、相机标定漂移等不可避免的分布偏移(covariate shift,p(x_test)≠p(x_train) 但 p(y|x) 不变)。同期基准 Factor World(11 项扰动、19 任务、仅评 2D 视觉运动策略)与 KitchenShift(Isaac Sim,7 项扰动、3 任务)覆盖面更窄;GROOT/LIBERO 只有 3 项扰动、3 任务。Colosseum 以 rlbench 的 100 个任务库为基础挑选 20 个、覆盖简单到复杂(<100 步到 >1000 步)的任务谱系,构造 20,371 个独特扰动实例(v1 为 17,431 个,对应 12 项扰动),并首次把”物理属性扰动”(摩擦、质量)和真实世界可复现套件纳入同一个基准,是这条”系统性扰动评测泛化”路线里覆盖任务数、扰动维度、真实世界可复现性三者兼具的工作。评测对象覆盖 2D 表征学习基线(R3M-MLP、MVP-MLP)、3D 体素/多视角基线(peract、rvt)与零样本大模型驱动基线(VoxPoser),并沿用 rlbench 的关键点式动作预测协议。
模型架构
Colosseum 本身不是一个策略模型,而是一套仿真基准 + 扰动注入框架;其”架构”由仿真栈、任务/扰动配置系统,以及被评测的 5 个基线模型构成:
仿真栈:沿用 RLBench 的 PyRep(低层 API)+ CoppeliaSim 仿真器;扰动通过 YAML 配置文件声明,可任意组合叠加,框架对新增扰动/新增任务可扩展。
扰动分类(14 项,v2):
- 操纵物体(MO,manipulation object):MO_Color / MO_Texture / MO_Size
- 接收物体(RO,receiver object,如”放酒架”任务里的”酒架”):RO_Color / RO_Texture / RO_Size
- 背景类:Light_Color、Table_Color、Table_Texture、Distractor(干扰物)、Background_Texture、Camera_Pose
- 物理类(v2 新增):Object_Friction(摩擦系数)、Object_Mass(质量)
资产规模:213 种纹理、20 种颜色(用于 MO/RO/Table/Background 的颜色纹理扰动);78 个 YCB 数据集物体模型(转 CoppeliaSim .ttm 格式)用作干扰物。Light_Color 从 RGB [0,0,0]–[0.5,0.5,0.5] 采样并施加到 3 盏方向光;Camera_Pose 对前置/左肩/右肩 3 台相机的位置与欧拉角分别从 [-0.1,-0.1,-0.1]–[0.1,0.1,0.1](位置)与 [-0.05,-0.05,-0.05]–[0.05,0.05,0.05](角度)采样;Object_Friction 从 [0.75, 1.0] 采样摩擦系数;Object_Size 的缩放范围逐任务设定(如 basketball_in_hoop 的 MO_Size 为 [0.75,1.25],hockey 为 [0.95,1.05])。部分 MO/RO 扰动因任务无 RO 物体(如 open_drawer)或 PyRep 不支持复合形状物体的纹理/缩放(如 empty_dishwasher 的洗碗机)而不适用于全部 20 任务。
被评测的 5 个基线(均用冻结 CLIP 编码语言指令):
- R3M-MLP:R3M(ResNet-50,23M 参数,人类第一视角视频对比学习预训练)+ ~3M 参数 MLP 动作头,冻结编码器,4 路 RGB 相机(无深度)+ 语言 + 本体感知输入,直接回归连续 7-DoF 关键点位姿。
- MVP-MLP:MVP(ViT-Base,86M 参数,450 万张真实图像自监督掩码重建预训练)+ 同结构 MLP 动作头。
- peract:Transformer,输入体素网格(100³,对应 1.0m³ 实际体积,patch 5³ 经 3D 卷积编码为 20³=8000 个体素 token)+ 语言 + 4 路 RGBD,预测离散体素平移点、5° 分箱旋转、夹爪开合二值;~33M 参数。
- rvt:多视角 Transformer,把捕获的 RGBD 重渲染为新虚拟视角构成的点云再输入模型,预测每视角热力图并反投影为离散 3D 平移点;旋转/夹爪预测同 PerAct;~36M 参数。
- VoxPoser(零样本,v2 新增):基于大预训练模型(LLM)抽取 3D 价值/约束图,把变化描述(variation description)当语言输入,无需训练直接做操作,人工标注了扰动涉及物体名以对齐 RLBench 场景。
数据
Colosseum Challenge Dataset(HF: colosseum/colosseum-challenge):
- 训练集:20 个任务各 100 条演示,无任何扰动(RLBench 原始变体仍保留,如 open_drawer 的 open bottom/middle/top drawer);每条演示含前/左肩/右肩/腕部 4 路相机的 RGB + Depth,帧分辨率 128×128。
- 测试集:20 个任务各适用扰动因子下 25 条演示;论文口径下测试集共 235 组(No Perturbation + 14 项单因子 + All Perturbations,此处 235 = 20 任务 × 因子子集,因非所有因子适用全部任务),每组 25 episode。
- 演示生成:全部经 RLBench 内建运动规划专家自动生成(无众包),保证按需生成无限量。
- 真实世界数据:4 个任务(insert onto square peg、slide block to target、scoop with spatula、setup chess)各用 HTC Vive 控制器采集 5 条真实演示;真实世界扰动因子每项只做 2 档(如 2 种打印色、2 种尺寸),资源受限下无法做到仿真侧的连续采样密度。
- sim-vs-real 对齐验证数据(v2 新增):额外构造 3 个真实复合场景(workbench、餐桌、书房桌面),各自搭配与仿真扰动组合对应的自然扰动,用于验证仿真扰动是否”真实存在”。
训练方法
- 问题形式化:从观测 o_j(4 路 RGBD)、本体感知 p_j、语言指令 l 预测动作 a_j(6-DoF 夹爪位姿 + 开合状态);沿用近期 SOTA 做法采用关键点式动作预测(基于关节速度趋零、夹爪开合变化的启发式抽取关键帧),而非逐步连续 7-DoF 控制。
- 标准训练协议:每任务 100 条演示、不加任何 Colosseum 扰动,但保留 RLBench 默认任务内变体(如具体开哪个抽屉);只训一个训练种子、一个评测种子,用最后一个 checkpoint 评测全部扰动因子。
- 各基线训练超参:R3M-MLP/MVP-MLP:batch size 32,300k 迭代;peract:batch size 16,300k 迭代;rvt:batch size 24,100k 迭代(沿用原始配置);VoxPoser:零样本,无训练。
- All Perturbations 训练消融:额外用 All Perturbations(全部扰动同时开启)设置训练 PerAct(batch 16、300k 迭代)作为泛化上界探测。
- 真实世界训练:PerAct 在真实演示上以 batch size 1 训 200k 迭代;同时训一个专注同 4 任务的仿真多任务 PerAct(batch size 4,50k 迭代)做仿真-真实对齐对照。
Infra(训练 / 推理工程)
- 仿真基线训练:1–4 张 NVIDIA RTX A6000,每个基线训练耗时 1–6 天;全基准评测(多个并行任务顺序批量启动)总计算量为每个模型 4 张 RTX A6000 跑 2–3 天。
- 真实机器人训练:1 张 NVIDIA TITAN RTX,训练 1 天。
- 真实机器人硬件:Franka Panda 机械臂 + 平行夹爪;感知用前置 Kinect-2 RGB-D 相机,分辨率 512×424 @ 30Hz;相机-机器人外参用 easy_handeye 包 + 夹爪上 ARUCO 标记标定;数据采集用 HTC Vive 控制器(6-DoF 追踪)配合 Franka ROS + MoveIt(RRT-Connect 默认规划器)执行。
- 推理 FPS / control-Hz:论文未披露具体数值。
- 精度 / 并行策略:未披露(论文聚焦基准构造与基线评测,非训练系统工程)。
评测 benchmark
主结果(v2,5 基线 × 14 扰动 × 20 任务):
- 单个扰动因子下,5 个 SOTA 操作模型的任务平均成功率普遍下跌 30%–50%;当 14 项扰动叠加同场景(All Perturbations)时下跌 ≥75%。
- 最伤成绩的因子:干扰物数量(Distractor)、目标物体颜色(MO_Color/Table_Color/Light_Color 等颜色类)、光照颜色;物体尺寸变化影响最小。
- 2D 模型(R3M-MLP、MVP-MLP):端到端 RGB 训练使其对颜色/纹理/相机位姿最敏感;MVP-MLP 因真实世界预训练在 Distractor 扰动下表现相对更稳(不降甚至更好),说明真实数据预训练对干扰物鲁棒性有价值。
- 3D 模型(PerAct、RVT):颜色类(物体/桌面/光照)与 Distractor 最伤;对 Camera_Pose 基本免疫(因为二者都先把 RGBD 预处理成体素网格或重渲染视角,不直接学原始视角);RVT(纯 RGB 视角输入)比 PerAct(完整 3D 场景输入)更受 Distractor 影响,说明 3D 场景输入对环境扰动更鲁棒。物理扰动(摩擦/质量)下 RVT 优于 PerAct;VoxPoser 等其余基线因本身完不成相关任务,物理扰动结果不具决定性。
- VoxPoser(零样本):在其能完成的任务(如 slide_block_to_target)上扰动鲁棒性突出——该任务 No Perturbation 与全部扰动平均的成功率差仅 3.21%(相对 No Perturbation),印证大预训练世界模型对场景变化的识别能力。
- All Perturbations 训练消融(PerAct):仅用 RLBench 默认变体训练、零样本评 All Perturbations 得任务平均成功率 6.4%(比 No Perturbation 低 28.1 个百分点);换成用 All Perturbations 训练后评 All Perturbations,成功率只提升 21.1%——说明 Colosseum 的扰动不仅是分布偏移测试,还实质性提高了任务本身的难度,即便训练时能见到扰动后的真值场景。
- 仿真-真实对齐(4 任务,PerAct):No Perturbation 下仿真与真实模型成功率仅相差 6.67%;MO_Texture、Light_Color、Table_Color、Table_Texture、Distractor 等因子仿真/真实差距 <5%。按 R² 衡量:MO_Color、Table_Texture、Camera_Pose 为中等相关(0.46≤R²≤0.52);Background_Texture、Distractor、Table_Color、Light_Color、RO_Color、RO_Texture、RO_Size 为强相关(R²=0.74–0.94,Table_Color 最高)——14 项中至少 7 项仿真结论与真实世界强相关。真实世界侧 MO_Color 扰动导致成功率暴跌 82.6%,而 MO_Size 反而提升 4.34%(无负面影响)。
- 扰动组合 vs 真实自然场景消融(v2 新增,Table II,slide_block_to_target 任务,5 轮×10 episode):[Distractor+MO_Size] 组合与真实工作台场景相关 R²=0.75;[Distractor+Light_Color] 组合 R²=0.01(不相关);[Light_Color+Table_Texture+Distractor+MO_Size] 组合 R²=0.83(最强)——说明并非任意扰动组合都能拟真,需挑选与真实场景共现模式匹配的组合。
- 基准对比表(Table I):与 GROOT/LIBERO(3 扰动/3 任务/无物理扰动)、VLMBench(8/8)、KitchenShift(7/3)、Factor World(11/19)相比,Colosseum 以 14 扰动 × 20 任务 × 5 个 SOTA 模型 × 物理扰动 + 真实世界可复现性成为当时覆盖面最广的操作泛化基准。
创新点与影响
贡献:
- 首个把物理属性扰动(摩擦、质量)纳入操作泛化基准的工作,扰动维度(14)× 任务数(20)在同类基准中最广。
- 用统一 YAML 配置把 14 类扰动模块化、可任意组合叠加,并配套开源可 3D 打印的真实世界复现套件(4 任务),让仿真结论有真实世界验证锚点(整体 R̄²=0.614)。
- 提出”Colosseum Challenge”标准协议(100 条无扰动演示训练 → 固定 25 episode × 14 因子评测 → 按性能变化幅度排行榜),把”训练可见分布”与”测试扰动分布”严格分离,避免基准被”偷看”扰动数据。
- 首次系统比较 2D/3D/零样本大模型三类范式在同一扰动谱系下的失效模式,量化”3D 输入 > 2D 输入”、“真实世界预训练提升干扰物鲁棒性”、“大预训练世界模型零样本对场景变化免疫”等结论。
作者自陈局限:
- 排行榜基线目前仅 4-5 个方法且均为 BC/零样本范式,未来计划纳入 RL、扩散策略、3D 特征场、大规模机器人预训training、动作分词(action tokenization)、action chunking 等方法。
- 真实世界实验中难以精确复现训练数据采集与评测时的位姿/朝向/执行过程;受限于资源,每个真实扰动因子只做了 2 档变体,真实世界结论目前只代表”仿真 vs 真实的相对分布”,尚未扩展到与仿真同等规模的真实任务集。
原始链接
- 论文(arXiv abs,v1/v2):https://arxiv.org/abs/2402.08191
- 论文 PDF:https://arxiv.org/pdf/2402.08191
- 会议:RSS (Robotics: Science and Systems) 2024
- 代码(GitHub):https://github.com/robot-colosseum/robot-colosseum
- RVT baseline 配套仓库:https://github.com/robot-colosseum/rvt_colosseum
- 项目主页:https://robot-colosseum.github.io/
- 文档:https://robot-colosseum.readthedocs.io/en/latest/overview.html
- 数据集(HF):https://huggingface.co/datasets/colosseum/colosseum-challenge
- Leaderboard(Papers with Code):https://paperswithcode.com/sota/robot-manipulation-generalization-on-the
一手源存档(sources/)
- the-colosseum—project-page — 项目主页快照(sources/embodied/2024/the-colosseum—project-page.md)
- the-colosseum—github-readme — GitHub README 快照(sources/embodied/2024/the-colosseum—github-readme.md)
- the-colosseum—hf-dataset-card — HuggingFace 数据集卡快照(sources/embodied/2024/the-colosseum—hf-dataset-card.md)
- arXiv 原文 PDF(arXiv:2402.08191,v1 2024-02 / v2 2024-05,不入 git):见上方 PDF 链接