一句话定位

SIMPLER(Simulated Manipulation Policy Evaluation for Real Robot Setups)是一套**“真机训练、仿真评测”(real-to-sim)** 的开源仿真评测环境:不做全保真数字孪生,而是靠系统辨识(closing 控制 gap)+ 视觉匹配(closing 视觉 gap)octo、RT-1/RT-1-X/RT-2-X 等真实机器人策略在仿真里的成功率与真机成功率强相关(Pick Coke Can 达 Pearson r=0.976 / MMRV=0.031)。覆盖 Google Robot 与 WidowX(BridgeData V2)两个本体、约 1500 次配对评测 episode,从此 VLA/通用操作策略可以在没有物理硬件的条件下被可复现、可比较地打分。发表于 RSS 2024。

背景与定位

通用机器人操作策略(RT-1/RT-2、octoopenvlapi0 等)能力越来越广,但真机评测既贵又慢、且几乎无法复现:不同实验室的光照、相机、工作台、物体都不一样,横向对比失真。作者把问题反过来:sim-to-real 是”在仿真里训练、去真机部署”,而 SIMPLER 做的是 real-to-sim ——把在真实数据上训练好的策略搬进仿真里评测

关键立场是”不需要精确复刻真实世界”:只要仿真环境”足够真实”,使得策略在仿真里的表现与真机表现相关性足够强,就能作为可靠的、白菜价的改进信号(checkpoint 选择、失败模式分析)来指导研究,而不必让数字艺术家逐个手工雕刻几何/材质/物理属性。作者把仿真评测比作自动驾驶里”上路前先在 CARLA 里跑一遍”的常规做法。

SIMPLER 直接对接 Open-X-Embodiment(open-x-embodiment)生态里的两大真机评测设置——Google Robot(RT 系列)与 WidowX + BridgeData V2;底座建在 SAPIEN / ManiSkill2 上,后被 maniskill3 收编为 GPU 并行版 real2sim 评测(4 个 Bridge 环境移植,快 10–15×)。范式上属于”offline / simulated policy evaluation”,与单纯的 sim benchmark(liberobehavior-1krobocasa)不同:它的目标不是刷分,而是让仿真分预测真机分

模型架构

这是一篇评测基础设施论文,“架构”指仿真环境栈与两条 real-to-sim gap 弥合方法:

  • 仿真底座:SAPIEN 物理仿真器 + 基于 CPU 的 ManiSkill2 benchmark;Google Robot 用 PhysX,作者发现默认 Projected Gauss-Seidel 求解器会在抓取时产生 mesh 穿透,遂在 SAPIEN 与 Isaac Sim 后端都改用 Temporal Gauss-Seidel 求解器保证正确抓取。论文另在 Isaac Sim 上复现,证明结论不依赖具体物理引擎
  • 两个本体 / 两套设置
    • Google Robot(RT 系列真机设置):头部自定义 egocentric 相机;仿真频率 ~500Hz(实现里 501),控制频率 3Hz(follow RT-1);机器人由官方 MuJoCo .mjcf 转 URDF,并修整 base link 碰撞网格防穿透。
    • WidowX + BridgeData V2:WidowX-250 6DOF 臂 + Logitech C920 第三人称相机;仿真频率 500Hz,控制频率 5Hz;URDF 从官方 Interbotix 仓库经 ROS 导出。
  • 控制器:给定模型输出的平移/旋转/夹爪动作,用 Ruckig 做带速度/加速度/jerk 约束的时间最优关节运动规划(Google Robot 臂限幅 1.5/2.0/50.0,夹爪 1.0/7.0/50.0),逐仿真步下发关节位置目标(论文 Algorithm 1/2)。
  • 两种评测模式
    • Visual Matching(VisMatch,推荐):把仿真前景(机械臂+可交互物体,用仿真真值分割 mask)叠加到真实世界背景上(“green-screening”),并做纹理匹配;成本低、相关性最好。
    • Variant Aggregation(VarAgg):不缩小 gap,而是像 domain randomization 一样在背景/光照/干扰物/桌面纹理四个轴上各造 2 个 variant,对所有 variant 的成功率取平均。
  • 评测指标(本文提出):除 Pearson r([-1,1],越高越好,但只测线性拟合、且对窄区间噪声敏感)外,提出 MMRV(Mean Maximum Rank Violation,[0,1],越低越好):对每对策略 (i,j),若仿真把它们的相对排名搞反,则以两者真机成功率之差为权重记一次 rank violation;再对每个策略取最坏情况后在 N 个策略上平均。它比 Spearman 更好——只有当排错的两个策略真机差距大时才重罚。

数据

SIMPLER 本身不训练模型,所谓”数据”是环境资产、任务与评测 trial:

  • 规模:约 1500 次评测 episode(真机与仿真各约 1500),横跨 6 个策略 checkpoint × 两个本体的多任务。
  • Google Robot 任务与 trial 数(真机口径):pick coke can(3 种朝向 × 25 格位 = 75)、move {obj1} near {obj2}(5 三元组 × 2 三角摆位 × 6 = 60,物体池 8 个:蓝瓶/百事/橙子/七喜/苹果/海绵/可乐/红牛)、(open/close)(top/middle/bottom) drawer(9 格位 × 3 抽屉 × 2 = 54)、open top drawer + place apple(3 位 × 9 = 27,长程任务)。
  • WidowX / Bridge 任务:put spoon on towel(2 朝向 × 12 = 24)、put carrot on plate、stack green block on yellow block(2 尺寸方格 × 12 = 24)、put eggplant in yellow basket(24)。均为大体刚体、物理可被现代仿真器较好近似的任务,且代表训练集分布。
  • 资产来源 / curation:常见物体(罐、苹果)取自 Objaverse;少见物体走 3D 扫描或单视图 3D 生成(One-2-3-45++);铰接物体(抽屉柜)手工按真实尺寸建模——这是整条流水线里最费人力的一步。所有资产在 Blender 里对齐真实尺寸、用 CoACD 生成凸碰撞网格;密度用”查 GPT-4 / Google 得材料密度”或”质量 ÷ 体积”估。摩擦系数按常见材料属性赋值。
  • 纹理匹配(GeTex):SAM 抠出真实物体 → 仿真里粗对齐位姿 → Nvdiffrast 可微渲染精配 mask → 把真实 RGB “反投影”到仿真网格 → 可选用 Zero123++ 扩散模型补其余视角。命令行脚本开源在 github.com/Jiayuan-Gu/GeTex。
  • action-labeling / 无新采集:系统辨识只用已有开源示教数据集(RT-1、Bridge V2)里的极少量轨迹来拟合控制参数,不采集任何新数据。被评测策略本身训练在 RT-1 数据集(≥80k 示教)、Open-X-Embodiment 与 Bridge V2 上。

训练方法

SIMPLER 不训练策略,“方法”是构建 real-to-sim 评测环境的两条 gap 弥合流水线

  • 控制 gap → 离线系统辨识(SysID):把同一条动作序列在真机与仿真里做开环回放,最小化 6D 末端位姿轨迹的平移误差 L_transl 与旋转误差 L_rotL_rotarcsin(||R_i−R'_i||_F / (2√2))),对控制器刚度/阻尼 PD 参数 (p,d) 做模拟退火(simulated annealing)优化,共 3 轮、每轮缩小搜索范围。消融显示:扰动 SysID 参数会显著抬高 MMRV(Setting1/2 的 control loss 0.267/0.432 vs SysID 0.131;MMRV 0.070/0.100 vs 0.031)。
  • 视觉 gap → Visual MatchingI' = M⊙I_sim + (1−M)⊙I_real。① green-screening:真实首帧用在线 inpainting(cleanup.pictures)去掉机械臂/前景,仿真真值分割给出前景 mask,二者合成;② 纹理烘焙:把真实纹理投到仿真物体、并调机械臂颜色。因臂在运动中会变色,作者取 4 组调好的机械臂颜色分别评测再平均(WidowX 臂恒黑则跳过);Octo 的扩散动作头非确定,跨 3 个随机种子平均
  • 消融的关键结论:视觉匹配必须整体一致地施加——只调抽屉纹理不调机器人、或只调纹理不做 green-screen,相关性都不改善;只有 green-screen + 前景物体 + 机器人纹理三者齐上,MMRV 才降到 0.050、真-仿成功率差降到 0.136(Table III/IX)。
  • 物理属性鲁棒性:即便可乐罐质量(10–80g)、夹爪静摩擦(0.25–2.0)、柜子关节摩擦被粗略估计,MMRV 仍稳在 ~0.03–0.10、Pearson r ~0.90–0.99,说明评测对物理参数不精确并不敏感(Table X)。

Infra(训练 / 推理工程)

  • 渲染吞吐:单个环境在消费级 NVIDIA 4090 上、640×512 分辨率达 3.5k 仿真步/秒;在 500Hz 仿真频率下相当于比真机评测快 7×
  • 硬件要求:需 NVIDIA GPU(RTX 更佳,光追在 1080Ti/A100 上慢);CUDA ≥11.8 且 <13;不支持 TPU(SAPIEN 需 GPU)。
  • GPU 并行版:Bridge 环境已并入 maniskill3maniskill3 分支),GPU 并行后比 ManiSkill2 版快 10–15×
  • 训练算力:不适用(本工作不训练模型)。被评测策略的算力见各自原文(octo、RT-1/RT-2 等)。
  • 推理:仓库提供 RT-1(TensorFlow 2.15)、Octo(JAX,octo-1.0)的一键推理脚本与 Colab;RT-1 checkpoint 从 gs://gdm-robotics-open-x-embodiment 下载。

评测 benchmark

核心结果是仿真分与真机分的相关性(不是绝对成功率的复刻)。以下为 SAPIEN + Visual Matching:

Google Robot(Table IV)

任务MMRV ↓Pearson r ↑
Pick Coke Can0.0310.976
Move Near0.1110.855
Open / Close Drawer0.0550.915
Open Drawer & Place Apple0.0000.969

WidowX + Bridge(Table V,按任务估计后平均):整体 MMRV=0.014、r=0.890;各任务成功率口径下 Put Spoon on Towel r=0.827、Put Carrot on Plate r=0.575、Stack Block r=1.000、Put Eggplant in Basket r=0.990(r=0.778 是 Put Spoon 的 Grasp 部分成功口径,非最终成功率)。

被评测策略:RT-1(Converged / 15% / Begin 三个训练阶段)、RT-1-X、RT-2-X、Octo-Base、Octo-Small。高真机分策略(RT-1 Converged、RT-2-X;Bridge 上 Octo-Small)在仿真里同样高分;低真机分(RT-1 Begin、Bridge 上 RT-1-X)同样低分。

对比基线

  • vs 验证集 action MSE(模仿学习常用的 model selection):SIMPLER 完胜。Pick Coke Can MSE 的 MMRV=0.412 / r=0.464,SIMPLER 0.031 / 0.976;多任务上 MSE 的 Pearson 甚至出现 −0.857、−1.000 的负相关(Table XII)。
  • vs VarAgg:Visual Matching 优于 Variant Aggregation(后者视觉分布偏移更大,对视觉敏感的策略被放大误差),故推荐 VisMatch 为默认。

其它验证

  • 分布偏移行为:沿背景/光照/干扰物/桌面纹理/相机位姿五轴做受控实验,仿真准确复现策略对各偏移的敏感度(w/o Aug: MMRV=0.000 r=0.831;w/ Aug: MMRV=0.016 r=0.970),且能区分”未见纯色桌面”(真机降 4% / 仿真降 2%)与”未见花纹桌面”(真机降 25% / 仿真降 24%)。
  • 预测新分布偏移:仿真里观察到 Octo-Base 对机械臂纹理极敏感(未调臂 0% → 调后 29.3%),据此设计真机”礼品纸包裹机械臂”实验,真机同样证实 Octo-Base 比 RT-1-X 更敏感(Fig 9 / Table VIII)。
  • 换物理引擎:Isaac Sim 复现 Google Robot(VarAgg)得 MMRV=0.058 / r=0.919,与 SAPIEN(0.082 / 0.923)一致。
  • 单任务策略 / Kruskal-Wallis:仅用 pick-coke-can 数据训的 RT-1 也被正确排名(加入后 MMRV=0.027 / r=0.959);Visual Matching 下多数任务-策略的仿真 trial 成功分布与真机无显著差异(p≥0.05)。

创新点与影响

  • 提出 real-to-sim 评测范式并给出可落地流水线:不造数字孪生,用系统辨识 + 视觉匹配两条低成本手段就把真-仿相关性做到 r≈0.9–0.98。
  • 提出 MMRV 指标,弥补 Pearson r 只测线性、对窄区间噪声敏感的缺陷,成为后续 real2sim 评测的标准度量之一。
  • 开源可复用基础设施:单行 simpler_env.make(...) 即用的 Gym 环境、RT-1/Octo 推理代码、环境构建指南、GeTex 纹理工具、以及真机-仿真配对数据与 MMRV/Pearson 计算脚本(方便他人对比自己的 offline eval 方法)。此后成为 openvlapi0 等 VLA 论文的标准评测台之一,并被 maniskill3 GPU 并行化。
  • 作者自述局限:① 仅限刚体任务(软体/柔性物体未覆盖,指向 IPC 等软体仿真为未来工作);② green-screening 仅适用固定相机,且未精确建模阴影等视觉细节;③ 环境构建仍含手工(尤其铰接物体建模),全自动、可批量生成上千环境仍是目标;④ 明确不追求 1:1 复刻真机绝对成功率,只求相对排名相关。

原始链接

一手源存档(sources/)

  • simpler-env—github-readme — GitHub README 快照(sources/embodied/2024/simpler-env—github-readme.md)
  • simpler-env—project-page — 项目主页快照(sources/embodied/2024/simpler-env—project-page.md)
  • arXiv 原文 PDF(2405.05941,不入 git)——正文/表格数据取自此 PDF,引用见上方链接。