一句话定位

GenManip 是上海人工智能实验室主导的 Isaac-Sim 桌面级操作仿真平台,核心是用 LLM 驱动的”任务导向场景图”(ToSG)从 1万个标注 3D 资产中自动合成多样化指令任务,并配套 200 个人工精修场景的 GenManip-Bench,用同一套基准同时评测”模块化 VLM 智能体”与”端到端 VLA/模仿学习策略”两条泛化路线,CVPR 2025。

背景与定位

放在”用 LLM/场景图自动生成机器人操作任务与场景”这条脉络里:RLBench、CALVIN、LIBERO、VIMA、Colosseum 等早期基准场景/物体数量有限(几十个物体、随机布局),且多数不支持人在环校正;RoboCasa 用生成式方法把资产规模做到 2.5K、任务规模到 100 类,但仍以随机化布局为主,缺乏可控、系统化的评测基准。GenManip 的差异化在于:(1) 资产规模进一步扩大到 10K(且带视觉-语言标注,RoboCasa 等均无此项);(2) 提出 ToSG 这一”自然语言友好版 PDDL”中间表示,让 LLM 既能生成任务又能定义可控布局与目标条件;(3) 首次在同一基准里系统对比”模块化基础模型系统”与”端到端 VLA/模仿学习策略”两大泛化路线的优劣。

范式关键词:LLM-driven scenario/task synthesis、task-oriented scene graph (ToSG)、modular VLM manipulation agent(对标 CoPA、MOKA)、端到端 VLA 数据扩展(GR-1、ACT)。vault 内与同为 Isaac-Sim 桌面基准的 robocasa、场景图驱动任务生成的相关工作,以及本文引用的具身城市级仿真 grutopia(articulated 资产与 MimicGen 式演示生成参考)可对照;modular 系统直接复用/对比了 copamoka 两个基础模型驱动的操作方法。若已有 embodied-benchmark-survey 页面可与本工作互链。

作者团队:Ning Gao、Yilun Chen(项目负责人)、Shuai Yang、Xinyi Chen(共同一作)、Yang Tian、Hao Li、Haifeng Huang、Hanqing Wang、Tai Wang、Jiangmiao Pang(通讯作者),机构含上海人工智能实验室、西安交通大学、浙江大学、南京大学。国家重点研发计划(2022ZD0160201)与上海人工智能实验室资助。

模型架构

GenManip 本身不是一个策略模型,而是”仿真平台 + 评测协议 + 两类基线系统”:

仿真平台:基于 NVIDIA Isaac Sim 4.1.0,单台 Franka 机械臂桌面场景;3 个用于模块化方法的相机位 + 2 个用于数据采集/学习式方法测试的额外相机位;默认场景背景设为白色以简化测试上下文;相机内外参数可自定义调整;模型调用(AnyGrasp、SAM2、自定义学习式模型)被封装为后端服务,与主程序异步通信。

模块化操作系统(对标 CoPA/MOKA 等 mark-based 视觉提示方法,抽象为统一的 4 模块流水线):

  • Affordance proposal generator:SAM2 生成物体掩码 → VLM 做 Set-of-Mark (SoM) 选取目标掩码;并提出 Coarse-to-Fine SoM (CtoF SoM,多次 SoM 调用定位如”杯柄”这类精细抓取部位);AnyGrasp 处理 RGB-D 生成全图抓取位姿提案,再用 SoM 选中的掩码过滤得到目标抓取位姿。
  • Grid-based motion planner:仿照 MOKA,将图像划分为 9×16 网格,VLM 依据目标网格 ID + 指令依次选择一系列网格中心(连同高度、夹爪朝向),重投影到 3D 空间得到轨迹点,再用 MPlib 求解动作序列;另有简化版 point-to-point(只选终点)对应 CoPA 的约束生成简化版。
  • Trajectory-action chainer:VLM 需在完整规划轨迹上标注每段对应的操作(pick/place 等脚本技能),当前仅支持 pick-and-place。
  • Long-horizon planner:任务分解 + 完成度检测闭环,失败时可回退触发第一模块重新规划。
  • 被测 VLM/MLLM:GPT-4o、GPT-4.5、Claude-3.7-Sonnet、Gemini-2.0-Flash、Qwen2.5-VL-72B(均为闭源 API 或 72B 级开源模型,零样本评测)。

端到端学习式策略:GR-1(GPT 风格、联合处理语言/视觉/机器人状态做动作预测,本文从零训练、无预训练)与 ACT(Transformer 策略,视觉数据增强 + 时序集成提升鲁棒性);输入静态相机 + 夹爪相机图像,预测未来 3 步、执行 1 步(receding horizon),输入序列长度 10。

数据

  • 资产规模:从 Objaverse 原始 660K 资产经标签/描述过滤降到 70K,再剔除网格面数 <1K 或缺失法线贴图的资产,最终精选 10K 刚体资产做 VL 标注(GPT-4V 生成物体描述、物理属性如尺度/质量、语义属性如类别/颜色/形状/材质);用 GPT-4V 做居中缩放到桌面尺寸后人工在环校正。
  • 关节物体:人工标注 100 个 articulated 资产(笔记本电脑、垃圾桶、烤箱、微波炉、抽屉等),显式指定物理约束;遵循 MimicGen 用人类遥操作轨迹采集基于物体功能(开/关/按/推/拉/拧)的原语技能演示。
  • 背景多样性100 张室内 HDRI 图像提供多样光照与背景。
  • ToSG 任务合成:随机采样种子物体(按 VL 标注),种子任务类型覆盖短程推理(空间/外观/常识)与长程任务,每个场景典型采样约 50 个相关物体,GPT-4 依据详细描述合成场景图格式(ToSG)任务;ToSG 由 (object, status) 节点 + (object, relation, anchor object) 边 + 目标条件列表构成。
  • GenManip-Bench:基于 GPT 合成场景,经人工标注者(可访问场景图与 USD 文件、用 Isaac Sim 详细检视、结合已标签物体集检索资产)逐条精修布局/物体/场景,剔除碰撞等不可行指令,最终精选 200 个场景构成基准(对比 Tab.1:RoboCasa 100 任务、RLBench 100、CALVIN 34、LIBERO 130、VIMA 17、Colosseum 20、ManiSkill2 20,GenManip 是唯一同时具备”VL 标注 + 人在环 + 多方面评测 + 多步评测”的平台)。
  • 行为克隆(BC)数据采集:利用场景布局与原语技能的特权信息,用运动规划库 MPlib 每个目标条件生成一条演示;GR-1/ACT 每个训练设置采集 1K 条轨迹(跨场景泛化实验中每个场景各提供 1K episodes);采集时 Isaac Sim 以 60 FPS 渲染+物理计算,MPlib plan_poserrt_range=0.001;两路相机录制 RGB-D,初始分辨率 1280×720、深度以米为单位,均缩放到 512×288,彩色图存 JPG、深度图乘 1000 后存 PNG;动作表示为 Franka 绝对关节位置,并同时记录末端执行器坐标系下的位置+XYZ 欧拉角表示。

训练方法

  • 模块化系统:完全基于提示工程/零样本推理,不训练参数——任务分解 prompt → SoM/CtoF SoM 掩码选择 prompt → 抓取点选择 prompt → grid-based 或 point-to-point 路径规划 prompt → 任务完成检测 prompt,形成闭环;抓取位姿由 AnyGrasp 提案按与 3D 抓取点的距离阈值+置信度排序确定;MPlib 从抓取位姿到各路径点做运动规划,Isaac Sim 内置 PD 控制器做力控执行 Franka。
  • 端到端策略训练:GR-1、ACT 均在同一超参下训练——AdamW 优化器 + cosine 学习率衰减 + dropout,batch size 512学习率 2e-3;预测未来 3 步执行 1 步,输入序列长度 10;GR-1 从零训练(不使用大规模预训练权重)。
  • 数据规模消融:在”捡香蕉放盘子”单任务设置下,用 100→1K episodes 递增数据量训练 GR-1/ACT,观察成功率随数据规模的变化。
  • 泛化维度消融:设计 6 档递增难度的评测分布——(1) 有限区域随机化(仅前景目标,20×30cm² 区域内)、(2) 有限区域随机化(全部物体)、(3) 全桌面随机化(仅前景)、(4) 全桌面随机化+跨 5 个不同场景图/布局训练测试、(5) 未见指令(5 个场景下改写指令)、(6) 未见物体(评测时引入训练未见过的物体实例)。

Infra(训练 / 推理工程)

  • 论文正文未披露训练/评测所用具体 GPU 型号、卡数或 GPU-hours;仅说明后端模型服务(AnyGrasp、SAM2、学习式模型)以异步服务方式部署,模块化基线仅需相机内外参即可脱离 Isaac Sim 独立部署,支持高并发从而使批量评测可行(未给出具体并发数或吞吐 FPS/Hz 数值)。
  • 评测节奏:单个 episode 最多运行 9000 步物理仿真步,对应 60 FPS 下约 150 秒
  • 后续 GitHub 仓库(GenManip Suite,非本 CVPR 论文原始披露内容,为论文之后的平台扩展)披露过压力测试数据:“1500 个并发 Isaac Sim 实例,跑在 500×RTX 4090 (48GB)“,用于说明数据生成流水线的并行扩展能力,但该数字对应的是套件层面的数据生成基础设施,不代表本论文实验本身所用的计算资源。

评测 benchmark

主结果(Tab.2,200 场景基准,5 个 MLLM × CoPA/MOKA 两套模块化流水线,SR/SPL 单位 %)

Modular 方法MLLMSpatial SRAppearance SRCommon Sense SRLong-Horizon SROverall SROverall SPL
CoPAGPT-4o25.0029.4120.5917.5920.334.53
CoPAGPT-4.525.0026.4729.4111.1123.005.26
CoPAClaude-3.7-Sonnet8.3314.712.947.418.671.15
CoPAGemini-2.0-Flash8.3338.2417.658.3319.004.02
CoPAQwen2.5-VL-72B8.3323.5310.7812.9613.673.05
MOKAGPT-4o8.3311.7611.765.5610.001.29
MOKAGPT-4.516.6723.5317.6511.1114.002.14
MOKAClaude-3.7-Sonnet0.000.0020.598.337.002.05
MOKAGemini-2.0-Flash8.3329.410.000.0012.002.66
MOKAQwen2.5-VL-72B8.3317.658.828.3311.001.84

要点:CoPA+GPT-4.5 综合最佳(23.0% SR),所有模型在长程任务上平均仅 9.07% SR,是最难的类别;CoPA 的 SPL 约为 SR 的 1/6(路径规划相对高效),MOKA 部分任务 SPL 低至 SR 的 1/10(路径规划效率明显更差)。

长程/干扰物消融(Tab.3):Horizon 1/2/3 步任务 SR 分别为 32.28% / 18.69% / 0.00%(SPL 10.12 / 5.40 / 0.00);干扰物数量 0/1/2 个时 SR 分别为 20.27% / 18.60% / 18.00%(引入第一个干扰物掉 1.67 个点,之后再加干扰物边际影响很小,呈阈值效应)。

模块消融(Tab.4,SoM/CtoF SoM × PointToPoint/Mark-based Grid/Oracle 组合,子集评测)

Grasping ProposalMotion PlanningSR (%)SPL (%)
SoMPointToPoint35.010.41
CtoF SoMPointToPoint27.57.29
SoMMark-based Grid15.01.58
CtoF SoMMark-based Grid10.00.94
SoMOracle50.0-
CtoF SoMOracle65.0-

要点:Point2Point 显著优于 Mark-based Grid(GPT 难以同时处理连续时序规划+图像定位);CtoF SoM 反而弱于 SoM(其抓取区域分析与 AnyGrasp 抓取提案重叠,重复 SoM 调用增加出错概率)。

端到端策略结果(单任务”捡香蕉放盘子”,Fig.5 数据扩展曲线):GR-1 从 100 episodes 的 33.0% SR 提升到 1K episodes 的 95.0% SR;ACT 同区间从 40.0% 提升到 72.5% SR——两者均随 BC 数据量单调提升。

GR-1 泛化消融(Fig.6,6 档难度):有限区域随机化 78.2% SR → 全桌面随机化 45.5% SR → 跨 5 场景训练测试 43.5% SR → 未见指令 0.0% SR → 未见物体 0.0% SR——同场景内位置级泛化可行,但布局级迁移已明显下降,语义/组合层面的泛化完全失效。论文说明:受限于计算资源,全部 200 场景的完整端到端评测留作未来工作(仅做了单任务+6 档消融)。

创新点与影响

  • 提出 ToSG(任务导向场景图) 作为比 PDDL 更适合 LLM 操作的中间表示,同时承担任务生成、可控布局构建、目标条件评测三重角色,形成”生成-执行-评测”闭环。
  • 首个把 10K 规模、带视觉-语言标注的资产库、人在环校正的 200 场景基准多方面(spatial/appearance/common-sense/long-horizon)+多步评测三者结合的桌面操作平台(对比 Tab.1 中 RoboCasa/RLBench/CALVIN/LIBERO/VIMA/Colosseum/ManiSkill2 均至少缺一项)。
  • 首次在同一基准下量化对比”模块化基础模型系统”与”端到端 VLA/模仿学习”两条泛化路线:模块化系统凭借基础模型的常识/外观理解在多样场景下泛化更稳(但长程规划、路径效率是短板);端到端策略随数据扩展性能强(GR-1 100→1K episodes 由 33%→95%),但对未见指令/物体几乎零泛化(0.0% SR),提示”双系统(dual-system)框架”是更具扩展性/鲁棒性的潜在方向。
  • 论文自陈局限:primitive skill 目前仅支持 pick-and-place 级别的 trajectory-action chaining,更多技能类型的聚合留作未来工作;受计算成本限制,仅做了单任务下的端到端数据扩展与 6 档消融,未在全部 200 场景上完整评测端到端策略;物理仿真的摩擦/质量参数与材质光照参数需要大量调试,仍存在可观的 sim-to-real gap(论文附录以 Franka 真机部署模块化基线定性验证仿真环境的真实感,但未做量化的仿真-真实对比)。
  • 论文之后(不在本文披露范围):项目已演进为 “GenManip Suite”,新增跨本体支持(Franka Panda/Robotiq 2F-85/Aloha Split/Lift2)、包管理式基准扩展系统,并作为 IROS 2025 Challenge(开放桌面视觉-语言操作) 的仿真后端,生成超 55K 条基于 ALOHA 平台的可泛化抓取-放置任务数据(发布于 Hugging Face InternRobotics/IROS-2025-Challenge-Manip),GenManip-Bench 计划并入 InternManip 项目。

原始链接

一手源存档(sources/)