一句话定位
RoboCasa 是一个基于 MuJoCo/RoboSuite 的大规模厨房仿真框架:120 个可交互厨房场景、2,509 个(多数由 text-to-3D 生成的)3D 物体、100 个任务(25 原子 + 75 由 LLM 生成的复合任务),配套用 MimicGen 自动扩增到 100K+ 条轨迹的多任务模仿学习数据集;它不是一个”模型”,而是一套数据生成 + 评测平台,后被 NVIDIA GR00T 等人形操作工作采用。
背景与定位
论文属于”用高保真物理仿真 + 生成式 AI 来规模化机器人学习数据”这一范式。核心动机:机器人数据稀缺,真实采集需要不现实的资本与人力,而仿真一旦建成即可低成本批量产数据(作者引 MimicGen、OPTIMUS 为例)。作者提出仿真要同时满足三条标准——realism(物理/渲染可迁移真实世界)、diversity(场景/资产/任务多样,靠生成式 AI 在规模上实现)、以及大规模配套数据集——并宣称此前仿真框架没有一个三条全占。
RoboCasa 建在 RoboSuite(MuJoCo,模块化/快/易用)之上,扩展支持移动操作(轮式底座、人形、带臂四足)。与相关工作对比:AI2-THOR / Habitat 2.0 有房间级场景但物理不真实(抓放靠脚本吸附);behavior-1k 有 1000 任务 / 1265 物体类但无机器生成数据与人类演示两者兼备;RLBench / ManiSkill2 / LIBERO 是桌面级;droid 是真实世界大规模遥操作数据集。RoboCasa 自称是唯一一个同时具备”大量任务 + 房间级场景 + 大量物体 + AI 生成任务 + AI 生成资产 + 大规模演示数据”的框架。数据扩增沿用 MimicGen(object-centric 段落分解 + 位姿变换 + 拒绝采样)路线,任务生成走 GenSim / RoboGen 之后的”LLM 提议任务”思路但强调仍需人写实现。
本页记录的是 2024-06 的原始 RSS 2024 版本;后续 RoboCasa365(ICLR 2026)见文末影响一节。
模型架构
RoboCasa 本体是仿真/数据平台,不含新模型;论文用于验证平台的策略是标准视觉运动 BC。
仿真栈:
- 后端:RoboSuite(MuJoCo 物理),继承其环境模型格式与机器人控制器;扩展加入移动操作机器人(轮式底座、人形、带臂四足),模型取自 RoboSuite / MuJoCo Menagerie 等仓库。
- 渲染:原生 MuJoCo 渲染(快,用于大批量数据)+ 可选 NVIDIA Omniverse 高质量照片级渲染。
- 场景:10 个厨房 floor plan × 12 种风格(Industrial / Scandinavian / Coastal / Modern / Traditional / Mediterranean / Rustic 等)= 120 个厨房场景;每场景可换纹理做域随机化。
- 可交互家具/电器:橱柜、抽屉、灶台、微波炉、咖啡机等,articulated(微波炉门可开合、灶台旋钮可拧)并支持状态变化(拧灶台旋钮→对应灶眼点火)。资产从在线 3D 库转成 MuJoCo MJCF,后处理把电器切成 articulated 部件。
评测所用策略(RoboMimic 的 BC-Transformer):
- 输入过去 10 步观测 + 语言目标,输出未来 10 步动作,执行第一步后重规划。
- 语言用 CLIP sentence encoder 编码。
- 三路相机(eye-in-hand、左工作区、右工作区)各用独立 ResNet-18 编码,经 FiLM 层融合;本体感觉编码末端执行器位姿 + 移动底座位姿。
- 主干 6 层 Transformer,约 20M 可训练参数。
- 对照实验用 Diffusion Policy(同一 ResNet+FiLM 观测编码器)。
数据
资产与纹理(均大量借助生成式 AI):
- 物体:2,509 个高质量 3D 物体,跨 153 个类别;来源为 Objaverse + Luma.ai(在线 text-to-3D 服务),其中 1,592 个来自 Luma.ai(即多数为 AI 生成),先海量挖掘再过滤掉缺陷/低质。
- 纹理:墙 100、地板 100、台面 100、橱柜面板 100,均用 MidJourney(text-to-image)生成,作为域随机化手段。
任务生成(LLM):
- 先问 ChatGPT(GPT-4)“给 30 个日常高层厨房活动”,人工选 20 个活动(brewing coffee/tea、washing dishes、restocking supplies、chopping food、frying、baking 等)。
- 再用 GPT-4 与 Gemini 1.5 为每个活动提议代表性任务,过滤逻辑错误(如引用不存在的 blender、误用技能、抓取本不该抓的餐具),汇成 75 个复合任务蓝图再人工写代码实现。
- 25 个原子任务覆盖 8 项基础技能:pick-and-place、开关门、开关抽屉、拧旋钮、扳杆、按钮、插入、导航。
演示数据集:
- 人类遥操作:4 名操作员用 3D SpaceMouse,每个原子任务采 50 条,共 1,250 条;每条在随机场景(随机 floor plan / 风格 / AI 纹理)中采集。作者发现仅此规模不足以解大多数任务。
- MimicGen 自动扩增:以 50 条人类演示为种子,每任务生成 3,000 条,覆盖 24 个原子任务(排除导航,MimicGen 尚不支持移动操作轨迹生成)= 72,000 条(Objaverse 物体);另发布 28K 条使用 AI 生成物体的轨迹,合计 100K+ 条。MimicGen 用拒绝采样只保留成功轨迹,并在多仿真进程并行加速。
- 训练图像用随机采样的 AI 纹理渲染(用轻量 MuJoCo 渲染器),评测则在人工策划纹理的场景中进行。
训练方法
- 目标:行为克隆(Behavioral Cloning),模仿数据集中动作。
- 原子任务多任务学习:在四种数据配置上各训一个 BC-Transformer——Human-50(1,250 条)、Generated-100(2,400 条)、Generated-300(7,200 条)、Generated-3000(72,000 条)。机器人固定为 Franka Panda + Omron 移动底座(近似 Omni-Frankie)。
- 超参:训 500k 梯度步,学习率 1e-4 + warmup。
- 复合任务:因难度高改为单任务策略,每任务 50 条人类演示,对比 Scratch(从头学)与 Fine-tuning(在原子任务全量 MimicGen 数据预训练模型上微调)。
- Diffusion Policy 对照:DDIM,训练 100 步 / 推理 10 步,观测历史 2、预测 horizon 16、动作 horizon 8(官方推荐值);显著弱于 BC-Transformer(见评测),作者归因于其观测历史只有 2 而 BC-Transformer 用 10。
- Sim-to-Real 共训:真实厨房里对每个任务采 50 条演示(各 5 个物体类别),对比 Real only 与 Real+Sim(真实演示 + 所有单阶段仿真 MimicGen 数据共训)。
Infra(训练 / 推理工程)
- 仿真基准:在 PickPlaceCounterToCab 任务上跑 10 episode,每次随机场景。渲染用 NVIDIA RTX A5000 GPU(原生 MuJoCo 渲染),物理跑在 AMD EPYC 7543 32-Core CPU 上。
- 带渲染:平均重置 9.50s,步进 25.2 fps。
- 不带渲染:重置 9.46s,步进 31.9 fps。
- 每步对应世界 0.04s(25 fps),即带渲染时约为实时速度。
- 控制频率:仿真机器人 20 Hz(Operational Space Control);真实机器人(DROID 硬件栈上的 Franka Emika Panda)控制器 15 Hz,且未用 OSC。仿真与真实间还有相机标定、光照、机器人底座位置的差异。
- 策略训练算力:未披露 GPU 数量 / GPU-hours / 并行策略 / 精度。
- MimicGen 数据生成:跨多个仿真进程并行;具体机数/耗时未披露。
评测 benchmark
全部结果来自论文(一手),基线为其自身数据配置与 Diffusion Policy。
原子任务多任务(24 任务平均成功率,50 trials × 5 固定评测场景,仅评测未见过的物体实例,5 场景中 2 个为训练未见风格):
| 数据配置 | 轨迹数 | 平均成功率 |
|---|---|---|
| Human-50 | 1,250 | 28.8% |
| Generated-100 | 2,400 | 26.3% |
| Generated-300 | 7,200 | 35.0% |
| Generated-3000 | 72,000 | 47.6% |
呈清晰 scaling trend:机器生成数据越多成功率越高,最终显著超过人类数据。技能层面:开关门/抽屉最易(CloseDrawer 0.96、CloseSingleDoor 0.94),pick-and-place 与 insertion 最难(多样性与灵巧性所致)。
Diffusion Policy vs BC-Transformer:在 PickPlaceCounterToSink 单阶段任务上,BC-Transformer 56% vs Diffusion Policy 12%。
复合任务(单任务,Scratch vs Fine-tuning):Scratch 在 5 个任务中 4 个为 0%;Fine-tuning 在 4/5 上非零但仍很低——ArrangeVegetables 2%→12%、MicrowaveThawing 0%→2%、RestockPantry 0%→6%、PreSoakPan 0%→4%、PrepareCoffee 0%→0%。整体仍有大量提升空间。
真实世界共训(DROID Franka,3 seed,5 seen + 3 unseen 物体类):
| Real only | Real+Sim(Ours) | |
|---|---|---|
| Seen 物体平均 | 13.6% | 24.4%(相对 +79%) |
| Unseen 物体平均 | 2.6% | 9.3% |
即共训仿真数据在真实机器人上把 seen 物体成功率相对提升约 79%。
创新点与影响
贡献:
- 首个同时具备”大规模任务 + 房间级场景 + 大量物体 + AI 生成任务 + AI 生成资产 + 大规模演示数据”的机器人仿真框架,把生成式 AI(text-to-3D 物体、text-to-image 纹理、LLM 任务生成)全链路嵌入仿真构建。
- 100 任务系统评测集(25 原子 + 75 LLM 复合),并给出跨全套任务的模仿学习分析。
- 用 MimicGen 把 1,250 条人类演示扩增到 100K+ 条,实证”生成数据规模↑→泛化↑“的 scaling 趋势,以及仿真数据共训提升真实机器人表现。
影响:RoboCasa 成为具身操作社区常用的数据生成/评测平台,被 NVIDIA GR00T 等人形操作工作采用(GitHub README 将 GR00T、π₀、Diffusion Policy 列为官方支持的基线)。其后续 RoboCasa365(ICLR 2026)在同一平台上扩到 365 任务、2,500+ 厨房场景、3,200+ 物体、600+ 小时人类演示 + 1,600+ 小时机器演示,并加了排行榜与 π₀/GR00T/Diffusion Policy 基准支持。
论文自陈局限:
- 复合任务微调性能仍低,策略架构/学习算法/微调策略有待研究。
- 生成轨迹虽”技术上成功”但常有抖动、碰撞等劣质行为(可靠检查仿真状态自动丢弃)。
- LLM 生成任务仍需人写实现代码;理想是让 LLM 自动写场景/任务代码。
- 仅限厨房环境。
- 数据只覆盖粗粒度操作,缺高灵巧、可变形、双手操作技能。
- 导航任务被 MimicGen 排除(不支持移动操作轨迹生成)。
原始链接
- arXiv abs:https://arxiv.org/abs/2406.02523
- arXiv PDF:https://arxiv.org/pdf/2406.02523
- 项目主页:https://robocasa.ai/
- 代码(GitHub):https://github.com/robocasa/robocasa
- 文档:https://robocasa.ai/docs/introduction/overview.html
- 后续 RoboCasa365(RSS24 PDF 与 ICLR26 PDF 均挂在主页):https://robocasa.ai/
一手源存档(sources/)
- robocasa—github-readme.md — GitHub README(含 RoboCasa365 更新、安装、基线列表、许可证与引用)
- robocasa—project-page.md — robocasa.ai 主页快照(场景/资产/技能/团队/引用)
- arXiv 原文 PDF(https://arxiv.org/pdf/2406.02523,arXiv 原文 PDF,不入 git)