一句话定位

GRUtopia 是上海人工智能实验室 OpenRobotLab 提出的「首个面向通用机器人的可交互 3D 城市级社会」仿真平台:跑在 NVIDIA Isaac Sim 上,由 10 万+ 可交互精标场景(GRScenes,覆盖 89 类功能场景)、LLM 驱动的 NPC 系统(GRResidents,负责社交对话与任务生成/分配)、以及三级具身基准(GRBench:物体导航 / 社交导航 / 移动操作)三部分组成,2025 年更名为 InternUtopia 并持续维护至今。

背景与定位

论文的出发点与 open-x-embodiment 一致——真机数据采集成本过高、跨本体泛化困难,因此押注 Sim2Real 范式作为具身智能规模化的关键路径。但作者认为已有仿真平台在「场景」与「任务」两个维度的多样性/复杂度都不足以支撑策略泛化:以 VirtualHome、Alfred 为代表的符号化平台缺乏物理真实性;Habitat 系列偏导航、弱交互;behavior-1k(同期的 OmniGibson 系平台)虽然物理真实性强(流体/可变形体/布料),但场景类型仅 8 种,且任务集中在家庭场景。GRUtopia 的差异化打法是三点并举:(a) 用 GRScenes 把场景范围从「家庭」扩展到服务型场景(医院、超市、餐厅、学校、图书馆等 89 类),可自由拼接成城市级地图;(b) 用 LLM 驱动的 NPC(GRResidents)第一次把「社交互动」系统性地纳入具身基准——机器人不只是执行指令,还要能就模糊指令与 NPC 对话澄清;(c) 用 GRBench 提供三档递增难度的「适度挑战性」任务,并原生提供强化学习训练好的类人形/四足底层控制策略作为 API,让研究聚焦高层规划而非从零训练走路。

在本 vault 内,可与 behavior-1k(同为 Isaac/Omniverse 系但物理真实性优先、场景多样性弱)、habitat-3(人-机器人协作、无 NPC 任务生成)、isaac-lab-orbit(同为 Isaac Sim 系仿真基础设施但偏底层控制训练)对照阅读。范式关键词:city-scale interactive simulation、LLM-driven NPC、learning-based control API、scene-aware task generation。

模型架构

GRUtopia 本身是「仿真平台 + 数据集 + 基准」,不是单一模型;以下分三部分记录其工程架构。

GRScenes(场景与物体资产)

  • 基座:NVIDIA Isaac Sim(Omniverse),场景以 USD/X-form 格式建模,物体做部件级(part-level)交互标注。
  • 层级化多模态标注:场景 → 室内区域(region,UI 手工在鸟瞰图上画多边形标注)→ 物体 → 部件(part),每个物体用 VLM(GPT-4v)基于多视角渲染图生成初始文本描述(外观、类别、房间归属),再人工核验。
  • 场景图(scene graph):节点=物体实例(含类别、房间、位姿、外观描述),边=空间关系;关系空间沿用 Sr3D(ReferIt3D)定义,并因内部结构可建模而新增 “in”/“out of” 关系(普通扫描场景通常只有表面信息,无法表达这类关系)。

GRResidents(LLM-NPC 系统)

  • World Knowledge Manager (WKM):持久化管理场景图与模拟器后端实时状态,暴露三个核心接口:find_diff(target, objects)(按 类别 > 房间 > 空间关系 > 外观 的优先级找出能收窄候选集合的差异点)、get_info(object, type)(按属性类型取物体信息)、filter(objects, condition)(按条件过滤候选集合)。
  • LLM Planner:三段式——记忆模块(存对话历史)→ LLM Programmer(迭代调用 WKM 接口查询场景知识)→ LLM Speaker(消费历史+查询结果生成回复)。
  • 新增 grounding API:grounding(target_object_info, anchor_object_info, relation_name),先按锚点信息定位锚点物体,再按空间关系+目标信息定位目标物体。

Robot Control APIs(底层控制策略)

  • 提供基于 RL 训练好的运动/操作底层控制策略作为 API(而非动画/瞬移伪执行),覆盖人形机器人 Unitree H1、Unitree G1、Fourier GR-1 与四足 Unitree Aliengo + Unitree Z1 机械臂;训练方法沿用作者团队 Hybrid Internal Model(同组 2024 ICLR 工作)与 Visual whole-body control 的实践。
  • 导航用简单最短路径搜索做路径规划;GRBench 基线智能体架构(Fig. 6)= 感知模块(原始传感器数据→语义/点云/BEV 地图/2&3D bbox)+ 记忆模块(动作-观测历史)+ 决策模块(VLM 或 LLM 做动作决策)+ 动作模块(执行输出动作,可选择向 oracle NPC 提问)。

数据

  • GRScenes 全量:约 10 万个高质量合成场景(从设计师网站采集原型,清洗+语义标注后拼接成城市),覆盖 89 个功能场景类别;除常见家居场景外,约 30% 来自其他多样类别(餐厅、办公室、公共场所、酒店、娱乐场所等)。
  • 首批开源子集(因版权问题,论文写作时只放出这部分):100 个精标场景(70 个家居 + 30 个商业场景,覆盖医院、超市、餐厅、学校、图书馆、办公室等),跨 7 种建筑类型;GitHub README 显示后续(GRScenes-100)已在 OpenDataLab / ModelScope / HuggingFace(InternRobotics/GRScenes)持续发布。
  • 这 100 个场景内含 2,956 个可交互物体 + 22,001 个非交互物体,共 96 个物体类别;可交互物体由专业团队补齐内部结构并在 NVIDIA Omniverse 的 X-form 中做部件级标注。
  • NPC 评测数据:Grounding 实验从 10 个家居场景的场景图模板生成 500 条物体描述(隐藏类别名/关系同义替换/自然语句改写三种规则化增强,GPT-4o 执行);Object-centric QA 用 GPT-4o 生成+人工核验,得到 489 条 物体中心导航 episode,共 1,669 轮人机对话交互,评测用 text-embedding-3-large 句向量余弦相似度(阈值 0.6 判对/错)。
  • GRBench 任务数据:三个基准各生成 300 个 episode(100 验证 + 200 测试)。

训练方法

  • GRUtopia 平台本身不训练端到端策略;论文用其做两类模型的评测与消融:(1) NPC 的 LLM 决策(GRResidents),(2) GRBench 智能体基线(VLM 零样本 / LLM Agent)。
  • 底层控制策略:人形/四足运动与抓取控制器用强化学习预训练(依赖同组 Hybrid Internal Model 方法),作为固定 API 提供给上层智能体,不在本文重新训练。
  • NPC 决策:无参数训练,走 in-context 的三段式流水线(记忆→程序员 LLM 查询→speaker LLM 应答),可插拔不同底座 LLM(GPT-4o / InternLM2-Chat-20B / Llama-3-70B-Instruct)。
  • GRBench 基线:Zero-Shot VLM 基线(InternVL-Chat-1.5、GPT-4o、Qwen-VL)直接吃当前观测图+语言 prompt,从 12 个离散动作(前进 2/4/6m、斜向 2/4/6m、左右转 90°、停止;社交导航额外加 Ask;操作导航额外加 Pick/Place)里选一个逐步执行至输出 Stop。LLM Agent 基线走 Fig.6 的感知-记忆-决策-动作四模块框架,决策模块可换用 Qwen / Llama-3-8B / InternLM2-Chat / ChatGLM3 / GPT-4o 作为语言后端。
  • 控制策略在高层任务中的降级评估:把无碰撞路径规划下的开阔地/家具密集室内两种环境对比,作为「简单点位到点位导航」而非完整任务,用以隔离底层控制的稳定性。

Infra(训练 / 推理工程)

  • 仿真器:NVIDIA Isaac Sim / Omniverse(README 要求 Isaac Sim 4.5.0,NVIDIA RTX 2070 及以上 GPU,驱动 ≥535.216.01,Ubuntu 20.04/22.04)。
  • 底层控制策略训练用的 GPU 数量/GPU-hours、NPC LLM 推理延迟、GRBench 基线控制频率(control-Hz)等具体工程数字论文未披露。
  • 底层控制策略稳定性评测(论文 Table 3,开阔平地 vs. 家具密集室内环境,机器人做点到点导航/抓取):
    • Locomotion(Flat):Unitree H1 轨迹误差 TE=0.01m,成功率 SR=100%,平均速度 AS=0.19m/s,平均耗时 AT=43.51s;Unitree Aliengo+Z1 TE=0.01m,SR=100%,AS=0.25m/s,AT=32.88s。
    • Locomotion(House,家具密集室内):H1 TE=0.07m,SR 从 100% 降到 58%,AS=0.17m/s,AT=36.46s;Aliengo+Z1 TE=0.13m,SR 降到 14%,AS=0.16m/s,AT=32.35s。
    • Manipulation(Flat→House,Aliengo+Z1):末端位置误差 PE 0.00m→0.56m,SR 从 100% 降到 8%
    • 作者将这一差距归因于路径/运动规划失败(而非底层控制本身不稳),并引入「重置次数(RT)」指标衡量底层策略鲁棒性——机器人摔倒后重置为站立姿态、用重置次数评估。

评测 benchmark

GRResidents 交叉验证(论文 Table 2,Referring/Grounding/QA,%/分)

  • GPT-4o:Referring 100.0,Grounding 93.2,QA 95.8
  • InternLM2-Chat-20B:Referring 95.9,Grounding 83.3,QA 88.7
  • Llama-3-70B-Instruct:Referring 100.0,Grounding 88.6,QA 92.5 (Referring:人工标注员靠 NPC 描述定位物体是否成功;Grounding:GPT-4o 扮演人工出描述,NPC 定位是否成功;QA:物体中心导航问答的语义相似度打分。)

GRBench 三档基准(论文 Table 4,含 Random / Zero-Shot VLM / LLM Agent 多个基线,跨 test/validation 两个 split):论文原始结果表因排版复杂、抽取文本列错位严重,逐格数字无法可靠还原,故不在本页逐一转录,仅摘录论文正文明确给出的定性结论:Random 策略在三个基准上的表现均接近 0(验证任务非平凡);采用较强 LLM 作为决策后端时三个基准均显著优于随机与直接用多模态大模型做决策;在需要主动对话澄清的 Social Loco-Navigation 上,Qwen 好于 GPT-4o。Loco-Manipulation 任务上所有测试的基线成功率均为 0,作者将其归因于(1)Aliengo 转弯半径/底盘更大导致导航碰撞增多、重置次数显著高于另两个基准,(2)操作时机械臂频繁与环境碰撞,反映现有多模态大模型难以做复杂运动规划。

感知模块消融(论文 Table 5,验证集 50 个 episode,决策后端固定,只换感知模块)

  • 感知=GPT-4o:Object Loco-Nav PL=23.82/SR=8.00%/SPL=4.26/RT=0.89;Social Loco-Nav PL=21.70/SR=12.00%/SPL=9.88/ECR=1.57/RT=1.80;Loco-Manip PL=0.23/SR=0/SC=0。
  • 感知=Qwen-VL:Object Loco-Nav PL=24.67/SR=6.00%/SPL=4.17/RT=0.87;Social Loco-Nav PL=21.41/SR=12.00%/SPL=10.36/ECR=0.56/RT=2.30;Loco-Manip PL=0.23/SR=0/SC=0。
  • 结论:感知模块质量对整体表现有显著影响;同时作者对比 oracle action(直接设定位姿)与 RL 底层控制器发现 oracle 显著更优,说明「理想化底层控制假设」与真实部署之间仍有明显差距。

任务成功判定:Benchmark 1/2 要求目标物体进入智能体视野且距离小于 3 米;Benchmark 3 要求目标手持物按 WKM 判定的条件被正确放置;三者均要求在 14,400 步物理仿真的生命周期内执行 STOP 动作,否则判失败。

创新点与影响

  • 场景规模与多样性:把具身仿真场景从「家庭为主」扩展到 89 类服务型场景、10 万级可组合规模,可拼接为城市级环境,是当时场景类别数量最多的仿真数据集(对比 Behavior-1K 的 8 类场景类型)。
  • LLM-NPC 系统的引入:首次把「社交澄清对话」系统性纳入具身基准的任务设计与评测(Social Loco-Navigation),NPC 通过 WKM 结构化场景知识做精确指代消解与信息问答,而非单纯闲聊。
  • 可插拔的底层控制 API:为人形(H1/G1/GR-1)与四足+机械臂(Aliengo+Z1)提供预训练好的 RL 控制策略 API,让研究者可以专注高层任务规划而非从零训练底层运动/抓取。
  • 难度梯度设计:三档基准(物体导航 → 社交导航 → 移动操作)的成功率随难度单调下降,验证了基准设计的合理性;操作任务全 0 成功率暴露现有多模态大模型在复杂运动规划上的短板。
  • 平台演进:项目 2025-02 发布 GRUtopia 2.0,2025-07 正式更名为 InternUtopia(2.2.0),并孵化出 InternNav / InternManip 两个下游基准仓库,GRScenes 数据集持续在 HuggingFace(InternRobotics/GRScenes)维护更新,是本工作影响力延续的直接证据。
  • 作者自陈局限(论文 Conclusion):初始版本仅放出 100 个标注场景与一个城市街区(完整 10 万场景因版权问题分批放出);当前 NPC 系统的社交互动不含物理真实接触;控制策略在复杂室内环境下成功率大幅下降,高层规划与底层控制的联合鲁棒性仍是开放问题。

原始链接

一手源存档(sources/)