一句话定位

MetaUrban 是 UCLA MetaDriverse 团队做的面向城市微出行(urban micromobility)的具身仿真平台:分层布局生成 + VLM 驱动的可扩展障碍物检索 + “同居者”(cohabitant)动态人群三个模块组合,可程序化生成无限多样的街区场景(人行道/十字路口/环岛/地形),内置 1,100 个绑定人体模型 × 2,314 种动作、10,000 个真实分布静态物体资产,并原生支持配送机器人、电动轮椅、代步车、机器狗、人形机器人等多种”移动机器”跨本体评测;ICLR 2025 Spotlight。

背景与定位

已有具身仿真器覆盖两类场景:室内家居(AI2-THOR、Habitat、Habitat 3.0、iGibson、ProcTHOR、OmniGibson)聚焦公寓内的物体交互与操作;自动驾驶(SUMO、CARLA、MetaDrive)聚焦车道级道路交通。社交导航仿真器(HuNavSim、SEAN 2.0、SocNavBench)虽引入行人,但场景是简化的 2D/3D 地图,缺少真实世界的物体分布与地形复杂度。三者都没有覆盖”人行道、广场”这类公共城市空间——而配送机器人、电动轮椅、机器狗、人形机器人已经开始在这里与行人共享路权。

论文 v1(2024-07,标题 “A Simulation Platform for Embodied AI in Urban Spaces”)以”城市空间”为叙事框架;v2(2024-10,ICLR 2025 camera-ready,即本页采用的标题 “urban micromobility”)把叙事收紧为”AI 驱动的城市微出行”这一更具体的范式,并新增了跨移动机器(配送机器人/电动轮椅/代步车)的机械结构对比实验、地形生成系统、以及”城市微出行四大独有挑战”的专门验证章节。MetaUrban 复用 MetaDrive 的 Block Incremental Generation(BIG)算法与 PyBullet 物理引擎/Panda3D 渲染管线搭建仿真底座,与同期的城市导航工作 CityWalker(从网络视频学习城市导航策略,不自建仿真环境)形成互补——CityWalker 解决”数据从哪来”,MetaUrban 解决”仿真环境怎么造、怎么评测跨本体安全性”。

模型架构

MetaUrban 是仿真基础设施论文,这里的”架构”指仿真器的三大构建模块(均为程序化生成管线,不是神经网络):

  • 分层布局生成(Hierarchical Layout Generation):从街区地图开始逐层细化。地面规划层先定义 5 类典型街区(直行、十字路口、环岛、圆形、T 字路口),采样街区类别/数量/顺序/车道数;据 Global Street Design Guide,人行道被划成 4 个功能区(建筑区、临街区、净空区、家具区),组合出 7 种典型人行道模板,可采样模板并分配各功能区宽度。地形生成层采用 Wave Function Collapse(WFC)方法连接采样的地形基元,定义 5 种地形基元(坡、台阶、楼梯、坡道、崎岖地),网格生成后叠加不同摩擦系数纹理模拟不同地面材质(v2 新增,v1 无地形系统)。物体放置层将物体分三类:标准基础设施(电线杆、树、标志牌,沿路周期放置)、非标准基础设施(建筑、盆栽、垃圾桶,功能区内随机放置)、杂物(饮料罐、包、自行车,全功能区随机放置)。
  • 可扩展障碍物检索(Scalable Obstacle Retrieval):先从真实世界抽取物体类别分布——用 CityScape + Mapillary Vistas 两个闭集场景理解数据集拿到 90 类高频物体;再引入两个开放集来源扩展:① 从 50 个国家 6 大洲收集 25,000 张 Google 街景图像,用 GPT-4o 生成候选物体描述、Grounded-DINO 出检测框、NMS 精修、Grounded-SAM 做开放集分割过滤,再用 all-mpnet-base-v2 句向量 + DBSCAN 聚类去重得到 1,075 个物体描述簇;② 调研 10 本城市规划手册得到 50 个必备物体描述。三源合并成 1,215 条物体描述池。检索阶段基于图文检索架构:从 Objaverse / Objaverse-XL 采样候选 3D 资产,每个资产渲染 20 张多视角图(选取高质量视角优先),用 BLIP 视觉语言模型编码图像与文本描述算余弦相似度,取分数达阈值的资产,再人工筛除低分辨率/不真实的资产,最终构建出 10,000 个高质量、真实分布的城市专属静态物体资产库。
  • 同居者填充(Cohabitant Populating):人体用 SMPL-X 参数化模型表示(姿态 θ、体型 β、表情 φ),基于 SynBody 资产库,从 68 种服装、32 种发型、13 种胡须、46 种配饰、1,038 种服装/皮肤纹理中程序化采样出 1,100 个绑定 3D 人体模型。动作分日常动作(idle、走、跑)与独特动作(跳舞、锻炼等,来自 BEDLAM 数据集共 2,311 种独特动作),统一骨骼绑定使动作可直接迁移到全部人体模型,组合出 1,100×2,311 个人-动作对。除行人外还引入弱势道路使用者(骑车人、滑板者、代步车骑手)和多种移动机器:v1 版本为 COCO Robotics/Starship 配送机器人、Drive Medical 电动轮椅、Boston Dynamics 机器狗、Agility Robotics 人形机器人共 6 类;v2 追加 Yandex Rover 配送机器人与 Pride Go-Go 代步车。轨迹规划用 ORCA 社会力模型(联合优化+集中式控制器,保证无碰撞)配合 Push & Rotate(P&R)多智能体寻路算法(局部协调解决死锁),100 智能体的轨迹规划在 Core i9 CPU 上 5 秒内完成;交通车辆沿用 MetaDrive 的 IDM 策略。

主干评测智能体的动作空间是 MetaDrive 式的 2 维连续向量(归一化到 [-1,1),表示加速度与转向率),观测含 RGB、Depth、语义图、LiDAR(50m 探测半径),实验中统一用 LiDAR 向量。

数据

  • MetaUrban-12K 数据集规模:12,800 个训练场景(MetaUrban-train)+ 1,000 个测试场景(MetaUrban-test),另建 100 个人工设计的未见场景(MetaUrban-unseen,采样自未见模板 g “宽商业人行道”+未见物体+设计师手动调整的轨迹)用于跨域泛化评测,以及与 unseen 同分布的 1,000 个微调场景(MetaUrban-finetune)。12K 场景在本地工作站上 12 小时内可生成完毕。
  • 场景统计:场景由 1–3 个街区连接,平均覆盖 20,000m² 面积;平均每 m² 有 0.03 个静态物体,物体间平均距离 0.7m,每场景至少 300 个物体;物体占地面积近似正态分布,中心在 5,250m²;每街区平均 10 个动态智能体;平均单集长度 410m,其中超过 20% 的单集长度超过 800 步。
  • 示范数据:从训练好的 RL agent 与人类操作员采集共 30,000 步高质量专家示范(用于离线 RL / 模仿学习),示范数据成功率 60%(作为 Offline RL/IL 实验的参考基线)。PointNav 的离线数据集由 20% 人类示范 + 80% 训练好的 PPO 策略示范混合组成。
  • 资产规模:10,000 个真实分布静态物体资产(来自 Objaverse/Objaverse-XL,经 BLIP 图文检索+人工筛选);1,100 个绑定人体模型 × 2,314 种动作(1,100 来自 SynBody 采样,2,311 独特动作来自 BEDLAM,另加 3 种日常动作);5 类弱势道路使用者;6–7 类移动机器(v1 6 类,v2 追加至 7 类含 Yandex Rover/Pride Go-Go);37 种车辆资产。
  • 许可:场景数据集、3D 资产库、代码均以 Apache 2.0 发布;3D 人体资产沿用 SynBody 的 CC BY-NC-SA 4.0 许可,动作序列沿用 BEDLAM 许可条款。数据采集时间:v1 版本 2024 年 5 月,v2 版本更新于 2024 年 9 月。

训练方法

MetaUrban 本身不训练模型,而是提供任务定义 + 基线训练配方,建立 PointNav(静态环境点导航)与 SocialNav(含动态智能体的点导航,需规避碰撞/越界接近,距离阈值 <0.2m)两个任务的完整基准:

  • 强化学习:PPO,128 个并行环境(128 进程),奖励函数 R = R_term + c₁R_disp + c₂R_lateral + c₃R_steering + c₄R_crash(到达终点 +5/出界 −5 的稀疏终端奖励,位移奖励系数 c₁=0.5,横向偏移惩罚 c₂=1.0,转向平滑惩罚 c₃=0.1,碰撞惩罚 c₄=1.0,不采用碰撞即终止策略),关键超参:环境视界 T=1000,学习率 5e-5,折扣因子 γ=0.99,GAE λ=0.95,clip ε=0.2,训练 batch 25,600,SGD minibatch 256,cost limit 1。
  • 安全强化学习:PPO-Lag(拉格朗日约束项)与 PPO-ET(早停终止 MDP 建模),基于 OmniSafe 实现,50 个并行环境。
  • 离线强化学习:IQL 与 TD3+BC,纯离线训练,100 epoch,关键超参见下方 Infra 段落数据规模。
  • 模仿学习:BC(SGD batch 64,40 epoch)与 GAIL(generator/discriminator 学习率 1e-4/3e-3,discriminator 优化 2,000 epoch,clip ε=0.2)。
  • 跨移动机器评测(v2 新增,4.2 节):固定同一 PPO 训练流程,仅替换机械结构参数(最大车速、最大转向角、轮摩擦系数、发动机推力、刹车力),在静态障碍规避任务上对比 5 种配置(COCO base/mod-1/mod-2、电动轮椅、代步车),量化机械设计对策略学习与执行的影响。
  • 地形执行鲁棒性评测(附录 D.3):固定统一的”向前移动”策略,在坡道/台阶/崎岖三种递增难度跑道上测试轮式机器(配送机器人/电动轮椅/代步车)的 x 位移与 Time-to-fall,量化轮距/轮径/轮宽对地形通过能力的影响。

Infra(训练 / 推理工程)

  • RL/SafeRL 训练:单张 Nvidia A5000 GPU,PointNav 上 PPO/PPO-Lag/PPO-ET 训练耗时 12 小时、500 万环境步;SocialNav 因动态智能体密集,在线方法训练速度约为 PointNav 的 1/3。
  • 离线 RL/IL 训练:单张 Nvidia A5000 GPU,IQL/TD3+BC 纯离线训练约 2 小时(100 epoch)。
  • 仿真吞吐(附录 G Performance):单张 Nvidia V100 GPU、单进程,场景平均约 200 个物体覆盖 1,500m²,采样 1,000 步动作、重复 10 次报告均值±标准误;128×128 分辨率下 RGB 观测 50±15 FPS、Depth 观测 60±10 FPS、LiDAR 观测 120±12 FPS(训练态)。
  • 场景生成吞吐:MetaUrban-12K 的 12,800 个场景可在本地工作站上 12 小时内生成完毕;环境初始化时间与 RAM 占用只与智能体”类别”数相关,与”数量”无关(100 个相同智能体与 1 个耗时相同),便于在特定硬件上扩展并发智能体规模。
  • 轨迹规划耗时:ORCA+P&R 联合规划 100 个智能体的 2D 轨迹,在 Core i9 CPU 上 5 秒内完成。
  • GitHub README 独立基准(非论文正文,来自仓库文档):在 RTX-3090/RTX-4080/RTX-4090/RTX-A5000/Tesla V100 上测试,运行 drive_in_static_env.py 示例约 60 FPS、约 2GB 显存占用;推荐配置为 Nvidia GPU ≥8GB RAM、≥3GB 显存,存储 ≥10GB。
  • 鲁棒性(附录 H):多随机种子训练 PPO(PointNav),MetaUrban-test 成功率 0.695±0.014,MetaUrban-unseen 成功率 0.638±0.060,种子间方差较小。
  • 推理侧机器人 Hz/端到端延迟:论文未披露(附录提到已在 Unitree Go2 四足与 COCO Robotics 轮式机器人上做初步真实部署验证,但未给出具体控制频率或延迟数字)。

评测 benchmark

PointNav / SocialNav 基准(Table 1,COCO Robotics 配送机器人为本体,7 个基线,MetaUrban-test / MetaUrban-unseen):

CategoryMethodPointNav Test SR/SPL/CostPointNav Unseen SR/SPL/CostSocialNav Test SR/SNS/CostSocialNav Unseen SR/SNS/Cost
RLPPO66% / 0.64 / 0.5149% / 0.45 / 0.7834% / 0.64 / 0.6624% / 0.57 / 0.51
Safe RLPPO-Lag60% / 0.58 / 0.4160% / 0.57 / 0.5317% / 0.51 / 0.338% / 0.47 / 0.50
Safe RLPPO-ET57% / 0.53 / 0.4753% / 0.49 / 0.655% / 0.52 / 0.262% / 0.50 / 0.62
Offline RLIQL36% / 0.33 / 0.4930% / 0.27 / 0.6336% / 0.67 / 0.3927% / 0.62 / 3.05
Offline RLTD3+BC29% / 0.28 / 0.7720% / 0.20 / 1.1626% / 0.61 / 0.6232% / 0.64 / 1.53
ILBC36% / 0.28 / 0.8332% / 0.26 / 1.1528% / 0.56 / 1.2318% / 0.54 / 0.58
ILGAIL47% / 0.36 / 1.0540% / 0.32 / 1.4634% / 0.63 / 0.7128% / 0.61 / 0.67

关键结论:两个任务都远未被解决(最高成功率仅 66% / 36%);未见场景零样本平均成功率仍达 41% / 26%,证明组合式场景生成带来的泛化能力;SocialNav 比 PointNav 平均低约 15 个百分点(动态智能体带来的额外难度);Safe RL 显著改善 Cumulative Cost 但牺牲成功率/SPL。

跨移动机器评测(Table 2,PPO,静态障碍规避,S=直行街区/X=十字路口街区):

机器最大车速(km/h)最大转向角(°)发动机推力(N)SR(S/X)SPL(S/X)Cost(S/X)
COCO(base)3040350–55047%/41%0.46/0.380.32/1.50
COCO(mod-1,限速10km/h)1040350–55062%/56%0.61/0.530.28/1.64
COCO(mod-2,限转向10°)3010350–55017%/22%0.15/0.200.35/1.21
电动轮椅55100–20013%/16%0.11/0.140.30/1.10
代步车4545450–65036%/31%0.33/0.280.34/1.43

结论:电动轮椅设计最保守(速度/转向/推力最低),十字路口 Cost 最优但整体成功率最差;代步车设计最激进,机动性优于轮椅但十字路口 Cost 最差;把 COCO 最高车速降到 10km/h(mod-1)显著同时提升成功率与安全性,而限制转向角(mod-2)则显著损害性能。

地形鲁棒性(附录 D.3,x-displacement / Time-to-fall):代步车(轮距 0.6m/轮径 0.2m/轮宽 0.15m)坡道上表现最好(31.90m→38.07m x-displacement 提升,视具体机型);三种机器在台阶测试上表现同样糟糕(轮式机器固有缺陷);配送机器人(轮距最小 0.45m)三项地形测试均最差。

消融研究:泛化性——在 unseen 集上零样本达 49% 成功率;直接在 finetune 集训练 vs 先在 train 集预训练再 finetune,后者显著更优。scaling——训练场景数从 5 增至 1,000,成功率从 12% 提升到 46%。静态/动态密度——密度从 1% 升到 100%,train/test 成功率均剧烈下降。

四大城市微出行独有挑战验证(附录 E):① 长时程大尺度——训练单集长度 10m(室内常见)vs 410m(城市常见),在 MetaUrban-test 上测试,SR 从 10%(SPL 0.08)提升到 41%(SPL 0.38);② 多样地形——同附录 D.3;③ 多样障碍——与 ProcThor 的物体类别分布对比显示显著差异;④ 密集行人——以每 100m 单集 10 个行人(城市常见,Setting-1)为参照 SR 24%/Cost 0.51;减到 5 个行人(Setting-2,室内常见密度)SR 降至 16%、Cost 升至 0.75;行人数不变但集中在路口(Setting-3,驾驶场景常见分布)SR 降至 10%、Cost 升至 0.74;用 Setting-1 模型在 30 个行人/100m(Setting-4,拥挤城市场景)上测试,SR 骤降至 8% 但 Cost 仅温和升至 0.68。

创新点与影响

贡献:

  1. 首个专为”城市微出行”设计的具身仿真平台,补齐室内/驾驶/社交导航三类现有仿真器都未覆盖的”人行道/广场”公共城市空间。
  2. 分层布局生成(含 WFC 地形系统)+ VLM 驱动的可扩展障碍物检索,首次把真实世界物体类别分布(25,000 张跨 50 国街景图像抽取)系统化引入仿真场景生成。
  3. 同居者填充模块提供了当时具身仿真环境中最大规模的绑定人体(1,100)与动作(2,314)数量(v2 Table 3 对比 Habitat 3.0 的 12 人/3 动作、CARLA 的 49 人/1 动作)。
  4. 首次系统评测”移动机器机械结构差异”对导航策略学习与地形通过能力的影响(v2 新增),为轮式机器人设计提供仿真侧的定量参考。
  5. 建立 PointNav/SocialNav 双任务、7 个基线(RL/Safe RL/Offline RL/IL)全覆盖的标准基准,以及场景数量、静态/动态密度、长时程等多维度消融协议。

影响:ICLR 2025 Spotlight;开源代码/数据/资产库(Apache 2.0),支持 Ray、Stable Baselines、Imitation、Torch 等框架;截至 2026-07 GitHub 仓库持续维护并发布 v0.1.0 正式版。作者在初步真实机器人部署(Unitree Go2、COCO Robotics 轮式机器人)上验证了用语义图/LiDAR 等抽象观测+域随机化训练可获得不错的 sim-to-real 泛化,但未给出量化的真实世界成功率或延迟指标。

论文自陈局限:① 目前只提取了物体类别的真实世界分布,物体位置/场景布局的真实分布提取依赖真实视频的高精度 3D 重建,极具挑战;② 环境智能体行为是确定性规则驱动(ORCA/P&R),未建模真实世界智能体间的交互性;③ 只研究了导航任务,未覆盖不同机器人本体的运动/操作等额外能力;④ 场景规模扩大后物理仿真与渲染效率会显著下降,需要更先进的物理引擎/渲染器(作者提及在探索接入 Nvidia Omniverse 渲染与 PhysX 物理);⑤ Sim-to-real gap 是仿真器普遍存在的问题,MetaUrban 目前未做系统性真实世界实验对比。

原始链接

一手源存档(sources/)

  • metaurban—github-readme — GitHub README 快照(sources/embodied/2024/metaurban—github-readme.md)
  • metaurban—project-page — MetaDriverse 项目主页快照(sources/embodied/2024/metaurban—project-page.md)
  • arXiv 全文(2407.08725 v1/v2,HTML/PDF)为 arXiv 原文,不入 git,见上方 arXiv 链接