一句话定位
Habitat 3.0 是 Meta FAIR 在 Habitat 仿真谱系上的第三代平台:在 Orbit 之外走了另一条路线——不追求可变形体物理精度,而是用「刚性骨架 + 蒙皮网格 + 离线缓存的 SMPL-X 姿态/动作」把逼真人形(humanoid avatar)塞进 Habitat-Sim,代价几乎为零(双 Spot 机器人 1345 FPS vs 人形+机器人 1190 FPS),并配一套客户端-服务器架构的人机回环(HITL)工具,让真人可以用键鼠或 VR 直接操控人形与训练好的机器人策略互动。论文提出两个新基准任务——社交导航(找人+跟随)与社交重排(人机协作收拾物品)——系统研究零样本协作(ZSC)泛化,并首次把自动化评测结果与 30 名真人被试的 HITL 评测结果做了对照。
背景与定位
此前的具身 AI 仿真器(Habitat 1.0/2.0、AI2-THOR、iGibson、SAPIEN、ManiSkill 系等)几乎都假设智能体是仿真世界里唯一会主动改变环境的「隐士」——即使有交互式操纵,环境的变化也只源于单一智能体自身的动作。但真实世界里的家用辅助机器人必须与会自主移动、会打乱环境的人类共享空间。已有的人形/人机协同仿真尝试各有明显短板:iGibson 2.0 的人形是沿预定轨道移动的刚体;VirtualHome(-Social) 支持人形交互但不支持机器人;Overcooked-AI 局限于 2D 网格;VRKitchen 侧重 VR 数据采集而非人形仿真;SEAN 2.0 同时支持人形与机器人但只有 3 个场景、聚焦社交导航、不支持物体交互。Habitat 3.0 的定位是把「高保真人形仿真」「HITL 交互」「大规模室内场景 + 物体交互」「机器人-人形协作基准」四件事第一次拼在一起,并且仿真速度不因加入人形而显著下降。
范式上,论文把已经研究成熟的单智能体导航 (PointNav/ObjectNav/ImageNav) 与重排任务「提升」到人机协同设定:社交导航(Social Navigation)中机器人目标与人形目标相互独立(只需找到并跟随、不能碰撞);社交重排(Social Rearrangement)沿用 Szot et al. (2023) 的双机器人协作重排任务设定,把其中一个机器人换成人形并推广到异构智能体、更多样的未知场景与未知搭档,两者需要真正协调分工完成共同目标。作者团队含 Xavi Puig、Andrew Szot、Dhruv Batra、Roozbeh Mottaghi 等,与同期发布的 Habitat Synthetic Scenes Dataset (HSSD-200) 及 HomeRobot 项目同属 Meta 这次「社交具身智能」发布组合。
模型架构
Habitat 3.0 是仿真框架 + 基准任务,不是单一模型;下面按「人形表征」「机器人」「HITL 架构」「策略网络」四部分拆解。
人形表征(SMPL-X + 缓存):人形用带旋转关节的骨架做碰撞检测/物理,外挂一张蒙皮网格(linear blend skinning, LBS)做渲染,二者解耦——骨架管物理、蒙皮只管视觉,这是速度关键。骨架/网格由 SMPL-X(Pavlakos et al. 2019)参数化:姿态 J∈R¹⁰⁹(手+身体+面部关节旋转)、体型 β∈R¹⁰(网格顶点位移主成分)。为了免去在线跑 SMPL-X 前向的开销,团队离线缓存 4 个男性 + 4 个女性 + 4 个中性共 12 个基础体型的骨架与蒙皮网格,运行时只做 LBS,代价是失去姿态相关的蒙皮形变(pose-dependent blend shapes)细节。
动作与行为:分层设计——学习到的策略/规划器调用一小组低层技能。(1) 行走:路径规划器生成路点,人形先原地转向下一个路点再直线前进,行走动画取自 AMASS 数据集的单个步态周期并循环播放直到到达路点。(2) 拾放:用 VPoser 离线为每个体型预计算一批”手伸向某 3D 位置、双脚固定”的静态姿态,按手相对人体根节点的 3D 坐标建索引;运行时对目标点在最近邻姿态间插值取姿态,免去在线查询 VPoser;连续拾放动作 = 手当前位置到目标位置画一条 3D 直线,在线上取中间点姿态,到达后运动学地把物体挂/摘到手上。论文自陈局限:该方法只覆盖行走和伸手两种动作,原地转向有视觉瑕疵,姿态若超出 VPoser 采样范围(手离身体过近/过远)会失真。
机器人:Boston Dynamics Spot 四足,5 对深度+RGB 相机(前左/前右/左/右/后)+ 7-DoF 机械臂(臂端一对深度+RGB 相机,224×171 分辨率、55° HFOV)。动作空间:底盘连续线速度+角速度(2 维),机械臂 7 维关节角增量;若前进/转弯会碰撞则可倒车。
HITL 架构:客户端-服务器分离——服务器跑仿真、智能体推理与键鼠控制逻辑,客户端只做平台相关的渲染与输入处理,因此可移植到资源受限的浏览器或 VR 设备;支持不同粒度的录制/回放(从高层 navigate/pick/place 到逐帧人形姿态与刚体轨迹),并可用不同的第一/第三人称相机重新渲染整段回合。
高层策略网络(社交导航 & 社交重排通用架构):ResNet-18 视觉编码器把 256×256 深度图编码成 512 维嵌入,与状态传感器拼接后过 2 层 LSTM(隐层 512),输出动作与价值预测;社交导航策略约 8517k 参数。社交重排用”两层”架构——学习到的高层策略从预定义技能库里选低层技能执行,低层技能有 oracle(特权地图导航+瞬时抓取/放置)与 learned(无特权信息、更真实但失败率更高)两种变体。
数据
- 场景:来自同期发布的 Habitat Synthetic Scenes Dataset (HSSD-200)——211 个人工制作的高质量 3D 家庭场景、超过 1.8 万个真实物体模型(论文正文称”18k+“,博客给出精确数 18,656 个模型、466 个语义类别)。Habitat 3.0 实验只用其中一个子集:59 个场景(37 训练 / 12 验证 / 10 测试),物体限定为 YCB 数据集以简化设置。
- episode 采样:训练场景每场 1000 条 episode,验证场景每场 100 条,测试场景每场 15 条。
- 人形动作数据:行走动画来自 AMASS 动捕数据集截取的单步态周期;拾放姿态由 VPoser 离线生成后缓存,不依赖额外人类演示数据。
- 社交重排的协作者数据:训练时按不同基线构造”协作者种群”(1~8 个不等),零样本评测种群 ZSC-pop-eval 由 10 个协作者组成——3 个来自 Learn-Single/Learn-Pop 的学习到人形策略 + 4 个来自各 Plan-Pop_p 的规划器协作者(每个基线在训练中大约只见过其中 1/3 的评测协作者,需泛化到剩余 2/3)。
- 全流程为仿真生成数据,无真实世界人类演示;HITL 部分的”真实数据”是 30 名真人被试在 3 种条件(solo / Learn-Single 搭档 / Plan-Pop₃ 搭档)下各做 10 个 episode 产生的交互轨迹与碰撞/步数记录(用于事后 GLMM 统计分析,非训练数据)。
训练方法
- 社交导航:机器人侧用 DD-PPO 端到端 RL 训练”感知到动作”的循环网络策略,输入为臂部深度图、二值人形探测器、人形相对 GPS(距离+朝向),输出机器人局部系速度指令;奖励基于 t 时刻到人形的距离设计(借鉴 PointNav/ObjectNav 奖励设计)。对照基线是有特权地图访问权限的启发式专家(Heuristic Expert:距人形 >1.5m 用最短路径找人,<1.5m 用倒退动作避碰)。同时做了逐传感器消融(去掉人形 GPS / 探测器 / 臂深度 / 用 RGB 替代深度)。
- 社交重排:三类”种群式”(population-based)训练基线,比较训练搭档多样性对零样本泛化的影响:Learn-Single(联合学习一个人形+一个机器人策略,种群大小 1);Plan-Pop_p(p=1..4,搭档是特权任务规划器,种群大小从 1 递增到 4,规模越大搭档行为越多样:p=4 时协作者可能只搬 1 件、2 件都搬或都不搬);Learn-Pop(沿用 population-play 思路随机初始化 8 个人形策略、每回合随机配对一个与机器人联合训练)。所有基线共享同一策略结构、训练参数、场景,仅训练种群不同。低层技能训练采用 oracle 或 learned 两种变体(详见”模型架构”)。
- 奖励设计(社交重排):完成整体任务 +10,完成任一子目标(拾起目标物/放到目标点)+5,每步 −0.005(鼓励更快完成),碰撞 −5 并终止回合。
- 关键超参:社交导航/重排高层策略均用 DD-PPO,分布式跑在 4×NVIDIA A100,每卡 24 个并行环境、每次更新收集 128 步;社交导航 lr=1e-4、梯度范数裁剪 0.2;社交重排用 Adam、lr=2.5e-4、2 个 PPO minibatch、1 epoch/更新、entropy loss 1e-4、梯度裁剪 0.2,训满 100M 环境步。低层技能训练(Appendix B):导航技能 4×A100,lr=1e-4,300M 步(约 6 天)达到 90% 导航成功率;拾取/放置技能各用 8 张 GPU、每卡 18 环境、lr=3e-4,拾取 100M 步(约 1 天)、放置 50M 步(约半天)各达 90% 成功率。社交导航高层策略约 200M 环境步(约 4 天)饱和。所有基线均跑 3 个随机种子取平均。
Infra(训练 / 推理工程)
- 训练硬件:所有 RL 基线(社交导航、社交重排高层策略、导航低层技能)用 4×NVIDIA A100;拾取/放置低层技能用 8×NVIDIA GPU(型号未注明)。
- 仿真吞吐基准(单张 NVIDIA V100,单环境,300 步/agent、10 次运行取均值±标准误):单 Spot 机器人 245±19 FPS;单人形 188±2 FPS(正文)/附录另一组场景尺寸消融给出人形 155±26 FPS vs 机器人 245±19 FPS(同一量级、不同实验批次的数值略有差异,均如实引用);双机器人 150±13 FPS;机器人+人形 136±8 FPS。场景越大吞吐越低(小/中/大场景对应约 245±19 → 154±14 FPS);物体数量、是否蒙皮渲染、拾取 vs 导航动作类型对吞吐无显著影响。
- 并行扩展:单张 V100 上开 16 个并行环境,机器人+人形组合吞吐可达 1191±3 FPS(摘要处圆整为 “1190 FPS”,并给出双机器人对照 “1345 FPS”);16 环境整体不同设置下吞吐区间为 1100–2290 FPS。
- 推理/控制频率:论文未披露真实机器人上的控制 Hz 或物理部署延迟(Habitat 3.0 聚焦仿真训练与评测,未做 sim-to-real 部署)。
- 横向对比(Table 4,各取自原论文或作者直接沟通,非同一硬件、仅供定性参考):VirtualHome-Social 10 steps/s;VRKitchen 15;SAPIEN 200–400;AI2-THOR 90–180;Habitat 2.0 1400;TDW 5–168;SEAN 2.0 3–60;iGibson 100;Habitat 3.0 单环境 140–250 steps/s。Habitat 3.0 是表中唯一同时支持机器人+人形(SMPL-X 体模型)+关节/IK/高层三级控制+键盘与 VR 双 HITL 接口+多智能体、并提供 200 个 authored 场景的平台。
评测 benchmark
社交导航(Fig.3,S=找人成功率, SPS=按路径步数加权的找人效率, F=跟随率, CR=碰撞率):
- Heuristic Expert:S=1.00, SPS=0.97, F=0.51, CR=0.52。
- End-to-end RL:S=0.97±0.00, SPS=0.65±0.00, F=0.44±0.01, CR=0.51±0.03——无地图特权信息下仍取得与启发式专家相当的成功率/碰撞率。
- 消融:去掉人形 GPS → S 骤降至 0.76±0.02(说明找人阶段最关键的传感器是人形 GPS);去掉臂部深度/RGB → 找到人形后碰撞率明显上升、跟随率下降(F 从 0.44 降到 0.19~0.38),说明臂部感知对贴身跟随避碰更关键。
社交重排(Fig.4,SR=成功率, RE=相对效率,相对人形单独完成的步数):
| 方法 | Train-pop SR | Train-pop RE | ZSC-pop SR | ZSC-pop RE |
|---|---|---|---|---|
| Learn-Single | 98.50±0.48 | 159.2±1.0 | 50.94±39.55 | 106.02±34.32 |
| Plan-Pop₁ | 91.2±2.63 | 152.4±5.4 | 50.44±39.02 | 109.75±34.63 |
| Plan-Pop₂ | 66.89±1.47 | 110.06±6.83 | 70.23±7.02 | 102.13±11.10 |
| Plan-Pop₃ | 77.79±2.86 | 118.95±6.04 | 71.79±7.38 | 101.99±15.18 |
| Plan-Pop₄ | 72.42±1.32 | 105.49±1.7 | 71.32±6.47 | 103.53±9.8 |
| Learn-Pop | 92.20±2.21 | 135.32±3.43 | 48.52±35.51 | 99.80±31.02 |
只见过单一搭档的 Learn-Single/Plan-Pop₁ 在 ZSC 评测中 SR 大幅跳水(98.50%→50.9%,91.2%→50.4%),Learn-Pop 虽 train-pop 表现最好但 ZSC 也大跌(92.2%→48.5%,学习到的种群多样性不足);Plan-Pop₃/₄ 训练/ZSC 落差最小,ZSC-pop-eval SR 最高达 71.7%。消融(基于 Plan-Pop₃):oracle 技能换成 learned 技能后 train-pop SR 从 77.79%→41.96%(低层执行失败拖累高层);深度换 RGB 无明显下降;去掉人形 GPS 小幅下降但非关键。
人机回环(HITL,30 名真人被试,Table 1):
| 方法 | CR | TS (95% CI) | RC | RE |
|---|---|---|---|---|
| Solo | 0.0 | 1253.17 [1020.90, 1533.26] | - | 100.0 |
| Learn-Single | 0.12 | 936.60 [762.50, 1146.62] | 0.36 | 133.80 |
| Plan-Pop₃ | 0.13 | 1015.05 [826.42, 1242.60] | 0.44 | 123.46 |
两个基线都让真人搭档比单独完成任务更高效(RE 提升到 123%~134%),Learn-Single 与 solo、Plan-Pop₃ 与 solo 的 TS 差异都显著(p<.0001,GLMM Poisson 模型),但 Learn-Single 与 Plan-Pop₃ 之间差异不显著(p=0.0533);Plan-Pop₃ 的任务分担率 RC 更高但 RE 略低于 Learn-Single。自动化评测(ZSC-pop-eval)与 HITL 评测在 RE/RC 的相对排序上一致,验证了”自动化零样本协作评测可以指示真人协作时的相对优劣排序”这一核心论点;但绝对数值不同——真人比 ZSC 智能体更能主动适应机器人行为,HITL 中两种方法 SR 都为 1.0。
创新点与影响
贡献:① 首个把高保真人形仿真(SMPL-X 骨架+蒙皮+动捕/VPoser 缓存)与机器人仿真整合到同一个大规模多房间室内场景平台,且加入人形对仿真吞吐几乎无损(机器人+人形 1191 FPS vs 双机器人 1345 FPS);② 客户端-服务器架构的 HITL 工具,支持键鼠/VR 双接口、跨平台可移植、带回放能力,是表中唯一同时提供两种 HITL 接口的平台;③ 提出社交导航与社交重排两个可复现基准,系统对比种群规模/来源对零样本协作泛化的影响;④ 首次把自动化多智能体评测结果与 30 人真实用户研究做对照,证明自动化 ZSC 评测能指示真人协作场景下的相对排序(但不能预测绝对数值)。
论文自陈局限:人形动作仅覆盖行走与伸手两种行为,尚不支持开抽屉、坐下等更复杂动作;固定权重的 LBS 蒙皮在某些姿态下有形变瑕疵;HITL 工具中人类看到的观测与自动化评测中人形智能体的观测空间存在差距(用方向指示标记部分弥合但未完全对齐);任务假设物体初始摆在开放搁架上、机器人已知初始/目标位置的 ground truth,尚未涉及需要搜索的重排任务或对铰接物体(抽屉柜等)的操作;当前只做零样本协作、不涉及人机通信。
原始链接
- 论文(arXiv 2310.13724):https://arxiv.org/abs/2310.13724
- PDF:https://arxiv.org/pdf/2310.13724
- 项目页:https://aihabitat.org/habitat3/
- 官方博客(联合发布 Habitat 3.0 / HSSD-200 / HomeRobot):https://ai.meta.com/blog/habitat-3-socially-intelligent-robots-siro/
- GitHub(habitat-lab,Habitat-3.0 对应 tag
v0.3.0):https://github.com/facebookresearch/habitat-lab
一手源存档(sources/)
- habitat-3—project-page — 官方项目页快照(功能概述、作者名单、视频描述)
- habitat-3—blog — Meta AI 官方博客快照(Habitat 3.0 + HSSD-200 + HomeRobot 联合发布通稿)
- habitat-3—github-readme — habitat-lab 仓库 README 快照(安装、引用信息;注明 Habitat-3.0 对应代码 tag 为 v0.3.0)
- 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)