一句话定位
BEHAVIOR-1K 是斯坦福视觉与学习实验室(SVL)提出的、以「问人类想让机器人干什么」的大规模问卷为根基的具身 AI 仿真基准:1,000 个日常家居活动,跑在自研 OmniGibson(基于 Nvidia Omniverse + PhysX 5)仿真器上,覆盖 50 个可交互场景、9,000+ 物体,支持刚体 / 可变形体 / 流体 / 布料 / 温度等真实物理与光线追踪渲染,是当时规模最大、最接近真实的长程移动操作家居基准。
背景与定位
这是「从人类真实需求出发」定义具身 AI 任务集的范式代表作,是前作 BEHAVIOR-100(100 个由研究者挑选的活动、跑在 iGibson 2.0)的下一代。作者的核心论点:以往仿真基准(AI2-THOR、Habitat 2.0、TDW、SAPIEN ManiSkill、VirtualHome、ALFRED、iGibson 等)的任务都是研究者拍脑袋设计的,无法保证对齐人类真实需求;而且普遍存在「多样性—真实性」的取舍——指令跟随类基准场景/物体/状态变化多但物理不真实,重排类基准物理真实但任务寥寥。BEHAVIOR-1K 想同时打破这两点:既让任务集源自人类需求(问卷驱动),又用一个能真实模拟流体/可变形体的新仿真器来兜住真实性。
在本 vault 内,可与 libero(终身机器人操作基准)、isaac-lab-orbit(同为 Isaac/PhysX 系仿真基础设施)、open-x-embodiment(跨本体真机数据)对照阅读——BEHAVIOR-1K 代表「仿真侧、人本需求驱动、长程移动操作」这一支,与真机数据集、单场景操作基准形成互补。范式关键词:human-centered embodied AI benchmark、long-horizon mobile manipulation、BDDL 谓词逻辑任务定义、sim-to-real 校准。
模型架构
BEHAVIOR-1K 本身是「数据集 + 仿真器」两件套,不是一个模型;此处记录 OmniGibson 仿真器架构与评测基线的策略网络两部分的工程配置。
OmniGibson 仿真器
- 底座:Nvidia Omniverse + PhysX 5,在此之上扩展;渲染支持 光线追踪 / 路径追踪(ray-traced / path-traced),视觉真实度显著高于 iGibson 2.0。
- 物理:不仅刚体,还支持可变形体、流体(fluids)、布料/柔性材料(flexible materials)——论文强调「若无这些特性,超过一半的 BEHAVIOR-1K 活动无法仿真」;对照图显示 Habitat 2.0 仅能支持其中 23% 的活动。
- 扩展物体状态(非运动学、启发式更新):temperature、toggled、soaked、dirtiness 等连续/离散扩展态(如靠近开启的热源时温度上升)。
- Transition Machine(转移机):模块化自定义转移规则,模拟 Omniverse 原生不支持的物理过程——面团入烤箱达温→变派、番茄+盐→酱、砂纸去锈、蔬菜打成泥等。
- 任务实例化:能对某活动的初始条件(谓词逻辑,如「食物是冷冻的」)采样出无限个合法物理配置,并据物体位姿/关节/扩展态判定目标条件(如「食物已煮熟且置于盘上」「布已折叠」);原生支持场景初始化随机化。
- 任务定义语言 BDDL(BEHAVIOR Domain Definition Language,继承自 BEHAVIOR-100):基于谓词逻辑,面向素人可读,用物体与物体状态描述初始/目标条件。本文新增 BDDL 特性:物质(substance)表示、三值谓词(three-valued predicates)、物体的组合/分解。
评测基线策略网络(附录 F)
- RL-Prim. / RL-Prim.Hist.(PPO):视觉特征提取器(Conv-ReLU-MaxPool-Flatten)吃 128×128×3 egocentric 图像 + 状态编码器(是否抓握),过 MLP 压成 128 维,接 value head 与 action head;action head 输出离散选择——对某物体施加某个动作原语。RL-Prim.Hist. 额外吃 3 步历史观测以消解相似外观状态的歧义。
- RL-VMC(SAC):同款特征提取器,actor/critic/target-critic 均为 ReLU-MLP,连续动作空间,直接输出底层关节控制指令(视觉到低层关节命令的端到端 visuomotor control)。
- 6 个动作原语(基于采样式运动规划实现):navigate、pick、place、push、dip、wipe,均为组合式(先从收臂位展臂、末执行、再收臂以便后续无碰撞导航)。抓取用 assistive pick(比 StickyMitten 更严格:所有手指接触物体时建立刚性连接)。
数据
问卷(需求来源)
- 面向美国普通人群,问「what do you want robots to do for you?」;活动源自时间使用调查(ATUS 等 time-use surveys)与 WikiHow 文章,约 2,000 个候选活动。
- 平台 Amazon Mechanical Turk,1,461 名受访者,每个活动 50 份独立回应、10 点 Likert 量表。
- 结果分布离散度高:Gini 指数 = 0.158;平均分 5.16,各活动均分区间 1.9–9.3。图 1 对 2,090 个活动排序。枯燥家务(如「擦浴室地板」)分最高,娱乐活动分最低。约 200 个清洁类、200+ 个烹饪类活动。
- BEHAVIOR-1K 的 1,000 个活动 = 偏好分最高的 909 个 + BEHAVIOR-100 的 91 个。
知识库 / BDDL 标注
- 物体空间来自 5,000 篇 WikiHow 文章,映射到 2,964 个叶层 synset(WordNet 或自定义)。
- 通过众包工人、学生与 GPT-3 为每个物体关联可仿真物体状态(如 apple 关联 cooked、sliced,但不关联 toggledOn),并给物体-属性对加参数(如「苹果的煮熟温度」)。
- 标注质量:5 名资深 ML 标注员复核,通过率 >96.8%;各标注任务准确率 >96%、F1 >91%、FDR/FPR 约 2–3%。
3D 资产
- 50 个全可交互场景 / 373 个房间;8 种场景类型:房屋 15、带花园房屋 8、酒店 3、办公室 5、杂货店 4、通用大厅 4、餐厅 6、学校 5(= 50)。其中 15 个家居场景由 BEHAVIOR-100 改进而来,其余 35 个从 TurboSquid 等市场采购并由专业 3D 设计师补齐缺失房间。
- 9,318 个物体模型 / 1,949 个物体类别(Table 1;正文表述为「9,000+ 模型 / 1,900+ 类别」),标注摩擦、质量、关节等物理属性与语义类别。
- 每活动涉及物体 3–47 个,需要的不同状态变化 2–11 种(均为全基准最高)。
- 视觉真实度人评(60 人 AMT,5 个仿真器各取 50 张 1280×720 图,排序 1–5 后反转):OmniGibson 3.20±1.23 > Habitat 2.0 1.74±1.33 > AI2-THOR 1.73±1.37 > iGibson 2.0 1.69±1.24 > ThreeDWorld 1.65±1.23。
注:项目官网当前版本(v3.9.0)已把口径更新为「50 个场景、10,000+ 物体」,规模较 2024 论文有所增长;本页数据一律以论文原文为准。
训练方法
- 目标 / 奖励:全部基线用 BDDL 活动定义给出的稀疏任务成功信号作奖励,无任何奖励工程;如 StoreDecorations 目标为
Forall(decoration){Inside(decoration, cabinet)},只有装饰物真正被放进抽屉才给正信号(须先 push 开抽屉再 pick-place,中间无子目标奖励)。 - 算法:RL-Prim. / RL-Prim.Hist. 用 on-policy PPO(clip 目标);RL-VMC 用 SAC(最大熵目标)。
- 训练规模:SAC 与 PPO 均训 30,000 时间步;训练用种子 0/1/2,评测用种子 0。
- 加速简化(训练期假设):动作原语只检查最终配置(如抓取位姿、目标点)的可达性/无碰撞,若运动学可行则直接把机器人瞬移到最终配置再往后仿真;抓取用 assistive pick。评测期再逐一撤掉这些简化做消融。
- PPO 超参:LR 3e-4、buffer 300、batch 64、γ 0.99、GAE 0.99、clip ε 0.2、entropy coeff 0.0、VF coeff 0.5。
- SAC 超参:LR 3e-4、buffer 300、batch 64、γ 0.99、soft update 系数 0.005。
- Sim-to-real 训练:为迁移到真机,训练时按前作方法对观测做基于图像的数据增强。
Infra(训练 / 推理工程)
仿真性能基准(附录 E.4,Table A.10)
- 测试机:Ubuntu,Intel i7-10700K @ 5.10GHz,单块 Nvidia RTX 3080,单进程单 GPU;渲染 128×128 RGB,动作步 ta=1/60 s、物理步 ts=1/60 s;“idle” 设定(机器人静置零速)。
- 仿真步/秒(SPS,越高越好),Rs_int(81 物体)/ house_single_floor(621 物体):
- Full Feature Set:24 / 11
- − 流体与布料:58 / 26
- − 物体状态更新:77 / 55
- − 机器人:90 / 60
- 即:全特性下大场景约 11 SPS,关掉流体/布料可提到 26 SPS。作者称速度与 iGibson 2.0 相当但渲染质量高得多,且可配置以在保真度与速度间权衡。
- 论文局限节另给:光追下一个约 60 物体的房屋场景约 60 fps(对比 iGibson 2.0 约 100 fps)——用渲染速度换视觉真实度。
基线训练算力(附录 F.3)
- 每次实验用单块 RTX 2080 Ti 或单块 RTX A-6000 + Intel Xeon CPU + 40GB RAM;训练时 GPU 显存约 9GB。
- 视任务不同,总迭代 10k–25k,墙钟训练时长 3.75–7.5 小时。
真机推理栈(附录 G)
- 平台:双臂移动操作机器人 Tiago;感知用机载 RGB-D + YOLOv3 检测器做 3D 物体定位;导航用两颗 LiDAR + 粒子滤波定位 + 公寓地图;动作原语用与仿真同款采样式运动规划(额外调参)。
- 控制频率 / 边缘功耗等未披露。
评测 benchmark
作者选 3 个「范式级」活动做基线评测:StoreDecoration(关节物体操作)、CollectTrash(刚体、最优需 ≥16 个原语步)、CleanTable(布料+流体、最优 6 个原语步)。
任务成功率(Table 2) — StoreDecoration / CollectTrash / CleanTable:
- RL-VMC(端到端视觉运动控制):0.0 / 0.0 / 0.0(长程导致完全学不出来)
- RL-Prim.:0.48±0.06 / 0.42±0.02 / 0.77±0.08
- RL-Prim.Hist.:0.55±0.05 / 0.63±0.03 / 0.88±0.02(历史记忆在长程、观测混叠任务如 CollectTrash 上增益最大)
效率指标(Table 3,CollectTrash) — 导航距离[m] / 仿真时间[s] / 运动学扰动[m]:
- RL-VMC:27.58 / 16.67 / 0.00(学不出、效率低)
- RL-Prim.:17.98 / 13.95 / 12.34
- RL-Prim.Hist.:15.33 / 12.48 / 10.82(记忆全面改善效率)
消融:撤掉抓取/运动简化(Table 4,RL-Prim.):启用完全物理抓取后成功率骤降到 0.0 / 0.0 / 0.0(抓取是关键瓶颈);仅启用完整轨迹运动执行影响小(0.46±0.04 / 0.36±0.08 / 0.73±0.03,对比基线 0.48 / 0.42 / 0.77)。成功分 Q(Table A.13)趋势与成功率一致(RL-Prim. 0.50/0.49/0.77)。
Sim-real gap(6.2 节,CollectTrash 数字孪生公寓):仿真 50 次约 40% 成功;真机最优策略 27 次约 22%;真机迁移的视觉策略 26 次 0%。真机失败中抓取占约 40%;学习策略里 44% 的错误来自视觉策略选错原语(真实相机动态范围差、木纹/反射建模不准所致)。仿真里因用 assistive pick,失败主要来自视觉策略而非抓取。
创新点与影响
- 需求驱动的任务集:首个用 1,461 人问卷、从时间使用调查排序出「人类最想让机器人做的」1,000 个活动的基准;论文强调「无其他基准把活动集建立在素人需求上」。
- 多样性 × 真实性同时拉满:相较 BEHAVIOR-100(100 活动 / 15 房屋场景 / 300+ 类),扩到 1,000 活动 / 50 场景(8 类型)/ 1,900+ 物体类别,并靠 OmniGibson 首次在同一基准里真实模拟流体、可变形体、布料、温度等——人评视觉真实度 3.20 显著领先其余仿真器。
- OmniGibson 与 BDDL 扩展:把 Omniverse/PhysX 5 封装成能做无限初始条件采样、目标判定、扩展物体状态与 Transition Machine 的具身 AI 仿真器,并扩展 BDDL(物质表示、三值谓词、组合/分解)。
- 难度实证与研究指引:即便最简单的 3 个活动,端到端视觉运动控制也全 0;必须靠动作原语抽象 + 记忆才能过半,指出「动作空间抽象」「记忆」「抓取」「sim-real 视觉差」是长程家居操作的核心难点。
- 影响:成为具身 AI 长程移动操作的标准家居基准之一,衍生出持续维护的 mono-repo(现 v3.9.0,含 JoyLo/VR 遥操、cuRobo 原语、LeRobot 数据格式)与 2026 BEHAVIOR Challenge(HuggingFace 排行榜)。
- 作者自陈局限:继承 Omniverse 的渲染速度(光追换真实度,约 60 fps);只含不涉及与人交互的活动(真实人类行为/外观仿真仍是开放问题);OmniGibson 仍缺感知/执行噪声模型,sim2real 有改进空间;抓取「为任意物体设计基于完全物理抓取的 pick 原语」本身是留待未来的开放问题。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2403.09227
- arXiv PDF:https://arxiv.org/pdf/2403.09227
- arXiv HTML 全文:https://arxiv.org/html/2403.09227v1
- 项目官网:https://behavior.stanford.edu/
- GitHub(StanfordVL/BEHAVIOR-1K):https://github.com/StanfordVL/BEHAVIOR-1K
- 2026 BEHAVIOR Challenge 排行榜(HF Space):https://huggingface.co/spaces/behavior-1k/2026-challenge-leaderboard
- 备注:预印本前身发表于 CoRL 2022(BEHAVIOR-100 相关工作)
一手源存档(sources/)
- behavior-1k—github-readme — GitHub README 快照(含 BibTeX、当前版本 v3.9.0 说明)
- behavior-1k—project-site — 项目官网首页快照(当前口径 50 场景 / 10,000+ 物体、2026 Challenge、OmniGibson 组件树)
- arXiv 原文 PDF(不入 git):https://arxiv.org/pdf/2403.09227