一句话定位
Being-0 是给全尺寸人形机器人(Unitree H1-2 + 灵巧手 + 主动视觉颈部)设计的三层分层智能体:云端慢速 Foundation Model(GPT-4o)做任务理解/规划/自省,本地轻量 VLM「Connector」把语言计划实时接地为可执行的移动/操作技能指令并做导航-操作过渡时的姿态调整,底层是遥操作+模仿学习练出的模块化技能库(RL 步态 + ACT 操作);在 20×20m 办公场景的长程任务上平均完成率 84.4%,比无 Connector 的纯 FM 直连基线快 4.2 倍。
背景与定位
范式是”FM 高层规划 + 低层技能库”的具身智能体(如 SayCan/Ahn et al. 2022、Inner Monologue、Code as Policies 这类挂机械臂/轮式/四足机器人的路线),Being-0 把这条路线第一次系统搬到人形机器人上。作者指出直接照搬的两个痛点:(1) 双足行走本身不稳定,走几步位置就漂移,需要频繁闭环修正,而非开环执行动作序列;(2) 现有 FM(含 GPT-4o)三维场景理解差、推理慢,常给出方向/深度错误的导航指令,且末尾停靠姿态往往不利于后续抓取。为此提出居中的 Connector 模块——一个专门在带标注的第一人称室内导航数据上训练的轻量 VLM,去做”语言计划→可执行技能”的实时接地、闭环视觉导航、以及导航-操作衔接时的姿态调整。
高层 FM 部分沿用 Cradle(Tan et al. 2024,一个跑通用计算机/游戏操作的 GPT-4o agent 框架)的三段式推理(描述-检测-规划)。底层技能获取路线继承自同一组的人形遥操作与全身控制工作(omnih2o、hover、humanplus),操作数据采集用 Apple VisionPro 遥操作(沿用 open-television 的方案),操作策略用 ACT(aloha-unleashed 系同源方法家族)。与 figure-helix、groot-n1 等”快-慢双系统”VLA 的区别在于:Being-0 的”慢系统”直接是通用 GPT-4o(不做机器人数据微调),“快系统”Connector 才是本文训练的产物,且 Connector 本身不直接输出关节动作,而是输出给模块化技能库的离散技能调用指令(如 move_towards、search_for、turn_left),锁定操作动作的仍是独立训练的 ACT 策略——是”符号化技能路由”而非端到端 VLA。
模型架构
三层结构(无统一端到端网络,各层独立训练/部署):
- Foundation Model(云端):GPT-4o,零微调,仅通过 prompt 承担三件事——Reasoning(描述图像+判断当前执行阶段)、Detection(评估近期技能执行是否成功)、Planning(从技能库选下一个技能)。Prompt 设计见论文 Appendix B.3(信息收集、任务反思/子任务提出、成功检测、动作规划四类 prompt 模板均全文给出)。
- Connector(本地 VLM,桥接层):backbone 为 VideoLLaMA2(Cheng et al. 2024c),视觉编码器为 SigLIP so400m-patch14-384,投影模块为 MLP;输入 16 帧/样本的双目图像 + 文本,最大序列长度 4096 tokens。多任务学习目标覆盖图像描述、技能预测(skill prediction)、目标检测(bbox)。三个下游能力:
- Grounded Skill Planning——把 FM 的语言计划(如”grasp a cup”)在当前观测下纠偏为可执行技能(如离桌子远则转成 move_towards(table));
- Visual Navigation——检测到目标 bbox 后用双目合成深度估计相对位置,选择合适的移动技能(move_towards / search_for 两套伪代码算法,Algorithm 1/2);未见目标则触发探索(转头+移动组合搜索);
- Coordinating Navigation and Manipulation(Adjustment)——导航过程中额外预测机器人相对目标物体的最优朝向角,若偏离则触发”转头+弧线前进”的复合技能,让机器人沿弧形路径逼近,最终停在利于操作的位姿(Algorithm 3)。
- 模块化技能库(本地设备):
- 移动技能:目标条件式本体感知 RL 策略 π^L(a^l | q^l,q^u,q̇,ω; v^g),Isaac Gym 仿真训练+sim-to-real 部署,控制频率 50Hz;定义了一组离散指令
{no_action, go_straight, walk_backwards, turn_left, turn_right, sidestep_left, sidestep_right, tilt_head, turn_head}。 - 操作技能:每个技能一个独立 ACT(Zhao et al. 2023,Transformer 架构的行为克隆)策略 π^Mi([a_j^u,a_j^h]_{j=t}^{t+K} | o_t^l,o_t^r,q_t^u,q_t^h),视觉编码器为 ImageNet 预训练 ResNet-50(含编码器在内整网络端到端微调),控制频率 10Hz,动作块长度训练 K=30 / 部署 K=10。
- 移动技能:目标条件式本体感知 RL 策略 π^L(a^l | q^l,q^u,q̇,ω; v^g),Isaac Gym 仿真训练+sim-to-real 部署,控制频率 50Hz;定义了一组离散指令
机器人本体:41 自由度(DoF)——13-DoF 下半身(两腿+躯干)、两条 7-DoF 手臂、两只 6-DoF 灵巧手、2-DoF 颈部;颈部搭载双目 RGB 相机实现主动视觉。实机为 Unitree H1-2 + 两只 Inspire 灵巧手 + 两个 Dynamixel 颈部电机 + ZED-mini 双目相机,板载计算为 NVIDIA Jetson AGX(部署 Connector 及全部模块化技能,FM 单独跑在云端)。
数据
- 操作技能遥操作数据:Apple VisionPro 遥操作采集,双目观测投影到 VisionPro、头/腕/手指动作 retarget 到机器人动作,控制频率 10Hz。每个技能仅需 50~150 条轨迹、不到 1 小时遥操作即可训练可用策略。10 个技能的具体轨迹数:Carry Basket 25、Handout Snack 50、Grasp Bottle 150、Grasp Cup 200、Open Beer 50、Place Basket 25、Place Cup 200、Place Pole 50、Play Chess 70、Play Toy Bricks 50。
- Connector 训练数据:自采第一人称室内导航图像共 3,177 张——其中 Visual Understanding(VLU)任务 2,483 张、Action Planning(AP)任务 694 张;图像描述先由 GPT-4o 初标、再经人工精修。按任务类型统计样本数:bounding box 检测 14,784 条(覆盖 19 类物体/区域,如 Hallway 3,834、Coffee machine 1,323、Reception desk 1,026 等)、yes/no 判断 20,536 条(18 类)、图像描述 1,530 条、地面/过渡描述 1,530 条、动作规划 771 条。
- 通用视觉接地数据(第一阶段预热):从三个开源视觉接地数据集(Visual Genome、Chatterbox、Visual CoT)中筛选 30 万(300K) 样本,用于在 VideoOrion+ checkpoint(去掉 object-centric 分支后与 VideoLLaMA2 同架构)基础上先行微调,再接自采数据集第二阶段微调。
- 场景:20×20m 大型办公室场景,含多个工位隔间、木桌、咖啡机、连接前台与会议室的走廊——全部为真机实测(无仿真评测环节,评测均在真实环境)。
训练方法
Connector 训练:VideoLLaMA2 框架下多节点分布式训练,两阶段——① 用 300K 通用接地数据在 VideoOrion+ checkpoint 上微调;② 用自采 VLU+AP 数据集继续微调。超参数:全局 batch size 128,单卡 local batch size 2,梯度累积步数按节点数动态计算;训练 3 个 epoch,学习率 2e-5、cosine 调度、warmup ratio 0.03;AdamW 优化器、zero weight decay;混合精度 bf16 + TF32;开启梯度检查点;最大序列长度 4096;按模态长度分组、取倒数第二层视觉特征、图像 padding 保持长宽比。
移动技能训练:RL(Isaac Gym 仿真),域随机化 + 外力扰动,目标条件策略后 sim-to-real 部署,50Hz。
操作技能训练:ACT 行为克隆,超参——训练步数 500,000、batch size 90、学习率 1e-5、梯度裁剪范数 10、训练时 chunk size 30 / 部署时 10;数据增强用随机裁剪、旋转、色彩抖动增强对视觉扰动的鲁棒性。
FM 端不做任何微调,纯 prompt engineering(信息收集/自省/子任务提出/动作规划四类模板,详见论文附录 B.3,全文给出)。
Infra(训练 / 推理工程)
- Connector 训练:多节点分布式,GPU 型号/数量、总 GPU-hours 未披露;已知混合精度 bf16+TF32、梯度检查点、全局 batch 128。
- 移动 RL 训练:Isaac Gym 仿真,具体 GPU 数/并行环境数未披露(原文只说明训练+sim-to-real 部署流程)。
- 推理侧:Connector 在**板载设备(NVIDIA Jetson AGX)**上的平均推理时延约 1 秒,显著优于云端 GPT-4o 的时延(具体 GPT-4o 时延数值未披露,仅以”效率提升 4.2ד的整体导航速度对比体现);移动技能控制频率 50Hz,操作技能控制频率 10Hz。除 FM 外的全部模块均部署在低成本本地设备上。
评测 benchmark
真机实验,全部在 20×20m 办公场景中进行,无仿真评测。
长程任务完成率(Table 1,w/o Connector vs Being-0):Fetch-bottle 0.00→0.90,Deliver-basket 0.00→0.80,Prepare-coffee 0.00→0.75,Make-coffee 0.90→0.90(此任务本身对导航依赖小,两者持平),Deliver-coffee 0.33→0.87。五任务平均完成率 84.4%(摘要自述数字,对应 (0.90+0.80+0.75+0.90+0.87)/5)。
Adjustment 消融(Table 2,成功次数/5):Grasp-bottle 2/5→4/5,Place-basket 4/5→3/5(下降,因该任务对末端姿态不敏感),Grasp-coffee 1/5→4/5,Place-coffee(table) 4/5→5/5,Place-coffee(machine,落点面积极小) 0/5→3/5。
主动视觉消融(Table 3,成功次数/5,四个子任务):固定相机 pitch 0.3 时导航两项(到桌子/到咖啡机)5/5,但操作两项(抓咖啡/放咖啡)0/5;pitch 0.6/0.9 时导航掉到 0/5,操作回升(0.9 时抓/放达 4/5、5/5);仅 Being-0 主动相机在全部四个子任务上均 5/5。
效率消融(Table 4,任务”navigate to wooden table”):w/o Connector 平均速度 2.3(单位未注明,原文对比量纲)、成功 0/5;Fixed Cam(0.3) 速度 8.5、成功 5/5;Being-0 速度 9.6、成功 5/5——即 4.2× 效率提升(9.6/2.3≈4.17)来自与无 Connector 基线的对比。
导航鲁棒性(Table 5):同房间内 1.00;同房间含障碍物 0.80;跨房间(需 FM 多步推理,如先找出口再继续)0.83。
操作技能泛化(Table 6):Grasp-bottle:seen 0.86 / unseen 0.63 / 视觉扰动 0.77;Handout-snack:0.90 / 1.00 / 0.80;Place-pole:0.90 / – / 0.80;Play-chess(用带触觉传感器的灵巧手):0.90 / – / 0.90。
论文未与其他公开 humanoid-agent 系统做同场景横向对比,所有基线均为自身消融(w/o Connector、w/o Adjustment、固定相机变体)。
创新点与影响
- 首次把”FM 高层规划 + 低层技能库”的具身智能体范式系统搬到双足人形机器人(此前该范式主要验证于机械臂/轮式/四足),并指出并解决了人形独有的两个障碍:步态不稳定导致的位置漂移、FM 3D 场景理解弱导致的规划失准。
- 提出 Connector 作为居中桥接层这一设计——本文的核心贡献不是训练更强的 VLA,而是用一个轻量、专门训练的 VLM 去做”语言计划的实时接地 + 导航闭环 + 姿态调整”,从而让通用 GPT-4o 不必处理高频细粒度决策,兼顾了 FM 的通用推理能力与本地部署的实时性。
- 验证了**主动视觉(可动颈部相机)**对人形具身智能体的必要性:固定相机无法同时兼顾导航(需要远视野)和桌面操作(需要俯视近视野),消融显示无论何种固定俯仰角都无法在两类任务上同时达到高成功率。
- 作者自述局限:(1) 当前系统不含蹲、坐、跳跃等复杂移动技能,限制在平地场景,无法处理爬楼梯、坐姿作业、不同高度物体操作;(2) 尽管板载系统已高效,Being-0 仍依赖慢速云端 FM 做高层决策,未来需要面向机器人场景定制的轻量 FM 来进一步提升系统效率。
- 代码仓库 BeingBeyond/Being-0 截至本次抓取仍为 README 占位,注明”年内发布代码”,尚未开源。
原始链接
- arXiv abs:https://arxiv.org/abs/2503.12533
- arXiv PDF:https://arxiv.org/pdf/2503.12533
- 项目主页:https://beingbeyond.github.io/Being-0/
- 代码 GitHub(尚未放出代码,仅 README 占位):https://github.com/BeingBeyond/Being-0
一手源存档(sources/)
- being-0—project-page — 项目主页快照(摘要、框架图说明、workflow 图说明、消融图说明、结论、BibTeX)
- being-0—github-readme — GitHub README 快照(确认代码尚未发布:“We will release our code within this year”)
- arXiv 原文 PDF:https://arxiv.org/pdf/2503.12533 (arXiv 原文 PDF,不入 git)