一句话定位

在 Unitree B1 四足 + Z1 机械臂平台上,WildLMa 用「学习到的全身(whole-body)低层控制器做 VR 遥操作」+「CLIP/MaskCLIP 语言条件模仿学习技能库」+「LLM 分层规划器」三件套,让机器人在真实走廊、户外地面等未见过的场景里完成捡垃圾、按钮开门、书架整理这类需要连续调用多个技能的长程任务,单个技能只需 30-60 条示范。

背景与定位

范式:全身遥操作数据采集 + 语言条件模仿学习技能库 + LLM 长程分层规划,三层解耦的四足移动操作框架。 论文把已有工作分成两条路线并各自指出短板:模块化方法(如 GeFF、OK-Robot 这类用 CLIP/SAM/GroundingDINO 做开放词表感知 + 启发式运动规划)感知泛化性强,但规划模块多是手写启发式,基本只能做 pick-and-place;端到端方法(如 RL 的 VBC、模仿学习的 Mobile ALOHA)能做更复杂动作,但依赖训练/测试分布小差距的假设(sim2real 或同类物体内变化),泛化性不足,且模仿学习在长程执行下容易复合误差。WildLMa 的定位是把这两条路线的优点拼起来:用模仿学习(而非纯 RL 或纯手写规则)获取带泛化性的原子技能,再用 LLM 做长程编排。

具体构件上:模仿学习骨架沿用 ACT(经 Mobile ALOHA 验证的移动操作版本),遥操作接口沿用 [open-television|Open-TeleVision]的 Apple Vision Pro 流式遥操作方案,全身控制器复用 VBC(Visual Whole-Body Control,liu2024-vbc,该团队自己的前作,GitHub 页面标注为 UC San Diego 的 wholebody-b1 项目)的 RL 低层策略;论文重点比较的两个真实机器人 baseline 正是 VBC(RL 方案)与 GeFF(qiu2024-geff,零样本模块化方案)。作者团队(Ri-Zhao Qiu、Yuchen Song、Xuanbin Peng 等共一,Xiaolong Wang 组,UC San Diego,协作 MIT / NVIDIA)同期还产出了 Mobile-TeleVision 等人形全身控制工作,WildLMa 是其四足线的收尾之作,发表于 ICRA 2025。

模型架构

三段式系统:VBC 全身控制器(遥操作接口)+ WildLMa-Skill(CLIP 条件 ACT 模仿学习技能 + 分析式导航)+ WildLMa-Planner(LiDAR SLAM 场景图 + 分层 LLM 规划器)。

  • 硬件平台:Unitree B1 四足 + Unitree Z1 机械臂;把 Z1 自带的鸟嘴式末端执行器换成参照 UMI-Gripper 设计、3D 打印的平行软爪(用齿轮转动直接驱动开合);头部装 Azure Kinect(RGBD),腕部装 Intel RealSense D405(RGBD),尾部装 LIVOX MID-360 LiDAR 用于定位。
  • 全身控制器(承袭 VBC):一个用 RL 训练的低层策略,输入为底座线/角速度指令 + 机械臂基座坐标系下的 6DoF 末端位姿,输出为手臂 + 底座关节指令,实现手臂-底座协同、扩展工作空间。
  • VR 遥操作接口:用 OpenTV 框架 + Apple Vision Pro,实时获取头/手 6DoF 位姿与 3D 手势关键点。操作者右手腕相对初始位姿的变换 T_right 经线性缩放(缩放系数 s_c,因 Z1 工作空间略大于人臂)映射为末端位姿指令 T_ee;拇指-食指捏合映射为夹爪开合;左手腕捏合后作为虚拟摇杆输出底座线/角速度指令,死区 x_th = 5cm。
  • WildLMa-Skill(模仿学习部分):骨架是 ACT,视觉编码器用冻结的 CLIP ViT-B/16,并用 MaskCLIP 重参数化技巧把 CLIP 原本的全局映射 f_visual: Ω→R^C 改造成稠密特征图 g_visual: Ω→H×W×R^C(与 CLIP 嵌入空间对齐)。用任务专属文本(如门禁按钮任务用 “door”、“ADA button”)的 CLIP 文本嵌入与该特征图逐像素做余弦相似度,得到类似概率图的 image-text cross-attention,作为辅助输入喂给 ACT;训练时对 cross-attention 加 dropout 防止过度依赖。为让技能能自主终止交还控制权给上层规划器,额外预测一个虚拟 “end” 信号:每条示范最后 n=10 帧标注 end 信号,部署时用滑动窗口检测器,当 end 信号连续 10 次预测超过阈值 τ=0.8 才终止。
  • WildLMa-Skill(分析式部分):纯底座移动(已知位置间导航)不用学习,用 PD 航点跟随器实现。
  • WildLMa-Planner:先用 FAST-LIO + DLO 做 LiDAR SLAM 建立世界坐标系下位姿估计,人工标注航点(如”站在某个储物架前”)及其连通性,机器人在每个航点原地转 360° 拍摄头部相机图像,用 GPT-4V 自动生成该航点的高层描述与物体清单;再人工把航点聚合成抽象节点(如”某个房间”),构成分层场景图。规划分两级:粗规划器用 Chain-of-Thought 把模板无关的自然语言指令(如 “clean the trash in the hallway”)拆成子任务序列(如 “navigate to hallway”→“pick up the trash”→“place trash in the trash bin”);细粒度规划器对每个子任务用广度优先搜索(BFS)遍历场景图节点,LLM 充当启发式打分器判断目标节点,再从预定义技能库里取出该节点对应的导航+操作序列执行。

数据

  • 技能库训练数据规模:每个技能独立训练权重,每个技能用 30-60 条遥操作示范(经 VR whole-body 遥操作采集)。
  • 数据采集方式:全部来自 Apple Vision Pro + OpenTV 的人类远程操作演示,而非仿真或自动化采集;经全身控制器降低了跨具身(人类双臂 vs 四足+单臂)的动作映射难度。
  • 全身遥操作对采集效率的提升:相比”解耦策略”(base 与 arm 分开操作/手动 pitch),whole-body 学习控制器把示范采集成本降低 26.9%(论文引言明确给出的数字)。
  • 长程任务训练数据:长程实验(收垃圾、书架整理)用 20 条训练序列,在训练和测试时都引入机器人位置、光照、物体摆放的变化,以贴近真实部署条件。
  • 数据混合/来源:论文未涉及仿真数据或第三方开源数据集的联合训练(co-training),训练数据来源单一(自采真实遥操作示范);未披露具体的示范时长(小时数)或总帧数统计。

训练方法

  • 模仿学习目标:在 ACT(action-chunking transformer)基础上,加入 CLIP/MaskCLIP 跨模态 cross-attention 作为辅助输入,并新增一个 “end” 信号预测头实现自主终止;训练目标沿用 ACT 的行为克隆损失(重构动作 chunk),此外对 end 信号做监督(最后 10 帧标 1)。
  • 不使用 RL 训练操作技能:论文所有操作相关技能(抓取、按钮、开门等)都用模仿学习获得,只有纯移动(导航)用分析式规划实现,不涉及额外的 RL 微调。
  • 全身控制器:直接复用 VBC 论文已训练好的 RL 低层策略,本文未重新训练该控制器,只是把它接入到 VR 遥操作与技能执行流程中。
  • 规划侧:WildLMa-Planner 不训练任何网络,是纯 prompt 工程(GPT-4V 做航点标注 + LLM 做 CoT 分解 + LLM 做 BFS 节点打分),依赖现成 LLM/LMM(GPT-4V)的零样本能力。
  • 关键超参数:end 信号缓冲帧数 n=10;终止判定阈值 τ=0.8,需连续 10 次预测超阈值;视觉编码器为 CLIP ViT-B/16。学习率、batch size、优化器、训练轮数等 ACT 训练细节论文未披露。

Infra(训练 / 推理工程)

  • 训练算力:论文全文未披露模仿学习(ACT+CLIP)训练所用的 GPU 型号、数量或训练时长;全身控制器 RL 训练算力细节属于 VBC 前作范畴,本文未重复披露。
  • 推理端硬件:真机部署用 Unitree B1(四足)+ Unitree Z1(机械臂)+ Azure Kinect(头部)+ RealSense D405(腕部)+ LIVOX MID-360(LiDAR,尾部)。
  • 控制频率 / 推理时延(FPS/Hz):论文未披露技能策略的具体推理帧率或控制频率数值;仅通过 Table IV 给出任务完成用时(见评测部分)侧面反映系统在真实操作中的时间开销。

评测 benchmark

Table I:自主技能执行成功率(Tabletop Grasping / Button Pressing / Ground Grasping,各设 I.D. 与 O.O.D. 两种设置)

方法Tabletop I.D.Tabletop O.O.D.Button I.D.Button O.O.D.Ground I.D.Ground O.O.D.平均成功率
WildLMa(本文)94.4%75%80%57.5%60%60%71.2%
ACT(Mobile ALOHA)77.8%19.4%55%25%60%30%40.8%
OpenTV88.9%77.8%75%25%50%50%64.4%
VBC50%*50%*NANA43.8%*43.8%*46.9%
GeFF55.6%*55.6%*NANANANA55.6%

(*:VBC/GeFF 不区分 I.D./O.O.D. 物体集,成功率取两者平均;NA 表示该方法不天然适用于该任务设置。)

Table II:长程任务执行(每类 10 次试验)——WildLMa:Collect & Drop Trash 7/10,Shelf Rearrangement 3/10;ACT baseline:两项均 0/10。

Table III:视觉骨架消融(物体抓取任务)——CLIP:I.D. 83.3% / O.O.D. 69.4% / 平均 76.4%;ResNet(ACT 默认的 ImageNet 预训练 ResNet-18):I.D. 77.8% / O.O.D. 19.4% / 平均 48.6%;DinoV2:I.D. 88.9% / O.O.D. 77.8% / 平均 83.3%。

Table IV:全身控制器 vs 解耦控制 vs 纯手臂(4 名操作员各任务 3 次试验,含平均耗时与成功率)

条件Ground Grasping 耗时Ground Grasping 成功率Rearrange Shelf 耗时Rearrange Shelf 成功率
Whole-body(本文)21.87s95%27.25s70%
解耦控制(Unitree SDK 手动 base pitch)37.35s80%29.81s40%
无 whole-body(仅手臂)无法完成(工作空间不足)0%27.88s70%

Table V:视觉输入模态消融(Head+Wrist / Head Only / Wrist Only)——Tabletop Grasping:94.4% / 27.8% / 83.3%;Button Pressing:80% / 75% / 85%;Door Opening:70% / 30% / 10%(有遮挡的任务显著受益于多视角)。

Table VI:cross-attention 消融(物体抓取任务)——加 cross-attention(本文):I.D. 94.4% / O.O.D. 75% / 平均 84.7%;不加:I.D. 83.3% / O.O.D. 69.4% / 平均 76.4%(与 Table III 的 CLIP 行数值一致,同一组消融)。

创新点与影响

  • 把”全身控制器”从纯 RL 部署场景挪到遥操作数据采集场景:用 VBC 的 RL 低层策略做人类遥操作的中间层,而不是让操作者直接分别控制底座和手臂,既扩大工作空间又把示范采集成本降低 26.9%,并在 Table IV 上量化验证了 whole-body 遥操作相对解耦控制/纯手臂在耗时与成功率上的优势。
  • MaskCLIP 重参数化 + 文本 cross-attention 用于语言条件 ACT:相比直接用 CLIP 全局特征(消融 Table III/VI 中的 “CLIP” 行),显式的稠密图文交叉注意力对 O.O.D. 泛化的提升更明显,验证了”给模仿学习策略一个文本查询的空间概率图”这一做法的价值。
  • 技能库 + LLM 分层规划的长程编排:证明少量(10-20 条)长程演示配合”泛化性强的原子技能 + divide-and-conquer 式 LLM 规划”可以让 ACT 从长程任务 0% 成功率提升到 30%-70% 区间(Table II),而直接在少量长程示范上训练端到端 ACT 完全失败。
  • 论文自陈的局限:三个模块(遥操作、技能学习、规划)相对独立地设计和验证,并未做端到端联合优化;规划器依赖人工标注航点与连通图(可被自动化场景图方法替代但本文未实现);多个技能仍各自独立训练权重,尚未探索跨技能共享或规模化学习。

原始链接

一手源存档(sources/)