一句话定位
在 Unitree B1 四足 + Z1 机械臂平台上,WildLMa 用「学习到的全身(whole-body)低层控制器做 VR 遥操作」+「CLIP/MaskCLIP 语言条件模仿学习技能库」+「LLM 分层规划器」三件套,让机器人在真实走廊、户外地面等未见过的场景里完成捡垃圾、按钮开门、书架整理这类需要连续调用多个技能的长程任务,单个技能只需 30-60 条示范。
背景与定位
范式:全身遥操作数据采集 + 语言条件模仿学习技能库 + LLM 长程分层规划,三层解耦的四足移动操作框架。 论文把已有工作分成两条路线并各自指出短板:模块化方法(如 GeFF、OK-Robot 这类用 CLIP/SAM/GroundingDINO 做开放词表感知 + 启发式运动规划)感知泛化性强,但规划模块多是手写启发式,基本只能做 pick-and-place;端到端方法(如 RL 的 VBC、模仿学习的 Mobile ALOHA)能做更复杂动作,但依赖训练/测试分布小差距的假设(sim2real 或同类物体内变化),泛化性不足,且模仿学习在长程执行下容易复合误差。WildLMa 的定位是把这两条路线的优点拼起来:用模仿学习(而非纯 RL 或纯手写规则)获取带泛化性的原子技能,再用 LLM 做长程编排。
具体构件上:模仿学习骨架沿用 ACT(经 Mobile ALOHA 验证的移动操作版本),遥操作接口沿用 [open-television|Open-TeleVision]的 Apple Vision Pro 流式遥操作方案,全身控制器复用 VBC(Visual Whole-Body Control,liu2024-vbc,该团队自己的前作,GitHub 页面标注为 UC San Diego 的 wholebody-b1 项目)的 RL 低层策略;论文重点比较的两个真实机器人 baseline 正是 VBC(RL 方案)与 GeFF(qiu2024-geff,零样本模块化方案)。作者团队(Ri-Zhao Qiu、Yuchen Song、Xuanbin Peng 等共一,Xiaolong Wang 组,UC San Diego,协作 MIT / NVIDIA)同期还产出了 Mobile-TeleVision 等人形全身控制工作,WildLMa 是其四足线的收尾之作,发表于 ICRA 2025。
模型架构
三段式系统:VBC 全身控制器(遥操作接口)+ WildLMa-Skill(CLIP 条件 ACT 模仿学习技能 + 分析式导航)+ WildLMa-Planner(LiDAR SLAM 场景图 + 分层 LLM 规划器)。
- 硬件平台:Unitree B1 四足 + Unitree Z1 机械臂;把 Z1 自带的鸟嘴式末端执行器换成参照 UMI-Gripper 设计、3D 打印的平行软爪(用齿轮转动直接驱动开合);头部装 Azure Kinect(RGBD),腕部装 Intel RealSense D405(RGBD),尾部装 LIVOX MID-360 LiDAR 用于定位。
- 全身控制器(承袭 VBC):一个用 RL 训练的低层策略,输入为底座线/角速度指令 + 机械臂基座坐标系下的 6DoF 末端位姿,输出为手臂 + 底座关节指令,实现手臂-底座协同、扩展工作空间。
- VR 遥操作接口:用 OpenTV 框架 + Apple Vision Pro,实时获取头/手 6DoF 位姿与 3D 手势关键点。操作者右手腕相对初始位姿的变换 T_right 经线性缩放(缩放系数 s_c,因 Z1 工作空间略大于人臂)映射为末端位姿指令 T_ee;拇指-食指捏合映射为夹爪开合;左手腕捏合后作为虚拟摇杆输出底座线/角速度指令,死区 x_th = 5cm。
- WildLMa-Skill(模仿学习部分):骨架是 ACT,视觉编码器用冻结的 CLIP ViT-B/16,并用 MaskCLIP 重参数化技巧把 CLIP 原本的全局映射 f_visual: Ω→R^C 改造成稠密特征图 g_visual: Ω→H×W×R^C(与 CLIP 嵌入空间对齐)。用任务专属文本(如门禁按钮任务用 “door”、“ADA button”)的 CLIP 文本嵌入与该特征图逐像素做余弦相似度,得到类似概率图的 image-text cross-attention,作为辅助输入喂给 ACT;训练时对 cross-attention 加 dropout 防止过度依赖。为让技能能自主终止交还控制权给上层规划器,额外预测一个虚拟 “end” 信号:每条示范最后 n=10 帧标注 end 信号,部署时用滑动窗口检测器,当 end 信号连续 10 次预测超过阈值 τ=0.8 才终止。
- WildLMa-Skill(分析式部分):纯底座移动(已知位置间导航)不用学习,用 PD 航点跟随器实现。
- WildLMa-Planner:先用 FAST-LIO + DLO 做 LiDAR SLAM 建立世界坐标系下位姿估计,人工标注航点(如”站在某个储物架前”)及其连通性,机器人在每个航点原地转 360° 拍摄头部相机图像,用 GPT-4V 自动生成该航点的高层描述与物体清单;再人工把航点聚合成抽象节点(如”某个房间”),构成分层场景图。规划分两级:粗规划器用 Chain-of-Thought 把模板无关的自然语言指令(如 “clean the trash in the hallway”)拆成子任务序列(如 “navigate to hallway”→“pick up the trash”→“place trash in the trash bin”);细粒度规划器对每个子任务用广度优先搜索(BFS)遍历场景图节点,LLM 充当启发式打分器判断目标节点,再从预定义技能库里取出该节点对应的导航+操作序列执行。
数据
- 技能库训练数据规模:每个技能独立训练权重,每个技能用 30-60 条遥操作示范(经 VR whole-body 遥操作采集)。
- 数据采集方式:全部来自 Apple Vision Pro + OpenTV 的人类远程操作演示,而非仿真或自动化采集;经全身控制器降低了跨具身(人类双臂 vs 四足+单臂)的动作映射难度。
- 全身遥操作对采集效率的提升:相比”解耦策略”(base 与 arm 分开操作/手动 pitch),whole-body 学习控制器把示范采集成本降低 26.9%(论文引言明确给出的数字)。
- 长程任务训练数据:长程实验(收垃圾、书架整理)用 20 条训练序列,在训练和测试时都引入机器人位置、光照、物体摆放的变化,以贴近真实部署条件。
- 数据混合/来源:论文未涉及仿真数据或第三方开源数据集的联合训练(co-training),训练数据来源单一(自采真实遥操作示范);未披露具体的示范时长(小时数)或总帧数统计。
训练方法
- 模仿学习目标:在 ACT(action-chunking transformer)基础上,加入 CLIP/MaskCLIP 跨模态 cross-attention 作为辅助输入,并新增一个 “end” 信号预测头实现自主终止;训练目标沿用 ACT 的行为克隆损失(重构动作 chunk),此外对 end 信号做监督(最后 10 帧标 1)。
- 不使用 RL 训练操作技能:论文所有操作相关技能(抓取、按钮、开门等)都用模仿学习获得,只有纯移动(导航)用分析式规划实现,不涉及额外的 RL 微调。
- 全身控制器:直接复用 VBC 论文已训练好的 RL 低层策略,本文未重新训练该控制器,只是把它接入到 VR 遥操作与技能执行流程中。
- 规划侧:WildLMa-Planner 不训练任何网络,是纯 prompt 工程(GPT-4V 做航点标注 + LLM 做 CoT 分解 + LLM 做 BFS 节点打分),依赖现成 LLM/LMM(GPT-4V)的零样本能力。
- 关键超参数:end 信号缓冲帧数 n=10;终止判定阈值 τ=0.8,需连续 10 次预测超阈值;视觉编码器为 CLIP ViT-B/16。学习率、batch size、优化器、训练轮数等 ACT 训练细节论文未披露。
Infra(训练 / 推理工程)
- 训练算力:论文全文未披露模仿学习(ACT+CLIP)训练所用的 GPU 型号、数量或训练时长;全身控制器 RL 训练算力细节属于 VBC 前作范畴,本文未重复披露。
- 推理端硬件:真机部署用 Unitree B1(四足)+ Unitree Z1(机械臂)+ Azure Kinect(头部)+ RealSense D405(腕部)+ LIVOX MID-360(LiDAR,尾部)。
- 控制频率 / 推理时延(FPS/Hz):论文未披露技能策略的具体推理帧率或控制频率数值;仅通过 Table IV 给出任务完成用时(见评测部分)侧面反映系统在真实操作中的时间开销。
评测 benchmark
Table I:自主技能执行成功率(Tabletop Grasping / Button Pressing / Ground Grasping,各设 I.D. 与 O.O.D. 两种设置)
| 方法 | Tabletop I.D. | Tabletop O.O.D. | Button I.D. | Button O.O.D. | Ground I.D. | Ground O.O.D. | 平均成功率 |
|---|---|---|---|---|---|---|---|
| WildLMa(本文) | 94.4% | 75% | 80% | 57.5% | 60% | 60% | 71.2% |
| ACT(Mobile ALOHA) | 77.8% | 19.4% | 55% | 25% | 60% | 30% | 40.8% |
| OpenTV | 88.9% | 77.8% | 75% | 25% | 50% | 50% | 64.4% |
| VBC | 50%* | 50%* | NA | NA | 43.8%* | 43.8%* | 46.9% |
| GeFF | 55.6%* | 55.6%* | NA | NA | NA | NA | 55.6% |
(*:VBC/GeFF 不区分 I.D./O.O.D. 物体集,成功率取两者平均;NA 表示该方法不天然适用于该任务设置。)
Table II:长程任务执行(每类 10 次试验)——WildLMa:Collect & Drop Trash 7/10,Shelf Rearrangement 3/10;ACT baseline:两项均 0/10。
Table III:视觉骨架消融(物体抓取任务)——CLIP:I.D. 83.3% / O.O.D. 69.4% / 平均 76.4%;ResNet(ACT 默认的 ImageNet 预训练 ResNet-18):I.D. 77.8% / O.O.D. 19.4% / 平均 48.6%;DinoV2:I.D. 88.9% / O.O.D. 77.8% / 平均 83.3%。
Table IV:全身控制器 vs 解耦控制 vs 纯手臂(4 名操作员各任务 3 次试验,含平均耗时与成功率)
| 条件 | Ground Grasping 耗时 | Ground Grasping 成功率 | Rearrange Shelf 耗时 | Rearrange Shelf 成功率 |
|---|---|---|---|---|
| Whole-body(本文) | 21.87s | 95% | 27.25s | 70% |
| 解耦控制(Unitree SDK 手动 base pitch) | 37.35s | 80% | 29.81s | 40% |
| 无 whole-body(仅手臂) | 无法完成(工作空间不足) | 0% | 27.88s | 70% |
Table V:视觉输入模态消融(Head+Wrist / Head Only / Wrist Only)——Tabletop Grasping:94.4% / 27.8% / 83.3%;Button Pressing:80% / 75% / 85%;Door Opening:70% / 30% / 10%(有遮挡的任务显著受益于多视角)。
Table VI:cross-attention 消融(物体抓取任务)——加 cross-attention(本文):I.D. 94.4% / O.O.D. 75% / 平均 84.7%;不加:I.D. 83.3% / O.O.D. 69.4% / 平均 76.4%(与 Table III 的 CLIP 行数值一致,同一组消融)。
创新点与影响
- 把”全身控制器”从纯 RL 部署场景挪到遥操作数据采集场景:用 VBC 的 RL 低层策略做人类遥操作的中间层,而不是让操作者直接分别控制底座和手臂,既扩大工作空间又把示范采集成本降低 26.9%,并在 Table IV 上量化验证了 whole-body 遥操作相对解耦控制/纯手臂在耗时与成功率上的优势。
- MaskCLIP 重参数化 + 文本 cross-attention 用于语言条件 ACT:相比直接用 CLIP 全局特征(消融 Table III/VI 中的 “CLIP” 行),显式的稠密图文交叉注意力对 O.O.D. 泛化的提升更明显,验证了”给模仿学习策略一个文本查询的空间概率图”这一做法的价值。
- 技能库 + LLM 分层规划的长程编排:证明少量(10-20 条)长程演示配合”泛化性强的原子技能 + divide-and-conquer 式 LLM 规划”可以让 ACT 从长程任务 0% 成功率提升到 30%-70% 区间(Table II),而直接在少量长程示范上训练端到端 ACT 完全失败。
- 论文自陈的局限:三个模块(遥操作、技能学习、规划)相对独立地设计和验证,并未做端到端联合优化;规划器依赖人工标注航点与连通图(可被自动化场景图方法替代但本文未实现);多个技能仍各自独立训练权重,尚未探索跨技能共享或规模化学习。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2411.15131
- 论文 PDF:https://arxiv.org/pdf/2411.15131
- 项目主页:https://wildlma.github.io/
- YouTube 视频:https://youtu.be/pNBMiHYn5tg
- 硬件 CAD(Onshape):https://cad.onshape.com/documents/a1c5aa72dc0984d718411e43/w/b704c91edc8536d5d2c27cae/e/e40be0896868f94b025ed97b
一手源存档(sources/)
- wildlma-loco-manipulation-in-the-wild—project-page — 项目主页快照(摘要、长程任务/技能库/泛化性/全身控制器演示清单、媒体报道、BibTeX、ICRA 2025 标注)
- arXiv 原文(arXiv:2411.15131,不入 git):https://arxiv.org/abs/2411.15131