一句话定位

LeLaN 用现成的基础模型(SAM 分割 + CogVLM 描述 + GPT-3.5-turbo 生成指令 + 单目深度估计 + NoMaD 生成反事实动作)全自动地给无动作标签的第一人称视频(机器人巡游、YouTube 房屋/城市游览、人举相机步行)打上语言指令和动作标签,标注了超过 130 小时数据,训练出一个仅 ResNet-FiLM + EfficientNet-B0 + Transformer 规模的轻量策略;在超过 1050 次真实机器人试验中,最终模型平均成功率 89%,比最强基线(OWL-v2 + Zoedepth,67%)高 22 个百分点,且在 Jetson Orin 边缘算力上推理速度是最快基线的 4 倍(0.054s vs. CoW 的 0.22s)。

背景与定位

语言条件导航(language-conditioned navigation)长期受限于缺乏大规模语言 + 动作标注的机器人数据——遥操作采集的导航轨迹通常只沿走廊中心行驶,极少主动朝向物体,即便人工标注这些轨迹也很难得到”物体导航”所需的丰富标签。此前的两条路线各有局限:一是零样本套用基础模型(VLM/LLM)做高层规划或代码生成策略(如 CLIP-Nav、LM-Nav、Code as Policies),但这些模型的训练数据分布与具身机器人经验相去甚远,且闭源大模型推理成本高、延迟大,难以上边缘设备;二是在窄分布机器人数据上微调基础模型,但微调后是否还保留原有泛化能力存疑。

LeLaN 的定位是把”任意在野视频都能被自动打上语言 + 动作标签”变成可规模化的数据管线,聚焦”最后一米导航”(last-mile navigation,即目标物体在机器人视野内可见时的精确抵达问题)——与语义探索(semantic exploration,先找到目标大致方向再靠近)互补,可搭配已有的探索式导航系统(如 ViNT 或经典搜索方法)使用。同期工作 CityWalker(见 CityWalker)延续了”网络规模视频 + 廉价自动标注”这一范式,但用视觉里程计代替 LeLaN 这里更昂贵的 VLM/LLM 语言打标流程,做的是点目标导航而非语言条件的物体导航。

模型架构

  • 任务形式化:策略 {v_k, ω_k}{k=0…N-1} = π_θ({o_k}{k=-L…0}, l),即给定当前及过去 L 步观测图像和语言提示 l,输出未来 N 步的线速度/角速度指令序列;论文实现中 N=24(Fig. 8 caption 明确给出”24 个线角速度对”),主评测中 L=0(不喂历史帧,且不启用碰撞规避损失,以隔离数据标注方法本身的贡献)。
  • 文本编码:冻结的 CLIP 文本编码器(“ViT-B32” 版本)编码提示 l;训练全程不更新该编码器权重以保留原始语义能力。
  • 视觉编码 + 语言条件融合:ResNet-FiLM(FiLM 条件层,Perez et al. 2018)从零训练,把 CLIP 文本特征以 FiLM 方式注入视觉特征提取的低层和高层,使视觉编码本身就针对提示中的目标物体做了条件化。
  • 历史帧编码:借鉴 ViNT/NoMaD 的做法,用 EfficientNet-B0 提取 {o_k}_{k=-L…0} 的视觉特征,与 ResNet-FiLM 特征一起送入 Transformer + 全连接 MLP,解码出速度指令序列。
  • 碰撞规避的知识蒸馏:额外目标 J_col 蒸馏机器人基础模型 NoMaD(Sridhar et al. 2023,NoMaD)——因为语言条件导航任务不提供目标图像 o_g,用当前观测裁剪出的目标物体图像近似 o_g 喂给 NoMaD,得到含避障行为的参考轨迹 {p̄[k]}_{k=0…M-1}(M 为 NoMaD 控制视界);为让 NoMaD 能处理裁剪目标图像,论文对其做了额外微调(50% batch 用当前观测裁剪图作为目标,50% 用原始目标图像)。
  • 训练三件套目标:J = J_pose + ε·J_col + J_smooth,其中 J_pose 是终点位姿误差((p̃_o − p̂_{N-1})²)、J_col 是与 NoMaD 参考轨迹的逐步位姿误差(乘掩码 ε)、J_smooth 是相邻步速度差的平方和(平滑约束);当目标物体距离 |p̃_o| < 1.0(论文未标注单位)时用 ε 屏蔽 J_col,避免 NoMaD 的避障倾向在临近目标时反而妨碍到达。
  • 两阶段碰撞规避训练:先不带 J_col 预训练出到达行为,再用 J_col 微调,避免”到达”和”避障”两个竞争能力互相干扰。
  • 架构消融(Table 5,MSE 越低越好):主模型 ResNet-FiLM 视觉编码器 + CLIP ViT-B32 文本编码器 MSE=1.291;换 ViT-ResNet50 文本编码器 MSE=1.202(略优但计算量更大,在真实机器人上会降低帧率、增加耗电,故未采用);把视觉编码器换成预训练 CLIP 的 ViT-B32/ViT-ResNet50(不训练视觉塔)则明显更差(MSE 1.690/1.673),因为 CLIP 视觉特征缺乏几何信息,不足以直接回归速度指令。

数据

标注总量超过 130 小时(Table 1 三类数据集合计 31.0h + 82.5h + 15.7h = 129.2h),全部来自动作无标签的第一人称视频:

  • 室内导航数据集(All 31.0h,111,570 张图,594,045 个物体,3,418,944 条提示):由三个公开机器人导航数据集拼成——GO Stanford 2(17.6h / 63,194 图 / 306,041 物体 / 1,775,073 提示)、GO Stanford 4(10.5h / 37,769 图 / 234,266 物体 / 1,338,117 提示)、SACSoN/HuRoN(2.9h / 10,607 图 / 53,738 物体 / 305,754 提示);这些轨迹本身不含主动”奔向物体”的行为,仅提供机器人视角多样性和物理接地。
  • YouTube 游览数据集(82.5h,593,727 图,3,343,956 物体,14,623,072 提示):来自 32 个不同国家的房屋游览、户外观光步行、商场游览视频,覆盖多种天气(雪、雨、晴)、时段(早/午/夜)与环境类型(城市/郊区/乡村);按 2 FPS 采样。
  • 人步行数据集(15.7h,113,277 图,534,544 物体,2,311,467 提示):因 YouTube 视频多为窄视场角相机,作者另行手持广角鱼眼相机在 3 个国家 11 个城市的室内外步行采集;同样按 2 FPS 采样。
  • 标注流程(数据自动打标管线本身也是核心贡献):SAM 对每帧分割出物体的 mask/bbox → 裁剪出的候选物体图像喂给开源 VLM(CogVLM)生成物体描述 → 描述喂给 GPT-3.5-turbo,若判定 VLM 确实识别到物体,则生成若干条”Go to X”提示(X 为该物体的多种描述方式);论文明确指出直接用 GPT-4V 生成提示成本和延迟都过高,而纯开源 VLM 直出提示质量差,故采用”开源 VLM 出描述 + 廉价 LLM 出提示”的折中方案。
  • 位姿标注:窄视场角图像用 Metric3D 估计深度,广角/360 图像用作者自研的 Depth360(自监督单目深度)估计深度,投影为点云后用 SAM mask 取中位数得到物体 3D 位姿。
  • 动作标注:用 NoMaD(RFM)以裁剪的目标物体图像为伪目标,生成朝向该物体、具避障行为的参考动作序列作为反事实动作标签——即完全无需人工遥操作或额外采集动作数据,动作标签是从现有 RFM 蒸馏出来的。
  • 数据配比消融(Fig. 5,Section 4.4):以”100% 室内导航 + 20% YouTube + 43% 人步行”为基础配比做各数据源比例的消融;室内导航数据集和人步行数据集带来的性能提升在约 10 万帧后饱和,而 YouTube 数据集在 10 万帧之后仍持续提升,训练到 50 万帧以上时给出最优策略——YouTube 数据的场景/物体分布广度是持续提升的关键原因。真实机器人测试(Table 2 的三档 YT/HW 占比:0%/0%、20%/43.5%、100%/100%)同样显示随着在野数据比例提升,几乎所有测试子集的成功率单调上升。

训练方法

  • 目标函数:见”模型架构”部分的 J = J_pose + ε·J_col + J_smooth(式 1、2)。
  • 训练超参(Appendix G.1):每个 batch 随机抽取 256 个观测;每个观测含多个物体、每个物体含多条提示,训练时随机选取物体和对应提示;L=1(只喂前一帧,对应 YouTube 数据里”1 秒前”的历史帧);Adam 优化器,学习率 1×10⁻⁴。
  • 碰撞规避的权重与掩码调参:论文提及需要反复试验才能平衡 J_pose 与 J_col 的权重——J_col 权重过大会损害到达性能;用阈值型掩码 η(0 或 1)在 |p_o| 小于设定距离阈值时屏蔽 J_col,防止 NoMaD 的避障倾向在接近目标时压制到达行为。
  • NoMaD 微调:为了让 NoMaD 能处理裁剪出的目标物体图像作为目标输入,作者对原始 NoMaD 权重做了微调(50% batch 用当前观测裁剪图作为目标图像,50% 沿用原始目标图像),其余训练流程与原 NoMaD 论文一致。
  • 长距离导航扩展(Appendix J,非端到端训练,属推理时组合):用拓扑记忆(遥操作预采集的节点图像序列)+ OWL-v2 对每个节点图像与提示打分,选最高分节点 → 用 ViNT 导航到该节点 → 切换到 LeLaN 做最后一米抵达。

Infra(训练 / 推理工程)

  • 训练硬件:单台工作站,Intel i9 CPU + 96GB 内存 + 一张 NVIDIA RTX 4090 GPU(论文原文明确,未使用多卡/多机);未披露具体训练时长(GPU-hours)、epoch 数或并行策略。
  • 推理硬件:NVIDIA Jetson Orin AGX 边缘计算平台;真实机器人评测中语言指令仅在导航开始时编码一次(CLIP 文本编码器只算一次),随后逐步以最佳帧率反复计算控制策略,只执行序列中第一步速度指令(receding horizon control 方式)。
  • 推理延迟对比(Table 2,动作计算耗时,单位秒):LeLaN 0.054s(各配比版本一致);CoW† 0.22s;OWL-ViT+ViNT 0.33s;OWL-v2+Zoedepth† 2.82s;OpenFMNav† 22.0s(含 * 号,仅首帧推理,随后交给经典控制器接管)。LeLaN 比最快基线 CoW 快约 4 倍(0.22/0.054 ≈ 4.1×),比 OWL-v2+Zoedepth 快约 52 倍。
  • 相机硬件:主评测用 Ricoh Theta S 全景相机的前向鱼眼画面;跨具身实验中替换为 PCB 鱼眼相机、Intel RealSense D435i(窄视场角)等,因视觉编码器完全从零训练,对相机类型无特殊限制。

评测 benchmark

主评测(Table 2,5 个真实环境(3 室内 + 2 室外)、28 个物体、超过 1050 次试验,成功判定为 0.2m 半径内到达目标)

方法TotalSimpleNoisyMultiple objectsDynamic objectInference (s)
OpenFMNav†0.430.380.460.310.0022.0*
OWL-ViT + ViNT0.470.480.470.220.330.33
CoW†0.580.730.510.430.170.22
OWL-v2 + Zoedepth†0.670.730.630.620.002.82
LeLaN(YT 0%, HW 0%)0.650.630.660.640.670.054
LeLaN(YT 20%, HW 43.5%)0.850.910.820.700.830.054
LeLaN(YT 100%, HW 100%)0.890.910.880.810.830.054

†表示接入经典状态格(state lattice)运动规划器做避障和速度指令生成(Appendix K:15 条运动基元,每条积分 8 步/2.664s)。LeLaN 在噪声提示(noisy prompts)上比最强基线高约 25 个百分点,在含多物体的复杂提示(如”go to the chair next to the black suitcase”)和动态目标(跟随行人)上也全面领先。Appendix B 按”办公楼层/入口大厅/家庭环境/室外”四类环境给出细分:LeLaN 在语义稀疏的办公楼层/入口大厅领先幅度最大(如办公楼层 Total 从 0.65 到 0.96),在物体丰富的家庭环境中与最强基线 OWL-v2+Zoedepth(0.77)的差距相对最小(LeLaN 满配 0.87)。

碰撞规避(Table 3,15 次试验,目标到达率)

方法有障碍物无障碍物
OWL-v2 + Zoedepth†0.400.67
LeLaN(无 J_col)0.130.89
LeLaN(有 J_col)0.600.77

无 J_col 的策略学到的是”径直冲向目标”,遇障碍物几乎必撞;加入 J_col 后有障碍物场景的到达率提升到 0.60(相应无障碍场景的到达率从 0.89 降到 0.77,体现到达与避障两个目标间的权衡),但论文明确承认 0.60 仍”不足以支撑实际使用”。

架构消融(Table 5):见”模型架构”部分——ResNet-FiLM 视觉编码器(从零训练)优于冻结 CLIP 视觉编码器(MSE 1.291/1.202 vs. 1.690/1.673)。

跨具身评测:定性验证(无成功率数字),在四足机器人 Unitree Go1(PCB 鱼眼相机)、同款轮式机器人换不同鱼眼相机、窄视场角相机(D435i)、更高机位球形相机(Ricoh Theta S)四种配置下均能稳定导航到目标物体。

长距离导航:仅提供定性演示(补充视频),未给出量化成功率。

创新点与影响

  • 核心贡献:(1)提出一套通用的、可全自动运行在任意无动作标签在野视频上的语言 + 动作标注管线,组合 SAM/VLM/LLM/单目深度/RFM(NoMaD)多个基础模型的互补能力;(2)用该管线标注的数据训练出的策略在噪声提示、动态目标、多物体消歧等困难场景上显著优于此前 SOTA 零样本方法,同时因为策略本身轻量(ResNet-FiLM + EfficientNet-B0 规模),边缘推理速度是最快基线的 4 倍;(3)数据消融证明了纳入域内机器人数据的必要性,以及 YouTube 在野视频在超过室内数据饱和点之后仍能持续提升性能;(4)开源超过 120 小时标注数据,其中含 15+ 小时来自 3 个国家 11 个城市的人工采集步行视频。
  • 论文自述局限:策略仅依靠空间推理很难区分同一场景中的多个同类物体(如两扇门中”最左边那扇”容易混淆);碰撞规避在语言条件导航中仍是尚未解决的难题(有障碍物场景到达率仅 0.60,作者称其”不足以支撑实际使用”);长距离导航和跨具身能力目前只有定性验证,缺乏严格的量化基准。

原始链接

一手源存档(sources/)