足式运动与导航族:从盲走到跨具身导航基础模型
这一族横跨两条看似无关、实则同源的技术线:腿式运动的 sim-to-real 强化学习(怎么让一台仿真里练出来的机器人真的走过泥地/跳过沟/爬上箱)与移动机器人的导航基础模型(怎么让一个策略驱动任意机身、去任意目标)。两条线的共同敌人都是泛化——仿真到真实的动力学缺口、一台机器人到另一台机器人的形态缺口。它们各自的答案惊人地对称:运动线用**“特权信息蒸馏 / 在线系统辨识”把仿真里的地形/摩擦/负载差异压进一个低维隐向量,让只有本体感觉的策略”想象”出看不见的环境;导航线用”归一化路点 + 图像/语言目标”**把不同机身的速度/动力学差异压进一个具身无关的动作空间,让一个网络吃下多机器人异构数据。到 2024 年两条线经 NaVILA 正式汇流——高层 VLM 出语言级 waypoint、低层 RL 运动策略执行——并在 2026 年的 Uni-LaViRA 上被推到极致:导航被论证为”落在预训练 MLLM 自然输出流形内”的任务,可以零训练完成。本页把这 33 个工作放在一条时间轴上,抠出”谁在什么硬件上、用什么方法、把什么指标推到多少”。
涉及工作(slug 即单页文件名)
- 腿式运动 sim-to-real:sim-to-real-agile-locomotion-quadruped → learning-quadrupedal-locomotion-challenging-terrain / rma-rapid-motor-adaptation / learning-to-walk-in-minutes-massively-parallel-rl → learning-robust-perceptive-locomotion-wild / neural-volumetric-memory-visual-locomotion / dreamwaq / dtc-deep-tracking-control → extreme-parkour-legged-robots / robot-parkour-learning / anymal-parkour-agile-navigation / agile-but-safe-legged-locomotion;步态参数化 walk-these-ways;腿臂协同 deep-whole-body-control-loco-manipulation / helpful-doggybot / wildlma-loco-manipulation-in-the-wild。
- 导航基础模型 & VLN:land-learning-to-navigate-from-disengagements → gnm-general-navigation-model / vint-foundation-model-visual-navigation / nomad-goal-masked-diffusion-navigation → lelan-language-conditioned-navigation-in-the-wild / citywalker-embodied-urban-navigation / crossformer-cross-embodied-learning;零样本语义导航 vlfm-vision-language-frontier-maps / viplanner-visual-semantic-local-navigation;VLM-VLN navid-video-vlm-vln / uni-navid-video-vla-navigation / navila-legged-robot-vla-navigation / mobility-vla;空中 VLN citynav-aerial-vln;视觉跟踪 trackvla-embodied-visual-tracking / trackvla-plus-plus;免训练统一 uni-lavira-unified-embodied-navigation。
0. 两张总表(数字均引自对应单页,单页已对抗式核过)
0a. 腿式运动 sim-to-real 谱系
| 模型 | 时间 | 机构 | 本体 | 感知 | 核心方法 | 训练框架/规模 | 关键数字(一手) |
|---|---|---|---|---|---|---|---|
| sim-to-real-agile-locomotion-quadruped | 2018-04 | Minitaur | 纯本体感觉(4维) | 执行器模型+延迟建模+动力学随机化 | PyBullet PPO,700万步 | 学习步态比手调省电 23%(trot)/35%(gallop);trot 0.6m/s;训练 4.35h | |
| learning-quadrupedal-locomotion-challenging-terrain | 2020-10 | ETH+Intel | ANYmal-B/C | 盲式(本体感觉) | teacher-student + TCN + 粒子滤波地形课程 | RaiSim,teacher 12h+student 4h 单机 | DARPA SubT 4×60min 零失败;foot-trapping 16.8cm;板载 400Hz |
| rma-rapid-motor-adaptation | 2021-07 | Berkeley/CMU/FAIR | Unitree A1 | 盲式 | base policy + adaptation module 估 8维 extrinsics <1s | RaiSim PPO,1 GPU 24h+3h | sim success 73.5% vs Expert 76.2;π 100Hz/φ 10Hz;背 12kg |
| learning-to-walk-in-minutes-massively-parallel-rl | 2021-09 | ETH+NVIDIA | ANYmal C | 本体感觉+108高度点 | 大规模并行 PPO + game 课程 | Isaac Gym,4096 env,单 RTX A6000 | 平地 <4min、粗糙 <20min;开源 legged_gym/rsl_rl |
| walk-these-ways | 2022-12 | MIT | Unitree Go1 | 本体感觉 | MoB gait-conditioned(8维行为参数) | Isaac Gym PPO,4096 env,2.58B步 | 单策略零样本上楼/钻杆/单跳 60cm 缺口;50Hz |
| deep-whole-body-control-loco-manipulation | 2022-10 | CMU | Go1+WidowX(19DoF) | 本体感觉+AprilTag | unified policy + Advantage Mixing + ROA | Isaac Gym,5000 env,20亿样本 | EE error 比 RMA 低 20%;latent 误差 2e-4 vs RMA 0.31;硬件 6K 美元 |
| dreamwaq | 2023-01 | KAIST | Unitree A1 | 盲式 | 非对称 AC + CENet 隐式地形想象 + AdaBoot | Isaac Gym,4096 env,单 RTX 3060Ti 1h | 抗推 1.121m/s、存活 95.23%;户外走 430m/465m |
| neural-volumetric-memory-visual-locomotion | 2023-04 | UCSD | Unitree A1 | 前置深度相机 | SE(3) 等变体素记忆 + teacher-student 蒸馏 | 图像观测约 1000fps(vs 高程图 4万) | Stones success 14.4% vs 次高 2.2;真机 Stages 5.4m |
| anymal-parkour-agile-navigation | 2023-06 | ETH | ANYmal D | 6深度相机+LiDAR | 分层:多分辨率地形重建+5技能+混合PPO导航选择器 | Isaac Gym,4096 env,8 个网络 | 导航 SR 98.2/96.3/97.6% vs manual;2m/s;感知延迟 250→25ms |
| extreme-parkour-legged-robots | 2023-09 | CMU | Unitree A1 | 前置深度 D435 | 内积统一奖励 + 双重蒸馏(动作+yaw) | Isaac Gym PPO,单 3090 <20h | climb 2×身高/gap 2×身长/37°坡/倒立;50Hz+10Hz |
| robot-parkour-learning | 2023-09 | 上海期智/Stanford等 | A1/Go1 | 深度 D435 | 软/硬动力学两阶段 + DAgger 蒸馏 | Isaac Gym PPO,4096 env,每技能 3090 12h+6h | sim climb 86/leap 80;真机爬 0.40m/跨 0.60m 沟 |
| dtc-deep-tracking-control | 2023-09 | ETH | ANYmal | 本体感觉+落脚点+高度扫描线 | 在线 TO(TAMOLS) 参考 + RL 跟踪,非对称 AC | Isaac Gym,4096 env,2 周 | 落脚误差 2.3cm;爬箱 0.48m(比 RL 基线高 50%);50Hz策略/400Hz TO |
| learning-robust-perceptive-locomotion-wild | 2022-01 | ETH | ANYmal C | 本体感觉+外感高度扫描 | belief encoder + 注意力门控(外感失效退化为盲走) | RaiSim,teacher 1000 env/student 300 env | 阿尔卑斯 2.2km/78min 零跌倒;速度 1.2 vs 基线 0.6m/s;台阶 30.5cm |
| agile-but-safe-legged-locomotion | 2024-01 | CMU+ETH | Unitree Go1 | 11 射线深度 | 双策略 + HJ reach-avoid 安全屏蔽 | Isaac Gym,1280 env,单 4090 20min | 峰值 3.1m/s 无碰撞;碰撞率 5.7% vs 纯敏捷 21.7% |
| helpful-doggybot | 2024-09 | Stanford/UCSD | Go2+咬合夹爪 | 深度 D435 + VLM | sim-only 控制 + 免训练 VLM 语义路由(Florence-2/SAM2) | Isaac Gym,6144 env,单 4090 10h+6h | 未见房间取物首试 60%;爬床 44cm;零真实数据 |
| wildlma-loco-manipulation-in-the-wild | 2024-11 | UCSD | Unitree B1+Z1 | RGBD + CLIP | 全身遥操作 + MaskCLIP-ACT + LLM 分层规划 | 模仿学习,每技能 30-60 条示范 | 技能均值 71.2%(O.O.D. 泛化);长程 7/10;采集省 26.9% |
0b. 导航基础模型 & VLN 谱系
| 模型 | 时间 | 机构 | 任务 | 骨干 | 参数 | 训练数据 | 目标模态 | 关键数字(一手) |
|---|---|---|---|---|---|---|---|---|
| land-learning-to-navigate-from-disengagements | 2020-10 | Berkeley | 人行道导航 | MobileNetV2+LSTM+MPC | — | 17.4km 真机 | 无(MPC 规划) | 接管前 87.5m vs BC 13.4m(6.5×) |
| gnm-general-navigation-model | 2022-10 | Berkeley/Toyota | 跨具身 image-goal | 双 MobileNetv2 | ~8.7M | ~60h/6 机身 | 图像目标 | LoCoBot 0.96/Tello 0.99;归一化路点+具身上下文 |
| vint-foundation-model-visual-navigation | 2023-06 | Berkeley | image-goal 基础模型 | EfficientNet + 4层 Transformer | 31M | ~80h/8 机身 | 图像目标 | Go1 零样本 45m;公里级 1270m;8×V100 30h |
| nomad-goal-masked-diffusion-navigation | 2023-10 | Berkeley | 导航+探索统一 | ViNT 编码 + 扩散动作头 | 19M | >100h | 图像目标/无目标 | 探索 98% vs SOTA 77%,小 15×;ICRA24 best paper |
| vlfm-vision-language-frontier-maps | 2023-12 | Boston Dynamics AI/GT | ObjectNav 零样本 | BLIP-2 价值地图 + frontier | 免训练 | 仅 PointNav 子策略 | 物体类别 | HM3D 30.4 SPL(超监督法);Spot 部署;ICRA24 best cognitive |
| viplanner-visual-semantic-local-navigation | 2023-10 | ETH/NVIDIA | 局部规划 | 双 ResNet-18 + Imperative Learning | — | ~80k sim 起止对 | 度量目标点 | 语义可通行代价 -38% vs iPlanner;单 3090 6h;10Hz |
| navid-video-vlm-vln | 2024-02 | PKU/BAAI/Galbot | VLN-CE | LLaMA-VID 视频 VLM(Vicuna-7B) | 7B | 510k+763k | 自由语言 | R2R SR 37.4(仅 RGB);24×A100 28h;真机 66% |
| citynav-aerial-vln | 2024-06 | 日本多机构 | 空中 VLN 数据集 | Seq2Seq/CMA/AerialVLN+GSM | — | 32637 轨迹真实城市 | 语言+地标 | AerialVLN+GSM 6.72% vs 人类 88%;单 4090 |
| crossformer-cross-embodied-learning | 2024-08 | Berkeley/CMU | 4 类具身统一 | 12 层 Transformer | 130M | 900K 轨迹/20 具身 | 语言/图像 | 平均 73% vs 专用 51%;TPU v5e-256;CoRL24 Oral |
| mobility-vla | 2024-07 | Google DeepMind | MINT 多模态导航 | Gemini 1.5 Pro + 拓扑图 | 零训练 | 导览视频 | 语言+图像 | 端到端 86/90%(复杂/多模态);免梯度更新 |
| lelan-language-conditioned-navigation-in-the-wild | 2024-10 | Berkeley/Toyota | 语言 last-mile | ResNet-FiLM+EffNet-B0 | 轻量 | >130h 自动标注 | 语言 | 89% 成功;边缘 0.054s(快 4×);VLM 全自动打标 |
| navila-legged-robot-vla-navigation | 2024-12 | UCSD/USC/NVIDIA | 腿式 VLN | SigLIP+Llama3-8B + RL locomotion | 8B | 真人视频+仿真+VQA | 语言(中层语言动作) | R2R SR 54.0(+17 vs NaVid);真机 88%;RSS25 |
| uni-navid-video-vla-navigation | 2024-12 | PKU/Galbot/BAAI | 4 nav 任务统一 | Vicuna-7B + 在线 token 合并 | 7B | 3.6M+2.3M | 自由语言 | R2R SR 47.0;40×H800 35h;~5Hz |
| trackvla-embodied-visual-tracking | 2025-05 | PKU/Galbot/BAAI | 具身视觉跟踪 | EVA-CLIP+Vicuna-7B + 锚点扩散头 | 7B | 170 万样本 | 语言(外观描述) | EVT-Bench STT 85.1;24×H100 15h;真机 10FPS |
| trackvla-plus-plus | 2025-10 | PKU 等 | 具身视觉跟踪 | NavFoM+Qwen2-7B + Polar-CoT+TIM | 7B | 200 万样本 | 语言 | DT 四视角 74.0(+12);8×H100 1天;4.8FPS |
| uni-lavira-unified-embodied-navigation | 2026-05 | 南大/自动化所等 | 4 任务 4 机身统一 | Gemini-3.1 + Qwen3.5 双 MLLM | 零训练 | 零轨迹 | 语言/图像 | R2R 60.7/ObjectNav 77.7%;GPU 训练 = 0 |
口径提醒:运动线普遍只报仿真成功率 + 真机定性/竞赛级部署(DARPA SubT、阿尔卑斯徒步),几乎不做统一 benchmark;导航线的 VLN-CE(R2R/RxR)、ObjectNav(HM3D/MP3D)是仅有的横向可比 leaderboard,但各家输入(RGB-only vs RGBD+里程计)、动作空间(低层 vs 高层 waypoint)口径不一,跨表比较需谨慎。
1. 一条谱系,两个源头,2024 年汇流
这一族真正的技术脉络不是一棵树,而是两条平行河在末端并流。
运动河的源头是 sim-to-real-agile-locomotion-quadruped(Google,2018)。它奠定了此后八年几乎所有腿式 sim-to-real 工作的三件套模板:物理级执行器建模(把 Bullet 默认 PD 换成直流电机动力学 + 分段线性力矩饱和)、控制回路延迟建模(实测 15–19ms 建进仿真)、动力学随机化(质量/摩擦/电机强度/延迟/电压逐 episode 采样)。它在 Minitaur 上零样本迁移出比工程师手调更省电的步态,证明”仿真训练、真机零微调”可行。此后 learning-quadrupedal-locomotion-challenging-terrain(ETH,2020)、rma-rapid-motor-adaptation(Berkeley,2021)把它推向复杂地形,learning-to-walk-in-minutes-massively-parallel-rl(ETH,2021)把它推向单卡分钟级训练。
导航河的源头是 land-learning-to-navigate-from-disengagements(Berkeley,2020)——它把”人类安全员接管”这一测试副产品当唯一监督信号,用一个卷积-循环网络预测未来接管概率再做 MPC 规划。它与同实验室的 BADGR 共享”动作条件模型 + 采样式 MPC”骨架,是后来 GNM→ViNT→NoMaD 这条”图像目标 + 归一化路点”导航基础模型线的方法论前身。
两条河的汇流点是 NaVILA(2024):它把 VLN 的”高层语言推理”接到腿式 RL 的”低层运动控制”上——上层一个 8B VLM 把 RGB 视频翻译成中层语言动作(“move forward 75cm”),下层一个 LiDAR 视觉 locomotion RL 策略(继承自 Rudin 那条 Isaac Lab 单阶段 PPO 线)把它执行成腿关节动作。这是本族第一次让”导航基础模型”和”运动 sim-to-real”在同一个系统里各司其职、双频协作。
2. 腿式运动 sim-to-real:从盲走到跑酷
2.1 奠基三件套 + 两把钥匙:特权蒸馏与大规模并行(2018–2021)
2018 的三件套解决了”动力学缺口”,但复杂地形还需两把新钥匙。
第一把:特权信息蒸馏(teacher-student)。 learning-quadrupedal-locomotion-challenging-terrain 的洞察是——直接对崎岖地形做 model-free RL 会因监督信号稀疏而学不动,于是拆成两阶段:teacher 在仿真里可见特权信息(71 维地形法向/高度扫描/接触力/摩擦,噪声无关)快速学到高性能,再蒸馏成一个只用本体感觉的 student。student 用 TCN(时间卷积网络) 从 2 秒本体感觉历史里隐式恢复地形隐向量,配粒子滤波自动地形课程维持”中等可通过性”的训练分布。结果是一个纯本体感觉的盲式控制器在 DARPA SubT 竞赛 4×60min 任务零失败,且涌现出 foot-trapping 反射(跨 16.8cm 台阶)。这套”privileged learning + proprioceptive sequence model + adaptive curriculum”成为后续几乎所有工作的地基。
RMA 的分叉。 rma-rapid-motor-adaptation 是 Lee et al. 的孪生工作,但在”student 用什么、何时适应”上分道扬镳。它的 adaptation module φ 只用最近 0.5s 单条本体感觉历史,在不到 1 秒内在线估出一个 8 维环境 extrinsics ẑ——关键洞察是不必辨识真实物理参数 e,只需直接估 extrinsics z(“如何改变行为来纠偏”的低维投影),绕开可辨识性歧义。φ 类比 Kalman 滤波器,π(100Hz)与 φ(10Hz)异步双频部署。它把适应时间从分钟级(同期 AWR 需 4-8 分钟真机 rollout)压到 <1s,让 Unitree A1 完全仿真训练就零样本走过沙/泥/油面并背 12kg(100% 自重)。这套”直接估 extrinsics + 异步双频”被后续大量工作沿用为标准配方。
第二把:大规模并行 RL。 learning-to-walk-in-minutes-massively-parallel-rl 把 RMA/Lee 的”12h/单机”训练拉到单 RTX A6000 上 4 分钟(平地)/20 分钟(粗糙)。核心是把仿真吞吐从 CPU 多进程搬到 Isaac Gym 的 GPU 上万并行,并在”数千机器人”新 regime 下重调 PPO——小 nsteps(≈25 步下限)、超大 mini-batch、time-out bootstrapping(+10-20% 奖励)、game-inspired 零调参课程。它开源的 legged_gym + rsl_rl 成为整个具身运动学习领域被反复 fork 的事实基线——walk-these-ways、dreamwaq、dtc-deep-tracking-control、extreme-parkour-legged-robots、robot-parkour-learning、agile-but-safe-legged-locomotion 全部构建其上。
2.2 感知融合与本体感觉的两条路(2022–2023)
盲式控制器只能”先踩后判断”,速度与越障天然受限。如何引入外部感知(exteroception)分出两条路。
融合外感、但学会何时不信它。 learning-robust-perceptive-locomotion-wild 在 learning-quadrupedal-locomotion-challenging-terrain 框架上加了个带注意力门控的 GRU belief encoder:外感高度扫描可信时通过 skip connection 放行、加速通过;外感失效(雪/水/反光/位姿漂移)时门关闭、无缝退化为纯本体感觉盲走。训练时对高度采样按 60%/30%/10% 概率注入 nominal/offset/noisy 三档噪声。结果是阿尔卑斯 2.2km 环线 78 分钟零跌倒、速度 1.2m/s(盲式基线 0.6)、可靠翻越 30.5cm 台阶。这套”用可学习门控替代启发式规则决定信不信外感”是感知式运动的关键突破。
继续深挖纯本体感觉。 反方向上,dreamwaq(KAIST)证明零视觉/LiDAR 也能走山地:用非对称 actor-critic 一次性联合训练(actor 只看本体历史,critic 看含高度图的特权状态),让 actor-critic 博弈本身逼策略隐式”想象”地形;配 CENet(共享编码器 + 速度估计头 + β-VAE 上下文头联合学正/反向动力学)与 AdaBoot(用 reward 变异系数自适应决定何时信任估计器)。单 RTX 3060Ti 训 1 小时,抗推速度 1.121m/s、户外连走 430m/465m。它把”非对称 AC 隐式想象、单阶段联合训练”确立为纯本体感觉的一条可行路线,区别于显式两阶段蒸馏。
几何显式化。 neural-volumetric-memory-visual-locomotion(UCSD)指出主流”帧堆叠”忽略了 3D 世界的等变结构——策略被迫额外学会消解相机运动带来的伪变化。它把近期几帧深度各自编成 3D 特征体素,用位姿网络估计的 SE(3) 变换对齐回当前自身坐标系再融合,取代帧堆叠。在需要精确落脚点推断的 Stones 地形上 success 14.4% vs 次高 2.2(6.5×)。
RL 与轨迹优化的联姻。 dtc-deep-tracking-control(ETH)走了第三条路:让在线模型驱动轨迹优化器 TAMOLS(400Hz)滚动生成参考落脚点/身体轨迹,一个纯 MLP 的 RL 策略(50Hz)去跟踪它——兼得 TO 的精确落脚(平地误差 2.3cm)与 RL 的鲁棒恢复。关键工程是 TO 只在触地时重算(省 23× 算力),且观测只暴露”对规划器选择不敏感”的落脚点子集,使同一策略能零样本换 TAMOLS 或非线性 MPC 两种规划器。它在垫脚石、缝隙这类”落脚点稀疏”地形上远超纯 RL 基线(0.1m 缝隙 100% vs 基线无法跨越)。
2.3 跑酷双雄 + 分层派 + 安全派(2023–2024)
2023 年三篇并行工作把”学习驱动的机器人跑酷”推到新高度,路线各异。
| 维度 | extreme-parkour-legged-robots | robot-parkour-learning | anymal-parkour-agile-navigation |
|---|---|---|---|
| 机构/本体 | CMU / Unitree A1 | 上海期智等 / A1·Go1 | ETH / ANYmal D |
| 策略结构 | 单一端到端网络 | 5 专家 → 蒸馏成单一视觉策略 | 分层:感知重建+5技能+导航选择器 |
| 核心招数 | 内积统一奖励 + 双重蒸馏(动作+yaw) | 软动力学预训练(障碍可穿透)+ 硬动力学微调 | 多分辨率地形重建 + 混合 PPO(Gaussian+categorical) |
| 特权→部署 | scandots + ROA → convnet-GRU + 深度 | 障碍抽象 e_vis → CNN+GRU + 深度 | 点云重建 belief 隐向量 → 深度+LiDAR |
| 感知 | 前置 D435(10Hz) | 前置 D435(48×64,10Hz) | 6 深度相机 + LiDAR |
| 招牌能力 | climb 2×身高/gap 2×身长/37°坡/倒立 | 爬 0.40m/跨 0.60m/匍匐/侧倾/奔跑 | 2m/s 敏捷导航、自主选技能与路径 |
| 训练成本 | 单 3090 <20h | 每技能 3090 12h+6h(蒸馏 4 机) | Isaac Gym 4096 env,8 网络 |
三者的哲学分歧很清楚:extreme-parkour-legged-robots 赌”更简单”——用能泛化到任意几何的 scandots 特权信息 + 一条通用内积奖励让跳/爬/倒立自然涌现,还首创”让策略自主决定朝向 yaw”(对极长跳,几度朝向误差就失败);robot-parkour-learning 把直接配点法的软约束思想搬进 RL——让障碍在预训练阶段可穿透以绕开难探索局部最优;anymal-parkour-agile-navigation 反其道坚持技能分离 + 高层选择器,理由是不同障碍所需动作模式差异极大、拆开更好调参,且导航层能显式建模每个技能的能力边界(箱子太高就绕路)。
安全派。 agile-but-safe-legged-locomotion(CMU+ETH)打破”敏捷 vs 安全”的两难:一个 goal-reaching RL 策略跑到极限速度,一个基于 Hamilton-Jacobi reach-avoid 价值网络实时判危、超阈值就切到恢复策略兜底。它在 Unitree Go1 上实现峰值 3.1m/s 无碰撞(碰撞率 5.7% vs 纯敏捷策略 21.7%),且量化证明”敏捷-安全权衡边界”客观存在、外部 RA 屏蔽能整体突破它。
2.4 步态参数化与 loco-manipulation:把”手”接上腿
可控步态。 walk-these-ways(MIT)不追极限,而是把”同一任务的多种解”用 8 维行为参数(步态相位/频率/身高/俯仰/站宽/抬脚高度)显式编码进单个 gait-conditioned 策略(MoB, Multiplicity of Behavior)——部署时人手实时旋旋钮,一个只训过平地的策略就能零样本上楼/钻 22cm 杆/抗推/穿灌木/单跳 60cm 缺口/跳舞。它把”OOD 泛化”从”重训一个策略”变成”实时选解”,其开源 Go1 控制器成为四足 sim-to-real 社区的强 baseline。
腿臂协同。 deep-whole-body-control-loco-manipulation(CMU)用单个 MLP 策略同时输出腿+臂全部关节目标(19 DoF),而非行业惯例的”腿臂分层”。两个方法创新:Advantage Mixing(用因果结构分解优势函数,诱导”先各自学会、再融合协同”的隐式课程)与 Regularized Online Adaptation(RMA 的正则化推广,去掉两阶段串行,latent 模仿误差比 RMA 低 3 个数量级)。硬件仅 6K 美元(Go1+WidowX),统一策略让腿的弯伸把臂工作空间扩大 40%。
接上语义。 到 2024 年,loco-manipulation 开始借 VLM 打开放世界:helpful-doggybot(Stanford/UCSD)给 Go2 装 1 自由度咬合夹爪,下层运动完全 sim-only 练成、上层语义完全交给免训练 VLM(Florence-2 检测 + SAM2 跟踪 + PID 目标点),在未见房间爬床/沙发叼玩具首试 60%,全程零真实数据;wildlma-loco-manipulation-in-the-wild(UCSD)把 VBC 的全身控制器挪到遥操作数据采集场景(示范成本降 26.9%),用 MaskCLIP 条件的 ACT 学原子技能(每技能 30-60 条示范),再用 LLM 分层规划编排长程任务(收垃圾 7/10)。
3. 导航基础模型 & VLN:从 image-goal 到语言 agent
3.1 BAIR 三部曲:跨具身 image-goal omnipolicy(2022–2023)
导航线真正成”基础模型”是 Berkeley(Levine 组)的三部曲,共享同一份 visualnav-transformer 代码库。
| 维度 | gnm-general-navigation-model | vint-foundation-model-visual-navigation | nomad-goal-masked-diffusion-navigation |
|---|---|---|---|
| 时间/参数 | 2022 / ~8.7M | 2023 / 31M | 2023 / 19M |
| 骨干 | 双 MobileNetv2 CNN | EfficientNet-B0 ×2 + 4层 Transformer | ViNT 编码 + 1D 条件 U-Net 扩散头 |
| 数据 | ~60h / 6 机身 | ~80h / 8 机身 | >100h(GNM+SACSoN) |
| 关键机制 | 归一化路点 + 具身上下文(连续过去帧) | goal-fusion 编码器(通道拼接) + prompt-tuning | goal masking(二值掩码切换定向/探索) |
| 任务 | image-goal | image-goal + GPS/指令适配 | 定向导航 + 无目标探索(统一) |
| 招牌数字 | LoCoBot 0.96/Tello 0.99(含未见机身) | Go1 零样本 45m;GPS 公里级 1270m | 探索 98% vs SOTA 77%(小 15×) |
核心抽象是”归一化路点 + 图像目标”。 GNM 的两处小改动定义了整族:(1) 归一化动作空间——不同机器人速度跨度 0.2-10m/s,用与最高速相关的机器人特定 α 把路点拉平成具身无关的抽象;(2) 具身上下文——用连续过去 5 帧自动推断一个学习到的机身表征,无需手工机器人参数。image-goal 作为预训练目标的选择是关键:目标由”在目标处会看到的那张图”指定,不需要真值定位/语义/metadata,任何”有视频+有动作”的数据都能拿来训。
ViNT 把它做成高容量基础模型:Transformer 骨干、31M 参数、支持零样本跨机身(Go1 训练集完全没有仍能控制)、prompt-tuning 适配 GPS/指令、1 小时数据微调到 CARLA 自动驾驶(完全 OOD)。它观察到正迁移——在分布内机器人上也超过只用该机器人数据训的专家,作者视之为”基础模型”的标志。NoMaD 则把 ViNT 的探索外挂(335M 图像扩散子目标)换成一个 goal-masked 扩散动作头——用一个二值掩码决定策略是否”看见”目标 token,从而在定向导航与无目标探索间无缝切换,把两件事塞进 19M 单模型、可跑在 Jetson Orin 边缘。它继承 Diffusion Policy 的”动作去噪”范式,获 ICRA 2024 最佳论文。
3.2 网络视频与自动标注:把数据从遥操作放大到万小时(2024)
三部曲的数据靠遥操作,规模受限。2024 年的关键突破是用现成基础模型全自动给在野视频打动作标签。
LeLaN(Berkeley/Toyota)组合 SAM 分割 + CogVLM 描述 + GPT-3.5 生成指令 + 单目深度 + NoMaD 生成反事实动作,给 YouTube 房屋/城市游览等无标签视频打上语言+动作标签(>130h),训出轻量策略聚焦”最后一米导航”,边缘推理 0.054s(比最快基线快 4×)。CityWalker(NYU)更激进——只用视觉里程计 DPVO 从 2000 小时城市步行/驾驶视频抠相对位姿当动作伪标签(不用任何 VLM/人工),沿用 GNM 的路点归一化处理尺度歧义,214M 的 DINOv2+Transformer 在真机城市部署 77.3%,超过 ViNT/NoMaD 含微调版。这条”网络规模视频 + 廉价自动标注”线证明了噪声伪标签”够用”。
跨具身推到极致的是 CrossFormer(Berkeley/CMU):不做任何观测/动作空间人工对齐,用一套 130M Transformer 权重在 900K 轨迹、20 种具身(单臂/双臂/轮式导航/四足关节级)上联合训练,真机平均 73%(打平各具身专用 SOTA 51% 与只用目标数据的同架构基线 68%),还零样本迁移到四旋翼。它首次把腿足 12 维关节动作(而非高层 2D waypoint)纳入跨具身联合训练,与操作族的 Octo/Gato/RoboCat 同谱系。
3.3 零样本语义导航:不训练策略,只接 VLM(2023)
另一条线彻底放弃训练导航策略,把预训练模型接进经典框架。VLFM(Boston Dynamics AI)用深度建占据栅格找前沿,同时用冻结 BLIP-2 直接对 RGB 算”这图和 Seems like there is a <target> ahead. 有多像”,铺成一张语言接地的价值地图——省掉”检测器把画面转成物体列表”这道信息瓶颈。零训练在 Gibson/HM3D/MP3D 刷新零样本 SOTA(HM3D 30.4 SPL),甚至超过专门训练的监督法,并部署到 Spot。ViPlanner(ETH/NVIDIA)则用 Imperative Learning(双层优化:网络权重 + 可微轨迹优化器联合端到端)训一个语义感知局部规划器,把 30 类语义按可通行性编码进 RGB 色彩空间,纯仿真训练零样本部署 ANYmal,能正确识别”楼梯几何上是障碍、实际可通行”(纯几何 iPlanner 结构性做不到)。
3.4 VLM 进入 VLN:视频 VLM 与”语言中层动作”(2024)
VLN(跟随自由语言指令导航未见环境)在 2024 年被 VLM 重塑。
| 维度 | navid-video-vlm-vln | uni-navid-video-vla-navigation | navila-legged-robot-vla-navigation | mobility-vla |
|---|---|---|---|---|
| 机构 | PKU/BAAI/Galbot | PKU/Galbot/BAAI | UCSD/USC/NVIDIA | Google DeepMind |
| 骨干 | LLaMA-VID(Vicuna-7B) | Vicuna-7B | SigLIP+Llama3-8B | Gemini 1.5 Pro(零训练) |
| 输入 | 单目 RGB 视频 | 单目 RGB 视频 | 单目 RGB 视频 | 导览视频 + 全帧 |
| 任务范围 | VLN-CE | VLN+ObjNav+EQA+跟随 | 腿式 VLN | MINT(多模态指令) |
| 动作 | 离散动作+量化参数(语言) | 4 步离散动作 token | 中层语言动作+RL执行 | 目标帧索引→拓扑图 Dijkstra |
| 数据 | 510k+763k | 3.6M+2.3M | 真人视频+仿真+VQA | 无(免训练) |
| R2R SR | 37.4 | 47.0 | 54.0 | —(MINT 86%) |
| 推理 | 1.2-1.5s/动作 | ~0.2s(在线 token 合并,5Hz) | 0.6s(W4A16 量化) | 高层 10-30s |
NaVid 是第一个把视频 VLM 用于 VLN-CE:只吃单目 RGB 在线视频流,端到端输出带量化参数的低层动作(前进 d cm/转 x 度),全程不用地图/里程计/深度,从建模上消除这些模态的 sim-to-real 域差。关键改造是历史/当前帧差异化 token 编码(当前帧 64 token、历史帧各 4 token)。Uni-NaVid 把它扩成统一四种导航任务,并用”当前/短期/长期”三级 token 分级合并把单次推理稳到 ~0.2s。
NaVILA 的”语言中层动作”是本族最重要的架构分歧点。 与 RT-2/OpenVLA 这类”VLM 直接吐量化低层动作”不同,NaVILA 主张 LLM 本就在自然语言上训练,把推理硬压成精确非语言动作会牺牲推理力,因此把动作留在语言域(“move forward 75cm”),再交给专门运动策略落地。这带来三重好处:换低层策略即换机身(Go2/H1/G1/T1)、训练能吃真人视频/QA 异构数据、大 VLM 低频出命令+运动策略实时跑的双频设计。R2R SR 54.0(首个单目 RGB 追平多传感器+waypoint 方法),真机 88%。
Mobility-VLA 的零训练组合是另一极。 它完全不训练任何网络:上层让 Gemini 1.5 Pro 的百万 token 上下文”看”一段人走过的导览视频、直接指出目标帧号;下层用经典 COLMAP 建拓扑图 + Dijkstra + iLQR-MPC 把目标帧转成动作。RQ3 证明直接让 VLM 输出路点动作 SR=0%(分布外),而”目标帧+拓扑图”SR=90%——把 VLM 限定在其训练分布内最擅长的任务(长视频里找一帧)、把度量动作完全交给经典 SLAM。
3.5 空中 VLN 与具身视觉跟踪(2024–2025)
任务边界继续外扩。 CityNav(日本多机构)把 VLN 搬到真实城市 3D 扫描(剑桥+伯明翰 SensatUrban),32637 条人类无人机飞行轨迹,提出把 OpenStreetMap 地标编成”地理语义地图 GSM”喂给基线——但即便如此 test-unseen SR 仅 6.72%,离人类 88% 仍是数量级差距,说明空中 VLN 远未解决。
具身视觉跟踪(EVT) 是 PKU-EPIC 系的新战场。TrackVLA 把”识别”和”规划”塞进同一个 Vicuna-7B 主干的单次前向——识别走语言建模头、跟踪走锚点扩散动作头(先 K-means 聚 40 条轨迹锚点,只加噪去噪 2 步 DDIM,比 vanilla diffusion policy 快 5×),靠一个 [Track] token 在解码阶段分叉。真机 Go2 上 10FPS,遮挡/高速场景优于同价位商用跟踪无人机。TrackVLA++ 在导航基座 NavFoM 上补两块短板:Polar-CoT(把空间推理压成”一个 token”的极坐标角度×距离网格 + <invalid> 标记)与 TIM(用 reasoning token 归一化熵做置信度门控的目标身份记忆),在严重遮挡+外观相似干扰下把 DT 四视角 SR 从 62.0 提到 74.0。
4. 汇流:分层解耦成为共识,训练无关成为可能
到 2024–2026,两条河的汇流已成范式共识:高层语义/规划(VLM 或经典 SLAM)+ 低层控制(RL 运动策略或几何控制器)的分层解耦。 这个模式在多处独立涌现——NaVILA 的”VLM 语言 waypoint + RL locomotion”、Mobility-VLA 的”VLM 找帧 + 拓扑图控制”、Helpful DoggyBot 的”免训练 VLM 语义路由 + sim-only 运动”、WildLMa 的”LLM 规划 + CLIP-ACT 技能 + VBC 全身控制”、ANYmal Parkour 的”导航选择器 + 技能库”。
Uni-LaViRA(2026)把这条线推到逻辑终点:训练无关(training-free)。 它提出结构性论证——一个具身任务能否免训练,看它的动作空间是否落在预训练 MLLM 的”自然输出流形”内。灵巧操作的连续关节力矩/接触力序列 MLLM 很少见过,必须端到端学;而导航本质是非接触的空间决策,可完全化约成离散方向语言 + 像素坐标,两者都是 MLLM 预训练反复产出的表示。于是两个通用 MLLM(Gemini-3.1 做语言动作、Qwen3.5 做视觉定位)零样本跑通 VLN-CE/ObjectNav/EQA/Aerial-VLN 四大任务和轮式/四足/人形/无人机四种机身,配 TODO List Memory(防长指令注意力漂移)和 Second Chance Backtrack(带失败证据的回退重规划)。R2R 60.7%/ObjectNav 77.7%/EQA 54.7%,GPU 训练 = 0——在 HM3D/EQA/OVON/OpenUAV 四个基准上零训练超过消耗千卡时、百万级轨迹训练的导航基础模型(NavFoM 训练约 4032 H100-hours)。这与 3.4/3.5 节那条”堆数据训 VLA 基础模型”的 scaling 路线(NaVid→Uni-NaVid,轨迹从 51 万涨到 360 万)形成了明确的路线对立。
5. 贯穿全族的设计模式
把 33 个工作叠在一起,能抽出几条反复出现的”元招式”:
| 模式 | 运动线的体现 | 导航线的体现 |
|---|---|---|
| 共享抽象层压掉差异 | extrinsics 隐向量(RMA)、belief state(Miki)压掉动力学/地形差异 | 归一化路点(GNM)、image-goal 压掉机身/场景差异 |
| 特权→可部署的蒸馏 | teacher(scandots)→student(深度)(learning-quadrupedal-locomotion-challenging-terrain/extreme-parkour-legged-robots/robot-parkour-learning) | oracle 轨迹→DAgger non-oracle(NaVid/Uni-NaVid) |
| 分层解耦 + 双频 | 高层导航 5Hz + 低层运动 50Hz(anymal-parkour-agile-navigation) | VLM 低频命令 + RL 策略实时(NaVILA) |
| 免训练接现成大模型 | VLM 语义路由(helpful-doggybot) | BLIP-2 价值地图(VLFM)、Gemini 找帧(mobility-vla)、双 MLLM agent(Uni-LaViRA) |
| 自动/廉价标注放大数据 | 仿真程序化地形(全族) | VLM 打标(LeLaN)、VO 伪标签(CityWalker)、接管信号(LaND) |
| 扩散建模多模态动作 | —(运动线以 PPO 连续动作为主) | goal-masked 扩散(NoMaD)、锚点扩散(TrackVLA) |
| 单卡/边缘可复现 | 单 3090<20h(extreme-parkour-legged-robots)、单 3060Ti 1h(dreamwaq)、单 4090 20min(agile-but-safe-legged-locomotion) | 19M 上 Jetson Orin(NoMaD)、边缘 0.054s(LeLaN) |
几个反复被验证的具体工程结论也值得钉住:Isaac Gym / legged_gym / rsl_rl(learning-to-walk-in-minutes-massively-parallel-rl)是运动线事实标准仿真栈;RGB-only + 归一化路点(GNM 起)是导航跨机身的最小假设;PD 控制器 kp/kd + 50Hz 策略 + 200Hz+ 底层是四足部署的标准频率划分;动作离散化为语言/token 而非连续回归在多个 VLN 工作里被消融证明是”能否学会导航”的关键(NaVid 直接回归连续位姿 SR=0%)。
6. 家族走向
运动线已从”能走”迈向”敏捷+安全+带手”,几个明确方向:(1) 把跑酷/敏捷从纯移动扩到移动操作(Extreme Parkour、Deep WBC 均把此列为未来方向,helpful-doggybot/wildlma-loco-manipulation-in-the-wild 已起步);(2) 把外部感知端到端纳入网络而非依赖独立高程建图(Miki 自陈局限);(3) 安全保证从事后屏蔽(ABS)走向动态障碍/3D 地形。
导航线的分岔更戏剧化:一边是继续 scale 训练的 VLA 基础模型(NaVid→Uni-NaVid→NavFoM,轨迹规模从百万涨到千万,追”导航 scaling law”),一边是 Uni-LaViRA 代表的训练无关 agent——用结构性分解 + agent-loop(记忆、回退重规划)零训练打平甚至超过训练基础模型。后者的关键权衡是”用每次评测的边际推理成本替换训练的一次性固定成本”,且暴露了残留短板:长指令任务(RxR)仍落后训练 VLA、最强 backbone 闭源、大范围区域定位不如具体物体。
两条线的汇流仍在深化。 NaVILA 证明的”VLM 语言 waypoint + RL 运动策略”骨架正成为腿式/人形 VLN 的常见范式;TrackVLA++ 构建在导航基座 NavFoM 之上、又服务于跟踪任务,显示”导航基础模型”正在成为下游具身任务的通用底座。可以预期的共同前沿:统一操作+导航+跟踪的单一具身模型(Uni-NaVid、CrossFormer 均把”扩到操作”列为下一步),以及社交导航(把动态行人意图从反应式底层控制提升到语言规划层,Uni-LaViRA 自陈方向)。而运动线八年前奠定的”仿真训练、真机零样本”这一底层承诺,至今仍是整族两条河共同站立的地基。