足式运动与导航族:从盲走到跨具身导航基础模型

这一族横跨两条看似无关、实则同源的技术线:腿式运动的 sim-to-real 强化学习(怎么让一台仿真里练出来的机器人真的走过泥地/跳过沟/爬上箱)与移动机器人的导航基础模型(怎么让一个策略驱动任意机身、去任意目标)。两条线的共同敌人都是泛化——仿真到真实的动力学缺口、一台机器人到另一台机器人的形态缺口。它们各自的答案惊人地对称:运动线用**“特权信息蒸馏 / 在线系统辨识”把仿真里的地形/摩擦/负载差异压进一个低维隐向量,让只有本体感觉的策略”想象”出看不见的环境;导航线用”归一化路点 + 图像/语言目标”**把不同机身的速度/动力学差异压进一个具身无关的动作空间,让一个网络吃下多机器人异构数据。到 2024 年两条线经 NaVILA 正式汇流——高层 VLM 出语言级 waypoint、低层 RL 运动策略执行——并在 2026 年的 Uni-LaViRA 上被推到极致:导航被论证为”落在预训练 MLLM 自然输出流形内”的任务,可以零训练完成。本页把这 33 个工作放在一条时间轴上,抠出”谁在什么硬件上、用什么方法、把什么指标推到多少”。

涉及工作(slug 即单页文件名)


0. 两张总表(数字均引自对应单页,单页已对抗式核过)

0a. 腿式运动 sim-to-real 谱系

模型时间机构本体感知核心方法训练框架/规模关键数字(一手)
sim-to-real-agile-locomotion-quadruped2018-04GoogleMinitaur纯本体感觉(4维)执行器模型+延迟建模+动力学随机化PyBullet PPO,700万步学习步态比手调省电 23%(trot)/35%(gallop);trot 0.6m/s;训练 4.35h
learning-quadrupedal-locomotion-challenging-terrain2020-10ETH+IntelANYmal-B/C盲式(本体感觉)teacher-student + TCN + 粒子滤波地形课程RaiSim,teacher 12h+student 4h 单机DARPA SubT 4×60min 零失败;foot-trapping 16.8cm;板载 400Hz
rma-rapid-motor-adaptation2021-07Berkeley/CMU/FAIRUnitree A1盲式base policy + adaptation module 估 8维 extrinsics <1sRaiSim PPO,1 GPU 24h+3hsim success 73.5% vs Expert 76.2;π 100Hz/φ 10Hz;背 12kg
learning-to-walk-in-minutes-massively-parallel-rl2021-09ETH+NVIDIAANYmal C本体感觉+108高度点大规模并行 PPO + game 课程Isaac Gym,4096 env,单 RTX A6000平地 <4min、粗糙 <20min;开源 legged_gym/rsl_rl
walk-these-ways2022-12MITUnitree Go1本体感觉MoB gait-conditioned(8维行为参数)Isaac Gym PPO,4096 env,2.58B步单策略零样本上楼/钻杆/单跳 60cm 缺口;50Hz
deep-whole-body-control-loco-manipulation2022-10CMUGo1+WidowX(19DoF)本体感觉+AprilTagunified policy + Advantage Mixing + ROAIsaac Gym,5000 env,20亿样本EE error 比 RMA 低 20%;latent 误差 2e-4 vs RMA 0.31;硬件 6K 美元
dreamwaq2023-01KAISTUnitree A1盲式非对称 AC + CENet 隐式地形想象 + AdaBootIsaac Gym,4096 env,单 RTX 3060Ti 1h抗推 1.121m/s、存活 95.23%;户外走 430m/465m
neural-volumetric-memory-visual-locomotion2023-04UCSDUnitree A1前置深度相机SE(3) 等变体素记忆 + teacher-student 蒸馏图像观测约 1000fps(vs 高程图 4万)Stones success 14.4% vs 次高 2.2;真机 Stages 5.4m
anymal-parkour-agile-navigation2023-06ETHANYmal D6深度相机+LiDAR分层:多分辨率地形重建+5技能+混合PPO导航选择器Isaac Gym,4096 env,8 个网络导航 SR 98.2/96.3/97.6% vs manual;2m/s;感知延迟 250→25ms
extreme-parkour-legged-robots2023-09CMUUnitree A1前置深度 D435内积统一奖励 + 双重蒸馏(动作+yaw)Isaac Gym PPO,单 3090 <20hclimb 2×身高/gap 2×身长/37°坡/倒立;50Hz+10Hz
robot-parkour-learning2023-09上海期智/Stanford等A1/Go1深度 D435软/硬动力学两阶段 + DAgger 蒸馏Isaac Gym PPO,4096 env,每技能 3090 12h+6hsim climb 86/leap 80;真机爬 0.40m/跨 0.60m 沟
dtc-deep-tracking-control2023-09ETHANYmal本体感觉+落脚点+高度扫描线在线 TO(TAMOLS) 参考 + RL 跟踪,非对称 ACIsaac Gym,4096 env,2 周落脚误差 2.3cm;爬箱 0.48m(比 RL 基线高 50%);50Hz策略/400Hz TO
learning-robust-perceptive-locomotion-wild2022-01ETHANYmal C本体感觉+外感高度扫描belief encoder + 注意力门控(外感失效退化为盲走)RaiSim,teacher 1000 env/student 300 env阿尔卑斯 2.2km/78min 零跌倒;速度 1.2 vs 基线 0.6m/s;台阶 30.5cm
agile-but-safe-legged-locomotion2024-01CMU+ETHUnitree Go111 射线深度双策略 + HJ reach-avoid 安全屏蔽Isaac Gym,1280 env,单 4090 20min峰值 3.1m/s 无碰撞;碰撞率 5.7% vs 纯敏捷 21.7%
helpful-doggybot2024-09Stanford/UCSDGo2+咬合夹爪深度 D435 + VLMsim-only 控制 + 免训练 VLM 语义路由(Florence-2/SAM2)Isaac Gym,6144 env,单 4090 10h+6h未见房间取物首试 60%;爬床 44cm;零真实数据
wildlma-loco-manipulation-in-the-wild2024-11UCSDUnitree B1+Z1RGBD + CLIP全身遥操作 + MaskCLIP-ACT + LLM 分层规划模仿学习,每技能 30-60 条示范技能均值 71.2%(O.O.D. 泛化);长程 7/10;采集省 26.9%

0b. 导航基础模型 & VLN 谱系

模型时间机构任务骨干参数训练数据目标模态关键数字(一手)
land-learning-to-navigate-from-disengagements2020-10Berkeley人行道导航MobileNetV2+LSTM+MPC17.4km 真机无(MPC 规划)接管前 87.5m vs BC 13.4m(6.5×)
gnm-general-navigation-model2022-10Berkeley/Toyota跨具身 image-goal双 MobileNetv2~8.7M~60h/6 机身图像目标LoCoBot 0.96/Tello 0.99;归一化路点+具身上下文
vint-foundation-model-visual-navigation2023-06Berkeleyimage-goal 基础模型EfficientNet + 4层 Transformer31M~80h/8 机身图像目标Go1 零样本 45m;公里级 1270m;8×V100 30h
nomad-goal-masked-diffusion-navigation2023-10Berkeley导航+探索统一ViNT 编码 + 扩散动作头19M>100h图像目标/无目标探索 98% vs SOTA 77%,小 15×;ICRA24 best paper
vlfm-vision-language-frontier-maps2023-12Boston Dynamics AI/GTObjectNav 零样本BLIP-2 价值地图 + frontier免训练仅 PointNav 子策略物体类别HM3D 30.4 SPL(超监督法);Spot 部署;ICRA24 best cognitive
viplanner-visual-semantic-local-navigation2023-10ETH/NVIDIA局部规划双 ResNet-18 + Imperative Learning~80k sim 起止对度量目标点语义可通行代价 -38% vs iPlanner;单 3090 6h;10Hz
navid-video-vlm-vln2024-02PKU/BAAI/GalbotVLN-CELLaMA-VID 视频 VLM(Vicuna-7B)7B510k+763k自由语言R2R SR 37.4(仅 RGB);24×A100 28h;真机 66%
citynav-aerial-vln2024-06日本多机构空中 VLN 数据集Seq2Seq/CMA/AerialVLN+GSM32637 轨迹真实城市语言+地标AerialVLN+GSM 6.72% vs 人类 88%;单 4090
crossformer-cross-embodied-learning2024-08Berkeley/CMU4 类具身统一12 层 Transformer130M900K 轨迹/20 具身语言/图像平均 73% vs 专用 51%;TPU v5e-256;CoRL24 Oral
mobility-vla2024-07Google DeepMindMINT 多模态导航Gemini 1.5 Pro + 拓扑图零训练导览视频语言+图像端到端 86/90%(复杂/多模态);免梯度更新
lelan-language-conditioned-navigation-in-the-wild2024-10Berkeley/Toyota语言 last-mileResNet-FiLM+EffNet-B0轻量>130h 自动标注语言89% 成功;边缘 0.054s(快 4×);VLM 全自动打标
navila-legged-robot-vla-navigation2024-12UCSD/USC/NVIDIA腿式 VLNSigLIP+Llama3-8B + RL locomotion8B真人视频+仿真+VQA语言(中层语言动作R2R SR 54.0(+17 vs NaVid);真机 88%;RSS25
uni-navid-video-vla-navigation2024-12PKU/Galbot/BAAI4 nav 任务统一Vicuna-7B + 在线 token 合并7B3.6M+2.3M自由语言R2R SR 47.0;40×H800 35h;~5Hz
trackvla-embodied-visual-tracking2025-05PKU/Galbot/BAAI具身视觉跟踪EVA-CLIP+Vicuna-7B + 锚点扩散头7B170 万样本语言(外观描述)EVT-Bench STT 85.1;24×H100 15h;真机 10FPS
trackvla-plus-plus2025-10PKU 等具身视觉跟踪NavFoM+Qwen2-7B + Polar-CoT+TIM7B200 万样本语言DT 四视角 74.0(+12);8×H100 1天;4.8FPS
uni-lavira-unified-embodied-navigation2026-05南大/自动化所等4 任务 4 机身统一Gemini-3.1 + Qwen3.5 双 MLLM零训练零轨迹语言/图像R2R 60.7/ObjectNav 77.7%;GPU 训练 = 0

口径提醒:运动线普遍只报仿真成功率 + 真机定性/竞赛级部署(DARPA SubT、阿尔卑斯徒步),几乎不做统一 benchmark;导航线的 VLN-CE(R2R/RxR)、ObjectNav(HM3D/MP3D)是仅有的横向可比 leaderboard,但各家输入(RGB-only vs RGBD+里程计)、动作空间(低层 vs 高层 waypoint)口径不一,跨表比较需谨慎。


1. 一条谱系,两个源头,2024 年汇流

这一族真正的技术脉络不是一棵树,而是两条平行河在末端并流。

运动河的源头sim-to-real-agile-locomotion-quadruped(Google,2018)。它奠定了此后八年几乎所有腿式 sim-to-real 工作的三件套模板:物理级执行器建模(把 Bullet 默认 PD 换成直流电机动力学 + 分段线性力矩饱和)、控制回路延迟建模(实测 15–19ms 建进仿真)、动力学随机化(质量/摩擦/电机强度/延迟/电压逐 episode 采样)。它在 Minitaur 上零样本迁移出比工程师手调更省电的步态,证明”仿真训练、真机零微调”可行。此后 learning-quadrupedal-locomotion-challenging-terrain(ETH,2020)、rma-rapid-motor-adaptation(Berkeley,2021)把它推向复杂地形,learning-to-walk-in-minutes-massively-parallel-rl(ETH,2021)把它推向单卡分钟级训练。

导航河的源头land-learning-to-navigate-from-disengagements(Berkeley,2020)——它把”人类安全员接管”这一测试副产品当唯一监督信号,用一个卷积-循环网络预测未来接管概率再做 MPC 规划。它与同实验室的 BADGR 共享”动作条件模型 + 采样式 MPC”骨架,是后来 GNMViNTNoMaD 这条”图像目标 + 归一化路点”导航基础模型线的方法论前身。

两条河的汇流点是 NaVILA(2024):它把 VLN 的”高层语言推理”接到腿式 RL 的”低层运动控制”上——上层一个 8B VLM 把 RGB 视频翻译成中层语言动作(“move forward 75cm”),下层一个 LiDAR 视觉 locomotion RL 策略(继承自 Rudin 那条 Isaac Lab 单阶段 PPO 线)把它执行成腿关节动作。这是本族第一次让”导航基础模型”和”运动 sim-to-real”在同一个系统里各司其职、双频协作。

2. 腿式运动 sim-to-real:从盲走到跑酷

2.1 奠基三件套 + 两把钥匙:特权蒸馏与大规模并行(2018–2021)

2018 的三件套解决了”动力学缺口”,但复杂地形还需两把新钥匙。

第一把:特权信息蒸馏(teacher-student)。 learning-quadrupedal-locomotion-challenging-terrain 的洞察是——直接对崎岖地形做 model-free RL 会因监督信号稀疏而学不动,于是拆成两阶段:teacher 在仿真里可见特权信息(71 维地形法向/高度扫描/接触力/摩擦,噪声无关)快速学到高性能,再蒸馏成一个只用本体感觉的 student。student 用 TCN(时间卷积网络) 从 2 秒本体感觉历史里隐式恢复地形隐向量,配粒子滤波自动地形课程维持”中等可通过性”的训练分布。结果是一个纯本体感觉的盲式控制器在 DARPA SubT 竞赛 4×60min 任务零失败,且涌现出 foot-trapping 反射(跨 16.8cm 台阶)。这套”privileged learning + proprioceptive sequence model + adaptive curriculum”成为后续几乎所有工作的地基。

RMA 的分叉。 rma-rapid-motor-adaptation 是 Lee et al. 的孪生工作,但在”student 用什么、何时适应”上分道扬镳。它的 adaptation module φ 只用最近 0.5s 单条本体感觉历史,在不到 1 秒内在线估出一个 8 维环境 extrinsics ẑ——关键洞察是不必辨识真实物理参数 e,只需直接估 extrinsics z(“如何改变行为来纠偏”的低维投影),绕开可辨识性歧义。φ 类比 Kalman 滤波器,π(100Hz)与 φ(10Hz)异步双频部署。它把适应时间从分钟级(同期 AWR 需 4-8 分钟真机 rollout)压到 <1s,让 Unitree A1 完全仿真训练就零样本走过沙/泥/油面并背 12kg(100% 自重)。这套”直接估 extrinsics + 异步双频”被后续大量工作沿用为标准配方。

第二把:大规模并行 RL。 learning-to-walk-in-minutes-massively-parallel-rlRMA/Lee 的”12h/单机”训练拉到单 RTX A6000 上 4 分钟(平地)/20 分钟(粗糙)。核心是把仿真吞吐从 CPU 多进程搬到 Isaac Gym 的 GPU 上万并行,并在”数千机器人”新 regime 下重调 PPO——小 nsteps(≈25 步下限)、超大 mini-batch、time-out bootstrapping(+10-20% 奖励)、game-inspired 零调参课程。它开源的 legged_gym + rsl_rl 成为整个具身运动学习领域被反复 fork 的事实基线——walk-these-waysdreamwaqdtc-deep-tracking-controlextreme-parkour-legged-robotsrobot-parkour-learningagile-but-safe-legged-locomotion 全部构建其上。

2.2 感知融合与本体感觉的两条路(2022–2023)

盲式控制器只能”先踩后判断”,速度与越障天然受限。如何引入外部感知(exteroception)分出两条路。

融合外感、但学会何时不信它。 learning-robust-perceptive-locomotion-wildlearning-quadrupedal-locomotion-challenging-terrain 框架上加了个带注意力门控的 GRU belief encoder:外感高度扫描可信时通过 skip connection 放行、加速通过;外感失效(雪/水/反光/位姿漂移)时门关闭、无缝退化为纯本体感觉盲走。训练时对高度采样按 60%/30%/10% 概率注入 nominal/offset/noisy 三档噪声。结果是阿尔卑斯 2.2km 环线 78 分钟零跌倒、速度 1.2m/s(盲式基线 0.6)、可靠翻越 30.5cm 台阶。这套”用可学习门控替代启发式规则决定信不信外感”是感知式运动的关键突破。

继续深挖纯本体感觉。 反方向上,dreamwaq(KAIST)证明零视觉/LiDAR 也能走山地:用非对称 actor-critic 一次性联合训练(actor 只看本体历史,critic 看含高度图的特权状态),让 actor-critic 博弈本身逼策略隐式”想象”地形;配 CENet(共享编码器 + 速度估计头 + β-VAE 上下文头联合学正/反向动力学)与 AdaBoot(用 reward 变异系数自适应决定何时信任估计器)。单 RTX 3060Ti 训 1 小时,抗推速度 1.121m/s、户外连走 430m/465m。它把”非对称 AC 隐式想象、单阶段联合训练”确立为纯本体感觉的一条可行路线,区别于显式两阶段蒸馏。

几何显式化。 neural-volumetric-memory-visual-locomotion(UCSD)指出主流”帧堆叠”忽略了 3D 世界的等变结构——策略被迫额外学会消解相机运动带来的伪变化。它把近期几帧深度各自编成 3D 特征体素,用位姿网络估计的 SE(3) 变换对齐回当前自身坐标系再融合,取代帧堆叠。在需要精确落脚点推断的 Stones 地形上 success 14.4% vs 次高 2.2(6.5×)。

RL 与轨迹优化的联姻。 dtc-deep-tracking-control(ETH)走了第三条路:让在线模型驱动轨迹优化器 TAMOLS(400Hz)滚动生成参考落脚点/身体轨迹,一个纯 MLP 的 RL 策略(50Hz)去跟踪它——兼得 TO 的精确落脚(平地误差 2.3cm)与 RL 的鲁棒恢复。关键工程是 TO 只在触地时重算(省 23× 算力),且观测只暴露”对规划器选择不敏感”的落脚点子集,使同一策略能零样本换 TAMOLS 或非线性 MPC 两种规划器。它在垫脚石、缝隙这类”落脚点稀疏”地形上远超纯 RL 基线(0.1m 缝隙 100% vs 基线无法跨越)。

2.3 跑酷双雄 + 分层派 + 安全派(2023–2024)

2023 年三篇并行工作把”学习驱动的机器人跑酷”推到新高度,路线各异。

维度extreme-parkour-legged-robotsrobot-parkour-learninganymal-parkour-agile-navigation
机构/本体CMU / Unitree A1上海期智等 / A1·Go1ETH / ANYmal D
策略结构单一端到端网络5 专家 → 蒸馏成单一视觉策略分层:感知重建+5技能+导航选择器
核心招数内积统一奖励 + 双重蒸馏(动作+yaw)软动力学预训练(障碍可穿透)+ 硬动力学微调多分辨率地形重建 + 混合 PPO(Gaussian+categorical)
特权→部署scandots + ROA → convnet-GRU + 深度障碍抽象 e_vis → CNN+GRU + 深度点云重建 belief 隐向量 → 深度+LiDAR
感知前置 D435(10Hz)前置 D435(48×64,10Hz)6 深度相机 + LiDAR
招牌能力climb 2×身高/gap 2×身长/37°坡/倒立爬 0.40m/跨 0.60m/匍匐/侧倾/奔跑2m/s 敏捷导航、自主选技能与路径
训练成本单 3090 <20h每技能 3090 12h+6h(蒸馏 4 机)Isaac Gym 4096 env,8 网络

三者的哲学分歧很清楚:extreme-parkour-legged-robots 赌”更简单”——用能泛化到任意几何的 scandots 特权信息 + 一条通用内积奖励让跳/爬/倒立自然涌现,还首创”让策略自主决定朝向 yaw”(对极长跳,几度朝向误差就失败);robot-parkour-learning直接配点法的软约束思想搬进 RL——让障碍在预训练阶段可穿透以绕开难探索局部最优;anymal-parkour-agile-navigation 反其道坚持技能分离 + 高层选择器,理由是不同障碍所需动作模式差异极大、拆开更好调参,且导航层能显式建模每个技能的能力边界(箱子太高就绕路)。

安全派。 agile-but-safe-legged-locomotion(CMU+ETH)打破”敏捷 vs 安全”的两难:一个 goal-reaching RL 策略跑到极限速度,一个基于 Hamilton-Jacobi reach-avoid 价值网络实时判危、超阈值就切到恢复策略兜底。它在 Unitree Go1 上实现峰值 3.1m/s 无碰撞(碰撞率 5.7% vs 纯敏捷策略 21.7%),且量化证明”敏捷-安全权衡边界”客观存在、外部 RA 屏蔽能整体突破它。

2.4 步态参数化与 loco-manipulation:把”手”接上腿

可控步态。 walk-these-ways(MIT)不追极限,而是把”同一任务的多种解”用 8 维行为参数(步态相位/频率/身高/俯仰/站宽/抬脚高度)显式编码进单个 gait-conditioned 策略(MoB, Multiplicity of Behavior)——部署时人手实时旋旋钮,一个只训过平地的策略就能零样本上楼/钻 22cm 杆/抗推/穿灌木/单跳 60cm 缺口/跳舞。它把”OOD 泛化”从”重训一个策略”变成”实时选解”,其开源 Go1 控制器成为四足 sim-to-real 社区的强 baseline。

腿臂协同。 deep-whole-body-control-loco-manipulation(CMU)用单个 MLP 策略同时输出腿+臂全部关节目标(19 DoF),而非行业惯例的”腿臂分层”。两个方法创新:Advantage Mixing(用因果结构分解优势函数,诱导”先各自学会、再融合协同”的隐式课程)与 Regularized Online Adaptation(RMA 的正则化推广,去掉两阶段串行,latent 模仿误差比 RMA 低 3 个数量级)。硬件仅 6K 美元(Go1+WidowX),统一策略让腿的弯伸把臂工作空间扩大 40%。

接上语义。 到 2024 年,loco-manipulation 开始借 VLM 打开放世界:helpful-doggybot(Stanford/UCSD)给 Go2 装 1 自由度咬合夹爪,下层运动完全 sim-only 练成、上层语义完全交给免训练 VLM(Florence-2 检测 + SAM2 跟踪 + PID 目标点),在未见房间爬床/沙发叼玩具首试 60%,全程零真实数据;wildlma-loco-manipulation-in-the-wild(UCSD)把 VBC 的全身控制器挪到遥操作数据采集场景(示范成本降 26.9%),用 MaskCLIP 条件的 ACT 学原子技能(每技能 30-60 条示范),再用 LLM 分层规划编排长程任务(收垃圾 7/10)。

3. 导航基础模型 & VLN:从 image-goal 到语言 agent

3.1 BAIR 三部曲:跨具身 image-goal omnipolicy(2022–2023)

导航线真正成”基础模型”是 Berkeley(Levine 组)的三部曲,共享同一份 visualnav-transformer 代码库。

维度gnm-general-navigation-modelvint-foundation-model-visual-navigationnomad-goal-masked-diffusion-navigation
时间/参数2022 / ~8.7M2023 / 31M2023 / 19M
骨干双 MobileNetv2 CNNEfficientNet-B0 ×2 + 4层 TransformerViNT 编码 + 1D 条件 U-Net 扩散头
数据~60h / 6 机身~80h / 8 机身>100h(GNM+SACSoN)
关键机制归一化路点 + 具身上下文(连续过去帧)goal-fusion 编码器(通道拼接) + prompt-tuninggoal masking(二值掩码切换定向/探索)
任务image-goalimage-goal + GPS/指令适配定向导航 + 无目标探索(统一)
招牌数字LoCoBot 0.96/Tello 0.99(含未见机身)Go1 零样本 45m;GPS 公里级 1270m探索 98% vs SOTA 77%(小 15×)

核心抽象是”归一化路点 + 图像目标”。 GNM 的两处小改动定义了整族:(1) 归一化动作空间——不同机器人速度跨度 0.2-10m/s,用与最高速相关的机器人特定 α 把路点拉平成具身无关的抽象;(2) 具身上下文——用连续过去 5 帧自动推断一个学习到的机身表征,无需手工机器人参数。image-goal 作为预训练目标的选择是关键:目标由”在目标处会看到的那张图”指定,不需要真值定位/语义/metadata,任何”有视频+有动作”的数据都能拿来训。

ViNT 把它做成高容量基础模型:Transformer 骨干、31M 参数、支持零样本跨机身(Go1 训练集完全没有仍能控制)、prompt-tuning 适配 GPS/指令、1 小时数据微调到 CARLA 自动驾驶(完全 OOD)。它观察到正迁移——在分布内机器人上也超过只用该机器人数据训的专家,作者视之为”基础模型”的标志。NoMaD 则把 ViNT 的探索外挂(335M 图像扩散子目标)换成一个 goal-masked 扩散动作头——用一个二值掩码决定策略是否”看见”目标 token,从而在定向导航与无目标探索间无缝切换,把两件事塞进 19M 单模型、可跑在 Jetson Orin 边缘。它继承 Diffusion Policy 的”动作去噪”范式,获 ICRA 2024 最佳论文。

3.2 网络视频与自动标注:把数据从遥操作放大到万小时(2024)

三部曲的数据靠遥操作,规模受限。2024 年的关键突破是用现成基础模型全自动给在野视频打动作标签

LeLaN(Berkeley/Toyota)组合 SAM 分割 + CogVLM 描述 + GPT-3.5 生成指令 + 单目深度 + NoMaD 生成反事实动作,给 YouTube 房屋/城市游览等无标签视频打上语言+动作标签(>130h),训出轻量策略聚焦”最后一米导航”,边缘推理 0.054s(比最快基线快 4×)。CityWalker(NYU)更激进——只用视觉里程计 DPVO 从 2000 小时城市步行/驾驶视频抠相对位姿当动作伪标签(不用任何 VLM/人工),沿用 GNM 的路点归一化处理尺度歧义,214M 的 DINOv2+Transformer 在真机城市部署 77.3%,超过 ViNT/NoMaD 含微调版。这条”网络规模视频 + 廉价自动标注”线证明了噪声伪标签”够用”。

跨具身推到极致的是 CrossFormer(Berkeley/CMU):不做任何观测/动作空间人工对齐,用一套 130M Transformer 权重在 900K 轨迹、20 种具身(单臂/双臂/轮式导航/四足关节级)上联合训练,真机平均 73%(打平各具身专用 SOTA 51% 与只用目标数据的同架构基线 68%),还零样本迁移到四旋翼。它首次把腿足 12 维关节动作(而非高层 2D waypoint)纳入跨具身联合训练,与操作族的 Octo/Gato/RoboCat 同谱系。

3.3 零样本语义导航:不训练策略,只接 VLM(2023)

另一条线彻底放弃训练导航策略,把预训练模型接进经典框架。VLFM(Boston Dynamics AI)用深度建占据栅格找前沿,同时用冻结 BLIP-2 直接对 RGB 算”这图和 Seems like there is a <target> ahead. 有多像”,铺成一张语言接地的价值地图——省掉”检测器把画面转成物体列表”这道信息瓶颈。零训练在 Gibson/HM3D/MP3D 刷新零样本 SOTA(HM3D 30.4 SPL),甚至超过专门训练的监督法,并部署到 Spot。ViPlanner(ETH/NVIDIA)则用 Imperative Learning(双层优化:网络权重 + 可微轨迹优化器联合端到端)训一个语义感知局部规划器,把 30 类语义按可通行性编码进 RGB 色彩空间,纯仿真训练零样本部署 ANYmal,能正确识别”楼梯几何上是障碍、实际可通行”(纯几何 iPlanner 结构性做不到)。

3.4 VLM 进入 VLN:视频 VLM 与”语言中层动作”(2024)

VLN(跟随自由语言指令导航未见环境)在 2024 年被 VLM 重塑。

维度navid-video-vlm-vlnuni-navid-video-vla-navigationnavila-legged-robot-vla-navigationmobility-vla
机构PKU/BAAI/GalbotPKU/Galbot/BAAIUCSD/USC/NVIDIAGoogle DeepMind
骨干LLaMA-VID(Vicuna-7B)Vicuna-7BSigLIP+Llama3-8BGemini 1.5 Pro(零训练)
输入单目 RGB 视频单目 RGB 视频单目 RGB 视频导览视频 + 全帧
任务范围VLN-CEVLN+ObjNav+EQA+跟随腿式 VLNMINT(多模态指令)
动作离散动作+量化参数(语言)4 步离散动作 token中层语言动作+RL执行目标帧索引→拓扑图 Dijkstra
数据510k+763k3.6M+2.3M真人视频+仿真+VQA无(免训练)
R2R SR37.447.054.0—(MINT 86%)
推理1.2-1.5s/动作~0.2s(在线 token 合并,5Hz)0.6s(W4A16 量化)高层 10-30s

NaVid 是第一个把视频 VLM 用于 VLN-CE:只吃单目 RGB 在线视频流,端到端输出带量化参数的低层动作(前进 d cm/转 x 度),全程不用地图/里程计/深度,从建模上消除这些模态的 sim-to-real 域差。关键改造是历史/当前帧差异化 token 编码(当前帧 64 token、历史帧各 4 token)。Uni-NaVid 把它扩成统一四种导航任务,并用”当前/短期/长期”三级 token 分级合并把单次推理稳到 ~0.2s。

NaVILA 的”语言中层动作”是本族最重要的架构分歧点。RT-2/OpenVLA 这类”VLM 直接吐量化低层动作”不同,NaVILA 主张 LLM 本就在自然语言上训练,把推理硬压成精确非语言动作会牺牲推理力,因此把动作留在语言域(“move forward 75cm”),再交给专门运动策略落地。这带来三重好处:换低层策略即换机身(Go2/H1/G1/T1)、训练能吃真人视频/QA 异构数据、大 VLM 低频出命令+运动策略实时跑的双频设计。R2R SR 54.0(首个单目 RGB 追平多传感器+waypoint 方法),真机 88%。

Mobility-VLA 的零训练组合是另一极。 它完全不训练任何网络:上层让 Gemini 1.5 Pro 的百万 token 上下文”看”一段人走过的导览视频、直接指出目标帧号;下层用经典 COLMAP 建拓扑图 + Dijkstra + iLQR-MPC 把目标帧转成动作。RQ3 证明直接让 VLM 输出路点动作 SR=0%(分布外),而”目标帧+拓扑图”SR=90%——把 VLM 限定在其训练分布内最擅长的任务(长视频里找一帧)、把度量动作完全交给经典 SLAM

3.5 空中 VLN 与具身视觉跟踪(2024–2025)

任务边界继续外扩。 CityNav(日本多机构)把 VLN 搬到真实城市 3D 扫描(剑桥+伯明翰 SensatUrban),32637 条人类无人机飞行轨迹,提出把 OpenStreetMap 地标编成”地理语义地图 GSM”喂给基线——但即便如此 test-unseen SR 仅 6.72%,离人类 88% 仍是数量级差距,说明空中 VLN 远未解决。

具身视觉跟踪(EVT) 是 PKU-EPIC 系的新战场。TrackVLA 把”识别”和”规划”塞进同一个 Vicuna-7B 主干的单次前向——识别走语言建模头、跟踪走锚点扩散动作头(先 K-means 聚 40 条轨迹锚点,只加噪去噪 2 步 DDIM,比 vanilla diffusion policy 快 5×),靠一个 [Track] token 在解码阶段分叉。真机 Go2 上 10FPS,遮挡/高速场景优于同价位商用跟踪无人机。TrackVLA++ 在导航基座 NavFoM 上补两块短板:Polar-CoT(把空间推理压成”一个 token”的极坐标角度×距离网格 + <invalid> 标记)与 TIM(用 reasoning token 归一化熵做置信度门控的目标身份记忆),在严重遮挡+外观相似干扰下把 DT 四视角 SR 从 62.0 提到 74.0。

4. 汇流:分层解耦成为共识,训练无关成为可能

到 2024–2026,两条河的汇流已成范式共识:高层语义/规划(VLM 或经典 SLAM)+ 低层控制(RL 运动策略或几何控制器)的分层解耦。 这个模式在多处独立涌现——NaVILA 的”VLM 语言 waypoint + RL locomotion”、Mobility-VLA 的”VLM 找帧 + 拓扑图控制”、Helpful DoggyBot 的”免训练 VLM 语义路由 + sim-only 运动”、WildLMa 的”LLM 规划 + CLIP-ACT 技能 + VBC 全身控制”、ANYmal Parkour 的”导航选择器 + 技能库”。

Uni-LaViRA(2026)把这条线推到逻辑终点:训练无关(training-free)。 它提出结构性论证——一个具身任务能否免训练,看它的动作空间是否落在预训练 MLLM 的”自然输出流形”内。灵巧操作的连续关节力矩/接触力序列 MLLM 很少见过,必须端到端学;而导航本质是非接触的空间决策,可完全化约成离散方向语言 + 像素坐标,两者都是 MLLM 预训练反复产出的表示。于是两个通用 MLLM(Gemini-3.1 做语言动作、Qwen3.5 做视觉定位)零样本跑通 VLN-CE/ObjectNav/EQA/Aerial-VLN 四大任务和轮式/四足/人形/无人机四种机身,配 TODO List Memory(防长指令注意力漂移)和 Second Chance Backtrack(带失败证据的回退重规划)。R2R 60.7%/ObjectNav 77.7%/EQA 54.7%,GPU 训练 = 0——在 HM3D/EQA/OVON/OpenUAV 四个基准上零训练超过消耗千卡时、百万级轨迹训练的导航基础模型(NavFoM 训练约 4032 H100-hours)。这与 3.4/3.5 节那条”堆数据训 VLA 基础模型”的 scaling 路线(NaVidUni-NaVid,轨迹从 51 万涨到 360 万)形成了明确的路线对立。

5. 贯穿全族的设计模式

把 33 个工作叠在一起,能抽出几条反复出现的”元招式”:

模式运动线的体现导航线的体现
共享抽象层压掉差异extrinsics 隐向量(RMA)、belief state(Miki)压掉动力学/地形差异归一化路点(GNM)、image-goal 压掉机身/场景差异
特权→可部署的蒸馏teacher(scandots)→student(深度)(learning-quadrupedal-locomotion-challenging-terrain/extreme-parkour-legged-robots/robot-parkour-learningoracle 轨迹→DAgger non-oracle(NaVid/Uni-NaVid
分层解耦 + 双频高层导航 5Hz + 低层运动 50Hz(anymal-parkour-agile-navigationVLM 低频命令 + RL 策略实时(NaVILA
免训练接现成大模型VLM 语义路由(helpful-doggybotBLIP-2 价值地图(VLFM)、Gemini 找帧(mobility-vla)、双 MLLM agent(Uni-LaViRA
自动/廉价标注放大数据仿真程序化地形(全族)VLM 打标(LeLaN)、VO 伪标签(CityWalker)、接管信号(LaND
扩散建模多模态动作—(运动线以 PPO 连续动作为主)goal-masked 扩散(NoMaD)、锚点扩散(TrackVLA
单卡/边缘可复现单 3090<20h(extreme-parkour-legged-robots)、单 3060Ti 1h(dreamwaq)、单 4090 20min(agile-but-safe-legged-locomotion19M 上 Jetson Orin(NoMaD)、边缘 0.054s(LeLaN

几个反复被验证的具体工程结论也值得钉住:Isaac Gym / legged_gym / rsl_rllearning-to-walk-in-minutes-massively-parallel-rl)是运动线事实标准仿真栈;RGB-only + 归一化路点(GNM 起)是导航跨机身的最小假设;PD 控制器 kp/kd + 50Hz 策略 + 200Hz+ 底层是四足部署的标准频率划分;动作离散化为语言/token 而非连续回归在多个 VLN 工作里被消融证明是”能否学会导航”的关键(NaVid 直接回归连续位姿 SR=0%)。

6. 家族走向

运动线已从”能走”迈向”敏捷+安全+带手”,几个明确方向:(1) 把跑酷/敏捷从纯移动扩到移动操作Extreme ParkourDeep WBC 均把此列为未来方向,helpful-doggybot/wildlma-loco-manipulation-in-the-wild 已起步);(2) 把外部感知端到端纳入网络而非依赖独立高程建图(Miki 自陈局限);(3) 安全保证从事后屏蔽(ABS)走向动态障碍/3D 地形。

导航线的分岔更戏剧化:一边是继续 scale 训练的 VLA 基础模型(NaVid→Uni-NaVid→NavFoM,轨迹规模从百万涨到千万,追”导航 scaling law”),一边是 Uni-LaViRA 代表的训练无关 agent——用结构性分解 + agent-loop(记忆、回退重规划)零训练打平甚至超过训练基础模型。后者的关键权衡是”用每次评测的边际推理成本替换训练的一次性固定成本”,且暴露了残留短板:长指令任务(RxR)仍落后训练 VLA、最强 backbone 闭源、大范围区域定位不如具体物体。

两条线的汇流仍在深化。 NaVILA 证明的”VLM 语言 waypoint + RL 运动策略”骨架正成为腿式/人形 VLN 的常见范式;TrackVLA++ 构建在导航基座 NavFoM 之上、又服务于跟踪任务,显示”导航基础模型”正在成为下游具身任务的通用底座。可以预期的共同前沿:统一操作+导航+跟踪的单一具身模型Uni-NaVidCrossFormer 均把”扩到操作”列为下一步),以及社交导航(把动态行人意图从反应式底层控制提升到语言规划层,Uni-LaViRA 自陈方向)。而运动线八年前奠定的”仿真训练、真机零样本”这一底层承诺,至今仍是整族两条河共同站立的地基。