一句话定位
Berkeley BAIR 提出的 LaND:把自动驾驶/移动机器人测试中人类安全员的”接管”(disengagement)事件本身当成唯一监督信号,训练一个以图像+未来动作序列为输入、预测未来接管概率的卷积-循环网络,再用该模型做模型预测控制(MPC)规划避免接管的动作——不需要手写奖励函数、不需要高精地图、不需要额外标注,接管数据是测试自动驾驶系统时本就在产生的免费副产品。
背景与定位
论文瞄准的痛点是行业惯例:“接管次数/里程”(disengagement rate)长期只被当作调试自动驾驶系统的诊断指标(如加州 DMV 的自动驾驶接管报告),出了问题就靠工程师去猜测、改模型、试错修复——对学习式模块而言这个修复循环尤其昂贵和不可控。作者的转向是把接管信号从”调试用的副产品”提升为”直接的强化学习监督信号”:接管发生的时刻和位置本身定义了失败,模型只需学会规避会导致接管的动作序列,就等价于学会了任务本身,且不需要知道任务是什么(对比标准 RL 需要手工设计 reward)。
方法定位在三条已有范式之间做区分:
- 传统地图定位规划范式(建图-定位-路径规划)在恶劣天气、场景变化、无法从经验学习等问题上长期受限;
- 直接学导航线索(深度/物体检测/道路分割)的监督学习方法标注成本高,多标注未必带来性能提升;
- 模仿学习(behavioral cloning、conditional imitation learning 等)多在视觉简单场景(车道保持、走廊、赛道)验证,需要向专家策略注入噪声来覆盖状态分布,且普遍丢弃接管数据不用。
LaND 把自己归为从机器人自身经验直接学习的强化学习一支,但相比同类方法(Riedmiller et al. 2007、Kendall et al. “Learning to drive in a day” 2019 等)不假设灾难性失败可接受、不需要访问安全控制器、不需要同一片区域反复走多次、不需要 on-policy 数据、且在训练时从未见过的真实场景中评测。论文与作者同一系列的 BADGR(Kahn, Abbeel, Levine, arXiv:2002.05700)共用同一套零阶随机优化 MPC 规划器(超参数直接沿用),LaND 可视为把 BADGR 的自监督导航框架换成”接管信号”这一更简单、天然免费的监督来源。后续 Berkeley 同一实验室脉络的视觉导航基础模型(如 ViNT、GNM、NoMaD 等)延续了”动作条件模型 + 目标导向 MPC/采样规划”的思路,但转向了跨机器人形态的大规模预训练,LaND 是这条谱系里更早、聚焦单一机器人平台和单一监督来源的工作。
模型架构
LaND 的核心是一个图像输入、动作条件的卷积-循环网络,预测未来 H 步的接管概率序列,记为 fθ(ot, at:t+H) → d̂t:t+H:
- 视觉编码器:MobileNetV2 处理当前观测图像 ot(96×192 RGB,来自前向 170° 视场角单目相机),后接若干全连接层;
- 时序解码:图像分支的输出作为 LSTM 的初始隐状态,LSTM 逐步接收未来 H 个候选动作 at+h(航向变化 / 转向角),依次输出对应的预测接管概率 d̂t+h;
- 动作/控制接口:机器人平台为 Clearpath Jackal 地面机器人,动作 a 为期望航向变化量(steering angle 语义),接管信号 d 为二值(0/1),由跟随机器人的人类安全员通过遥控给出;
- 规划/控制:用零阶随机优化器(沿用 Nagabandi et al., CoRL 2019 的方法,warm-start + soft update + 考虑时间步相关性,比 random shooting / CEM 更强)在线求解代价函数 C(d̂t:t+H, at:t+H) = Σ_h [d̂t+h + α·‖at+h − g‖²],其中第一项压低接管概率、第二项(权重 α,实验中因无岔路口而设 α=0)鼓励朝目标航向 g 前进;求解后按 MPC 范式只执行第一步动作,每步重新规划;规划器超参数 N=8192、σ=1、β=0.5、γ=50(与 BADGR 论文一致)。
- 训练目标是最小化预测接管概率与真实接管标签之间的交叉熵损失(Eq. 1),构成整个网络唯一的监督来源,无手工奖励、无地图、无额外传感器标注需求。
数据
- 规模:17.4 km 人行道行驶里程,累计 6 小时数据采集;按每行驶 Δx=0.5 米采样一个数据点,得到 34,800 个数据点,其中 1,926 个为接管事件(约 5.5% 正样本比例)。
- 来源:数据完全来自”用一个自主控制策略(可以是 LaND 自身或对比方法)跑机器人 + 人类安全员监控 + 触发接管即人工复位”这一测试流程本身产生的副产品,不额外采集或标注。
- 接管类型(Fig. 4 定义了三类失败模式触发接管):碰撞障碍物、驶入机动车道(street)、驶入私家车道(driveway)。
- 训练时的类别再平衡:每个 minibatch 强制一半序列以接管结尾、另一半不含接管,防止稀有的接管样本被淹没;若采样时间点 t 距接管不足 H 步,用”随机采样的动作 + 额外接管标签”填充序列到长度 H(假设一旦接管、后续任意动作都维持接管状态),既保证训练样本聚焦在接管附近,也让训练分布匹配规划时”总是规划 H 步”的推理分布。
- 评测数据切分:训练用的 17.4 km 与评测用的 2.3 km 从未见过的人行道(Fig. 1)完全不重叠;持续学习实验中另用 1.3 km 从未见过的人行道做二次数据采集 + 微调评测。
- 无仿真数据:全程真实世界采集与评测,无 sim-to-real 环节。
训练方法
- LaND 采用数据采集-模型训练交替迭代的在线闭环流程(Algorithm 1):机器人按当前规划策略执行动作 → 若安全员判定失败则触发接管、人工复位并重新使能自主模式 → 观测/动作/接管标签持续写入数据集 D → 用 D 训练/微调预测模型 fθ 最小化交叉熵损失(Eq. 1)→ 用更新后的模型继续采数据,如此循环直至策略表现满意。
- 训练本身是**离策略(off-policy)**监督学习(交叉熵分类损失),不依赖 on-policy rollout 或 policy-gradient 更新,规划阶段则是纯粹的基于模型的零阶优化控制(不训练独立的策略网络)。
- 对比基线同样在同一数据集上训练:Behavioral cloning(模仿学习,训练时剔除距接管 2 米以内的数据,因接管附近的动作被认为是不良示范);Kendall et al. 2019(VAE 学习图像压缩表征 + DDPG 学策略,reward 设为接管时 -1、否则 0,因原论文未开源代码,作者用现成 VAE/DDPG 实现复现)。
- 具体网络超参数(batch size、学习率、优化器、预测horizon H 的数值)论文正文与附录均未给出具体数字,仅给出了上文列出的规划器超参数。
Infra(训练 / 推理工程)
- 训练算力(GPU 型号/数量/GPU-hours):未披露。
- 推理侧:论文强调”资源受限的移动机器人”上需要更强的零阶优化器(warm-start + 软更新 + 时间步相关性)才能达到成功的实时规划控制,但未给出具体的控制频率(Hz)或规划延迟数值。
- 硬件平台:Clearpath Jackal 地面机器人 + 前向 170° FOV 单目相机(96×192 RGB 输入分辨率);接管信号由人类安全员用遥控器在机器人旁跟随给出。
评测 benchmark
在 2.3 km 训练时从未见过的人行道上评测(Table I,越远越好):
| 方法 | 平均接管前行驶距离 (m) |
|---|---|
| Behavioral cloning | 13.4 |
| Kendall et al. (VAE + DDPG) | 2.0 |
| LaND (ours) | 87.5 |
LaND 平均接管前行驶距离是次优方法(BC)的 6.5 倍。轨迹级分布(Fig. 7)显示:LaND 有 33% 的轨迹行驶超过 50 米(最长单条轨迹超过 400 米),而其余两个对比方法没有任何一条轨迹超过 50 米。定性对比(Fig. 9)中 LaND 在停放自行车、密集灌木、逆光、急转弯等场景成功通过,而表现最好的对比方法(模仿学习)在同样场景中失败/碰撞。
持续学习/微调实验(Table II,在同一 1.3 km 从未见过的人行道上先采集数据再微调评测):
| 方法 | 平均接管前行驶距离 (m) |
|---|---|
| LaND | 101.2 |
| LaND with finetuning | 218.3 |
微调后性能提升超过 2 倍,验证了”随着更多数据被采集,方法持续变强”这一核心论点。
论文未与更晚近的地图定位类方法或端到端 Transformer 方法比较(发表于 2020 年,对比对象限定为同期的模仿学习与实车 RL 方法)。
创新点与影响
- 核心贡献:把自动驾驶/移动机器人测试流程中天然产生、此前只用于调试的”接管事件”重新定位为一种直接、免费、已大规模存在的强化学习监督信号,提出一套简单有效且可扩展的学习框架(数据采集↔训练交替迭代),无需手工奖励、地图或额外标注。
- 实证效果:在真实、多样化的人行道场景中,相比模仿学习与实车 RL 基线(Kendall et al. 2019)分别取得 6.5 倍与远超的接管前行驶距离提升;并验证了策略会随数据积累持续变强(微调后提升 2 倍以上)。
- 作者自陈的局限(Discussion 部分原文列出):(1) 该方法仍需要人类持续监控机器人,成本高且繁琐,作者建议未来研究让机器人自己判断何时需要人类介入(例如基于不确定性);(2) 论文只利用了测试过程中产生的接管数据,而实际还存在大量专家演示数据集未被利用,如何把接管学习与模仿学习统一到一个框架中仍待探索;(3) LaND 是作为独立导航系统提出的,如何与现有的地图/路径规划系统结合、用 LaND 去”打补丁”修复既有系统的失效模式,也留作未来工作。
- 影响:是 Berkeley BAIR 同一脉络(Kahn/Abbeel/Levine)“自监督/弱监督真实世界导航”系列研究之一(与同期 BADGR 共享规划器实现),为后续基于图像目标条件、模型预测控制的视觉导航基础模型路线(如 ViNT、GNM、NoMaD 等)提供了早期的方法论参照——即用简单、已存在、免费的信号驱动真实机器人在线学习,而非依赖手工奖励或大规模人工标注。
原始链接
- arXiv: https://arxiv.org/abs/2010.04689
- PDF: https://arxiv.org/pdf/2010.04689
- 项目主页: https://sites.google.com/view/sidewalk-learning
- GitHub: https://github.com/gkahn13/LaND
一手源存档(sources/)
- land-learning-to-navigate-from-disengagements—project-page — 项目主页(Google Sites)快照
- land-learning-to-navigate-from-disengagements—github-readme — GitHub README 快照
- arXiv 原文 PDF,不入 git(见上方 arXiv 链接)