一句话定位

Robotics at Google 用”高通量遥操作 + 事件可选式事后语言重标注(event-selectable hindsight relabeling)“采集近 60 万条语言标注轨迹,训一个 Transformer 策略 LAVA(Language Attends to Vision to Act),单一策略在 5Hz 实时闭环控制下可执行 87,588 条独立自然语言指令(93.5% 成功率),并首次证明人类可用持续实时语言(而非一次性开环指令序列)引导机器人完成需数分钟的长程精细重排任务。

背景与定位

Interactive Language(Lynch, Wahid, Tompson 等,arXiv 2022-10)要解决的问题不是”能否听懂语言指令”,而是”能否在任务执行过程中实时响应新语言指令”——论文称之为 interactive language(约 3Hz 或更高频率插入新指令,对标人眨眼速度)。此前的语言条件机器人(如 saycan 用 LLM 做高层任务分解、CLIPort 等)大多用阻塞式参数化技能或自复位行为,一旦开始执行一条指令就无法被新指令打断;开环规划范式(先决定完整指令序列,再顺序执行)也是主流评测设定。本文将语言引导机器人的能力显式拆成两层:底层是一个可实时响应任意自然语言的短程视觉运动技能策略,上层是人类通过连续语言反馈把这些短程技能”缝合”成任意长程目标——不依赖显式的技能库或规划器。

方法论上直接继承 Lynch & Sermanet 2020(LangLFP)的”事后语言重标注”思路,但将其”随机窗口”重标注换成”事件可选式”重标注(标注者看完整段视频后自行框定行为起止帧,而非依赖预设窗口长度超参数)。数据引擎与 bc-z 的”专家演示 + 人在环纠偏(HG-DAgger)“路线不同,Interactive Language 走的是”play 数据”路线(Lynch et al. 2020 Learning Latent Plans from Play):操作员持续遥操作、不做任务分割和回合重置,靠事后众包标注把无结构数据转成语言条件演示对,从而把瓶颈从机器人采集转移到众包语言标注(后文数据节详述)。策略架构 LAVA 用 Transformer 做”语言查询视觉、时序自注意力融合”的跨模态融合,是 rt-1 之前 Robotics at Google 内部对 Transformer 视觉运动策略的一次探索,两者共享”ResNet 视觉编码 + Transformer 融合 + 连续/离散动作输出”的谱系,但 Interactive Language 的动作空间局限于 2D 平面推块任务,规模也小于 RT-1 的 13 万条真机演示、700+ 任务。论文同时开源 Language-Table 数据集与仿真基准,成为后续语言条件视觉运动学习的参考数据源之一,与同期的 calvin 基准并列。

模型架构

策略命名为 LAVA(“Language Attends to Vision to Act”,附录中写作”…for Actions”),是一个确定性行为克隆网络 πθ(a|s,l),输入 RGB 视频历史 + 语言,输出连续 2D 动作:

  • 感知模块:输入 s ∈ R^(seqlen×320×180×3),seqlen=4 的 RGB 观测历史。每帧经 ConvNet 提取多尺度特征:前两层是 ImageNet 预训练 ResNet,之后接两个额外可学习卷积层(通道数 128、256),层间做 2D max pooling,得到 5 个尺度的特征金字塔([H,W] = [112,112]/[56,56]/[28,28]/[14,14]/[7,7])。
  • 语言模块:预训练 CLIP 文本编码器(消融中用 ViT-B/32),在领域内数据上做对比式微调(用 (起始帧, 目标帧, 语言) 三元组:拼接起止帧编码过 MLP 得到与语言嵌入同维的视觉嵌入 z_im,与语言嵌入 z_lang 对齐),微调后编码器在策略训练时保持冻结;文本仅做去标点/去多余空格的极简预处理;输出 512 维句嵌入。
  • 视觉-语言融合模块(“Language-Attends-to-Vision”):取 ConvNet 第 2/3/4 层特征(H,W=28×28/14×14/7×7),每层经层特定 MLP 映射到 d_model 并加 2D 正弦位置编码,展平为长度 1029 的视觉 token 序列;语言嵌入投影到 d_model 后作为 query,视觉 token 作为 key/value,送入一个标准 pre-norm decoder-only 跨注意力 Transformer(仅语言在残差路径上)。该融合 Transformer:4 层,d_model=128,2 个注意力头,前馈宽度 128,dropout 0.1
  • 时序融合模块:对 4 帧的融合输出序列加 1D 正弦位置编码,送入另一个 pre-norm 自注意力 Transformer(2 层,d_model=128,2 头,前馈宽度 128,dropout 0.1),沿时间维取平均池化。
  • 策略输出:深度残差 MLP,2 个残差块(每块 3 层 MLP,前两层宽度 256、末层宽度 1024),ReLU 激活 + 正态初始化,最后线性投影到 2D 动作空间(末端执行器 delta 笛卡尔坐标 setpoint)。
  • 本体与动作空间:真实与仿真均为 xArm6 6-DoF 机械臂,约束在 2D 平面内移动,配一个圆柱形末端执行器(真机用 6 英寸 PVC 管,McMaster-Carr 9173K515);工作台为 24×18 英寸木板,8 个 Play22 儿童积木(4 色 6 形)。动作是从上一 setpoint 到新 setpoint 的 2D delta 笛卡尔位移,无夹爪/末端旋转自由度。
  • 观测/控制频率:真机用 Intel RealSense D415,640×360 RGB @30Hz,缩放到 320×180 后喂给策略;相机延迟约 80ms,在构造伪同步训练对时被显式补偿;真机策略训练/推理批到伪同步 5Hz;仿真中策略做阻塞式 10Hz 控制。

数据

数据分真实世界和仿真两套,均含”原始遥操作采集”与”事后众包重标注”两阶段(Table II / GitHub README 口径略有差异,见下):

真实世界原始采集(Real-World-Raw-Collect):11 名操作员轮换操作 4 台机器人,遵循随机抽取的长程提示(如”make a square shape out of the blocks”,用后即弃),不做低层任务分割或回合重置;共 23,498 条原始回合,平均时长 9.9 分钟(±5.6 秒),累计约 3,865 小时原始数据。其中 16,417 条回合、共 2,701 小时(论文 Table II 记为 2.7k 小时、16.4k 回合)进入了本文实际策略训练所用的数据快照,其余为训练完成后、数据集发布前继续采集的部分。

真实世界重标注(Real-World-Relabeled)64 名众包标注员用事件可选式重标注界面,看完整段回合视频后自行框定 24 段(12 中程 + 12 短程)连贯行为并写自然语言描述,共产出 414,798 条重标注演示、119,959 条独立指令;其中 298,782 条演示、87,140 条独立指令进入训练快照(论文摘要/正文与 Table II、Table IV 统一引用的即是这批”87k unique instructions”)。众包标注吞吐量是实际瓶颈:仅 18.06% 的原始采集数据在分析时点已完成标注(未标注数据量约为已标注的 5.5 倍),即便标注员人数是机器人数的 16 倍。

仿真原始采集(Simulation-Raw-Collect):6 名操作员,8,318 条回合,平均时长 36.8±15 秒,共 85.5 小时

仿真重标注(Simulation-Relabeled):64 名众包标注员产出 181,020 条重标注演示、78,623 条独立指令。

汇总(论文 Table III):Language-Table 数据集共 594k 条语言标注轨迹(413k 真实 + 181k 仿真)、198k 条独立语言标签(119k 真实 + 79k 仿真),比此前同类”事后语言标注”数据集(CALVIN 20k 条/0.4k 独立标签、BLOCKS 30k/n.r.、LOREL 6k/1.7k、LangLFP 10k/n.r.)大一个数量级;论文也与非语言重标注、规模更大的按任务采集数据集对比(BC-Z 25k 条/0.1k 任务、SayCan 68k/0.5k、DeepMind Playhouse 1,097k/779k)。

关系数据重标注策略对比(Table I):事件可选式重标注相较此前”随机窗口”重标注(Nair et al. 2022 / Lynch & Sermanet 2020)更贴合真实测试指令分布——按”物体/位置类""含接触指向性指令""复合指令”三类占比统计:随机窗口 86% / 47% / 16%;事件可选式(本文)91% / 83% / <1%;而真实测试指令的分布是 89% / 84% / <1%,与事件可选式重标注最吻合。

最终公开发布规模(GitHub README, 与论文分析快照略有出入):GitHub 上最终发布的 language_table(真实)为 442,226 回合,language_table_sim181,020 回合(与论文仿真重标注数字一致);另有 5 个各 200,000 回合的仿真 oracle 单任务数据集(block2block / block2block-relative / block2absolute / block2relative / separate,均由脚本化 oracle 智能体生成、非人类语言标注)。真实数据的最终发布量(44.2万)高于论文分析时的训练快照(29.9万)和当时的全部重标注总量(41.5万),说明数据集在论文发布后仍持续增长。

训练方法

  • 目标函数:标准监督式语言条件行为克隆(LCBC),MSE 损失 min_θ Σ_(s,a,l)~D_training ||a − π_θ(s,l)||²₂,策略为确定性输出(非概率策略)。
  • CLIP 语言编码器微调:用对比式方法把预训练的图文 CLIP 编码器适配到”(视频, 语言)“域——从每段视频抽取起始帧/目标帧对,拼接其编码过 MLP 得到 z_im,与该视频对应指令的语言嵌入 z_lang 做对齐;微调后编码器在策略训练阶段保持固定。
  • 训练规模/步数:约 500,000 步或至训练损失平台期;批大小 4096;优化器 Adam(TensorFlow 默认动量参数),学习率 1e-3;动作标签用训练集统计量归一化为 N(0,1)。
  • 架构消融(Table VI,Language-Table 仿真基准,3 个随机种子,350k 步后):完整 LAVA + 训练配方成功率 0.772 ± 0.044;去掉 CLIP 微调(用未微调的预训练 ViT-B/32 CLIP)降到 0.735 ± 0.023;去掉时序融合 Transformer(改用通道堆叠 + 随机初始化 ConvNet 编码 4 帧历史)降到 0.732 ± 0.036;批大小减半至 2048 降到 0.720 ± 0.038。论文指出去 CLIP 微调在仿真中降幅不大,但在真机上观察到更明显的定性行为差异,作者推测因为仿真评测用模板化指令、真机评测用更多样的人类语言。

Infra(训练 / 推理工程)

  • 训练硬件TPUv3 8×8 pod(64 块 TPUv3 芯片),训练速度约 7.6 步/秒,500,000 步训练总耗时约 18 小时
  • 推理/控制频率:真机 5Hz 异步伪同步闭环控制(相机延迟约 80ms 被计入伪同步配对),仿真 10Hz 阻塞式控制;论文未披露单步推理延迟的具体毫秒数。
  • 本体:xArm6 6-DoF 机械臂,状态以 100Hz 记录;单目 Intel RealSense D415 相机,640×360 RGB @30Hz,缩放到 320×180 供策略使用;策略仅用 RGB + 语言,无其他状态输入(仿真环境额外暴露 26 维状态供调试,但策略不使用)。
  • 数据采集侧基础设施:自建众包事件可选式重标注 Web 界面(标注员标记起止帧 + 撰写自然语言描述);数据存储为 TFDS 格式,托管于 gs://gresearch/robotics/language_table* 公开 GCS bucket。

评测 benchmark

全部数字取自本文:

真实世界短程指令覆盖(Table IV):以 87,588 条众包收集的独立自然语言指令为全集,随机抽 20 条指令、每条 10 次试验,估计整体成功率的 95% 置信区间——结果为平均成功率 93.50% ± 3.42%(95% CI [90.08%, 96.92%])。论文强调这是当时已知规模最大的、单一真机策略能力可覆盖的语言指令集合。

真实世界长程实时语言引导(Table V):定义 11 个高层目标族(如按颜色分类、摆成形状、精确到指定位置等)共 10 万+ 独立长程组合目标,均匀抽样 20 个目标、每个从随机初始状态评测 3 次(共 60 次评测);实时语言引导下平均成功率 85.0% ± 15.65%(95% CI [69.35%, 100.00%]),平均每目标使用 15 条指令。

开环 vs 实时语言消融(Table V):同一组长程目标,若操作员必须提前决定完整指令序列(开环设定,不能中途调整),成功率骤降到 25.0% ± 18.98%,平均只用 6.5 条指令——证明本文场景下的精细接触式操作严重依赖持续实时反馈,而非仅依赖底层策略能力。

多机器人语言引导:定性展示单一人类操作员同时用语音/文本实时指挥 4 台机器人完成长程任务,未给出量化成功率,论文称”据我们所知是文献中尚未出现过的能力”。

架构/数据量消融(Fig. 6,仿真,定性 + Table VI 定量部分):以 SPL(Success weighted by Path Length,兼顾成功率与路径效率)作为主指标,LAVA 相较 BC-Z 中的 FiLM-ResNet-18 基线取得”显著提升”(原文未在正文给出具体数值表格,仅有图示);训练数据量按倍增扫描时性能持续提升但边际递减、未见饱和平台期。

创新点与影响

  • 贡献:(1) 提出 Interactive Language 框架,把”高通量无结构遥操作 + 事件可选式事后语言重标注 + 简单 LCBC + Transformer 策略”组合成一套可扩展配方,首次让单一真机策略在 5Hz 实时闭环下响应 87,588 条独立自然语言指令,比此前工作大约一个数量级;(2) 首次系统研究”实时语言引导”这一新设定,量化证明它相对开环语言规划有巨大优势(85% vs 25% 长程成功率);(3) 展示”单人实时语言同时指挥多机器人”这一此前文献未出现的能力;(4) 开源 Language-Table 数据集(近 60 万条语言标注轨迹)与配套仿真基准/环境,成为后续语言条件视觉运动学习研究可复用的参考数据源。
  • 改变了什么:把”事件可选式”重标注确立为优于”随机窗口”重标注的数据构建方式(Table I 定量对比);把”实时语言可打断执行”作为语言条件机器人的一个独立评测维度提出来,区别于此前默认的开环语言规划设定;Language-Table 数据集后来被广泛用作语言条件操作策略的基准之一。
  • 作者自陈的局限:更广义的人机协作中大量开放问题(意图识别、非语言交流、物理协作式任务完成等)本文均未涉及,只处理”实时语言引导的操作”这一狭窄场景;未来工作应探索该框架在真实时助理机器人等场景的应用,并将本文的短程实时技能与 LLM 式的自主长程规划相结合(当时的开环/闭环 LLM 子目标生成方法在需要精细空间细节的任务上仍难以从纯文本场景描述生成准确子目标)。

原始链接

一手源存档(sources/)