一句话定位

Google Robotics 团队用 12 台机械臂、7 名操作员采集 25,877 条真机演示 + 18,726 条人类视频,训一个 ResNet18+FiLM 的语言/视频条件行为克隆策略,在 100 个训练任务之外对 29 个未见任务组合实现零样本泛化(语言条件下 24 个任务有非零成功率、平均成功率 44%),是 rt-1 之前 Robotics at Google 摸出的”规模化模仿学习换任务级泛化”的直接前驱配方。

背景与定位

BC-Z(Jang、Irpan、Khansari、Kappler、Ebert、Lynch、Levine、Finn,CoRL 2021,arXiv 挂出于 2022-02)要回答的问题是:模仿学习能否零样本泛化到训练时完全没演示过的新任务,而不只是新物体、新目标配置。论文把自己和两类先行工作区分开:一类是靠机器人演示条件(one-shot from a demo)或人类视频条件(few-shot)实现新物体泛化的工作(Task-Embedded Control Networks 等),另一类是靠离散 one-hot 任务 ID 的多任务 BC(如 Rahmatizadeh et al. 2018)。BC-Z 的新意在于:(1) 用连续的任务表示(语言或视频嵌入)取代离散 one-hot,使得测试时给一个新句子/新视频就有可能推广到新任务;(2) 把这套方法真正扩到 100 个训练任务、7-DoF 真机操作、10Hz 控制的规模,而不是仿真或单一技能的小样本设置。

方法论上,BC-Z 采用交互式模仿学习:VR 遥操作收集专家演示后,让当前策略自主执行、人类通过”override 离合器”随时接管纠错——这本质是 HG-DAgger(Kelly et al. 2019)在真实多任务机械臂上的规模化实践。这套”专家演示 + 人在环纠偏”的数据引擎,以及”语言/视频嵌入做任务条件”的策略架构,与同期 saycan(用 LLM 做高层任务分解、接一个学出来的低层技能库)、peract(体素化的语言条件操作)同属”把语言接进机器人操作”的探索脉络,但 BC-Z 关注的是单一 flat 策略如何靠数据规模本身获得任务级组合泛化,不依赖显式的技能库或高层规划器。

BC-Z 团队与 rt-1 团队高度重叠(Levine、Finn 挂名両篇),RT-1 论文里明确把”BC-Z”和”BC-Z XL”列为架构基线之一,说明 BC-Z 的数据配方与结论(数据多样性关键、语言嵌入可做零训练的任务条件器)被直接继承进了后续 VLA(vision-language-action)路线;同时 BC-Z 论文本身也把自己定性为”是否可以不靠更复杂算法、只靠扩大数据规模拿到任务级泛化”的实证研究。

模型架构

策略是一个 ResNet18 + FiLM 的判别式(确定性)行为克隆网络 π(a|s,z),而非概率策略:

  • 感知主干:单目 RGB 头戴相机图像(视角固定不随夹爪移动,试过随动但更难学)经 ResNet18 “torso”,从最后的 mean-pool 层分叉出多个动作头。
  • 任务条件(FiLM):512 维任务嵌入 z 通过线性投影,为 ResNet18 的 4 个 block 的每个 channel 生成 FiLM 的 scale/shift(Perez et al. 2018 式),实现全网络的任务条件化。
  • 动作头:每个头是 2 层 256 单元 MLP + ReLU,分别预测 delta XYZ、delta axis-angle、归一化夹爪开合(0-1)——即 6-DoF 末端位姿增量 + 第 7 维连续夹爪控制;门开任务把手臂控制换成底盘前进/偏航速度 + 二元终止标志。
  • 动作表示是状态差分而非原始动作:直接克隆 10Hz 下的相邻状态差分会导致动作过小、机器人抖动;论文用自适应 N-步预测——从 N=1 开始递增,直到第 N 帧夹爪值变化超过 0.01 或手臂关节 L2 位移超过 0.05 才停,兼顾移动速度与接触精度(消融见下)。
  • 辅助开环预测:策略额外预测未来 10 步的开环轨迹作为辅助训练目标,仅用于训练时监督与离线可视化,推理时仍逐步闭环执行第一步动作。
  • 任务编码器 q(z|w)(语言或视频二选一,训练/推理时不混用):
    • 语言分支:冻结的预训练多语言 Universal Sentence Encoder(USE,tfhub.dev/google/universal-sentence-encoder-multilingual/3)直接产出 512 维语言向量,不做微调。
    • 视频分支:人类演示视频随机采样成 20 帧,排成 4×5 网格送入 2D ResNet18(把时间卷积伪装成 2D 卷积,比专门的时序卷积架构更省显存、效果更好),mean-pool 后过 32 单元 FC(限制表达力,防止编码器只记场景)→ 512 维线性层 → L2 归一化,与语言嵌入维度对齐;训练时对视频加随机 x/y 翻转与光度增强。
  • 视频编码器目标:单纯用人类视频 + BC 损失端到端训练会让嵌入按”21-任务族 vs 79-任务族”的物体集合聚类,而非按任务语义聚类;解决办法是加一条辅助语言回归损失(video/robot 视频嵌入与该任务语言嵌入的余弦距离),联合目标为 100·Huber(xyz) + 10·Huber(angle) + 0.5·LogLoss(gripper) + D_cos(z_h, z_l) + D_cos(z_e, z_l)

数据

  • 主数据集规模100 个操作任务,分两个不相交物体族——21-任务族(用 Object Set 1)与 79-任务族(用 Object Set 2);共 25,877 条机器人演示(11,108 条纯专家演示 + 16 轮迭代的 14,769 条 HG-DAgger 纠偏演示),累计约 125 小时机器人时间;另配 18,726 条人类演示视频(在多个家庭/办公场景、多机位拍摄)。
  • 采集组织12 台机械臂、7 名操作员,历时 5 个月采集;VR 遥操作用双 Oculus Quest 手柄(右手柄跟踪臂位姿 + 离合器接管 + 扳机连续控夹爪,左手柄摇杆控底盘)。
  • 共享自主(Shared Autonomy)采集流程:先纯专家演示打底,再让当前多任务策略自主执行、人类持”override”离合器实时纠错(即 HG-DAgger),并把纠偏数据滚动加回训练集,迭代 16 轮。
  • held-out 评测任务:29 个未见任务,其中 4 个只用 79-任务族内的物体组合(较易),25 个要求跨 21/79 两族物体组合(更难,需要真正的”物体×动作”组合泛化,训练中从未见过这些物体对同框)。
  • 单任务验证数据(独立于 100-任务数据集):
    • Bin-emptying:2,759 条演示。
    • Door-opening:真机 12,000 条演示(24 间会议室,10 间右开/14 间左开)+ 仿真 36,000 条(5 间仿真会议室),由 13 名操作员、30 台机器人采集;用 RetinaGAN 做 sim2real 图像自适应,最终策略在”真机 + 仿真 + RetinaGAN 适配后的仿真”三份数据混训。
  • 数据质量控制:自建 SQL 可查询的数据浏览/重标注 Web 界面,用于修正操作员误标的成功/失败标签、剔除硬件故障或遮挡目标物的演示。

训练方法

  • 范式:纯监督行为克隆(无 RL),确定性策略而非高斯策略——论文验证确定性策略已足以实现泛化。
  • 损失100·Huber_δ=1(ΔXYZ) + 10·Huber_δ=1(Δaxis-angle) + 0.5·LogLoss(gripper),三项权重人工调整以平衡量纲。
  • 任务嵌入噪声:训练时对策略输入的任务嵌入加 N(0, 0.1) 高斯噪声,防止策略学到”看图像抄近路、忽略任务条件”的捷径——论文强调这一步对让策略真正依赖任务嵌入是关键。
  • 视频嵌入推理时的平均化:评测新任务时,对该任务采集的 10 段人类视频的嵌入取平均后再喂给策略,比单条视频更稳。
  • 视频编码器批采样策略(消融,Table 6,指标为”held出视频嵌入最近邻匹配正确语言嵌入”的准确率):每 batch 先采样任务、每任务各取 1 条人类视频+1 条机器人视频(保证 50/50 人类-机器人平衡)达到 84% 准确率;若改成直接采 28 条人类+28 条机器人视频降到 80%;若整体随机采 56 条视频降到 74%——按任务采样的均衡策略最优。
  • 消融(Table 4,评测对象为训练任务”place bottle in ceramic bowl”):多任务语言条件 52%(标准差 6.3)> 多任务 one-hot 条件 45%(5.3)≫ 单任务基线(仅用该任务 1000 条演示)5%(2.8);去掉自适应 state-diff(固定 N=1)性能崩到 3%(2.3),说明多任务数据池化和自适应动作表示都是必要设计。
  • DAgger 消融(Table 4 右,控制总数据量不变):单任务上 100% 人工演示 27%(5.2)vs 50%人工+50% HG-DAgger 53%(5.8);8-任务子集上 23%(4.2)vs 47%(5.2)——同等数据量下 HG-DAgger 纠偏数据的价值显著高于纯专家演示;博客同时报告约 2 倍性能提升。干预频率与策略成功率呈负相关(Fig.5),可作为免评测的在线代理指标。
  • 仿真侧验证(Appendix B.1):在无场景随机化的仿真里,仅 37 条专家演示即可让单任务策略达到 97.2%(0.7)成功率;一旦引入物体位置随机化,40 条演示的成功率降到 56%(2.2)——证明真机单任务基线的低成功率主要来自场景多样性,而非算法本身的样本效率问题。

Infra(训练 / 推理工程)

  • 多任务策略训练TPUv3 pod,batch size 4096,Adam(TensorFlow 默认动量参数),学习率 5e-3;基于开源 Tensor2Robot 框架的 FiLM-ResNet 实现。
  • 单任务(bin-emptying / door-opening)策略训练:异步 SGD,10 块 GPU,每 worker batch size 32,学习率 2.5e-4;这两个单任务不加 FiLM(无任务条件)。
  • 视频编码器训练18 块 V100 GPU,batch size 28/GPU(每个样本是一对人类+机器人视频,故每 GPU 每步实际训练 56 段视频),异步梯度下降,学习率通过随机搜索选定为 2.45e-4
  • 推理 / 控制频率10Hz 异步闭环控制,单集动作决策数”远超 100 次”;论文未披露单步推理延迟的具体毫秒数(对比继任 RT-1 论文 Table 13 事后测得 BC-Z 网络推理约 5.3ms、BC-Z XL 约 5.9ms,但那是 RT-1 论文的测量,不算 BC-Z 本文披露)。
  • 本体:7-DoF 机械臂 + 平行夹爪(+ 可选移动底盘用于门开任务),单目头戴 RGB 相机固定视角。

评测 benchmark

全部数字来自本文(无外部基线对比,均为消融/自身设置对照):

单任务验证(Table 1)

任务设置指标数值
Bin-Emptying人类专家picks/min6.3 (±2.1),2759 次
Bin-EmptyingBC-Z(2759 演示)picks/min3.4 (±1.2),9 次
Door-Opening24 训练门成功率87% (±2.2),480 次
Door-Opening4 未见门成功率94% (±2.7),80 次

零样本/少样本任务泛化(Table 2,29 个未见任务,按技能分组):语言条件在 1 干扰物场景下整体 38%、4-5 干扰物场景 32%;视频条件(4-5 干扰物)整体仅 4%;语言条件下 24/28 个任务有非零成功率,其中平均成功率 44%;视频条件仅 9 个任务非零成功率。4 个不需跨物体族组合的任务上,单任务基线(300+ 条对应演示 + DAgger)反而 0% 成功,说明这批任务本身有相当难度、并非”随便训就会”。

编码器 vs 控制层瓶颈分析(Table 3):训练任务上 one-hot 42%、语言条件 40%、视频条件 24%;held-out 任务上语言条件降到 32%、视频条件降到 4%——语言与 one-hot 在训练任务上表现接近,说明语言潜空间足够好,held-out 性能的瓶颈更多在控制层(π)而非编码器(q);视频编码器泛化明显更弱。

消融见上文”训练方法”节 Table 4/Table 6 数字。

创新点与影响

  • 贡献:(1) 首次把”语言/视频条件的行为克隆”扩到 100 个真机操作任务的规模,并证明简单 BC(无需更复杂算法)配合规模化数据即可实现任务级零样本泛化,而非仅是新物体/新目标位置的泛化;(2) 系统性验证 HG-DAgger 共享自主采集 在多任务真机场景下的价值(同数据量下显著优于纯专家演示);(3) 提出”辅助语言回归损失”解决人类视频编码器坍缩到按物体集合聚类而非任务语义聚类的问题;(4) 开源 25,877 条演示的 TFRecord 数据集(Kaggle: google/bc-z-robot)与预计算任务嵌入,供后续多任务机器人学习复用。
  • 改变了什么:BC-Z 确立的”语言嵌入可直接做零训练任务条件器""数据多样性能带来组合泛化""共享自主采集优于纯遥操作”等结论,被同一实验室的 rt-1 继承并放大到 13 万条演示、700+ 任务的规模;RT-1 论文将 BC-Z 与 BC-Z XL 列为核心架构基线之一,用以说明”ResNet+FiLM 的容量/实时性权衡不如 Transformer+TokenLearner”。BC-Z 也是”用预训练语言表征做机器人任务条件”这一思路在真机大规模场景下的早期实证,为后续 VLA(如 RT-2 直接用 VLM 权重)路线提供了先验证据。
  • 作者自陈的局限:(1) 未见任务上的成功率方差很大,部分任务即便”部分理解”也难以完全成功;(2) 语言指令结构局限于简单的”(动词)(名词)“模板,未覆盖更丰富的自然语言变体;(3) 视频条件的泛化能力明显弱于语言条件,作者认为这是未来需要改进的方向;(4) 纯模仿学习的性能上限受限于人类演示质量,作者提出未来可将该策略当作预训练初始化,再结合自主 RL 做下游微调以突破这一上限。

原始链接

一手源存档(sources/)

  • bc-z—project-page — 项目主页(任务概览、泛化结果图、链接、BibTeX)
  • bc-z—blog — Google Research 博客正文(HG-DAgger 2x 提升的定性说法、100 任务/29 held-out 任务概述)
  • bc-z—github-readme — GitHub(Tensor2Robot research/bcz)README,训练命令与数据下载链接
  • arXiv 原文 PDF(2202.02005,不入 git):见上方 arXiv 链接