一句话定位

GR-1 是 ByteDance Research 提出的一个简单 GPT 风格因果 transformer:先在 Ego4D 的 80 万段 3 秒视频片段(约 800K clip / 8M 帧) 上做语言条件的未来帧预测(video generative pre-training),再无缝微调到机器人数据上,同一模型端到端同时输出未来图像机械臂/夹爪动作;在 CALVIN 基准上把成功率从 88.9% 推到 94.9%,在跨场景零样本泛化上从 53.3% 推到 85.4%,并在真实 Kinova 机械臂上验证了对未见物体/场景的泛化能力,是”大规模视频生成预训练能直接迁移到机器人操作”这一论点的早期实证之作,也是 ByteDance GR 系列(bytedance-gr-2)的第一代。

背景与定位

论文 2023-12 发在 arXiv(2312.13139),后被 ICLR 2024 接收,作者 Hongtao Wu、Ya Jing(共同一作)等,通讯作者 Tao Kong,来自 ByteDance Research。它出现在语言条件视觉机器人操作这条线的中段:rt-1(2022,35M 参数专用 transformer,模仿学习)、palm-e 与 RT-2(2023,把 VLM 语义直接拿来做动作)代表”用更大的语言/视觉-语言模型做条件”这一支;r3m、MVP 等代表”用视频预训练一个冻结的视觉表征再接策略头”这一支;GATO、robocat、Decision Transformer 代表”用统一 transformer 建模轨迹序列”这一支。GR-1 的定位介于后两者之间:它不是只把预训练模型当冻结的特征提取器(如 R3M),而是让同一个 GPT 风格因果 transformer 同时承担视频生成预训练(预测未来帧)与下游动作学习(预测末端位姿/夹爪状态)两个任务,预训练权重可以直接复制到微调阶段并继续优化,形成”预训练-微调”范式在具身操作上的直接实例化。论文将其与 RoboCat(同样预测动作+未来图像,但是目标图像条件、不做视频预训练、也非语言条件)和 RPT(自监督感觉运动预训练,预测被 mask 掉的多模态 token)做了明确区分。

论文对比的四个基线:MCIL(分层隐变量计划)、rt-1(FiLM 条件卷积 + transformer)、HULC(分层隐变量计划的改进版)、以及作者自建的 MT-R3M(用 r3m 编码图像 + GPT 风格 transformer 输出动作,可训练参数量与 GR-1 相同,用于单独验证”视频生成预训练”这一项的贡献而非仅仅”用 Ego4D 数据”)。

模型架构

Backbone:单一因果(causal)GPT 风格 transformer(Radford et al. 2018 式),12 层、12 个注意力头、hidden size 384,总参数 195M,其中仅 46M 可训练(差值即冻结的 CLIP 文本编码器 + MAE ViT-Base 图像编码器)。

输入编码

  • 语言:CLIP 文本编码器,全程冻结,仅提供语义表示(不训练也是论文认为语言零样本泛化的原因之一)。
  • 视觉:MAE 预训练的 ViT(同样冻结),取 CLS token 作为图像全局表示,patch token 经 perceiver resampler 压缩 token 数后作为局部表示。
  • 机器人状态:末端位姿的 6D pose(SE(3))+ 夹爪二值状态,用线性层编码。
  • 各模态嵌入统一过线性层对齐维度后送入因果 transformer;为注入时序信息,加入按 timestep 共享的可学习相对位置嵌入;语言 token 在每个 timestep 都重复一次(避免被其他模态”淹没”)。

动作 / 观测预测 token:引入一个可学习的 [ACT] token 预测动作,多个可学习的 [OBS] token 预测未来帧。预训练阶段序列为 (l, o_{t-h}, [OBS], l, o_{t-h+1}, [OBS], ..., l, o_t, [OBS]);微调阶段序列变为 (l, s_{t-h}, o_{t-h}, [OBS], [ACT], ..., l, s_t, o_t, [OBS], [ACT])。因果 attention mask 额外规定:预训练时 token 不能看到 [OBS];微调时 token 既看不到 [OBS] 也看不到 [ACT]。

输出头:视频预测接一个由 self-attention block + MLP 组成的 transformer 解码器,作用于 [OBS] token 输出和可学习的 mask token(做法承袭 MAE:预测目标做 patch-wise 归一化,损失为像素空间 MSE,即 L_video);动作预测接三层 MLP,末层拆两个头分别输出连续的手臂动作(Smooth-L1 损失 L_arm)与二值夹爪动作(BCE 损失 L_gripper)。微调总损失 L_finetune = L_arm + L_gripper + L_video

微调时输入序列长度设为 10;预测未来步长 Δt 在预训练阶段为 1(对应帧间隔 1/3 秒),在微调阶段改为 3(机器人数据比采样视频帧更密集);同时预测静态相机与夹爪相机两路图像。

数据

预训练数据:Ego4D(Grauman et al. 2022),原始规模超过 3,500 小时的第一人称人机交互视频,每段视频配有自然语言描述。GR-1 从中每段裁出 3 秒短片,共得到 80 万段(800,000)视频片段,约 800 万(8M)帧;预训练时按等间隔(1/3 秒)从片段中采样帧序列训练视频预测。

CALVIN 微调数据:CALVIN 基准包含 34 个操作任务,环境为 Franka Emika Panda 机械臂 + 带滑动门/抽屉/彩色积木/LED/灯泡的桌面,4 个环境 A/B/C/D(桌面颜色与物体配置不同)。数据集含 24 小时的遥操作无约束玩耍(play)数据,其中仅 1% 带众包语言标注,训练/评测均只用这部分带标注数据。ABCD→D split 训练集含超过 2 万条专家轨迹(消融表里精确值为 22,966 条);10% 数据消融从中对 34 个任务各采样 66 条轨迹,共 2,244 条

真实机器人数据:物体搬运任务用 HTC Vive VR 遥操作采集 1,775 条演示(场景含茄子、西兰花、彩椒三种物体,在案板与桌面间搬运);铰接物体(抽屉)操作采集 2,856 条开/关抽屉轨迹。

数据处理要点:预训练数据为域外(out-of-domain)非机器人数据(人类第一人称视频),与 VPT/VIPER 等使用域内(in-domain)游戏/任务视频形成对比;机器人数据始终带语言标注,未使用未标注 play 数据(与 MCIL/HULC 相反)。

训练方法

两阶段:先在 Ego4D 上做语言条件视频生成预训练(仅优化 L_video),再在机器人数据上微调(L_finetune = L_arm + L_gripper + L_video,即微调阶段视频预测损失继续保留、并非只做行为克隆)。预训练/微调全程冻结 CLIP 文本编码器与 MAE 图像编码器。

超参数(论文 Table 3):

  • 预训练:batch size 1024,学习率 3.6e-4,dropout 0.1,AdamW 优化器 + cosine 学习率衰减,warmup 5 epoch,训练 50 epoch。
  • CALVIN 微调:batch size 512,学习率 1e-3,dropout 0.1,同样 AdamW + cosine decay,warmup 1 epoch,训练 20 epoch。
  • 真实机器人微调:与 CALVIN 微调设置相同,但 batch size 改为 64、训练 30 epoch。
  • 图像输入应用随机平移(random shift)增强。

消融显示:视频预测 + 预训练两项均去掉(GR-1 w/o Video Prediction & Pre-training,即去掉 [OBS] token 从零训练)在 ABCD→D 上平均完成长度降到 3.33(GR-1 完整版 4.21);只去掉预训练(保留视频预测但从零训练)为 3.82;未来预测步长 Δt 在 1/3/5 之间的消融显示 Δt=3 时平均长度最高(3.82 vs Δt=1 的 3.61、Δt=5 的 3.67),说明”预测稍远的帧”比”预测下一帧”更有效,但收益很快饱和。

Infra(训练 / 推理工程)

论文正文未披露训练所用 GPU 型号、数量、总 GPU-hours 或分布式并行策略;推理侧的控制频率(control-Hz)、单步延迟、边缘硬件配置同样未披露。唯一可确认的工程细节是上文列出的 batch size / 学习率 / epoch 数等训练超参数,以及真实机器人实验用的传感配置:7-自由度 Kinova Gen2 机械臂,末端装 RealSense 相机作为腕部视角,另配一台 Kinect Azure 提供场景静态视角。

评测 benchmark

CALVIN — ABCD→D(同域多任务,1000 条评测指令链,每链最多连续完成 5 个任务):

方法完成 1 任务完成 5 任务平均完成长度
MCIL0.3730.0000.40
RT-10.8440.2272.45
HULC0.8890.3833.06
MT-R3M0.7520.1632.08
GR-10.9490.7314.21

(论文摘要口径:成功率从最强基线 88.9%(HULC,完成 1 任务)提升到 94.9%;平均完成长度从最强基线 3.06(HULC)提升到 4.21。)

CALVIN — ABC→D(跨域零样本场景泛化,训练于 A/B/C,评测于未见环境 D):

方法完成 1 任务完成 5 任务平均完成长度
MCIL0.3040.0000.31
RT-10.5330.0130.90
HULC0.4180.0110.67
MT-R3M0.5290.0180.93
GR-10.8540.4013.06

(摘要口径:完成 1 任务成功率从最强基线 53.3%(RT-1)提升到 85.4%。)

10% 数据(ABCD→D split 抽样 2,244 条轨迹,共 4 个方法对比):

方法完成 1 任务平均完成长度
RT-10.2490.34
HULC0.6681.11
MT-R3M0.4080.61
GR-10.7782.00

未见语言指令泛化(用 GPT-4 为 34 个任务各生成 50 条同义指令,在 ABCD→D 训练的模型上评测):

方法完成 1 任务平均完成长度
RT-10.4940.86
HULC0.7151.82
MT-R3M0.5120.92
GR-10.7642.17

真实机器人实验(成功率):

设置RT-1MT-R3MGR-1
物体搬运 - 已见物体0.270.150.79
物体搬运 - 未见实例0.130.100.73
物体搬运 - 未见类别0.000.300.30
铰接物体(抽屉)操作0.350.300.75

真实机器人失败模式:GR-1 在”未见类别”设定下常把彩椒与颜色相近的桃子混淆;抽屉任务中偶尔关不严实、或掏抽屉把手时未能有效接触把手。

创新点与影响

贡献:1)首次给出”大规模视频生成预训练能有效提升视觉机器人操作学习”的实证证据;2)提出一个灵活的 GPT 风格 transformer,用同一套权重完成视频生成预训练与机器人数据微调的无缝衔接(预训练权重直接复制到微调阶段继续训练,而非仅当特征提取器);3)在仿真(CALVIN)与真实机器人上做了较全面的多任务、小数据、跨场景、跨语言泛化实验。

论文自陈的局限 / 未来方向:预训练目前只使用了带语言标注的视频,未来希望结合有标注和无标注视频以进一步提升鲁棒性与泛化;预训练视频(Ego4D 人类第一人称交互)与真正的操作任务相关性有限,作者提出”预训练视频应该是任意种类还是更贴近操作任务的视频”这一开放问题;机器人数据规模仍偏小,计划扩大轨迹数量、环境多样性与技能种类。工程侧(训练算力、推理延迟/控制频率)论文完全未披露。

其直接后续是 ByteDance GR 系列的 bytedance-gr-2:GR-2 把视频预训练规模从 GR-1 的约 80 万段(0.8M)拉到 3800 万段(38M,约 47 倍),并在 GR-2 自己复现的 CALVIN ABCD→D 对比中全面超过 GR-1(完成 1 任务 94.9%→98.6%,完成 5 任务 73.1%→85.9%,平均长度 4.21→4.64;数字取自 bytedance-gr-2 页),说明 GR-1 提出的”视频生成预训练 + 统一 transformer 微调”范式本身具备良好的可扩展性(scaling)。

原始链接

一手源存档(sources/)