一句话定位

先在 3800 万条互联网文本-视频片段(约 500 亿 token)上做自回归视频生成预训练,再在机器人轨迹上微调「同时预测未来视频 + 动作轨迹」,得到一个把视频生成先验无损迁移到操作策略的生成式 VLA;105 任务多任务平均成功率 97.7%,并在未见背景/环境/物体/技能上展现强泛化。

背景与定位

GR-2 是 ByteDance Research 机器人团队 GR 系列的第二代,直接承接 GR-1(gr-1wu2023unleashing,Unleashing large-scale video generative pre-training for visual robot manipulation)。GR-1 的核心思想是:视频里蕴含环境如何随文本描述演化的动力学信息,这种信息可以在下游策略学习里帮助动作预测。GR-2 把这条路线的预训练规模从 GR-1 的 0.8M 视频拉到 38M(约 47 倍),并改造模型架构,使预训练知识能「无损」传到微调阶段。

范式上它属于**「视频生成预训练 → 生成式 VLA」**,与两条主流 VLA 路线并列但不同:

  • rt-2(RT-2)、OpenVLA 那种「在互联网数据上预训练的 VLM 上直接输出离散动作 token」的 VLM-as-VLA 路线不同——GR-2 的 web 知识来自视频生成而非图文 VLM。
  • rt-1(RT-1)、Octo 这类纯机器人数据多任务策略不同——GR-2 的泛化能力主要来自海量人类活动视频。

它把「世界模型(视频预测)当规划器」这一思路做进 VLA:模型先自回归生成未来视觉轨迹,动作轨迹相当于在「复现」预测视频里的运动。相关基准用 calvin(CALVIN)长程语言条件操作,预训练数据引用 ego4dopen-x-embodiment 系的 RT-1/Bridge,动作头借鉴 aloha-act(ACT,zhao2023learning)的 cVAE + action chunking。

模型架构

整体:语言条件的 GPT 式(自回归 transformer)视觉操作策略。策略 π 输入语言指令 l、一段历史观测 o_{t-h:t}、一段机器人状态 s_{t-h:t},端到端输出动作轨迹 a_{t:t+k}(h 为观测历史长度,k 为动作轨迹长度)。微调阶段目标改为「同时输出下一帧图像 o_{t+1} 与动作轨迹 a_{t:t+k}」。

输入编码:

  • 语言:冻结的文本编码器(CLIP 文本塔,radford2021learning)把指令转成 token。
  • 图像:用 VQGANesser2021taming,Taming Transformers)把每帧图像离散化成 token。VQGAN 在互联网数据 + 域内机器人数据上训练,训练全程冻结——既加速训练又支持生成高质量视频。
  • 机器人状态:末端执行器的位置 + 姿态 + 二值夹爪状态,经线性层编码(该线性层在微调阶段可训练)。

预训练输出:GPT-style transformer 吃 tokenized 文本 + 图像序列,输出未来图像的离散 token,再用 VQGAN decoder 解码成未来帧(自回归视频预测)。

动作头(action head):动作轨迹由条件 VAE(cVAE)生成(sohn2015learning/kingma2013auto/zhao2023learning)。作者实证:生成动作轨迹(chunk)而非单步动作对轨迹平滑与实时性都至关重要。

多视角处理:预训练视频只有单视角,机器人数据常是多视角。GR-2 架构专门设计成能优雅处理多视角——微调时输入 tokenized 指令 + 多路视角图像序列 + 状态序列,输出每一路视角的未来图像和一条动作轨迹。

模型规模(可训练参数):30M(GR-2-S)/ 95M(GR-2-B)/ 312M(GR-2-L)/ 719M(GR-2-XL)。默认 GR-2 = 230M 总参数,其中 95M 可训练(即 GR-2-B;冻结的 VQGAN/文本编码器占其余参数)。

数据

预训练数据(视频生成):

  • 规模:38,000,000 条文本-视频片段,≈ 50,000,000,000(500 亿)token
  • 人类活动数据集:HowTo100M、ego4d(Ego4D)、Something-Something V2、EPIC-KITCHENS、Kinetics-700;场景覆盖家居、户外、职场、休闲等日常活动。
  • 公开机器人数据集:RT-1(brohan2022rt)、Bridge(BridgeData V2)。
  • 数据处理流水线:手部过滤(MediaPipe,lugaresi2019mediapipe)+ 重新打字幕 re-captioning(Open-Sora,opensora),以适配机器人操作任务。
  • 对比 GR-1 的 0.8M → GR-2 的 38M。

机器人微调数据(真机遥操作采集):

  • 多任务:105 张桌面任务,覆盖 8 类技能(picking、placing、uncapping、capping、opening、closing、pressing、pouring);共约 40,000 条轨迹(平均每任务 ~400 条)。数据稀缺设定用约 1/8(~50 条/任务)。
  • 端到端 bin-picking:~94,000 条抓放轨迹,55 个物体;语言指令极简:“move any object from the right basket to the left basket”。
  • CALVIN:ABCD-D split,> 20,000 条专家演示,34 个任务

微调期数据增强(提升未见场景泛化):

  • 插入新物体:训练一个扩散模型(DDPM,ho2020denoising),用自采物体数据集 + Open Images,能在指定区域插入特定物体。
  • 更换背景:用 SAM(kirillov2023segment)抠出背景区域。
  • 用视频生成模型 Latte(latent diffusion transformer,ma2024latte)以原视频 + inpaint 帧为条件,生成增强视频,同时保持机器人运动不变。

训练方法

两阶段管线:

  1. 视频生成预训练:给定文本描述 + 一帧图像,自回归预测后续帧(预测未来图像的 VQGAN 离散 token)。目标是让模型掌握时序动力学与语义先验,为下游动作预测服务。
  2. 机器人数据微调:在真机轨迹上微调,串联预测未来图像 + 动作轨迹(式 2:π(l, o, s) → o_{t+1}, a_{t:t+k})。视频预测头 + cVAE 动作头联合训练。

关键设计:

  • 「无损知识迁移」的新架构:预训练学到的参数可无损带入微调(scaling 实验里预训练参数冻结、只微调新增部分,仍随规模稳定提升)。
  • 动作用 cVAE 生成整段轨迹(action chunking),而非逐步回归。
  • 生成的视频与真实 rollout 高度吻合,等价于「动作在复现预测视频里的运动」,因此改进视频生成即可迭代改进动作预测。

具体优化器 / 学习率 / batch size / 训练步数等超参未披露

Infra(训练 / 推理工程)

  • 训练硬件(GPU 型号 / 数量 / GPU-hours / 并行策略 / 精度):均未披露(技术报告未给算力细节)。
  • 真机系统:7-DoF Kinova Gen3 机械臂 + Robotiq 2F-85 夹爪;两路相机——静态头部相机(工作区全局视图)+ 末端执行器腕部相机(近距交互视图)。
  • 部署 / 控制:GR-2 在笛卡尔空间生成动作轨迹;自研 Whole-Body Control (WBC) 算法用轨迹优化做运动跟踪(yang2023moma-force):先对生成轨迹做平滑/连续性优化,再把笛卡尔轨迹转成底层关节动作,在真机上以 200 Hz 执行;优化框架里集成碰撞约束与可操作度(manipulability)。
  • 策略网络本身的推理 FPS / 时延未披露(仅底层关节控制 200 Hz 有明确数字)。作者强调「生成轨迹而非单步」是保证实时性的关键。

评测 benchmark

所有数字取自技术报告(arXiv 2410.06158)与项目页。

真机多任务学习(105 任务):

设定GR-2备注
Simple(400 条/任务)97.7%105 任务多任务能力
Unseen Backgrounds71.4%约为 GR-1 的两倍
Unseen Environments71.7%约为 GR-1 的两倍
Unseen Environments(w/ 数据增强)87.0%
三项泛化设定平均(w/ 数据增强)74.7%
Simple(仅 50 条/任务)73.9%三项泛化设定均超 GR-1
Unseen Manipulation55.8%最难,最弱项

端到端 Bin-Picking(122 物体:55 seen + 67 unseen;含透明/可形变/反光物体):

  • 平均成功率从 GR-1 的 33.3% → GR-2 79.0%
  • GR-1 无法应对 Unseen 与两种 cluttered 设定,性能大幅退化;GR-2 在 Unseen 与两种 cluttered 设定的成功率与 Seen 设定相当。

CALVIN(ABCD-D split,1000 条指令链,每链连做 5 任务),baseline:RT-1、MT-ACT、HULC、RoboFlamingo、GR-1:

指标GR-1GR-2
完成 1 任务94.9%98.6%
完成 5 任务73.1%85.9%
平均长度(avg. length)4.214.64

GR-2 在成功率与平均长度上全面超过全部 baseline,建立新 SOTA。

Scaling:预训练视频预测验证损失(在 Ego4D / RT-1 / 自采机器人数据三个验证集上)随模型规模单调下降;微调后真机成功率也随规模稳定提升(S<B<L<XL)。

创新点与影响

贡献:

  1. 把视频生成预训练规模拉到 38M 片段 / 50B token(GR-1 的 ~47×),证明「海量人类活动视频 → 机器人操作泛化」这条路线可 scale。
  2. 提出「无损知识迁移」的新架构,使视频生成预训练先验能干净地进入动作微调,并在多任务 + 强泛化设定下展现可扩展性(模型越大越好)。
  3. 生成式 VLA:同时生成未来视频 + 动作轨迹,视频预测充当动作规划器,且视频与真机 rollout 高度一致——给出「改进视频生成即可迭代改进动作」的自我提升范式。
  4. 真机部署引入 WBC(轨迹优化 + 实时运动跟踪,200 Hz 关节控制),并演示工业化 bin-picking(透明/形变/反光物体)。
  5. 数据效率:5000 条轨迹(平均 50 条/任务)即可学 100+ 任务,大幅降低新技能/新环境的采集成本。

改变了什么:把「世界模型/视频预测」从辅助表征学习真正落到端到端 VLA 的动作输出上,为「用互联网视频而非图文 VLM 获取 web 知识」提供了强 baseline,也是后续 GR 系列与视频-动作联合建模工作的关键前身。

作者自述局限:

  • Unseen Manipulation 仅 55.8%,是最弱环节;典型失败:① 抓不住新形状的未见物体;② 被要求抓某个未见物体时选错对象。
  • 未来工作聚焦提升未见操作(新物体、新技能)的泛化与鲁棒性。
  • 模型未开源(无 GitHub / HuggingFace 权重发布),复现依赖自建数据与真机系统。

原始链接

一手源存档(sources/)

  • bytedance-gr-2—project-page — 项目页快照 sources/embodied/2024/bytedance-gr-2--project-page.md
  • 技术报告全文见 arXiv https://arxiv.org/html/2410.06158v1(arXiv 原文,不入 git)