一句话定位
先在 3800 万条互联网文本-视频片段(约 500 亿 token)上做自回归视频生成预训练,再在机器人轨迹上微调「同时预测未来视频 + 动作轨迹」,得到一个把视频生成先验无损迁移到操作策略的生成式 VLA;105 任务多任务平均成功率 97.7%,并在未见背景/环境/物体/技能上展现强泛化。
背景与定位
GR-2 是 ByteDance Research 机器人团队 GR 系列的第二代,直接承接 GR-1(gr-1,wu2023unleashing,Unleashing large-scale video generative pre-training for visual robot manipulation)。GR-1 的核心思想是:视频里蕴含环境如何随文本描述演化的动力学信息,这种信息可以在下游策略学习里帮助动作预测。GR-2 把这条路线的预训练规模从 GR-1 的 0.8M 视频拉到 38M(约 47 倍),并改造模型架构,使预训练知识能「无损」传到微调阶段。
范式上它属于**「视频生成预训练 → 生成式 VLA」**,与两条主流 VLA 路线并列但不同:
- 与 rt-2(RT-2)、OpenVLA 那种「在互联网数据上预训练的 VLM 上直接输出离散动作 token」的 VLM-as-VLA 路线不同——GR-2 的 web 知识来自视频生成而非图文 VLM。
- 与 rt-1(RT-1)、Octo 这类纯机器人数据多任务策略不同——GR-2 的泛化能力主要来自海量人类活动视频。
它把「世界模型(视频预测)当规划器」这一思路做进 VLA:模型先自回归生成未来视觉轨迹,动作轨迹相当于在「复现」预测视频里的运动。相关基准用 calvin(CALVIN)长程语言条件操作,预训练数据引用 ego4d、open-x-embodiment 系的 RT-1/Bridge,动作头借鉴 aloha-act(ACT,zhao2023learning)的 cVAE + action chunking。
模型架构
整体:语言条件的 GPT 式(自回归 transformer)视觉操作策略。策略 π 输入语言指令 l、一段历史观测 o_{t-h:t}、一段机器人状态 s_{t-h:t},端到端输出动作轨迹 a_{t:t+k}(h 为观测历史长度,k 为动作轨迹长度)。微调阶段目标改为「同时输出下一帧图像 o_{t+1} 与动作轨迹 a_{t:t+k}」。
输入编码:
- 语言:冻结的文本编码器(CLIP 文本塔,
radford2021learning)把指令转成 token。 - 图像:用 VQGAN(
esser2021taming,Taming Transformers)把每帧图像离散化成 token。VQGAN 在互联网数据 + 域内机器人数据上训练,训练全程冻结——既加速训练又支持生成高质量视频。 - 机器人状态:末端执行器的位置 + 姿态 + 二值夹爪状态,经线性层编码(该线性层在微调阶段可训练)。
预训练输出:GPT-style transformer 吃 tokenized 文本 + 图像序列,输出未来图像的离散 token,再用 VQGAN decoder 解码成未来帧(自回归视频预测)。
动作头(action head):动作轨迹由条件 VAE(cVAE)生成(sohn2015learning/kingma2013auto/zhao2023learning)。作者实证:生成动作轨迹(chunk)而非单步动作对轨迹平滑与实时性都至关重要。
多视角处理:预训练视频只有单视角,机器人数据常是多视角。GR-2 架构专门设计成能优雅处理多视角——微调时输入 tokenized 指令 + 多路视角图像序列 + 状态序列,输出每一路视角的未来图像和一条动作轨迹。
模型规模(可训练参数):30M(GR-2-S)/ 95M(GR-2-B)/ 312M(GR-2-L)/ 719M(GR-2-XL)。默认 GR-2 = 230M 总参数,其中 95M 可训练(即 GR-2-B;冻结的 VQGAN/文本编码器占其余参数)。
数据
预训练数据(视频生成):
- 规模:38,000,000 条文本-视频片段,≈ 50,000,000,000(500 亿)token。
- 人类活动数据集:HowTo100M、ego4d(Ego4D)、Something-Something V2、EPIC-KITCHENS、Kinetics-700;场景覆盖家居、户外、职场、休闲等日常活动。
- 公开机器人数据集:RT-1(
brohan2022rt)、Bridge(BridgeData V2)。 - 数据处理流水线:手部过滤(MediaPipe,
lugaresi2019mediapipe)+ 重新打字幕 re-captioning(Open-Sora,opensora),以适配机器人操作任务。 - 对比 GR-1 的 0.8M → GR-2 的 38M。
机器人微调数据(真机遥操作采集):
- 多任务:105 张桌面任务,覆盖 8 类技能(picking、placing、uncapping、capping、opening、closing、pressing、pouring);共约 40,000 条轨迹(平均每任务 ~400 条)。数据稀缺设定用约 1/8(~50 条/任务)。
- 端到端 bin-picking:~94,000 条抓放轨迹,55 个物体;语言指令极简:“move any object from the right basket to the left basket”。
- CALVIN:ABCD-D split,> 20,000 条专家演示,34 个任务。
微调期数据增强(提升未见场景泛化):
- 插入新物体:训练一个扩散模型(DDPM,
ho2020denoising),用自采物体数据集 + Open Images,能在指定区域插入特定物体。 - 更换背景:用 SAM(
kirillov2023segment)抠出背景区域。 - 用视频生成模型 Latte(latent diffusion transformer,
ma2024latte)以原视频 + inpaint 帧为条件,生成增强视频,同时保持机器人运动不变。
训练方法
两阶段管线:
- 视频生成预训练:给定文本描述 + 一帧图像,自回归预测后续帧(预测未来图像的 VQGAN 离散 token)。目标是让模型掌握时序动力学与语义先验,为下游动作预测服务。
- 机器人数据微调:在真机轨迹上微调,串联预测未来图像 + 动作轨迹(式 2:π(l, o, s) → o_{t+1}, a_{t:t+k})。视频预测头 + cVAE 动作头联合训练。
关键设计:
- 「无损知识迁移」的新架构:预训练学到的参数可无损带入微调(scaling 实验里预训练参数冻结、只微调新增部分,仍随规模稳定提升)。
- 动作用 cVAE 生成整段轨迹(action chunking),而非逐步回归。
- 生成的视频与真实 rollout 高度吻合,等价于「动作在复现预测视频里的运动」,因此改进视频生成即可迭代改进动作预测。
具体优化器 / 学习率 / batch size / 训练步数等超参未披露。
Infra(训练 / 推理工程)
- 训练硬件(GPU 型号 / 数量 / GPU-hours / 并行策略 / 精度):均未披露(技术报告未给算力细节)。
- 真机系统:7-DoF Kinova Gen3 机械臂 + Robotiq 2F-85 夹爪;两路相机——静态头部相机(工作区全局视图)+ 末端执行器腕部相机(近距交互视图)。
- 部署 / 控制:GR-2 在笛卡尔空间生成动作轨迹;自研 Whole-Body Control (WBC) 算法用轨迹优化做运动跟踪(
yang2023moma-force):先对生成轨迹做平滑/连续性优化,再把笛卡尔轨迹转成底层关节动作,在真机上以 200 Hz 执行;优化框架里集成碰撞约束与可操作度(manipulability)。 - 策略网络本身的推理 FPS / 时延未披露(仅底层关节控制 200 Hz 有明确数字)。作者强调「生成轨迹而非单步」是保证实时性的关键。
评测 benchmark
所有数字取自技术报告(arXiv 2410.06158)与项目页。
真机多任务学习(105 任务):
| 设定 | GR-2 | 备注 |
|---|---|---|
| Simple(400 条/任务) | 97.7% | 105 任务多任务能力 |
| Unseen Backgrounds | 71.4% | 约为 GR-1 的两倍 |
| Unseen Environments | 71.7% | 约为 GR-1 的两倍 |
| Unseen Environments(w/ 数据增强) | 87.0% | |
| 三项泛化设定平均(w/ 数据增强) | 74.7% | |
| Simple(仅 50 条/任务) | 73.9% | 三项泛化设定均超 GR-1 |
| Unseen Manipulation | 55.8% | 最难,最弱项 |
端到端 Bin-Picking(122 物体:55 seen + 67 unseen;含透明/可形变/反光物体):
- 平均成功率从 GR-1 的 33.3% → GR-2 79.0%。
- GR-1 无法应对 Unseen 与两种 cluttered 设定,性能大幅退化;GR-2 在 Unseen 与两种 cluttered 设定的成功率与 Seen 设定相当。
CALVIN(ABCD-D split,1000 条指令链,每链连做 5 任务),baseline:RT-1、MT-ACT、HULC、RoboFlamingo、GR-1:
| 指标 | GR-1 | GR-2 |
|---|---|---|
| 完成 1 任务 | 94.9% | 98.6% |
| 完成 5 任务 | 73.1% | 85.9% |
| 平均长度(avg. length) | 4.21 | 4.64 |
GR-2 在成功率与平均长度上全面超过全部 baseline,建立新 SOTA。
Scaling:预训练视频预测验证损失(在 Ego4D / RT-1 / 自采机器人数据三个验证集上)随模型规模单调下降;微调后真机成功率也随规模稳定提升(S<B<L<XL)。
创新点与影响
贡献:
- 把视频生成预训练规模拉到 38M 片段 / 50B token(GR-1 的 ~47×),证明「海量人类活动视频 → 机器人操作泛化」这条路线可 scale。
- 提出「无损知识迁移」的新架构,使视频生成预训练先验能干净地进入动作微调,并在多任务 + 强泛化设定下展现可扩展性(模型越大越好)。
- 生成式 VLA:同时生成未来视频 + 动作轨迹,视频预测充当动作规划器,且视频与真机 rollout 高度一致——给出「改进视频生成即可迭代改进动作」的自我提升范式。
- 真机部署引入 WBC(轨迹优化 + 实时运动跟踪,200 Hz 关节控制),并演示工业化 bin-picking(透明/形变/反光物体)。
- 数据效率:5000 条轨迹(平均 50 条/任务)即可学 100+ 任务,大幅降低新技能/新环境的采集成本。
改变了什么:把「世界模型/视频预测」从辅助表征学习真正落到端到端 VLA 的动作输出上,为「用互联网视频而非图文 VLM 获取 web 知识」提供了强 baseline,也是后续 GR 系列与视频-动作联合建模工作的关键前身。
作者自述局限:
- Unseen Manipulation 仅 55.8%,是最弱环节;典型失败:① 抓不住新形状的未见物体;② 被要求抓某个未见物体时选错对象。
- 未来工作聚焦提升未见操作(新物体、新技能)的泛化与鲁棒性。
- 模型未开源(无 GitHub / HuggingFace 权重发布),复现依赖自建数据与真机系统。
原始链接
- 项目页(一手,canonical):https://gr2-manipulation.github.io/
- arXiv abs:https://arxiv.org/abs/2410.06158
- arXiv PDF:https://arxiv.org/pdf/2410.06158
- 技术报告 HTML 全文:https://arxiv.org/html/2410.06158v1
- 前作 GR-1:arXiv 2312.13139(Unleashing large-scale video generative pre-training for visual robot manipulation)
- 注:GR-2 无官方开源代码 / 权重(项目页仅有 Paper / YouTube / Bilibili / GR-1 链接)
一手源存档(sources/)
- bytedance-gr-2—project-page — 项目页快照
sources/embodied/2024/bytedance-gr-2--project-page.md - 技术报告全文见 arXiv
https://arxiv.org/html/2410.06158v1(arXiv 原文,不入 git)