一句话定位
GR-3 是字节跳动 Seed 团队 gr-1、bytedance-gr-2 之后的第三代通用机器人 VLA 模型:Qwen2.5-VL-3B 主干 + 动作 diffusion transformer 的 mixture-of-transformers 架构,用机器人轨迹 + 网页视觉-语言数据 + VR 采集的人类轨迹三类数据联合训练,配自研的 22-DoF 双臂移动机器人 ByteMini,在指令跟随泛化、长程双臂桌面清理、柔性物体(挂衣服)操作三类任务上全面超过 π0 基线。
背景与定位
VLA 路线(RT-2、π0、groot-n1、gemini-robotics 等)普遍面临两个瓶颈:一是分布外指令(新物体类别、需要抽象概念推理的描述)跟随差;二是长程、涉及柔性物体的灵巧任务因误差累积而不稳健。GR-3 延续 GR-2(bytedance-gr-2,生成式视频预训练路线)之后,转向”预训练 VLM + flow-matching 动作头 + 三源数据 co-training”的路线,并新增用 VR 设备采集人类轨迹做少样本适配这一环,试图同时解决泛化、数据效率、长程鲁棒性三个问题。论文里的直接基线是 Physical Intelligence 的 π0(用官方 openpi 仓库在同样任务上微调)。
模型架构
GR-3 是一个端到端 VLA 策略 π_θ(a_t | l, o_t, s_t),采用 mixture-of-transformers 架构:
- VLM 主干:预训练 Qwen2.5-VL-3B-Instruct,处理多路相机观测图像与语言指令。
- 动作头:一个 action diffusion transformer(DiT),用 flow matching 做动作预测;层数为 VLM 主干层数的一半,且只使用 VLM 后半部分层的 KV cache(而非全部层),以保证推理速度。
- 总参数量:4B(VLM + action DiT 合计)。
- 动作表示:k 步动作 chunk a_t = a_{t:t+k},表示为 k 个 token 后与机器人状态 token 拼接,作为 action DiT 的输入序列;flow matching 的时间步 τ 通过 AdaLN(adaptive layer norm)注入;DiT 内使用因果注意力掩码建模 chunk 内部的时序依赖。
- 训练加速:对同一次 VLM 前向,采样多个 flow matching 时间步计算 loss,减少重复的 VLM 前向次数。
- 推理积分:动作从随机噪声 a_t^{τ=0}~N(0,I) 出发,用 Euler 法从 τ=0 积分到 τ=1,步长 Δτ=0.2(即 5 步积分完成一次动作 chunk 采样)。
- 稳定性设计:早期实验发现训练不稳定,借鉴 QK-Norm 思路,在 DiT block 内的注意力与 FFN 线性层后都加了额外的 RMSNorm;消融显示这一改动不仅大幅提升训练稳定性,还显著提升指令跟随能力(GR-3 w/o Norm 在 IF 设置尤其是 Novel Destinations 上明显变差)。
- 任务状态(task status)辅助监督:给动作追加一维状态标签 Ongoing(0)/Terminated(1)/Invalid(-1)。训练时随机把语言指令替换成与当前观测不匹配的”无效指令”,只监督模型预测 Invalid 状态,强迫模型真正关注语言条件而非利用多视角的虚假相关性;消融显示去掉 task status 会明显削弱 IF 能力。
数据
三类数据来源,分任务/阶段使用:
- 机器人轨迹数据(模仿学习):真人遥操作采集,配一个”数据采集调度器”提前给遥操作员指定动作、物体组合、背景设置以最大化多样性,采集后再做质量筛查过滤无效/低质量轨迹。三个评测任务的具体规模:
- 可泛化拾取放置任务:35k 条轨迹,覆盖 101 个物体,共 69 小时,用”把 A 放进 B”模板标注。
- 长程桌面清理(table bussing)任务:约 101 小时机器人轨迹。
- 柔性物体(挂衣服)任务:116 小时机器人轨迹。
- 网页规模视觉-语言数据(co-training):从多个公开数据源(含 Seed1.5-VL 内部数据、CLEVR、LLaVA-NeXT-Interleave、GLaMM 像素级 grounding、xGen-MM/BLIP-3 等)curate 而来,覆盖图像描述、视觉问答、图像 grounding、交错式 grounded image captioning 等任务;另建了一套过滤 + 重新标注 pipeline 提升数据质量。训练时以 mini-batch 为粒度、等权重动态混合 VL 数据与机器人轨迹;VL 数据只用 next-token-prediction 目标训练 VLM 主干(不训练 action DiT),机器人轨迹数据同时训练 VLM 主干和 action DiT。
- 人类轨迹数据(VR 遥操作,少样本泛化):用 PICO 4 Ultra Enterprise 采集第一人称视频 + 人手轨迹,用与机器人轨迹相同的标注 pipeline 打语言标签。VR 采集速率约 450 条轨迹/小时,显著快于遥操作机器人的约 250 条轨迹/小时。人类轨迹只有第一人称视角和手部轨迹,没有机械臂关节状态/夹爪状态,因此腕部相机视角用空白图像填充,只用手部轨迹做训练监督。少样本实验中,对 45 个未见物体每个采集最多 10 条人类轨迹,共 450 条、总时长约 30 分钟。
训练方法
- 目标函数:机器人轨迹上是 flow-matching 回归损失(式 2:预测 velocity field 与真值 a_t-ε 的 L2),叠加 VL 数据上的 next-token-prediction 交叉熵,两者按 mini-batch 等权混合。
- 两阶段流程:先用机器人轨迹 + VL 数据联合训练得到基础 checkpoint;再在此基础上引入人类轨迹数据,三类数据一起做额外 20k 步的 co-training 完成少样本适配(论文未披露第一阶段的具体训练步数/超参)。
- 消融变体:GR-3 w/o Co-Training(只用机器人轨迹,无 VL 数据)、GR-3 w/o Norm(去掉 DiT 内额外 RMSNorm)、GR-3 w/o TS(去掉 task status 监督),均用于验证各组件对指令跟随/泛化能力的贡献。
- 控制侧:策略输出的动作 chunk 经过 pure pursuit 与轨迹优化,用实时参数化优化最小化 jerk,保证 waypoint 之间及不同 rollout 之间的平滑衔接。
Infra(训练 / 推理工程)
- 训练 GPU 数量 / GPU-hours / 并行策略 / 精度:论文未披露。
- 训练步数:仅披露人类轨迹少样本适配阶段的 20k 步;预训练阶段步数未披露。
- 推理侧速度指标(FPS / 控制频率 / 端到端延迟):论文未披露具体数值,只说明 action DiT 层数为 VLM 主干的一半、仅用后半部分 VLM 层的 KV cache 是专门为”保证快速推理”所做的架构选择。
- 机器人本体(ByteMini):22-DoF 双臂移动机器人;每臂 7-DoF,采用球形腕关节配置,肘部内收角可达 2.53 rad,兼顾类人灵巧性与紧凑腕部尺寸;移动平台为全向底盘 + 升降机构;执行器基于 Quasi Direct Drive(QDD)原理提升稳定性与透明度;集成便携屏幕、NUC 与双锂电池,续航超 10 小时;配无线急停;头部与双腕各装 RGBD 相机(腕部相机用于近距离精细操作观测)。
- 策略 rollout 时的控制自由度:预测的动作 chunk 用于控制 19 个 DoF(排除升降机构与头部的 3 个 DoF)。
- teleoperation 系统:全身柔顺控制框架把所有 DoF 当作一个整体,把任意遥操作人体动作重定向为可行机器人动作,同时做可操作性优化、奇异性规避、关节限位约束;数据采集阶段用 Meta VR Quest 做全身遥操作,可同时控制双臂、升降、夹爪与移动底座。
评测 benchmark
三个真实世界任务,基线统一为按官方 openpi 仓库在对应任务数据上微调的 π0:
1) 可泛化拾取放置(IF rate / success rate 双指标):
- Basic / Unseen Environments:GR-3 与 GR-3 w/o Co-Training 表现接近,均超过 π0,说明 VL co-training 在见过的物体上无明显增益。
- Unseen Instructions(含大小/空间关系/常识等抽象概念指令):success rate π0 40% → GR-3 77.1%。
- Unseen Objects(45 个未见物体,其中逾 70% 属训练轨迹中未见类别):success rate π0 40% → GR-3 57.8%;且 GR-3 w/o Co-Training 反而不如 π0,作者推测 π0 的优势来自其大规模跨本体预训练,凸显 VL co-training 对 GR-3 泛化能力的关键作用。
- 少样本人类轨迹微调(Unseen Objects 子集):以每物体 1/5/10 条人类轨迹递增微调,success rate 从零样本的 57.8% 提升到 10-shot 的 86.7%,且未观察到对已见物体性能的明显下降。
2) 长程桌面清理(table bussing):
- Flat 设置(单一”清理餐桌”指令,5 组不同物体,指标为平均任务进度):GR-3 与 π0 均表现尚可。
- IF 设置(6 组子任务指令:Basic / Multiple Objects / Multiple Destinations / Multiple Objects & Destinations / Novel Destinations / Invalid Tasks,指标为平均子任务成功率):success rate π0 53.8% → GR-3 97.5%。π0 无法区分叉子和勺子,在 Novel Destinations 下倾向把物体放进训练中常共现的容器而非按指令执行;GR-3 在全部六组测试中严格跟随指令,并能在 Invalid Tasks 中正确拒绝执行。
- 消融:去掉 RMSNorm(GR-3 w/o Norm)在 IF 设置尤其 Novel Destinations 上明显退化;去掉 task status(GR-3 w/o TS)同样导致 IF 能力下降。
3) 柔性物体操作(挂衣服)(平均任务进度,1.0 为完全成功,分解为拿衣架/挂右肩/挂左肩/挂上晾衣杆四个里程碑):
- Basic(6 件训练中见过的衣服):GR-3 86.7%。
- Position(旋转/揉皱衣服布局):GR-3 83.9%。
- Unseen Instances(4 件未见衣服,含 2 件训练数据中没有的短袖款式):GR-3 75.8%。
- 均超过 π0;两模型共同的最大失败点是”挂完右肩后挂左肩”(左侧衣领常被衣架遮住难以抓取),以及挂衣过程中衣架从夹爪滑脱。
创新点与影响
- 贡献:把”机器人轨迹 + 网页 VL 数据 co-training”与”VR 采集人类轨迹的少样本跨本体适配”整合进同一个 mixture-of-transformers VLA,并给出两个被证明关键的架构/训练细节——DiT 内额外 RMSNorm(稳定训练 + 提升指令跟随)与 task status 辅助监督(强迫模型真正依赖语言条件);同时发布自研的 ByteMini 双臂移动机器人本体。
- 改变了什么:证明了人类第一人称 VR 轨迹(450 条/小时的采集效率)可以在极少样本(10 条/物体)下有效跨本体迁移到机器人策略,为”机器人数据采集成本高”提供了一条比纯遥操作更快的补充路径;同时用三个真实长程/灵巧任务(而非仅短程原子技能)系统验证了 VLA 的鲁棒性。
- 作者自陈局限:面对涉及新概念/新物体的分布外指令仍会出错,对未见形状物体的抓取能力不足;和所有模仿学习方法一样,rollout 中一旦进入分布外状态就难以恢复;论文提出未来计划扩大模型与数据规模,并引入强化学习强化复杂灵巧任务上的鲁棒性、突破模仿学习的性能上限。GR-3 本身未开源代码/权重,项目页面同时列出了后续工作 Seed GR-RL(本报告不涉及其细节)。
原始链接
- 论文(arXiv):https://arxiv.org/abs/2507.15493
- 论文 PDF:https://arxiv.org/pdf/2507.15493
- 官方项目页:https://seed.bytedance.com/GR3
一手源存档(sources/)
- bytedance-gr-3—project-page.md — 官方项目页快照
- arXiv 2507.15493 全文:见上方 arXiv 链接(arXiv 原文 PDF,不入 git)