一句话定位
RoboCat 是 Google DeepMind 2023-06 提出的视觉目标图像条件(visual goal-conditioned)多具身通用操作智能体:以 gato-a-generalist-agent 的自回归 decision transformer 为骨干、把图像用冻结的预训练 VQ-GAN 编码成离散 token,在同一个 1.18B 参数模型里控制 Sawyer / Panda / KUKA 等不同自由度、不同观测/动作空间、不同控制频率的多种真实机械臂;核心贡献是自我改进闭环——用 100–1000 条示教微调出专才、让专才在真机上自主采集约 1 万次数据、再把这些自生成数据并回训练集训练下一代通才,如此迭代使”在未见新任务上(500 示教微调)“的成功率从初版 36% 提升到最终版 74%。
背景与定位
RoboCat 出自 DeepMind(伦敦),2023-06-20 发 arXiv(Konstantinos Bousmalis、Giulia Vezzani 等并列一作,Nicolas Heess / Francesco Nori / Raia Hadsell 并列资深作者),同日配官方博客。它要解决的核心矛盾是:真实机器人学习长期是”一个任务训一个模型”,而采集真机数据受实时操作瓶颈、监督稀缺,跨机器人/跨任务复用异构数据一直很难。
范式命名:self-improving foundation agent for manipulation(可自改进的操作基础智能体),机制关键词是 visual goal-conditioning + hindsight goal relabelling + self-generated data loop。相对同期工作的定位:
- 直接前身 gato-a-generalist-agent(Gato, 2022):RoboCat 复用 Gato 的 transformer 架构与 proprio/action token 化流程,但把 Gato 的 ResNet patch tokeniser 换成冻结 VQ-GAN,并从”横跨 Atari/字幕/对话的通才但机器人能力很弱”收窄为专攻多真机操作,展示跨任务正向迁移与快速适配。
- rt-1(RT-1)/ palm-e / saycan:这些走的是语言条件路线(语言指令→transformer 策略,或 LLM 出高层规划);RoboCat 走目标图像条件——任何轨迹末帧都能当作 hindsight 目标,无需人工语言标注即可复用(含失败数据)。
- open-x-embodiment(2023-10,晚于 RoboCat)后来把跨具身数据聚合推向更大规模;RoboCat 是”单模型原生控制多真实具身、且不同观测/动作规格”的早期奠基作之一(论文自称是首个原生支持多真实具身、观测/动作规格各异的工作)。
- 与 diffusion-policy(连续动作扩散头)不同,RoboCat 用离散 token 自回归出动作。
它被 foundation-models-in-robotics 综述归入”generalist manipulation policy / self-improving”一脉。DeepMind 未开源代码或权重,一手材料只有 arXiv 论文与官方博客。
模型架构
总体范式:目标条件策略 π(aₜ | oₜ, gₜ),其中 oₜ=(xₜ, Iₜ) 为本体感受(关节位置/速度等)与图像观测,gₜ 为”任务完成态的示例图像”(只指示做哪个任务、不指定要精确到达的状态,成功只由末状态判定)。用自回归 transformer 建模,内部全部在 token 层面操作:
- 骨干:decoder-only transformer,架构沿用 gato-a-generalist-agent。主实验模型 1.18B 参数、24 层、embedding 维度 2048、post-attention 前馈隐层 8196。消融用更小模型(364M、62M;跨技能迁移分析里另有 400M 通才)。
- 图像 tokenizer(关键改动):冻结的预训练 VQ-GAN(Esser 2021,类 VQ-VAE),把每张图编码成 8×8=64 个离散 token(可提前一次性 token 化,大幅加速训练)。VQ-GAN 编码器为 ResNet(2 组 ×2 块)+ 3 层 attention,解码器 3 层 attention + ResNet(2 组 ×3 块);向量量化码本正文 D.2 记为 64 个 embedding、维度 128(消融图默认词表 4096,且发现增大词表反而损害测试泛化)。VQ-GAN 在 ImageNet + Gato 控制任务图像(Atari/MuJoCo)+ 本项目机器人操作图像的混合集上预训练——加入 ImageNet 对泛化明显有益(消融)。
- 本体/动作 token 化:沿用 Gato 流程;本体 token 数 L、动作 token 数 Q 随具身变化(不同臂自由度不同)。
- 动作头:离散 token 自回归预测(非连续回归、非扩散/flow)。
- 上下文与记忆:固定总长 1024 token(约 3 个时间步历史)。
- 辅助一致性损失:除动作 token 外,额外预测未来 k=5 步的图像 VQ-GAN token(Gato 只预测动作)——相邻帧太相似,预测 k=5 步未来 token 是”更难的自监督”,比 k=0、比预测未来像素都更利于泛化(消融:k 从 0→5 泛化相对提升约 50%,>5 反降)。
支持的具身与动作维度:Sawyer(sim 7-DoF / real 5-DoF)、Panda(sim+real 7-DoF)均配 Robotiq 平行夹爪;KUKA 14-DoF 配自研三指手,只在微调阶段出现、训练时未见。
数据
数据是 RoboCat 的核心资产,来自三类来源混合:
- RL 智能体数据:仿真结构搭建任务用 MPO 离线/在线 RL 训练的 per-task 专家策略生成(从状态训比从视觉训快得多;训 RoboCat 时丢弃物体位姿等特权信息)。真机 Sawyer 5-DoF stacking 走 sim-to-real + offline RL(沿用 RGB-Stacking benchmark)。
- 人类遥操作数据:用 3DConnexion SpaceMouse + web UI 采集;100+ 名遥操作员、来自 4 个国家、累计 >4000 小时人类示教。每集给不同语言指令(如”lift the apple”),另有”shuffle”集增加初始构型多样性、提升鲁棒性。
- 自生成数据:某任务积累到最少成功集数后,用 500 或 1000 条成功集微调出专才,再让专才在真机上自主采集(博客:每个新任务/臂平均练约 1 万次),配 hindsight 目标重标注并回灌训练集。
规模与结构:
- 共 253 个任务变体(240 训练 + 13 微调),归为若干任务族;含 2 个仿真 + 3 个真实具身、5 个仿真 + 11 个真实任务族、123 个仿真 + 134 个真实物体。评测覆盖 141 个训练任务变体。
- 36 台真机:15 Panda + 17 Sawyer + 4 KUKA。
- 物体集:116 个参数化 RGB 物体(结构搭建 benchmark)、NIST-i 齿轮 + 三孔基座(插入 affordance,公差 1 mm,真机基座可自由移动、更难)、YCB 水果 + YCB-i 蔬菜 + 碗、木质形状匹配玩具。
- 微调只用 100–1000 条目标任务示教。
- 博客口径:最终 RoboCat 训练集是”数百万条轨迹(millions of trajectories)“,含真机、仿真与自生成数据,覆盖 4 种类型机器人。
目标图像标注(免人工监督):hindsight 目标 = 用本集末帧当目标;语义等价目标 = 用同任务另一成功集的末帧当目标(需奖励模型判成功)。成功集两种目标都用,失败集只用 hindsight 目标。
训练方法
目标函数:token 级预测损失 = 动作 token 对数似然 + 未来图像 token(k=5)对数似然之和(式 3)。
生成器主训练(generalist):
- 优化器 AdamW,β₁=0.9、β₂=0.95、ε=1e-8,weight decay 0.1。
- 线性 warmup 15,000 步,随后 cosine 在 2,000,000 步内把学习率衰减为 1/10(最大/最小学习率因模型而异)。
- batch size 256、序列长 1024 token;预训练用 stochastic depth(每个子层以 0.1 概率跳过)。
微调(fine-tuning):从预训练权重初始化,用 Adam、常数学习率 1e-5、batch size 32、序列长 1024,最多 50,000 步;微调后得到专才但可能在原任务上退化(故需自改进闭环把新技能并回通才)。
自改进闭环(5 步,博客):① 采 100–1000 条新任务/臂示教 → ② 微调出专才 → ③ 专才真机自主练约 1 万次生成数据 → ④ 示教+自生成数据并入训练集 → ⑤ 重训 VQ-GAN 与新一代通才。整个过程可迭代。
真机自主采集的两个工程支撑:
- 奖励模型做成功检测:众包标注”任务在哪一步后算成功”→ 训二分类器;用于语义等价目标重标注与判断是否需要复位。检测器准确率约 90%,故最终评测不用它、改用人工目视计数以保准确。
- policy pool 做自主复位:利用”某任务的末状态 ∈ 另一任务的合法起始态”,把插入/移除等互为复位的策略组成池子轮转执行,实现无脚本复位、并提高机器人利用率与初始构型多样性(分 stateless 与基于状态两种池)。
无 RL 微调:RoboCat 的适配靠行为克隆式的示教微调 + 自生成数据回灌,而非在线 RL。
Infra(训练 / 推理工程)
- 训练硬件 / 加速器型号 / 数量 / GPU(TPU)-hours / 并行策略 / 精度:未披露。论文与博客均未给出训练所用 TPU/GPU 型号、卡数、训练时长或并行/精度细节。
- 推理 / 控制频率:任务控制频率 10–20 Hz(随任务而异,评测时与采集数据频率对齐;训练时不把控制频率喂给模型)。图像预先一次性 VQ-GAN token 化以省推理开销。未披露具体单步延迟、板载算力或边缘部署硬件。
- 机器人平台:标准化 cage + basket 工作空间(沿用 Lee 2021);36 台真机分布在多地,含远程与现场遥操作。
评测 benchmark
均为论文/博客一手数据,真机评测每任务对 100 集目视计数取平均(微调评测协议:每 5000 步评 25 集选最优 checkpoint,再对该 checkpoint 评 100 集)。
RGB-Stacking Mastery Benchmark(真机 Sawyer 5-DoF,与专才/Gato 对比,表 2):
| 方法 | T1 | T2 | T3 | T4 | T5 | 平均 |
|---|---|---|---|---|---|---|
| RoboCat | 87% | 70% | 82% | 93% | 68% | 80% |
| BC-IMP(专才, Lee 2021) | 75% | 61% | 74% | 95% | 88% | 79% |
| Gato(通才, Reed 2022) | 58% | 59% | 81% | 96% | 96% | 78% |
即:RoboCat 在此 stacking benchmark 上与专才/Gato 平均持平,但同时还能解大量其它操作任务。
训练任务成功率(单一 RoboCat 通才,表 1 部分族均值):仿真 Sawyer stacking 82%、Panda stacking 80%、tower building 60%、pyramid building 65%、NIST-i 齿轮 lifting 88%(各族均在同一模型内完成)。
自改进带来的提升(博客头条数字):在未见新任务上用 500 条示教微调,初版 RoboCat 成功率仅 36%,训练数据更多样的最终版翻倍多到 74%。
跨具身快速适配:全新 KUKA 14-DoF 三指臂(自由度是训练所见两指臂的两倍、训练时完全未见),观测 1000 条人类示教后齿轮 lifting 成功率 86%;RoboCat-lim 在真机 blue-on-green stacking 上 500 示教微调达 88%,对比 Gato 同数据 60%。
对比 VFM 基线:训练/评测了 59 个视觉基础模型基线,选出最强两个作主基线——NFNet-f6(438M, CLIP 预训练) 与 Swin-L(197M, CLIP 预训练),每任务用相同 BC 损失与相同成功集单独微调。结论:仅 1000(甚至 500)条示教时,微调后的 RoboCat 远好于这些 VFM 基线(图 6),后者表现很差。
跨任务正向迁移:训更多任务的完整 RoboCat 在”RoboCat-lim 训练过的那批任务”上反而优于更专的 RoboCat-lim;从 400M 升到 1.2B 完整版,齿轮插入失败(固定/移动基座)减少约三分之二——训更大模型 + 更多样”bring-to-pose”数据有正迁移。
创新点与影响
贡献:
- 首次证明单个大 transformer 序列模型能在多个真实机器人具身、且观测/动作规格各异上解一大批灵巧任务(论文自述)。
- 视觉目标图像条件 + hindsight 重标注:任何轨迹末帧皆可作目标,无需额外人工监督即可复用数据(含次优/失败数据),为自改进提供天然接口。
- 冻结 VQ-GAN token + 未来 token 预测:相对 Gato 的 patch ResNet,显著改善对留出任务的泛化,且图像可预 token 化加速训练。
- 自改进闭环:微调专才→真机自采数据→并回训通才的可迭代流程,是”自主扩充技能、越学越快学”的一个基本构件——数据越多样、微调新任务越省样本。
改变了什么:把”目标图像条件 + 自生成数据回灌”确立为跨具身通用操作策略的一条可行范式;与语言条件的 rt-1/palm-e 并列成为 2023 年通用操作策略的代表路线之一,为后续跨具身聚合(open-x-embodiment)与 self-improvement 类工作提供参照。
论文自述局限:
- 奖励模型准确率仅约 90%,尚不足以完全自动化评测,最终仍靠人工目视计数;未来需提升奖励模型精度以闭合这一步。
- 自生成数据源自”在示教上微调过的 RoboCat”,因此行为接近遥操作风格,多样性受此制约。
- 仿真与真机只做了粗对齐(未做仔细系统辨识、图像不逼真、只随机化物理参数不随机化视觉外观)。
- 仍是”迈向”基础智能体的一步(a step towards),自改进的迭代深度与规模有限。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2306.11706
- 论文 PDF:https://arxiv.org/pdf/2306.11706
- 论文 HTML 全文:https://arxiv.org/html/2306.11706v1
- 官方博客(Google DeepMind):https://deepmind.google/discover/blog/robocat-a-self-improving-robotic-agent/
- 代码 / 权重:未开源(DeepMind 未发布 RoboCat 的 code / model card / HF 仓库)
一手源存档(sources/)
- robocat—blog — Google DeepMind 官方博客快照(sources/embodied/2023/robocat—blog.md)
- arXiv 论文全文(2306.11706)仅引用链接,原文 PDF/HTML 不入 git