一句话定位
CrossFormer 用一套 130M 参数的 transformer 策略权重,在 900K 条轨迹、20 种具身(单臂/双臂机械臂、轮式导航机器人、四足机器人,外加零样本迁移到四旋翼无人机)上联合训练,不做任何观测或动作空间的人工对齐,真实机器人上平均 73% 成功率,既打平各具身的专用 SOTA 方法(51%),也打平只用目标机器人数据训练的同架构基线(68%),并以约 3 倍成功率优势超过此前最强的跨具身对齐方法。CoRL 2024 Oral(Top 4%)。
背景与定位
机器人学习的核心瓶颈是每个平台、每个任务的数据都稀缺;open-x-embodiment(OXE)这类跨机构数据聚合让”在多机器人数据上训一个通用策略”成为可能。但已有的规模化尝试普遍先把数据裁剪成统一格式再联合训练:octo 只用 OXE 里单臂机械臂的子集,未涉及更异构的具身;早期跨具身导航工作(如 gnm-general-navigation-model)把所有地面机器人统一成”以自我为中心相机视角 + 2D waypoint”格式;Yang et al.(arXiv 2402.19432, Pushing the Limits of Cross-Embodiment Learning for Manipulation and Navigation)进一步把导航与操作也拉进同一个动作空间,靠”腕部相机的自我运动看起来很像导航相机的自我运动”这一观察做手工动作对齐,但只覆盖两种动作空间,且评测局限于标准化场地。Gato(Reed et al. 2022)与 RoboCat(Bousmalis et al. 2023)虽用灵活 transformer 处理不同 DoF 的机械臂(4/6/7/14-DoF),但评测同样只在标准化 cage 里做单臂操作。
CrossFormer 的定位是把”序列到序列”的 transformer-first 范式(继承 Octo/Gato/RoboCat 一脉)推向观测和动作空间完全不共享的四类具身:单臂/双臂操作、地面导航、四足关节级运动控制,首次把它们放进同一批次联合训练,且不要求任何跨具身的观测或动作对齐。这也是第一个把腿足机器人低层 12 维关节动作(而非高层 2D waypoint)纳入跨具身联合训练的工作。方法与后续 hpt-heterogeneous-pretrained-transformers 等”如何吸收异构机器人数据”的探索同属一个谱系。代码基于 Octo codebase 构建,作者来自 UC Berkeley(Sergey Levine 组)与 Carnegie Mellon University。
模型架构
骨干:12 层、8 个注意力头、MLP 维度 2048、token embedding 维度 512 的 decoder-only causal transformer,采用 block-wise causal attention mask——每个时间步的观测 token 只能 attend 同一或更早时间步的观测 token。上下文窗口固定为 2135 token,容纳 k=5 个时间步的观测历史(含全部观测与 readout token 组);作者发现导航任务需要 5 步历史才能取得好效果,且该上下文长度不影响其他具身的表现。总参数量(含图像编码器与动作头)130M。
观测 tokenizer:图像用 ResNet-26 编码器(ImageNet 预训练初始化)处理,flatten 空间维度后投影到 token embedding 维度;本体感知(proprioception)直接线性投影。为最大化跨具身迁移,同类型相机视角共享编码器权重,全模型共 4 个图像编码器:操作场景第三人称视角 1 个、导航自我中心视角 1 个、腕部相机 2 个(单臂/双臂各一)。策略支持任意子集的以下 5 种观测类型:Workspace Image(操作第三人称)、Navigation Image(导航自我中心)、Wrist Image(腕部相机)、Quadruped Proprioception(四足关节位置+速度估计)、Bimanual Proprioception(双臂关节位置)。
任务指定:接受语言指令或目标图像两种模态,语言指令与图像观测通过 FiLM 联合处理;目标图像沿 channel 维度与当前图像拼接后一起输入图像编码器。训练时若某条轨迹同时有语言和目标图像标注,会随机 mask 其中一种,使策略在两种任务指定模式下都能被 condition(测试时可任选)。
动作预测:沿用 Octo 的做法,在每个时间步的观测 token 之后插入一组 readout token(只能 attend 之前的观测 token,不被观测 token 反向 attend),其输出 embedding 送入对应的动作头。选择连续动作回归 + L1 loss(而非 diffusion 或离散 token 分类),readout token 数量与该具身的动作 chunk size 对齐。共 4 个动作头:
| 动作头 | 维度 | Chunk 大小 | 执行频率 |
|---|---|---|---|
| 单臂 Cartesian(末端相对位姿 + 夹爪) | 7 | 4 | 5–15Hz |
| 导航 waypoint(相对当前位置的 2D 目标点) | 2 | 4 | 4Hz |
| 双臂关节位置(两臂 joint position) | 14 | 100 | 20Hz |
| 四足关节位置(腿部 joint position) | 12 | 1(不做 chunk) | 20Hz |
(注:CrossFormer 项目主页在 CoRL 2024 camera-ready 之后更新的文本中把双臂控制频率写为”50hz”,与 arXiv v1 论文正文/附录一致写明的 20Hz 不符——两处口径不一致,此处如实并列,未强行调和。)
工程上采用固定 padding 而非稠密打包:缺失的观测类型被整体 mask 掉,而不是压缩序列腾出更多时间步;代价是牺牲一些内存效率,换来的好处是 readout token 的位置编码本身就能指示要预测哪类动作,模型不需要额外的”具身前缀 token”来判断当前是哪种机器人。
数据
训练数据合计 900K 条轨迹,20 种机器人具身(跨观测空间、动作空间、控制频率的巨大差异)。构成:
- Open X-Embodiment 单臂子集(与 Octo 相同的约 23 个子数据集,采样权重从 Fractal 17%、Kuka 2.2%、BC-Z 2.2% 一路到 DLR EDAN Shared Control 0.019%、DROID 0.022% 不等,Appendix Table 1 逐一列出);
- DROID(droid,大规模 Franka 操作数据集);
- ALOHA-multi-task:本项目自采,两所机构合作采集的 7K 条 ALOHA 双臂轨迹;
- GNM(gnm-general-navigation-model)导航数据集,60 小时;
- Go1-walk:本项目自采,25 分钟四足行走数据,来自一个先在仿真中用 RL 训练好的专家策略 rollout 产生;
- Franka-tabletop:本项目自采,200 条额外 Franka 轨迹。
其中 Bridge/BridgeData(bridgedata-v2,WidowX 评测目标数据集)、ALOHA-multi-task、GNM、Go1-walk、Franka-tabletop 被作者标记为各评测设置对应的”目标数据集”(target dataset),在采样权重上做手工上采样:Bridge/GNM/ALOHA-multi-task 各占批次采样权重 17%,Go1-walk 与 Franka-tabletop 各占 8.5%,其余单臂 OXE 子集合计约 32%。数据来源以真机 teleoperation 为主(OXE 子集、Bridge、ALOHA、Franka-tabletop),Go1 数据例外——来自仿真 RL 专家策略的 rollout,属于 sim-to-real 迁移的动作标签。动作标签直接沿用各数据集自身的原生动作表示,不做跨具身对齐;训练时用 hindsight goal relabeling(从轨迹里随机采样未来观测作为目标图像)扩充目标图像监督。论文自陈局限:采样权重是手工挑选的(为避免对重复片段多的数据集过采样、对评测最相关数据欠采样),并非自动学出的配比。
训练方法
单阶段联合模仿学习预训练(无 RL、无多阶段 pipeline),全部 20 种具身共享同一批次、同一组权重训练。目标函数为动作头输出与真值动作的 L1 回归 loss。优化器 AdamW,学习率 3e-4,warmup 2000 步,inverse square-root decay 学习率调度,weight decay 0.1,梯度裁剪阈值 1.0,batch size 512,共训练 300K 步。图像增强用 color jitter + 随机 resize/crop。训练中用 hindsight goal relabeling 采样未来观测作为目标图像;若某条轨迹同时有语言与目标图像标注,随机 mask 其中一种以支持两种任务指定模式。checkpoint 依据验证集 MSE 挑选(作者发现该指标与真机表现”大致但不精确地相关”)。
Baseline 设置:为公平对比,“single-robot dataset baseline”(只用目标数据集训练的同架构模型)因数据量小而缩小模型规模,各设置从 5M 到 95M 参数不等,以避免过拟合;跨具身对齐对比方法 Yang et al. 2024 的策略为作者原始训练的 186M 参数模型,直接复用,未重新训练。
Infra(训练 / 推理工程)
训练硬件为 TPU v5e-256 pod。训练耗时存在论文内部口径不一致:正文(Section 3.4)与 GitHub README 均写”300K 步、batch 512,耗时 47 小时”,而附录 B(Table 2 之后的正文)写”Training took 80 hours on a TPU V5e-256 pod”——同一篇论文两处数字不同,此处如实并列,未做取舍。未披露具体 GPU/TPU-hours 换算、FLOPs 或参数-数据 scaling 曲线。
推理部署:操作类评测在**连接机器人的 NVIDIA 4090(或类似 GPU)**上直接跑模型;地面导航与无人机评测则在独立服务器上运行模型,通过无线网络下发动作指令。各具身的执行控制频率见”模型架构”表格(单臂 5–15Hz、导航 4Hz、双臂 20Hz、四足 20Hz);未披露具体推理延迟(ms)或 FPS 数字。
评测 benchmark
评测覆盖 5 种真实机器人设置 + 1 种零样本新具身,共 116 次 trial,Table 3 给出逐任务细分(括号内为该任务 trial 数,格式为 single-robot baseline / best prior method / CrossFormer):
- WidowX(Bridge setup,over-the-shoulder 相机,共 48 trials):spoon-on-cloth 0.25/0.25/0.25(各 12 次);mushroom-in-pot 0.00/0.17/0.25(各 12 次);cloth-on-saucer 0.75/0.67/0.75(各 12 次);carrot-on-plate 0.67/0.25/0.33(各 12 次)。Best prior method = octo。
- Franka(DROID setup,共 39 trials):sweep pinecones into dustpan 0.41/0.52/0.41(各 27 次);flip pot upright 0.83/0.67/0.83(各 12 次)。Best prior method = openvla。
- ALOHA 双臂(3 相机视角,共 20 trials):uncap pen 0.60/0.70/0.80(各 10 次);cut sushi with knife 0.40/0.30/0.60(各 10 次)。Best prior method = aloha-act(ACT)。
- LoCoBot 导航(共 6 个地点评测,每地点每策略 1 次 trial,按 3 项技能拆分、每项技能 2 次):obstacle avoidance 0.95/0.30/0.95;cornering 0.95/0.85/0.95;sharp cornering 0.85/0.30/0.88。Best prior method = vint-foundation-model-visual-navigation(ViNT)。
- Tello 四旋翼(零样本迁移,训练时未见过四旋翼数据,复用导航头,3 个地点各 1 次):cornering 0.68/0.68/0.82。
- Go1 四足(25 分钟 rollout,reward 按 RL 专家策略归一化):1.0 / N/A(无合适的模仿学习基线)/ 1.0。
总平均(116 trials,Go1 不计入 best-prior 均值):CrossFormer 0.73,single-robot dataset baseline 0.68(正文摘要处四舍五入写作”67%“,与 Table 3 汇总的 0.68 存在小数点差异),best prior method 0.51。
与跨具身对齐 baseline(Yang et al. 2024, 186M 参数)对比:CrossFormer 在 LoCoBot 导航全部三种复杂任务及 WidowX 操作上均明显更优,项目主页量化为平均约 3 倍成功率优势;定性上导航路径更平滑、少 stop-and-go。在 WidowX 设置中 Yang et al. 得到零成功率——尽管其训练数据同样包含 Bridge 数据及额外自采 WidowX 数据;作者推测原因是 Yang et al. 训练时第三人称视角与腕部视角共享同一输入槽位,导致对第三人称控制欠拟合,而 CrossFormer 因缺乏公开的 WidowX 腕部相机数据,本就只用第三人称视角。
创新点与影响
- 首次不做任何观测/动作空间人工对齐,将单臂操作、双臂操作、地面导航、四足关节级运动控制四种截然不同的动作空间联合放进同一策略训练(此前最多两种,如 Yang et al. 2024 只对齐导航与操作)。
- 证明”用一套架构联合吸收异构具身数据不产生负迁移”:跨具身联合训练版本(73%)与只用目标数据训练的同架构基线(68%)表现相当,同时打平/超过各具身专门调优的 SOTA 专用方法(51%)。
- 论文自陈局限(Discussion 原文):(1) 目前尚未观察到显著的正向迁移——跨具身协同训练目前只做到”不掉分”,作者推测随着数据集与具身规模增大会看到更明显的正迁移;(2) 数据混合的采样权重是手工设定的,理论上模型规模足够大时不再需要这种权重调整;(3) 随着模型规模增长,推理速度会成为控制高频具身的瓶颈——本工作已能支撑 20Hz 的精细双臂操作,但更大模型未来可能难以支撑更高频具身,需要硬件与推理加速方面的后续研究;(4) 未来方向包括提升跨具身正迁移的技术、数据 curation 方法,以及纳入次优机器人数据或无动作标注的人类视频等更多样数据源。
- CoRL 2024 Oral(Top 4%);是”跨具身通用机器人策略”谱系里首个同时覆盖单臂、双臂、地面导航、四足、四旋翼五类硬件形态的工作,为后续 hpt-heterogeneous-pretrained-transformers 等异构机器人数据吸收方法提供先例。
原始链接
- arXiv: https://arxiv.org/abs/2408.11812
- arXiv PDF: https://arxiv.org/pdf/2408.11812
- GitHub: https://github.com/rail-berkeley/crossformer
- HuggingFace 模型: https://huggingface.co/rail-berkeley/crossformer
- 项目主页: https://crossformer-model.github.io/
一手源存档(sources/)
- crossformer-cross-embodied-learning—github-readme — GitHub README(安装、checkpoint、预训练/微调命令,含”47 小时”训练耗时口径)
- crossformer-cross-embodied-learning—hf-card — HuggingFace model card
- crossformer-cross-embodied-learning—project-page — 项目主页(CoRL 2024 Oral 标注、评测视频说明、“30 种具身/50Hz”更新口径)
- arXiv 原文 PDF(不入 git):https://arxiv.org/pdf/2408.11812