一句话定位
UC Berkeley 用 MAE(掩码自编码器)在 450 万张互联网 + 第一人称视频图片上做自监督视觉预训练,冻结编码器后接一个轻量 BC 策略头,在 xArm 机械臂与 Allegro 多指手两种真机本体、六个任务、981 次真机试验中稳定超过 CLIP、监督 ImageNet 预训练与从零训练;证明了”模型与数据必须同步放大”,并把当时最大的 3.07 亿参数视觉编码器首次部署到真实机器人上。
背景与定位
本文是作者团队前作 Masked Visual Pre-training for Motor Control(Xiao et al., arXiv:2203.06173,仅在仿真中验证)向真机的延伸:数据量扩大 7 倍、模型放大 15 倍、并补齐大规模真机评测。范式上它属于”冻结视觉表征 + 独立训练控制头”一路——用单个视觉编码器服务所有下游任务与本体(对照 Figure 2 “One encoder for all robots and tasks”),区别于端到端联合训练视觉与动作的方案。
方法论选择上强调”图像自监督、不依赖任何跨域监督”:与同期投稿同一会议(CoRL 2022)的 R3M(Nair et al., arXiv:2203.12601)形成直接对照——R3M 依赖 ego4d 自带的图文/视频-语言标注做时间对比学习+语言监督,而本文仅用纯图像的 MAE 自监督,不需要任何文本标注,因而能吃下互联网上未经筛选的海量图片(如 ImageNet)。也与有监督预训练路线(如用 clip 的图文对比预训练特征,或 ImageNet 分类监督特征)做正面比较。预训练数据主力来自 ego4d(3,670 小时第一人称视频,9 个国家)。
模型架构
- 视觉编码器:标准 ViT(Dosovitskiy et al. 2020),提供三档:ViT-S 22M、ViT-B 86M、ViT-L 307M 参数。ViT-L 在 224×224 输入下约 64 GFLOPs,约为常用 ResNet-50 的 15 倍——作者称是当时部署到真实机器人上的最大视觉模型。
- 自监督目标:masked autoencoder(MAE, He et al. 2021)——随机遮盖图像 patch(掩码率 75%),非对称”重编码器+轻解码器”结构重建被遮内容;沿用辅助 dummy classification token 以便迁移到下游机器人任务。
- 无 VLM / 无语言监督:纯图像自监督,不使用任何文本-图像配对(与 CLIP 图文对比、R3M 的视频-语言监督形成对照)。
- 策略头(action head):编码器权重全程冻结,图像特征与本体感知状态(仅关节位置,不含速度、不显式引入末端位姿)线性投影到联合嵌入空间后,输入四层 MLP(SeLU 激活),隐藏层 [256, 128, 64](多数任务)或 [512, 256, 128](PickSink 任务),回归输出下一时刻的关节角增量(连续回归式动作头,非离散 token / 非 diffusion)。
- 跨本体:同一冻结编码器同时服务两种本体——7 自由度 UFACTORY xArm7 机械臂 + 1 自由度平行夹爪(控制频率 5 Hz,第一视角腕部 RealSense 相机、不使用深度信息),以及 Allegro 多指灵巧手;每个任务/本体各自训练一个轻量 BC 头,编码器本身不针对本体或任务做任何微调。
数据
- 预训练语料(“Ego” 数据集)总规模 450 万张图片,由五个来源拼接:
- ego4d 按 0.2 fps 抽帧 → 260 万帧(覆盖 9 个国家的日常生活第一人称视频)
- ImageNet → 120 万张
- 前作 HoI(hand-object interaction)数据 70 万张:Epic Kitchens(1 fps 抽帧)+ Something-Something(0.3 fps 抽帧)+ YouTube “100 Days of Hands”
- 总计 450 万张,是前作仅用 70 万张 HoI 数据的 6.5 倍
- 预训练轮数:组合 Ego 数据集训练 400 epoch;纯 HOI 数据集训练 1600 epoch;ImageNet(用于监督基线)训练 1600 epoch
- 无机器人动作标注:预训练语料是纯图像自监督,不含任何动作/机器人标签
- 下游示教数据:每个任务 80 条人类示教轨迹,多数任务用 HTC Vive VR 动作捕捉遥操作采集(约 1 小时采集 40 条),CloseFridge 等难以用手柄操作的任务用运动学示教(kinesthetic teaching);采样效率实验中示教数从 20 条扫到 80 条
- 全真实数据、无仿真:预训练图片(互联网 + 第一人称视频)与下游示教(真机遥操作)均为真实世界采集,不涉及仿真数据或 sim-to-real 迁移
- 评测规模:16 组系统化环境变化(物体/机器人位置扰动)× 多个任务/模型,累计报告 981 次真机试验
训练方法
- 两阶段流水线:(1) MAE 自监督预训练视觉编码器;(2) 编码器冻结,逐任务用行为克隆(behavior cloning, BC)训练轻量 MLP 策略头,仅回归关节角增量
- MAE 训练配方沿用 He et al. 2021,具体超参延续前作(arXiv:2203.06173)设置;掩码率 75%
- 策略训练为标准监督式 BC 回归,无 RL、无蒸馏、无离散动作 token 化
- 微调消融:额外尝试端到端微调 ViT-S(HoI) 与 CLIP ResNet-50(编码器随策略一起训练)——仅带来边际提升,无法弥补与更优预训练表征之间的差距,说明表征质量本身比是否微调更关键
- 关键超参:掩码率 75%、MLP 隐藏层 [256,128,64]/[512,256,128]、SeLU 激活、xArm 控制频率 5 Hz
Infra(训练 / 推理工程)
- 预训练算力(GPU 数 / GPU-hours / 并行策略 / 精度):未披露(论文正文与附录均未给出)
- 真机推理:xArm 控制频率 5 Hz(示教采集与在线控制共用),第一视角腕部 RealSense 相机、不使用深度;未披露策略推理延迟/FPS 的独立数字(隐式受限于 5 Hz 控制频率)
- 硬件:低成本 UFACTORY xArm7 七自由度机械臂 + 1 自由度平行夹爪;Allegro 多指灵巧手;遥操作用消费级 VR 设备(HTC Vive 六自由度手柄 + Meta Quest 2 手部追踪),仅用于示教采集,不参与推理
评测 benchmark
六任务、两本体,累计 981 次真机试验;ViT-B 为基线对比统一使用的编码器规格。
- 基础运动任务(ReachBlock / PushCube / PickCube,Figure 4):本方法(Ours)相较 CLIP、监督 ImageNet 预训练(Sup.)、从零训练(Scratch)均有显著优势;CLIP 是三个基线中最强的,且排名在各任务间保持一致(图表数值,正文未给出精确百分比)
- 样本效率(Figure 5):本方法用 40 条示教(demo=20~80 扫描)即可达到 CLIP 用 80 条示教的性能,即示教量减半仍追平最强基线
- 复杂场景/物体泛化(CloseFridge / PickFruit / PickSink,Figure 6,均用 ViT-B):本方法优势幅度比基础任务更大,作者认为这说明其表征捕捉了更精细的空间结构,在真实复杂场景中收益更大
- 与并发工作 R3M 的量化对比(Table 1,PickFruit 任务,success rate):
- R3M ResNet-50(video-text 监督,23M 参数):31.3%
- CLIP ViT-B(image-text 监督,86M 参数):18.8%
- Ours ViT-S(image-only 自监督,22M 参数):68.8%
- Ours ViT-B(image-only 自监督,86M 参数):93.8%
- Ours ViT-L(image-only 自监督,307M 参数):100.0%
- 即最小的 ViT-S(22M)已超过参数量相近的 R3M ResNet-50(23M)逾一倍成功率;模型越大领先幅度越大
- 模型/数据联合缩放(Figure 7):仅放大模型(ViT-S→ViT-B,约 4.5 倍参数)但保持数据量不变(仅用 70 万 HoI 图片)时性能不升反降;同时放大数据到 450 万张 Ego 数据集后 ViT-B 才明显受益;继续放大到 307M 的 ViT-L 带来进一步提升,且在更难任务(PickSink)上增益更大
- 消融研究(Figure 8,定性对比无精确数值):① 相机——腕部第一视角显著优于第三方桌面视角;② 模态——去掉本体感知或去掉图像输入均导致成功率归零;③ 数据增强——对冻结编码器策略无明显帮助;④ 从零训练架构——ResNet-18(FLOPs 为 ViT-B 的 11%)、ResNet-50(22%)均不如从零训练的 ViT-B;⑤ CLIP 架构——CLIP ViT-B 优于 CLIP ResNet-50;⑥ 微调——微调 ViT-S(HoI) 与 CLIP ResNet-50 仅带来边际提升
- Allegro 多指手案例研究:视觉伸指任务在 8 个已见物体和 45 个未见物体上成功率均约 50%;立方体翻转任务 30 次试验成功率约 50%
创新点与影响
- 贡献:(1) 首次在大规模真机实验(981 次试验、6 任务、2 本体)中系统验证”冻结 MAE 视觉表征 + 轻量 BC 头”范式的有效性,此前同类工作仅在仿真验证;(2) 证明模型规模与数据规模必须协同放大——单独放大模型甚至会损害性能;(3) 用纯图像自监督(无语言/跨域标注)在同一 PickFruit 任务上明显超过依赖 Ego4D 视频-语言标注的并发工作 R3M;(4) 把 307M 参数的 ViT-L 首次部署到真实机器人控制中,是当时报道的最大规模机器人视觉编码器
- 它改变了什么:确立了”互联网/第一人称视频规模的自监督视觉预训练可直接迁移到真机操控”这一实用路径,为后续冻结视觉骨干在机器人学习中的广泛采用(如 VC-1/CortexBench 等工作)提供了直接的真机证据链
- 作者自述局限:实验场景与物体仍偏”实验室里的玩具物体”而非真实世界完整场景;任务均为单物体、不涉及反馈控制或多步规划;机器人使用时长(up-time)本身会影响精度,可能是评测的混杂因素
原始链接
- arXiv 摘要:https://arxiv.org/abs/2210.03109
- arXiv PDF(v1,2022-10-06):https://arxiv.org/pdf/2210.03109
- 项目主页:https://tetexiao.com/projects/real-mvp
- 代码仓库:https://github.com/ir413/mvp
- 前作(仿真版,本文直接基础):arXiv:2203.06173 Masked Visual Pre-training for Motor Control
一手源存档(sources/)
- mvp-masked-visual-pretraining—github-readme — GitHub README 快照(ir413/mvp,fetched 2026-07-16)
- mvp-masked-visual-pretraining—project-page — 项目主页 tetexiao.com/projects/real-mvp 快照(fetched 2026-07-16)
- arXiv 原文 PDF(arXiv:2210.03109v1,不入 git)——正文数字均取自此 PDF,见上方 arXiv 链接