一句话定位

Meta AI(FAIR)提出 CortexBench——横跨移动/固定操作、灵巧操作、导航、锁足控制共 17 个任务、7 个既有基准的统一评测集,用它系统评测现有预训练视觉表征(PVR),发现没有任何一个”通吃”;随后用 MAE 在自建的 7 源、超 4000 小时、562 万帧的第一人称视频 + ImageNet 混合数据上训练出 VC-1(ViT-L,3.07 亿参数),冻结特征下平均成功率 68.7,超过此前最强 PVR(MVP ViT-L 67.5、R3M 58.0、CLIP 57.0),经任务级适配(端到端微调或 MAE 继续预训练)后在 CortexBench 全部 7 个基准上都能追平或超过此前各自领域的最好结果,训练该系列模型共耗费逾 1 万 GPU-小时。

背景与定位

论文 2023-03 发布于 arXiv(2303.18240),作者来自 Georgia Tech、Meta AI(FAIR)、UPenn、Stanford、UC Berkeley(Arjun Majumdar、Karmesh Yadav、Sergio Arnaud 等 15 人)。它要回答的问题直接呼应 Fukushima 近 50 年前提出的”人工视觉皮层”设想:能否有一个统一的视觉表征模块,支撑从锁足控制、灵巧操作、桌面操作到室内导航、移动操作等各种具身智能任务,而不必为每个任务单独设计/训练一套感知模型。此前的预训练视觉表征工作彼此不可通约——各自使用不同的自监督算法、不同的预训练数据、在不同的下游任务上评测,例如 r3m(时序对比 + 视频-语言对齐,训练于 Ego4D 子集 500 万帧,ResNet-50 骨干)、mvp-masked-visual-pretraining(MAE 目标,450 万帧第一人称视频 + ImageNet,ViT 骨干,是与 VC-1 架构/目标最接近的前作)、VIP(目标条件价值函数预训练)、CLIP(4 亿图文对对比学习)。VC-1/CortexBench 的定位正是消除这种不可比性:先固定一套跨领域基准(CortexBench),再系统对比现有 PVR 与自己训练的一系列 MAE 模型,最后专门研究”扩大预训练数据规模/多样性”与”下游任务适配”这两个变量的独立作用。数据来源之一是 Meta 同期开源的大规模第一人称视频数据集 Ego4D(相关后续工作见 ego-exo4d)。论文明确声明”本文不提出新技术,只提供严格的系统性评测、一套认知发现(部分推翻了此前窄领域工作的结论)以及开源代码与模型”。

模型架构

VC-1 不是一个端到端的视觉-语言-动作(VLA)策略,而是一个冻结/可适配的视觉编码器(PVR),下游各基准各自套一个任务专属的轻量策略头(见”训练方法”)。

Backbone:标准 Vision Transformer(ViT),用 Masked Auto-Encoding(MAE,He et al. 2021) 目标做自监督预训练;提供 ViT-B(86M 参数)与 ViT-L(307M 参数)两种规模,VC-1 特指用全部数据训练的 ViT-L。

VC-1(ViT-L)具体配置(来自官方 MODEL_CARD.md):

  • Patch size 16×16;输入图像 224×224×3
  • Embedding 维度 1024,24 层,16 个注意力头,MLP ratio 4,QKV bias=True,LayerNorm eps=1e-6
  • 使用 [CLS] token 输出 1024 维图像级嵌入(下游 MuJoCo/TriFinger 任务用 [CLS] token 接策略头;Habitat 导航/操作任务改用 patch-level 特征接一层压缩层再输入 LSTM/GRU)
  • 输入预处理:原始图像 250×250×3 → 官方 model_transforms 缩放/裁剪为 224×224×3
  • 训练 182 epoch(epoch 数按”模型更新总次数与 MAE 在 ImageNet 上的更新次数保持一致”的原则、依数据规模反推得到,而非固定值——数据量更大的组合训练更少 epoch,见”数据”节 Table 7)
  • 遵循 MAE 官方代码库(He et al. 2021)默认超参数实现,论文正文未重新逐项列出 mask ratio、学习率、优化器等具体训练超参数数值
  • 注:GitHub README 示例代码中 VC1_LARGE_NAME 加载后的注释写着”Embedding will be 1x768”,与 MODEL_CARD.md 明确标注的 embedding dim=1024 不一致,疑似该注释复制自 ViT-B(VC-1-base,标准 ViT-B 隐藏维度确为 768)版本示例、忘记随规格更新;本页以 MODEL_CARD.md 的显式数值(1024)为准。

下游策略头(非 VC-1 本身,随基准而异):MuJoCo 类任务(Adroit/MetaWorld/DMControl)与 TriFinger 用 3 层 MLP 行为克隆策略;Habitat ObjectNav 用 2 层 LSTM,Habitat 2.0 Mobile-Pick 用 2 层 GRU(均接在 PVR 特征之上,训练时 PVR 权重默认冻结)。

跨具身/跨任务覆盖:CortexBench 本身横跨 7 种机器人/环境形态——28 自由度拟人手(Adroit)、Sawyer 机械臂(MetaWorld)、抽象锁足体(DMControl)、三指机械手(TriFinger)、圆柱形导航智能体(Habitat ImageNav/ObjectNav)、7 自由度手臂+移动底座+吸盘夹爪(Habitat 2.0 Mobile-Pick),但 VC-1 作为纯视觉编码器本身不做任何动作/本体感觉的条件化设计——它只输出图像特征,跨具身的适配完全交给下游策略头。

数据

预训练数据(VC-1 = Ego4D+MNI 混合集,共 562 万帧),来自 7 个第一人称视频源 + ImageNet:

组合包含数据源采样帧数
Ego4D(基础集)Ego4D2,790,520(从原始 4.19 亿帧中采样)
Ego4D+M(操作)Ego4D + 100DOH + SS-v2 + Epic Kitchens3,538,291
Ego4D+N(导航)Ego4D + OpenHouse24 + RealEstate10K3,593,049
Ego4D+MN(操作+导航)Ego4D+M ∪ Ego4D+N 去重后的视频源4,340,820
Ego4D+MNI(= VC-1 训练集)Ego4D+MN + ImageNet5,621,987(约 5.6M)

各原始数据源规模(总帧数 → 实际采样使用帧数):Ego4D 原始 418,578,043 帧(仅采样 2,790,520 帧,约 0.67%);100DOH 99,899 帧(全部使用);Something-Something v2 原始 25,209,271 帧(采样 315,115);Epic Kitchens 原始 19,965,439 帧(采样 332,757);OpenHouse24(OH24,Meta 内部数据集,将由另一独立研究项目开源)覆盖 1600+ 套已装修住宅实拍漫游视频,共 139 小时,单次漫游平均 5 分 12 秒(原始 27,806,971 帧,采样 499,442);RealEstate10K 原始 1000 万帧(采样 303,087);ImageNet-1k 训练集 1,281,167 张图像(全部使用)。整体口径为”4,000+ 小时第一人称视频 + ImageNet”。

数据混合/消融设计逻辑:论文刻意构造 4 组递增数据集(Ego4D → Ego4D+M / Ego4D+N → Ego4D+MN → Ego4D+MNI),分别控制”数据规模”与”数据多样性”两个变量——Ego4D+M 与 Ego4D+N 规模相近但前者只加操作类视频、后者加导航类视频,用于隔离”多样性”而非单纯”规模”的作用。

下游任务数据(策略训练用,非预训练数据):Adroit/DMControl 各用 100 条专家演示做行为克隆,MetaWorld 用 25 条;TriFinger 每任务 100 条演示;Habitat ObjectNav 用 77k 条人类演示(Habitat-Web 采集)做行为克隆,累计 3.6 亿环境步;Habitat ImageNav 与 Mobile-Pick 用 DD-PPO / VER 做强化学习,各 5 亿环境步。真实机器人硬件实验(TriFinger 实机 + Franka Emika Panda,见”评测 benchmark”)同样采用少样本模仿学习,演示通过遥操作或人工设计控制器在真实世界采集。

Sim-vs-real:CortexBench 17 个任务全部在仿真中评测;论文额外做了两个真实机器人平台(TriFinger 实机、Franka 机械臂)的概念验证实验。预训练数据全部来自真实世界视频(无仿真渲染数据)。

训练方法

预训练目标:MAE(掩码图像重建),使用 He et al. 官方开源代码库与默认超参数训练 ViT-B / ViT-L。

epoch 数按”模型更新次数对齐”原则反推(Table 7):数据量越大,训练 epoch 越少,使得所有配置的”模型参数更新总次数”与 MAE 在 ImageNet 上训练时的更新次数保持一致——Ego4D+N(3.59M 帧)289 epoch;Ego4D+M(3.54M 帧)414 epoch;Ego4D+MN(4.34M 帧)236 epoch;Ego4D+MNI / VC-1(5.62M 帧)182 epoch。

下游策略学习(冻结 PVR 特征之上):MuJoCo 类任务与 TriFinger 用行为克隆(BC),MLP 策略训练 100 epoch(TriFinger 的 Push-Cube 子任务训练 1000 epoch);Habitat ObjectNav 用人类演示 BC;Habitat ImageNav / Mobile-Pick 用 DD-PPO / VER 强化学习。

两种适配(adaptation)策略研究(第 6 节):

  1. 端到端(E2E)微调:允许策略训练阶段一并更新 VC-1 权重。在大规模 IL/RL 任务(ObjectNav/ImageNav/Mobile-Pick)上显著提升;但在少样本 IL 任务(Adroit/MetaWorld/DMControl/TriFinger)上表现明显变差甚至崩溃(大模型在≤5万帧小数据集上过拟合)。
  2. MAE 适配:以 VC-1 权重为初始化,在任务专属数据(少样本任务用演示帧,大规模任务用训练环境采样帧)上继续做 MAE 自监督训练 100 epoch,训练完成后冻结特征再学策略。在少样本 IL 任务上大幅提升,在大规模 IL/RL 任务上有小幅下降。二者呈互补关系:数据量大时 E2E 微调更优,数据量小时 MAE 适配更优。

未涉及蒸馏或额外 RL 微调预训练本身;动作/输出 tokenization 由各下游基准各自的策略学习框架决定(如 MLP 连续动作输出、DD-PPO/VER 的 RL 动作分布),VC-1 编码器本身不做任何动作相关的设计。

Infra(训练 / 推理工程)

预训练算力:论文摘要与官方博客均称”训练与评测这些模型共耗费超过 10,000 GPU-hours”,未进一步拆分预训练 vs. 各下游基准评测各占多少、也未披露具体 GPU 型号(如 V100/A100)、单次训练所用 GPU 数量、并行策略(数据/模型并行)或训练精度(FP32/FP16/BF16)——论文与已抓取的 GitHub / 官方博客均未披露上述细节。

推理侧:控制频率(control-Hz)、单步延迟、边缘部署硬件型号,论文与官方渠道均未披露;已知的确定性信息仅有模型规模(ViT-L 307M 参数)与输入分辨率(224×224)。

评测 benchmark

CortexBench 构成:17 个任务、7 个基准——Adroit(Relocate、Reorient-Pen)、MetaWorld(Assembly、Bin-Picking、Button-Press、Drawer-Open、Hammer)、DeepMind Control(Finger-Spin、Reacher-Hard、Cheetah-Run、Walker-Stand、Walker-Walk)、TriFinger(Reach-Cube、Push-Cube)、Habitat(ImageNav、ObjectNav)、Habitat 2.0(Mobile-Pick)。两个推荐汇总指标:Mean Success(各基准平均成功率)与 Mean Rank(各基准排名的平均)。

现有 PVR 冻结对比(第 4 节,Table 2,Mean Success / Mean Rank):CLIP(ViT-B,4 亿图文对)57.0 / 3.9;R3M(RN-50,Ego4D 子集 500 万帧)58.0 / 3.4;VIP(RN-50,Ego4D 子集 500 万帧)52.3 / 4.0;MVP(ViT-B)62.4 / 3.1;MVP(ViT-L,450 万第一人称+ImageNet 帧)67.5 / 2.1(当时最优)。分基准看:R3M 在 Adroit / MetaWorld / DMControl 上最强,MVP(ViT-L) 在 TriFinger / ImageNav / Mobile-Pick 上最强,CLIP 在 ObjectNav 上最强——没有任何一个 PVR 在全部基准上领先

扩展假设实验(第 5 节,Table 4,Mean Success / Mean Rank;ViT-B / ViT-L 对比):Ego4D 62.2/8.6(B)、63.5/5.9(L);Ego4D+N 63.8/7.2(B)、67.1/3.5(L);Ego4D+M 63.0/7.0(B)、64.4/6.0(L);Ego4D+MN 64.1/6.9(B)、67.2/3.1(L);Ego4D+MNI(B)66.2/4.4;VC-1 = Ego4D+MNI(ViT-L)68.7 / 2.4,均值排名全场最高。关键发现:(1)模型从 ViT-B 增至 ViT-L 平均提升性能,但非普遍成立(如 Ego4D+MNI 下 MetaWorld、TriFinger 反而 ViT-B 更优);(2)数据多样性比单纯扩大规模更重要——Ego4D+N 与 Ego4D+M 规模相近,但前者(加导航数据)提升幅度明显更大;(3)加入 ImageNet 静态图像仍能提升 EAI 任务表现(Ego4D+MN→Ego4D+MNI:ViT-B 64.1→66.2,ViT-L 67.2→68.7);(4)VC-1 平均最优但并非每个基准都最优——Mobile-Pick 最优模型是 Ego4D+M(ViT-L)=68.6,ImageNav 最优模型是 Ego4D+N(ViT-L)=70.5,均高于 VC-1 自身在该基准的成绩。VC-1 相对 MVP(ViT-L) +1.2、R3M +10.7、CLIP +11.7、从头端到端训练 +19.6(49.1→68.7);VC-1 在训练数据量为 CLIP 的约 1/70 情况下,在 CortexBench 全部 7 个基准上都优于 CLIP。

适配实验(第 6 节,Table 5,CortexBench 部分,格式:VC-1 冻结 / E2E 微调 / MAE 适配,括号内为对应此前最优或本文实验最优参照):

基准此前最优(任意方法)本文实验最优(Section 5)域内 MAE 基线VC-1 冻结VC-1 + E2E 微调VC-1 + MAE 适配
Adroit7573.3±2.047.359.3±5.215.9±9.872.0±3.3
MetaWorld8096.0±1.183.488.8±2.222.7±9.796.0±1.8
DMControl7781.1±0.777.666.9±1.46.7±3.880.9±1.8
TriFinger74.1±0.380.4±0.3271.7±0.470.9±0.580.6±0.25
ObjectNav70.460.3±1.139.9±1.0960.3±1.167.7±1.0557.4±1.11
ImageNav82.070.5±0.747.6±0.7770.3±0.781.6±0.667.0±0.73
Mobile-Pick68.6±2.151.6±2.2363.2±2.274.0±1.9662.4±2.16

规律:少样本 IL 任务(Adroit/MetaWorld/DMControl/TriFinger)上 MAE 适配大幅优于 E2E 微调(E2E 会因大模型在小数据上过拟合而性能崩溃,尤其 DMControl 从 66.9 掉到 6.7);大规模 IL/RL 任务(ObjectNav/ImageNav/Mobile-Pick)上 E2E 微调更优,MAE 适配反而小幅下降。适配后的 VC-1 在全部 7 个基准上都追平或超过此前各自领域的最优结果(TriFinger/ObjectNav/ImageNav/Mobile-Pick 此前无统一 SOTA 对照,论文以本文自己的 Section 5 最优扩展模型或域内 MAE 基线为参照)。

真实机器人硬件实验(第 7 节,Table 5 Hardware 部分;因算力限制,硬件上只对比 VC-1 与最强前作 MVP(ViT-L)):

平台MVP(ViT-L)域内 MAE 基线VC-1 冻结VC-1 + E2E 微调VC-1 + MAE 适配
TriFinger Push-Cube(12 次试验均值)31.9±4.322.9±5.445.8±6.552.7±9.243.5±6.7
Franka(4 任务×10 次试验均值)55.0±10.435.0±13.970.0±10.967.5±13.485.0±9.1

VC-1(冻结)在两个真实平台上都大幅超过 MVP 与域内 MAE 基线;TriFinger 上 E2E 微调最优(52.7),Franka 上 MAE 适配最优(85.0)——与仿真中的适配规律部分一致(TriFinger 数据量小、MAE 适配用的仅约 300 张真实图像不足以奏效,需要 E2E 微调学习任务专属特征;Franka 任务上 MAE 适配帮助弥合仿真-真实域差更有效)。

创新点与影响

创新点:(1)首次提出并开源 CortexBench——一个横跨锁足/灵巧/移动操作、桌面操作、室内导航等 7 个既有基准、17 个任务的统一评测协议,把此前彼此不可比的 PVR 评测统一到同一套下游策略学习范式下;(2)系统性地把”数据规模”与”数据多样性”两个变量解耦研究,得出与部分前作(如 MVP 论文)矛盾的结论——扩大规模/多样性平均有益但并非每个任务都有益,不存在单一”通吃”的视觉基座;(3)提出 VC-1 并证明”任务级适配”(E2E 微调或 MAE 继续训练)可以让同一个预训练骨干在全部 7 个基准上追平或超过各自领域此前的最优结果,且这一比较刻意选取”最不利于自己”的对照(各领域此前 SOTA 通常是专为该任务设计、不受任何统一设计约束的模型);(4)真实机器人概念验证实验,证明仿真基准上的结论(VC-1 > MVP,适配有效)能迁移到真实硬件。

论文自述的局限性(Appendix A.1):CortexBench 的任务多样性受限于评测所需的计算资源,新出现的更具挑战性基准(如后续 Embodied AI Workshop 提出的任务)未纳入;本工作只研究了 MAE 一种自监督目标与 ViT 一种架构,其它 SSL 算法可能有不同的规模效应或更优表现;适配流程需要为每个基准单独调超参数(训练 epoch 数、数据采样比例等)并重新训练一个专属模型,不构成一个真正统一的视觉基座;仿真基准终究是真实机器人任务的代理,仿真中的排名未必能完全预测真实世界表现。

原始链接

一手源存档(sources/)