一句话定位
Meta AI(FAIR)提出 CortexBench——横跨移动/固定操作、灵巧操作、导航、锁足控制共 17 个任务、7 个既有基准的统一评测集,用它系统评测现有预训练视觉表征(PVR),发现没有任何一个”通吃”;随后用 MAE 在自建的 7 源、超 4000 小时、562 万帧的第一人称视频 + ImageNet 混合数据上训练出 VC-1(ViT-L,3.07 亿参数),冻结特征下平均成功率 68.7,超过此前最强 PVR(MVP ViT-L 67.5、R3M 58.0、CLIP 57.0),经任务级适配(端到端微调或 MAE 继续预训练)后在 CortexBench 全部 7 个基准上都能追平或超过此前各自领域的最好结果,训练该系列模型共耗费逾 1 万 GPU-小时。
背景与定位
论文 2023-03 发布于 arXiv(2303.18240),作者来自 Georgia Tech、Meta AI(FAIR)、UPenn、Stanford、UC Berkeley(Arjun Majumdar、Karmesh Yadav、Sergio Arnaud 等 15 人)。它要回答的问题直接呼应 Fukushima 近 50 年前提出的”人工视觉皮层”设想:能否有一个统一的视觉表征模块,支撑从锁足控制、灵巧操作、桌面操作到室内导航、移动操作等各种具身智能任务,而不必为每个任务单独设计/训练一套感知模型。此前的预训练视觉表征工作彼此不可通约——各自使用不同的自监督算法、不同的预训练数据、在不同的下游任务上评测,例如 r3m(时序对比 + 视频-语言对齐,训练于 Ego4D 子集 500 万帧,ResNet-50 骨干)、mvp-masked-visual-pretraining(MAE 目标,450 万帧第一人称视频 + ImageNet,ViT 骨干,是与 VC-1 架构/目标最接近的前作)、VIP(目标条件价值函数预训练)、CLIP(4 亿图文对对比学习)。VC-1/CortexBench 的定位正是消除这种不可比性:先固定一套跨领域基准(CortexBench),再系统对比现有 PVR 与自己训练的一系列 MAE 模型,最后专门研究”扩大预训练数据规模/多样性”与”下游任务适配”这两个变量的独立作用。数据来源之一是 Meta 同期开源的大规模第一人称视频数据集 Ego4D(相关后续工作见 ego-exo4d)。论文明确声明”本文不提出新技术,只提供严格的系统性评测、一套认知发现(部分推翻了此前窄领域工作的结论)以及开源代码与模型”。
模型架构
VC-1 不是一个端到端的视觉-语言-动作(VLA)策略,而是一个冻结/可适配的视觉编码器(PVR),下游各基准各自套一个任务专属的轻量策略头(见”训练方法”)。
Backbone:标准 Vision Transformer(ViT),用 Masked Auto-Encoding(MAE,He et al. 2021) 目标做自监督预训练;提供 ViT-B(86M 参数)与 ViT-L(307M 参数)两种规模,VC-1 特指用全部数据训练的 ViT-L。
VC-1(ViT-L)具体配置(来自官方 MODEL_CARD.md):
- Patch size 16×16;输入图像 224×224×3
- Embedding 维度 1024,24 层,16 个注意力头,MLP ratio 4,QKV bias=True,LayerNorm eps=1e-6
- 使用 [CLS] token 输出 1024 维图像级嵌入(下游 MuJoCo/TriFinger 任务用 [CLS] token 接策略头;Habitat 导航/操作任务改用 patch-level 特征接一层压缩层再输入 LSTM/GRU)
- 输入预处理:原始图像 250×250×3 → 官方
model_transforms缩放/裁剪为 224×224×3 - 训练 182 epoch(epoch 数按”模型更新总次数与 MAE 在 ImageNet 上的更新次数保持一致”的原则、依数据规模反推得到,而非固定值——数据量更大的组合训练更少 epoch,见”数据”节 Table 7)
- 遵循 MAE 官方代码库(He et al. 2021)默认超参数实现,论文正文未重新逐项列出 mask ratio、学习率、优化器等具体训练超参数数值
- 注:GitHub README 示例代码中
VC1_LARGE_NAME加载后的注释写着”Embedding will be 1x768”,与 MODEL_CARD.md 明确标注的 embedding dim=1024 不一致,疑似该注释复制自 ViT-B(VC-1-base,标准 ViT-B 隐藏维度确为 768)版本示例、忘记随规格更新;本页以 MODEL_CARD.md 的显式数值(1024)为准。
下游策略头(非 VC-1 本身,随基准而异):MuJoCo 类任务(Adroit/MetaWorld/DMControl)与 TriFinger 用 3 层 MLP 行为克隆策略;Habitat ObjectNav 用 2 层 LSTM,Habitat 2.0 Mobile-Pick 用 2 层 GRU(均接在 PVR 特征之上,训练时 PVR 权重默认冻结)。
跨具身/跨任务覆盖:CortexBench 本身横跨 7 种机器人/环境形态——28 自由度拟人手(Adroit)、Sawyer 机械臂(MetaWorld)、抽象锁足体(DMControl)、三指机械手(TriFinger)、圆柱形导航智能体(Habitat ImageNav/ObjectNav)、7 自由度手臂+移动底座+吸盘夹爪(Habitat 2.0 Mobile-Pick),但 VC-1 作为纯视觉编码器本身不做任何动作/本体感觉的条件化设计——它只输出图像特征,跨具身的适配完全交给下游策略头。
数据
预训练数据(VC-1 = Ego4D+MNI 混合集,共 562 万帧),来自 7 个第一人称视频源 + ImageNet:
| 组合 | 包含数据源 | 采样帧数 |
|---|---|---|
| Ego4D(基础集) | Ego4D | 2,790,520(从原始 4.19 亿帧中采样) |
| Ego4D+M(操作) | Ego4D + 100DOH + SS-v2 + Epic Kitchens | 3,538,291 |
| Ego4D+N(导航) | Ego4D + OpenHouse24 + RealEstate10K | 3,593,049 |
| Ego4D+MN(操作+导航) | Ego4D+M ∪ Ego4D+N 去重后的视频源 | 4,340,820 |
| Ego4D+MNI(= VC-1 训练集) | Ego4D+MN + ImageNet | 5,621,987(约 5.6M) |
各原始数据源规模(总帧数 → 实际采样使用帧数):Ego4D 原始 418,578,043 帧(仅采样 2,790,520 帧,约 0.67%);100DOH 99,899 帧(全部使用);Something-Something v2 原始 25,209,271 帧(采样 315,115);Epic Kitchens 原始 19,965,439 帧(采样 332,757);OpenHouse24(OH24,Meta 内部数据集,将由另一独立研究项目开源)覆盖 1600+ 套已装修住宅实拍漫游视频,共 139 小时,单次漫游平均 5 分 12 秒(原始 27,806,971 帧,采样 499,442);RealEstate10K 原始 1000 万帧(采样 303,087);ImageNet-1k 训练集 1,281,167 张图像(全部使用)。整体口径为”4,000+ 小时第一人称视频 + ImageNet”。
数据混合/消融设计逻辑:论文刻意构造 4 组递增数据集(Ego4D → Ego4D+M / Ego4D+N → Ego4D+MN → Ego4D+MNI),分别控制”数据规模”与”数据多样性”两个变量——Ego4D+M 与 Ego4D+N 规模相近但前者只加操作类视频、后者加导航类视频,用于隔离”多样性”而非单纯”规模”的作用。
下游任务数据(策略训练用,非预训练数据):Adroit/DMControl 各用 100 条专家演示做行为克隆,MetaWorld 用 25 条;TriFinger 每任务 100 条演示;Habitat ObjectNav 用 77k 条人类演示(Habitat-Web 采集)做行为克隆,累计 3.6 亿环境步;Habitat ImageNav 与 Mobile-Pick 用 DD-PPO / VER 做强化学习,各 5 亿环境步。真实机器人硬件实验(TriFinger 实机 + Franka Emika Panda,见”评测 benchmark”)同样采用少样本模仿学习,演示通过遥操作或人工设计控制器在真实世界采集。
Sim-vs-real:CortexBench 17 个任务全部在仿真中评测;论文额外做了两个真实机器人平台(TriFinger 实机、Franka 机械臂)的概念验证实验。预训练数据全部来自真实世界视频(无仿真渲染数据)。
训练方法
预训练目标:MAE(掩码图像重建),使用 He et al. 官方开源代码库与默认超参数训练 ViT-B / ViT-L。
epoch 数按”模型更新次数对齐”原则反推(Table 7):数据量越大,训练 epoch 越少,使得所有配置的”模型参数更新总次数”与 MAE 在 ImageNet 上训练时的更新次数保持一致——Ego4D+N(3.59M 帧)289 epoch;Ego4D+M(3.54M 帧)414 epoch;Ego4D+MN(4.34M 帧)236 epoch;Ego4D+MNI / VC-1(5.62M 帧)182 epoch。
下游策略学习(冻结 PVR 特征之上):MuJoCo 类任务与 TriFinger 用行为克隆(BC),MLP 策略训练 100 epoch(TriFinger 的 Push-Cube 子任务训练 1000 epoch);Habitat ObjectNav 用人类演示 BC;Habitat ImageNav / Mobile-Pick 用 DD-PPO / VER 强化学习。
两种适配(adaptation)策略研究(第 6 节):
- 端到端(E2E)微调:允许策略训练阶段一并更新 VC-1 权重。在大规模 IL/RL 任务(ObjectNav/ImageNav/Mobile-Pick)上显著提升;但在少样本 IL 任务(Adroit/MetaWorld/DMControl/TriFinger)上表现明显变差甚至崩溃(大模型在≤5万帧小数据集上过拟合)。
- MAE 适配:以 VC-1 权重为初始化,在任务专属数据(少样本任务用演示帧,大规模任务用训练环境采样帧)上继续做 MAE 自监督训练 100 epoch,训练完成后冻结特征再学策略。在少样本 IL 任务上大幅提升,在大规模 IL/RL 任务上有小幅下降。二者呈互补关系:数据量大时 E2E 微调更优,数据量小时 MAE 适配更优。
未涉及蒸馏或额外 RL 微调预训练本身;动作/输出 tokenization 由各下游基准各自的策略学习框架决定(如 MLP 连续动作输出、DD-PPO/VER 的 RL 动作分布),VC-1 编码器本身不做任何动作相关的设计。
Infra(训练 / 推理工程)
预训练算力:论文摘要与官方博客均称”训练与评测这些模型共耗费超过 10,000 GPU-hours”,未进一步拆分预训练 vs. 各下游基准评测各占多少、也未披露具体 GPU 型号(如 V100/A100)、单次训练所用 GPU 数量、并行策略(数据/模型并行)或训练精度(FP32/FP16/BF16)——论文与已抓取的 GitHub / 官方博客均未披露上述细节。
推理侧:控制频率(control-Hz)、单步延迟、边缘部署硬件型号,论文与官方渠道均未披露;已知的确定性信息仅有模型规模(ViT-L 307M 参数)与输入分辨率(224×224)。
评测 benchmark
CortexBench 构成:17 个任务、7 个基准——Adroit(Relocate、Reorient-Pen)、MetaWorld(Assembly、Bin-Picking、Button-Press、Drawer-Open、Hammer)、DeepMind Control(Finger-Spin、Reacher-Hard、Cheetah-Run、Walker-Stand、Walker-Walk)、TriFinger(Reach-Cube、Push-Cube)、Habitat(ImageNav、ObjectNav)、Habitat 2.0(Mobile-Pick)。两个推荐汇总指标:Mean Success(各基准平均成功率)与 Mean Rank(各基准排名的平均)。
现有 PVR 冻结对比(第 4 节,Table 2,Mean Success / Mean Rank):CLIP(ViT-B,4 亿图文对)57.0 / 3.9;R3M(RN-50,Ego4D 子集 500 万帧)58.0 / 3.4;VIP(RN-50,Ego4D 子集 500 万帧)52.3 / 4.0;MVP(ViT-B)62.4 / 3.1;MVP(ViT-L,450 万第一人称+ImageNet 帧)67.5 / 2.1(当时最优)。分基准看:R3M 在 Adroit / MetaWorld / DMControl 上最强,MVP(ViT-L) 在 TriFinger / ImageNav / Mobile-Pick 上最强,CLIP 在 ObjectNav 上最强——没有任何一个 PVR 在全部基准上领先。
扩展假设实验(第 5 节,Table 4,Mean Success / Mean Rank;ViT-B / ViT-L 对比):Ego4D 62.2/8.6(B)、63.5/5.9(L);Ego4D+N 63.8/7.2(B)、67.1/3.5(L);Ego4D+M 63.0/7.0(B)、64.4/6.0(L);Ego4D+MN 64.1/6.9(B)、67.2/3.1(L);Ego4D+MNI(B)66.2/4.4;VC-1 = Ego4D+MNI(ViT-L)68.7 / 2.4,均值排名全场最高。关键发现:(1)模型从 ViT-B 增至 ViT-L 平均提升性能,但非普遍成立(如 Ego4D+MNI 下 MetaWorld、TriFinger 反而 ViT-B 更优);(2)数据多样性比单纯扩大规模更重要——Ego4D+N 与 Ego4D+M 规模相近,但前者(加导航数据)提升幅度明显更大;(3)加入 ImageNet 静态图像仍能提升 EAI 任务表现(Ego4D+MN→Ego4D+MNI:ViT-B 64.1→66.2,ViT-L 67.2→68.7);(4)VC-1 平均最优但并非每个基准都最优——Mobile-Pick 最优模型是 Ego4D+M(ViT-L)=68.6,ImageNav 最优模型是 Ego4D+N(ViT-L)=70.5,均高于 VC-1 自身在该基准的成绩。VC-1 相对 MVP(ViT-L) +1.2、R3M +10.7、CLIP +11.7、从头端到端训练 +19.6(49.1→68.7);VC-1 在训练数据量为 CLIP 的约 1/70 情况下,在 CortexBench 全部 7 个基准上都优于 CLIP。
适配实验(第 6 节,Table 5,CortexBench 部分,格式:VC-1 冻结 / E2E 微调 / MAE 适配,括号内为对应此前最优或本文实验最优参照):
| 基准 | 此前最优(任意方法) | 本文实验最优(Section 5) | 域内 MAE 基线 | VC-1 冻结 | VC-1 + E2E 微调 | VC-1 + MAE 适配 |
|---|---|---|---|---|---|---|
| Adroit | 75 | 73.3±2.0 | 47.3 | 59.3±5.2 | 15.9±9.8 | 72.0±3.3 |
| MetaWorld | 80 | 96.0±1.1 | 83.4 | 88.8±2.2 | 22.7±9.7 | 96.0±1.8 |
| DMControl | 77 | 81.1±0.7 | 77.6 | 66.9±1.4 | 6.7±3.8 | 80.9±1.8 |
| TriFinger | – | 74.1±0.3 | 80.4±0.32 | 71.7±0.4 | 70.9±0.5 | 80.6±0.25 |
| ObjectNav | 70.4 | 60.3±1.1 | 39.9±1.09 | 60.3±1.1 | 67.7±1.05 | 57.4±1.11 |
| ImageNav | 82.0 | 70.5±0.7 | 47.6±0.77 | 70.3±0.7 | 81.6±0.6 | 67.0±0.73 |
| Mobile-Pick | – | 68.6±2.1 | 51.6±2.23 | 63.2±2.2 | 74.0±1.96 | 62.4±2.16 |
规律:少样本 IL 任务(Adroit/MetaWorld/DMControl/TriFinger)上 MAE 适配大幅优于 E2E 微调(E2E 会因大模型在小数据上过拟合而性能崩溃,尤其 DMControl 从 66.9 掉到 6.7);大规模 IL/RL 任务(ObjectNav/ImageNav/Mobile-Pick)上 E2E 微调更优,MAE 适配反而小幅下降。适配后的 VC-1 在全部 7 个基准上都追平或超过此前各自领域的最优结果(TriFinger/ObjectNav/ImageNav/Mobile-Pick 此前无统一 SOTA 对照,论文以本文自己的 Section 5 最优扩展模型或域内 MAE 基线为参照)。
真实机器人硬件实验(第 7 节,Table 5 Hardware 部分;因算力限制,硬件上只对比 VC-1 与最强前作 MVP(ViT-L)):
| 平台 | MVP(ViT-L) | 域内 MAE 基线 | VC-1 冻结 | VC-1 + E2E 微调 | VC-1 + MAE 适配 |
|---|---|---|---|---|---|
| TriFinger Push-Cube(12 次试验均值) | 31.9±4.3 | 22.9±5.4 | 45.8±6.5 | 52.7±9.2 | 43.5±6.7 |
| Franka(4 任务×10 次试验均值) | 55.0±10.4 | 35.0±13.9 | 70.0±10.9 | 67.5±13.4 | 85.0±9.1 |
VC-1(冻结)在两个真实平台上都大幅超过 MVP 与域内 MAE 基线;TriFinger 上 E2E 微调最优(52.7),Franka 上 MAE 适配最优(85.0)——与仿真中的适配规律部分一致(TriFinger 数据量小、MAE 适配用的仅约 300 张真实图像不足以奏效,需要 E2E 微调学习任务专属特征;Franka 任务上 MAE 适配帮助弥合仿真-真实域差更有效)。
创新点与影响
创新点:(1)首次提出并开源 CortexBench——一个横跨锁足/灵巧/移动操作、桌面操作、室内导航等 7 个既有基准、17 个任务的统一评测协议,把此前彼此不可比的 PVR 评测统一到同一套下游策略学习范式下;(2)系统性地把”数据规模”与”数据多样性”两个变量解耦研究,得出与部分前作(如 MVP 论文)矛盾的结论——扩大规模/多样性平均有益但并非每个任务都有益,不存在单一”通吃”的视觉基座;(3)提出 VC-1 并证明”任务级适配”(E2E 微调或 MAE 继续训练)可以让同一个预训练骨干在全部 7 个基准上追平或超过各自领域此前的最优结果,且这一比较刻意选取”最不利于自己”的对照(各领域此前 SOTA 通常是专为该任务设计、不受任何统一设计约束的模型);(4)真实机器人概念验证实验,证明仿真基准上的结论(VC-1 > MVP,适配有效)能迁移到真实硬件。
论文自述的局限性(Appendix A.1):CortexBench 的任务多样性受限于评测所需的计算资源,新出现的更具挑战性基准(如后续 Embodied AI Workshop 提出的任务)未纳入;本工作只研究了 MAE 一种自监督目标与 ViT 一种架构,其它 SSL 算法可能有不同的规模效应或更优表现;适配流程需要为每个基准单独调超参数(训练 epoch 数、数据采样比例等)并重新训练一个专属模型,不构成一个真正统一的视觉基座;仿真基准终究是真实机器人任务的代理,仿真中的排名未必能完全预测真实世界表现。
原始链接
- arXiv: https://arxiv.org/abs/2303.18240
- PDF: https://arxiv.org/pdf/2303.18240
- GitHub: https://github.com/facebookresearch/eai-vc
- 项目页: https://eai-vc.github.io/
- 官方博客(Meta AI, 2023-03-31): https://ai.meta.com/blog/robots-learning-video-simulation-artificial-visual-cortex-vc-1/
- 模型权重下载:VC-1 (ViT-L) https://dl.fbaipublicfiles.com/eai-vc/vc1_vitl.pth ;VC-1-base (ViT-B) https://dl.fbaipublicfiles.com/eai-vc/vc1_vitb.pth
一手源存档(sources/)
- 论文全文 PDF:
/tmp/p_vc1.pdf(arXiv 原文 PDF,不入 git;来源 https://arxiv.org/pdf/2303.18240) - vc-1-cortexbench—github-readme.md — GitHub README 快照(模型下载链接、加载代码、目录结构、许可证)
- vc-1-cortexbench—model-card.md — 官方 MODEL_CARD.md 快照(架构配置数值、数据混合表、CortexBench 性能表)
- vc-1-cortexbench—blog.md — Meta AI 官方博客快照(2023-03-31,与 Adaptive Skill Coordination 联合发布)
- vc-1-cortexbench—project-page.md — 项目页快照(摘要、方法概览,内容与论文一致)