一句话定位
Meta FAIR 联合 13 所大学的两年协作,产出 3,670 小时、931 名佩戴者、74 个城市、9 个国家的第一人称(egocentric)日常生活视频语料 + 五大 benchmark 套件——这是把「人类第一视角视频」做成研究基础设施的奠基之作,后续机器人的 human-video 预训练(R3M / VIP / MVP / VC-1 等)几乎都以它为主力数据源。
背景与定位
论文把矛头对准当时视觉数据集的三大局限:(1) Kinetics / COCO / ImageNet / HowTo100M 全是第三人称「旁观者」视角,由摄影师有意取景,与机器人/AR 里那种「持续、无剪辑、随身相机」的第一人称视频流存在巨大 domain gap;(2) 主动 curation 让互联网数据缺乏真实穿戴相机的运动模糊、非常规视角、缺乏时间剪辑等特性;(3) 第一人称感知需要持久的 3D 场景理解与人–物交互、社交行为的语义。作者引用已有工作证明「用第三人称数据预训练 egocentric 模型」会因 domain mismatch 掉点。
它相对既有 egocentric 数据集(EPIC-Kitchens 100 小时、Charades-Ego、EGTEA、UT-Ego、ADL、Disney)是数量级跃升:3,670 小时 vs [43] 的 100 小时、931 名佩戴者 vs [201] 的 71 人,环境从「一个厨房/几十个」扩到「数百个室内外场景」。范式上它属于 in-the-wild 被动穿戴采集,与遥操作/脚本化机器人数据采集(embodied-data-teleop)形成对照——后者精但贵且窄,Ego4D 走「无脚本、多人、跨地域」的规模路线,成为 human-video 预训练语料的事实标准(相关:EPIC-Kitchens、后续 ego-exo4d 引入 exocentric 对齐视角)。名字取自 Ego(centric) + 4D(3D 空间 + 时间)。
模型架构
这是数据集/benchmark 论文,没有单一模型;这一维度记录「语料结构 + 采集硬件 + 标注 schema + baseline 模型栈」。
- 采集硬件:7 种头戴相机以避免过拟合单一设备——GoPro、Vuzix Blade、Pupil Labs、ZShades、ORDRO EP6、iVue Rincon 1080、Weeview。它们在 RGB/立体/gaze 模态、FoV、续航上各有取舍;GoPro 头顶朝下高清拍手部操作,Vuzix 平视贴近人眼视线但会漏掉贴身交互。
- 多模态构成(Table 1,单位小时):RGB 视频 3,670 / 文本 narration 3,670 / 预计算特征 3,670 / 音频 2,535 / IMU 836 / 未打码人脸 612 / 3D scan(Matterport3D 网格) 491 / 多机位同步 224 / 立体 80 / 眼动 gaze 45(gaze 仅 Indiana U. 与 Georgia Tech 采集)。
- 语料形态:典型原始 clip 长约 8 分钟(远超第三人称常研究的 10 秒片段);每位佩戴者单次佩戴 1–10 小时,呈现「一个人完整活动弧」的长视频。
- 标注 schema:叙事(narration) 打底——密集时间戳自由文本;在其上派生五大 benchmark 各自的 query/bbox/state-change/说话人/轨迹标注。
- baseline 模型栈(附录,非本体贡献):视频特征用 SlowFast 8×8 + ResNet-101(Kinetics-400 预训练);NLQ 文本用冻结 BERT,接 VSLNet / 2D-TAN 等定位网络;预测任务用 SlowFast backbone + Concat/Transformer 聚合器。
数据
- 总规模:3,670 小时 RGB 视频(首个 release 记为 Ego4D-3K),931 名独立佩戴者,74 个城市,9 个国家、5 大洲;14 支团队分布式采集。(项目页后续修订写 923 名参与者、88 名研究者;论文 v3 正文为 931。)
- 场景来源与配比:以美国劳工统计局 ATUS 调查(人们时间花在家务/休闲/交通/差事/职场)为选题依据,让参与者自选日常活动自然覆盖。Figure 3 中 14 个最常见场景占 70% 数据,其余 30% 长尾。部分团队专招有视觉语境的职业(面包师、木匠、园丁、机械师,如 carpenter >7 小时、crafting >12 小时、bike mechanic >5.5 小时)。采集策略是「适度引导 vs 完全放养」的折中:招募能自然覆盖场景的人 + 要求佩戴到电池耗尽以让活动自然展开。多人场景例外——5 个站点征得同意的参与者做社交活动(玩游戏等),供音视频/社交 benchmark。
- 人口多样性:45% 女性,96 人 50 岁以上,2 人非二元性别;覆盖多种职业年龄段(人口统计对 64% 参与者可得)。
- 叙事标注(narration):仿「pause-and-talk」叙述者,标注员看 5 分钟片段先几句概括、再逐停写下佩戴者每个动作句;每段视频由 2 名独立标注员各叙述一遍。密度 13.2 句/分钟,全库共 3.85M 句,含 1,772 个独立动词、4,336 个独立名词。标注总投入 >250,000 小时人工。
- 各 benchmark 标注量(Table 3):EM Visual Queries 432.9h/5,831 clip;EM VQ-3D 13h/159;EM Moments 328.7h/2,522;EM NLQ 227.1h/1,659;Hands+Objects 196.2h/88,585 clip(均长仅 8.0 秒);Forecasting 110.5h/1,498;AVD 47.7h/572;Social 47.7h/572。AVD+Social 相关(有音频/对话/未打码脸)总计 764 小时。Episodic Memory 三类 query 合计约 74K 条、覆盖 800 小时。
- sim-vs-real / co-training:全为真实世界采集,无仿真成分;不做机器人动作标注(无 teleop 动作),是纯人类视频语料。
- 偏差:74 地远非全球覆盖,佩戴者多在城市/大学城;COVID 导致居家场景(做饭/清洁/手工)偏多、大型公共社交活动偏少;标注由非洲两站点众包工人完成,语言选词有本地偏差。
训练方法
本作不训练一个「主模型」,训练方法体现在标注流水线与 baseline 上:
- 标注流水线:先对全部视频跑 narration(pause-and-talk,双标注员),再用叙事做文本挖掘、数据驱动地半自动构建动作/物体分类法(如 Moments 的 110 类活动、Forecasting 的动名词分类法从叙事种子再人工精修),并据此定位需要 seed 标注的时间窗。
- 五个 benchmark 目标:① Episodic Memory——NLQ(文本 query→时间窗)/VQ(图像 query→时空 bbox + 可选 3D 位移)/MQ(活动名→所有时间窗);② Hands & Objects——物体状态变化,含 PNR(point-of-no-return) 时间定位、pre/PNR/post 三帧状态变化物体检测、状态变化分类;③ Audio-Visual Diarization——FoV 内说话人定位跟踪 / active speaker / diarization / 转写(仅英文);④ Social——LAM(是否看着我)/TTM(是否对我说话),建在 AVD 标注之上;⑤ Forecasting——locomotion 轨迹 / 手部运动 / 短时物体交互预判(含 time-to-contact) / 长时动作序列预判。
- 评测指标:NLQ 用 tIoU 阈值下的 top-k recall;MQ 用多 tIoU mAP + top-kx recall;VQ 用时空定位 + timeliness;Hands&Objects 用秒级时间误差 / 分类准确率 / AP;AVD 用 MOTA/MOTP、speaker error rate、DER、WER;Social 用 mAP + Top-1;Forecasting 用 L2 距离 / Top-5 mAP / edit distance。
- 关键消融(长时动作预判,Table 38):仅 K400 预训练 vs 再在 Ego4D 动作识别上微调,后者显著降低 edit distance(Transformer 聚合器下 noun ED 0.809→0.779、action ED 0.953→0.941),印证了「Ego4D 域内预训练相对第三人称 Kinetics 的增益」——这正是它作为 embodied 预训练语料价值的直接证据。
Infra(训练 / 推理工程)
- 训练 GPU / GPU-hours / 并行 / 精度:未披露(数据集论文,baseline 模型规模小,附录未给算力细节)。
- 数据工程与分发:AWS 后端托管(致谢中 Jacob Chalk 搭建 Ego4D AWS backend),由 Common Visual Data Foundation(CVDF) 托管分发;随数据集提供预计算 SlowFast 8×8/ResNet-101(Kinetics-400 预训练)特征作为轻量起点,缓解 3,670 小时体量对存储/算力的门槛;支持按 benchmark 或按模态选择性下载。
- 去标识化 pipeline:商用软件——brighter.ai 用于部分大学的视频打码,University of Bristol 用 Primloc Secure Redact;每段视频人工审查敏感内容后再分享(部分站点通过外置硬盘或云回传原始素材)。
- 推理 FPS / 控制 Hz / 边缘硬件:不适用(无部署模型;面向 AR/机器人感知研究的离线 benchmark)。
评测 benchmark
本作自身即 benchmark 定义者,附录给出 baseline 而非 SOTA。关键量化:
- 规模对比:3,670 小时 vs 当时最大 egocentric 数据集 EPIC-Kitchens 的 100 小时(≈36×),佩戴者 931 vs 71(≈13×);项目页称在小时数上比任何既有数据集大 20 倍以上。
- 标注体量:3.85M 叙事句、1,772 动词 / 4,336 名词、约 74K episodic memory queries、Hands&Objects 88,585 个 clip、>250,000 标注小时。
- Forecasting 长时预判 baseline(Table 38,val,edit distance 越低越好):K400 初始化 verb/noun/action ED = 0.752/0.820/0.958(Concat);+Ego4D 微调后 = 0.747/0.808/0.952;Transformer 聚合器 +Ego4D 达 0.745/0.779/0.941——各任务均从 Ego4D 域内预训练受益。
- 其余四个 benchmark 的 baseline(NLQ 用 VSLNet、VQ、MQ、Hands&Objects、AVD、Social/LAM/TTM)在附录 F–J 分别给出,作者明言这些只是「试驾」基线,2022 年 6 月开放正式挑战赛邀请社区刷点。
创新点与影响
- 贡献:(1) 数量级放大的第一人称视频语料——规模、地域、人口、场景、模态五重多样性,首次让 AI 能「看我们所看、听我们所听」;(2) 覆盖过去/现在/未来的五大 benchmark 套件(Episodic Memory、Hands & Objects、Audio-Visual Diarization、Social、Forecasting)+ 数百万标注;(3) 从设计之初就把隐私/伦理做进流程(知情同意、可撤回、PII 去标识、公共空间打码)。
- 它改变了什么:把「egocentric video」从零散小数据集升级为可规模化研究的基础设施,直接催生了机器人视觉表征的 human-video 预训练路线(R3M、VIP、MVP、VC-1/CortexBench 等均以 Ego4D 为主力预训练源),也奠定了后续 ego-exo4d(引入第三人称对齐视角)等衍生工作。Forecasting 一节明确类比 GPT-3——把「视觉预测」当作隐式捕获物理世界动力学知识的自监督任务。
- 作者自述局限:74 地远非全球覆盖、偏城市/大学城;COVID 使居家场景过采样、公共社交欠采样;叙事标注的本地语言偏差;且首个 release 每个 benchmark 只有 48–1,000 小时被标注(并非全部 3,670 小时),测试标注与叠加叙事被扣留以做挑战赛提交服务器。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2110.07058
- arXiv PDF(v3, 2022-03):https://arxiv.org/pdf/2110.07058
- 项目主页:https://ego4d-data.org/
- 代码仓库(Ego4D + Ego-Exo4D,MIT 许可):https://github.com/facebookresearch/Ego4d
- benchmark baseline 分仓:https://github.com/EGO4D/
- 数据许可申请(Ego4D license,需签署):https://ego4d.dev/request/ego4d
一手源存档(sources/)
- ego4d—github-readme — GitHub README 快照(facebookresearch/Ego4d,fetched 2026-07-16)
- ego4d—project-page — 项目主页 ego4d-data.org 快照(fetched 2026-07-16)
- arXiv 原文 PDF(arXiv:2110.07058v3,46 MB,不入 git)——正文数字均取自此 PDF,见上方 arXiv 链接