一句话定位

Meta FAIR + Project Aria + 15 所大学组成的 consortium 历时两年,用 Aria 眼镜(ego) + 4-5 台 GoPro(exo) 同步拍摄 740 名各领域专家13 城市 123 个真实场景中完成 8 类技能活动,产出 5,035 takes / 1,286.3 小时(其中 ego 视频 221.26 小时)的多视角多模态视频,配三套时间对齐的语言标注(含首创的「专家点评」)与四大类 benchmark(关系/识别/熟练度/姿态)——是 ego4d 之后把「第一人称+第三人称同步」做成研究基础设施的奠基数据集,为 ego-exo 迁移学习和具身智能体从人类专家视频学技能提供了标准语料。

背景与定位

ego4d 证明了大规模第一人称视频可以成为 human-video 预训练的事实标准语料,但它只有 ego 单一视角,且拍的是无脚本日常生活活动。本文瞄准一个更窄但更深的问题:技能——如何让 AI 理解人类专家如何执行有一定难度的程序性/物理性活动(做饭、修车、打篮球、跳舞、演奏乐器等),并在 ego 与 exo 视角之间建立联系。作者指出,既有的 ego-exo 双视角数据集(CMU-MMAC、CharadesEgo、Assembly101 等)规模小、跨机位不同步,或过于「摆拍」,不足以支撑真实世界的视角迁移研究;而主流 exo 数据集(Kinetics、AVA 等)和 ego 数据集(EPIC-Kitchens、ego4d)各自只覆盖单一视角。

Ego-Exo4D 的核心主张:ego 与 exo 视角互补而非替代——ego 视角捕捉近距离手物交互与注意力,exo 视角捕捉全身姿态与环境上下文;人类从小就具备”观察他人(exo)→映射到自己(ego)“的能力,这也是技能学习的认知基础。范式上,它延续 ego4d 的”无脚本、多机构、跨地域大规模采集”路线,但引入了同步多视角、更丰富的传感器套件(Aria 全套 IMU/gaze/SLAM/点云)与三层语言标注体系,并新增了”熟练度评估”这一此前较少被系统性数据化的维度。同期/后续的相关工作包括聚焦手部/操作细粒度标注的 egodex,以及大量以 ego4d/Ego-Exo4D 为预训练语料的具身表征学习方法(R3M、MVP、VC-1 等)。论文最初发表于 arXiv 2023-11(v1),经历 v2(2024-03,数据/标注大幅扩充)发布及 CVPR 2024 会议版本,2025 年发表于 IJCV 期刊完整版;一作 Kristen Grauman(Meta FAIR,兼 UT Austin),通讯作者众多(15 所高校 PI 联合署名)。

模型架构

本文是数据集 + benchmark 论文,没有单一旗舰模型;这一维度记录采集装置架构各 benchmark 任务配套的 baseline 模型

采集装置(camera rig):每套装备含 1 台 Aria 眼镜(ego)+ 4 台 GoPro + 1 个 GoPro 遥控器 + 4 个三脚架 + 4 张 SD 卡 + 1 台笔记本 + 1 台平板(问卷),整套硬件成本(不含 Aria/手机/笔记本)低于 3,000 美元。Aria 提供:RGB 相机 + 左右两路灰度 SLAM 相机;两个 IMU(800Hz、1000Hz);7 通道麦克风阵列;气压计(50fps)、磁力计(10fps);经 Aria Machine Perception Service (MPS) 输出 6DoF 定位(VIO+SLAM,毫米级精度)、眼动 gaze、3D 静态场景点云。GoPro 通过 Aria 构建的 SLAM 地图做 6DoF 重定位,与 Aria RGB 时间同步精度达 1 帧内(±16.66ms)。

Ego-exo relation(关系)baseline:correspondence 任务用 XSegTx(基于 SegSwap 扩展的 Transformer 图像协同分割模型,纯空间)与 XView-XMem(基于 XMem 视频目标跟踪模型改造,时空联合);translation 任务用 pix2pix(GAN)与 GNT(Generalizable NeRF Transformer,利用相机位姿)做 track/clip 生成,另有 DiT 扩散模型基线做 clip 生成。

Keystep recognition(识别)baseline:TimeSFormer(K600/HowTo100M/EgoVLP/EgoVLPv2 多种预训练)、view-invariant (VI) encoder(两阶段:clip 级对比学习 + 分类)、viewpoint distillation(多视角教师蒸馏单视角学生)、Ego-Exo Transfer MAE(沿用 Ego-Exo 方法用 ego 伪标签微调 MAE 骨干)。能效版任务用 LaViLa(视觉)、Light-ASDNet(音频)及 late-fusion/cascade 组合,在 20mW(高效档)与 2825.71mW/2.8W(高性能档)两级能耗预算下评测。

Proficiency estimation(熟练度)baseline:TimeSFormer(ego/exo 各单独训练 + 后期融合)用于人物级熟练度分类;ActionFormer(时序动作定位模型,改造为时间戳回归)用于片段级”好执行/待改进”检测。

Ego pose(姿态)baseline:body pose 用 Kinpoly(仿真人形+关节力矩控制)、EgoEgo(先估头部位姿再用 DDPM 扩散模型生成全身动作,基于 AMASS 预训练)、location-based transformer(40 帧窗口,直接回归 3D 坐标,40,000 iter,Adam lr=1e-4)及静态姿态基线;hand pose 用 METRO(CNN 全局特征+Transformer,仅推理未在本集微调)、THOR-net(Keypoint-RCNN + GraFormer 图卷积做 2D→3D 提升)、HandOccNet(ResNet50-FPN + FIT/SET 两级 Transformer)、POTTER(Pooling Attention Transformer + HybrIK 回归头)。

数据

规模:5,035 takes,累计 1,286.3 小时 ego+exo 视频(ego 视频 221.26 小时),740 名参与者,123 个场地,13 座城市(美国 7 州 + 日本、哥伦比亚、加拿大、印度、新加坡),单 take 时长 8 秒–42 分钟(procedural 类如做饭最长)。8 大领域、43 项具体活动、689 个唯一 keystep。官方按场景给出的精确分布(takes / 参与者 / 场地 / 小时):

场景Takes参与者场地小时
Cooking67817360564.13h
Music276598180.08h
Soccer282781466.97h
Health39712224114.5h
Basketball910113578.01h
Dance728937106.57h
Bike Repair36332882.15h
Rock Climbing (Bouldering)140198293.90h
合计50357401231286.3h

Cooking 是唯一”跨所有站点”的场景(14 道菜谱),650+ takes、170+ 位厨师、60 个不同环境,单是 ego 视频就近 100 小时;音乐含小提琴/钢琴/吉他 3 种乐器,专家演奏者展示 300+ 种指法技巧(新手/中级 < 100 种),有意提升动作复杂度以利姿态估计任务。参与者年龄 18–74 岁,37% 女性、60% 男性、3% 非二元/不愿透露;均为该领域真实专家(职业/大学运动员、爵士/萨尔萨/中国民族舞蹈教师、竞技攀岩者、大型厨房主厨、日修数十辆自行车的技师等),个人平均经验 10+ 年,但也保留不同熟练度参与者以支撑熟练度评估任务。数据经各机构独立伦理审查、遵循 Project Aria Research Community Guidelines,且因多为封闭场地拍摄(无路人),绝大多数视频未做去标识化处理,下载需签署专门的 Ego-Exo4D License(约需 2 个工作日审批)。

语言标注(三套,均与视频时间对齐):

  • 专家点评(expert commentary):招募 52 位跨领域认证教练/讲师(90% 有 10+ 年从业经验,持美国足球总会、美国烹饪联合会、USA Climbing、美国红十字会等资质认证),对着 ego+经标注者挑选的最佳可见 exo 视角录制口头点评,平均每分钟视频点评 7 次,用 Whisper 转录;累计 117,812 条带时间戳点评,耗费 6,000+ 专家工时;每条点评平均 4 句,附带”telestrator”手绘空间标注与 1–10 分熟练度评分。
  • Narrate-and-act:参与者自述式”how-to”讲解,覆盖约 10% 的 takes(因需放慢动作专门录制)。
  • Atomic action descriptions:第三方标注员对每个原子动作打标,覆盖数据集全部视频,累计 432,467 条句子,唯一名词 2,924 个、唯一动词 1,481 个(词汇量小于专家点评但密度更高,尤其 cooking / soccer 场景)。

标注总投入:三类语言 + 各 benchmark 结构化标注合计超过 200,000 标注员工时

Correspondence 标注:6 个场景(排除 Bouldering、Dance)标注 1,335 takes,1.8M 个 mask(1fps)覆盖 5.6k 个物体实例,平均每 take 标 5.5 个物体、每物体平均连续跟踪 173 帧(排除遮挡帧)。

Keystep 标注:143,442 个片段,覆盖 664 个 keystep、17 项活动(长尾分布下取 20 样本/类阈值,分析限定 278 个高频 keystep)。

姿态标注:3D body/hand pose 共约 14M 帧(自动 GT + 人工修正两阶段流水线:先用现成 2D 关键点检测器 + 多视角三角化/RANSAC 生成自动 GT,再人工多视角修正)。人工标注部分:body pose 376K 3D / 2M 2D,hand pose 68K 3D / 340K 2D——号称文献中最大规模人工标注 ego 姿态数据集;此外还有自动生成的 body pose 9.2M/47M(3D/2D)与 hand pose 4.3M/21M(3D/2D)伪标注。人工 vs 自动标注一致性:body 3.33cm、hand 1.87cm MPJPE(远小于当前最优 baseline 误差)。

训练方法

数据集本身不含单一训练配方;论文为四大类 benchmark 各自定义了训练/评测协议:

  • Ego-exo correspondence/translation:给定一段查询 mask 轨迹(在 ego 或 exo 任一视角),预测另一视角中对应帧的 mask(或判断不可见);translation 则从 exo 帧+mask 直接生成对应 ego 帧/mask(pix2pix / GNT / DiT)。
  • Keystep recognition:clip 级分类,探索”如何在训练时有效利用 exo 视角信息提升测试时纯 ego 场景下的识别”——对比 view-invariant contrastive pretraining、viewpoint distillation、ego-exo pseudo-label transfer 三种范式;能效版本引入”传感器触发策略”,在给定能耗预算下决定何时开启摄像头/音频/IMU 采样。
  • Proficiency estimation:demonstrator 级(TimeSFormer 分类整段视频对应的 4 档熟练度:novice/early/intermediate/late expert)与 demonstration 级(ActionFormer 时间戳回归,定位”好执行”与”待改进提示”两类事件,标注来自专家点评的时间戳+极性)。
  • Ego pose:body pose 用 RGB 和/或 IMU 序列回归 17 关节 3D 坐标(MS COCO 关节定义);hand pose 用单帧 ego 图像回归每手 21 个 3D 关节;训练/评测明确排除 exo 视频、音频、gaze 等”作弊”信号,以贴近真实穿戴设备的单目、部分可观测约束。所有姿态 baseline 均可选择在纯人工标注或”人工+自动”混合标注上训练。

Infra(训练 / 推理工程)

数据集论文不披露统一的训练集群配置;仅在各 baseline 实现细节中零星披露:

  • HandOccNet 训练约 2 小时,用 8× NVIDIA V100(纯人工标注子集);
  • THOR-net 训练约 4 小时(人工数据)/ 10 小时(人工+自动数据),单张 RTX 4090
  • POTTER 训练约 43 分钟(人工)/ 4 小时(人工+自动),单张 RTX 4090
  • Location-based body pose baseline:40,000 iteration,Adam lr=1e-4,40 帧时间窗口。
  • 能效 keystep 任务显式定义两档能耗预算:20 mW(高效档,面向电池受限的 AR 眼镜/手机场景)与 2825.71 mW(≈2.8 W)(高性能档),综合计算能耗(compute)、内存读写能耗与传感器持续运行能耗(摄像头/音频/IMU 各自成本不同);论文发现高性能档下纯视觉 LaViLa 已接近饱和,融合音频反而降低表现,高效档下音视频融合更有优势。
  • 整体训练/推理硬件规模、GPU-hours、精度等未披露(论文明言不追求算法/工程创新,聚焦数据与 benchmark 定义)。

评测 benchmark

四大类任务,均在测试集上报告 baseline 结果(无更强模型对比,因为这是首篇 benchmark 定义论文):

Ego-exo correspondence(Table 4,IoU / Balanced Accuracy / Location Score / Contour Accuracy):Exo→Ego 方向最佳为 XView-XMem(+XSegTx),IoU 34.90%、Bal.Acc 66.79%;Ego→Exo 方向最佳为纯空间模型 XSegTx,IoU 27.14%、Bal.Acc 82.01%(时空模型在此方向反而不占优,因 exo 视角物体过小)。所有 baseline 在两方向 IoU 均 <35%,凸显任务难度(跨视角、重遮挡、微小物体)。

Keystep recognition(Table 6,ego 视角 Top-1 准确率):val/test 最佳为 VI Encoder(EgoExo4D 预训练),test 41.53%;Viewpoint Distillation 次之 39.49%;EgoVLPv2(EgoExo4D, ego+exo 训练) 38.76%。随机基线未报告,但 TimeSFormer(K600, ego-only) 为 35.93%。不同方法对”引入 exo 视角训练”的响应不一致:EgoVLPv2 从纯 ego 训练的 37.72% 提升到 38.76%,而 TimeSFormer(K600) 反而从 35.93% 掉到 31.04%。

Demonstrator proficiency(Table 10,Top-1 分类准确率):Random 基线 26.4%,Majority-class 基线 32.3%(val)/42.4%(test);学习模型最佳为 TimeSFormer(EgoVLPv2 预训练,多 take 推理融合) test 51.0%(ego)。Ego 视角在 cooking 等近距离场景更优,exo 视角在 bouldering 等需要全身姿态的场景更优;late fusion 未带来提升。

Demonstration proficiency(Table 11,L1-distance mAP):ActionFormer 最优(Avg mAP 3.27–4.04,随 ego/exo/ego+exo 设置 val/test 略有波动),显著优于 Random/Uniform 系列朴素基线(Avg mAP 2.17–2.48,三种视角设置下取值相同),但绝对数值偏低,显示任务仍很难。

Ego body pose(Table 12,MPJPE/MPJVE,cm/m/s):Static pose 基线 test MPJPE 215.87cm(表明姿态高度动态、不能用平均姿态近似);Location-based 最优 test MPJPE 18.51cm;Kinpoly 24.36cm;EgoEgo 26.38cm。分场景(Table 13)Location-based 在 cooking(12.65cm)、health(11.63cm)表现最好,music(15.00cm)次之。

Ego hand pose(Table 14,MPJPE/PA-MPJPE,mm;METRO/HandOccNet 未报告原始 MPJPE):人工+自动混合训练下 PA-MPJPE 从优到劣依次为 POTTER 11.07mm、HandOccNet 13.56mm、THOR-net 17.61mm、METRO*(仅推理未在本集训练)20.61mm;原始 MPJPE 方面 POTTER 28.94mm 优于 THOR-net 47.64mm。混合自动标注普遍略优于纯人工训练(如 POTTER PA-MPJPE 由 11.14mm 降到 11.07mm,THOR-net 由 17.99mm 降到 17.61mm)。

CVPR 2024 EgoVis 挑战赛(社区提交,Table E10/E11):Body Pose 赛道 4 队提交、3 队超过 baseline,冠军(多尺度模型融合)MPJPE 15.32cm,较 baseline 提升 3.19cm;Hand Pose 赛道 4 队提交、3 队超过 POTTER baseline,冠军 PCIE EgoHandPose(HP-ViT)MPJPE 25.51mm、PA-MPJPE 8.49mm,较 baseline 分别提升 11.85%/23.31%。

创新点与影响

  • 贡献:(1) 首个大规模、同步、多视角(ego + 4-5 exo)、多模态(RGB+7ch 音频+IMU+gaze+3D 点云)技能活动数据集,1,286.3 小时、740 名真实领域专家、13 城市 123 场地;(2) 首创”专家点评”这一新语言标注类型——由持证教练/讲师针对具体执行细节做批判性讲解,区别于此前只描述”做了什么”的叙事标注;(3) 首个跨 ego/exo 的熟练度评估 benchmark;(4) 迄今最大规模的人工标注 ego 3D body/hand pose 数据集,配套自动 GT 生成流水线;(5) 四大类 benchmark(关系/识别/熟练度/姿态)及完整 baseline 代码、评测脚本、web 可视化工具,全部开源。
  • 改变了什么:把”ego-exo 同步双视角”从零散小规模数据集(CMU-MMAC、CharadesEgo 等)升级为可支撑规模化研究的基础设施,是 ego4d 单视角路线的自然延伸与互补;为后续 ego-exo 迁移学习、AR 虚拟教练、机器人从人类专家视频学技能等方向提供标准训练/评测语料,并催生 CVPR EgoVis 系列公开挑战赛与 IJCV 期刊完整版。
  • 作者自陈局限:exo 相机位置在多样场景下难以统一优化,常因参与者遮挡而影响标注质量(人工挑选最佳 exo 视角作为补救);数据长尾分布明显(cooking 时长约为 soccer 的 9 倍,源于活动本身耗时差异);不同活动的”技能门槛”差异巨大(如篮球投篮 vs COVID 检测),可能给模型训练带来不均衡挑战;bike repair、health 两场景因参与者熟练度分布严重偏斜,被排除在 demonstrator proficiency 任务之外。

原始链接

一手源存档(sources/)

  • ego-exo4d—blog — Meta AI 官方博客快照(含 2024-04 v2 更新说明)
  • ego-exo4d—github-readme — facebookresearch/Ego4d 仓库 README 快照(Ego-Exo4D 相关段落)
  • ego-exo4d—project-page — ego-exo4d-data.org 首页快照(含逐场景 takes/参与者/场地/小时精确表)
  • arXiv 全文 PDF(2311.18259,v4):见上「原始链接」,arXiv 原文 PDF,不入 git