一句话定位
EgoDex 是 Apple 用 Apple Vision Pro 采集的当时规模最大、最多样的人类灵巧操作数据集:829 小时 1080p / 30Hz 第一视角(egocentric)视频,配对采集时刻同步产生的 3D 头/上身/双手骨骼追踪(每只手 25 个关节),覆盖 194 个桌面操作任务、338,000 条演示 / 9000 万帧 / 2.0 TB,并附带手部轨迹预测的 benchmark、评测指标与 14 个模仿学习 baseline,主张走”第一视角人类视频 + 配对 3D 手姿”这条**被动可扩展(passively scalable)**的第三条路来破解机器人操作的数据稀缺。
背景与定位
模仿学习的老大难是数据稀缺:语言和 2D 视觉有互联网级语料,灵巧操作没有。论文把已有路线归为两类并指出各自的天花板——
- 遥操(teleoperation):open-x-embodiment(RT-X)、droid 等社区聚合了数百小时真机数据,可用于预训练控制策略,但受制于物理机器人运行速度,难以继续扩规模,且泛化受限于采集时的硬件本体与相机视角。
- 互联网野生视频:数据海量,但缺乏灵巧操作所需的精确标注,也没有配套的电机动作标签;即便用 HaMeR 等 3D 手姿预测网络后处理,缺多视角与已知相机外参时预测质量会退化。
EgoDex 走第三条中间路线:第一视角人类视频 + 配对 3D 手姿标注,论断这类数据像互联网文本/图像一样被动可扩展(人在戴头显时顺带产生,不需专门”采集动作”),且把人手当作通用本体(common embodiment),不绑定特定机器人硬件。范式上属”从人类视频学操作(learning from human video)“,但关键区别是标注质量:Vision Pro 多相机 + 已知内外参 + 产品级手姿预测网络在采集时就给出精确 3D 追踪,而非事后重建。
与相邻工作的定位(论文 Table 1):Ego4D / EPIC-KITCHENS 规模大但不聚焦操作、无灵巧标注;HOI4D 有 3D 手姿但靠人工标注、规模小若干数量级且偏抓取;最接近的 EgoMimic 同样采第一视角视频 + 3D 手追踪,但只有约 4 小时、且只记录腕部——EgoDex 扩到 829 小时、记录含头/肩/臂/双手每指共 25 关节。论文把 PH2D / Humanoid Policy as Human Policy(Qiu et al. 2025)列为相关工作——同样用 Apple Vision Pro + ARKit 采第一视角人类数据、并靠 co-training 弥合人→机器人本体差(PH2D 自采数据集,与 EgoDex 无引用/子集关系,PH2D 论文未提 EgoDex)。
模型架构
这是一篇数据集论文,“模型”指其上训练的模仿学习 benchmark 策略(数据采集”硬件”另述)。
数据采集平台(人手作为本体):
- Apple Vision Pro + visionOS 2 + ARKit:高分辨率、高频、宽视场的 passthrough,采集者像用自己眼睛一样无遮挡观察,相机数据无位姿偏移(不同于头戴外挂相机)。产品级姿态追踪软件让裸手自然演示、无需额外硬件。
- 多标定相机 + 端上 SLAM 精确追踪每只手每个关节的位姿;ARKit 给出每关节 0–1 的置信度(0 = 完全遮挡)。
Benchmark 策略(基于 X-IL 框架):
- 骨干:两种 Transformer 架构——encoder-decoder(EncDec) 与 decoder-only(Dec)。
- 动作头 / 策略表示:三种——行为克隆 BC(确定性)、去噪扩散 DDPM、流匹配 Flow Matching (FM)(后两者随机、可采样多模)。
- 编码器:图像 obs resize 到 224×224 过预训练 ResNet;语言标注过冻结 CLIP 编码器。
- 动作表示:每步动作 = 2 手 ×(腕 3D 位置 + 腕 6D 旋转 + 5 指尖各 3D 位置)= 48 维;实践中按固定时域分块(chunk)预测,所有位姿表达在相机坐标系。
- 规模:默认 2 亿参数;另训一个 5 亿参数版做容量消融。
跨本体(cross-embodiment)主张:若有一个视觉外观、运动学、动力学都模仿人臂/人手的假想机器人本体,本文训的”第一视角视频→3D 臂手位姿增量”策略可零样本部署(该本体落在训练分布内);否则需 co-training 小规模真机数据 / 大规模人类预训练 + 真机微调 / 训视觉编码器 / 学操作先验后 RL 微调等方式弥合 embodiment gap。
数据
规模与存储:
- 829 小时 1080p(1920×1080)、30 Hz 第一视角视频;338,000 条演示(episode)、194 个桌面任务、9000 万帧(数据样本)。
- 磁盘 2.0 TB;未压缩原始视频将占 >500 TB(约 250×),靠现代视频压缩收敛。训练时用 PyTorch torchcodec 只解码采样 batch 所需帧。
- 划分:训练集 ~725 小时(5 个 ~300 GB zip)/ 测试集 ~7 小时(16 GB,冻结的 1% held-out)/ 额外数据 ~97 小时(200 GB,split 冻结后补采);实验用 99/1 train/test 划分。
模态(每帧 30 Hz):
- 第一视角 RGB 1920×1080;2. 相机内参 + 外参;3. 上身全部关节(含每手 25 关节)3D 位置 + 朝向(SE(3) 4×4 齐次矩阵);4. 每关节姿态预测置信度(0–1);5. 操作的自然语言标注。
- 关节清单:上身 20 个(hip、spine1–7、neck1–4、左右 Shoulder/Arm/Forearm/Hand)+ 每手 24 指关节(拇指 4 + 其余四指各 5)。
leftHand/rightHand即腕部:腕置信度表征整只手是否被检出,指关节置信度是相对腕的置信度。 - 坐标系:所有 transform(含相机外参)表达在 ARKit origin frame(录制会话开始时设在地面的静止帧,session 内静止但跨 episode 不必一致)。
来源、配比与整理:
- 全部由 Apple Vision Pro 采集,无脚本、无聚合。以 session 为单位录制(约 10–15 分钟一段,内含多 episode,靠录制 App 的 pause/resume 切分 episode 边界)。
- 任务三分类以提高采集产出:Reversible(可逆对)——一对互逆任务(插充电器 ↔ 拔充电器),彼此终态落在对方初态分布;Reset-free——终态落在自身初态分布(抛球再接,重力当 reset);Reset——每次演示后需人工重置环境(这类 reset 不计入录制数据)。可逆与 reset-free 免去昂贵重置、提高单位时间产出。
- **多样性聚焦”灵巧操作行为”**而非场景:任务远超 pick-and-place——拧螺丝、系鞋带、发牌、翻书页、接网球、装电池、拧瓶盖、翻书取书、折 T 恤、洗杯子、拉拉链等;也含大量多样物体的基础 pick-and-place 与 FurnitureBench 装配基准任务。去重动词分布远宽于 DROID(DROID 很多动词 <10¹ 条演示,EgoDex 多数动词 >10³ 条)。
- 语言标注:采集者标注任务名、简短自然语言描述、环境与物体细节,这些含噪字段喂给 GPT-4 合成为单条详细描述(可逆任务给两条描述并标注哪条适用;由 GPT-4 LLM/VLM 自动生成,可能有误)。
- 仿真 vs 真实 / co-training:全为真实人类视频(无仿真);co-training/迁移到机器人由下游工作(H-RDT、Being-H0 等)承担。
- 许可:CC-by-NC-ND。
训练方法
- 两个 benchmark 任务:
- 灵巧轨迹预测(dexterous trajectory prediction):给第一视角图像观测 o₀..ₜ、骨骼位姿 s₀..ₜ、语言 l,预测未来时域 H 的手部动作块 â_{t:t+H}。
- 逆动力学(inverse dynamics):额外给终点目标图像 o_{t+H},预测起止之间的手部轨迹,可解释为视觉目标条件策略(缓解人类动作的严重多模态性)。 两 benchmark 由预测时域 H 参数化:短时 H=30(1 秒)、长时 H=90(3 秒)。设固定 1% held-out 测试集,完全可复现(不依赖物理环境)。
- 评测指标 “best-of-K”:每个测试点采样 K 次捕捉多模态,取与真值最近的一条,距离 = 预测 3D 关键点与真值的欧氏距离,在时间步与 12 个关键点(每手腕 + 5 指尖)上平均,直观即 3D 空间平均定位误差(米)。确定性模型(BC)随 K 不变;随机模型(DDPM/FM)随 K 增大而改善。
- 组合:2 架构 × 3 策略表示 = 6 基础模型,加 4 个不同数据量、2 个不同时域、1 个更大模型、1 个视觉目标条件,共 14 个模型。
- 关键超参:全部训 50,000 梯度步、batch 2048(256/GPU 数据并行),Adam lr 1e-4,训到 train/val loss 平台;DDPM 与 FM 用 16 步采样;其余超参沿用 X-IL 默认。腕旋转用 6D 表示。
Infra(训练 / 推理工程)
- 训练:每个模型在单节点 96 逻辑 CPU(48 物理)+ 8× NVIDIA A100 80GB 上训练;完整训练约 72 小时。数据并行,batch 2048(256/卡)。数据加载走 torchcodec 只解码所需帧。GPU-hours / 精度 / 更细并行策略:未披露(单跑约 8×72 = 576 A100·h)。
- 模型容量结论:默认 2 亿参数已足够——5 亿参数版在 2 秒时域得到 avg 0.045 / final 0.062,与 2 亿完全一致;中等规模模型可舒适跑在商用 GPU 上,降低复现门槛。
- 推理:benchmark 为离线轨迹预测(非实时闭环部署),推理 FPS / 控制频率 / 时延 / 边缘硬件:未披露(数据本身为 30 Hz 采集)。
评测 benchmark
全部为本文在 EgoDex 上训练的策略结果(无外部 SOTA 对比,属自建 baseline / benchmark):
- 架构对比(2 秒时域,Table 2,avg/final 距离,米):
- EncDec 一致小幅优于 Dec。
- K=1:Dec+BC 0.045/0.062、EncDec+BC 0.044/0.060(BC 最优,比 DDPM/FM 好约 15%)。
- K=10:EncDec+FM 0.038/0.041(最优)、EncDec+DDPM 0.039/0.043、Dec+FM 0.040/0.043;FM 在 K=5/10 比其他好达 34%。
- 解读:BC 的”平均预测”更好,DDPM/FM 的”最优采样”更好。
- 预测时域(Dec+BC,Table 3):H=30(1s) 0.031/0.049、H=60(2s) 0.045/0.062、H=90(3s) 0.053/0.069。相对 2s,缩到 1s 使 avg/final 改善 31%/21%,拉到 3s 使 avg/final 变差 18%/11%——时域越长、要预测越远的 48 维灵巧动作,越难。
- 视觉目标条件(Table 4):Dec+BC 加 goal image 后 0.035/0.029,avg 降 22%、final 降 53%(目标图像提供终点”锚”缓解多模态),给出逆动力学 benchmark 的 baseline。
- 数据规模 scaling(Fig 4):avg/final 距离随训练数据量对数增大而改善——支持”多采第一视角数据”的动机。
创新点与影响
- 贡献:发布迄今规模最大、最多样的人类灵巧操作数据集(轨迹、任务、帧数均大幅领先 Table 1 中所有前作),且同时具备语言标注、相机外参、灵巧(多指手姿)标注三要素;关键在标注是采集时刻同步产生(多相机 + 已知内外参 + 产品级预测网络),而非事后重建。
- 范式改变:把”第一视角人类视频 + 配对 3D 手姿”确立为被动可扩展的机器人数据路线,并以人手为通用本体去耦硬件;配套提出可复现的轨迹预测 / 逆动力学 benchmark 与 best-of-K 指标。类比”AlexNet 之前先有 ImageNet”。
- 下游影响(据 GitHub README「Community Projects」):已被 H-RDT(Human-to-Robotics Diffusion Transformer,在 EgoDex 上预训练)、Being-H0(用 MANO 手模型处理 EgoDex 标注做 VLA 预训练)采用;社区另有 HF Spaces 上的 EgoDex Viewer(Gradio 可视化 test set)。
- 作者自陈局限:场景/背景多样性有限(仅桌面),可用图像生成式数据增强补场景;灵巧标注在重遮挡(如折毛巾)或极高速运动下会不准,因其本身是模型预测;未来工作含程序化背景随机化与更多样环境采集。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2505.11709
- arXiv PDF:https://arxiv.org/pdf/2505.11709
- arXiv HTML 全文:https://arxiv.org/html/2505.11709v1
- GitHub(代码 + 数据说明):https://github.com/apple/ml-egodex
- 数据集下载(Apple CDN):https://ml-site.cdn-apple.com/datasets/egodex/README.md (part1–5 / test / extra .zip)
一手源存档(sources/)
- egodex—github-readme — GitHub README 快照(数据访问、HDF5 结构、社区项目、引用)
- arXiv 全文见上方 HTML/PDF 链接(arXiv 原文,不入 git)