一句话定位

Georgia Tech(Simar Kareer 等,Judy Hoffman / Danfei Xu 指导,Stanford 合作)提出 EgoMimic:用 Meta Project Aria 智能眼镜采集「无需机器人」的人类第一视角操作视频 + 3D 手部轨迹,把这类”人类具身数据”当作与遥操作机器人数据平等的训练来源(而非仅提取高层意图去指导底层策略),通过硬件对齐(同款 Aria 眼镜装在机器人上)、动作/视觉的跨域对齐处理、以及基于 ACT 的共享编码器联合策略架构,在三个长程双臂操作任务上相对 ACT 提升 34%–228% 的任务得分,并展现出”多 1 小时人类数据比多 1 小时机器人数据更值钱”的有利缩放趋势。ICRA 2025 接收。

背景与定位

模仿学习长期受限于遥操作演示数据的采集成本——论文举 RT-1 为例:需要 17 个月数据采集 + 13 台机器人(见 rt-1)。为扩大数据规模,此前主要有两条路:一是改进遥操作硬件本身,如 ALOHA/ACT 的 leader-follower 遥操作(见 aloha-act)与 gello 的低成本遥操作框架;二是绕开机器人本体、直接从人类视频里榨取信号,包括手持夹爪采集(universal-manipulation-interface,UMI)、身体穿戴式动捕(dexcap)、静态相机模仿(humanplus 的人形 shadowing)等,但这些方案要么不便携(静态相机),要么不够 ergonomic(手持/穿戴设备),难以做到”被动式”规模化采集。

同时,既有的人类视频利用方式(如 MimicPlay、Bharadhwaj et al. 的 human-to-robot 意图迁移)普遍采用分层架构:先从人类视频学一个高层规划器/意图预测器,再用它去指导一个仍然只在机器人数据上训练的低层策略——这意味着底层控制性能的天花板仍由(昂贵的)机器人数据量决定,人类数据只是”辅助信息”而非”一等数据”。

EgoMimic 的定位转变在于:借助 Aria 眼镜(75g、可长时间佩戴、带前置广角 RGB + 两个用于手部/设备定位的黑白 SLAM 相机)捕获的第一视角视频天然逼近机器人的视觉-动作-定位三件套(相机视觉、3D 手部轨迹当作”动作”、设备 SLAM 当作定位),使人类数据在形式上可以和机器人数据对齐进同一个动作空间、同一套策略网络,从而摆脱分层瓶颈,用一个共享的 ACT 式策略同时学习人类手部轨迹和机器人关节动作。这类思路呼应了 open-x-embodiment 一系列”多具身数据共训更泛化”的跨具身学习结论,但 EgoMimic 把”人类”本身也当作又一种具身(embodiment)纳入这一谱系,而不只是机器人间的迁移。其源头数据集参照的是 ego4d / ego-exo4d 这类大规模第一视角视频采集范式(Ego-Exo4D 达 3000+ 小时),论文认为未来可以直接把这类研究级第一视角数据接入训练。

模型架构

EgoMimic 的策略基于 ACT(Action Chunking Transformer)扩展,本身不含预训练 VLM/大模型骨干,是一个从零训练的 ResNet + Transformer 架构:

  • 视觉编码器:ResNet-18,人类与机器人数据共享同一套权重;输入为经 SAM2 处理后的图像(见下)。机器人额外接入两路手腕相机(Intel RealSense D405)视角,人类数据只有 Aria 主视角,Transformer 用可变长度输入序列处理这一差异(有手腕图像时多拼接对应 token,做法沿用 ACT)。
  • 本体感受编码:人类为 3D 双手位姿(SE(3)×SE(3),来自 Aria MPS 手部追踪);机器人为末端位姿 + 双臂关节位置(∈ℝ^(2×7),含夹爪关节)。两者各自做 Z-score 标准化后过线性层得到 proprioception token。
  • 策略 Transformer(编码器-解码器):Encoder 4 层、Decoder 7 层,隐藏维度 512,前馈维度 3200,8 个注意力头;额外接入 ACT 原生的 CVAE 风格 token z(由 CVAE 编码器产生,用于捕捉演示中的多模态性)。
  • 双输出头(仅隔一层线性层):pose 头(预测末端/手部位姿动作,人类和机器人数据都监督)+ joint 头(预测机器人关节动作,只有机器人数据监督)。选择关节空间控制机器人是因为 6-DoF ViperX 遥操作臂用笛卡尔空间(differential IK)控制时冗余度低、容易碰奇异点;作者指出这是硬件特定限制,更强的机械臂可以省掉这个 joint 头。
  • 动作:连续值回归(非离散 token / 非 diffusion),带 action chunking——chunk size 统一为 100,机器人在 4 秒时间窗口内取样、人类因数据”放慢 4 倍”对齐节奏而在 1 秒窗口内取样(详见”训练方法”)。
  • 跨具身对齐的关键设计:(1) 坐标系统一——把逐帧的手/末端 3D 轨迹变换到观测时刻相机坐标系下的稳定参考系(用 Aria MPS 的 SLAM 位姿变换人类轨迹,机器人用手眼标定的固定相机系变换);(2) 动作分布对齐——人类和机器人的 proprio/action 各自独立做高斯(Z-score)标准化;(3) 视觉外观对齐——用 SAM2 对人手和机械臂做黑色遮罩,再叠加一条从抓取点到肘部/手腕轮廓的红线以保留末端指向信息(SAM2 point prompt 来自 3D 手/末端位姿投影到图像的关键点)。
  • 未披露总参数量(论文未给出模型总参数统计,规模量级与 ACT/RT-1 同级 Transformer 相当)。

数据

  • 纯真实世界数据,无仿真。三个长程任务的采集统计(Table II):
任务人类 # 演示人类采集耗时(min)人类 演示/min机器人 # 演示机器人采集耗时(min)机器人 演示/min
Object-in-Bowl140060232701202
Groceries1608023003001
Laundry59010064303001

人类数据采集速率是机器人遥操作的 6–12 倍(Object-in-Bowl 上 23 vs 2 演示/分钟),这正是论文强调”人类数据被动可扩展”的直接证据。

  • 数据来源:人类数据由研究者本人佩戴 Aria 眼镜徒手完成任务采集(无需机器人在场);机器人数据来自作者自建的低成本双臂遥操作系统(leader-follower,仿 ALOHA),机器人主传感器同样是一副 Aria 眼镜(与人类数据用同款设备,最小化相机间的 FOV/曝光/动态范围差异),另加两个手腕 RealSense D405。
  • 动作标注:人类数据的动作即 Aria Machine Perception Service(MPS)云端处理输出的 3D 手部位姿轨迹(SE(3)×SE(3)),全程无需人工标注,属于被动采集;机器人动作为遥操作记录的关节 + 末端位姿真值。人类数据缺失抓握(grasp)信号——Aria 只记录手部位姿、不含抓握状态,因此抓握动作仅通过机器人关节损失分支监督。
  • 时序对齐:人类和机器人执行任务的节奏不同,参照 MimicPlay 的做法把人类数据在时间上”放慢 4 倍”(4x 是实验中发现足够对齐两域节奏的经验值);机器人动作 chunk 覆盖 4 秒地平线,人类动作 chunk(放慢后)覆盖 1 秒;两者 chunk size 均取 100(100 个均匀间隔的未来动作点)。原始采集帧率:人类 30Hz(Aria),机器人 50Hz。
  • 数据混合:训练时每步分别从人类数据集 𝒟_H 和机器人数据集 𝒟_R 各采一个 batch,二者损失相加联合更新(非拼接单一 dataloader);未与任何互联网规模数据集(如 Ego4D/Open X-Embodiment)混合训练,人类数据全部来自作者自采。
  • 官方在 HuggingFace(gatech/EgoMimic)发布了三个任务对应的 6 个 hdf5 采样数据集(bowlplace_human/robot.hdf5groceries_human/robot.hdf5smallclothfold_human/robot.hdf5),可直接用仓库脚本训练复现。

训练方法

  • 目标函数:主文 Algorithm 1 伪代码写作 MSE 回归;Appendix VI-C 给出更精确的公式——机器人损失 L_robot = L1(pose) + L1(joint) + KL,人类损失 L_hand = L1(pose) + KL(KL 为 ACT 原生的 CVAE 隐变量正则项),总损失 L = L_robot + L_hand,每步同时优化(两处表述在”是 MSE 还是 L1”上略有出入,本页以更详细的附录公式为准)。
  • 训练框架:基于 robomimic 框架实现(GitHub 显示训练主脚本由 PyTorch Lightning 驱动,支持 DDP)。
  • 超参数(Table V):AdamW 优化器,初始学习率 5e-5,Linear 调度器,decay factor 1;global batch size 128;数据增强仅用 Color Jitter。
  • 消融验证的四个关键组件(均在 Object-in-Bowl 任务上,Table IV):动作标准化(去掉后掉 38%)、SAM2 遮罩(去掉遮罩+红线掉 26%,只去掉红线掉 13%)、人类数据本身(完全去掉人类数据掉 47%,即架构不变、纯机器人数据训练时得分从 128 掉到 68)。
  • MimicPlay 基线复现细节(Appendix VI-E):先用 ResNet-18 + GMM(5 个混合分量)在人类+机器人数据上训练高层轨迹规划器(LR 1e-4,decay 0.1,batch 50),再抽取其隐变量作为 style token 输入到只用机器人数据训练的低层 ACT 策略(LR 5e-5,AdamW,同 EgoMimic 超参)——为公平对比,去掉了 MimicPlay 原生的目标条件(goal conditioning),因为 EgoMimic 面向单任务策略。
  • 无 RL 环节,纯模仿学习(行为克隆);不涉及蒸馏。

Infra(训练 / 推理工程)

  • 训练硬件:4× NVIDIA A40 GPU,global batch size 128,训练 120,000 iterations,耗时约 24 小时
  • 并行策略 / 精度:未披露具体并行方式(README 显示训练脚本支持 PyTorch Lightning DDP,多机可用 submitit/slurm 启动)与训练精度(fp16/bf16/fp32 未披露)。
  • 推理部署:真机 rollout 在桌面级 NVIDIA RTX 4090 GPU上完成,策略以 1Hz 频率做完整推理(重新预测 4 秒动作 chunk),机器人以 25Hz 频率执行控制(receding-horizon 方式只执行预测 chunk 里前 1 秒的动作后重新查询);评测阶段 SAM2 遮罩同样实时跑在同一桌面机上生成机械臂 mask。机器人传感器整体以 50Hz 更新,仅 Aria 相机以 30fps 流式传输。

评测 benchmark

三个真实世界长程双臂任务的定量对比(Table III,得分为完成阶段计数 Pts,部分任务另报告 Success Rate/SR):

MethodBowl (Pts)Laundry (Pts)Laundry SRGroceries (Pts)Groceries SRGroceries Open-Bag
ACT398255%8222%54%
MimicPlay717850%538%40%
EgoMimic (w/o human,即纯架构改动无人类数据)6810473%9228%60%
EgoMimic12811488%11030%70%
  • 相对 ACT:任务得分提升 34%–228%(最大在 Continuous Object-in-Bowl:128 vs 39,+228%),绝对成功率提升 8%–33%
  • 相对 EgoMimic(0% human) 架构对照组:得分提升 10%–88%,成功率提升 2%–15%——用于剥离”架构改动本身贡献”与”人类数据贡献”。
  • 泛化实验(Fig. 7):Laundry 任务换成训练中未见过的衣服颜色时,ACT 成功率 25%,EgoMimic 保持 85%;Object-in-Bowl 换成全新场景(新背景、新光照,且该场景零机器人数据、只靠人类数据)时,EgoMimic 得 63 分,而同样能接触该场景人类数据的 MimicPlay(因分层架构存在泛化瓶颈)只得 4 分
  • 数据缩放实验(Fig. 8):EgoMimic 用 2 小时机器人数据 + 1 小时人类数据(对应约 1400 条人类演示 vs 只有约 135 条机器人演示/小时),在 Continuous Object-in-Bowl 上得 128 分,显著超过 ACT 用 3 小时纯机器人数据的 74 分;论文同时指出 EgoMimic 在同样 2 小时机器人数据下也超过 ACT(说明部分提升来自架构本身,但追加人类数据仍带来主要增益)。
  • 消融(Table IV,Object-in-Bowl 得分):完整 EgoMimic 128 → 去掉红线 112(-13%)→ 再去掉遮罩 95(-26%,累计相对完整版)→ 再去掉动作标准化 79(-38%,相对 128)→ 完全去掉人类数据 68(-47%,相对 128)。
  • Meta 官方博客(非论文本身,单独标注)另称 Kareer “用仅 90 分钟 Aria 录制数据,实现了机器人在多个任务上 400% 的性能提升”——这一数字未在论文正文的定量表格中找到直接对应,可能是后续在 ICRA 2025 展示中更新过的结果或更宽口径的换算,本页仅作为博客方声明记录,不与论文 Table III/IV 的 34%–228% 数字混同。

创新点与影响

  • 把人类第一视角数据当作与机器人遥操作数据”平等”的具身数据,用共享编码器 + 共享 Transformer 的单一端到端策略联合训练,而非此前主流的”人类数据训高层规划器、机器人数据训低层策略”的分层范式——实验证明分层架构(MimicPlay)存在明显的泛化瓶颈(新场景仅 4 分 vs EgoMimic 63 分)。
  • 软硬件协同设计降低人类-机器人域差:机器人主视觉传感器直接用与人类数据采集同款的 Aria 眼镜(而非普通机器人相机),从硬件层面而非纯算法层面消除相机 FOV/曝光/动态范围差异;自建低成本双臂遥操作平台(BOM 低于 $1000,不含 ViperX 机械臂本身)在运动学上逼近人类上肢。
  • 三项廉价却关键的跨域对齐技巧(消融证明缺一不可):动作/本体感受的逐域 Z-score 标准化(去掉掉 38% 得分)、SAM2 遮罩 + 末端指向红线的视觉外观对齐(去掉掉 13%–26%)、坐标系统一变换。
  • 有利的数据缩放趋势:1 小时人类数据(约 1400 条演示)比 1 小时机器人遥操作数据(约 135 条演示)更容易采集,且在实际任务得分上,2 小时机器人+1 小时人类数据的组合明显优于 3 小时纯机器人数据,为”用被动人类数据替代部分昂贵遥操作数据”提供了实证支持。
  • 作者自陈局限:(1) 抓握动作在人类数据中完全缺失(Aria 只记录手部位姿、无抓握信息),只能靠机器人分支的关节损失监督,意味着抓握相关的策略能力无法直接从人类数据中学到;(2) 机器人关节空间控制头是因为 6-DoF ViperX 臂笛卡尔控制冗余度低、易遇奇异点这一具体硬件限制而引入的额外分支,更强机械臂理论上可以省去;(3) 论文明确把”泛化到全新机器人本体""泛化到人类数据中演示过、但机器人从未做过的全新行为(如叠裤子而非叠 T 恤)“列为未来工作,当前方法尚未验证跨具身或跨行为类别的迁移。

原始链接

一手源存档(sources/)