一句话定位

PH²D 是一个大规模、任务导向的第一视角人类—人形机器人配对数据集(约 302 万人类帧 / 26,824 条人类演示 + 约 66.8 万机器人帧 / 1,552 条机器人(Unitree H1)遥操作演示),配套训练 Human Action Transformer(HAT)——把人和人形机器人统一建模为共享 54 维手腕—指尖状态-动作空间下的”不同本体”,通过可微分的运动学重定向把人类动作直接转成机器人动作、端到端联合训练,不依赖 affordance / 物体关键点等中间表征代理,在真机实验中让分布外(O.O.D.)任务的总成功次数从 ACT 基线的 59/170 提升到 101/170。

背景与定位

  • 现有模仿学习面临两难:机器人遥操作数据(如 open-x-embodimentdroid 等跨机器人聚合数据集)质量高但采集贵、难以规模化;互联网人类视频数量巨大,但和机器人动作之间存在具身鸿沟(embodiment gap),多数工作靠 affordance、物体关键点等中间表征代理训练,容易产生复合误差(composite error)。
  • PH²D/HAT 的立场是”直接模仿人类行为、不用学习代理”:把人和人形机器人都当成同一个状态-动作空间里的不同本体,用逆运动学(IK)+ 手部重定向把人类动作可微分地转换为机器人动作,训练时两种本体的数据混合送进同一个 Transformer,无需额外监督。
  • 论文把最直接的同类工作归为”对齐动作”一派:DexCap(手套 + 胸挂 RGBD 相机采 3D 手姿,仅 787 条演示、无机器人协同数据)与 EgoMimicegomimic,可穿戴设备 + 视觉掩码对齐观测,需要严格的视觉传感器对齐和启发式设计,约 2,150 条人类演示)。PH²D 用消费级 VR 设备(Vision Pro / Quest 3 + ZED)降低采集门槛,规模(26,824 条人类演示)与任务/物体/相机多样性均大于二者(见论文 Table I),且部署时不需要严格视觉传感器对齐或掩码等启发式设计。真机遥操作硬件方案沿用作者团队此前的 open-television(OpenTV)。
  • 与同样用 Apple Vision Pro + ARKit 采集第一视角人类数据的 egodex(Apple,2025-05)相比:EgoDex 规模远大(829 小时、9000 万帧)但只是纯人类数据集、不含机器人协同数据;PH²D 规模较小但同时采集了配对的机器人遥操作数据并做真机 co-training 验证,二者互不引用、无数据重叠,代表同一新兴范式(消费级 XR 设备做被动可扩展的人类灵巧操作数据采集)的两条并行路径。

模型架构

  • 策略骨干:基于 Action Chunking Transformer(ACT,open-television 所用 OpenTV 实现之上)改造,用冻结的 DinoV2 ViT-S 视觉编码器替换原始 ACT 的可训练 ImageNet 预训练 ResNet-18,并在中间层加入可训练的视觉适配器(visual adaptor)。
  • 统一状态-动作空间:机器人与人类都用同一个 54 维动作向量表示——头部、左手腕、右手腕的旋转各用 6D 旋转表示(3×6=18 维);左右手腕平移各为 x/y/z(2×3=6 维);机器人 5 指灵巧手与人手之间存在双射映射,10 个指尖各用 3D x/y/z 关键点回归(10×3=30 维);合计 18+6+30=54 维。作者指出也可采用单射映射(如把拇指到其余手指的距离映回平行夹爪开合度),留作未来工作。
  • 视觉域差处理:人类采集相机(VR 设备 + ZED)与机器人部署相机存在色调等域差,人手与机器人末端外观也不同;论文发现在数据足够大且多样时,无需专门的视觉增强启发式(如添加视觉伪影或生成式方法)——普通的颜色抖动(color jittering)与高斯模糊即可作为有效正则化。
  • 动作域差处理:人类动作速度远快于人形机器人遥操作,训练时对人类数据的平移/旋转做插值”减速”,减速因子 α_slow 由人类与人形机器人平均任务完成时间的比值经验决定(约为 4),论文统一取 α_slow = 4;此外训练时对本体感受(proprioception)输入做随机 dropout,避免策略过度依赖低维状态输入而非视觉。
  • 本体感受随机丢弃 + 跨本体归一化:消融了”是否对人类/机器人使用不同的状态-动作归一化系数”这一设计选择(详见评测部分)。
  • 训练目标:ℒ = ℓ₁(π(sᵢ), aᵢ) + λ·ℓ₁(π(sᵢ)_EEF, aᵢ,EEF),其中 λ=2,用于强调末端执行器(EEF)位置精度重于指尖关键点精度。
  • 机器人本体:Unitree H1 双臂人形机器人 + 一对 6-DOF Inspire 灵巧手;新增 2 DoF 主动颈部(跟随 OpenTV 设计)使机器人可视觉聚焦操作对象;不驱动下肢;总计 28 自由度;仅用头部相机、不用腕部相机,专门研究纯第一视角视觉下的操作能力。

数据

  • 规模对比(论文 Table I):PH²D 人类数据 ~3.02M 帧(按 30Hz 估算)、26,824 条演示;配套机器人(Unitree H1 遥操作)数据 ~668k 帧1,552 条演示。对比同类工作:DexCap ~378k 帧 / 787 条演示(无机器人数据);EgoMimic ~432k 帧 / 2,150 条人类演示 + 1.29M 帧 / 1,000 条机器人演示。项目页面口径为”约 27k 条带语言标注的演示,耗时数十小时”。
  • 采集硬件:两套消费级 VR 方案——① Apple Vision Pro + 内置底部左侧摄像头,自研 VisionOS App + Apple ARKit 获取 3D 头/手姿;② Meta Quest 3 / Apple Vision Pro + ZED Mini 双目相机,基于 open-television(OpenTV)的 Web 应用采集 3D 头/手姿,配 3D 打印相机支架,整套成本 <700 美元,引入双目相机带来的视觉多样性。
  • 采集流程:让人类操作者佩戴 VR 设备完成与机器人执行重叠的任务(如抓取、倒水),每条演示配语言指令(如 “grasp a can of coke zero with right hand”),按最近时间戳同步本体感受与视觉输入。
  • 动作域差缓解(数据侧):要求采集者**端坐(upright)**减少无意识的全身/腰部运动;把物体放在人手臂工作空间内,避免全身移动,使人类工作空间贴近人形机器人(无全身运动)的工作空间。
  • 评测任务:4 类双手灵巧操作——杯子传递(cup passing)水平抓取(horizontal grasping:瓶子/box_1/box_2/易拉罐)垂直抓取(vertical grasping:3×3 网格 9 个位置抓取 Dynamixel 盒)倾倒(pouring);每类均设 In-Distribution / Human-Distribution / Out-Of-Distribution 场景,机器人数据故意只覆盖训练分布的一小部分(如垂直抓取仅在右侧网格采 50 次、左侧仅 10 次),人类数据覆盖更多背景、物体、位置。
  • 仿真数据:GitHub 开源数据额外包含 1 个 Unitree H1 在 Mujoco 仿真中经遥操作采集的数据集(用于代码开发与新本体接入的沙盒测试),论文真机实验本身不使用仿真数据。
  • 开源:HuggingFace RogerQi/PH2D(MIT 许可)公开人类数据、UCSD/CMU 两台 Unitree H1 的真机遥操作数据、Mujoco 仿真数据;HDF5 组织,每个文件夹对应一个任务,任务 ID 以 “1” 开头表示人类演示。

训练方法

  • 两个基线对比ACT(仅用机器人数据训练,状态表示为关节位置)与 HAT(架构相同,但状态编码器工作在统一状态-动作空间,默认在机器人+人类数据上联合 co-train)。
  • 联合训练:每个 batch 从 𝒟_robot 或 𝒟_human 中采样状态-动作对,共享同一组可训练参数(本体感受编码器 θ + Transformer 主干),无需针对人类/机器人分别设计模块。
  • 消融验证的关键设计(Table VI,均在垂直抓取子任务上报告成功次数):
    • 统一状态空间 + 不做速度插值(无减速):1/10
    • 不统一状态空间(关节位置 vs EEF 表示)+ 做速度插值:0/10
    • 完整方法(统一状态空间 + 速度插值):4/10
    • 论文解读:不做减速插值会导致预测速度在”像人类”和”像遥操作”之间跳变、造成不稳定;不统一状态空间会让策略退化成”看到熟悉状态就切到对应本体的专用子策略”(条件切换),在 I.D. 上成功率尚可但几乎无法跨本体迁移。
  • 归一化消融(Table II 的 D. Norm 列):对人类/机器人使用相同 vs. 不同的归一化系数,整体成功次数差异不大(97/170 vs 101/170),但用不同归一化时成功分布偏向网格右上区域——作者推测因为人类工作空间是人形机器人工作空间的超集,统一归一化会让机器人状态-动作分布相对更集中。
  • 全身运动消融(Table V,水平抓取任务,人类数据是否含全身/肩腰运动):无全身运动 21/40 vs 有全身运动 18/40——现有人形机器人尚无法复现人类无意识的全身动作,含有这类动作的人类数据反而拖累部署表现。

Infra(训练 / 推理工程)

  • 论文正文未披露具体的 GPU 型号/数量、GPU-hours、并行策略、训练精度(BF16/FP32)、batch size、学习率、训练步数等超参——四个实验任务的实际训练配置在 arXiv 全文中没有给出数值。
  • GitHub 仓库给出的是通用实现说明而非论文实验的确切配置:单卡示例要求 ≥24GB 显存的 GPU;更复杂训练(BF16 / torch.compile / 多卡)通过 HuggingFace accelerate 支持,示例脚本默认 chunk_size=100batch_size=64num_epochs=50000lr=1e-4(这是仓库 Mujoco 玩具示例的默认值,不代表论文四个真机任务的实际训练配置,因此不作为论文数字引用)。
  • 推理侧:论文未披露具体的控制频率(Hz)、单步推理延迟或边缘硬件;数据采集与部署速度以任务完成时间衡量(见下表),而非推理帧率。

评测 benchmark

均为论文真机实验的自建评测(Unitree H1 + Inspire 灵巧手),无外部数据集/第三方 SOTA 对比:

  • 整体评测(Table II,含 4 类任务 I.D./O.O.D. 成功次数)
    • ACT(仅机器人数据):Ovr. 成功 I.D. 42/60,O.O.D. 59/170
    • HAT(联合训练,不同本体不同归一化 ✗):Ovr. I.D. 45/60,O.O.D. 97/170
    • HAT(联合训练,不同本体不同归一化 ✓,完整方法):Ovr. I.D. 49/60,O.O.D. 101/170
    • 论文原文表述:“co-training drastically improves O.O.D. settings, achieving nearly 100% relative improvement”(即从表中 ACT 的 59/170 到 HAT 完整方法的 101/170 这一整体提升,作者用”接近 100% 相对提升”来定性描述);I.D. 场景下两者差异很小,说明冻结视觉骨干本身已提供不错的近场景鲁棒性。
  • 背景泛化(Table III,杯子传递任务,20 次试验计失败/重试次数):Paper(I.D.) ACT 19/20 vs HAT 20/20;Wooden(H.D.) 14/20 vs 16/20;Red(O.O.D.) 12/20 vs 18/20;Green(O.O.D.) 10/20 vs 18/20;总计 55/80 → 72/80(论文原文称整体成功率”提升近 50%”)。
  • 物体外观泛化(Table IV,水平抓取,每物体 10 次):Bottle(I.D.) 8/10 vs 8/10;Box_1(H.D.) 5/10 vs 7/10;Box_2(O.O.D.,人类数据也未见) 1/10 vs 1/10;Can(O.O.D.) 1/10 vs 4/10;总计 16/40 → 21/40。作者指出 box_2 成功率虽未提升,但 HAT 表现出更少的 OOD 失败与更主动的抓取搜索行为。
  • 物体摆放泛化(Fig. 5,垂直抓取,3×3 网格,机器人数据仅覆盖 2 个网格,其中右侧 50 次/左侧 10 次不平衡采集):论文原文定性描述”co-training…doubling the overall success rate”(具体各网格数值见论文图 5,为图片形式未能在文本抽取中还原逐格数字)。
  • 人类演示 vs 遥操作效率(Table VII,任务完成时间均值±标准差,含场景重置)
    • 常规人类演示(不戴 VR):抓取 3.79±0.27s,倾倒 4.81±0.35s
    • 人类演示(戴 VR):抓取 4.09±0.30s,倾倒 4.90±0.26s(戴 VR 几乎不影响人类操作速度)
    • 人形机器人遥操作(VR Teleop):抓取 19.72±1.65s,倾倒 37.31±6.25s
    • 即遥操作耗时约为戴 VR 人类演示的 ~4.8×(抓取)/ ~7.6×(倾倒),作者将开销主要归因于人到机器人的重定向延迟与 7-DoF 机械臂工作空间受限。
  • 跨人形本体少样本迁移(Fig. 6/7,第二台 Unitree H1_2”Humanoid B”,独立环境+单一物体,仅 20 条演示):(i) 仅用 Humanoid B 数据、(ii) Humanoid B + Humanoid A 跨本体、(iii) Humanoid B + Humanoid A + Human 三种训练下,(ii)(iii) 均显著超过 (i) 基线,且在 Humanoid B 训练时从未见过的新物体上也有提升。固定 Humanoid A(100 条)与人类数据(50 条),仅增加 Humanoid B 演示数:即使只有 5–10 条 Humanoid B 演示,联合训练在新物体上的成功次数达到孤立训练的 两倍以上,而零样本迁移(孤立训练)成功率接近随机水平(~12%)。

创新点与影响

  • 贡献:① PH²D——目前同类”任务导向、第一视角、配对手指 3D 姿态”人类数据集中规模最大(26,824 条演示)、任务/物体/相机最多样的一个(Table I);② HAT——统一人类与人形机器人状态-动作空间、无需 affordance/关键点等中间代理即可端到端联合训练的跨本体策略,并配套可微分 IK/手部重定向;③ 系统性消融证明人类数据能显著改善背景、外观、物体摆放三类分布外泛化,且对新人形本体的少样本适配有效。
  • 对生态位的改变:把”直接把人当作另一个机器人本体训练”确立为一条相对轻量的跨本体扩展路线——不需要 EgoMimic 式严格视觉传感器对齐/掩码,也不需要 DexCap 式专用手套硬件,用消费级 XR 设备即可完成,采集效率远高于遥操作(约快 5-8 倍)。
  • 作者自陈局限(论文 Limitation 一节):① 虽采集了语言标注,但当前版本策略架构相对简单,未做语言条件化的跨本体策略,留待未来扩展为大规模语言条件跨本体策略以研究对新语言指令的泛化;② 当前评测只在配备灵巧手(与人手运动学更接近)的机器人上验证,尚未验证 PH²D 是否也能帮助配备平行夹爪等其他形态末端执行器的机器人做跨本体学习。

原始链接

一手源存档(sources/)