一句话定位

UC San Diego 的 In-N-On 把第一视角人类数据分成”野生(in-the-wild)“和”任务对齐(on-task)“两类,用前者做预训练、后者做后训练,喂出一条 1000+ 小时野生数据 + 20+ 小时任务数据的 PHSD 数据集,训出的语言条件 flow matching 策略 Human0 在人形机器人上展示了仅靠人类数据涌现的零样本语言跟随、单条机器人示教的少样本学习、以及用少量任务对齐人类数据大幅提升长时序任务鲁棒性。

背景与定位

机器人操作基础模型的数据规模远小于语言/视觉模型,社区因此转向跨本体学习(open-x-embodiment 等)和第一视角人类数据两条路。人类数据内部又高度异质——从 Ego4D 式的日常起居、EPIC-KITCHEN 式的厨房长时序活动,到情景喜剧片段,异质性导致简单”人类数据预训练 + 机器人数据微调”的两阶段方案容易遭遇灾难性遗忘。论文把已有的人类数据使用方式归纳为两条线并各自指出局限:一类用中间表征(物体位姿、affordance)绕开异质性但不是端到端;另一类(如 being-0、EgoVLA 等)走端到端预训练路线,同样受上述灾难性遗忘问题困扰。同期的 EgoMimic、dexumi 等则专注采集任务对齐的人类数据做协同训练,但未把野生数据和任务数据放在同一套预训练-后训练框架里系统比较。

In-N-On 的定位是首次把”野生数据做预训练、任务对齐数据做后训练”整合成一条完整的两阶段数据配方,并在此之上补一个新发现——人类数据和机器人数据混训时,策略的隐层表征会”作弊”,靠视觉/本体感受特征就能线性区分输入来自人还是机器人(简单探针即可 100% 分类),因此论文引入对抗式域适配(domain-adversarial discriminator + Gradient Reversal Layer,GRL)来压制这种捷径学习。底层动作表征沿用 humanoid-policy-human-policy-ph2d(PH2D/HAT)提出的人类中心状态-动作空间与 IK/FK 重定向套件,策略骨干沿用 pi0 的语言条件 flow matching 架构并从其预训练权重初始化。基线对比中 GR00T N1 代表另一支扩散式 VLA 路线,HAT(PH2D)代表专才策略(specialist policy)路线。

模型架构

骨干:采用 pi0 式语言条件 flow matching 策略,而非新设计架构。SigLIP 视觉编码器提取视觉 token v∈R^(L×C)(L 为 patch 数,C 为嵌入维度),与文本嵌入 n∈R^(T×C) 拼接后送入 Transformer 做跨模态融合;人类中心状态经轻量 MLP 投影为姿态 latent x∈R^C;三者共同产生融合 latent token z=Transformer(v,n,x)∈R^C。除状态/动作投影层因人类中心表征维度更大而随机初始化外,其余权重用 π0 发布的预训练 checkpoint 初始化。

统一人类中心状态-动作空间(沿用/扩展 PH2D):

  • T_head ∈ SE(3):头部位姿,作为基座变换(比 PH2D 额外编码平移,支持全身移动操作)
  • T_Lwrist, T_Rwrist ∈ SE(3):双腕位姿,相对头部坐标系表达
  • P_Lfinger, P_Rfinger ∈ R^(3×5):双手指尖关键点(5 指×3 维坐标)
  • D_Lgripper, D_Rgripper ∈ R(可选):平行夹爪场景下由拇指-食指指尖距离映射得到的夹爪开合量

重定向软件套件:基于 Pinocchio 实现 IK/FK 与手部重定向,把任意人形机器人的关节读数与统一人类中心空间做双向转换,在 MuJoCo 中可视化验证(同一人类动作重定向到不同人形机器人)。

ACTION 头:flow matching,预测从噪声到目标动作的流场 f_θ^flow(z, a_t, t),训练目标见下节。

域适配判别器:视觉 token v 与投影后的姿态 latent x 沿 token 维拼接,过一个 attention head 得特征向量 m=Attn(Concat(v,x))∈R^C;m 送入判别器 MLP D_φ 做人/机器人二分类,中间插入 Gradient Reversal Layer,使判别器损失对判别器参数 φ 最小化、对策略编码器参数 θ 最大化(对抗式 min-max),从而鼓励编码器产生本体无关(embodiment-invariant)的特征。

数据

PHSD(Physical Humans-Humanoids Dataset):1,000+ 小时野生(in-the-wild)第一视角数据 + 20+ 小时任务对齐(on-task)数据。

预训练数据(野生,三源聚合,经统一重定向套件转换):

  • egodex:800+ 小时技能丰富的人类演示,多台 Apple Vision Pro 采集,含 6-DoF 头/腕位姿与指尖关键点
  • Fourier ActionNet:100+ 小时人形机器人演示,主要在 Fourier GR1T1 本体(配双臂 Fourier 5 指 6-DoF 灵巧手)上采集
  • [humanoid-policy-human-policy-ph2d]:人类 + 人形机器人混合任务演示,人类数据同样用 Apple Vision Pro 采集,机器人数据在配 5 指 Inspire 灵巧手的 Unitree H1 上采集

后训练数据(任务对齐,commercial-grade 设备:Apple Vision Pro + Meta Aria Glass 采人类数据,Apple Vision Pro + OpenTV 采机器人数据),按任务统计的演示条数(Table 3):

任务机器人演示数人类演示数
Single Object Grasping1202545
Multi Object Grasping1801016
Burger assembly80750
Pouring1(初始)+ 30(左手)+ 30(右手)= 61727

数据配比:预训练阶段人类数据量远超机器人数据,人工调整采样比例以稳定训练;后训练阶段机器人数据占比明显提高,但实证发现人类数据采样比例调高到约 70% 更能保留人类数据中的语义(论文称这与另一项同期工作用 8:2 人类:机器人采样比的发现基本一致,该工作在原文中因参考文献列表未被 arXiv HTML 渲染而无法核实具体标题)。图像分辨率统一为 240×320。数据全部来自真实采集(人类穿戴设备 + 真实机器人遥操),论文未披露仿真数据。

训练方法

两阶段流程:预训练(混合三份野生人类+机器人数据集,学习统一视觉-语言-动作先验)→ 后训练(仅用目标任务的人类+机器人数据,精炼语言 grounding 与视觉运动控制)。

Flow matching 目标(预训练与后训练共用同一目标):

L_FM = E[‖f_θ^flow(z, a_t, t) − (a − u)‖²₂]

其中 u ~ N(0, I_C) 为高斯噪声,t ~ U(0,1) 为时间步,a_t = (1−t)u + ta 为插值动作,a 为目标动作。

域适配对抗损失:

L_D(φ|θ) = −E[log D_φ(m_h)] − E[log(1−D_φ(m_r))]

max_θ min_φ L_D(φ,θ)(m_h、m_r 分别为人类/机器人样本的融合特征,GRL 实现梯度反转)

总损失:L_final = L_FM + λ·L_D(φ|θ),λ = 0.1(实验中固定取值)。

无 RL 微调,纯监督式 flow matching + 对抗域适配;后训练阶段沿用与预训练相同的目标函数(Eq. 2),只是数据换成任务对齐数据。

Infra(训练 / 推理工程)

  • 预训练:8× H200 GPU,100k 步,batch size 160,从 π0 发布的预训练 checkpoint 初始化。
  • 后训练:单张 H100 GPU,30k 步,batch size 10——论文强调这展示了”用单卡即可微调出可用的第一视角操作策略”的民主化应用场景。
  • 机器人平台:Unitree H1 与 Unitree G1 人形机器人,均配 Inspire 5 指灵巧手;论文数据/实验多数在 G1 上完成。
  • 推理 FPS / 控制频率:未披露具体数值。
  • 边缘硬件:数据采集侧为 Apple Vision Pro 与 Meta Aria Glass(均输出头位姿、腕位姿、稠密指尖关键点预测);机器人遥操作数据经 Apple Vision Pro + OpenTV 采集。
  • GPU-hours:未披露。

评测 benchmark

四个真实人形机器人任务(Single/Multi Object Grasping、Burger assembly、Pouring),区分 I.D.(训练分布内)与 O.O.D.(未见物体/场景/语言指令)设置,基线对比 π0、GR00T N1、HAT(PH2D,专才策略,不支持部分设置)、以及去掉全部人类数据的消融 Human0 w/o human(Table 1,success rate / total trials):

方法Single I.D.Single O.O.DMulti I.D.Multi O.O.DBurger I.D.Burger O.O.DPouring I.D.
π019/2019/2025/3016/305/123/120/20
GR00T N118/2013/206/308/304/123/120/20
HAT w/ human17/2015/20----2/20
Human0 w/o human18/2018/2023/3015/307/122/122/20
Human0(Ours)20/2019/2029/3030/308/127/125/20

Human0 在全部四个任务、I.D. 和 O.O.D. 设置下均取得最优或并列最优成绩,尤其 Multi Object Grasping O.O.D.(30/30)和 Burger assembly(O.O.D. 相对基线”超过 100% 相对提升”)差距明显;论文指出 π0 在多物体抓取任务面对未见物体时会随机抓 2 个候选物体中的 1 个,成功率约 50%(GR00T N1 在同一设置下实测更低,仅 6/30 I.D.、8/30 O.O.D.)。

域适配消融(Table 2,Pouring 任务分阶段/复合成功率,20 次试验):

判别器右手抓取左手抓取倒水复合 SR
17/205/203/2015%
16/207/205/2025%

线性探针实验(Fig. 5):未加判别器的 vanilla 模型上,一个简单 MLP 仅用中间视觉+本体感受 token 就能在留出验证集上达到 100% 的人/机器人二分类准确率,证明模型隐式学会了”作弊”;加入 GRL 判别器后(Fig. 7),探针预测概率回落到约 50%(等同随机猜测),表明特征已变得本体无关。

背景泛化消融(Table 4,Multi Object Grasping,30 次试验):白桌(原始)29/30(I.D.)、30/30(O.O.D.);黑色桌布 26/30、29/30;花纹桌布 24/30、28/30——背景变化下性能有轻微下降但整体保持稳健。

多目标语言跟随(Table 5,I.D. 指令来自机器人数据、O.O.D. 指令仅出现在人类数据):Multi Object Grasping 29/30(I.D.)、30/30(O.O.D.);Burger assembly 10/12(I.D.)、10/12(O.O.D.)——O.O.D. 指令下性能不降反升/持平,显示较强的零样本语言泛化。

少样本机器人学习:Pouring 任务仅用 1 条机器人示教(另加 30+30 条同任务左/右手抓取变体),Human0 达到 5/20 成功率;论文明确指出”在当前训练规模下无法仅靠人类数据学到全新行为(零样本行为)“,但认为随着人类数据规模扩大,少样本表现可能进一步提升直至趋近零样本。

机器人数据量消融(Fig. 8):在 Single Object Grasping 任务上变化机器人训练数据占比,发现人类数据在机器人数据稀缺(low-data regime)时能有效正则化训练。

创新点与影响

  • 首次系统性地把第一视角人类数据按”野生 vs 任务对齐”分类,并分别对应到预训练/后训练两阶段,给出一条可执行的数据配方,而非笼统地”用人类数据预训练”。
  • 发现并量化了人机混训中的隐性域捷径问题(线性探针 100% 区分人类/机器人特征),并用对抗式 GRL 判别器纠正,同时在 Pouring 少样本任务上验证了该纠正带来的实际性能提升(15%→25% 复合成功率)。
  • 用真实人形机器人任务(尤其是模拟真实快餐店工人场景的 Burger assembly)展示了仅靠人类数据涌现的三种能力:未见语言指令的零样本跟随、单条机器人示教的少样本学习、以及跨物体/背景/光照变化的鲁棒性提升,并给出后训练阶段人类:机器人采样比(约 7:3)的经验设置。
  • 论文自陈局限(6.5 节 Failure analysis):场景/光照变化下仍会误定位或混淆颜色相近物体,导致误抓/碰撞,在工具使用、精细操作任务上被放大;长时序任务(Burger assembly)早期抓取误差会累积成不可恢复的下游错位;Pouring 任务任一阶段失败则整体失败;域适配虽压制了显性的人机特征区分,但在关节极限附近的运动、接触密集场景下的抓取稳定性等更细粒度的本体差异仍未完全消除;未来方向包括进一步扩大人类数据规模、以及在人形机器人之外的其他本体上验证方法。

原始链接

一手源存档(sources/)