一句话定位
UC San Diego 的 In-N-On 把第一视角人类数据分成”野生(in-the-wild)“和”任务对齐(on-task)“两类,用前者做预训练、后者做后训练,喂出一条 1000+ 小时野生数据 + 20+ 小时任务数据的 PHSD 数据集,训出的语言条件 flow matching 策略 Human0 在人形机器人上展示了仅靠人类数据涌现的零样本语言跟随、单条机器人示教的少样本学习、以及用少量任务对齐人类数据大幅提升长时序任务鲁棒性。
背景与定位
机器人操作基础模型的数据规模远小于语言/视觉模型,社区因此转向跨本体学习(open-x-embodiment 等)和第一视角人类数据两条路。人类数据内部又高度异质——从 Ego4D 式的日常起居、EPIC-KITCHEN 式的厨房长时序活动,到情景喜剧片段,异质性导致简单”人类数据预训练 + 机器人数据微调”的两阶段方案容易遭遇灾难性遗忘。论文把已有的人类数据使用方式归纳为两条线并各自指出局限:一类用中间表征(物体位姿、affordance)绕开异质性但不是端到端;另一类(如 being-0、EgoVLA 等)走端到端预训练路线,同样受上述灾难性遗忘问题困扰。同期的 EgoMimic、dexumi 等则专注采集任务对齐的人类数据做协同训练,但未把野生数据和任务数据放在同一套预训练-后训练框架里系统比较。
In-N-On 的定位是首次把”野生数据做预训练、任务对齐数据做后训练”整合成一条完整的两阶段数据配方,并在此之上补一个新发现——人类数据和机器人数据混训时,策略的隐层表征会”作弊”,靠视觉/本体感受特征就能线性区分输入来自人还是机器人(简单探针即可 100% 分类),因此论文引入对抗式域适配(domain-adversarial discriminator + Gradient Reversal Layer,GRL)来压制这种捷径学习。底层动作表征沿用 humanoid-policy-human-policy-ph2d(PH2D/HAT)提出的人类中心状态-动作空间与 IK/FK 重定向套件,策略骨干沿用 pi0 的语言条件 flow matching 架构并从其预训练权重初始化。基线对比中 GR00T N1 代表另一支扩散式 VLA 路线,HAT(PH2D)代表专才策略(specialist policy)路线。
模型架构
骨干:采用 pi0 式语言条件 flow matching 策略,而非新设计架构。SigLIP 视觉编码器提取视觉 token v∈R^(L×C)(L 为 patch 数,C 为嵌入维度),与文本嵌入 n∈R^(T×C) 拼接后送入 Transformer 做跨模态融合;人类中心状态经轻量 MLP 投影为姿态 latent x∈R^C;三者共同产生融合 latent token z=Transformer(v,n,x)∈R^C。除状态/动作投影层因人类中心表征维度更大而随机初始化外,其余权重用 π0 发布的预训练 checkpoint 初始化。
统一人类中心状态-动作空间(沿用/扩展 PH2D):
- T_head ∈ SE(3):头部位姿,作为基座变换(比 PH2D 额外编码平移,支持全身移动操作)
- T_Lwrist, T_Rwrist ∈ SE(3):双腕位姿,相对头部坐标系表达
- P_Lfinger, P_Rfinger ∈ R^(3×5):双手指尖关键点(5 指×3 维坐标)
- D_Lgripper, D_Rgripper ∈ R(可选):平行夹爪场景下由拇指-食指指尖距离映射得到的夹爪开合量
重定向软件套件:基于 Pinocchio 实现 IK/FK 与手部重定向,把任意人形机器人的关节读数与统一人类中心空间做双向转换,在 MuJoCo 中可视化验证(同一人类动作重定向到不同人形机器人)。
ACTION 头:flow matching,预测从噪声到目标动作的流场 f_θ^flow(z, a_t, t),训练目标见下节。
域适配判别器:视觉 token v 与投影后的姿态 latent x 沿 token 维拼接,过一个 attention head 得特征向量 m=Attn(Concat(v,x))∈R^C;m 送入判别器 MLP D_φ 做人/机器人二分类,中间插入 Gradient Reversal Layer,使判别器损失对判别器参数 φ 最小化、对策略编码器参数 θ 最大化(对抗式 min-max),从而鼓励编码器产生本体无关(embodiment-invariant)的特征。
数据
PHSD(Physical Humans-Humanoids Dataset):1,000+ 小时野生(in-the-wild)第一视角数据 + 20+ 小时任务对齐(on-task)数据。
预训练数据(野生,三源聚合,经统一重定向套件转换):
- egodex:800+ 小时技能丰富的人类演示,多台 Apple Vision Pro 采集,含 6-DoF 头/腕位姿与指尖关键点
- Fourier ActionNet:100+ 小时人形机器人演示,主要在 Fourier GR1T1 本体(配双臂 Fourier 5 指 6-DoF 灵巧手)上采集
- [humanoid-policy-human-policy-ph2d]:人类 + 人形机器人混合任务演示,人类数据同样用 Apple Vision Pro 采集,机器人数据在配 5 指 Inspire 灵巧手的 Unitree H1 上采集
后训练数据(任务对齐,commercial-grade 设备:Apple Vision Pro + Meta Aria Glass 采人类数据,Apple Vision Pro + OpenTV 采机器人数据),按任务统计的演示条数(Table 3):
| 任务 | 机器人演示数 | 人类演示数 |
|---|---|---|
| Single Object Grasping | 120 | 2545 |
| Multi Object Grasping | 180 | 1016 |
| Burger assembly | 80 | 750 |
| Pouring | 1(初始)+ 30(左手)+ 30(右手)= 61 | 727 |
数据配比:预训练阶段人类数据量远超机器人数据,人工调整采样比例以稳定训练;后训练阶段机器人数据占比明显提高,但实证发现人类数据采样比例调高到约 70% 更能保留人类数据中的语义(论文称这与另一项同期工作用 8:2 人类:机器人采样比的发现基本一致,该工作在原文中因参考文献列表未被 arXiv HTML 渲染而无法核实具体标题)。图像分辨率统一为 240×320。数据全部来自真实采集(人类穿戴设备 + 真实机器人遥操),论文未披露仿真数据。
训练方法
两阶段流程:预训练(混合三份野生人类+机器人数据集,学习统一视觉-语言-动作先验)→ 后训练(仅用目标任务的人类+机器人数据,精炼语言 grounding 与视觉运动控制)。
Flow matching 目标(预训练与后训练共用同一目标):
L_FM = E[‖f_θ^flow(z, a_t, t) − (a − u)‖²₂]
其中 u ~ N(0, I_C) 为高斯噪声,t ~ U(0,1) 为时间步,a_t = (1−t)u + ta 为插值动作,a 为目标动作。
域适配对抗损失:
L_D(φ|θ) = −E[log D_φ(m_h)] − E[log(1−D_φ(m_r))]
max_θ min_φ L_D(φ,θ)(m_h、m_r 分别为人类/机器人样本的融合特征,GRL 实现梯度反转)
总损失:L_final = L_FM + λ·L_D(φ|θ),λ = 0.1(实验中固定取值)。
无 RL 微调,纯监督式 flow matching + 对抗域适配;后训练阶段沿用与预训练相同的目标函数(Eq. 2),只是数据换成任务对齐数据。
Infra(训练 / 推理工程)
- 预训练:8× H200 GPU,100k 步,batch size 160,从 π0 发布的预训练 checkpoint 初始化。
- 后训练:单张 H100 GPU,30k 步,batch size 10——论文强调这展示了”用单卡即可微调出可用的第一视角操作策略”的民主化应用场景。
- 机器人平台:Unitree H1 与 Unitree G1 人形机器人,均配 Inspire 5 指灵巧手;论文数据/实验多数在 G1 上完成。
- 推理 FPS / 控制频率:未披露具体数值。
- 边缘硬件:数据采集侧为 Apple Vision Pro 与 Meta Aria Glass(均输出头位姿、腕位姿、稠密指尖关键点预测);机器人遥操作数据经 Apple Vision Pro + OpenTV 采集。
- GPU-hours:未披露。
评测 benchmark
四个真实人形机器人任务(Single/Multi Object Grasping、Burger assembly、Pouring),区分 I.D.(训练分布内)与 O.O.D.(未见物体/场景/语言指令)设置,基线对比 π0、GR00T N1、HAT(PH2D,专才策略,不支持部分设置)、以及去掉全部人类数据的消融 Human0 w/o human(Table 1,success rate / total trials):
| 方法 | Single I.D. | Single O.O.D | Multi I.D. | Multi O.O.D | Burger I.D. | Burger O.O.D | Pouring I.D. |
|---|---|---|---|---|---|---|---|
| π0 | 19/20 | 19/20 | 25/30 | 16/30 | 5/12 | 3/12 | 0/20 |
| GR00T N1 | 18/20 | 13/20 | 6/30 | 8/30 | 4/12 | 3/12 | 0/20 |
| HAT w/ human | 17/20 | 15/20 | - | - | - | - | 2/20 |
| Human0 w/o human | 18/20 | 18/20 | 23/30 | 15/30 | 7/12 | 2/12 | 2/20 |
| Human0(Ours) | 20/20 | 19/20 | 29/30 | 30/30 | 8/12 | 7/12 | 5/20 |
Human0 在全部四个任务、I.D. 和 O.O.D. 设置下均取得最优或并列最优成绩,尤其 Multi Object Grasping O.O.D.(30/30)和 Burger assembly(O.O.D. 相对基线”超过 100% 相对提升”)差距明显;论文指出 π0 在多物体抓取任务面对未见物体时会随机抓 2 个候选物体中的 1 个,成功率约 50%(GR00T N1 在同一设置下实测更低,仅 6/30 I.D.、8/30 O.O.D.)。
域适配消融(Table 2,Pouring 任务分阶段/复合成功率,20 次试验):
| 判别器 | 右手抓取 | 左手抓取 | 倒水 | 复合 SR |
|---|---|---|---|---|
| 无 | 17/20 | 5/20 | 3/20 | 15% |
| 有 | 16/20 | 7/20 | 5/20 | 25% |
线性探针实验(Fig. 5):未加判别器的 vanilla 模型上,一个简单 MLP 仅用中间视觉+本体感受 token 就能在留出验证集上达到 100% 的人/机器人二分类准确率,证明模型隐式学会了”作弊”;加入 GRL 判别器后(Fig. 7),探针预测概率回落到约 50%(等同随机猜测),表明特征已变得本体无关。
背景泛化消融(Table 4,Multi Object Grasping,30 次试验):白桌(原始)29/30(I.D.)、30/30(O.O.D.);黑色桌布 26/30、29/30;花纹桌布 24/30、28/30——背景变化下性能有轻微下降但整体保持稳健。
多目标语言跟随(Table 5,I.D. 指令来自机器人数据、O.O.D. 指令仅出现在人类数据):Multi Object Grasping 29/30(I.D.)、30/30(O.O.D.);Burger assembly 10/12(I.D.)、10/12(O.O.D.)——O.O.D. 指令下性能不降反升/持平,显示较强的零样本语言泛化。
少样本机器人学习:Pouring 任务仅用 1 条机器人示教(另加 30+30 条同任务左/右手抓取变体),Human0 达到 5/20 成功率;论文明确指出”在当前训练规模下无法仅靠人类数据学到全新行为(零样本行为)“,但认为随着人类数据规模扩大,少样本表现可能进一步提升直至趋近零样本。
机器人数据量消融(Fig. 8):在 Single Object Grasping 任务上变化机器人训练数据占比,发现人类数据在机器人数据稀缺(low-data regime)时能有效正则化训练。
创新点与影响
- 首次系统性地把第一视角人类数据按”野生 vs 任务对齐”分类,并分别对应到预训练/后训练两阶段,给出一条可执行的数据配方,而非笼统地”用人类数据预训练”。
- 发现并量化了人机混训中的隐性域捷径问题(线性探针 100% 区分人类/机器人特征),并用对抗式 GRL 判别器纠正,同时在 Pouring 少样本任务上验证了该纠正带来的实际性能提升(15%→25% 复合成功率)。
- 用真实人形机器人任务(尤其是模拟真实快餐店工人场景的 Burger assembly)展示了仅靠人类数据涌现的三种能力:未见语言指令的零样本跟随、单条机器人示教的少样本学习、以及跨物体/背景/光照变化的鲁棒性提升,并给出后训练阶段人类:机器人采样比(约 7:3)的经验设置。
- 论文自陈局限(6.5 节 Failure analysis):场景/光照变化下仍会误定位或混淆颜色相近物体,导致误抓/碰撞,在工具使用、精细操作任务上被放大;长时序任务(Burger assembly)早期抓取误差会累积成不可恢复的下游错位;Pouring 任务任一阶段失败则整体失败;域适配虽压制了显性的人机特征区分,但在关节极限附近的运动、接触密集场景下的抓取稳定性等更细粒度的本体差异仍未完全消除;未来方向包括进一步扩大人类数据规模、以及在人形机器人之外的其他本体上验证方法。
原始链接
- arXiv: https://arxiv.org/abs/2511.15704
- 项目主页: https://xiongyicai.github.io/In-N-On/
- GitHub: https://github.com/XiongyiCai/Human0
- HF 模型(Human0,权重”计划开源”,fetch 时 README 为空仅有 license): https://huggingface.co/XiongyiC/Human0
- HF 数据集(PHSD,fetch 时 README 为空仅有 license): https://huggingface.co/datasets/XiongyiC/PHSD
一手源存档(sources/)
- in-n-on-human0—project-page — 项目主页(摘要、数据/演示视频描述、方法图说明)
- in-n-on-human0—github-readme — GitHub README(仓库定位与三步流程简述)
- arXiv 原文 PDF(https://arxiv.org/pdf/2511.15704,不入 git)