一句话定位

Ψ₀(Psi-Zero)是 USC Physical Superintelligence (PSI) Lab 提出的开源人形全身操作(loco-manipulation)基础模型:把「从人类第一视角视频学任务语义/视觉表征」与「在真机数据上学关节空间精确控制」显式拆成两个训练阶段,而不是像多数同类工作那样把人类数据和机器人数据混合共训;仅用约 800 小时人类视频 + 30 小时真机数据,在 8 个长时序真机任务上比用 10 倍以上数据训练的最强基线(GR00T N1.6)整体成功率高出 40% 以上。

背景与定位

人形机器人的全身运动控制(whole-body control)近年进展显著,但操作能力——尤其是长时序、需要双臂协同和精细手指动作的操作——明显落后。沿 VLA 基础模型这条脉络,pi0π0.5groot-n1 等已证明”在大规模真机遥操作数据上训练 flow-based 动作头”能提升泛化能力,但真机遥操作数据采集昂贵、难以规模化,人形机器人尤其如此。

另一条路径是用人类第一视角视频(如 EgoDex)作为廉价、可规模化的替代信号,但人与人形机器人之间存在运动学/动力学 gap。现有工作(EgoVLA、In-n-On、H-RDT)大多选择把人类数据和机器人数据混合共训(co-train)成单一策略去建模统一的人-机器人动作空间,作者认为这本质上次优——单个模型要同时拟合两个分布差异巨大的动作分布(人手的自由手指运动 vs 人形机器人受限的关节空间和 29-DoF 全身约束)。

Ψ₀ 的核心主张是打破”混合共训”假设:把预训练(用人类视频学任务语义+视觉表征)和后训练(用机器人数据学关节空间精确控制)显式解耦成两阶段、两套目标函数,外加一个用少量领域内遥操作数据做的微调阶段。架构上延续 π0.5/GR00T 一脉的”三系统”设计(System-2 VLM + System-1 flow-matching 动作专家 + System-0 底层跟踪控制器),但训练配方(谁在哪个阶段学什么)是本文的主要贡献点。

模型架构

三系统(triple-system)架构:

  • System-2(VLM 主干):Qwen3-VL-2B-Instruct,从头部相机图像 + 语言指令提取视觉-语言隐藏特征。
  • System-1(动作专家):约 500M 参数的 flow-based Multi-Modal Diffusion Transformer(MM-DiT),架构借鉴 Stable Diffusion 3。与 naive DiT 的关键区别:用 flow timestep τ 分别调制”动作(A)“和”视觉-语言(VL)“两路特征(双路调制),并在每个 transformer block 内让 A、VL 两类 token 做联合全局注意力,而非把 VL 仅作为条件做交叉注意力——消融显示这种更充分的融合方式持续优于 naive DiT。
  • System-0(底层控制器):现成的 RL 跟踪策略 AMO,把动作专家输出的 8-DoF 上层控制信号(torso roll/pitch/yaw、base height h_b、水平线速度 v_x/v_y、角速度 v_yaw、目标偏航 p_yaw)映射为 15-DoF 下肢关节角(3-DoF 腰 + 12-DoF 腿)。

整体动作定义 a ∈ R^36 = {q_hand(14维,双手), q_arm(14维,双臂), torso_rpy(3), h_b, v_x, v_y, v_yaw, p_yaw};加上 System-0 输出的 15-DoF 下肢关节角,整机输出为 43-DoF 全身动作。

硬件平台:Unitree G1(29-DoF 全身),每只手为 7-DoF Dex3-1 灵巧手;视觉观测用机头默认搭载的 Intel RealSense D435i 相机。模型总参数量”超过 25 亿”(VLM 2B + 动作专家 ~500M + 其余组件),单次前向推理耗时约 160ms。

Action tokenizer 用 FAST:在 EgoDex 上用 50 万条随机采样动作重新训练(原始开源 FAST tokenizer 在噪声较大的 token 设置下重建损失偏大),action horizon/词表大小/scale 设为 1/2048/100;重训后 L1 重建损失从 5.83×10⁻⁴ 降到 1.95×10⁻⁴,平均 token 长度从 2.08 增至 13.04(更长但更精确,用于自回归预训练阶段的动作离散化)。

数据

预训练两个数据来源:

  • EgoDexegodex):约 829 小时人类第一视角灵巧操作视频,约 9 亿帧,每帧提供上肢全局变换矩阵(7 个脊柱关节 + 2 臂 + 每只手 21 个关节)。预处理:全部动作转换到当前头部相机坐标系;帧率上采样 3 倍;用 1st/99th 分位数归一化以处理极端离群值;原始分辨率 1920×1080 因显存限制降采样到 360×240;预训练阶段不输入 state,只用视觉+语言。
  • Humanoid Everyday (HE)31 小时真机遥操作数据,覆盖 260 个任务(7 大类),约 300 万帧。作用是缓解人类视频与机器人视觉观测之间的视觉 domain gap,同时也是后训练(post-training)阶段的数据源。HE 含两种本体(G1+Dex3-1 手 与 H1+因时灵巧手),手指自由度/关节顺序不同,需重排关节索引对齐为统一 28-DoF 动作(14 手 + 14 臂),再 pad 到 36-DoF 动作 / 32-DoF 状态以兼容后续微调阶段的下肢维度。

统一动作表征(人手与机器人末端执行器共享,用于预训练阶段的 48-DoF task-space 表征):a = {a_l, a_r},每侧 a ∈ R^24 = {T_wrist(9-DoF 位姿:3D 位置 + 6D 旋转), P_thumb, P_index, P_middle, P_ring, P_pinky}(各为 3D 指尖位置)。

微调数据:8 个真实世界长时序任务,每任务采集 80 条遥操作演示轨迹,每条任务含 3-5 个子任务,多数任务超过 2000 步(30Hz 控制),属于真正的长时序任务。

数据配比:论文未给出显式采样百分比混合,而是阶段性划分——预训练前 200k steps 只用 EgoDex,后 30k steps 只用 HE;后训练阶段完全用 HE;微调阶段完全用目标任务的 80 条演示。除 EgoDex + HE 外未披露额外数据源。

训练方法

三阶段配方(核心贡献):

  1. 预训练(VLM 主干,自回归 next-action-token 预测):在 EgoDex(+ 末段 HE)上让 VLM 自回归预测下一步(而非整个 chunk)的离散动作 token,目标是学任务语义和可迁移的视觉表征,而非精确控制本身——作者发现即使预训练用的动作表征(48-DoF 人手/末端执行器空间)与下游动作头实际使用的表征(关节空间)不同,这一步依然能学到有效的下游视觉表征。用 DeepSpeed 全量微调 Qwen3-VL-2B-Instruct,语言主干/MM projector/视觉塔学习率分别为 1e-4/1e-5/1e-5(作者提到官方默认的 1e-6 太小、收敛不充分);64×A100,10 天,230k steps(前 200k EgoDex only + 后 30k HE only),全局 batch size 1024。
  2. 后训练(动作专家,flow matching,关节空间):冻结 VLM,从零训练约 500M 参数的 MM-DiT 动作专家;标准 flow-matching 目标 L_fm = E[‖v_ρ(z_t, a_t^τ, τ) − (ε − a_t)‖],其中 a_t^τ = τ·a_t + (1−τ)·ε,ε 为高斯噪声。在 HE 数据上训练 30k steps,学习率恒定 1e-4,全局 batch size 2048,图像降到 320×240,diffusion timestep 采用均匀采样(论文称与其他采样策略相比无明显性能差异)。
  3. 微调(领域内遥操作数据):只微调动作专家(VLM 继续冻结),每任务 80 条演示,cosine 学习率调度(初始 1e-4),全局 batch size 128,40k steps/任务。

训练时 Real-Time Chunking(RTC):应对>25 亿参数模型约 160ms 的推理延迟带来的”停顿-思考-执行”式抖动。作者发现测试时 RTC(test-time action inpainting,arXiv:2506.07339)在自己模型上引导不稳定,因此采用训练时 RTC(arXiv:2512.05964):训练时随机遮蔽前 d ∈ [1, d_max] 个动作 token(d_max=6)、不计入 loss,让模型学会以已提交的”干净”动作 token 为条件、生成与之平滑衔接的后续 token;推理时把尚未执行的动作步视为干净 token 滚动生成下一个 chunk。部署系统为双线程异步架构:Control Loop 以 30Hz 运行(观测更新 + 动作下发),Inference Loop 异步触发(当已执行进度 t ≥ s_min 时预取下一 chunk),避免因推理而产生的执行中断。

遥操作数据采集管线(专为 loco-manipulation 定制,与常见”下肢端到端 retarget 全身 SMPL 动作”如 TWIST2/SONIC 不同):PICO 4 Ultra 头显 + 手腕 tracker 做多目标逆运动学(IK)解出手臂/躯干姿态;MANUS 手套追踪拇指/食指/中指精细动作,retarget 到 G1 三指灵巧手;腰部+脚部 tracker 提供高层移动命令(v_x, v_y, v_yaw, p_yaw)喂给 AMO RL 策略做下肢稳定控制。单一操作员即可完成全身遥操作,规避了纯视觉 VR 手部追踪的遮挡问题,也规避了端到端全身动作 retarget 常见的脚部漂移/不稳定问题。

Infra(训练 / 推理工程)

  • 预训练:64×A100,约 10 天,230k steps,全局 batch size 1024,DeepSpeed 全量微调(具体 ZeRO stage / 混合精度类型未披露)。
  • 后训练:32×A100(单节点),约 30 小时,30k steps,全局 batch size 2048。
  • 微调:单任务级别,40k steps,全局 batch size 128(GPU 数未披露)。
  • 推理:单次前向约 160ms(>25 亿参数);部署时 Control Loop 30Hz、Inference Loop 异步;下位机控制线程以 60Hz 驱动 RL controller 保证下肢稳定性和整机可控性。
  • 边缘硬件:未披露专用边缘算力型号,采用 client(观测采集+动作执行)/server(推理)分离的双线程架构,具体 server 侧 GPU 型号论文未给出。

评测 benchmark

真机基准:8 个长时序灵巧 loco-manipulation 任务(Unitree G1),每任务 10 次 rollout,全部子任务完成才计为成功;所有 baseline 均用相同的 80 条演示数据、相同图像观测与动作/状态表征做微调,用相同的 client 代码部署到机器人上。

对比基线:π0.5(Pi05_DROID checkpoint 转 PyTorch 实现,动作维度从 30 扩展到 36,学习率从 1e-5 提到 1e-4、batch size 从 32 提到 128 以适配 embodiment gap)、GR00T N1.6(GR00T N1.5 的后续版本,3B 预训练 checkpoint,微调 20k steps,全局 batch 24,3×A100;因官方 RTC 代码未开源改用顺序推理)、InternVLA-M1(RT-1/Bridge 预训练 checkpoint,冻结 VLM,微调动作头 30k steps,batch 64,单张 A100;论文观察到该基线在连续动作 chunk 间存在抖动)、H-RDT(2B 参数单一大 DiT,10k steps,batch 32,单张 A100;擅长不需要高精度的任务,在需要多关节高精度的操作上表现差)、EgoVLA(同样基于 EgoDex 预训练,改造动作解码器输出关节空间指令,按原论文配置微调 115 epochs,effective batch 16×8×4;论文观察到其下肢控制能力弱,因预训练主要覆盖上肢/手部技能)、Diffusion Policy(ResNet-18 视觉编码器,40k steps,batch 32,两张 A100 约 15 小时/任务,推理时 100 步迭代去噪;论文观察到 DP 在多数任务上失败,尽管能较好拟合训练数据,推测 UNet 视觉容量不足)、ACT(重配置为 36 维动作输出,chunk size 100,4 encoder + 1 decoder layer,其余超参与 DP 相同)。

八任务 Overall 成功率(每任务 10 次 rollout,来自项目页汇总表):

任务ACTInternVLA-M1EgoVLAH-RDTπ0.5GR00T N1.6Ψ₀
拧开瓶盖、开水龙头接水0/100/100/100/102/102/106/10
喷水擦碗、擦完叠布1/100/100/100/103/104/107/10
拿瓶子转身倒入杯中0/100/101/100/102/104/108/10
拿罐头倒盘子、推车0/100/100/100/101/103/107/10
玩具放篮子、转身递交0/101/100/100/105/100/109/10
推车拿葡萄放盘子0/105/100/100/103/104/106/10
端饭盒、蹲下放桌上5/100/102/106/102/105/109/10
拉出薯片内胆扔垃圾桶0/101/100/100/101/101/105/10

Ψ₀ 在全部 8 个任务上都是最优;第二名各任务不一(多为 GR00T N1.6 或 π0.5)。论文正文陈述”整体成功率比第二名基线 GR00T-N1.6 高出至少 40%”。

消融 1(预训练/后训练/RTC/动作头类型的作用,单任务:右臂拾放→左臂拾放→双臂搬箱,三步骤长时序任务)

EgoDex预训练HE预训练HE后训练RTC动作头右臂P&P左臂P&P双臂搬运Overall
Naive DiT1/101/101/100/10
MM-DiT9/102/103/102/10
MM-DiT8/106/106/106/10
MM-DiT8/108/109/108/10
MM-DiT9/109/1010/109/10
MM-DiT9/109/109/109/10

解读:论文正文明确指出——用原始(仅文本预训练、未经任何机器人域预训练)的 Qwen3-VL 冻结主干、只微调动作头,是表现最差的配置之一,“overall success rate of only 0.2”,对应上表第 2 行(MM-DiT 头、无 EgoDex/HE 预训练)的 Overall=2/10=0.2;若连动作头架构也换成 naive DiT(第 1 行),Overall 进一步降到 0/10。加入 EgoDex 预训练后带来大幅跃升(6/10);再加入 HE 预训练与 HE 后训练进一步提升到 8/10→9/10;加入 RTC 后 Overall 维持在 9/10(论文称”RTC 缓解物理碰撞、提高滚动吞吐,且不损失性能”)。

消融 2(数据规模/来源):只用 10% EgoDex 预训练(其余流程不变)在两组真机实验上 Overall 从 8/10、7/10 分别降到 1/10、6/10;只用 HE 预训练(不用 EgoDex)在同样两组实验上 Overall 从 8/10、7/10 分别降到 4/10、4/10——HE-only 变体在不需要精细操作的子任务上表现尚可,但在需要精细手指-物体协调的子任务上明显落后于全量 EgoDex 预训练的基线。

消融 3(GR00T-N1.6 + RTC):由于 GR00T-N1.6 官方 RTC 代码未开源,作者自行补测:w/o RTC Overall SR 7/10 → w/ RTC 6/10,论文称”效果相当”(未见明显提升或损失)。

消融 4(多任务微调):定性观察到联合多任务微调比单任务微调在各个体任务上性能下降,作者归因为”多任务训练分散了模型的学习目标,导致欠拟合”(未给出具体数值表,仅 Fig.11 定性对比)。

创新点与影响

贡献:(1) 挑战”人形数据 = 越多越好、人类和机器人数据应混合共训”的主流假设,提出显式解耦的两阶段训练(预训练学任务语义/视觉表征,后训练学精确关节控制),用远少于基线的数据量(800h 人类视频 + 30h 真机 vs 基线 >10× 数据量)取得更优效果,验证”scale the right data in the right way”; (2) 面向操作任务优化的单人遥操作管线(PICO+MANUS+AMO 分层控制),提升下肢稳定性且不需要多操作员; (3) 训练时 Real-Time Chunking,缓解>25 亿参数模型推理延迟带来的执行抖动; (4) MM-DiT 动作专家(消融显示持续优于 naive DiT)。

作者自陈局限(原文 Limitation):受算力和时间限制,未能把训练进一步扩展到更大规模的人类视频集合与真机数据(留作未来工作);硬件平台(Unitree G1)的负载能力限制了可执行的、更复杂操作行为的上限。

后续影响(据 GitHub README 披露,非论文正文):已被 RSS 2026 接收;在 CVPR 2026 的 3D-LLM/VLA Workshop 获 Best Paper Award;同组后续发布配套仿真基准 SIMPLE(arXiv:2606.08278,用于加速迭代和统一评测)以及与 NVIDIA SONIC 全身控制器的集成支持。

原始链接

一手源存档(sources/)