一句话定位

π0.5 是 Physical Intelligence 在 pi0 之上做的升级版视觉-语言-动作(VLA)模型:靠对「异构数据」的 co-training(其它机器人、高层子任务预测、口头指令、网页数据),配一套高层子任务/低层动作的分层设计,让策略能开箱部署到训练中从未见过的全新家庭,完成 10 到 15 分钟的整屋清洁这类长程任务。

背景与定位

VLA 领域(openvla、RT-2、pi0rdt-1bgroot-n1gemini-robotics 等)此前的通病是:评测环境几乎都跟训练分布高度重合。能泛化的多是「拿起某个物体」「拉开抽屉」这类短程原子技能,很难把同样的做法扩展到「清理一间厨房」这种长程任务,因为靠暴力扩数据去覆盖所有真实场景不现实。

π0.5 想回答的核心问题是:怎样设计一套训练配方,让机器人在多个抽象层级同时泛化。作者的类比是人做一份新工作既靠亲身练习、也靠别人口述与书本知识、还靠从别的任务迁移过来的直觉。对应到机器人,就是让一个统一的 VLA 序列建模框架同时吃下:本体移动操作数据、其它机器人本体的数据、网页视觉问答/检测数据、高层语义子任务标注、以及人类监督者的口头指令。这条路线属于「非机器人数据 co-training + 语言化高层推理」范式,方法上直接承接同组的 FAST 动作 tokenizer(Pertsch et al. 2025)与 Hi Robot 分层指令跟随系统,把二者合进同一个模型。

关键的反直觉数字:在第一阶段预训练里,喂给 π0.5 的样本中 97.6% 并不来自「移动操作机器人做家务」,而是来自其它机器人或网页等来源;真正的本体移动操作数据只占 2.4%,却仍能驱动模型在全新家庭里工作。

模型架构

骨干沿用 pi0 的 PaliGemma VLM(SigLIP 400M 视觉编码器 + Gemma),外挂一个更小的「action expert」做快速动作生成,整体是一个能同时输出文本 token 与动作 chunk 的 transformer。

  • VLM 主干:约 2B 参数,从 PaliGemma 权重初始化,配置 {width=2048, depth=18, mlp_dim=16384, num_heads=18, num_kv_heads=1, head_dim=256}。图 3 标注 SigLIP(400M) + Gemma(2.6B)。
  • Action expert:约 300M 参数,与主干同架构但 {width=1024, mlp_dim=4096},用独立的 expert 权重(类似 MoE 中的专家),专门做 flow matching 动作生成。
  • 两种动作表示混用:预训练阶段动作用 FAST tokenizer 压成离散 token 做自回归预测(训练高效但推理要贵的自回归解码);后训练阶段加上 action expert,用 flow matching 生成连续动作(推理快、能表达细粒度连续轨迹)。用注意力掩码保证两种动作表示互不 attend,避免信息泄漏。整体信息单向从 VLM 流向 action expert。
  • 动作 chunk:action horizon = 50 步(H=49),即 1 秒的连续低层关节动作 chunk;推理时先自回归解码高层文本子任务 ℓ̂,再做 10 步 flow matching 去噪产出动作。
  • 注意力:相比 LLM 标准因果注意力,图像 patch、文本 prompt、连续动作 token 用双向注意力;图像/prompt/本体状态用 full prefix mask;FAST 动作 token 对 prefix 双向、对已生成动作 token 自回归。
  • 时间步注入:不同于 π0 把 flow matching 时间步 τ 直接融进带噪动作,π0.5 用单独 MLP 投影 τ,再用 adaptive RMSNorm 把时间步信息注入 action expert 每一层。τ 采样用偏向低时间步的 Beta 分布(α=1.5, β=1),阈值 s=0.999。
  • 本体状态:关节角、夹爪位姿、躯干升降、底盘速度等本体状态离散化后当文本 token 输入。
  • 分层分布:模型建模 πθ(a, ℓ̂ | o, ℓ) = πθ(a | o, ℓ̂)·πθ(ℓ̂ | o, ℓ),低层动作只依赖高层子任务 ℓ̂ 而不直接依赖原始任务 prompt ℓ;高层与低层推理由同一个模型完成(类似 chain-of-thought),高层推理频率低于低层。

数据

训练混合分两阶段,具体来源:

  • MM(Diverse Mobile Manipulator):约 400 小时移动操作机器人做家务的数据,覆盖约 100 个不同家庭环境(消融时按 3/12/22/53/82/104 个地点切分)。这是与评测任务最相关的一片,但只占预训练样本的 2.4%。
  • ME(Diverse Multi-Environment 非移动机器人):单臂或双臂固定式机器人在多种家庭环境采的数据;机臂轻便易搬运,因此能覆盖更多样的家庭,但本体与移动机器人不同。
  • CE(Cross-Embodiment 实验室数据):实验室桌面环境采的多任务数据(收拾餐桌、叠衬衫等),含单臂/双臂、静态/移动底座多种机器人,并纳入开源 Open X-Embodiment(droid 所在的 OXE 生态),是 π0 数据集的扩展版。
  • HL(High-Level 子任务预测):把「清理卧室」这类高层命令人工拆成「整理毯子」「拿起枕头」等短子任务标注;对 MM/ME/CE 中的多阶段任务全部标注子任务描述,还额外标注当前观测里的相关物体 bounding box,让模型在预测子任务前先预测框。
  • WD(Multi-modal Web Data):图像描述(CapsFusion、COCO)、视觉问答(Cambrian-7M、PixMo、VQAv2)、物体定位;并用室内场景与家用物体的带框网页数据扩充定位数据集。
  • VI(Verbal Instruction):仅后训练使用。专家用户用自然语言实时「遥操作」一个已训练好的低层策略,一步步指挥机器人,从而给出「好的高层子任务输出」的示范。VI 只占高层移动操作样本的约 11%,但消融显示它对高层性能至关重要。

其它数据处理:所有动作数据训练模型预测目标关节位姿与末端执行器位姿,用 <control mode> 前缀区分两种控制模式;动作按各数据集每一维的 1% 与 99% 分位数归一化到 [−1,1];动作维度取所有数据集里最大的动作空间,低维本体零填充。

训练方法

两阶段流程,优化目标是「文本/FAST token 的交叉熵」加「action expert flow matching 回归」的加权和(式 1,权重 α):

  1. 预训练(约 280k 步):作为标准自回归 transformer,对文本、物体位置、FAST 编码动作 token 做 next-token prediction,此时 α=0(动作全部走离散 token 通路,模型就是个 VLM)。这阶段吃下上面全部 MM/ME/CE/HL/WD。
  2. 后训练(额外约 80k 步):加入随机初始化的 action expert,α=10.0,联合训练 next-token prediction(保留文本能力)与 flow matching(连续动作)。后训练动作数据是 MM+ME 里筛出的成功且短于长度阈值的 episode,再配 WD(保语义/视觉能力)、多环境切片的 HL、以及 VI。这一阶段把模型专门化到「家庭移动操作」,并装上实时控制所需的高效推理机制。

地点扩展实验里,为省算力,先在不含移动操作的机器人动作混合上预训练,再对不同地点数的移动操作数据分别后训练 40k 步(控制样本量一致)。

作者还构造了两个对照:π0(始终用 action expert)和 π0-FAST+Flow(用式 1 的 FAST+flow 混合训练,但只吃含动作的机器人数据,无 HL/WD,因此不能做高层推理)。结论是 FAST 离散 token 训练在算力上更划算,π0.5 即便让 π0 训到 300k 步也仍胜出。

(注:openpi 仓库 2025 年 9 月放出的 pi05 权重改用了后续的 “knowledge insulation” 训练技术,且当前仓库只支持 flow matching 头,与本文 4 月版配方略有出入。)

Infra(训练 / 推理工程)

  • 训练 GPU 数量 / GPU-hours / 并行 / 精度:论文与博客均未披露。
  • 机器人平台:两类移动操作机器人,各配两条 6 DoF 机臂 + 平行夹爪、腕部单目 RGB 相机、轮式全向底盘、躯干升降机构;共 4 路相机(前、后、双腕),高层推理用全部 4 路,低层推理用腕部 + 前向相机。状态/动作空间总维度 18 或 19(底盘为 2D 线速度 + 1D 角速度,升降为 1D 或 2D)。
  • 控制:π0.5 直接以 50 Hz(带 action chunking)输出机臂、夹爪、躯干升降的目标位姿与底盘目标速度,由简单 PD 控制器跟踪,无额外轨迹规划或碰撞检测,操作与导航全程端到端。
  • 任务时长:单个整屋清洁长程任务约 10 到 15 分钟;量化评测里的单任务约 2 到 5 分钟。
  • 推理边缘硬件 / 具体延迟 / FPS:未披露(仅给出 50 Hz 控制频率与 10 步去噪)。

评测 benchmark

评测全部在训练中未见过的新环境进行:3 个真实家庭 + 用于可复现对照的 mock 厨房/卧室,共 12 个地点;标准协议每策略每任务 10 次 rollout。评分按 rubric 计「完成步骤百分比」(如放一半盘子入水槽约 50%)。

  • 真实家庭泛化:π0.5 在 3 个新家的厨房/卧室清洁任务上稳定成功,任务多为多阶段(搬多个物体),单次 2 到 5 分钟。作者称这是首个在全新家庭里做长程灵巧操作的端到端学习机器人系统。
  • 地点数扩展:性能随训练地点数(3→104)单调上升;104 地点的模型逼近「把测试家庭直接放进训练集」的 oracle 基线,说明 co-training 配方能用相对易得的移动操作数据量换到强泛化。
  • 数据消融(语言跟随,来自博客的具体数字)
    • In-distribution Follow Rate:π0.5 86% / no WD 86% / no CE 74% / no ME 66%
    • In-distribution Success Rate:π0.5 83% / no WD 82% / no CE 67% / no ME 57%
    • OOD Follow Rate:π0.5 94% / no WD 80% / no CE 67% / no ME 33%
    • OOD Success Rate:π0.5 94% / no WD 74% / no CE 49% / no ME 31%
    • 结论:ME/CE(来自其它机器人的数据)对所有条件都关键;WD(网页数据)对 OOD 新物体泛化影响最大(去掉 WD 后 OOD 成功率从 94% 掉到 74%)。
  • 对比其它 VLA:mock home 上 π0.5 显著优于 π0 与 π0-FAST+Flow;语言跟随率 π0.5 略高于 π0-FAST+Flow、远高于 π0(体现离散 token 训练对语言跟随能力的重要性)。
  • 高层推理消融:完整 π0.5(显式高层+低层)最好,甚至超过 human HL「oracle」;第二名是 implicit HL(训练含 HL 数据但推理不做显式高层),说明大半收益来自把子任务预测数据放进混合;no VI 明显变弱(VI 仅约 11% 的高层 MM 样本却关键);no WD 明显变弱;zero-shot GPT-4 当高层策略最差,说明必须用机器人数据适配 VLM。

创新点与影响

  • 核心贡献:一套训练高泛化 VLA 的系统性配方 + 概念验证,证明「在足够多样的异构数据上 co-training」能让端到端学习的机器人在全新家庭里做长程、灵巧的整屋清洁,这在此前 VLA 工作里没有先例。
  • 改变了什么:把泛化的来源从「暴力扩本体数据」转向「跨来源知识迁移」——低层动作从其它更简单的静态机器人迁移,高层语义从网页数据、子任务标注与人类口头指令迁移;并用同一个模型统一高层/低层推理(chain-of-thought 式),而非过去常见的「VLM 规划 + 独立低层策略」两模型方案。
  • 工程贡献:离散 FAST 预训练 + 连续 flow matching 后训练的混合配方,兼顾训练算力效率与实时推理。
  • 作者自陈的局限:仍会犯错;某些环境有持续困难(陌生抽屉把手、机器人物理上难开的柜子);部分可观测性问题(机臂遮住要擦的污渍);高层子任务推理易被干扰(放东西时反复开关同一抽屉);只能处理相对简单的 prompt,复杂偏好需更丰富标注;上下文/记忆较有限,跨房间导航或记住物体存放位置等能力受限。

原始链接

一手源存档(sources/)

  • pi0-5—blog.md — 官方博客快照(含数据消融的具体百分比)
  • pi0-5—openpi-readme.md — openpi 仓库 README 快照(pi05 检查点清单与用法)
  • arXiv 2504.16054 全文 PDF:见上方 arXiv 链接(arXiv 原文 PDF,不入 git)