一句话定位
π0.7 是 Physical Intelligence 2026 年 4 月发布的下一代通用机器人基础模型(5B 参数 VLA):在 pi0-5 / pi-star-0-6 架构基础上,靠”多模态上下文条件”(丰富语言 + 情节元数据 + 世界模型生成的子目标图像)把海量异质、含次优/失败/自主的数据统一进单一策略,首次在机器人上展示出接近 LLM 的组合式泛化——零样本跨本体折衣、语言”教学”操作陌生厨房电器、单一通用模型追平多个 RL 专家策略的吞吐与成功率。
背景与定位
VLA(pi0 → pi0-5 → π0.6)的核心痛点:模型能理解语义概念,但难以在训练分布外组合技能解决新任务,且即便是训练见过的技能,最佳表现也往往要针对性微调专家模型才能达到。这与 LLM 形成对比——LLM 能把”英译法”和”输出 JSON”组合成”用 JSON 输出法语翻译”。π0.7 想把这种组合式泛化搬到物理智能上。
作者给出的范式命名为 diverse context conditioning(多样上下文条件):不改架构,而是改”喂给模型的 prompt”。把每条训练样本的 context 从”一句任务指令”扩展为”语言子任务 + 情节元数据(速度/质量/是否出错)+ 控制模态 + 子目标图像”,用这些标注消解大规模混合质量数据里的歧义,让失败数据、次优自主回放、非机器人数据都能被安全利用而不拖垮性能。思想上类比图像/视频生成里的 prompt expansion,但强调机器人里”决定成败的细节”(如叠好 T 恤的外观)语言难以表达,必须补图像/元数据模态。
架构上直接承接 π0.6 的 VLA + pi-star-0-6 的 Recap RL + MEM 记忆系统(Torne et al. 2026),并新增子目标图像条件与世界模型;与 gemini-robotics、groot-n1 等同属”VLM 初始化 + 动作专家”的生成式 VLA 谱系。是一篇方法学论文(作者明确表态”不提新架构,提的是让 VLA 利用更多样数据的方法论”)。
模型架构
总体:5B 参数 VLA = 4B VLM backbone + MEM 视频历史编码器 + 860M 动作专家。
- VLM backbone:从 Gemma3 4B(含 400M 视觉编码器)初始化。视觉编码器沿用 MEM 的历史编码器设计,对历史观测做时间+空间压缩,无论多少历史帧都输出固定 token 数。
- 动作专家(action expert):860M transformer,用 flow matching 预测连续动作;用 adaptive RMSNorm 注入 flow 的时间步。动作 token 固定 50 个 = 50 步动作 chunk,50 个 token 之间双向注意力,并可注意 VLM backbone 激活。
- 输入模态:最多 4 路相机(前视、两个腕视、可选后视),每路最多 6 帧历史(采样步长 1 秒),最多 3 张子目标图像(去掉后视)。相机观测与子目标图像都 resize 到 448×448,共享同一编码器。历史帧整体以 0.3 概率丢弃,后视以 0.3 概率丢弃。
- 本体状态 q_t:不同于 π0.6 用离散文本 token,π0.7 跟随 MEM 用线性投影把状态维映射到 backbone 维,每个历史状态是一个独立 token(帧被丢则对应状态 token 也 mask)。
- 注意力:block-causal 掩码——观测 token 与子目标图像 token 内部双向,子目标图像可额外注意观测;后续文本 token 因果注意。FAST token(仅训练期)与 flow 动作互不注意。
- ACTION-conditioning 的核心创新——多模态 prompt(每个组件训练时随机 dropout,测试时可任选子集):
- 子任务指令 ℓ̂(承接 pi0-5):如”打开冰箱门”,运行时由学到的高层策略或人给出。
- 子目标图像:多视角 g_t,描绘子任务成功后场景近未来状态;比语言更精确地指定”世界该长什么样”,提升空间 grounding。
- 情节元数据 m:① 速度(情节时长,按 500 步分箱);② 质量(1–5 分);③ mistake(该动作段是否出错,人工粗标)。
- 控制模态 c ∈ {joint, ee}:文本标识关节/末端执行器控制。
- 世界模型(生成子目标图像):从 BAGEL(14B mixture-of-transformers 图像理解/编辑/生成模型)初始化,遵循 SuSIE 思路。输入子任务 ℓ̂ + 当前观测,用 flow matching 生成子目标图像。BAGEL 内部:相机输入同时过 ViT(语义,448×336,patch 14)与 VAE(细节,512×384,patch 16);ViT token 过 7B LLM backbone,VAE token 过 7B 生成 backbone。世界模型受益于 web 级图像编辑/视频预训练,把语义/物理概念经子目标图像”迁移”进 π0.7。
- RTC(real-time action chunking):用训练期版本(train-time RTC,推理不增开销)生成平滑动作;训练中模拟 0–12 步延迟,对应 50Hz 机器人最大 240ms 推理延迟。
数据
强调”多样 + 详细标注”而非规模数字(论文未披露训练数据总小时数/情节数/token 量)。数据来源覆盖:
- 示范数据:大量任务、多种机器人平台(静态/移动、单臂/双臂),多样环境(实验室型、家居型、in-the-wild 真实家庭)。
- 自主数据(关键差异化):大量策略评测(policy evaluation)产生的自主回放,含失败情节与含大量错误的成功情节;特别地,把 pi-star-0-6 的 π*0.6 RL 训练期数据当额外样本喂入,实现对 RL 专家的”蒸馏”。(明确排除任何泛化评测任务本身的自主数据以防泄漏。)
- 人类干预数据:策略 rollout 中的人工介入片段。
- 开源机器人数据集:如 DROID(Franka 臂)。
- 第一人称人类视频(egocentric human video)。
- 非机器人 web 数据:物体定位、属性预测、VQA、纯文本预测;以及视频-语言任务(in-house 机器人数据与 web 的视频字幕)。
混合质量的利用方式:不做繁重的数据过滤,而是给每条数据打上情节元数据。速度用 ground-truth 情节时长;质量与 mistake 段由人工粗标。数据本身的多样性(不同速度/质量)提供了让模型学会”元数据↔动作”关联的信号。
动作标注:包含关节级与末端执行器两种控制模态,用文本标识区分,运行时按任务选。
训练期 dropout 配比(决定测试灵活性):子目标图像只加到每 batch 25% 的样本(有子目标时动作预测退化为”逆动力学”,训练更快);有子目标的样本里 30% 概率丢子任务文本(图像常可替代文本);元数据整体 15% 概率全丢,各分量(速度/质量/mistake)各 5% 概率单独丢;控制模态不 dropout。
训练方法
- 目标:近似对数似然 max E_D[log π_θ(a_{t:t+H} | o_{t-T:t}, C_t)];flow matching 动作专家优化其下界。
- Knowledge Insulation (KI) 训练配方:VLM backbone 用 FAST token 做离散交叉熵监督;动作专家注意 VLM 全部激活,但梯度不回流进 VLM backbone——让 VLM 靠更稳定的离散交叉熵训练,动作专家靠 flow matching 训练。
- 子目标图像训练:为兼容不同延迟/画质(含世界模型生成图),采样方案为——0.25 概率取段末图像(与世界模型预测目标一致),0.75 概率在当前时刻 0–4 秒后均匀采样真实未来图;此外大量采样世界模型生成的子目标图像构造额外训练样本,缓解真实图/生成图的 train-test 失配。
- 世界模型训练:从 BAGEL 初始化、沿用其配方;用带高质量分段语言标注的机器人数据子集 + egocentric 人类视频(作者发现标注/时间分段质量对子目标质量影响很大),并混入若干开源图像编辑数据集与开源视频数据集以保住语义知识。
- 运行时 prompt 策略(Algorithm 1):始终给控制模态与元数据;速度设为该任务情节长度的 15 分位,质量恒设 5,mistake 恒设 false;子任务 ℓ̂ 由高层策略或人工教学给出;子目标图像在语义意图变化或 Δ=4 秒后刷新;子目标与子任务在独立线程异步生成(VLA 推理永远用最新可得的)。
- CFG(classifier-free guidance):因每个 prompt 组件都做过 dropout,可对任意组件做 CFG;实际对情节元数据施加 CFG 以在灵巧任务上激发强性能,权重 β ∈ {1.3, 1.7, 2.2}。
- 每次用 5 步去噪生成 50 步 chunk,执行其中 Ĥ ∈ {15, 25} 步。
Infra(训练 / 推理工程)
- 训练硬件 / GPU 数 / GPU 小时 / 并行 / 精度:未披露。(论文与博客均未给训练集群规模、训练时长、优化器/学习率/batch size 等超参。)
- 策略推理:π0.7 与高层策略(都基于 Gemma3 4B)用单张 NVIDIA H100 推理。经 RTC 后一系列优化,最小变体推理 38ms(3 路相机、5 步去噪、train-time RTC——不增推理开销);开启 MEM 视觉编码器 + 加入子目标图像后,最坏情形升到 127ms。
- 世界模型推理:14B 模型 + 近 10,000 token 序列的迭代去噪很贵;用 4 路张量并行(4×H100)、所有大矩阵乘 8-bit 量化、改版 SageAttention 做 backbone 注意力,25 步去噪(每步含文本+图像 CFG)生成子目标图像耗时 1.25 秒;运行时用朴素异步策略——π0.7 边执行边让世界模型生成下一个子目标。
- 控制频率:UR5e 机器人 20Hz,其余机器人 50Hz;动作经简单 PD 控制器施加,末端执行器指令用数值逆运动学转关节位置。
- 机器人平台:双臂移动机械手(两条 6-DoF 臂)、静态双臂轻量机械手(“BiPi”)、双臂 UR5e + Robotiq 夹爪(跨本体实验,臂更长/更重/形态不同)。均为平行夹爪。
评测 benchmark
全部结果取自 π0.7 技术报告(PDF),对比对象为自家 π0.5 / π0.6 / π*0.6 专家 / SFT 专家 / MEM 专家,以及人类遥操作者。
- 开箱灵巧性(图 6):单一 π0.7 模型在 espresso、box building、laundry folding 等任务上直接开箱追平各任务的 RL 微调专家 π*0.6;在困难的 laundry 与 box building 上吞吐还超过 RL 专家。对比 π0.6 上的 SFT 专家(slice zucchini、peel、take out trash 等),π0.7 也逐一贴近。
- 消融(图 7):π0.7 全面优于 π0.7(no metadata) 与 π0.7(no eval data) 两个消融,差距在吞吐上最明显——说明”用自主评测数据 + 元数据消歧”是强性能的关键。
- 记忆任务(图 8):单一 π0.7 开箱即达到或超过 MEM 论文里对各任务微调的 π0.6-MEM 专家。
- 指令遵循(图 9–11):4 个未见厨房 + 2 个未见卧室、每场景 3–6 步开放指令,π0.7 全面显著超过 π0.5 / π0.6;复杂/非常规指称指令(“拿我用来喝汤的东西""拿最大盘子上的水果”)上优势更大,加世界模型子目标(π0.7(GC))再提升;能打破数据集偏置(“Reverse Bussing""Reverse Fridge→Microwave”),后者子目标图像是成功关键。
- 跨本体迁移(图 12–13、22):随本体差异增大,π0.7 相对 π0.5/π0.6 优势拉开。折衬衫从静态双臂零样本迁到 UR5e 双臂:π0.7(GC) 达 85.6% 任务进度 / 80% 成功率,对比 10 位顶级遥操作者(平均 375 小时经验、前 2%、同为该本体首次尝试)的 90.9% 进度 / 80.6% 成功率——机器与人相当。且策略会自发发明适配目标本体的新策略(UR5e 用垂直抓取/单臂 pick-and-place,而非复制源机器人的倾斜抓取/双臂)。
- 速度/最优性(Recap 对比):单一 π0.7 在 laundry(T-shirts&shorts)、laundry(diverse-hardest)、make espresso、box building 上,成功率与归一化吞吐达到或超过各任务的 π*0.6 RL 专家。
- 组合式泛化(图 14–18):短程新任务(舀米入电饭煲、转风扇、擦拭耳机等)开箱可做;长程新任务(空气炸锅烤红薯、烤面包片)经语言教学可完成,再把教学数据微调成高层策略即可全自主执行且逼近教学时表现——全程零额外遥操作。
- 数据规模化消融(图 18):带元数据时,数据越多性能越涨(即便平均质量在降);不带元数据则随低质数据增多而变差。去掉任务多样性最高的 20% 数据会显著掉点(对照随机去 20%)。
- 作者自陈局限:零样本泛化成功率仍低于分布内——见过任务常 >90%,未见任务/未见任务-本体组合在 60–80%;大规模多样数据下”哪些任务真属未见”难以严格界定(与 LLM 泛化研究同样的困境)。
创新点与影响
- 贡献:不提新架构,提出”多样上下文条件”方法学——用语言 + 情节元数据 + 生成式子目标图像三类 prompt 模态,把混合质量、含失败/次优自主、跨本体、非机器人的海量异质数据统一进单一 VLA,并用随机 dropout 保证测试期灵活组合。
- 改变了什么:① 让”次优/失败数据”从负担变资产(元数据消歧 + 测试期条件到高质量模式);② 让单一通用模型经”蒸馏”追平多个 RL 专家(pi-star-0-6 Recap 经验并入训练),省去逐任务微调;③ 首次在机器人上给出接近 LLM 的组合式泛化证据——零样本跨本体折衣(追平人类遥操作者)、语言教学解锁陌生电器操作;④ 世界模型作为”语义搬运工”,把 web 级图像生成知识经子目标图像注入策略,尤其在打破数据偏置与复杂指称上不可或缺。
- 局限(作者原文):零样本成功率仍显著低于分布内(60–80% vs >90%);训练数据太大太杂,“真未见 vs 只是换标签/顺带出现”难以定论,泛化可能主要来自”remix 已见技能”;未来方向是靠 π0.7 的高可控性做测试期高效学习(更细语言教学,甚至自主 RL)。
原始链接
- 官方博客:https://www.physicalintelligence.company/blog/pi07 (亦 https://www.pi.website/blog/pi07)
- 技术报告 PDF:https://www.pi.website/download/pi07.pdf
- 项目页:https://pi.website/pi07
- 演示视频:https://website.pi-asset.com/pi07/Pi07VFINAL.mp4
- (无 arXiv、无开源代码/权重、无 HuggingFace/ModelScope 发布)
一手源存档(sources/)
- pi0-7—blog — 官方博客快照(sources/embodied/2026/pi0-7—blog.md)
- 技术报告 PDF(https://www.pi.website/download/pi07.pdf,全文 PDF 不入 git,正文数字均取自该 PDF)