一句话定位

Physical Intelligence 的 π*0.6:在 pi0 家族的 π0.6 VLA 上叠加一套 RECAP(RL with Experience and Corrections via Advantage-conditioned Policies)配方——用「离线 RL 预训练 + 演示 SFT + 专家纠错干预 + 机器人自主实践」让 VLA 从自己的真实部署经验里迭代自我提升,在做意式咖啡、叠多样衣物、组装纸箱这类 5–15 分钟长程任务上把最难任务的吞吐翻倍、失败率约减半,可连续无中断运行十几个小时。

背景与定位

  • 范式:把 VLA 从纯模仿学习推进到「从经验中学习」的真实世界 RL。 模仿学习(behavior cloning)存在众所周知的 compounding errors(复合误差,[Ross et al. 2011 DAgger]):策略犯小错→进入训练分布外的状态→犯更大错→失败。这使 VLA「有时成功容易、每次都成功极难」。RECAP 的立意是像人一样「三步学习」:演示(定义技能)→ 教练纠错(修正大错)→ 自主练习(打磨细节、突破人类遥操作速度上限)。
  • 谱系。 π*0.6 的底座 π0.6 是 pi0 → π0.5 → π0.6 的演进:π0.5 引入开放世界泛化与高层子任务预测;π0.6 换更大 backbone、支持更异质的 prompt/conditioning。RECAP 的策略抽取方法最接近 CFGRL(Frans et al. 2025,diffusion guidance as controllable policy improvement operator),并复用 Knowledge Insulation(KI)训练法与 FAST 动作 tokenizer。
  • 与相关 RL-for-VLA 工作的区别。 不同于直接对 VLA 套 PPO/REINFORCE(dppo-diffusion-policy-policy-optimization、VLA-RL、SimpleVLA-RL、πRL 等)或只训 residual/action-head/noise-space 的路线,RECAP 用 advantage conditioning 做端到端 offline RL 策略抽取:支持 flow matching 这类无 tractable log-likelihood 的大 VLA,能吃下所有 off-policy 数据(演示 + 干预 + 新老策略 rollout),并把好数据和坏数据都用上。论文自称是「首次证明一个通用 RL 配方(含人类奖励反馈与干预)能显著提升 VLA 部署经验下的鲁棒性与吞吐」。

模型架构

底座 π0.6 VLA(来自 π0.6 model card + 论文):

  • VLM backbone:Gemma 3 4B 初始化;视觉编码器 SigLIP(400M)。博客把整体 VLM 概括为「5B 参数」的 vision-language model。
  • Action expert:860M 参数,层数与 backbone 相同;用 flow matching 生成连续动作 chunk。
  • 分层设计(沿袭 π0.5): 模型先自回归产出离散文本输出 ℓ̂(下一个子任务,如 “pick up the coffee cup”)做高层决策,再生成动作;推理时子任务预测以低于动作生成的频率运行。动作 chunk a_{t:t+H} 为关节角 + 夹爪指令,50 Hz
  • KI(Knowledge Insulation)训练: VLM backbone 预测 FAST 离散动作 token + 多模态 web 共训样本;action expert 预测连续动作,且 action expert 的梯度 stop-gradient、不回流到主干(train fast / run fast / generalize better)。训练目标同时含离散动作的自回归似然、文本似然与连续动作的 flow matching loss,三者按 log π(a, aℓ, ℓ̂ | o, ℓ) = log π(ℓ̂) + log π(aℓ|ℓ̂) + log π(a|ℓ̂) 因式分解。
  • 输入: 预训练最多 4 张图 @ 448×448(base 相机、至多 2 个腕部相机、移动平台可选后向相机)+ tokenized 语言 prompt + tokenized 本体感知状态。图像 token 间双向注意力、文本 token 因果注意力、动作 token 双向注意力。prompt 里除任务指令 ℓ 外还可带 metadata s 调制执行方式。

π0.6 → π*0.6 的改造(advantage conditioning):

  • 新增一个改进指示符 I_t 作为额外文本输入:I_t=True 时喂 "Advantage: positive",否则 "Advantage: negative"。该 token 插在 ℓ̂ 之后、(离散与连续)动作之前,只影响动作的 log-likelihood
  • 训练时按 30% 概率随机丢弃 advantage conditioning(advantage-conditioning dropout),从而可在推理时直接采样条件/无条件策略并做 CFG;这个 dropout 有效替代了损失系数 α。
  • 价值函数: 与 VLA 同架构,但用更小的 670M VLM backbone(同样从 Gemma 3 初始化);是分布式价值函数(distributional VF),输出 B=201 个离散 value bin 的分布,交叉熵训练;额外在少量多模态 web 数据上共训防过拟合。670M 使得训练 VLA 时「on-the-fly」推理 VF 算 advantage 的额外开销很小。

数据

  • 预训练:数万小时」(tens of thousands of hours)的演示,来自众多任务与多种机器人。数据构成大体沿用 π0.5:自采 cross-embodiment 数据 + 外部数据源、家庭环境的移动/非移动数据、高层子任务预测、以及含 bounding box / keypoint 预测的多模态 web 数据;π0.6 相比 π0.5 额外增补了多机器人平台数据。价值函数先在同一数据集上训练。
  • 改进阈值 ϵℓ 设定: 预训练时按任务取价值函数预测的 30 百分位(约 30% 演示数据为正 advantage,在 10k 随机采样上计算);微调时一般设成约 40% 的评测 rollout 为正 advantage;对 T-shirt/shorts 折叠(高质量演示已高成功率但慢)调高阈值到约 10% 数据为正。
  • 各任务后训练在机器人上采集的经验数据(Appendix F 具体数字):
    • Laundry(T-shirt & shorts): 仅自主评测数据、无专家纠错;每次迭代在 4 个机器人工位采 300 条 episode
    • Diverse laundry: 450 条评测 episode + 287 条纠错 episode(11 类衣物:毛巾/衬衫/毛衣/牛仔/T恤/短裤/polo/裙/长袖/袜/内衣;度量用最难的 button-up shirt)。
    • Failure-mode removal 消融: 共约 1000 条自主 + 280+378 条纠错 episode,跨 3 台机器人(主文另述:2 次迭代、每次采 600 条)。
    • Box assembly: 工厂部署场景直接采数,每次迭代 600 条演示/自主 + 360 条干预 episode,共用 3 台机器人。
    • Cafe(espresso): 单次迭代,429 条纠错 episode + 414 条自主 episode
  • 动作标注 / 奖励标注: 每个 episode 由人标注 success 标签(多质量维度聚合成 success),干预动作由专家遥操作实时接管提供;纠错动作强制标 I_t=True。
  • sim vs real: 全为真实机器人数据(含工厂真实包装线场景),无仿真依赖。co-training 用多模态 web 数据防遗忘/防过拟合。

训练方法

  • RECAP = 迭代式 offline RL,三个可重复子程序(Algorithm 1):
    1. 数据收集: 跑当前策略、给每条 episode 打 success/reward 标签,早期迭代可加人类纠错干预(human-gated DAgger 式)。
    2. 价值函数训练(Eq.1): 用截至目前所有数据,蒙特卡洛回归离散化 return(B=201 bins)的分布,交叉熵。
    3. advantage-conditioned 策略训练(Eq.3): 目标 min E[ −log π(a|o,ℓ) − α·log π(a|I,o,ℓ) ],其中 I_t = 1[A^{πref}(o_t,a_t,ℓ) > ϵℓ]。数学基础是 π̂(a|o,ℓ) ∝ πref(a|o,ℓ)·[πref(a|I,o,ℓ)/πref(a|o,ℓ)]^β,β=1 时 π̂ = πref(a|I,o,ℓ)(可直接采正 advantage 条件分布),思路与 classifier-free guidance 一致。
  • 稀疏奖励(Eq.5): r_t = 0(终止且成功)/ −Cfail(终止且失败,Cfail 大常数)/ −1(其它);价值函数因此学到「到成功还剩多少步的负值」,按任务最大长度归一化到 (−1, 0)。
  • advantage 估计: 后训练用 N=50 lookahead 的 n-step 估计;预训练用 N=T(整段 episode)以便单次 VF 推理 on-the-fly 算 advantage。
  • 完整 pipeline: ①离线 RL 预训练 π*0.6(在全预训练集上做子程序 2+3)→ ②对目标任务用演示做 SFT(固定 I_t=True,略优)得 πℓ0 → ③K 次迭代「采数→重训 VF→重训策略」。每次迭代的 VF 与策略都从预训练 checkpoint 微调(而非上一迭代),以避免多轮漂移;实践中常常一次迭代就有显著提升。最终 generalist 从头训,各 specialist 从预训练模型微调。
  • 推理端策略锐化: 训练后可设 β>1 用 CFG 进一步锐化(无需再训),但过高 β 会把动作分布推到支撑边界导致动作过激,故主要靠训练期阈值 ϵℓ,仅在有用处配 β∈[1.5, 2.5]
  • 对比的策略抽取方法: AWR(advantage-weighted regression)与 PPO(DPPO/FPO 变体,用单步 diffusion 目标算似然、并按 SPO 定义 trust-region 约束 η=0.01 稳训)。

Infra(训练 / 推理工程)

  • 推理: π0.6 在 5 步去噪 + 3 路相机下,单张 H100 产生一个动作 chunk 需 63 ms;机器人控制 50 Hz(关节位置)。价值函数因用 670M 小 backbone,训练期 on-the-fly 推理开销极小。
  • 机器人平台(迭代改进实验): 静态双臂系统,两条 6-DoF 机械臂 + 平行夹爪,50 Hz 关节位置控制;观测含关节/夹爪位置与 3 路相机(臂间 base 相机 + 每臂腕部相机各一),可灵活桌面安装。预训练数据来自多种机器人。
  • 训练 GPU 数量 / GPU-hours / 并行策略 / 精度: 未披露
  • 部署鲁棒性(作为工程结果): 咖啡任务连续跑 13 小时(论文口径;博客另以「从 5:30am 到 11:30pm 做各类意式饮品」描述同一次全天演示);在新家连续叠 50 种新衣物 2+ 小时无中断(论文 “over two hours”,博客 “50 items”);真实巧克力包装工厂组装并贴标 59 个箱子无中断(博客)。

评测 benchmark

两个指标:throughput(每小时成功完成次数,同时反映成功率与速度)与 success rate(人工标注)。任务时限:T-shirt/shorts 折叠 200s;diverse laundry 500s;failure-removal 200s;double espresso 200s;box assembly 600s。对比阶梯:π0.5 → π0.6(SFT baseline)→ π0.6 RL-pretrained → π0.6 offline RL + SFT → π*0.6(Ours,含自主 rollout + 专家纠错,默认 β=1)。

  • 主结果(Fig.7/8): 加入机器人经验后,diverse laundry 与 espresso 的吞吐翻倍以上(>2×)、失败率约减半(~2×)。除 diverse laundry 外,最终 π*0.6 各任务成功率均在 90%+,达到可实用水平(办公室做咖啡、工厂组箱)。较易的 T-shirt/shorts 在 SFT 阶段成功率已近满,但最终模型吞吐仍显著提升。
  • 多次迭代(Fig.9/10): laundry 两次迭代吞吐累计 +50%,第一次迭代成功率已 >90%,第二次主要提吞吐;box assembly 需更多数据——先降后升,第二次迭代后吞吐 ~2×,折箱与贴标在 600s 内成功率约 90%
  • 策略抽取对比(Fig.11,T-shirt/shorts): RECAP 的 advantage conditioning 远超 AWR 与 PPO——PPO 需极小 trust region(η=0.01)才稳但性能差;AWR 成功率尚可但策略慢、吞吐低;两者都难以超过 offline RL + SFT 的 π*0.6 起点。
  • 失败模式移除(Fig.12): 严格判据(领子居中朝上)的对抗性 T-shirt 折叠,2 次迭代(每次 600 条)后成功率 97% 且更快——证明 RECAP 可用较少数据、纯 RL(无干预/额外演示)定向消除特定失败模式。
  • 底座 π0.6 out-of-box(model card,无任务微调): 相比 π0.5,π0.6 在速度上全面提升;laundry 与 box assembly 此前需高质量数据微调才有非零成功率,而 π0.6 开箱即可可靠叠衣、约 20% 概率完整组装箱子

创新点与影响

  • 贡献: 一套通用、可扩展的 VLA 真实世界 RL 配方 RECAP,把演示 / 专家干预 / 自主经验三类异质数据统一进 iterated offline RL;核心是用 advantage conditioning 做策略抽取,绕开对 flow matching VLA 难以施加的 policy-gradient(PPO/REINFORCE)与 log-likelihood 计算,同时利用全部好/坏数据。配套一个语言条件的分布式价值函数做 credit assignment。
  • 改变了什么: 首次系统性证明 VLA 能「从部署经验持续变强」——在真实长程灵巧任务上把吞吐翻倍、失败率减半,达到可连续运行十几小时的实用鲁棒性,指向「自主经验最终可能成为最大数据源、甚至带来超人表现」的训练范式转向。
  • 作者自述局限: ①非全自主——仍依赖人来打奖励标签、做干预、重置场景;②探索方式朴素——基本是贪婪探索,靠策略随机性与人类干预来发现新解;③是迭代「离线」更新(采一批→重训→再采),而非价值函数与策略实时更新的全在线 RL 循环;作者认为把 RECAP 扩成并发在线 RL 是有前景的方向。价值函数用 on-policy 蒙特卡洛估计(非 off-policy Q),承认不如经典 Q 最优但更简单可靠。

原始链接

一手源存档(sources/)