一句话定位
Physical Intelligence 发现给 VLM 装上连续动作专家(action expert)后,这个新模块回传的梯度会把预训练 VLM 的知识”训坏”;他们提出的”knowledge insulation(知识隔热)“办法是在注意力层里对 action expert→backbone 方向的梯度做 stop-gradient,同时用离散 FAST 动作 token 给 backbone 补一条不依赖 action expert 的学习信号,实现”训得快、跑得快、泛化好”三者兼得,是 pi0-5 里那套配方的正式化与单阶段化版本。
背景与定位
VLA 领域此前分两代路线:第一代(RT-2、openvla)把动作离散化成文本 token 做自回归预测,训练简单但推理慢、精度粗,控制频率被压到 2 Hz 以下;第二代(pi0、GR00T 等)在 VLM 上外挂一个连续输出模块(diffusion head 或 flow-matching 的 action expert),换来快推理和精细动作,但这个新模块是随机初始化的,训练时必须”嫁接”到预训练 backbone 上。本文要回答的问题是:这种嫁接到底有没有损害 VLM 原本从网络级数据里学到的知识?
作者发现答案是肯定的:naively 训练 action expert 会讨论出对语言指令不敏感的策略(不看指令、凭图像相关性乱抓东西),且训练收敛明显更慢——这与作者自己此前 pi0 的训练经验一致。同一时期 pi0-5 论文里已经用了”先离散 token 预训练、再联合训练 action expert”的两阶段配方来缓解这个问题;本文把这套做法背后的原理抽象出来,形式化为”knowledge insulation”,并合并成一个单阶段配方(离散 token 学习表示 + 连续动作生成同时训练,但用 stop-gradient 切断二者的梯度耦合)。方法上把 pi0-5 的 co-training 数据配方、FAST tokenizer(Pertsch et al. 2025)与本文新提出的注意力层 stop-gradient 结合在一起,属于”VLM 表征保护 + 离散/连续动作双通道联合训练”这一路径,也直接对标同期的 openvla-oft(并行解码)、HybridVLA(自回归+diffusion 混合)、Transfusion(同 backbone 去噪连续输入)等竞品设计。
模型架构
- Backbone:PaliGemma VLM(SigLIP 图像编码器 + Gemma 语言模型),语言模型部分 config 为
{width=2048, depth=18, mlp_dim=16384, num_heads=18, num_kv_heads=1, head_dim=256};博客架构图标注整体 VLM backbone 约 3B 参数。 - Action expert:与 backbone 同深度、同头数的独立 transformer 专家,config 除
width=1024, mlp_dim=4096外与 backbone 相同,共约 300M 参数;backbone 与 action expert 只通过自注意力层交互,各自有独立的 Q/K/V 投影,但投影维度对齐以便交互(沿用 π0 提出的”混合专家式”多权重-transformer 设计)。 - 双动作表示 + 联合训练:模型输出空间同时含(1)FAST 离散 token 化的动作(用于自回归下一 token 预测,仅作训练期表示学习信号,推理时丢弃)和(2)flow-matching 连续动作 chunk(action horizon H=50,即约 1 秒的低层动作序列),两者用同一套联合损失 ℒ_CO-VLA = 语言/离散动作交叉熵 + α·flow-matching 回归损失同时优化。
- Knowledge insulation 的核心机制——注意力层 stop-gradient:把注意力概率矩阵按 backbone token(b)和 action-expert token(a)分块为 P_bb / P_ab / P_aa;标准做法里 P_ab(action expert 对 backbone 的注意力)里的 key/value 都来自 backbone 未被截断的梯度。本文把这部分 key(以及对应 value)套上 stop-gradient 算子
sg(·):Q_a(X_a)·sg(K_b(X_b))^T计算注意力权重、sg(V_b(X_b))计算取值。效果是信息仍能单向从 backbone 流向 action expert(模型前向计算不变),但反向传播时 action expert 的梯度不再流回 backbone;backbone 只被离散 token 的交叉熵损失训练。因为两路损失现在作用在(基本)独立的权重集合上,α 可以直接设为 1(不用像式 4 那样再调权重)。 - FAST 与连续 token 互不可见:注意力掩码保证离散 FAST 动作 token 不能 attend 到连续 action-expert token,反之亦然,避免信息泄漏(沿用 pi0-5 的设计)。
- 本体状态表示:论文附录对比了三种方案——text state(离散化后当文本数字输入,最贴近 VLM 预训练分布但耗 token 最多)、special token state(离散 bin 映射到专属 token,耗 s 个 token)、continuous state(连续值经可学仿射投影直接输入 embedding 空间);实验(Fig. 10)显示方法在 text state 和 continuous state 上都可行。
- flow-matching 细节:沿用 π0 的时间步采样分布,偏向低时间步的 Beta 分布
p(τ)=Beta((s-τ)/s; α=1.5, β=1), s=0.999,而非均匀采样或偏中段的采样方式。
数据
本文复用 pi0-5 论文里已经建立的通才(generalist)数据混合,训练/验证集合本身未在本文重新披露具体小时数/帧数,关键构成:
- 12 种机器人本体配置:单臂静止(ARX、UR5、Franka)、双臂静止(ARX、AgileX、Trossen、UR5)、双臂移动(mobile Trossen、ARX slate、Galaxea G1、Hexmove H1、Fibocom)。
- 额外纳入开源 Open X-Embodiment(open-x-embodiment)数据集。
- VLM 非动作数据 co-training:图像描述(CapsFusion、COCO)、视觉问答(Cambrian-7M、PixMo、VQAv2)、物体定位(额外扩充了室内场景/家用物体的带框网页数据)。
- 公开基准数据:DROID(真实世界桌面操作,沿用 Pertsch et al. 2025 的任务集);LIBERO(Spatial/Object/Goal/10-Long/90 五个任务套件,图像按 Kim et al. 2024 的流程重渲染到 224×224,过滤失败演示与空操作)。
- 训练混合里显式包含”非动作预测任务”(图像描述、bbox 检测、机器人高层规划),与动作预测任务共享一个联合损失(式 4),从而让离散/连续动作预测与通用 VLM 任务在同一批次里协同训练。
- 每类真实世界评测任务另有独立采集的机器人示教数据(如 items-in-drawer、T-shirt folding、table bussing 各自的专用数据集),具体规模未披露。
训练方法
- 联合损失:式 4,
ℒ_CO-VLA(θ) = E[−Σ M_j^ℓ log p_θ(ℓ̂_{j+1}|x_{1:j}) + α·M^act·‖ω − a_{1:H} − f_θ^a(a_{1:H}^{τ,ω})‖²],α 为 flow-matching 损失权重(本文方法下设 α=1,因为 stop-gradient 后两路损失已解耦到不同权重集合)。 - 三项关键设计(消融验证):
- 联合训练(joint-training):同时用自回归离散 token 目标和 flow-matching 连续目标训练同一模型,离散目标只作训练期表示学习用,推理仅走 action expert 通路。
- VLM 数据 co-training:混入非动作的通用视觉语言数据和机器人规划数据,减少知识遗忘。
- Stop-gradient(knowledge insulation):如上所述,切断 action expert 到 backbone 的反向梯度。
- 对照消融组:π0(纯 action expert,只训机器人数据)、π0-FAST(纯自回归+FAST,只训机器人数据)、openvla-oft(并行解码+双向注意力,未用 FiLM,保留 text state)、Transfusion(同一 backbone 里去噪连续输入,本文将其从图像生成迁移到动作)、HybridVLA(transfusion+朴素自回归 token 联合训练,自回归 token 可 attend 连续输入)、joint-training(本文方法但不做 stop-gradient)、joint-training w/o VLM data(joint-training 且不做 VLM co-training,约等价于自建版 HybridVLA 但自回归 token 不能 attend 连续输入)、naive tokenization(把 FAST 换成朴素离散化做表示学习目标)。
- naive tokenization 对比:直接朴素离散化(可选 stride=5 做子采样)作表示学习目标,效果好于纯连续训练但不如 FAST,说明 FAST 提供的学习信号质量本身也是知识隔热配方的一部分。
- 训练收敛速度(关键量化结果,来自官方博客图表):generalist 模型在 “bussing” 任务上,π0.5+KI 与 π0-FAST 在约 160K 训练步收敛到高性能,而纯 flow-matching 的 π0 要到约 1200K 步才追上,即 KI 比 π0 少用约 7.5 倍训练步数(1200K/160K≈7.5)就能达到相当或更好的效果,同时仍保留 action expert 的快推理能力(不像 π0-FAST 需要慢速自回归解码)。
- 计算开销:论文明确指出,同时训练离散+连续两路输出,相比只训练连续动作(π0),单步训练计算成本增加约 20%;但因为收敛所需步数大幅减少,实际 wall-clock 训练时间仍显著快于纯 flow-matching 的 π0。
Infra(训练 / 推理工程)
- 训练 GPU 数量 / GPU-hours / 并行策略 / 精度:论文正文与附录均未披露具体数字。
- 单步计算开销:训练同时输出离散+连续动作比纯连续动作(π0)单步计算成本高约 20%(论文 §7 明确给出,为本文唯一披露的算力相关量化数字)。
- 推理架构:knowledge insulation 只改变训练期的梯度流与损失构成,推理阶段与 π0 完全一致——FAST 离散 token 通路训练完即丢弃,只跑 action expert 的 flow-matching 连续动作生成;论文 §4 指出这一类”action expert”架构(π0 一脉)可达 10 Hz 控制频率,远快于自回归 VLA 的 1.3 Hz(π0-FAST 生成 1 秒动作 chunk 在 RTX4090 上需约 750 ms),但论文没有为 π0.5+KI 单独重新测一遍这个数字(该数字来自对 π0 架构类的一般性描述,本文模型推理端与 π0 同构,故应沿用同量级)。
- 任务执行时间对比(本文明确报告):“table bussing” 任务里,自回归的 π0-FAST 完成任务所需时间约为本文方法(π0.5+KI)的 2 倍(论文正文与博客均给出这一比例,但未给出具体秒数)。
- 下游部署硬件需求(来自 openpi 仓库 README,KI 技术已并入该仓库 2025 年 9 月发布的 π0.5 系列检查点,含明确用 knowledge insulation 训练的 pi05_droid):推理 >8 GB 显存(如 RTX 4090);LoRA 微调 >22.5 GB;全量微调 >70 GB(A100 80GB / H100);训练脚本暂不支持多机,多 GPU 通过 FSDP(
fsdp_devices)做单机模型并行。这些数字描述的是 openpi 里包含 KI 技术的 π0.5 checkpoint 家族的资源需求,而非本论文自身实验环境的精确配置。
评测 benchmark
真实世界任务(10 episodes/任务/策略,双侧 t 检验):
-
Items-in-drawer(静态单臂,未见环境,需同时精确理解语言指令+精细操作抽屉):本文方法显著优于全部基线;joint-training(无 stop-gradient)语言跟随出问题,π0 也有类似问题;π0-FAST 动作慢、开抽屉精度不足;HybridVLA(方法论上最接近本文,也联合训练离散+连续,但允许自回归 token attend 连续动作)在此任务上明显更差,说明本文的注意力掩码设计是关键。
-
Table bussing(详细消融任务):本文方法最佳;joint-training(无 stop-gradient)也不错;π0-FAST 慢,需约 2 倍时间;Transfusion 效果好但比本文方法慢;OpenVLA-OFT 式并行解码普遍更差;冻结 backbone 不可行(表征不足以支撑机器人控制)。
-
T-shirt folding:π0 在本文构建的大规模单本体数据混合上训练也表现挣扎;冻结 backbone、并行解码同样不是好策略。
-
DROID(开源基准,真实世界桌面操作,与 Pertsch et al. 2025 同任务集):本文方法得分 0.55 ± 0.09,π0 0.49 ± 0.09,π0-FAST 0.45 ± 0.09。
-
LIBERO(表 1,成功率 %):
方法 Spatial Object Goal 10(Long) 90 Baku – – – 86.0 90.0 MoDE – – – 94.0 95.0 openvla-oft 97.6 98.4 97.9 94.5 – pi0 96.8 98.8 95.8 85.2 – π0-FAST 96.4 96.8 88.6 60.2 – Ours(从零训练) 96.6 97.2 94.6 84.8 92.7 Ours(从 generalist 微调) 98.0 97.8 95.6 85.8 96.0 本文方法(从 generalist 模型微调)在 LIBERO-Spatial 和 LIBERO-90 上取得当时新的 SOTA;该 LIBERO 微调模型是从”stop-gradient + VLM 数据 co-training”的 generalist 模型上微调而来,因为 generalist 原始训练混合里没有 LIBERO 数据。
-
通才(generalist)模型评测:table bussing 任务上通才模型与专精模型性能相当;去掉 VLM co-training 数据(w/o VLM data)任务完成率略降,对 joint-training(无 stop-gradient)基线的语言跟随率影响最大;4 个移动操作任务(如 dish-in-sink)上同样是”stop-gradient + VLM 数据”版本最佳;π0 在同训练步数下明显更差,因为纯 flow-matching 损失收敛慢得多(对应上文”7.5 倍训练步”的发现)。
-
语言跟随消融:stop-gradient 相比 π0 与”无 VLM 数据的 joint-training”显著提升语言跟随;若已做 VLM co-training,则不做 stop-gradient 的 joint-training 也能达到不错的语言跟随水平;Transfusion 语言跟随优于 π0(因为它复用 backbone 权重做连续动作生成,新增参数只有投影层)。
-
OOD 泛化实验:移动操作机器人抓取训练中未见过的新物体(“OOD Follow Rate”),VLM 数据 co-training 对此项泛化尤为关键。
创新点与影响
- 核心贡献:把”要不要冻结/如何嫁接连续动作模块到预训练 VLM”这个此前只能凭经验试错的问题,转化成一个可解释、可复现的机制——用注意力层的分块 stop-gradient 精确切断 action expert 到 backbone 的梯度回传,同时用离散 FAST token 给 backbone 补一条独立学习信号,是第一个”训得快(同 π0-FAST)+ 跑得快(同 π0)+ 泛化好(保留 VLM 知识)“三者兼得的单阶段 VLA 训练配方。
- 改变了什么:把 pi0-5 里”先离散预训练、再接 action expert 后训练”的两阶段流程,形式化并压缩成单阶段联合训练;确认并量化了”randomly initialized 的连续输出模块会通过梯度污染预训练 VLM”这一此前只是猜测的现象,并给出可以直接落地到其他 VLA 架构(如 HybridVLA、Transfusion)的通用修正方案。
- 对社区的影响:该技术已被合并进 pi0-5 所在的 openpi 开源仓库,2025 年 9 月发布的 π0.5 系列基础检查点(pi05_base / pi05_libero / pi05_droid)均改用 knowledge insulation 训练,其中 pi05_droid 的仓库说明直接点名”用 knowledge insulation 微调,实现快推理和好的语言跟随”。
- 作者自陈局限:联合训练离散+连续两路输出使单步训练计算成本增加约 20%(虽被更快收敛抵消,整体 wall-clock 训练时间仍更快);语言跟随虽有改善但仍不完美,训练数据里的相关性有时仍会让模型忽略语言指令。
原始链接
- 论文(arXiv):https://arxiv.org/abs/2505.23705
- 论文 PDF:https://arxiv.org/pdf/2505.23705
- 官方博客 / 项目页(含视频演示):https://www.physicalintelligence.company/research/knowledge_insulation
- 博客内论文 PDF:https://www.physicalintelligence.company/download/pi05_KI.pdf
- 承载该训练技术的开源代码仓库(openpi,pi05_base / pi05_libero / pi05_droid 检查点均用此技术训练):https://github.com/Physical-Intelligence/openpi
- 相关:pi0(π0 原始 action-expert 架构)、pi0-5(本文正式化的两阶段配方来源)、openvla-oft(并行解码基线)
一手源存档(sources/)
- pi-knowledge-insulation—blog.md — 官方博客快照(含各任务消融的 p 值与训练步数对比图说明)
- pi-knowledge-insulation—github-readme.md — openpi 仓库 README 快照(KI 训练技术并入的 π0.5 checkpoint 家族与硬件需求)
- arXiv 2505.23705 全文 HTML:见上方 arXiv 链接(arXiv 原文,不入 git)