一句话定位
One-Step Flow Policy(OFP)不依赖预训练教师模型,用”自一致性训练 + 自引导正则化 + 免训练 warm-start”三件套把 flow-matching 视觉运动策略从零蒸馏成单步生成器:在 56 个仿真操作任务上,1 步推理平均成功率超过 100 步扩散/flow 策略,推理加速 100 倍以上;接入 π0.5 后单步也能超过原版 10 步策略。
背景与定位
Flow/扩散生成式策略(如 Diffusion Policy、DP3、π0/π0.5)用迭代 ODE/SDE 求解生成动作,天然支持多模态动作分布和连续控制信号,但单次动作生成需要几十到上百次网络前向,在高速抓取等时间敏感场景中控制频率和精度都会被拖累。此前的加速路线分两派:一是[consistency-policy|Consistency Policy] 这类一致性蒸馏(Consistency Distillation),沿轨迹强制端点一致,但目标函数是 mode-covering 的,容易在多模态动作分布上做平均,单步预测不够”尖锐”;二是 One-Step Diffusion Policy(OneDP)这类得分蒸馏(Score Distillation,源自 DMD),目标 mode-seeking,单步样本质量高但牺牲了多样性、且只能做单步推理(无法用多步换精度)、还都依赖预训练教师网络提供得分/轨迹。MeanFlow 尝试用平均速度场做单步生成,但训练中的 JVP(Jacobian-Vector Product)计算显著增加显存开销并使优化不稳定(在真实机器人策略适配版 MP1 里训练方差大、频繁 loss spike)。
OFP 的定位是把两派的优点在一个从零训练(无教师网络)的自蒸馏框架里统一:自一致性训练继承一致性蒸馏的”跨时间连贯性”,自引导正则化引入得分蒸馏式的”锐化到专家高密度模态”信号,两者互补,同时保留了多步推理换精度的能力。论文进一步把该方法接到 π0.5 这一大规模 VLA 骨干上验证可扩展性(在 RoboTwin 2.0 上单步超过原版 10 步)。
模型架构
Backbone(仿真基准):Diffusion Transformer(DiT),2D 与 3D 设置均为 12 层 transformer、8 个注意力头、隐藏维度 768;时间步嵌入与目标区间嵌入各 128 维,拼接后投影;观测通过 cross-attention 注入,线性头输出最终动作。
ACTION 建模:不是离散 token 化,而是把标准 flow-matching 的”瞬时速度场”换成参数化的区间平均速度场 u_θ(z_t, t, r∣o)(0≤t≤r≤1),表示从 t 到 r 的平均速度;更新规则 z_r = z_t + (r−t)·u(z_t,t,r);当 r→t⁺ 时退化为标准瞬时速度场,与 flow matching 理论一致。推理时既可做单步全局跳跃 â=ε+u_θ(ε,0,1∣o),也可以链式多步(K 段区间)换精度,同一模型无需重训即可在 NFE=1 和 NFE=4 之间切换。
编码器(2D 设置):ResNet-18 端到端训练提取视觉特征,两帧历史的 84×84 RGB + 低维本体状态(如 Adroit Hammer 24 维、DexArt Faucet 32 维),8 步动作 chunk,执行前 4 步(receding horizon)。
编码器(3D 设置):DP3 的 PointNet 点云编码器 + MLP 状态编码器,点数从 512(Adroit/MetaWorld)到 1024 场景点+96 想象机器人点(DexArt);128 维点云特征+64 维状态特征拼接后送入 transformer 策略。
跨具身集成(π0.5+OFP):沿用 OpenPI 的双专家 PaliGemma 架构——2B 参数的视觉语言前缀专家(含 SigLIP 编码器)融合多视角相机与语言指令,300M 参数的动作专家(depth 18、width 1024、8 头)把带噪动作 token 映射为 flow 更新;时间与区间条件通过自适应 RMSNorm 注入;输入为 3 路 224×224 RGB、32 维机器人状态、PaliGemma 分词后的语言 prompt。
对比基线架构:DP 与蒸馏基线(CP、OneDP)用 U-Net 去噪器,通道宽度 [256,512,1024];DP3 通道更宽 [512,1024,2048];所有蒸馏基线沿用各自教师网络架构(CP/OneDP 均由预训练 DP3 教师蒸馏而来,OFP 与 MP1 是从零训练)。
数据
不涉及互联网规模预训练数据,全部是仿真专家示范 + 一个真实 VLA 微调设置:
- Adroit(3 任务:Door/Hammer/Pen):单任务学习,每任务 10 条专家示范,训练 3000 epoch。
- DexArt(4 任务:Bucket/Faucet/Laptop/Toilet):单任务学习,每任务 100 条专家示范,训练 3000 epoch。
- MetaWorld(49 任务,按难度分 Easy 28/Medium 11/Hard 5/Very Hard 5):单策略联合训练全部 49 任务,每任务 10 条示范,训练 1000 epoch。
- 3D 设置总计 56 个任务(Adroit 3 + DexArt 4 + MetaWorld 49);2D 设置为 Adroit 3 + DexArt 4 共 7 个任务。
- RoboTwin 2.0(π0.5 集成,4 任务:Adjust Bottle / Beat Block Hammer / Handover Mic / Place Empty Cup):每任务 100 条示范,从 π0.5 base checkpoint 微调 3000 步,评测时每任务 100 次随机化 trial(域随机化涵盖杂物干扰、背景纹理、光照、桌面高度)。
- 数据效率消融(DexArt Faucet 任务):示范数从 20 条增到(未列出全部中间点,论文只给两端)150 条,OFP 从 32.7%→51.0% 持续提升;MP1 在 20 条示范时性能急剧退化,150 条时也出现下降(rank-collapse 现象),OFP 未出现该问题。
- 无 sim-to-real 迁移实验,仿真与真机(π0.5 微调用的是仿真 RoboTwin 2.0,非物理真机)各自独立采集示范,未引入第三方数据联合训练;论文自陈”当前评测均在仿真中完成,真机验证是直接的下一步工作”。
训练方法
统一目标:L_self-distill = L_flow + λ_c·L_self-consistency + λ_g·L_self-guidance。
- 边界锚定(L_flow):标准 flow-matching 监督,对角线上 u_θ(z_t,t,t∣o) 回归 (a−ε),保证策略保留多步高质量生成能力。
- 自一致性训练(L_self-consistency):采样两个时间 (t,r)(t<r)和中间时间 m∈[t,r],用 EMA 教师 u_θ⁻ 预测轨迹终点 ẑ_r = z_m+(r−m)·u_θ⁻(z_m,m,r),构造目标 u_target=(ẑ_r−z_t)/(r−t);关键是时间收缩调度(time-contracting schedule):m 从 U[t, t+(r−t)ρ(s)] 采样,ρ(s) 随训练步 s 单调递减——训练早期 ρ(s)≈1(m 覆盖整个区间,减少对未训练教师的 bootstrapping 误差),后期 ρ(s)→0(m→t,强制严格局部一致性)。论文附录证明:当 (m−t)→0 时,该一致性目标收敛到 MeanFlow 目标里导数项的有限差分近似,但完全避免了 MeanFlow 需要的 JVP 计算,只依赖前向传播。
- 自引导正则化(L_self-guidance):把单步预测 â 在新时间 t’ 重新加噪,最小化策略边际分布与专家分布的反向 KL;用 Classifier-Free Guidance 展开梯度后发现可分解为 “CFG 增广项(CA term)” 和 “分布匹配项”,DMD 式分析表明 CA 项是样本质量的主要驱动,于是只用 CA 项作为引导信号——用 EMA 教师自身的条件/无条件预测差 (u_θ⁻(·∣ϕ)−u_θ⁻(·∣o)) 估计得分差,无需预训练教师。训练用条件 dropout(概率 p_drop)让同一网络同时学习条件/无条件分支。
- Warm-start(免训练推理机制):receding-horizon 循环中,把上一步未执行的动作后缀左移、末端动作 padding 补齐,构成与当前 chunk 等长的 warm-start 先验 a_warm;推理时不从纯高斯噪声出发,而是从 a_warm 在噪声水平 t_w 处的加噪投影 z_tw=(1−t_w)ε+t_w·a_warm 出发做单步跳跃,降低单步生成需要跨越的 transport 距离。
关键超参(仿真主实验):AdamW,lr=1e-4,β=(0.95, 0.999),weight decay=1e-6,cosine schedule + 500 步 warmup;EMA 教师衰减 0.75(上限 0.9999);训练 3000 epoch,batch size 64;损失权重边界 flow-matching 占 80%、自一致性占 20%;自一致性区间从 logit-normal 分布采样,时间收缩调度取多项式衰减;3D 任务上自引导权重 0.05,条件 dropout 10%;推理 warm-start 取 t_w=0.15。
π0.5+OFP 微调超参:沿用 OpenPI 配置,AdamW,全局梯度裁剪 1.0,cosine schedule 峰值 lr=2.5e-5,从 π0.5 base checkpoint 微调 3000 步。
训练范式为模仿学习(regression on expert demonstrations),无 RL 阶段。
Infra(训练 / 推理工程)
- 仿真主实验:单张 NVIDIA A100 GPU,训练 3000 epoch,batch size 64;总 GPU-hours 未披露;是否用混合精度 / 数据并行未披露。
- π0.5+OFP 微调:4 张 NVIDIA A100 GPU,微调 3000 步;GPU-hours 未披露。
- 推理延迟(56 任务平均,wall-clock):OFP 单个动作 chunk 17.58 ms;对比 DP3(NFE=100)3225.67 ms、3D FM Policy(NFE=100)1865.72 ms——分别对应约 183× 和 106× 加速;OFP 比 OneDP/MP1(同为单步)略慢,因为 warm-start 引入了少量额外计算,论文认为精度收益足以覆盖这部分开销。
- 控制频率(control-Hz)未直接给出,可由 chunk 级延迟折算(17.58ms/chunk),但论文未提供逐动作/实时控制频率的显式数字;边缘硬件部署未涉及(全部为仿真评测 + GPU 上的 π0.5 微调)。
- 代码/权重未开源(arXiv 页面 Code/Data/Media 标签下仅有第三方 CatalyzeX 代码查找器链接,未见官方 GitHub/HF 仓库)。
评测 benchmark
2D 图像输入,7 任务平均(Table 1,NFE=1 vs 多步基线)
| 方法 | NFE | Door | Hammer | Pen | Bucket | Faucet | Laptop | Toilet | 平均 |
|---|---|---|---|---|---|---|---|---|---|
| DP | 100 | 51.7 | 100.0 | 67.7 | 34.7 | 38.7 | 80.3 | 76.0 | 64.2 |
| FM Policy | 100 | 63.7 | 100.0 | 69.7 | 31.7 | 40.7 | 84.7 | 79.7 | 67.2 |
| CP | 1 | 46.3 | 100.0 | 58.7 | 30.7 | 33.3 | 79.0 | 69.7 | 59.7 |
| OneDP | 1 | 53.3 | 100.0 | 64.7 | 32.7 | 40.0 | 76.3 | 76.3 | 63.3 |
| MP1 | 1 | 49.3 | 96.3 | 57.3 | 31.7 | 33.0 | 83.7 | 72.3 | 60.5 |
| OFP | 1 | 68.3 | 100.0 | 69.3 | 33.3 | 41.0 | 85.7 | 80.7 | 68.3 |
OFP 在 NFE=1 下(68.3%)已超过 DP@NFE=100(64.2%)和 FM Policy@NFE=100(67.2%)。
3D 点云输入,56 任务平均(Table 2):DP3@100 步 66.4%,3D FM Policy@100 步 59.8%;OFP@NFE=1 达 71.6%——比 DP3@100 高约 8 个百分点,比 3D FM Policy@100 高 19.7 个百分点;OFP 在 MetaWorld 各难度段(Easy 87.9%、Medium 52.4%、Hard 43.3%、Very Hard 49.2%)均优于或接近其余单步方法。
少步 vs 单步权衡(Table 3,4 个 DexArt 任务):OFP@NFE=1 平均 64.5%,@NFE=4 提升到 66.2%;OneDP 只支持单步(62.5%),CP 从 NFE=1 的 60.7% 提升到 NFE=4 的 64.2%——OFP 同时保持单步最优和多步继续提升的能力。
π0.5 集成,RoboTwin 2.0 四任务平均成功率(Table 5,NFE=1 除 π0.5 基线 NFE=10):π0.5 基线 91.5%(4 任务均值:96.0/88.3/90.7/91.0);CFM 79.1%;Shortcut 80.9%;iMF 86.7%;OFP 94.7%(99.0/91.7/94.3/93.7)——单步 OFP 全面超过原版 10 步 π0.5。
组件消融(Table 6,7 个 Adroit+DexArt 任务平均):仅 SCT(自一致性)NFE=1 时 68.7%,NFE=4 时 72.3%——单步能力明显落后多步;SCT+SGR(加自引导)NFE=1 提升到 71.4%(+2.7pt),NFE=4 到 72.6%;完整 OFP(再加 warm-start)NFE=1 达 73.3%,NFE=4 达 75.7%。消融证实:SCT 提供跨时间平滑但单步易”多模态平均”、SGR 专门解决单步锐化、warm-start 训练免费且在任意步数下都有增益。
数据规模消融(Fig. 4,DexArt Faucet):极稀疏数据(20 条示范)下 MP1 大幅退化,OFP 保持稳健;示范数增加时 OFP 从 32.7% 平滑提升到 51.0%,MP1 在 100 条示范后反而下降(bootstrapping/rank-collapse 问题)。
创新点与影响
贡献:(1) 提出无需预训练教师的从零自蒸馏框架,把一致性蒸馏(trajectory-matching)和得分蒸馏(score-distillation)两条此前互斥的技术路线统一进同一个训练目标;(2) 用”区间平均速度场 + EMA 教师 + 时间收缩调度”构造一致性目标,并在附录证明它在极限下等价于 MeanFlow 的导数项,却完全绕开 JVP 计算,训练更稳定(论文观察到 MP1/MeanFlow 类方法训练中出现高方差和 loss spike,OFP 未出现);(3) 复用 warm-start 这一原本用于平滑 receding-horizon 执行的技巧,把它重新定位为免训练的单步推理先验,缩短单步生成需要跨越的 transport 距离;(4) 在 56 个仿真任务和 π0.5 这一大规模 VLA 骨干上都验证了单步生成不发生性能坍缩,证明该方法不锁定在小模型策略类上。
改变了什么:此前单步生成式策略要么牺牲多样性(score distillation 类,如 OneDP)、要么牺牲单步精度(consistency distillation 类,如 CP),且都依赖预训练教师;OFP 首次在从零训练、无教师、同一模型可在 1 步与多步间自由切换的条件下,把单步生成质量推到超过 100 步基线的水平,同时给出 100倍以上 的推理加速。
作者自陈局限:当前全部评测在仿真中完成,物理真机验证是直接的下一步工作;OFP 与系统级加速技术(模型量化、结构剪枝)是正交的,可进一步叠加降低推理延迟,但论文未做此类叠加实验。
原始链接
- 论文(arXiv,2026-03-12 提交):https://arxiv.org/abs/2603.12480
- 论文 PDF:https://arxiv.org/pdf/2603.12480
一手源存档(sources/)
- 论文全文(arXiv 2603.12480,arXiv 原文 PDF,不入 git;正文数字取自 arXiv HTML v1 全文,含附录 A–E)。
- 未发现官方 GitHub / HuggingFace / project page(arXiv Code-Data-Media 标签仅有第三方 CatalyzeX 代码查找工具,未见作者自建仓库或主页),故本页无额外可归档的一手网页快照。