一句话定位

ReinFlow 不是新策略模型,而是给流匹配(flow-matching)策略配的一套在线策略梯度微调法:它在流策略确定性的 ODE 积分路径上,逐去噪步注入一个可学习、有界的高斯噪声,把「确定性 ODE」变成「离散时间马尔可夫过程」,从而在任意(甚至只有 1 步)去噪步数下都能写出精确、无需数值近似的联合似然,PPO 由此可以直接对流/Shortcut 策略做策略梯度微调——相当于把 DPPO 那套「去噪即 MDP + PPO」的思路从扩散策略搬到流匹配策略,但用「注入结构化噪声」而非「扩散本身自带的随机性」来获得可处理似然。

背景与定位

流匹配策略(Rectified Flow 等)相比扩散策略推理更快、实现更简单,正取代扩散策略成为机器人动作生成的新宠,但预训练数据稀缺、质量参差不齐,纯模仿学习(BC)预训练的流策略成功率常有上限;用在线 RL 微调是自然的下一步,此前 DPPO 已证明策略梯度可以稳定微调扩散策略。但流匹配的采样路径由一个确定性 ODE(神经网络参数化的速度场 v_θ)描述,在极少去噪步(离散化误差大)时连对数似然本身都难以获得或数值不稳定,直接把 DPPO 的思路照搬到流策略行不通。

同期把 RL 用到流匹配的工作(Flow-GRPO、ORW-CFM-W2)都面向计算机视觉任务(文生图、图像压缩),且 Flow-GRPO 用 GRPO 而非学习噪声网络,ORW-CFM-W2 基于奖励加权回归而非标准策略梯度;离线 RL 方向的 Flow Q-Learning (FQL) 训练一个多步流策略再蒸馏成单步策略做微调,但蒸馏过程缺乏内建探索机制,且论文实验里发现 FQL 官方实现在蒸馏单步策略时梯度会回流到多步策略、干扰预训练损失,导致多步 FQL 策略难以匹配纯 BC 预训练的奖励。ReinFlow 把注意力放回机器人连续控制场景,提出首个直接、稳定微调多步流匹配策略(含 Rectified Flow 与 Shortcut Models)的在线 RL 框架。

模型架构

ReinFlow 本身不引入新的策略骨干——被微调的仍是标准流匹配策略(速度场 v_θ),架构对齐 DPPO 以便公平对比:

  • State 输入任务(OpenAI Gym / Franka Kitchen):v_θ 用 MLP,接收动作 chunk、state、时间特征;时间 t∈(0,1) 经正弦位置编码 + 线性投影 + Mish 激活;Shortcut Models 额外把去噪步数编码后与时间特征拼接,并用小 MLP 编码 state 特征后与时间特征相加。critic 也是 MLP,宽度与 actor 相同或减半。
  • Pixel 输入任务(Robomimic):actor 与 critic 用单层 Vision Transformer(+ random shift 数据增强)做视觉编码器,小 MLP 压缩本体感知(proprioception);视觉运动条件特征、时间嵌入、原始动作 chunk 一起喂进 actor 的速度头;critic 只接收时间和条件特征。
  • 噪声注入网络 σ_θ’:与 actor 共享特征提取器(省参数、保持一致性),输出每个动作坐标的高斯噪声标准差;输出经 Tanh + 仿射变换约束在 [σ_min, σ_max] 区间内(边界是超参数,随机器人关节的机械结构约束设定)。可选条件包括仅 state、(state, t) 或固定常数(对比见「设计选择」实验)。微调后丢弃 σ_θ’,恢复出的仍是纯 ODE 推理的流策略。
  • 动作生成:a⁰N(0,I),a^(k+1) = a^k + v_θ(t_k,a^k,o)Δt_k + σ_θ’(t_k,a^k,o)·ε,εN(0,I);K 为去噪步数,均匀离散化下 t_k=k/K, Δt_k=1/K。这一注入噪声的过程把流的 ODE 转成离散时间马尔可夫过程,联合对数似然为 ln π(a⁰,…,a^K|o) = ln N(0,I) + Σ_{k=0}^{K-1} ln N(a^(k+1) | a^k+v_θΔt_k, σ_θ’²) ——对任意大的步长(即任意少的去噪步)都精确,不像连续时间流的精确似然(基于 Hutchinson 迹估计器对 ∇·v 积分)在少步下离散化误差会很大。
  • 动作分块(action chunking):一次观测输出一段动作 chunk(大小 C),chunk 内动作在给定初始观测下条件独立,chunk 的对数似然是内部各动作对数似然之和。
  • 策略梯度定理扩展:论文证明了一个针对「离散时间马尔可夫过程策略」(含噪声注入流)的通用策略梯度定理(POMDP、部分观测、折扣奖励),∇_θJ(π_θ) = E[Σ_h γ^h A_h^π(o_h,a_h) ∇_θ ln π_θ(a_h⁰,…,a_h^K|o_h)];具体实现用带 clip 的 PPO 代理损失(Algorithm 2),也可换成 GRPO 或 off-policy 的 SAC 等其他策略优化子程序。
  • 正则化:支持 Wasserstein-2 正则(约束微调后策略到预训练策略的 W2 距离上界)与熵正则(负逐符号熵率 / block entropy,鼓励探索);实验发现 W2/BC 正则通常没必要甚至会限制探索,熵正则在 locomotion 任务上更有效。
  • 参数规模(Table 2,state 任务噪声网络增量 <6%,pixel 任务约 15–19%):
Task预训练 Actor θ /M噪声网络 θ’ /M微调后 Actor θ̄ /MCritic /M总计 /MNoise/Velocity
Hopper-v2 (1-ReFlow)0.550.010.560.130.691.22%
Walker2d-v2 (1-ReFlow)0.570.010.580.140.711.39%
Ant-v3 (1-ReFlow)0.620.010.640.160.802.31%
Humanoid-v3 (1-ReFlow)0.800.030.830.231.064.23%
Kitchen (Shortcut)0.160.010.170.150.315.46%
Can (Shortcut)1.010.151.160.591.7414.59%
Square (Shortcut)1.690.322.010.592.5918.91%
Transport (Shortcut)1.870.352.220.662.8718.84%

数据

纯微调框架,不采集新数据,全部复用公开基准的演示数据 + 在线 rollout:

  • OpenAI Gym(Hopper-v2 / Walker2d-v2 / Ant-v2 / Humanoid-v3,state 输入,dense reward):专家数据来自 D4RL medium 或 medium-expert 档位(Humanoid-v3 例外,用自训 SAC agent 采样数据);为与 FQL 对齐(DPPO 的 Gym BC 数据集没有离线奖励),涉及 FQL 的实验改用 D4RL 离线 RL 数据集同时训练 DPPO/FQL/ReinFlow。
  • Franka Kitchen(9-DoF Franka 机械臂,长程多任务序贯规划,state 输入,sparse reward):人类遥操作数据,含 complete / mixed / partial 三档演示完整度。
  • Robomimic(视觉操作,Can / Square / Transport,pixel[3,96,96]×1或2 + 本体感知,sparse reward):人类遥操作数据,按 DPPO 论文的处理方式进一步压缩(比官方默认配置的状态向量更小、比 Robomimic 官方数据集质量/数量更低——DPPO 作者自陈此点)。
  • 动作 chunk / episode 长度(Table 1):Gym 各任务 action chunk 维度×4(如 Hopper 3×4),max episode length 1000;Kitchen 9×4,长度280;Robomimic Can/Square 7×4(长度300/400),Transport 14×8(双臂,长度800)。
  • 数据规模消融(Appendix Table 5, Robomimic Square):用 16/64/100 episodes 的 BC 数据集分别预训练再微调;16 episodes 因预训练初始成功率过低导致微调失败;64 与 100 episodes 用同一超参数(noise std∈[0.08,0.14],entropy 系数 0.01)均能微调成功。
  • sim-only:全部实验在仿真中进行,论文未做 sim-to-real 或真机实验(未披露真机数据)。

训练方法

两阶段:①流匹配模仿学习预训练(Rectified Flow 的 flow-matching 回归目标,或 Shortcut Models 的两步-单步速度对齐目标);②ReinFlow 在线策略梯度微调,核心设计:

  • 噪声注入把 ODE 变成可精确算似然的离散时间马尔可夫过程(见「模型架构」),噪声网络 θ’ 与速度网络 θ 联合训练,损失都是同一个策略梯度损失(Eq. 9)。
  • PPO 子程序(默认实现):优势估计用 GAE(λ=0.95);clip 概率比 ε=0.01(state 任务)/ 0.001(pixel 任务,沿用 DPPO 设定);裁剪去噪的中间动作到 [-1,1] 以防注入噪声让积分路径跳变过猛,微调后推理阶段也要保留这一裁剪,否则性能会退化。
  • critic warmup:微调前先训练几轮 critic 再更新 actor(对大模型/视觉输入尤其关键);critic 最后一层全连接层用正偏置初始化(按预训练成功率估计),可减少 warmup 轮数、避免 critic 对预训练分布过拟合导致策略梯度损失剧烈震荡。
  • 噪声标准差调度:训练前 35% 迭代保持噪声标准差上界不变,之后向 0.3σ_min+0.7σ_max 衰减(OpenAI Gym 任务设定,见 Table 7);论文发现噪声幅度是影响 ReinFlow 性能最显著的因素——过小探索受限,越过某阈值后策略能找到比预训练基线强 3 倍的新策略,此后对噪声变化不再敏感;视觉/复杂任务、长去噪链、预训练成功率低的场景应调低噪声。
  • 正则化选择:state-input 任务默认加熵正则(α=0.03),视觉操作任务默认不加正则;实验显示逐渐调低 W2 正则系数 β 能让策略离开 BC 基线、逼近熵正则的效果,说明 FQL 等依赖 W2 蒸馏损失约束在线探索的离线 RL 方法性能上限较低的部分原因。
  • 共享超参(Table 6):critic loss 系数 0.5,reward 归一化开启,actor/critic 均用 Adam + CosineAnnealingWarmupRestart 调度器(周期 100 步)。
  • Gym 任务具体超参(Table 7):40 个并行环境,action chunking size=4,batch size=50k,rollout steps=500,update epochs=5,训练迭代 1000 次,去噪步数=4,target KL=1.0。噪声标准差与学习率按任务分档(原文 Table 7b 中 Ant-v0 与 Humanoid-v3 共用同一组数值):Hopper-v2/Walker2d-v2 噪声 std∈[0.10,0.24],Ant-v0/Humanoid-v3 噪声 std∈[0.08,0.16];actor 学习率 Hopper-v2 与 Ant-v0/Humanoid-v3 均为 cos(4.5e-5→2.0e-5),Walker2d-v2 为 cos(4.5e-4→4.0e-4);critic 学习率 Hopper-v2 与 Ant-v0/Humanoid-v3 均为 cos(6.5e-4→3.0e-4),Walker2d-v2 为 cos(4.0e-3→4.0e-3);critic warmup 迭代数 Hopper-v2/Ant-v0/Humanoid-v3=0,Walker2d-v2=5。
  • 去噪步数:Gym/Kitchen 用 4 步(相比 DPPO 的 10 步),Robomimic Can/Square 用 Shortcut Model 单步(K=1),Transport 用 4 步(相比 DPPO 用的 5 步 DDIM)。
  • 消融实验(第 6 节,Design Choice):①扩大预训练数据规模或推理步数对奖励的提升会很快平台化(与 Lin et al. 的模仿学习数据 scaling law 研究一致),但 ReinFlow 在任意预训练规模下都能持续提升;②流匹配的时间采样分布(uniform/logit-normal/beta)不影响 ReinFlow 有效性,beta 分布在单步微调时略强;③噪声网络若同时条件于 (state, time) 比只条件于 state 成功率更高;④增加去噪步数 K 会提高 Franka Kitchen 上 Shortcut Policy 的初始奖励但很快出现平台效应,视觉操作任务中提高 K 时同时调低噪声标准差有益。

Infra(训练 / 推理工程)

  • 仿真与并行:OpenAI Gym 任务用 40 个并行环境采样(rollout steps=500,batch size=50k);Kitchen/Robomimic 具体并行环境数未在原文超参表中给出(原文称环境配置与 DPPO 对齐)。
  • 单迭代墙钟(Table 3,单块 NVIDIA RTX 3090,EGL 渲染;Transport 例外用两块 NVIDIA A100)
TaskReinFlow-RReinFlow-SDPPOFQL
Hopper-v211.72s12.29s99.05s4.42s
Walker2d-v211.56s13.02s101.92s5.02s
Ant-v017.47s17.73s102.01s5.17s
Humanoid-v330.92s30.53s109.57s5.25s
Franka Kitchen26.54s83.16s5.25s
Can (image)218.06s308.93s
Square (image)313.21s437.83s
Transport (image, 2×A100)558.36s419.32s
  • 按 Table 3 数字换算,ReinFlow 单迭代墙钟比 DPPO 快约 3.1×(Franka Kitchen)到 8.8×(Walker2d-v2)不等,简单 locomotion 任务提速幅度最大、Humanoid-v3/Kitchen 这类更复杂任务提速幅度较小;主要来自去噪步数更少(4 步 vs 10 步)+ 更简单的似然计算(无需算去噪步优势函数)。FQL 单迭代墙钟最短,但 batch 更小、总迭代数远多于 PPO 类方法且非并行设计,故总墙钟未必更省(原文未给出 FQL 总迭代数,无法据此推算其总墙钟)。
  • 总墙钟净减少:论文摘要口径——Gym locomotion 任务节省 82.63% 墙钟(vs DPPO),全部任务平均节省 62.82%;Robomimic 视觉操作任务平均节省 23.20% 计算时间(vs 微调后的 DDIM 策略,性能相当)。
  • 精度:论文未披露混合精度训练细节。
  • 推理延迟/边缘硬件:未披露具体 FPS/control-Hz 或边缘部署数据;论文全部为仿真实验,未做 sim-to-real 或真机部署。
  • 后续扩展(GitHub README 披露,晚于本文 2025-05 arXiv 版本):借助开源 RL 基础设施项目 RLinf,ReinFlow 已被扩展到 320 个高度随机化的视觉操作环境(数千种物体-场景-任务-位姿组合)、模型规模最高到 30 亿参数;2025/11 进一步扩展到微调 π₀、π₀.₅ 等 VLA 模型(LIBERO 环境代码见 RLinf-pi0,技术报告 arXiv:2510.25889),以及 NVIDIA GR00T VLA(RLinf-GR00T-N1.5)。这些均为仓库后续更新内容,不在本文(2505.22094)披露范围内。

评测 benchmark

主结果(Table 4,论文原始数字,均为 3 个随机种子 mean±std,Kitchen mixed/partial 额外加 2 个种子):

Locomotion(Average Episode Reward,D4RL 数据预训练)

TaskAlgorithm预训练奖励微调后奖励净增长率
Hopper-v2ReinFlow-R1431.80±27.573205.33±32.09123.87%
Hopper-v2ReinFlow-S1528.34±14.913283.27±27.48114.83%
Walker2d-v2ReinFlow-R2739.90±74.574108.57±51.7749.95%
Walker2d-v2ReinFlow-S2739.19±134.304254.87±56.5655.33%
Ant-v2ReinFlow-R1230.54±8.184009.18±44.60225.81%
Ant-v2ReinFlow-S2088.06±79.344106.31±79.45225.81%†
Humanoid-v3ReinFlow-R1926.48±41.485076.12±37.47163.49%
Humanoid-v3ReinFlow-S2122.03±105.014748.55±70.71123.77%

† 原文 Table 4 中 Ant-v2/ReinFlow-S 一行的净增长率打印值与 ReinFlow-R 完全相同(225.81%),但按论文自己给出的公式 (微调后−预训练)/预训练 用该行数字计算应为 (4106.31−2088.06)/2088.06 ≈ 96.66%,怀疑是原文表格的复制粘贴笔误(已核对 arXiv HTML 源码,两行确实都印 225.81%)。摘要中「135.36% 平均净增长」这一头条数字,若按原文印刷的 8 个百分比直接平均,刚好等于 135.36%;若把 Ant-v2/ReinFlow-S 换成按公式重算的 96.66%,平均值降为约 119.21%。此处如实保留原文印刷值并注明这一算术不自洽,供后续引用时注意。

Manipulation(Average Success Rate)

TaskAlgorithm预训练成功率微调后成功率净增量
Kitchen-completeReinFlow-S73.16±0.84%96.17±3.65%23.01%
Kitchen-mixedReinFlow-S48.37±0.78%74.63±0.36%26.26%
Kitchen-partialReinFlow-S40.00±0.28%84.59±12.38%44.59%
Can (image)ReinFlow-R59.00±3.08%98.67±0.47%39.67%
Can (image)ReinFlow-S57.83±1.25%98.50±0.71%40.67%
Square (image)ReinFlow-R25.00±1.47%74.83±0.24%49.83%
Square (image)ReinFlow-S34.50±1.22%74.67±2.66%40.17%
Transport (image)ReinFlow-S30.17±2.46%88.67±4.40%58.50%
  • 汇总指标:OpenAI Gym locomotion 平均奖励净增长 135.36%;Franka Kitchen 平均成功率净增 31.29%;Robomimic 平均成功率净增 45.77%;全部操作任务合计平均净增 40.34%。
  • 与 DPPO 对比:Gym/Kitchen 上 ReinFlow 在几乎所有任务上优于 DPPO,同时去噪步数从 10(DPPO)降到 4(ReinFlow),Robomimic 上成功率与 DPPO 相当但去噪步数更少(Can/Square 单步、Transport 4 步 vs DPPO 5 步 DDIM)。
  • 与 FQL 对比:FQL 在简单 locomotion 任务(Hopper、Walker2d)样本效率更高,但在更难的任务上渐近性能不如 DPPO/ReinFlow;ReinFlow 在样本效率和最终性能上通常渐近优于或匹配 FQL,且总墙钟更低(FQL 无并行设计)。
  • 与其他扩散 RL 基线对比(Appendix E,Ant-v0/Hopper-v2/Walker2d-v2):ReinFlow 相较 QSM、DRWR、DAWR、DIPO、IDQL 等扩散 RL 基线在随机种子稳定性与渐近性能上整体更优。
  • 数据规模消融(Table 5, Square):16 episodes 预训练成功率过低导致微调失败;64/100 episodes 用同一超参均能成功微调。

创新点与影响

  • 核心贡献:首个直接对多步流匹配策略(Rectified Flow / Shortcut Models)做在线策略梯度微调的框架,通过学习噪声注入网络把确定性 ODE 转成离散时间马尔可夫过程,在任意去噪步数(含 1 步)下都给出精确似然,避免了连续时间流似然(基于 Hutchinson 迹估计 + ODE 积分)在少步下的离散化误差问题。
  • 理论贡献:给出适用于「离散时间马尔可夫过程参数化策略」(含噪声注入流、以及原则上任何 ODE 策略)的通用 POMDP 策略梯度定理,比 DPPO 的 bi-level MDP 构造(对去噪步计算优势函数、缺乏理论保证)更简洁且有严格证明。
  • 效率影响:在 locomotion 上比 DPPO 省 82.63% 墙钟(全部任务平均省 62.82%),因为去噪步数更少、似然计算无需拆解到去噪步;在视觉操作上于更少去噪步下达到与微调后 DDIM 策略相当的成功率,同时省约 23.20% 计算时间。
  • 设计对流策略变体的普适性:同一套超参数可分别微调 Rectified Flow 与 Shortcut Models 两种流策略变体;理论上适用于任何以 ODE 定义采样路径的策略。
  • 作者自陈局限(论文 Conclusion + GitHub README 后续更新的 Limitation 章节):①本文只用 PPO 实现策略梯度子程序,未探索样本效率更高的其他 RL 算法;②全部实验在仿真中完成,未做真实机器人部署验证;③GitHub README 后续补充:“ReinFlow 可能不是从零训练 RL agent 的最优方法——本方法设计用于微调,而非预训练”;④噪声注入网络架构在更大骨干(如多层 Transformer)上如何平衡性能提升和参数量,论文留作未来工作。
  • 后续影响:论文被 NeurIPS 2025 接收;开源代码/数据/checkpoint 全部发布(MIT 协议),并被 RLinf 项目用于扩展到 3B 参数规模、320 个视觉操作环境,以及微调 π₀/π₀.₅、NVIDIA GR00T 等 VLA 模型(这些扩展属于仓库后续更新,晚于本文最初的 arXiv 版本)。

原始链接

一手源存档(sources/)

  • reinflow—project-page — 项目主页文本抽取(pipeline 图解、噪声结构说明、设计选择实验小结、FAQ)
  • reinflow—github-readme — GitHub README(安装/复现说明、后续新闻更新、致谢、超参调优 tips、局限性声明)
  • arXiv 全文(2505.22094,arXiv 原文 PDF,不入 git):见上「原始链接」