一句话定位
Qwen-Image-2.0-RL 是通义团队给已发布的 qwen-image-2-0 做的一套后训练方案,用人类反馈强化学习(RLHF)加在线策略蒸馏(OPD)同时提升文生图与图像编辑两条任务线的视觉质量和指令遵循:先用微调过的 Qwen 系 VLM 做「打分制(pointwise)+ 思维链」的多维组合奖励模型,再用改造版 GRPO(含「只在 rollout 用 CFG」的混合策略、异步奖励管线、按噪声档采样抑制 reward hacking)分别训出 T2I 与编辑两个专家教师,最后用轨迹级速度匹配的 OPD 把两个教师合并成一个可部署的学生模型。相对 base,Qwen-Image-Bench 总分从 55.23 提到 57.84(+2.61),T2I arena Elo 1115→1193(+78),图像编辑 arena Elo 1256→1349(+93)。论文只放方法、不开权重(HF 作者评论明确「Just the papers」)。
背景与定位
这篇报告是纯后训练方法工作,落在 qwen-image-2-0 已经训好的基础模型之上,本身不改架构、不重训主干。它要解决的是「预训练扩散模型的去噪目标只优化 score matching,并不直接对齐人类审美(构图、纹理、prompt 忠实度、风格一致性)」这个老问题——RLHF 在大语言模型上已经证明能弥合这道缝,作者把同一范式搬到扩散模型上。
作者点出把 RLHF 扩展到扩散模型的三个具体难点:其一,可靠的奖励信号必须同时覆盖差异极大的任务——T2I 侧要管美学与 prompt 忠实,编辑侧要管细粒度的身份保持,单一奖励做不到,必须做「组合式、任务感知」的奖励设计;其二,现有扩散 RL 框架大多只在 LoRA 微调下验证过,真实场景里多奖励信号、多任务类型、全参数规模训练仍是空白;其三,部署时要把多个任务专用的 RL 策略收敛成一个模型,还不能牺牲各自任务的质量。这三点分别对应论文的三块贡献:奖励建模、可扩展 RL 框架、在线策略蒸馏。
方法谱系上,RL 部分建立在 Flow-GRPO(把多步去噪轨迹当 MDP、用等价随机采样器让 GRPO 可用)与 DiffusionNFT(前向扩散过程做策略优化)这两条扩散 RL 路线之上;蒸馏部分则和两个同期工作 Flow-OPD、DiffusionOPD 平行——后两者聚焦「把单奖励 T2I 教师合并」,本作的区别是按任务类型(T2I / 编辑)区分教师,并从 2-Wasserstein 距离上界推出蒸馏目标。奖励模型的「打分即 token 概率」思路来自 UnifiedReward / RewardDance 一系。与更早的 raft-reward-diffusion(奖励排序微调)相比,这里是完整的在线 GRPO + 蒸馏管线而非离线重加权。
模型架构
本作不引入新架构,被训练与被蒸馏的都是 qwen-image-2-0 那套(Qwen3-VL 冻结条件编码器 + MMDiT 去噪主干 + f16c64 高压缩 VAE,详见 qwen-image-vae-2-0)。报告没有重述主干参数量。真正新增的「模型」是两类奖励打分器:
- VLM 奖励模型:由微调 Qwen 系 VLM 得到,开启思维链推理。输出不是回归一个实数,而是在离散分数集
S={1,2,3,4,5}上出 token,奖励取该概率分布的期望R_φ(x,c)=Σ s·p_φ(s|x,c)。T2I 侧有三个(对齐、美学、人像),编辑侧有一个(指令遵循)。 - 基于模型的人脸身份打分器:编辑任务里 VLM 只能抓全局结构一致性,抓不住细微的人脸身份漂移,所以额外接一个专门的、embedding 级的人脸身份一致性打分器作补充。
训练产物是两个任务专家教师(T2I 教师、编辑教师),再蒸成一个统一学生(学生从预训练 base 初始化)。
数据
这是后训练工作,数据的重点在奖励模型标注和 RL prompt 池,而非预训练语料。
奖励模型标注(两种范式对比后选打分制)。作者刻意构造两份评估焦点相同(美学质量 + 视觉纹理)、只在标注格式上不同的数据集,图像都来自同一批 SOTA AIGC 模型,以隔离「训练范式」这一个变量:
- 打分制标注:prompt 从高质量人像参考图采样、再改写以丰富语言分布;每张图由人工在 5 分 Likert 上按两个结构化维度打分——Quality(清晰度、光照、色彩平衡、风格一致、材质纹理)与 Fidelity(结构正确、物理一致、无 AI 伪影如不自然平滑 / 纹理重复)。
- 成对标注:严格优先级 图文一致 > 结构畸变 > 纹理质量 > 美学吸引;每对再打辅助标签(样本有效性、文字畸变、人物畸变)。
结论(Fig 2)是打分制训出的奖励模型在 RL 里带来一致更好的视觉质量、更细纹理、更少伪影,作者归因于绝对分在校准尺度上编码了「有多好」,而成对只捕捉「哪个更好」。于是所有 VLM 奖励模型都以打分制为默认目标。人像奖励另用一份人像专属数据集训练。
RL prompt 池经过筛选(见训练方法的 prompt curation)。报告未披露 RL prompt 的具体规模、奖励模型各自的标注样本量。唯一出现的量化标注数字是评测端 Q-Judger 的 13 万+ 人工标注图-prompt 对、80 位专业画师,但那属于 qwen-image-bench 的评审模型,不是 RL 训练数据。
训练方法
整条管线是「两个专家 RL 教师 → 一个蒸馏学生」(Fig 1)。
GRPO-based RL 框架。沿用 Flow-GRPO 的组相对优势:一个 prompt 采 G 张图,奖励减组内均值除组内标准差得优势。多奖励下用带权求和 + 逐 prompt 组归一化(式 13,受 GDPO 启发)A=Σ_k w_k·(R_k−μ_k)/σ_k,Σw_k=1;逐组归一化保证组合奖励对各奖励模型的绝对尺度差异不敏感,避免某一维靠数值范围大而主导优势信号。
几个关键工程/算法设计:
- 混合 CFG 策略(核心)。系统比较了三种(Fig 3):两阶段都用 CFG → 训练不稳定、图像最终崩溃;两阶段都不用 CFG → 奖励分照涨但模型丢失风格化能力和世界知识(连知名人物长相都还原不出);只在 rollout 用 CFG(采纳)→ 用 CFG 生成高质量候选拿到可靠奖励信号,但把无条件分支排除在策略优化目标外。第三种兼顾稳定性与预训练能力保留,还省掉联合优化条件/无条件带来的算力与优化困难。
- 异步奖励管线。奖励模型部署成远端 API 服务、与训练解耦。策略经 GPU 推理生成一批图并跨 rank 收集后,后台线程异步把图提交到远端奖励端点;响应回来后各 rank 同步、逐 prompt 组归一化、算优势做梯度更新。奖励延迟几乎全部藏在推理计算背后,能在不成比例增加训练时间的前提下扩展到多个奖励模型。
- 按噪声档采样抑制 reward hacking。rollout 用 40 步 ODE 求解器;若在全部 40 个 timestep 都施加 RL 目标会很快 reward hacking、几轮内退化。对策是只在一个子集的 timestep 上训练,且偏重高噪声档(靠近 t=1)——高噪声档主导全局结构与语义布局,是更稳健的优化目标,能减缓奖励利用、让模型在各质量维度全面改善。
- prompt 筛选(intra-group reward range filtering)。用训好的奖励模型先过 prompt 池:base 对每个候选 prompt 做 G 次 rollout,算组内奖励极差(最大减最小),只保留极差超阈值的 prompt。奖励在所有样本上都均匀高或均匀低的 prompt 信号弱,被剔除,把算力集中在还有提升空间的 prompt 上。
- 按类别校准奖励权重。prompt 按语义分类(人像、风景、排版、通用),各给一套类别专属奖励权重向量——人像 prompt 给人像保真更高权重,排版 prompt 强调对齐。避免优化收敛到单一主导风格。
奖励模型细节。T2I 用分层设计:先图文对齐奖励(最基础,优先级 物体存在与计数 > 属性正确(色/尺寸/形状/材质)> 空间关系 > 动作姿态;违背最高优先级项的图无论其它维度都被压到低分),再叠美学奖励(构图平衡、真实光照、纹理保真、艺术一致),再叠人像奖励(面部吸引力、比例、身份细节、皮肤毛发纹理,显式检查手指数错误、面部畸变、身体比例异常)。编辑用指令遵循奖励(把源图+编辑指令+输出图当三元组,拆成核心/非核心要求,按「核心是否完成 / 非核心是否处理 / 整体是否协调」评分)加上前述基于模型的人脸身份一致性奖励。
在线策略蒸馏(OPD,最后阶段)。动机是 RL 出来的策略是任务专用的——T2I 优化过的模型可能编辑退化,反之亦然。做法(式 14):学生 v_θ(从预训练 base 初始化)用 N 步反向 ODE 生成图并保存整条轨迹,在轨迹每一点上匹配「任务对应教师」的速度 L_OPD=E[Σ_n ||v_θ(x_tn,tn,c)−v_θ*(x_tn,tn,c)||²]。多教师蒸馏时维持 T2I 教师与编辑教师两个,按当前样本任务类型选教师;显存上只把当前活跃教师放 GPU、非活跃教师 offload 到 CPU(动态教师激活,让多个大教师不成比例吃显存)。教师带 CFG 做速度预测、学生不带 CFG,OPD 之后再把 CFG 集成回学生。相对「把 T2I 与编辑奖励在一个模型里联合优化」的 Mix-RL 基线(Fig 5/6),OPD 从专家教师蒸馏避免了跨任务优化冲突——Mix-RL 在复杂指令下仍有身份漂移或编辑不完整,OPD 学生细节更锐、prompt 遵循更准、人脸身份保持更好。附录 A 把 OPD 目标从 2-Wasserstein 距离上界推导出来(借 Benton 2023 把速度场逼近误差与流分布距离关联的界)。
Infra(训练 / 推理工程)
- 奖励侧:奖励模型作为远端 API 服务独立部署,训练进程用后台线程异步提交打分请求,奖励延迟隐藏在 GPU 推理背后,从而可以低成本扩展到多个奖励模型(本报告主要的工程亮点之一)。
- 蒸馏侧显存管理:多教师 OPD 里只加载当前活跃教师到 GPU、其余 offload 到 CPU,用动态教师激活换取「多大教师不涨显存」。
- rollout:40 步 ODE 求解器;RL 目标只施加在高噪声子集 timestep 上(既抗 reward hacking 也变相省了每步反传的算力)。
- 未披露:GPU 数量、GPU·时、总算力、并行/分布式策略、混合精度、wall-clock、全参数 vs LoRA 的具体规模、RL 步数、G 组大小、学习率、KL 系数、OPD 的 N 步数等超参一律没给(全文只有 1 张表,即 Table 1 的评测结果,没有训练超参表)。这是本报告相对偏薄的一面。
评测 benchmark
两套一手评测,都用第一方口径给了数字。
Qwen-Image-Bench(Table 1,[0,100],Q-Judger 评审)。这是 qwen-image-bench 的创作者中心基准,5 个一级支柱、56 个三级切面自底向上聚合,评审模型 Q-Judger 由 13 万+ 人工标注、80 位专业画师训练。RL 相对 base 全五维一致提升,总分 55.23→57.84(+2.61),提升最大的是 Creative Generation(+6.72)和 Real-world Fidelity(+4.29):
| 维度 | Qwen-Image-2.0-Base | Qwen-Image-2.0-RL | Δ |
|---|---|---|---|
| Quality | 52.29 | 54.39 | +2.10 |
| Aesthetics | 57.10 | 58.67 | +1.57 |
| Alignment | 57.64 | 59.28 | +1.64 |
| Real-world Fidelity | 47.54 | 51.83 | +4.29 |
| Creative Generation | 58.22 | 64.94 | +6.72 |
| Overall | 55.23 | 57.84 | +2.61 |
横向坐标(同表):RL 后 57.84 仍低于闭源第一梯队——GPT Image 2 总分 64.69、Nano Banana 2.0 59.82、GPT Image 1.5 59.65、Nano Banana Pro 59.45,与 Seedream 5.0(57.22)大致同档、超过 Seedream 4.5/4.0、FLUX 2 Max/Pro、GPT Image 1 等。也就是说 RL 把 Qwen-Image-2.0 从「Seedream 4.x / FLUX 2 档」提到「Seedream 5.0 档」,但没追上 Nano Banana 2.0 / GPT Image 2。
人类偏好 arena(Fig 4,Elo)。T2I arena 用户对匿名图对投票,8 个子类(Product、3D、Cartoon、Photorealism、Art、Portraits、Text Rendering、Edit)。RL 后总体 T2I Elo 1115→1193(+78),提升最大的是 3D Modeling(+93)和 Photorealism(+91)。图像编辑 arena 1256→1349(+93)。
消融/定性:CFG 三策略对比(Fig 3)证明「只 rollout 用 CFG」是稳定性与能力保留的最优解;Mix-RL vs OPD(Fig 5 T2I / Fig 6 人像编辑)证明按任务分教师再蒸馏优于联合混训。报告未报告 GenEval / DPG-Bench / T2I-CompBench / GEdit 等标准化第三方 benchmark,评测口径就是 Qwen-Image-Bench + 两个 Elo arena。
创新点与影响
- 打分制 + CoT 的 VLM 组合奖励:用离散分数集的 token 概率期望做奖励,实证优于成对 Bradley-Terry;T2I 分层(对齐→美学→人像)、编辑另配基于模型的人脸身份打分器,覆盖了单一奖励盖不住的多维质量。
- 可扩展扩散 RL 框架:混合 CFG(只在 rollout 用)解决扩散 RL 里 CFG 该不该开这个两难,异步奖励管线让多奖励近乎零额外训练时延,按高噪声档采样 + prompt 极差筛选 + 按类别校准奖励三招系统性抑制 reward hacking 并提高样本效率。
- 按任务分教师的 OPD:用轨迹级速度匹配把 T2I 与编辑两个专家 RL 教师合并成单一部署模型,避开联合混训的跨任务冲突,且推理时不再依赖奖励模型;理论上从 2-Wasserstein 上界推导,和同期只做单奖励 T2I 合并的 Flow-OPD / DiffusionOPD 形成区分。
影响与定位:这是把「多任务、多奖励、全参数规模的扩散 RLHF + 蒸馏」讲清楚的一份工程化报告,验证了在一个统一生成-编辑模型(qwen-image-2-0)上,纯后训练能稳定拿到跨任务的偏好对齐增益(Bench +2.61、edit Elo +93),并把开源模型从 Seedream 4.x 档推到 Seedream 5.0 档。
已知局限:① 不开权重(HF 作者评论「Just the papers」),只是方法与结果的披露,社区无法直接复用模型;② 训练算力/GPU·时/并行/超参几乎全未披露,全文仅 1 张结果表,可复现性受限;③ 评测只用自家 Qwen-Image-Bench + 内部 arena,缺标准化第三方基准,横向可比性打折;④ 绝对水平上仍明显落后 GPT Image 2(64.69)与 Nano Banana 2.0(59.82);⑤ RL prompt 规模、奖励标注量均未给数字。
原始链接
- arxiv_abs: https://arxiv.org/abs/2606.27608
- arxiv_pdf: https://arxiv.org/pdf/2606.27608
- HuggingFace paper page: https://huggingface.co/papers/2606.27608
- 权重 / GitHub / ModelScope / 官方博客:无(论文明确不发布模型)