一句话定位

Meta 提出 quality-tuning(质量微调):在 11 亿图文对预训练的隐扩散模型之上,只用 约 2000 张人工精选的极高美学图像做监督微调,就能让模型「只产出高美感图像」而不损失概念通用性——质量微调后的 Emu 在视觉吸引力上以 82.9% 胜率压过其纯预训练版本,并以 68.4%/71.3% 胜率(PartiPrompts / Open User Input)超过当时 SOTA 的 SDXL v1.0。核心论点:质量远比数量重要,美学对齐之于文生图,正如指令微调之于 LLM。

背景与定位

网络规模图文对预训练(latent-diffusion-ldm / sdxl / dall-e-2 / imagen)让模型能从文本生成几乎任意视觉概念,但预训练分布里混杂大量低质量图像,导致模型默认产物不够美——存在”美学对齐”的缺口。此前社区改善美学多靠风格化微调(dreambooth、Textual Inversion、lora)或额外控制(controlnet、InstructPix2Pix),但这些都是面向特定主体/风格/任务的;本文是据作者所称**首个强调”用好的微调配方做通用美学对齐”**的工作。

类比是全文骨架:作者把流程拆成「知识学习阶段」(预训练,学会画万物) + 「质量学习阶段」(把输出限制到高质量、高美感子域)。后者对应 LLM 的指令微调——Llama2 用 27K 高质量 prompt 做 SFT 就达到 ChatGPT 级表现;同理文生图只需几千张精选图就能显著提升美感且保留通用性。关键洞见:强预训练模型本身已有能力生成高美感图,只是采样分布没被正确引导;质量微调只是把输出”约束”到那个高质量子集,而非教模型新能力。

模型架构

主干:单阶段隐扩散模型(LDM),输出 1024×1024。由 Autoencoder(编码图像到 latent)+ U-Net 去噪网络组成。注意与 SDXL 不同,Emu 不用后续 refinement 阶段,是单阶段架构。

Autoencoder 的关键改造(本文重要架构贡献)

  • 常用的 4 通道 AE(AE-4) 压缩率过高(三个 2×2 下采样把分辨率压 64×,通道却只从 3 RGB 升到 4),会丢小物体细节。
  • 把 latent 通道数提到 16,重建质量大幅改善。ImageNet 上的重建指标(Table 1,论文该列标为 FID,即重建 FID):AE-4 → AE-16 的 SSIM 0.80→0.92、PSNR 28.64→34.00、FID 0.35→0.06(中间档 AE-8:0.86 / 30.95 / 0.19)。
  • 进一步用对抗损失,并对 RGB 输入做一个不可学习的 Fourier Feature Transform 预处理,把输入通道从 3 维抬到更高维以更好捕捉细结构(Fourier-AE-16:SSIM 0.93、PSNR 34.19、FID 0.04)。

U-Net:大 U-Net,2.8B 可训练参数;通过加大各 stage 的通道数与堆叠残差块数提升容量。

文本条件:同时用 CLIP ViT-LT5-XXL 两个文本编码器的嵌入作为条件。

上采样器:部分精选图低于 1024×1024 目标分辨率,因此训练了一个受 imagen 架构启发的像素扩散上采样器,在需要时把训练图上采样到目标分辨率。

数据

预训练数据:自建内部数据集 11 亿(1.1B)图文对;采用渐进式提分辨率训练(类似 SDXL),低分辨率学高层语义、高分辨率补细节。预训练最后阶段加 noise-offset = 0.02,利于高对比度生成(对美感有贡献)。

高质量对齐数据(quality-tuning 数据集)的两段式构建——这是全文最核心的工程:

  1. 自动过滤(从数十亿降到约 200K):
    • 起始数十亿图 → 一系列自动过滤器降到几亿:去冒犯内容、美学评分过滤OCR 字数过滤(剔除叠太多文字的图)、CLIP score 过滤(剔图文对齐差的)。
    • 再按图像尺寸/长宽比自动过滤。
    • 视觉概念分类(引用 Meta 的 billion-scale 半监督分类工作)从特定领域均衡取图(肖像、食物、动物、风景、车等)。
    • 最后用专有信号(如点赞数)进一步降到 200K
  2. 人工过滤(两阶段):
    • 第一阶段:训练通才标注员把 200K 降到 20K,目标优化召回(确保排掉漏网的中低质图)。
    • 第二阶段:专家标注员(懂摄影原则)从 20K 里精选最高美学图,目标优化精度(只留最好的)。
    • 摄影原则指南覆盖 5 维:构图(三分法、深度与层次等)、光照(动态光、平衡曝光,避免人工/暗淡/过曝)、色彩与对比(鲜艳色彩、强对比,避免单色主导)、主体与背景(前后景深度、背景干净不杂乱、主体不出框不被遮)、额外主观评估(是否讲了引人故事 / 能否拍得更好 / 是否是你见过此类内容里最好的)。
    • 最终保留约 2000 张极高质量图,并为每张人工撰写 ground-truth caption

作者假设:遵循”高质量摄影的基本原则”能跨多种风格普遍带来更美的图——这一假设由人评验证(连非写实/风格化图也改善)。

训练方法

两阶段配方:知识学习(预训练)→ 质量学习(quality-tuning)。

预训练:11 亿图文对,渐进分辨率,扩散去噪目标,noise-offset 0.02(末阶段)。

Quality-tuning(核心方法)

  • 用约 2000 张精选图做监督微调(SFT)。
  • 极小 batch size = 64
  • 微调阶段 noise-offset = 0.1(高于预训练的 0.02)。
  • 早停至关重要:小数据集上微调过久会严重过拟合、退化通用性;尽管 loss 仍在下降,也不超过 15K 次迭代(迭代数靠经验确定)。
  • 不做 RLHF / DPO / reward model / 蒸馏——纯 SFT。方法之”简单”正是其卖点。

消融的方法论结论(见 benchmark 节):质量比数量重要——即使只用 100 张图也能把对 SDXL 的胜率从 24.8% 拉到 60%;试图以量换质会损害质量。

通用性验证:quality-tuning 不限于 LDM。作者从头重训了一个类 imagen像素扩散模型和一个类 muse掩码生成式 transformer,各用同样 2000 张图做质量微调,两者在视觉吸引力与文本忠实度上均显著提升——证明该配方架构无关。

Infra(训练 / 推理工程)

论文几乎未披露训练算力工程细节:未给 GPU 数 / GPU·时 / 并行策略 / 混合精度 / 吞吐量;致谢中提到”大量协作者支撑底层基础设施、数据、隐私与评测框架”,但无具体数字。推理侧也未报告步数 / 量化 / 缓存等加速细节。仅可知:预训练规模 11 亿图文对、U-Net 2.8B 参数、目标分辨率 1024²、单阶段(无 refiner)。质量微调本身极轻量(2000 图、batch 64、≤15K 迭代)。完整 infra 数字:未披露。

评测 benchmark(把效果讲清楚)

作者刻意不报告 FID 等”标准”指标,理由是(引 Pick-a-Pic、SDXL 等)FID 与人类对生成质量的判断相关性差。改用两项人评指标

  • 视觉吸引力(visual appeal):A/B 双图并排(不显示 caption),5 名标注员选更美的(A/B/Tie)。
  • 文本忠实度(text faithfulness):显示 caption,3 名标注员选更符合描述的(A/B/Both/Neither,Both 与 Neither 记为 Tie)。
  • 评测集:1600 条 PartiPrompts + 自建 2100 条 Open User Input (OUI) prompt(基于真实用户用法、由 LLM 改写成普通用户口吻,覆盖艺术时尚/食物/动物/文化/交通/自然等概念)。

关键数字

  1. Emu vs 纯预训练版(质量微调有效性,Figure 6)——视觉吸引力 Emu 胜率 82.9%(Parti)/ 91.2%(OUI),预训练版仅被选 15.4% / 7.9%;文本忠实度 Emu 胜率 36.7% / 47.9%,预训练版仅 21.0% / 18.5%(其余为 Tie)。文本忠实度也提升,作者归因于 2000 张图的 caption 是人工写的、比预训练噪声 caption 干净。

  2. Emu vs SDXL v1.0(视觉吸引力,Table 2)

    评测集win%tie%lose%
    Parti (All)68.42.129.5
    OUI (All)71.31.227.5
    Parti (Stylized)81.71.916.3
    OUI (Stylized)75.51.423.1

    风格化(非写实) prompt 上优势更大(81.7% / 75.5%),印证”摄影原则可跨风格泛化”。注:SDXL 因无法访问其训练数据/底模,用其官方 API 对比。

  3. 数据规模消融(Table 3,全部对 SDXL 为基线)

    微调数据量win%tie%lose%
    无质量微调24.81.473.9
    10060.31.538.2
    100063.21.935.0
    200067.02.630.4

    仅 100 张图就反超 SDXL(24.8%→60.3%),随数据量增加继续提升——是”质量>数量”的硬证据。

  4. 架构通用性(Figure 10):像素扩散与掩码生成式 transformer 在 1/3 随机抽样的 PartiPrompts 上,质量微调后视觉吸引力与文本忠实度均显著提升(论文以图呈现,未给具体百分比表格——具体数字未报告)。

创新点与影响

核心贡献

  1. 提出 quality-tuning 范式——把”美学对齐”明确为预训练后的独立阶段,并证明几百到几千张人工精选高质图 + 纯 SFT 即可大幅提升美感而不损通用性;据作者所称是首个强调通用美学对齐微调配方的工作。
  2. **“质量压倒数量”**的实证(100 张即反超 SDXL),与 LLM 指令微调的”少而精”形成跨模态呼应。
  3. 架构无关性:LDM / 像素扩散 / 掩码生成式 transformer 通吃。
  4. 一套可复用的数据漏斗工程(数十亿→200K 自动→20K 召回优先→2000 精度优先 + 人工 caption)与基于摄影原则的标注准则。
  5. 顺带的架构改进:16 通道 + Fourier Feature + 对抗损失的 Autoencoder(解决 AE-4 丢细节),U-Net 2.8B、双文本编码器(CLIP ViT-L + T5-XXL)。

影响:Emu 是 Meta AI 产品图像生成的底座——后续 Meta 的 Emu 系列(Emu Edit 图像编辑、Emu Video 文生视频)及 Meta AI / Instagram / Facebook 的图像生成功能均建立其上;“少量高质数据做美学/偏好对齐”成为业界文生图后训练的常见做法。

已知局限(论文自陈):

  • 人评固有主观且噪声大,换一组 prompt/标注员/准则结果可能不同;评测集虽较大但未必完全反映真实使用。
  • 小规模微调治标不治本:质量微调只约束输出分布到高质域,预训练遗留问题仍在——预训练没学好的物体,微调也难生成。
  • 与其他文生图模型一样可能产出偏见/误导/冒犯内容;作者称在公平性与安全上投入了均衡数据构建、专门评测集与多小时红队测试。
  • 未开源模型权重/数据;闭源产品化方向。

原始链接

一手源存档(sources/)