一句话定位
JEPA-T 把 i-jepa 开创的联合嵌入预测架构(JEPA)从”非生成表征学习”改造成一个文本到图像生成器:VAE 连续潜变量当”视觉 token”、冻结 CLIP 文本编码器当”文本条件”,两路都喂进一个共享 Transformer;关键设计是predictor 之后再加一次 cross-attention(而非把文本焊在骨干各层),配合 flow-matching loss 前再注入一次原始文本 embedding,在 ImageNet-1K 256×256 上把 FID 做到 1.42,同时一个网络既能做类别条件生成也能做开放词表的自由文本生成。属于 JEPA 谱系里少见的生成式旁支(论文本身与非生成式世界模型主线只是同源,不是同一目标)。
背景与定位
Token-centric 的 T2I 架构近年逐渐替代纯扩散/纯自回归两条老路:扩散模型(Stable Diffusion、Imagen)语义强但采样慢;自回归模型(Parti、MaskGIT)离散序列建模但长程依赖弱、扩展性差。论文把自己放进这样一条谱系里:TokLIP 在 tokenization 阶段就注入语义(早融合),D-JEPA(“Denoising with a Joint-Embedding Predictive Architecture”)把 jepa-predictive 的联合嵌入预测目标搬进生成式建模、拿到强扩展性,但没有专门做文本条件化。JEPA-T 要回答的问题是:该在哪一层、以什么方式把文本融进视觉 token,才能既保住 backbone 的任务无关性、又拿到强条件化?论文给出的答案是”晚期架构融合 + 目标函数层面对齐”的组合,而非把跨模态交互摊开在网络每一层(这是 LSeg/CLIPSeg 式开放词表分割、AttnGAN、Stable Diffusion U-Net cross-attention 等前人做法的共同代价:设计复杂度高)。
代码基于 MAR(mar-autoregressive-without-vector-quantization,“Autoregressive Image Generation without Vector Quantization”)的代码库;这也解释了为什么其”视觉 token”实际是连续潜变量而非离散码本(见下)。
模型架构
骨干:Transformer 编码器-解码器(encoder-decoder),backbone 用 ViT-Base(论文未重申具体层数/宽度等标准 ViT-B 配置数字,只说”we use a ViT-Base backbone for all JEPA-T variants”)。
- 视觉 tokenization:输入图像切非重叠 patch,经 VAE 编码为连续潜向量序列,再过线性层
z_proj投影到模型 embedding 维度,得到视觉 token 序列z。VAE 压缩因子 16,256×256 图像 → 16×16=256 个 token/图。- 值得注意的表述不一致:摘要与引言称图像/文本被编成”discrete visual and textual tokens”,但方法节 2.2 明确 VAE 输出是 continuous latent vectors,flow-matching 损失(Eq.5)也是对连续值做 L2 回归(而非离散码本上的交叉熵)——这与其所基于的 MAR(“无向量量化”路线)一致,“discrete”更像是沿用 token-centric 文献的通用措辞,而非真的做了向量量化。
- 文本/条件 tokenization:文本描述或类别标签经冻结 CLIP ViT-B/16 文本编码器 tokenize + 编码;embedding 再过 MLP 投影得到条件向量
c。 - Encoder:ViT 编码”可学习 knowledge buffer + 未掩码视觉 token”的组合;条件向量
c被 prepend 到 buffer 前面引导编码。 - Predictor(解码器):通过相加与 cross-attention 两种方式吸收
c,从 encoder 输出重建视觉 token,产出粗粒度预测z_pred ∈ R^{N×D_dec}(N=256 视觉 token 数)。 - 两级文本融合(论文核心设计):
- Input-level 注入(Predictor 阶段):
c提前偏置去噪动态,让粗重建就带语义意图,backbone 本身保持任务无关。 - Post-predictor cross-attention:predictor 输出后再加一层 cross-attention,用原始文本 embedding
t_emb精修视觉 token 的高分辨率语义细节;输出z_attended与z_pred残差相加得z_fuse1 = z_pred + z_attended(式 1)。随后把z_fuse1与t_emb(扩展到匹配序列长度)拼接,过融合层fuse_proj(投影矩阵W_P ∈ R^{(D_dec+D_enc)×D_dec})投回解码器维度得到z_final(式 2–3)。 - 目标函数层面注入:flow-matching 损失计算前,解码器输出
z再与文本 embeddingt_proj通过 cross-attention 交互,让 transport trajectory 本身被语言语义引导。
- Input-level 注入(Predictor 阶段):
- 论文强调这一放置方式让 predictor 保持”vision-centric”(backbone 任务无关),条件化被显式限定在精修阶段——用于在”条件强度”与”backbone 通用性”之间取得平衡。
数据
- 单一数据集:ImageNet-1K([16] Russakovsky et al.),同时用于类别条件与文本条件训练/评测。
- 文本条件的 caption 来源:ImageNet 图像的文本描述由 Qwen-VL 生成(非人工标注、非独立大规模图文数据集如 LAION/COCO)。
- 分辨率:256×256,训练与评测统一。
- 无 sim-to-real、无 action 标注、无跨数据集 co-training——论文没有在正文引入除 ImageNet-1K 外的第二个数据源。
训练方法
- 双目标联合训练:
- Masked Prediction Loss(JEPA 式):借鉴 MAE/MaskGIT,先将图像 patchify 成视觉 token
v_0,掩码比例采自截断高斯分布(均值 100%、标准差 0.25,最低掩码比例 0.7);context encoder 只处理未掩码 token + 可学习 buffer token + 投影后的类别 CLIP embeddingt_proj;decoder 重建被掩码 token。损失为 EMA 目标编码器一致性目标:L_JEPA = β·‖z − z_EMA‖²₂·mask,β(论文标注为示例值 e.g. 2.0)。 - Conditional Flow Matching Loss:把 flow matching 扩展到(连续)视觉 token 空间,直接用原始文本 embedding 条件化 transport 过程;解码器输出
z与t_proj经 cross-attention 交互后预测干净目标v_0:L_FM = E[‖v̂_0(v_t, t_proj) − v_0‖²₂],仅在被掩码位置(mask=1)计算,聚焦”inpaint 被掩码区域”。为提升稳定性,有效 batch size 额外放大 4 倍。 - 总损失:
L_total = L_FM + λ_jepa · L_JEPA(λ_jepa论文同样只给示例值 e.g. 2.0,非确定超参表)。
- Masked Prediction Loss(JEPA 式):借鉴 MAE/MaskGIT,先将图像 patchify 成视觉 token
- 优化器/超参:AdamW,学习率
1×10⁻⁵,batch size 1024,线性 warmup 100 epoch;flow-matching 损失权重λ=1.0。 - 推理:默认 64 步迭代(auto-regressive/iterative denoising)采样,同一网络在推理时既支持类别条件也支持自由文本生成。
- 消融验证的组件必要性(见评测节):去掉 cross-attention、去掉 flow-matching 前的文本注入、去掉 flow-matching 目标,三者都显著掉点,说明”架构级 + 目标级”两种融合缺一不可。
Infra(训练 / 推理工程)
- 训练卡数、GPU-hours、并行策略:论文未披露(正文完全没有硬件/算力小节)。
- GitHub README 仅说环境兼容性:“We tested our environment on A100, H20 and 4090”——这是代码可运行的硬件清单,不等同于论文实际训练所用的卡型/卡数,故不作为训练算力数字引用。
- 推理 FPS / 延迟 / 边端硬件:未披露(只知道采样步数为 64 步,无 wall-clock 数字)。
- 精度(fp16/bf16 等):未披露。
- 模型权重:截至本次抓取(2026-07-16),GitHub TODO 列表显示”Release JEPA-T model”仍未打勾,权重尚未开源,只有训练/评测脚本(
scripts/cache_vae.sh缓存 VAE 潜变量、scripts/jepat_base/large/huge.sh训练/评测)。
评测 benchmark
Table 1,ImageNet-1K 256×256 主表(FID↓ / IS↑ / Precision↑ / Recall↑,均为论文一手数字):
| 方法 | FID | IS | Pre. | Rec. |
|---|---|---|---|---|
| Stable Diffusion | 4.21 | 185.6 | 0.75 | 0.58 |
| Imagen | 3.98 | 192.4 | 0.76 | 0.59 |
| Parti | 3.75 | 198.7 | 0.77 | 0.60 |
| MaskGIT | 3.50 | 200.5 | 0.78 | 0.61 |
| TokLIP | 3.30 | 202.1 | 0.78 | 0.62 |
| ADM | 4.59 | 186.7 | 0.82 | 0.52 |
| VDM++ | 2.12 | 267.7 | – | – |
| MAGVIT-v2 | 1.78 | 319.4 | – | – |
| LDM-4 | 3.60 | 247.7 | 0.87 | 0.48 |
| U-ViT-H/2-G | 2.29 | 263.9 | 0.82 | 0.57 |
| DiT-XL/2 | 2.27 | 278.2 | 0.83 | 0.57 |
| MDTv2-XL/2 | 1.58 | 314.7 | 0.79 | 0.65 |
| GIVT | 3.35 | – | 0.84 | 0.53 |
| D-JEPA-L(cfg=3.0) | 1.58 | 303.1 | 0.80 | 0.61 |
| MAR-L | 1.78 | 296.0 | 0.81 | 0.60 |
| JEPA-T(本文) | 1.42 | 298.3 | 0.79 | 0.63 |
JEPA-T 在 FID 上全表最优(1.42),Recall 并列/领先(0.63),但 IS、Precision 并非全表最高(MDTv2-XL/2 IS 更高,GIVT Precision 更高)。论文未披露自己这一行结果所用的 classifier-free guidance scale(对照行 D-JEPA-L 明确标了 cfg=3.0,JEPA-T 行没有对应标注),也未说明各 baseline 数字是否复用原论文报告值——这一点原文未交代,读者需自行留意跨论文数字可比性问题。
Table 2,消融(同一组指标):
| 变体 | FID | IS | Pre. | Rec. |
|---|---|---|---|---|
| Full Model | 1.42 | 298.3 | 0.79 | 0.63 |
| w/o Cross-Attn | 1.75 | 198.2 | 0.77 | 0.61 |
| w/o Text-Inj | 1.48 | 200.1 | 0.78 | 0.62 |
| w/o Flow Matching | 1.60 | 190.5 | 0.76 | 0.60 |
去掉 post-predictor cross-attention 对 IS 打击最大(298.3→198.2),去掉 flow-matching 前文本注入对 FID 影响相对最小(1.42→1.48),说明 cross-attention 精修环节是三个组件里贡献最大的一环。
创新点与影响
- 贡献:(1)提出统一的 JEPA 式 T2I backbone,避开扩散的采样开销与自回归的扩展性瓶颈;(2)明确回答”文本该在哪融合”——predictor 之后做 cross-attention + 目标函数层面注入原始文本 embedding,而不复杂化核心架构;(3)自监督训练配方(masked prediction + flow matching)不依赖像素级重建,同一网络同时支持类别条件与开放词表生成。
- 谱系位置:是 D-JEPA(把 JEPA 目标搬进生成式建模)与 TokLIP(tokenization 阶段注入语义)之外,第三种”文本融合点”的探索;本质上是 i-jepa 系”非生成式表征学习”范式向”生成式图像合成”的一次改造/迁枝,与 jepa-predictive 世界模型主线(预测未来观测/表征)目标不同,仅共享”联合嵌入预测”这一结构性组件。
- 论文自陈局限:全文(4 页会议短文格式)没有专门的 Limitations 小节。可观察到的、原文未讨论但读者应注意的边界:仅在单一数据集 ImageNet-1K 上验证(无 LAION/COCO 等大规模图文语料上的结果);文本条件来自 Qwen-VL 生成的合成 caption 而非人工标注;训练算力、推理延迟均未披露;模型权重截至抓取时尚未发布。
原始链接
- arXiv abstract:https://arxiv.org/abs/2510.00974
- arXiv PDF:https://arxiv.org/pdf/2510.00974
- GitHub(代码已开源,权重未开源):https://github.com/justin-herry/JEPA-T
一手源存档(sources/)
- jepa-t-text-to-image—github-readme — GitHub README 快照(环境依赖、TODO 状态、License,fetched 2026-07-16)
- arXiv 全文(HTML v1,2510.00974v1)已通读;PDF 首页用于核对作者机构,原文 PDF 不入 git,见上方 arXiv 链接