一句话定位
T-JEPA(Tabular-JEPA)把 i-jepa 的”隐空间掩码预测”范式系统搬到表格(tabular)数据上:不像大多数表格 SSL 方法(VIME、Scarf、SubTab)那样依赖手工数据增强或原始空间重建,而是从一个特征子集的表征直接预测另一个非重叠特征子集的表征。论文额外发现了一个此前 I-JEPA/V-JEPA 都不需要的现象——不加正则化 token([REG]),T-JEPA 训练会陷入表征坍缩,这是本文的另一项经验性贡献。在 6 个表格基准(Adult/Higgs/Helena/Jannis/ALOI/California Housing)上,T-JEPA 预训练让 ResNet 等简单架构在分类任务上整体持平或超过 XGBoost/CatBoost 等梯度提升树。
背景与定位
表格数据自监督学习长期面临一个图像/文本领域不存在的障碍:难以构造有意义的数据增强。图像可以裁剪/旋转/变色,文本可以做 token 掩码/替换,但表格特征异质(数值+类别混合),任意扰动都容易生成脱离数据流形的样本。此前的表格 SSL 路线大致分两类:一类需要显式增强或原始空间重建,如 VIME(掩码向量估计 + 重建)、Scarf(随机特征扰动做对比学习)、SubTab(切分特征子集做类掩码重建)、XTab/TransTab/UniTabE(跨表预训练);另一类走原型/分箱路线,如 PTaRL(原型学习)、Lee et al. 2024 的 BinRecon(把特征值分箱后重建 bin 索引而非原始值)。
论文沿用 Assran et al. 2023(i-jepa)对自监督方法的三分类——联合嵌入架构(JEA)、生成式架构(原始空间重建)、联合嵌入预测架构(JEPA,隐空间重建)——并指出 JEPA 此前只被验证于图像(I-JEPA)、视频(v-jepa)、音频、图(Skenderi et al. 2023)等模态,尚未系统用于表格数据。T-JEPA 延续 Thimonier et al. 2024 与 Kossen et al. 2021 提出的”掩码重建对表格表征学习有效”的发现,把重建目标从原始特征空间搬到隐空间,从而完全绕开为表格数据设计增强这一难题。注:论文使用的”T-JEPA”命名与其他同名工作(如某些”T-JEPA”指代其他领域)无关,本文特指这篇 Tabular-JEPA。
模型架构
整体结构:AR-transformer 式的标准 Transformer(非 RSSM/扩散),由 context encoder、target encoder(EMA 更新,无梯度)和predictor 三部分组成,结构与 I-JEPA 同构,但作用对象是表格特征的 tokenized 表示而非图像 patch。
特征嵌入层(tokenizer):数值特征归一化为 0 均值单位方差($e_j=1$ 维);类别特征做 one-hot($e_j$=类别数)。每个特征 $j$ 都配一个独立学习的线性层 $\text{Linear}(e_j, h)$ 把其嵌入到统一的隐维 $h$;再加上学习到的位置(index)嵌入与特征类型嵌入。
正则化 Token [REG](论文核心经验性发现之一):借鉴 ViT 的 register token(Darcet et al. 2024),把一个可学习 token 拼接到样本嵌入表示上,只在 T-JEPA 训练时使用,下游监督训练时丢弃。消融显示:不加 [REG] token,T-JEPA 训练在若干 epoch 后 loss 会坍缩到接近 0(representation collapse)且无法逃逸;加入该 token 后模型能推出坍缩、走向非平凡的稳定训练区间。作者复现了 I-JEPA 官方代码在 ImageNet-1K(batch size 缩小到 16,其余超参不变)上,观察到相同的初始坍缩现象,说明这是 EMA+stop-gradient JEPA 训练机制的共性问题,而 [REG] token 是本文针对表格数据经验性发现的解法。
Masking 策略:context mask 与 target mask 分别独立采样,二者不重叠,但同一类内(多个 context mask 之间、多个 target mask 之间)允许重叠;[REG] token 从不被掩码。Context encoder 只接收未被掩码的特征表示 $z_x^m$(维度随掩码比例变化);target encoder 接收全部未掩码的嵌入 $z_x^{0_d}$(掩码在编码后再应用于输出表示上)。
Predictor:Transformer,隐维通过线性层从编码器维度下采样;输入为 context encoder 对某个 context mask 的输出 $h_{context}^{m_j}$ 与一个 target mask $m_k$(target 位置用可学习向量+位置嵌入参数化的 mask token 表示);每个 context 输出要对 $|M_{target}|$ 个不同 target mask 各过一遍 predictor。训练全程固定使用 4 个预测(target)mask(论文原文明确的唯一固定计数;context mask 数量论文未给出具体值)。
损失函数:预测表示 $g_\phi(h_{context}^m, m_k)$ 与真实 target 表示 $h_{target}^{m_k}$ 的 $\ell_2$ 距离,对所有 context mask × target mask 组合求平均(式 5)。
参数更新:context encoder 走标准反向传播;target encoder 走 context encoder 权重的指数滑动平均(EMA),衰减率训练中从 0.996 升至 1。
超参搜索空间(Bayesian optimization,非最终逐数据集定值,论文未公布逐数据集最终配置表):model_num_heads∈{2,4,8};model_dim_hidden∈{2,4,8,16,32,64,128};model_num_layers∈{1..8,16};model_dim_feedforward∈{64,128,256,512,768,1024};model_dropout_prob∈(0,0.01);exp_lr∈(1e-5,1e-3);mask_min_ctx_share∈(0.07,0.15)、mask_max_ctx_share∈(0.2,0.9);mask_min_trgt_share∈(0.05,0.20)、mask_max_trgt_share∈(0.2,0.9);predictor 侧 pred_num_layers∈{2,4,8,16,24,32}、pred_embed_dim∈{4,8,16,32,64,128}、pred_num_heads∈{2,4,8}、pred_p_dropout∈(0,0.01)。批大小固定为 512(所有数据集统一)。可见搜索空间上限也很小(隐维最高仅 128),模型规模远小于 LLM 级别;论文未披露最终选中配置的具体参数量。
数据
- 预训练数据:均为同数据集内自监督(无跨表预训练),采用与 Ye et al. 2024(PTaRL)一致的 6 个异质表格数据集:
- Adult (AD):48,842 样本,6 数值 + 8 类别特征,二分类。
- Higgs (HI):98,050 样本,28 数值特征,二分类。
- Helena (HE):65,196 样本,27 数值特征,100 类多分类。
- Jannis (JA):83,733 样本,54 数值特征,4 类多分类。
- ALOI (AL):108,000 样本,128 数值特征,1000 类多分类。
- California Housing (CA):20,640 样本,8 数值特征,回归任务(RMSE)。
- 每个数据集按 80/10/10 切分训练/验证/测试,验证集同时用于 T-JEPA 超参搜索(线性探测)与下游模型超参搜索。
- 无数据增强:核心卖点即”augmentation-free”,掩码替代增强来构造 context/target 视图。
- 动作标注 / sim-vs-real / co-training:不适用(静态表格分类/回归任务,无动作条件、无跨模态协同训练)。
训练方法
- 两阶段流程:(1) T-JEPA 自监督预训练(在训练集上),用线性探测在验证集上做贝叶斯超参搜索选出每个数据集的最佳配置;(2) 用训练好的 context encoder 生成的表示去训练下游深度分类器/回归器(MLP、DCNv2、ResNet、AutoInt、FT-Transformer),中间加一层投影层(linear flatten / linear per-feature / 卷积投影 / max pooling / mean pooling 五选一,与下游任务联合训练)把 T-JEPA 输出的 $h\in\mathbb{R}^{d\times h}$ 表示对齐到各模型的输入维度。
- 优化器:AdamW + cosine annealing 学习率调度($\eta_{min}=0$)。
- 稳健性验证:下游实验重复 20 次独立运行,报告均值±标准差。
- 无 RL、无蒸馏、无显式 action tokenization(不适用于表格数据)。
- 该方法本质是**非对比(non-contrastive)**自监督:无负样本,仅靠 EMA+stop-gradient+[REG] token 正则化来避免坍缩。
Infra(训练 / 推理工程)
- 硬件:单张 NVIDIA (HGX) A100 GPU,40GB 显存(Appendix A.1/B 均确认为单卡训练,无分布式/多卡并行披露)。
- 精度:未披露(论文未提及 fp16/bf16/混合精度设置)。
- T-JEPA 预训练 GPU 小时数(Table 5,Appendix B,逐数据集):AD 0.84、HI 1.80、HE 1.03、JA 1.27、AL 3.64、CA 0.34 GPU-hours(6 个数据集合计约 8.9 GPU-hours)。差异主要反映数据集样本量与特征维度的复杂度。
- 推理 FPS / 控制频率 / 边缘硬件:不适用——这是离线表格表示学习的预训练模型,非实时控制场景,论文未给出推理速度评测。
- 软件栈(Table 3):Python 3.12.2、PyTorch 2.3.0、pytorch_lightning 2.2.1、scikit-learn 1.4.1、xgboost 2.1.1 等。
评测 benchmark
主表(Table 1,6 数据集 × 5 架构 + T-JEPA 增强 vs. GBDT,分类用 Accuracy↑,CA 用 RMSE↓)
| 模型 | AD↑ | HE↑ | JA↑ | AL↑ | CA↓ | HI↑ | Wins(/6) |
|---|---|---|---|---|---|---|---|
| MLP | 0.825 | 0.352 | 0.672 | 0.917 | 0.518 | 0.681 | 1 |
| +T-JEPA | 0.866 | 0.400 | 0.728 | 0.961 | 0.468 | 0.517 | 5 |
| DCNv2 | 0.826 | 0.340 | 0.662 | 0.905 | 0.502 | 0.681 | 1 |
| +T-JEPA | 0.861 | 0.399 | 0.723 | 0.955 | 0.420 | 0.525 | 5 |
| ResNet | 0.813 | 0.354 | 0.666 | 0.919 | 0.537 | 0.682 | 0 |
| +T-JEPA | 0.865 | 0.401 | 0.718 | 0.964 | 0.441 | 0.705 | 6 |
| AutoInt | 0.823 | 0.338 | 0.653 | 0.894 | 0.507 | 0.685 | 1 |
| +T-JEPA | 0.866 | 0.351 | 0.710 | 0.938 | 0.448 | 0.517 | 5 |
| FT-Trans | 0.827 | 0.363 | 0.675 | 0.913 | 0.486 | 0.689 | 1 |
| +T-JEPA | 0.864 | 0.384 | 0.708 | 0.921 | 0.444 | 0.551 | 5 |
| XGBoost | 0.874 | 0.368 | 0.720 | 0.951 | 0.462 | 0.729 | N/A |
| CatBoost | 0.873 | 0.381 | 0.721 | 0.946 | 0.430 | 0.726 | N/A |
要点(论文原文数字):
- 分类任务上除 Higgs(HI,仅 ResNet+T-JEPA 提升)外,T-JEPA 对全部模型全部提升;平均提升幅度(排除 HI / 含 HI):MLP +6.8%/+0.7%,DCNv2 +7.5%/+1.4%,ResNet +7.1%/+6.4%,AutoInt +5.8%/−0.32%,FT-Transformer +3.6%/−1.1%。
- 回归任务(CA)上 T-JEPA 对全部模型都降低了 RMSE:MLP 改进 9.7%,DCNv2 16.3%,ResNet 17.9%,AutoInt 11.7%,FT-Transformer 8.6%(原文数字,正文表述为”MSE improved”但对应指标定义为 RMSE,可能是原文笔误)。
- ResNet+T-JEPA 综合最强(6 个数据集中 6 个都优于其对应 baseline,且在多数数据集上超过 XGBoost/CatBoost),呼应 Gorishniy et al. 2021b 与 Zabërgja et al. 2024 关于”ResNet 是 GBDT 有力替代”的结论。注意力型架构(FT-Transformer、AutoInt)虽被 T-JEPA 提升,但提升幅度不及 ResNet/MLP,作者推测 T-JEPA 更契合结构简单模型的归纳偏置。
与其他表格 SSL 方法对比(Appendix E Table 6):额外对照 PTaRL(原型学习)、SwitchTab、BinRecon、VIME。PTaRL 在 AD/JA/AL/HI 部分列上数字略高于 T-JEPA(AD 上 PTaRL 0.862–0.871 vs T-JEPA 0.861–0.866),但论文指出 PTaRL 未报告方差、且计算复杂度显著高于 T-JEPA,二者定位不完全可比;SwitchTab(如 AD 0.867、HE 0.387)、BinRecon(AD 0.846、CA 0.619,明显偏弱)、VIME(AD 0.859、CA 0.467)在多数列上不及 T-JEPA 增强后的模型。
表征空间分析:用 Kullback-Leibler 散度、uniformity score(Wang & Isola 2020)、intra/inter-feature 方差刻画表征演化(Table 2,以 Jannis 数据集为例,epoch 0→120):$\sigma_{inter}^2$ 从 0.65 降到 0.07(特征专门化),uniformity 从 3.12/0.94(先降后升,对应初始坍缩)升到 11.38,说明训练后期表征利用了更充分的表示空间。特征重要性验证:T-JEPA 隐空间的特征嵌入方差排名与 XGBoost 特征重要性排名的 Kendall’s τ = 0.44(p = 1.73e-6),说明 T-JEPA 在无标签监督下学到的高方差特征与监督方法认定的重要特征高度相关。
创新点与影响
贡献
- 首次把 I-JEPA 代表的”隐空间掩码预测、无需数据增强”范式系统迁移到表格数据领域,绕开了 VIME/Scarf/SubTab 等方法依赖增强或原始空间重建的固有限制。
- 正则化 Token([REG]):经验性发现——EMA + stop-gradient 对图像 JEPA(I-JEPA)已足以避免表征坍缩,但表格 JEPA 训练仍会坍缩,需额外拼接一个可学习正则化 token 才能逃逸初始坍缩区间;论文通过复现 I-JEPA 官方代码在 ImageNet-1K 上对照验证了这一现象的普遍性与差异性。
- 证明 T-JEPA 预训练可以让 ResNet、MLP 等结构简单的深度模型在表格分类/回归任务上持平或超过 XGBoost/CatBoost,对”表格数据上树模型总是赢”这一常见结论提出反例。
- 通过 KL 散度/uniformity/特征方差等指标及与 XGBoost 特征重要性的 Kendall τ 相关性分析,定量论证了 T-JEPA 在无监督条件下学到了对下游任务有用的特征结构。
它改变了什么:把 JEPA 家族(I-JEPA→V-JEPA→…)的”预测发生在表征空间而非输入空间”这一核心思想扩展到了表格这一没有自然空间/时间连续性、难以构造增强的模态,说明该范式可以通过针对模态设计合适的掩码/正则化策略(而非改动 JEPA 主体框架)来迁移——这一思路与 Point-JEPA(点云)、Brain-JEPA(fMRI)等同期工作呼应,共同构成 JEPA 向非图像模态扩展的一批工作。
论文自陈的局限
- 所得表示”最适配 transformer 类下游架构”,若要用于其他架构类型仍需额外适配工作。
- 论文承认对”为什么非对比自监督学习有效”缺乏理论解释,将其列为未来工作方向。
- 未探索将 JEPA 式重建用作表格异常检测的预训练目标(列为未来可能扩展)。
原始链接
- 论文(arXiv 2410.05016,v1 2024-10-07,v3 修订于 2025-05-03):https://arxiv.org/abs/2410.05016
- PDF:https://arxiv.org/pdf/2410.05016
- 官方代码:https://github.com/jose-melo/t-jepa
- HF / ModelScope / 项目主页:均未找到官方发布(论文与 GitHub 仓库中均无相关链接)
一手源存档(sources/)
- t-jepa-tabular—github-readme — jose-melo/t-jepa README 快照,含代码结构、安装/运行方式与结果表(sources/world-model/2024/t-jepa-tabular—github-readme.md)
- 论文全文见 arXiv HTML(arxiv.org/html/2410.05016v1)/ PDF(arXiv 原文 PDF,不入 git):https://arxiv.org/pdf/2410.05016