一句话定位

Point-JEPA 把 i-jepa 的”隐空间预测”范式第一次系统搬到点云上:不像 Point-MAE / Point-M2AE 那样在输入空间重建被遮挡的点,而是像 I-JEPA 一样在表征空间预测被遮挡 patch embedding 的语义表征。点云的核心障碍是置换不变性——数据没有自然顺序,无法像图像那样直接切出”空间上连续的一块”。作者为此设计了一个贪心排序器(Greedy Sequencer):按照 patch 中心点的空间邻近关系把 patch embedding 排成一条序列,让相邻索引大概率也空间相邻,从而能用 I-JEPA 式的 block masking 高效采样 context/target。在 ShapeNet 上预训练后,Point-JEPA 在 ModelNet40 线性 SVM 探测(93.7±0.2%)、四种小样本设置全部刷新 SOTA,且预训练只需 7.5 小时(RTX A5500),不到 Point-M2AE 的一半、约 Point2Vec 的 60%。WACV 2025 收录。

背景与定位

点云自监督学习此前主要走两条路:生成式重建(Point-BERT 用离散 VAE token 化再重建、Point-MAE 直接重建被遮挡点 patch、Point-M2AE 做多尺度重建、PointGPT 走自回归生成)和自蒸馏/对比学习(Point2Vec 用教师-学生网络在表征空间做自蒸馏,但仍需较长训练才能收敛到有意义的表征)。论文的初步调查发现,这些方法普遍预训练耗时长(Fig. 1),限制了向更大数据集或更深模型扩展的能力——而这恰恰违背了自监督学习”从海量无标注数据中学强表征”的初衷。

i-jepa 及其视频版 v-jepa 证明了联合嵌入预测架构(JEPA,源自 lecun-path-autonomous-machine-intelligence 的蓝图)能以更高效率学到强语义表征——预测发生在表征空间而非输入空间,剔除了无关的低层细节。但把 JEPA 直接搬到点云上有一个图像/视频没有的难题:点云是无序集合,对 N 个点的 N! 种排列都表示同一个物体,这意味着不能像 I-JEPA 那样简单假设”索引相邻⇒空间相邻”去采样空间连续的 context/target block。Point-JEPA 正是为解决这个障碍而设计,其贡献是在 JEPA 框架里插入一个排序步骤,而非改动 JEPA 本身的预测目标。

模型架构

Backbone:AR-transformer 式的标准 Transformer(非 RSSM/扩散),由 context encodertarget encoder(EMA 更新,不接收梯度)与predictor 三部分组成,结构与 I-JEPA 同构;JEPA 运算作用在embedding 而非原始 patch 上,使 context/target encoder 共享同一个点编码器(沿用 Point2Vec 的做法)以提高效率。

Point Cloud Patch Embedding(tokenizer):给定点云对象 P(n 个点),先用**最远点采样(FPS)**取 c=64 个中心点,再用 KNN 在每个中心点周围取 k=32 个最近邻点组成 patch;patch 内坐标减去中心点坐标做局部归一化(分离结构信息与位置信息)。用一个 mini-PointNet(两组”共享 MLP + max-pool”)把每个 patch 编码为一个 patch embedding,保证对 patch 内点的排列不变。

Greedy Sequencer(论文核心创新,Algorithm 1):在 patch 化之后、送入 JEPA 之前插入一步排序。从坐标和最小的中心点(物体边缘附近的点)出发,每步选择与上一个已选中心点欧氏距离最近的下一个中心点,迭代直到访问完所有中心点,得到一个”索引相邻⇒大概率空间相邻”的序列。该算法按批并行化(一次前向算完 batch 内所有点对距离,再同步迭代选点),在现代 GPU 上比 z-order/Hilbert 曲线更快。消融显示起点选”坐标和最小”(在物体边缘)比选”数据 feeding 顺序里第一个点”效果更好。

Context 与 Target:target 是target-encoder 输出(已编码的表征)上的掩码——随机采 M=4 个可重叠的空间连续 block,ratio 范围 (0.15, 0.2);这一步在编码器输出上而非原始 patch 上做,是保证 target 语义层级高的关键(沿用 I-JEPA 设计)。Context 则是patch embedding(编码前)上的掩码:先选一个空间连续的 patch embedding 子集,再剔除与所有 target block 重叠的索引,剩余部分喂给 context encoder;因为要避开多个 target block,context 常由多段空间连续的 patch 拼成。Context ratio 范围 (0.4, 0.75)

Predictor:更窄的 Transformer,depth=6, width=192, heads=6(沿用 I-JEPA 的窄 predictor 设计);输入是 context 表征加上由共享可学习参数 + target 中心点位置编码构成的 mask token,对每个 target block 单独预测。

主干配置数字(ShapeNet 预训练):中心点数 c=64、group size k=32、输入点数 1024/对象;context/target encoder depth=12、embedding width=384、6 heads;predictor depth=6、width=192、6 heads。

Loss:Smooth L1(β=2,沿用 Point2Vec 设定),衡量预测表征与 target-encoder 输出表征的逐元素差异,对离群值更不敏感。

参数更新:context encoder 走反向传播;target encoder 走 context encoder 参数的指数滑动平均(EMA),衰减率在预训练中从 0.995 线性升到 1.0

数据

  • 预训练:ShapeNet 训练集,41,952 个 3D 点云实例,来自 55 个类别的合成 3D mesh,无外部数据、无手工数据增强(与 Point-MAE/Point2Vec 等同源对比)。
  • 下游数据集
    • ModelNet40:12,311 个合成 3D 物体,40 类;线性探测/微调均用 1024 点/对象。
    • ScanObjectNN:15 类,共 2,902 个真实世界扫描实例(sim→real 迁移评测);端到端微调用全部 2048 点/对象,128 个中心点、32-NN patch。
    • ShapeNetPart:16,881 个物体,16 类,用于部件分割。
  • 动作标注 / co-training:不适用(静态点云分类/分割任务,无动作条件、无跨模态 co-training)。
  • 仿真 vs 真实:预训练与线性/few-shot 评测均在合成数据(ShapeNet/ModelNet40)上,仅端到端微调阶段引入真实扫描数据(ScanObjectNN)检验 sim→real 迁移。

训练方法

  • 目标函数:单一的表征空间 Smooth L1 距离(β=2),非生成、非对比,无像素/点重建、无负样本。
  • 流程:单阶段自监督预训练(ShapeNet)→ 下游任务特定评测(线性 SVM 探测 / 端到端微调 / few-shot),无 RL、无蒸馏阶段。
  • 优化器:AdamW + cosine 学习率衰减;学习率从 1e-5 在前 30 epoch 增至 1e-3,再 cosine 衰减到 1e-6;预训练 batch size 512
  • Masking 策略消融(Table 4/主表):单 block 随机掩码 (ratio 0.6,0.6) → 92.5;单 block 空间连续掩码 (0.6,0.6) → 92.3;本文的多 block 策略(target ratio 0.15–0.2、freq=4;context ratio 0.4–0.75)→ 93.7——多 block、更小 target、更高频率的组合明显更优。
  • Sequencer 消融(Table 6):z-ordering(PointGPT 式)93.4 acc / 8.30h;Hilbert-ordering 91.8 / 10.78h;Greedy(最小索引起点) 92.7 / 7.47h;Greedy(最小坐标和起点) 93.7 / 7.47h——本文方案同时拿到最高精度和最快训练时间。
  • Predictor 深度消融:depth 2→92.5,3→92.8,4→93.2,5→93.4,6→93.7(单调递增,更深 predictor 更好)。
  • Target block 数量消融:freq 1→93.0,2→93.5,3→93.4,4→93.7,5→93.4,6→93.2(4 为最优点,过多反而context 信息不足)。
  • Target ratio 消融(附录):(0.1,0.2)→93.0,(0.15,0.2)→93.3,(0.2,0.25)→93.2,(0.25,0.3)→92.4,(0.3,0.35)→90.5,(0.35,0.4)→84.6——target 过大会急剧损害性能。
  • Context ratio 消融(附录):多组 (0.85,1.0)→93.1 … 最优 (0.4,0.75)→93.7——上下界差距更大(更高训练时方差)反而有利,且上界不宜过高。

Infra(训练 / 推理工程)

  • 预训练硬件:Compute Canada Narval 集群,NVIDIA A100 SXM4(CUDA 11.4,README);论文正文合并表述为 “NVIDIA RTX A5500 and NVIDIA A100 SXM4”。
  • 下游微调硬件:另一台服务器,RTX A5500(README 简写 “RTX 5500”,CUDA 11.8)。
  • 预训练时长7.5 小时(RTX A5500)——不到 Point-M2AE 的一半、约为 Point2Vec 所需时间的 60%(正文 4.1 节明确对比)。
  • 并行 / 精度:论文未披露具体数据并行策略或混合精度设置;批大小 512。
  • 推理 FPS / 控制频率 / 边缘部署:不适用——本文是离线点云表征学习模型,非实时控制场景,论文未给出推理速度或边缘硬件评测。

评测 benchmark

以下数字均来自论文正文表格(自监督预训练 + 下游评测,10 次独立随机种子跑均值±标准差,除非另注)。

ModelNet40 线性 SVM 探测(Table 1,冻结 context encoder + max/mean pool + SVM 分类头,1024 点)

方法Overall Accuracy
Latent-GAN85.7
3D-PointCapsNet88.9
STRL90.3
Sauder et al.90.6
Fu et al.91.4
Transformer-OcCo*89.6
Point-BERT*87.4
Point-MAE*90.0
Point-M2AE92.9
CluRender**93.2
Point-JEPA (Ours)93.7 ± 0.2

要点:比此前 SOTA Point-M2AE 提升 +0.8%。

端到端微调(Table 2)

方法ModelNet40 +VotingModelNet40 −VotingScanObjNN OBJ-BGOBJ-ONLYOBJ-T50-RS
Point-BERT93.292.787.488.183.1
Point-MAE93.893.290.088.385.2
Point-M2AE94.093.491.288.886.4
Point2Vec94.894.791.290.487.5
PointGPT-S94.091.690.086.9
PointDiff93.291.987.6
Point-JEPA (Ours)94.1 ± 0.193.8 ± 0.292.9 ± 0.490.1 ± 0.286.6 ± 0.3

要点:ScanObjNN OBJ-BG(含背景,最贴近真实场景)上 +1% 超过此前所有 SSL 方法(含扩散式 PointDiff);OBJ-ONLY/OBJ-T50-RS 上略低于 PointDiff。

Few-shot 学习(Table 3,ModelNet40, m-way n-shot,10 折 × 10 次随机种子)

方法5-way 10-shot5-way 20-shot10-way 10-shot10-way 20-shot
Point-BERT94.6 ± 3.196.3 ± 2.791.0 ± 5.492.7 ± 5.1
Point-MAE96.3 ± 2.597.8 ± 1.892.6 ± 4.195.0 ± 3.0
Point-M2AE96.8 ± 1.898.3 ± 1.492.3 ± 4.595.0 ± 3.0
Point2Vec97.0 ± 2.898.7 ± 1.293.9 ± 4.195.8 ± 3.1
PointGPT-S96.8 ± 2.098.6 ± 1.192.6 ± 4.695.2 ± 3.4
CluRender**97.2 ± 2.398.4 ± 1.393.7 ± 4.096.0 ± 2.9
Point-JEPA (Ours)97.4 ± 2.299.2 ± 0.895.0 ± 3.696.4 ± 2.7

要点:四种设置全部 SOTA,最难的 10-way 10-shot 上 +1.1%(低数据场景下代表性最强)。

部件分割(ShapeNetPart,16 类 16,881 物体)

方法mIoU_CmIoU_I
Transformer-OcCo83.485.1
Point-BERT84.185.6
Point-MAE84.186.1
Point-M2AE84.986.5
Point2Vec84.686.3
PointGPT-S84.186.2
Point-JEPA (Ours)83.9 ± 0.185.8 ± 0.1

要点:分割任务上 Point-JEPA 略逊于 Point-M2AE 等方法——论文将其归因于所学表征偏”全局特征”,见下节自陈局限。

创新点与影响

贡献

  1. 首次把 JEPA(联合嵌入预测架构)系统迁移到点云域,证明”在表征空间预测被遮挡 patch 的语义表征”这条路在点云上同样可行且高效,避开了 Point-BERT/Point-MAE/PointGPT 等生成式方法固有的输入空间重建开销。
  2. 贪心排序器(Greedy Sequencer):解决了点云置换不变性与 JEPA 式空间连续 block 采样之间的根本冲突,且比已有的空间填充曲线排序方法(z-order、Hilbert)同时更快、精度更高(Table 6:7.47h/93.7 vs 8.30h/93.4 vs 10.78h/91.8)。
  3. 系统消融证明起点选择(坐标和最小、位于物体边缘)、target/context ratio、target block 数量、predictor 深度等设计选择对最终表征质量有显著影响,为后续点云 JEPA 变体提供了可复用的超参配方。
  4. 在 ModelNet40 线性探测与全部四种 few-shot 设置上刷新 SOTA,同时预训练时间比 Point-M2AE 快 2 倍以上、比 Point2Vec 快约 40%,验证了 JEPA 范式在点云上同样具备”效率与语义表征兼得”的优势。

它改变了什么:把 I-JEPA/V-JEPA 代表的”非生成式隐空间预测”范式扩展到了点云这一置换不变、无自然序的模态,说明 JEPA 的核心思想(不重建输入、只在表征空间预测)可以通过针对模态特性设计一个排序/位置化前置步骤来迁移,这一思路后续也在 Brain-JEPA(fMRI)等工作中重演。

论文自陈的局限

  • 在部件分割任务上表现弱于分类/few-shot(mIoU_C/I 83.9/85.8,低于 Point-M2AE 的 84.9/86.5),论文认为这反映了 Point-JEPA 学到的表征偏重全局特征、弱于局部特征
  • Point-JEPA 处理更大规模点云的有效性尚不确定,原因是大规模点云数据中存在冗余区域,论文明确指出”需要进一步研究”。

原始链接

一手源存档(sources/)

  • point-jepa—github-readme — Ayumu-J-S/Point-JEPA README 快照,含模型库表与训练环境说明(sources/world-model/2024/point-jepa—github-readme.md)
  • 论文全文见 arXiv HTML(arxiv.org/html/2404.16432)/ PDF(arXiv 原文,不入 git):https://arxiv.org/pdf/2404.16432