一句话定位

S-JEPA(Signal-JEPA)把 i-jepa 的”隐空间预测而非像素重建”范式搬到 EEG 信号上,核心贡献是一个**按电极空间做块遮蔽(spatial block masking)**的预训练策略——不同于此前 EEG 自监督工作只在时间维度上做块遮蔽,S-JEPA 让局部编码器逐通道独立编码,从而能以电极为单位、按空间半径遮蔽一整片电极区域,目标是学到能应对”通道集合变化”的动态空间注意力,服务于跨数据集迁移这一 BCI 长期痛点。这是一篇小规模探索性研究(54 受试者、单一数据集、单机训练几十小时量级),发表于 Graz BCI Conference 2024(DOI 10.3217/978-3-99161-014-4-003)。

背景与定位

EEG 驱动的脑机接口(BCI)长期受限于”每个受试者/每次会话都要重新校准”的数据稀缺问题。掩码式自监督学习(SSL)——遮住部分输入、训练模型预测被遮部分——是缓解这一问题的主流思路,但落到 EEG 上此前的工作要么用掩码自编码器(MAE)直接重建原始信号(Pérez-Velasco 等在空间和时间维度随机遮蔽;Chien 等的 MAEEG 在时间维度做块遮蔽),要么用 JEPA 式隐空间预测但仍只在时间维度做块遮蔽(Kostas 等的 BENDR、Foumani 等的 EEG2Rep)。作者指出 MAE 类方法的通病:EEG 信噪比低、直接在原始空间重建会放大噪声,且难以像 i-jepa 那样在线性探测等”冻结骨干”场景下取得好效果。S-JEPA 的定位是把 v-jepa(Bardes 等 2024 提出的 Revisiting Feature Prediction,本文图 1 的训练流程图直接借鉴其画法)式的目标编码器+EMA+预测器框架,和 BENDR/MAEEG 的卷积局部编码器结合,同时把块遮蔽的维度从”时间”换成”电极空间”——这是本文与既有 EEG-JEPA 工作(BENDR、EEG2Rep)唯一但关键的架构差异。论文本身称其为”探索性研究”(exploratory study),不追求刷新大规模 SOTA,而是回答三个问题:什么样的掩码策略最有效、预训练样本时长如何影响训练动态、什么样的下游微调策略效果最好。

模型架构

局部编码器(Local encoder):5 层卷积神经网络(CNN),每层为卷积 + GELU 非线性。与 BENDR/MAEEG 的局部编码器接受”多通道”输入窗口不同,S-JEPA 的局部编码器逐通道独立处理——这是启用空间块遮蔽的关键改动。每个窗口被编码为 64 维嵌入向量(token)。窗口长度 1.19 秒,步长 1.0 秒;第一层卷积核覆盖 0.25 秒,后续卷积核的时间长度与步长均为 2(即逐层两两合并特征向量)。

上下文编码器(Contextual encoder):标准 Transformer 编码器,8 层(Vaswani et al. 2017 架构)。输入是局部编码器产出的无序 token 序列,需附加位置编码信息以恢复时间和空间位置:时间位置用余弦编码,覆盖 64 维中的前 34 维;空间位置用可训练 embedding,以电极三维坐标的余弦编码初始化。

空间块遮蔽(Spatial Block Masking):由于 EEG 电极在空间上分布不规则,“连续块”的概念不能像图像/时间信号那样直接套用。做法是:随机选一个中心电极,遮蔽该电极预定半径范围内的所有电极对应的全部 token。本文比较了3 档遮蔽直径:约占头部尺寸的 40%、60%、80%(该策略天然导致每次遮蔽的 token 数量不固定)。

S-JEPA 预训练的两个附加组件:(1) 上下文目标编码器(Contextual target encoder)——上下文编码器的非训练副本,不参与梯度反传,参数通过 EMA(指数滑动平均)从上下文编码器更新而来(论文未披露具体 EMA 衰减率数值);(2) 预测器(Predictor)——4 层 Transformer 解码器(同样为 Vaswani et al. 架构),接收未遮蔽 token 生成的上下文表征,预测被遮蔽 token 的目标表征,预测值与目标编码器输出之间用 L1 损失比较。

下游架构(三种,配合两种微调策略):由于逐通道 tokenization 导致隐空间维度接近原始输入维度,直接线性探测效率低,因此额外引入两层——空间聚合(Spatial aggregation)(卷积层,把 C 个真实通道加权合并为 V≪C 个”虚拟通道”)与全连接层(Fully-connected)(预测类别概率)。三种配置:①Contextual——两个新层接在上下文编码器之后;②Post-local——丢弃预训练的上下文编码器,新层直接接在局部编码器输出上;③Pre-local——同样丢弃上下文编码器,但把空间聚合层放在局部编码器之前,相当于在网络最前端做一次空间滤波(BCI 传统流程中常见的空间滤波步骤)。两种微调策略:new-前缀只训练新增层、冻结预训练部分;full-前缀微调整个网络,且先跑 10 epoch 只训练新层的热身阶段,再放开全部参数训练。

数据

预训练与评测数据集:Lee et al. (2019) 的 OpenBMI 数据集(经 MOABB 框架加载),54 名受试者,每人完成 3 种 BCI 范式:稳态视觉诱发电位(SSVEP,4 类)、视觉事件相关电位(ERP)、左右手运动想象(MI)。C=62 个 EEG 通道,带通滤波 0.5–40 Hz,降采样至 128 Hz。受试者划分:前 40 名用于预训练,接下来 7 名用于预训练阶段的验证集,最后 7 名保留用于下游评测。

预训练样本:SSL 不需要标签,训练/验证样本是按固定间隔 16.9 秒切出的连续记录片段。比较了对数尺度分布的 3 档样本时长:1 秒、4 秒、16 秒。所有分配到预训练的受试者、所有 3 种范式的数据被合并使用,共产生 36,576 条训练样本6,528 条验证样本。未做伪迹剔除(no artefact rejection)。

下游评测样本:对每名下游受试者、每种范式,用 5 折受试者内分层交叉验证评估微调性能。样本时长:MI 和 SSVEP 为 4.19 秒,ERP 为 1.19 秒(与原始数据集协议保持一致,同时兼容 tokenization 流程)。全部为真实人体 EEG 记录,无仿真数据、无跨模态 co-training。

训练方法

目标:非生成式隐空间预测(JEPA 范式),L1 损失,预测器基于未遮蔽 token 的上下文表征预测被遮蔽 token 的目标表征。早停规则:预训练阶段验证损失连续 10 epoch 无提升即停止,保存最优 checkpoint 供微调;微调阶段验证损失连续 50 epoch 无提升即停止,恢复最优 checkpoint 做测试。full-微调策略额外有 10 epoch 的热身阶段(只训新层)。预训练实验矩阵:3 档样本时长 × 3 档遮蔽直径的全组合,外加一个不做预训练的基线(baseline 仅用 full 微调评估)。训练动态:16 秒样本时长下的训练曲线明显更平滑;16s-80% 配置因验证损失早期出现低谷而在 12 epoch 提前停止;16s-40% 与 16s-60% 训练时间最长,分别持续 **74 epoch(约 12 小时)**与 58 epoch(约 10 小时)

Infra(训练 / 推理工程)

  • 硬件(GPU 型号/数量):论文未披露。
  • 并行策略 / 混合精度:未披露。
  • GPU-hours:未直接给出,可换算的训练时长信息仅有 16s-40% 配置约 12 小时、16s-60% 配置约 10 小时(均为单次预训练运行的墙钟时间,未注明单卡还是多卡)。
  • 推理 FPS / 控制频率 / 边缘部署:未披露——本文是离线 BCI 解码研究,未评测实时/在线推理延迟或边缘硬件。

评测 benchmark

按范式的最佳流水线(pipeline = 预训练配置 + 下游架构 + 微调策略的组合)

  • ERP:16s-40%-full-pre-local 达到 97% AUC(全场景最佳)
  • SSVEP:16s-60%-new-pre-local 达到 94% 准确率
  • MI:16s-40%-new-pre-local 达到 65% 准确率

与已发表 SOTA 的对比(引用 Chevallier et al. 2024 在 MOABB 上对 Lee2019 数据集全部 54 名受试者、within-session 设置下的黎曼几何方法基准):ERP 98.41±2.03%、SSVEP 89.44±13.84%、MI 84.74±13.19%。本文结果在 ERP 上持平 SOTA、SSVEP 上超过 SOTA、MI 上不及 SOTA——但作者特别指出评测口径不完全可比:本文下游评测只用最后 7 名受试者,而 Chevallier 等人的基准覆盖全部 54 名,且 Lee 原始论文已将这 7 人中的 6 人标记为 MI 任务上”难分类”的受试者,可能是本文 MI 分数偏低的主因。

消融/趋势结论(无法归约为单一数字表格,以下为论文正文陈述的定性结论):

  1. 样本时长影响大:16 秒预训练样本整体表现最好,尤其配合 pre-local 微调架构,在三分之二的评测折中排名第一;但若下游用 Contextual 架构,16 秒预训练模型反而经常掉到随机水平(chance level)。
  2. 遮蔽半径的影响不确定:40%/60%/80% 三档之间未观察到清晰趋势。
  3. 最佳下游架构自带空间滤波:Pre-local(把空间聚合层放在局部编码器之前)在所有测试中表现最好,说明在特征提取前先做线性空间滤波、提升信噪比,对 EEG 解码至关重要。
  4. 使用 Contextual 下游架构、且预训练样本为 16 秒或未做预训练时,SSVEP 上经常降到随机水平;1 秒/4 秒预训练样本配合 Contextual 架构反而好一些,推测是注意力机制的训练窗口与下游任务的短窗口更匹配。

创新点与影响

贡献

  1. 首次把块遮蔽(block masking)策略从”时间维度”扩展到”EEG 电极的空间维度”,通过让局部编码器逐通道独立编码实现,填补了此前 EEG 自监督工作(BENDR、MAEEG、EEG2Rep)只做时间块遮蔽的空白。
  2. 提出并对比三种下游微调架构(Contextual / Post-local / Pre-local),发现在高维、逐通道 tokenization 的隐空间下,传统线性探测并非最优选择,专门设计的空间聚合层更有效。
  3. 在 ERP、SSVEP 两个下游任务上追平/超过已发表的黎曼几何 SOTA 基线(评测样本量小,非严格可比)。

它改变了什么:为 EEG-JEPA 这条线提供了”空间块遮蔽 + 通道级 tokenization”的新设计选项,论证了动态空间滤波(把空间聚合放在网络最前端)对 BCI 解码性能的关键作用,为后续应对”跨数据集通道集合不一致”问题的 EEG 基础模型提供了一个探索性的架构起点。

论文自陈的局限

  1. 这是探索性研究,数据集规模有限(仅 54 名受试者,下游评测仅用其中 7 名),结论的普适性有待更大数据集验证。
  2. 遮蔽半径对下游性能的影响未见清晰趋势,可能是所测半径范围不够优,或存在其他未控制的干扰因素;未来应与时间维度遮蔽做直接对比。
  3. Contextual 下游架构表现不佳,作者认为是 Transformer 需要更大规模数据集才能训练充分,提示未来应转向更大规模数据集以充分发挥上下文编码器的能力。
  4. 未测试遮蔽策略与时间维度遮蔽的组合,也未在多个数据集上验证真正意义上的跨数据集迁移(本文实验全部在单一数据集 Lee2019 内部完成)。

原始链接

一手源存档(sources/)

  • 未额外存档:本文除 arXiv 外未发现官方博客、GitHub、模型卡或项目页;全文见 arXiv HTML(arxiv.org/html/2403.11772v2)/ PDF(arXiv 原文,不入 git):https://arxiv.org/abs/2403.11772