正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
联合嵌入预测架构(JEPA)通过预测语义相关视图的嵌入来学习表征,但训练时容易出现表征坍塌。现有方法依赖 stop-gradient、teacher-student 网络、负样本等启发式技巧,这些组件缺乏理论保证,对超参数敏感,且计算复杂度常随 batch 或维度呈二次增长。JEPA 的设计长期停留在经验调参阶段,缺少从第一性原理出发的理论指导。
核心方法
作者首先证明各向同性高斯分布是嵌入空间的最优分布,能最小化下游任务的预测偏差与方差。随后提出 SIGReg(Sketched Isotropic Gaussian Regularization),利用随机方向投影和特征函数匹配,将高维分布对齐问题分解为多个一维统计检验,实现线性复杂度。LeJEPA 将 JEPA 预测损失与 SIGReg 结合,无需 stop-gradient、teacher-student 或负样本,仅用一个超参数控制两项损失的权衡。
实验结论
- ImageNet-1K 上 ViT-H/14 冻结 backbone 线性探测准确率达 更高水平
- Galaxy10 域内预训练在 1-shot 到全监督下均优于 DINOv2/v3 迁移学习
局限性与证据边界
- 论文未提供与 I-JEPA 的直接对比实验数据
- 未明确说明 SIGReg 中随机投影方向数 M 的推荐取值及其对性能的敏感度
- 未在正文中给出 LeJEPA 在视频或序列数据上的实验结果
适合谁阅读
自监督学习研究者表征学习理论研究者基础模型预训练工程师生成模型模型架构
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2511.08544