I-JEPA: Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture
I-JEPA 的核心设计包含两点:一是预测目标在表征空间而非像素空间生成,由目标编码器(指数移动平均更新)提供语义级 target;二是多块遮挡策略,随机采样 4 个尺度 0.15–0.2 的目标块,并用一个尺度 0.85–1.0 且去除重叠区域的上下文块作为输入,保证预测任务非平凡且上下文信息充足。实验在 ImageNet-1K 上以 ViT-H/14 训练 更高水平 epoch,线性探测 Top-1 达 79.3%,1% 半监督达 更高水平,均优于 MAE(77.2% / 71.5%)和 data2vec(77.3% / 更高水平 但需 更高水平 epoch)。在 Clevr 物体计数与深度预测等低层任务上也超过 DINO 和 iBOT。预训练仅需不到 1200 GPU 小时,比 MAE ViT-H/14 快 10 倍以上,比 iBOT ViT-S/16 还少。方法在 ImageNet-22K 上继续受益于数据规模,ViT-G/16 在多个迁移任务上进一步提升。边界在于:目前仅在图像模态验证,且依赖 ViT 架构与 EMA 目标编码器来避免表征坍塌。