I-JEPA: Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture
I-JEPA 的核心设计包含三点:使用目标编码器的指数移动平均在表示空间生成预测目标;采用多块掩码策略,采样 4 个尺度 0.15–0.2 的目标块,并用一个尺度 0.85–1.0 的上下文块(去除与目标重叠区域)进行预测;预测器以窄 ViT 加位置掩码 token 条件化输出。实验在 ImageNet-1K 上以 ViT-H/14 训练 300 epoch,线性探测 Top-1 达 79.3%,1% 半监督表现均优于 MAE 和 data2vec,且在 CLEVR 物体计数与深度预测等低层任务上超越 DINO 和 iBOT。训练效率方面,ViT-H/14 仅需不到 1200 GPU 小时,比 MAE 同等模型快 10 倍以上,比 iBOT 的 ViT-S/16 还少。方法在更大数据集 ImageNet-22K 和更大模型 ViT-G/16 上继续展现扩展性。