论文解决了什么问题
当前图像自监督学习主要有两条路线:基于视图不变性的方法依赖手工数据增强(如随机裁剪、颜色抖动),虽能学到高语义表征,但引入了强归纳偏置,难以泛化到需要不同抽象层级的下游任务或其他模态;基于生成的方法(如 MAE)在像素或 token 空间重建缺失内容,虽无需手工增强,但学到的表征语义层级偏低,线性探测和少样本迁移表现不及对比学习方法,通常需要端到端微调才能发挥优势。如何在不依赖手工增强的前提下学到高语义、可直接使用的图像表征,是本文要回答的核心问题。
核心方法
I-JEPA 在抽象表示空间而非像素空间进行预测。给定一张图像,先用目标编码器(上下文编码器的指数移动平均)提取所有 patch 的表征,再从中随机采样 4 个尺度 0.15–0.2、长宽比 0.75–1.5 的目标块作为预测目标。上下文块尺度为 0.85–1.0,去除与目标块重叠区域后送入上下文编码器(ViT)。预测器是一个窄 ViT,接收上下文编码输出和带位置编码的可学习掩码 token,输出目标块的表征预测,损失为 L2 距离。整个流程只处理单视图,无需任何手工数据增强。
方法与已有工作的区别
有原文依据相比 MAE 在像素空间重建缺失 patch,I-JEPA 在表示空间预测,线性探测 Top-1 从 77.2% 提升至 79.3%(同为 ViT-H/14),且训练 epoch 从 1600 降至 300。相比 data2vec 使用在线目标编码器预测缺失 patch 表征,I-JEPA 在相同 ViT-L/16 架构下线性探测从 77.3% 提升至 77.5%,且训练 epoch 从 1600 降至 600。相比 iBOT 和 DINO 等依赖多视图手工增强的方法,I-JEPA 仅需单视图,ViT-H/14 的计算量甚至低于 iBOT 的 ViT-S/16。
实验结论
- I-JEPA ViT-H/14 在 ImageNet-1K 线性探测 Top-1 达 79.3%,优于 MAE ViT-H/14 的 77.2% 和 data2vec ViT-L/16 的 77.3%
- I-JEPA ViT-H/14 在 1% ImageNet-1K 半监督评估中表现优于 MAE ViT-H/14
- I-JEPA ViT-H/14 在 CLEVR 物体计数任务上线性探测达 86.7%,超越 DINO ViT-B/8 的 86.6% 和 iBOT ViT-L/16 的 85.7%
- I-JEPA ViT-H/14 在 CLEVR 深度预测任务上线性探测达 72.4%,大幅超越 DINO ViT-B/8 和 iBOT ViT-L/16
- 在 ImageNet-22K 上预训练的 ViT-G/16 在 iNat18 迁移任务上线性探测达 55.3%,优于 ImageNet-1K 预训练 ViT-H/14 的 47.6%
局限性与证据边界
- 目标块尺度需足够大(0.15–0.2)以保证语义层级,过小可能导致表征退化
- 上下文块需足够大且信息丰富(0.85–1.0),过小或过于局部可能导致预测任务过于简单或无法学到有效表征
- 原文未明确披露 I-JEPA 在密集预测任务(如语义分割、目标检测)上的端到端微调性能边界
- 原文未明确披露 I-JEPA 在密集预测任务(如语义分割、目标检测)上的端到端微调性能
- 原文未明确披露 I-JEPA 在非图像模态(如音频、视频)上的实验结果
适合谁阅读
可核验的原论文来源和作者
- 作者
- Assran, Mahmoud, Duval, Quentin, Misra, Ishan, Bojanowski, Piotr, Vincent, Pascal, Rabbat, Michael, LeCun, Yann, Ballas, Nicolas
- 来源
- arXiv
- 论文 ID
- 2301.08243