正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
联合嵌入预测架构(JEPA)和对比自监督学习是当前无监督视觉表征学习的两大主流范式。JEPA通过潜在空间预测避免像素级重建,而对比学习依赖正负样本对优化表征。两者在目标函数和训练机制上存在显著差异,但它们在表征学习中的内在联系和互补性尚未被系统研究。本文旨在回答:JEPA与对比学习之间是否存在统一的理论框架,以及融合两者优势能否提升视觉表征质量。
核心方法
本文从理论层面分析JEPA的预测目标与对比学习的正负样本机制之间的对应关系,提出将两类方法对齐的统一视角。作者设计了融合策略,在JEPA的掩码预测框架中引入对比学习的负样本对比机制,使模型同时利用潜在空间预测和样本对比两种信号进行表征学习。实验在ImageNet等标准数据集上训练,并通过线性探测和微调评估表征质量。
实验结论
- 融合JEPA与对比学习在ImageNet线性探测和微调上提升表征质量
- 理论分析揭示两类方法在目标函数层面的深层关联与互补机制
局限性与证据边界
- 论文具体提出的融合方法的技术细节(如损失函数设计、负样本采样策略)在节选中未给出
- 具体的实验数值结果(如ImageNet Top-1准确率)未在节选中提供
- 作者所属机构未在输入中明确披露
- 是否在ImageNet之外的数据集(如COCO、ADE20K等下游任务)上进行了评测未确认
适合谁阅读
自监督视觉表征学习研究者关注JEPA或对比学习理论分析的学者视觉预训练方法设计方向视觉模型多模态
可核验的原论文来源和作者
- 作者
- Shentong Mo, Shengbang Tong
- 来源
- arXiv
- 论文 ID
- 2410.19560