正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前视频自监督学习通常依赖在图像上预训练的编码器,或采用像素级重建与对比学习等目标,这些做法要么引入额外模态先验,要么迫使模型关注高频细节而忽略高层时空结构。本文关注的问题是:能否仅使用特征预测这一独立目标,从视频中直接学习有效的视觉表征,而不借助任何图像预训练或像素级解码。
核心方法
V-JEPA 在潜在空间中对视频块进行遮蔽,并训练模型预测被遮蔽块的特征表示,而非重建原始像素。整个训练流程不使用预训练图像编码器,也不包含解码器,仅依赖特征预测目标驱动表征学习。该方法可直接应用于不同规模的视频数据集与视觉架构。
实验结论
- 在 Kinetics-400 与 Something-Something V2 上,V-JEPA 的线性探测与微调性能达到或超过现有自监督方法
- 无需图像预训练编码器或像素级解码器,仅依赖特征预测目标即可完成视频表征学习
局限性与证据边界
- 具体使用的视频数据集规模与预训练时长未在节选正文中给出
- 各基准上的具体数值结果与对比方法列表未在节选正文中给出
- 模型架构细节(如 ViT 变体、参数量)未在节选正文中给出
- 作者所属机构未在输入中明确披露
适合谁阅读
视频表征学习研究者自监督与掩码建模方向研究者关注多模态预训练范式的工程师视觉模型多模态
可核验的原论文来源和作者
- 作者
- Adrien Bardes, Quentin Garrido, Jean Ponce, Xinlei Chen, Michael Rabbat, Yann LeCun, Mahmoud Assran, Nicolas Ballas
- 来源
- arXiv
- 论文 ID
- 2404.08471