InsightXiv 专题 返回 Feed
Research Topic 01 · Joint Embedding Predictive Architecture

JEPA:从表征预测走向可规划的世界模型

JEPA(联合嵌入预测架构)是一类让模型通过“预测表征”来理解世界的自监督学习方法,目标是学到能够支持识别、推理和行动的内部世界模型。它要解决的核心问题是:图像、视频和声音中包含大量随机细节,如果要求模型逐一重建像素或 token,训练资源会被消耗在颜色、纹理和噪声上,学到的表示也未必适合判断物体如何变化或行动会带来什么后果。JEPA 的做法是先把已知内容和待预测目标编码到潜在空间,再让预测器根据上下文推断目标区域或未来状态的高层表征;模型不必复原所有表面细节,只需抓住稳定、可预测并且对任务有用的结构。I-JEPA 首先在图像上验证了这条路线,V-JEPA 将它扩展到视频动态,之后的 LeJEPA、V-JEPA 2 和 LeWorldModel 又把研究推进到稳定训练、物理理解与机器人规划。

37篇论文 8篇重点解读 2022–2026研究跨度

建议读法:第一次了解先看 I-JEPA 与 V-JEPA 2;准备复现可直接进入 EB-JEPA;关注世界模型和机器人规划则继续阅读 LeWorldModel 与 Hierarchical Planning。

8 篇重点解读,另有 29 篇延伸论文

没有找到匹配的论文,试试更短的关键词。
专题依据 AbdelStark/awesome-jepa 与论文原始页面整理;重点论文由 InsightXiv 按研究演进和阅读价值重新组织。