InsightXiv 专题 返回 Feed
Research Topic 01 · Joint Embedding Predictive Architecture

JEPA:从表征预测走向可规划的世界模型

研究综合

专题摘要

纳入 12 篇

联合嵌入预测架构(JEPA)不直接复原像素,而是在潜在空间预测被遮挡区域或未来内容的表征,目标是保留语义、运动以及其他可预测结构。本专题沿图像表征、视频动态、训练机制与行动规划四条线索,考察 JEPA 学到什么、为何能稳定训练,以及它在什么条件下可以充当世界模型。

图 1 / 3JEPA 在学什么可以把它理解成一道带答案的遮挡题:模型根据周围内容猜隐藏部分应有的特征,再与真实内容的特征比较;它不需要把杯子的每个像素画回来。 点击可查看大图。
37篇论文 8篇重点解读 2022–2026研究跨度

建议读法:第一次了解先看 I-JEPA 与 V-JEPA 2;准备复现可直接进入 EB-JEPA;关注世界模型和机器人规划则继续阅读 LeWorldModel 与 Hierarchical Planning。

专题图解接着上方图 1,按图 2 → 图 3 顺序阅读
图 2 / 3JEPA 研究路线研究主线从理解静态图像开始,依次进入时间变化、稳定训练和行动决策;四个阶段与下方论文筛选项对应。 点击可查看大图。
图 3 / 3JEPA 如何帮助选择动作世界模型先预测多个候选动作会带来什么结果,再选择更接近目标的动作;预测结果仍需在真实环境中验证。 点击可查看大图。

8 篇重点解读,另有 29 篇延伸论文

没有找到匹配的论文,试试更短的关键词。
专题依据 AbdelStark/awesome-jepa 与论文原始页面整理;重点论文由 InsightXiv 按研究演进和阅读价值重新组织。