正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
世界模型需要理解物体之间的关系才能进行预测、推理和控制。现有的以物体为中心的表征虽然提供了有用的抽象层次,但不足以捕捉依赖交互的动态变化。如何在世界模型中有效学习物体间的因果依赖关系,是本文要回答的核心问题。
核心方法
Causal-JEPA 在 JEPA 框架基础上引入物体级因果掩码机制。模型首先将场景分解为独立的物体表征,然后在潜空间中基于推断的因果结构选择性地遮蔽部分物体表征,而非随机遮蔽图像 patch。这种掩码策略迫使模型学习物体间的交互依赖关系,从而构建更具因果结构的世界模型。
实验结论
- 在关系推理和物理预测任务上显著优于标准 JEPA
- 在纯像素重建任务上无额外增益,优势集中在结构化关系建模场景
局限性与证据边界
- 具体使用的 benchmark 和数据集名称未在提供的节选中明确
- 具体的性能提升数字和对比基线方法的详细结果未在节选中给出
- 因果结构的推断方法细节未在节选中说明
- 作者的具体机构归属未在提供的信息中明确
适合谁阅读
世界模型研究者因果推理方向研究者视觉表征学习研究者世界模型推理与规划
可核验的原论文来源和作者
- 作者
- Heejeong Nam, Quentin Le Lidec, Lucas Maes, Yann LeCun, Randall Balestriero
- 来源
- arXiv
- 论文 ID
- 2602.11389