正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
长视野视觉规划要求智能体能够跨越不同的时间尺度和抽象层次进行推理。然而,现有的与任务无关的JEPA世界模型通常只能在单一时间尺度上进行预测和规划,或者仅仅在一个共享的潜在空间中处理多个预测视野,难以有效应对长序列任务中的复杂推理需求。
核心方法
H-JEPA通过端到端学习将动作条件JEPA组织成多层世界模型。在该层次化架构中,高层模型负责预测更远的未来并生成宏观子目标,而低层模型则根据这些子目标逐级落实具体的动作规划,从而实现跨时间尺度的高效推理。
方法与已有工作的区别
有原文依据现有的与任务无关的JEPA世界模型通常在单一时间尺度上进行预测和规划,或者在一个共享的潜在空间中处理多个视野;而H-JEPA将动作条件JEPA组织成多层世界模型,通过高层生成子目标、低层落实规划来实现跨时间尺度和抽象层次的推理。
实验结论
- 在Visual AntMaze基准上,三层H-JEPA结构的规划成功率达到73%,相比基线提升了55个百分点。
- 采用层次化结构后,模型在长视野规划中的计算量得到减少。
- 在Visual AntMaze任务中,三层H-JEPA结构将成功率从18%提升至73%。
- 多层世界模型在提升规划成功率的同时,有效减少了规划过程的计算量。
适合谁阅读
研究长视野规划与视觉导航的学者探索世界模型与层次化强化学习的工程师关注JEPA架构在机器人或Agent控制中应用的研究者世界模型推理与规划
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2610.06805