正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
通用强化学习智能体需要在目标多样且环境动力学发生外生变化的条件下保持能力。现有因果 RL 工作假设智能体接收显式的任务或环境索引,然后证明其策略映射必须编码世界模型。但在更现实的设定中,环境索引不可见,智能体只能从自身轨迹推断所需信息。这就引出一个核心问题:智能体的内部记忆究竟必须编码哪些关于世界的信息,才能在多目标、多环境中一致地表现良好?
核心方法
论文在隐域 POMDP 框架下推导两个定理。定理 1 证明:若两个环境在同一瓶颈状态要求不相交且存在价值差距的最优动作集,任何一致近优策略的记忆分布必须以全变差距离区分这两个环境。定理 2 引入辅助单步预测目标族,证明当记忆对这些目标的价值函数足够充分时,存在一个解码器可从记忆状态近似恢复局部干预转移核,且解码出的动力学可支持近似 Bellman 规划。实验在 ForkWorld 网格世界中用无记忆 DQN、Stacked DQN、DRQN 及 Oracle 基线验证理论预测。
实验结论
- 无记忆 DQN 在 ForkWorld 中成功率仅约 0.19,远低于 0.50 的随机猜测上限;带记忆的 DRQN 和 Stacked DQN 达到 0.75–0.88。
- 线性探针显示带记忆智能体在首次到达瓶颈时环境识别处于随机水平(约 0.48),后续访问准确率升至 0.97–1.00,验证了记忆分离定理的全变差下界。
适合谁阅读
强化学习理论研究者Agent 系统与世界模型方向研究者关注泛化与鲁棒性的 RL 工程师Agent 系统世界模型
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.18746