正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
个性化对话 agent 需要长期用户记忆,但现有系统大多把记忆当作系统级检索函数,将预选上下文被动喂给模型。当检索结果不完整时,agent 无法主动检查更多证据,也难以在不同查询下灵活切换记忆粒度。本文要回答的核心问题是:能否把用户记忆重构为 agent 可主动导航的结构化动作空间,并通过强化学习让 agent 学会在合适的粒度上使用记忆。
核心方法
NapMem 先把用户交互历史组织成四层记忆金字塔:原始对话、类型化记忆记录、跨会话主题轨迹和全局用户画像,层与层之间通过溯源关系连接。系统提供五个记忆工具,分别支持按标识精确获取、混合检索和文件读取,使 agent 能在不同抽象层之间上下导航。训练阶段使用 GRPO 对记忆密集查询进行强化学习,奖励同时考虑答案正确性、格式有效性和是否合理使用记忆工具,并在工具调用预算内优化整条轨迹。
实验结论
- 强化学习后的 NapMem 在多项记忆任务上整体优于未训练版本和多个现有基线。
- 非记忆任务上基本保留原有能力,同时减少了不必要的记忆工具调用。
适合谁阅读
研究个性化对话 agent 与长期记忆系统的研究者关注 agent 工具调用、记忆管理与强化学习后训练的工程团队Agent 系统检索与 RAG强化学习
可核验的原论文来源和作者
- 作者
- Yue Xu, Yutao Sun, Yihao Liu, Mengyu Zhou, Jiayi Qiao, Lu Ma, Kai Tang, Wenjie Wang, Xiaoxi Jiang, Guanjun Jiang
- 来源
- arXiv
- 论文 ID
- 2607.05794