正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
在长程任务中,任务要求、环境事实、失败诊断和未完成子目标等关键信息往往散落在不断增长的轨迹里,即使仍在上下文窗口内,也可能不再影响后续决策,作者将这种失败模式称为行为状态衰减。现有记忆系统主要解决存储与检索,却难以回答“何时让已记住的状态重新进入控制循环”。论文要验证的是:把记忆设计为一种主动干预策略,是否能稳定改善长程 Agent 的决策质量。
核心方法
作者在不修改 action agent 的前提下引入一个独立的 memory agent,按固定间隔读取最近轨迹窗口和当前记忆库。第一阶段通过受限工具调用更新结构化记忆库,包括私有状态、知识记忆和过程记忆;第二阶段根据更新后的记忆库决定下一步是向 action agent 注入一条简短、基于记忆的提醒,还是输出空干预保持沉默。该模块以插件方式接入现有 agent 框架,并进一步用 SFT 和 GRPO 在 SETA 上微调 Qwen3.5-27B 学习干预策略。
实验结论
- Terminal-Bench 2.0 上 Sonnet 4.5 pass@1 提升 8.3 个百分点,Opus 4.6 提升 2.4 个百分点。
- τ2-Bench 任务加权平均上 Sonnet 4.5 提升 6.8 个百分点,Opus 4.6 提升 2.5 个百分点,且选择性干预优于被动暴露、强制注入和 Mem0 检索。
适合谁阅读
研究长程 Agent 记忆与上下文控制的系统研究者需要改进命令行或多轮工具任务稳定性的工程团队Agent 系统上下文工程检索与 RAG
可核验的原论文来源和作者
- 作者
- Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao
- 来源
- arXiv
- 论文 ID
- 2607.08716