正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
长周期 LLM agent 需要长期记忆来维持跨会话的一致性与经验复用,但现有系统多把历史交互或反思作为被动上下文检索,导致重复推理和高 token 消耗。将原始轨迹直接蒸馏为 skill 又容易过拟合噪声、缺乏触发条件与适用边界。本文要回答的是:如何在不训练基础模型的前提下,把 agent 经验组织成可治理的记忆,并稳定地提升为可复用的 skills。
核心方法
MSCE 构建三层记忆:L1 保存带证据的步骤轨迹,L2 归纳跨 episode 的过程策略,L3 抽象环境结构与约束。系统通过 reflection-weighted value backfilling 将稀疏终端反馈沿轨迹回填,并用自反思权重校准每步价值。满足证据保留、正增益和稳定性的 L2 策略会被结晶为 skill,附带触发条件、边界、验证规则与可靠性估计,支持在线更新与生命周期管理。
实验结论
- 在 EvoAgentBench 五个领域取得最高或并列最高 Pass@1,SE 域提升 15.39 个百分点。
- 跨域迁移平均提升约 3.93 个百分点,但部分目标域成本上升,SE 域准确率提升伴随交互轮数增加。
局限性与证据边界
- 原文未给出 MSCE 在不同基础模型或不同工具集下的系统性对比结果。
- 原文未提供长期持续演化中 skill 库规模、存储开销或检索延迟的具体量化。
- 跨域迁移中部分目标域成本上升的原因与适用边界未进一步细化分析。
适合谁阅读
长周期 agent 系统设计agent 记忆与 skill 库工程自演化与终身学习研究Agent 系统技能学习
可核验的原论文来源和作者
- 作者
- Bo Tang, Yang Zhang, Guomian Zhuang, Wenqiang Wei, Gaoyang Zheng, Lindong Xie, Yanchao Tan, Feiyu Xiong, Qingyu Yang, Edward Chung, Zhiyu Li
- 来源
- arXiv
- 论文 ID
- 2607.16621