正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前 Agent 系统大多在部署时复用单一全局控制层(包括提示、工具接口、解码策略、编排方式等),无法针对不同领域、推理深度或输出格式的案例进行差异化处理。现有自动优化方法通常只调整提示或工作流等局部组件,且优化结果仍是训练时固定的静态配置,缺乏测试时的案例级自适应能力。MemoHarness 旨在解决如何让 Agent 控制层从自身执行经验中学习,并在推理时按案例动态调整的问题。
核心方法
MemoHarness 将 Agent 控制层拆解为上下文组装、工具交互、生成控制、编排拓扑、记忆管理与输出处理六个可编辑维度。训练阶段在标注案例上执行引导搜索,将每次执行的轨迹、奖励与诊断存入双层经验库(案例级条目与蒸馏的全局模式)。测试阶段针对每个无标签案例,检索相似历史案例与相关全局模式,将全局控制层映射为案例专属配置后执行,全程无需反馈、梯度更新或额外搜索。
实验结论
- Terminal-Bench 任务成功率从 0.722 提升至 0.806,优于最强固定控制层基线
- 在六个未见评测集与六个不同基座模型上实现选择性迁移,跨模型平均提升 +0.098
局限性与证据边界
- 更广泛的统计鲁棒性尚未通过大规模重复实验验证
- 各控制层维度对性能提升的具体贡献缺乏细粒度消融实验
- 跨评测集与跨模型迁移的稳定性仅在有限子集上验证,未覆盖所有任务类型
- 成本竞争力依赖于检索经验的可缓存比例,具体缓存命中率与场景分布未详细报告
适合谁阅读
Agent 系统工程师LLM 应用开发者关注 Agent 控制层与推理时自适应的研究者Agent 系统上下文工程
可核验的原论文来源和作者
- 作者
- Yue Huang, Wenjie Wang, Han Bao, Yuchen Ma, Xiaonan Luo, Yi Nian, Haomin Zhuang, Zheyuan Liu, Yue Zhao, Xiangliang Zhang
- 来源
- arXiv
- 论文 ID
- 2607.14159