正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
现代AI代理的harness负责构建提示、管理状态和调用工具,其行为分布在代码库的多个文件和执行阶段。当需要修改harness行为时,开发者和编码代理必须先定位所有相关实现位置,但现有仓库探索方法仍以文件和函数组织,缺乏从行为到代码的直接映射,导致定位成为瓶颈。
核心方法
我们提出Harness Handbook,一种行为为中心的表示。它通过静态分析提取代码中的程序事实,借助LLM辅助进行行为组织,将函数或文件映射到执行阶段,形成系统、组件、单元三级文档树。修改时采用行为引导的渐进披露(BGPD)从行为描述渐进导航到源码位置,并验证候选站点。规划器基于定位证据生成编辑计划,每次代码修改后手册自动重同步。
实验结论
- 手册辅助规划整体胜率提升约10个百分点(如Codex从28.3%升至更高水平)
- 规划器令牌消耗减少,Codex降低12.7%
局限性与证据边界
- 原文未给出LLM辅助行为组织中使用的具体模型名称
- 评估未涉及编辑实际执行后的功能正确性验证,仅评估规划质量
适合谁阅读
需要频繁修改生产级agent harness的开发者希望用编码代理自动演化harness的团队Agent系统系统基础设施推理与规划
可核验的原论文来源和作者
- 作者
- Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang
- 来源
- arXiv
- 论文 ID
- 2607.13285