论文解决了什么问题
现有 Agent 评测多关注是否解决既有代码库中的单一 issue 或任务成功率,难以刻画 Agent 在按详细规格实现多组件系统时引入并自诊系统级缺陷的行为。本文要回答:当 Agent 端到端实现存储 schema、异步编排、跨进程配置和检索过滤等系统约束时,会引入哪些缺陷、如何被发现,以及其中一项检索权衡在外部基准上的真实表现。
核心方法
作者开展一次观察性案例研究,让 LLM 编程 Agent 按固定规格实现图存储、元数据过滤向量索引、异步摄入流水线和力导向可视化客户端,并记录每个缺陷的代码差异、症状、根因与修复,按系统约束和检测方式分类。随后在 HotpotQA distractor 设定下,用 pooled 语料对比“图实体过滤后排序”与“全语料语义搜索”的 recall@k 与 exact match,并进行配对 sign test。
方法与已有工作的区别
有原文依据相对 SWE-bench 等以解决既有代码库中预定义 issue 为主的评测,以及 ReAct 等以任务成功率为指标的 Agent 架构评估,本文关注 Agent 按详细规格端到端实现多组件系统时引入并自诊系统级缺陷的行为,并用外部基准量化其中一项检索权衡,而非仅报告任务是否完成。
实验结论
- 在 n=100 的 HotpotQA 评测中,过滤检索的 recall@3 为 1.000,而未过滤检索的 recall@10 为 0.845,exact match 仅 0.690。
- 配对 sign test 在所有 k∈{1,3,5,10} 上均拒绝无差异原假设,p 值均小于 10^-4。
- 案例共记录五类系统级缺陷,分别涉及配置路径可靠性、存储幂等正确性、图遍历一致性、并发效率与渲染正确性。
- Agent 在并发优化中仅对较小文档验证修复效果,未在触发修复的 18-chunk、242 秒延迟输入上复测。
- 在 HotpotQA distractor 设定下,过滤检索在 k=3 时 recall@k 达到 1.000,而未过滤在 k=10 时 exact match 仅 0.690。
局限性与证据边界
- 研究为单次会话、单 Agent 的观察性案例,缺陷频率不具备泛化结论。
- 检索评测用 gold entity 标题替代上游实体识别,结论仅界定过滤决策本身,不覆盖完整自动化流水线。
- 未对更小或更高效模型进行对比,能力权衡可能与前沿规模 Agent 不同。
- 论文明确声明不复现 HotpotQA 原始任务指标,结果不可与该数据集排行榜比较。
适合谁阅读
设计 Agent 评测框架或执行基准的工程师与评测负责人Agent 系统Benchmark / 评测评测检索与 RAG
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.01985