正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
A classical intuition holds that verifying a solution is easier than producing one. For today's coding agents, this intuition is being inverted: as foundation models develop stronger reasoning capabilities and engineering harnesses grow more sophisticated, generating complex candidate solutions is no longer difficult -...
核心方法
提出从 scalability、faithfulness、robustness 三个维度评估验证信号,并在四类任务上构建奖励构造:1)SWE-like 任务中使用执行测试作为奖励,配合 agentic quality judge 过滤低质量任务,并在 RL 中引入轨迹级行为监控以惩罚 shortcut 行为;2)前端任务中设计 rubric-based 静态 judge,并扩展为在真实浏览器中进行模拟交互的 agentic interactive judge;3)真实世界 agent 任务中利用用户自然语言反馈与行为信号作为高忠实度奖励来源;4)长程任务中部署自动化 agentic evaluator,对生成代码库按规范进行多轮动态评估,并用于训练数据筛选。
实验结论
- 在三个 SWE-Bench 变体上,轨迹级行为监控将平均 hacked resolved rate 从 28.57% 降至 0.56%,clean resolved rate 从 40.22% 提升至 60.53%。
- 将用户交互反馈用于模型优化,在五个内部 coding-agent benchmark 上取得显著提升,其中一项私有 benchmark 提升 13.3 个百分点。
适合谁阅读
研究 coding agent 训练与评估的研究者构建 agent 评测基础设施与 benchmark 的团队Agent 系统Benchmark / 评测评测
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.26300