正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
在不训练模型、法律任务评测昂贵且结果有噪声的条件下,能否自动搜索 Agent 外层 Harness,并让开发集上的改进迁移到冻结的测试集?
核心方法
在 DeepSeek-V4-Pro 权重保持不变的条件下,用 Meta-Harness 让 Claude proposer 每轮只增加一种机制;外层实验脚手架在 24 项开发集上运行三次评测,并以 criterion pass rate、all-pass 和 token 成本组成的带噪声边际规则决定是否晋级,最后在 100 项未见测试集上验证。
实验结论
- 开发集 criterion pass rate 从 63.1% 升至 83.3%,未见测试集从 63.4% 升至 80.1%,测试集 all-pass 从 0% 升至 5.0%
- 五个排名前六的 Harness 主要依赖确定性的文件交付、事项一致性和循环鲁棒性代码
- 代码修复在同模型家族上迁移较好,但提示词 playbook 跨模型家族可能产生负迁移
- 实验只使用 24 项开发任务,且评测成本较高
适合谁阅读
验证 Harness 搜索的实际收益设计高成本 Agent 评测闭环区分模型失败与运行框架失败Agent 系统推理与规划
可核验的原论文来源和作者
- 作者
- Joel Niklaus
- 来源
- Hugging Face
- 论文 ID
- hf-harness-optimization