正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前自我改进智能体(如 Darwin/Huxley Gödel Machine)依赖固定外部评测标准,在缺乏直接 benchmark 的开放任务(如论文写作、证明撰写)中无法提供有效搜索信号,且静态评测易被奖励作弊或饱和。如何让评测标准本身随智能体共同进化,同时保持搜索的收敛保证,是本文要回答的核心问题。
核心方法
RQGM 将搜索组织为多个 evolutionary epoch:每个 epoch 内评测器冻结,提供固定效用信号;在 epoch 边界,挑战者评测器仅在 ground-truth anchor 上统计优于当前评测器时才被提升,并执行 selective erasure 擦除旧评测记录。任务智能体与评测器共享可编辑代码空间,由 meta-agent 统一修改,形成协同进化。
实验结论
- Polyglot 代码任务:RQGM 以 1.35×–1.72× 更少 token 达到 71.7% pass rate,超越 HGM-H 的 69.9%
- 论文写作任务:协同进化写手在 agent-as-a-judge 面板下接受率达 40.5%,较基线 21.8% 提升 1.86×
适合谁阅读
Agent 系统研究者自动化科学发现方向LLM 评测与对齐研究者多智能体协同进化方向Agent 系统
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.26294