正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
语言模型智能体的行为同时取决于模型和 harness,但不同任务要求以不同方式组织模型调用、工具使用和信息流。如果仅调整模型权重,就不容易覆盖 harness 层面的执行组织差异。本文要回答:能否通过强化学习让一个提议模型根据执行反馈重写 harness,在测试时不更新参数就实现未见推理与多跳问答任务的连续适配?
核心方法
Harness Learning 把智能体适配对象从模型权重改为可执行 harness。一个提议模型接收任务执行反馈,通过强化学习学习重写 solver 的工具调用与信息流;测试阶段保持模型参数不变,只用重写后的 harness 完成新的推理和多跳问答任务。作者在未见任务上观察多轮改进。
方法与已有工作的区别
有原文依据相对已有依赖模型权重更新的 agent 适配方式,本文把适配对象改为可执行 harness,并用强化学习根据任务执行反馈重写 solver 的工具调用与信息流。
实验结论
- Harness Learning 在未见推理任务上实现连续多轮改进,具体指标原文未给出。
- Harness Learning 在多跳问答任务上实现连续多轮改进,具体指标原文未给出。
- 在未见推理任务上报告连续多轮改进,未提供具体数值
- 在多跳问答任务上报告连续多轮改进,未提供具体数值
适合谁阅读
研究测试时自适应与 agent 工具调用、信息流编排的研究者关注无需参数更新的强化学习适配,以及推理和多跳问答任务改进的读者Agent 系统推理与规划强化学习
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.35738