正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
怎样像训练模型参数一样系统、稳定地优化自然语言技能,同时阻止一次局部成功造成跨任务退化?
核心方法
独立优化器读取评分轨迹并提出有界编辑,以留出验证严格改进作为接受条件,配套文本学习率、拒绝缓存和元更新。
实验结论
- 覆盖 6 个基准、7 个目标模型和 3 种 Harness 的 52 个组合中均最佳或并列最佳,优化后的技能还能跨模型与 Harness 迁移
适合谁阅读
构建技能优化器控制自修改研究跨环境迁移智能体Agent Skills
可核验的原论文来源和作者
- 作者
- Yifan Yang、Ziyang Gong、Weiquan Huang 等
- 来源
- arXiv
- 论文 ID
- 2605.23904