论文解决了什么问题
现代自主代理的自我改进研究正快速发展,但领域内术语高度碎片化,相似机制常被打上不同标签。现有综述往往将基础模型微调与代理脚手架优化视为孤立话题,缺乏统一的形式化视角,且极少追溯这些机制在经典人工智能中的概念根源。本文旨在解决这一认知割裂,为现代代理系统的自我改进建立严谨的理论定位与分类体系。
核心方法
本文提出一个系统级框架,将现代代理定义为基础模型与操作脚手架的耦合配置,并将自我改进形式化为一个自我诱导的更新算子。基于此框架,文章构建了统一的分类法,将现有方法按更新目标分为基础模型改进和脚手架改进两条主要路径。研究进一步根据驱动更新的信号来源对具体机制进行细分,系统梳理了参数更新与非参数优化的各类实现方式。
方法与已有工作的区别
有原文依据相比于Gao等人(2026a)和Fang等人(2025a)侧重于演化内容与时间的组织维度,以及Tao等人(2024)仅关注静态大语言模型的自主学习能力,本文同时涵盖了代理系统形式化、历史根源追溯、更新基础、评估视角和广泛的领域覆盖,提供了更全面的统一形式化框架。
实验结论
- 基础模型改进通过内在生成示范、内在评估反馈或外在探索经验更新参数,旨在实现跨任务的长期能力巩固。
- 脚手架改进通过非参数方式更新提示词、记忆结构、工具或整体控制逻辑,具有更快速且更易逆转的调整特性。
- 现代代理评估协议需结合机制级基准测试与端到端评估,并必须将安全因素纳入可靠、持续自我改进的考量中。
- 构建了涵盖基础模型改进与脚手架改进两大路径的统一分类体系
- 系统对比了机制级基准测试与端到端评估协议在衡量代理改进时的优劣
局限性与证据边界
- 原文未明确披露本综述自身在文献覆盖范围或筛选标准上的具体局限性
适合谁阅读
致力于构建自适应代理系统的研究人员关注大模型微调与代理脚手架优化的算法工程师研究代理系统评估协议与安全对齐的学者Agent 系统评测
可核验的原论文来源和作者
- 作者
- Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong, Qingfeng Lan, Wenyi Wang, Li Nanbo, Yibo Yang, Mingchen Zhuge, Jürgen Schmidhuber
- 来源
- arXiv
- 论文 ID
- 2607.13104