正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
现有自动多智能体系统生成方法分为推理时和训练时两条路径。推理时方法使用冻结的前沿大模型进行迭代搜索,但每次运行重复相同流程,无法从历史失败中积累经验。训练时方法通过梯度更新将经验内化到小模型参数中,但受限于小模型的能力天花板,且难以扩展到百B级以上的闭源大模型。如何在保留大模型强推理能力的同时实现经验积累,是该领域核心难题。
核心方法
Skill-MAS 将 Meta-agent 的高层编排行为建模为结构化的 Meta-Skill,包含任务分解、Agent 工程和工作流拓扑三个模块。每轮迭代包含两个阶段:Multi-Trajectory Rollout 对每个任务采样多条独立轨迹,将单次结果转化为分布统计;Selective Reflection 通过不确定性与难度联合评分筛选高优先级任务,执行任务内高低分对比分析和跨任务综合,提炼可泛化的策略级原则更新 Meta-Skill。经过多轮演化后,选取验证集上表现最优的 Meta-Skill 用于最终测试。
实验结论
- 优化后的 Skill-MAS 在四个 benchmark、四个 LLM 的绝大多数设置下超越 EvoAgent、AFlow、MAS-Orchestra 等基线,平均性能最优且推理成本显著低于推理时迭代方法
- 演化出的 Meta-Skill 具备强迁移性:跨 LLM 迁移(如 GPT-5.4-Nano→DeepSeek-V4-Flash)在 VITA 上提升 9.53 分,跨任务迁移同样带来稳定增益
适合谁阅读
多智能体系统自动化构建研究者Agent 编排与工作流优化方向关注 LLM 经验积累与技能演化的研究者Agent 系统技能学习
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.18837