正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前前沿 LLM 在不同领域和细粒度任务上呈现明显专长分化,单一模型难以同时覆盖软件工程、数学推理、科学问答等多种高难场景。现有 multi-agent 系统多依赖人工设计的固定协作模式或单步路由,难以在保持低延迟的同时自适应组合多家闭源模型的优势。论文要回答的是:能否训练一个编排模型,把多个前沿 LLM agent 当作黑盒 worker,按查询动态构建 scaffold 并实现超越单一模型的集体智能。
核心方法
Sakana Fugu 将编排模型本身训练为语言模型,对输入查询生成 agentic scaffold 并调度 worker 池。Fugu 在骨干网络最后隐层接入轻量选择头,直接输出 worker logits 进行单 agent 路由,并通过奇异值微调少量参数;训练先在单步可验证任务上做软分布监督微调,再用 sep-CMA-ES 在多轮端到端 coding 轨迹上优化终端奖励。Fugu-Ultra 基于 Conductor 框架,用强化学习让编排模型以自然语言生成多 agent 工作流、分配子任务并管理共享记忆,优先最大化复杂任务的答案质量。
实验结论
- 在 SWE-Bench Pro、Terminal Bench、LiveCodeBench、GPQA-Diamond 等基准上整体优于 GPT 5.5、Gemini 3.1 Pro、Opus 4.8 等公开模型
- Fugu 以接近单次前沿模型调用的延迟实现单 agent 路由,Fugu-Ultra 以更高延迟换取多 agent 工作流的更高质量
适合谁阅读
multi-agent 系统研究者LLM 路由与编排工程实践者需要组合多家闭源模型能力的产品团队Agent 系统系统基础设施
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.21228