正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
现实用户往往能同时访问多个 LLM,但不同模型擅长的编程维度不同,单一全局最强模型也无法覆盖所有任务。现有路由方法通常把问题简化为一次性静态分类,导致与逐任务最优选择之间仍有明显差距。论文要回答的核心问题是:路由性能瓶颈究竟来自推理能力不足,还是来自决策时可用信息不足,以及如何在持续任务流中系统性地缩小这一差距。
核心方法
作者提出 Agent-as-a-Router,将路由形式化为 Context-Action-Feedback 循环:路由器基于当前上下文选择模型,执行后通过沙箱和验证工具获得反馈,再把反馈写回下一次决策的上下文。该框架被实例化为 ACRouter,由 Orchestrator 做决策、Verifier 做执行验证、Memory 做历史积累,并使用累积 regret 作为流式评测指标。配套构建的 CodeRouterBench 统一了约 1 万道任务、10 个编程维度和 8 个前沿模型,用于在相同条件下比较不同路由策略。
实验结论
- 消融实验显示,给零样本 LLM 路由补上维度级性能统计后,平均性能相对提升 15.3%,说明瓶颈主要是信息缺失。主实验中,ACRouter 在分布内测试上取得最低累积 regret 205.5,在 agentic programming 分布外测试上也保持领先。边界在于,静态训练出的轻量路由在分布内表现尚可,但在 OOD 任务上泛化明显变差,说明缺乏在线反馈积累会限制真实部署效果。
适合谁阅读
Agent 系统Benchmark / 评测推理与规划评测
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.22902