正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
多模型 LLM 系统什么时候真的比单模型更强;路由、投票、级联和多智能体组合的收益上限
核心方法
把编排视为带预算的分配问题,证明任何输出为成员答案的策略准确率上限为 1−β(β 为全体模型同错概率),并用 Clopper–Pearson 下界把单个 held-out 查询集转化为 0 美元部署前证书;在 67 个前沿模型、21 家供应商的池子上,用 tetrachoric 校准的单因子与全 Σ 高斯 copula、以及 Clayton copula 对照,实测 β 与 ρ 的偏离及其随池规模 k 的变化。
实验结论
- 在 MATH-500 的 67 模型池上,经验 β=0.052,而 tetrachoric 单因子 copula 预测 0.021、全 Σ 高斯 copula 预测 0.023,低估约 2.2–2.5 倍(k=17,90% CI 1.7–3.4)。
- 在 GPQA-Diamond 多选题上 β≈0,但改为自由回答后 β=0.127;在代码竞赛上 β=0.079,复现共模尾部模式。
适合谁阅读
LLM 推理基础设施与路由系统工程师模型编排与成本优化决策者评测与 ensemble 理论研究者Agent 系统系统基础设施
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.27288