正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
多智能体 LLM 系统依赖智能体自主协作完成复杂任务,但现有模型在交互中普遍存在探索不足的问题。实验表明,即使是 GPT-4、GPT-5 等前沿模型,也倾向于在前几轮就过早锁定某个伙伴,导致次优协调和累积遗憾增加。这一失败模式并非能力不足,而是当前 LLM 智能体的结构性缺陷,亟需显式引导的探索机制。
核心方法
本文提出 MACE(Multi-Agent Contextual Exploration)框架,将多智能体探索问题建模为部分可观测随机博弈,并分解为独立的上下文赌博机决策。MACE 通过设计响应多样性、伙伴独特性、历史表现和交互轮次等结构化特征,编码智能体间的关系结构。结合 LinUCB 算法,MACE 在特征空间而非原始选择计数上计算不确定性奖励,实现细粒度的探索激励。
实验结论
- MACE 在 HotpotQA、Math500 和 GPQA 任务上显著优于基线,累积遗憾达到 O(√T log T),而贪婪策略为 Ω(δT)。
- 理论证明探索收益随智能体多样性增加而无限增长,验证了探索在异构多智能体系统中的核心价值。
适合谁阅读
多智能体系统研究者LLM 智能体协调与自主决策方向强化学习与探索策略研究multi-agentagent-system
可核验的原论文来源和作者
- 作者
- Hyeong Kyu Choi, Jiatong Li, Wendi Li, Xin Eric Wang, Sharon Li
- 来源
- arXiv
- 论文 ID
- 2607.11250