论文解决了什么问题
在交互式系统中,用户查询常常模糊、不完整或包含系统不支持的实体。大语言模型需要主动识别歧义、提出澄清问题并最终还原可执行的明确意图。然而,现有评测基准多聚焦静态输入输出任务,难以捕捉多轮澄清对话的动态交互特性,也缺乏对模型追问策略、歧义处理和最终意图对齐的系统度量。
核心方法
框架由三个 LLM 智能体构成:澄清智能体(QCA)分析初始查询并迭代追问;应答智能体(RA)依据预设真实意图和人设模拟用户回复,可引入无关信息或模糊表述;评估智能体(EA)在对话结束后对完整记录进行多维度打分。评测数据通过供应链领域合成方法生成,包含不同歧义程度的初始查询与对应的明确意图基准。
方法与已有工作的区别
有原文依据与 ClarQ-LLM 等已有澄清评测基准相比,本框架引入应答智能体模拟多样化用户行为(包括无关输入和模糊回复),并通过评估智能体实现多维度自动打分,而非仅依赖成功率或平均查询差异等单一指标。与 AgentBench、MINT 等通用智能体评测不同,本框架专门针对多轮澄清对话场景设计,覆盖歧义检测、提问质量、不支持输入处理和最终意图对齐等细分维度。
实验结论
- 在 200 段供应链合成对话中,被测模型歧义检测准确率(AH-DA)达 0.92,提问相关性(QQ-Rel)得分 4.48/5。
- 平均澄清轮数为 4.83 轮,整体任务成功率(OTS)为 87%。
- 不支持输入处理(LA-Uns)得分仅 3.75/5,模型在面对系统不支持的实体时未能有效引导对话。
- 约 13% 的失败案例与澄清完整性不足相关,典型模式为过早接受模糊回复(如将
- 整体任务成功率 87%,歧义检测准确率 0.92,提问相关性 4.48/5
局限性与证据边界
- 评估智能体与人类对齐仅在单一指标(澄清完整性)和单一标注者上验证,皮尔逊相关系数 0.87,尚未覆盖全部评测维度。
- 合成数据仅覆盖供应链领域,框架在其他领域的泛化能力未经检验。
- 应答智能体的可靠性依赖迭代调优,其模拟真实用户行为的多样性和真实性存在上限。
- 全部智能体均使用 Claude 3.5 Sonnet 实例化,评测结论可能受特定模型能力影响。
适合谁阅读
研究对话式 AI 中歧义处理与主动澄清能力的学者需要构建或评估多轮交互式 LLM 系统的工程师关注 LLM-as-a-judge 评测方法可靠性的研究者供应链等领域任务型对话系统的开发者Agent 系统
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.02054