正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
真实场景中用户指令往往同时包含必须满足的硬性约束和最好满足的柔性偏好。现有 agent 评测框架通常将所有需求等同对待,无法衡量模型在约束冲突时是否优先保障核心需求。本文聚焦这一缺口,研究多模态大模型 agent 能否正确识别并优先执行 Must-Have 任务。
核心方法
作者构建了结构化优先级评测基准,将用户需求显式标注为 Must-Have 与 Nice-to-Have 两类,并设计冲突场景使两者不可同时满足。在此框架下对主流多模态大模型 agent 进行系统评测,同时对比提示工程与微调两类改进策略在优先级遵循上的效果差异。
实验结论
- 主流多模态大模型 agent 在约束冲突场景下 Must-Have 完成率显著下降
- 提示工程策略对优先级遵循的改善幅度有限
- 微调策略在特定模型上对优先级排序的提升效果优于提示工程
- 主流多模态大模型 agent 在 Must-Have 与 Nice-to-Have 冲突时普遍出现优先级倒置
- 提示工程与微调均可改善优先级遵循,但泛化到新场景的能力有限
局限性与证据边界
- 改进策略在泛化到未见场景时效果受限
适合谁阅读
研究 agent 指令遵循与约束优先级排序的研究者构建复杂用户需求评测基准的评测工程师Agent 系统Benchmark / 评测评测
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.05224