论文解决了什么问题
当前 Agent 评测通常以完整用户指令为起点,默认系统只需规划执行,而真实使用中需求往往来自屏幕事件、传感器流或停滞的任务进度,用户未必能及时表达。主动服务因此不是更频繁地行动,而是在不确定下判断何时取得主动权,并证明介入比等待更有价值。既有综述多局限于对话场景,缺少统一的决策对象、沉默选项与可操作的评测协议。
核心方法
论文将主动服务建模为受授权与严重风险约束的部分可观测序贯决策过程,把沉默、询问、协助与执行放入同一动作空间,使时机、内容与交付方式可以联合分析。方法沿状态与需求估计、介入门控、动作构造、反馈适配的决策流水线组织,并用正交的策略构造维度区分规定式、预测式、基于模型与回报优化组件。评测侧提出统一的决策单元、三轴证据描述符,以及覆盖触发、时机、校准、用户负担、安全与策略价值的指标体系。
方法与已有工作的区别
有原文依据相比 Deng 等面向文本对话的主动对话综述,本文将组织对象从对话轮次换成模态无关的决策机会,把主动性从“引导对话达成目标”的能力改为“相对指令且允许沉默”的门控决策,并补充了统一决策单元、校准与时机指标、off-policy 与反事实评估以及绑定授权与可恢复性的安全模型。相比 Jannach 等对话推荐综述,本文把“是否询问”放入包含沉默、协助与执行的统一动作空间,而非仅作为偏好 elicitation 组件。
实验结论
- 论文将主动服务形式化为相对当前任务说明、在允许沉默前提下由系统自主引入服务机会的非沉默动作。
- 主动服务被建模为受授权与严重风险约束的部分可观测序贯决策过程,沉默、询问、协助与执行属于同一结构化动作空间。
- 既有方法被统一组织为状态与需求估计、介入门控、动作构造、反馈适配四段决策流水线,并按策略构造机制正交分类。
- 论文提出跨对话、屏幕、视频、软件工程与人机协作资源的归一化决策单元与三轴证据描述符。
- 评测协议将授权、可恢复性、长期效用与反事实评估纳入统一框架,而不仅依赖触发 F1 或接受率。
局限性与证据边界
- 本文是综述与框架性论文,未报告新的统一实证结果或单一最优策略。
- 作者指出既有评测常缺少 off-policy 或反事实估计,以及绑定授权与可恢复性的安全模型。
- 论文强调单靠离线触发、内容质量或接受率无法代表部署价值,相关指标仍需在实际部署中进一步验证。
适合谁阅读
研究 Agent 主动介入、澄清与混合主动交互的研究者设计 GUI、具身或高风险场景 Agent 评测协议的工程师关注 AI 安全、授权与可恢复执行的系统与安全团队Agent 系统Benchmark / 评测
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.03727