正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前 computer-using agent 在执行重复任务时仍要从零开始读屏、推理和点击,无法像人类一样把熟练流程内化为快速例程。现有技能库和 record-and-replay 方案要么在运行时仍依赖语言模型,要么盲目回放缓存动作而无法检测界面变化或任务是否真正完成。本文要回答的核心问题是:agent 能否在重复任务上既显著提速又保证回放可靠,并让技能库随使用单调变好而非悄悄退化。
核心方法
PreAct 在 agent 首次成功完成任务后,将轨迹编译为一个带参数的小型状态机程序,每个状态附带屏幕校验谓词,每个转移对应具体操作。回放时系统逐步“先观察后执行”,一旦屏幕不符就交回完整 agent 继续处理并产生新轨迹。新程序必须在干净环境中由独立评估器确认真正完成任务后才能入库,并可替换同签名的旧版本,从而形成可自我修正的可执行技能库。
实验结论
- 在 AndroidWorld、OSWorld 和 WebArena 三个 benchmark 上,PreAct 的 warm replay 比从头推理快 8.5–13 倍,且回放阶段不产生逐步 LLM 调用。入库验证门控在冷到热过渡中稳定带来 1.75–2.6 个任务的净收益,方向在三个平台一致;关闭该门控则因错误程序累积导致性能下降。当无匹配程序时,重新探索的 fallback 使 PreAct 与强 record-and-replay 基线持平。提示词措辞、运行时护栏以及用 LLM 还是 embedding 检索器选择程序对结果影响很小。
适合谁阅读
Agent 系统技能学习Benchmark / 评测上下文工程
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.17929