正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
能否从计算机操作轨迹中自动挖出清晰的技能边界,并把这些结构转化为跨任务策略提升?
核心方法
用边界检测切分 GUI 轨迹、对片段做无序表示与聚类,再从候选技能标注训练基于 GRPO 的技能感知策略。
实验结论
- 聚类结构可解释,但策略提升有限且跨域无效
- 边界检测、忽略顺序的表示和离线奖励模型是主要限制
适合谁阅读
研究轨迹抽象识别自动生成瓶颈重视负结果智能体Agent Skills
可核验的原论文来源和作者
- 作者
- Yuexing Hao、Xiaomin Li
- 来源
- arXiv
- 论文 ID
- 2606.20363