论文解决了什么问题
现有 VLA 策略擅长从视觉和语言直接预测动作,但在长程任务中难以判断失败究竟来自目标定位、子目标选择、底层执行还是进度验证。基于 LLM 的机器人 agent 虽能显式推理,却无法保证提议的技能在当前物理状态可执行或结果可核验。论文要回答的是:如何把模型决策与物理执行用统一接口连接起来,使每次操作在执行前被校验、执行后被验证,并让失败可追踪。
核心方法
EmbodiedSkills 将 agent 组织为六个语义阶段,并通过共享的技能合约连接高层策略、低层 VLA 与运行时。高层提出结构化技能调用,运行时在执行前检查阶段兼容、输入完整、证据新鲜和状态转移合法性,执行后再用新观察核对子目标进展。所有决策、执行结果与错误都记录为统一轨迹,支持规划、执行、验证等组件独立训练或替换,而不改动主循环。
方法与已有工作的区别
有原文依据相比端到端 VLA 策略,EmbodiedSkills 把中间决策显式化为可校验技能;相比 LLM-based robotic agent,它不依赖 prompt 保证执行安全,而由运行时强制前置条件与状态转移。与 LingBot-VA 报告的 π0.5 参考 82.74% 相比,本文任务适配后的低层策略在 RoboTwin 2.0 达到 86.20%;与 OpenPI 官方 LIBERO 参考 96.85% 相比,本文达到 97.40%。
实验结论
- 在 50 个 RoboTwin 2.0 任务上,任务适配后的低层 VLA 策略平均成功率为 86.20%
- 在 LIBERO-Spatial、LIBERO-Object、LIBERO-Goal、LIBERO-Long 四个套件上,平均成功率为 97.40%
- 在 RMBench 的 4 个记忆依赖任务上,同一执行方式平均成功率为 12.5%
- RoboTwin 2.0 结果高于 LingBot-VA 报告的 π0.5 参考 82.74%
- LIBERO 结果高于 OpenPI 官方参考 96.85%
局限性与证据边界
- 在 RMBench 记忆依赖任务上成功率仅 12.5%,说明当前执行方式对需要交互历史的场景仍明显不足
- 在线策略优化仅在交互反馈和可靠环境评估器可用时可选支持,并非默认训练范式
- 整体任务成功仍依赖各环境自带终端评估协议,框架本身不替代终端成功定义
适合谁阅读
做 VLA agent 系统工程与闭环执行的研究者需要把低层 VLA 策略接入可验证、可恢复运行时的人关注机器人长程任务中规划、验证与失败追踪的系统设计者Agent 系统机器人与具身
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.01281