正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前 coding agent 虽能将自然语言需求转为可执行脚本,但产出多为一次性代码,难以在工业环境中被可视化、编辑和复用,且常幻觉依赖或脱离平台语义。这导致自然语言意图与持久化、可治理的平台原生工作流之间存在显著断层,即 NL2Pipeline gap。
核心方法
DataFlow-Harness 由四个组件协同:Data Pipeline Backend 作为唯一真实源,MCP Tools Layer 提供实时算子注册与状态检索,DataFlow-Skills 注入程序性构建知识与组合约束,DataFlow-WebUI 同步对话与可视化 DAG 编辑。agent 通过类型化增量修改(如添加算子、连接边)操作流水线,每次变更需通过 DAG 无环与 schema 兼容性验证后才提交。
实验结论
- 12 项任务端到端通过率 93.3%,接近脚本生成基线(94.2%)
- 相比 Vanilla Claude Code,构建成本降低 72.5%,延迟降低 49.9%
适合谁阅读
数据工程平台开发者LLM agent 系统研究者需要可治理、可编辑数据流水线的 MLOps 团队agent-systemdata-engineering
可核验的原论文来源和作者
- 作者
- Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang
- 来源
- arXiv
- 论文 ID
- 2607.16617