论文解决了什么问题
主流 NL-to-SQL 基准如 Spider 2.0-Snow 仅覆盖扁平关系表,无法衡量企业系统中广泛存在的 ARRAY[STRUCT] 嵌套字段、多态链接数组与多跳图遍历。这导致现有系统在生产 schema 上频繁因 LATERAL FLATTEN 误用、子字段缺失或链接类型判别失败而报错,且缺乏针对分析推理深度的统一评测维度。论文要回答的核心问题是:如何构建能真实反映嵌套企业 schema 挑战的评测基准,并设计在该设定下兼顾正确率与推理成本的 agent 架构。
核心方法
作者提出两层 agent 架构:顶层 orchestrator 通过预计算知识图谱工具迭代浏览和扩展 schema,底层 NL2SQL 生成器仅接收组装好的上下文并输出单条 SQL。系统包含预执行查询计划校验器、15+ 类结构化错误分类与定向修复指令、确定性检查与重写链,以及跨查询积累的动态 cheatsheet。所有验证与反馈任务路由至更轻量的次要模型以控制成本,整个流程无需微调,每个查询仅走单次生成轨迹。
方法与已有工作的区别
有原文依据与 CHASE-SQL、XiYan-SQL、Agentar-Scale-SQL 等多候选或测试时扩展方法不同,本文系统采用单次生成轨迹,依赖迭代 schema 扩展与结构化错误修复而非候选投票;与 MAC-SQL、DIN-SQL 等 agent 方法相比,本文强调针对嵌套类型的子字段感知检索与 15+ 类错误分类;与 Spider 2.0-Snow 基准相比,DevRev 专门引入 ARRAY[STRUCT]、多态链接图与 SDS 维度,填补扁平 DDL 基准未覆盖的评测空间。
实验结论
- 在 DevRev 全量 900 条查询上,系统答案正确率为 91.7%,FlexSQL 为 37.1%,APEX-SQL 为 27.2%,ReFoRCE 为 29.1%。
- 按 SDS 难度分层,基线正确率随难度单调下降(ReFoRCE 下降 21.3 pp),而本系统在 Easy/Medium/Hard 三桶波动不超过 6 pp,与 FlexSQL 的差距从 44.6 pp 扩大到 57.1 pp。
- 每条正确答案成本:本系统 0.57 美元,APEX-SQL 4.60 美元,FlexSQL 15.35 美元,ReFoRCE 0.93 美元。
- 对基线失败查询注入 SDS 维度定向提示后,ReFoRCE 在 638 条原失败查询上的正确率从 29.1% 提升至 63.2%,APEX-SQL 在 655 条上从 27.2% 提升至 41.4%。
- 在 Spider 2.0-Snow 公开数据集上,系统在单次生成设定下与领先系统持平。
局限性与证据边界
- 基准仅覆盖单一生产 schema(DevRev),未在多个不同企业的嵌套 schema 上验证泛化性。
- 系统依赖预计算知识图谱与离线 schema 文档,对缺乏结构化文档的新数据库适配成本未讨论。
- SDS 评分依赖七维 rubric 的人工或模型判定,未报告评分者间一致性或自动评分偏差。
适合谁阅读
Agent 系统Benchmark / 评测评测推理与规划
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.04641