正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
AI 加速科研产出使顶会投稿量三年翻倍,传统人工同行评审在数学与理论计算机领域需逐行核验证明,已无法匹配论文增速。现有单次大模型调用受上下文窗口限制,而简单多次采样(Pass@k)虽提高召回却严重牺牲精度,迫使人工在大量幻觉中筛选真实错误。
核心方法
PAT 采用四阶段 agent 流水线:先由分段 agent 将论文切分为语义模块,再按信息密度动态分配推理算力;随后深度审查 agent 在各自段落内并行执行长链推理,同时保留全文上下文;最后综合 agent 结合搜索工具去重、校验引用并生成最终报告。该设计避免重复消耗上下文预算,并抑制多次采样带来的幻觉累积。
实验结论
- 在 SPOT 基准的 26 篇数学/CS 撤稿论文上,PAT 召回率达 89.7%,较零-shot 基线提升约 34 个百分点。STOC 与 ICML 试点共审查逾 4700 篇投稿,超 90% 作者认为反馈有帮助,35% 的 ICML 作者报告 PAT 指出了需耗时修复的理论漏洞,31% 因此补做新实验。系统目前仅检测客观错误,不替代人工决策,仍受日期幻觉、PDF 解析与推理误判限制。
适合谁阅读
Agent 系统科学智能系统基础设施评测
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.28277