论文解决了什么问题
当前基于 LLM agent 的资产定价系统(如因子挖掘、交易决策)各自定义架构与评估指标,缺乏共享术语和统一评测标准。更关键的是,现有实践仅对系统输出(因子或交易)进行静态回测,无法区分系统是真正可靠、存在信息泄露,还是仅仅在特定样本窗口“运气好”。这种评估方式掩盖了自主发现系统特有的失败模式,使不同系统之间无法公平比较、复现或迭代。
核心方法
论文定义 AEAP 范式并提炼五个核心构建模块(假设生成、形式化、执行、评估门控、记忆与迭代),提出三项评估原则:时点数据(P1)、时点过程(P2)、仅样本外结果(P3)。针对因子发现,构建包含生产力、表现、新颖性的多维评估标准,并设计滚动重执行协议——在多个历史决策日期重新运行完整发现循环,检验系统是否能利用已积累状态持续适应市场变化。SEADS 作为参考架构的具体实例,采用 Planner-Proposer 分层生成、沙盒执行、九阶段统计验证门控和自演化机制。
方法与已有工作的区别
有原文依据论文明确指出,所调研的所有现有 AEAP 系统(包括 AlphaAgent、RD-Agent(Q)、QuantaAlpha、Beyond Prompting、AlphaForge)均仅对输出进行静态回测,无一满足“时点过程”(P2)原则——即在多个历史决策日期重新执行发现循环。此外,没有任何基线系统将超过两个独立统计标准组合进单一准入决策,而 SEADS 的验证门控包含九项独立检查。
实验结论
- 在 JKP 和 CRSP/Compustat 两个面板上,六个系统在生产力、表现、新颖性三个维度上排名不一致,证明单一指标不足以评估因子发现系统。
- Beyond Prompting 在两个面板上分别产出 96.4 和 85.0 个因子(生产力最高),样本外 Sharpe 分别为 0.41 和 0.11,但其新颖性得分(0.90/0.81)并非所有系统中最低(即相关性并非最小)。
- 非智能体基线 AlphaForge 在两个面板上仅分别产出 5.0 和 1.8 个因子,表明在严苛门控下纯组合搜索难以满足生产力要求。
- SEADS 在两个面板上分别产出 14.0 和 13.8 个因子,样本外 Sharpe 为 0.25 和 0.16,新颖性得分为 0.65 和 0.46(越低表示与参考集相关性越小,新颖性越高)。
- 论文调研的所有现有 AEAP 系统均未在多个历史决策日期重新执行其发现循环,因此无法评估发现过程本身的可靠性与适应性。
局限性与证据边界
- 论文仅聚焦因子发现这一 AEAP 目标,未覆盖交易决策或结构模型估计等其他目标。
- 滚动重执行协议虽被提出,但正文节选中未报告其完整实验结果(仅说明方法与必要性)。
- 评估指标(如生产力、表现、新颖性的具体度量方式)是作者选择的操作性定义,并非唯一合理方案。
- 论文省略了“骨干年份”(backbone-vintage)原则,认为其残余风险具有任务依赖性,在因子发现任务中较软。
- SEADS 的 Planner 存在已观察到的失败模式,需依赖两个确定性后备机制进行修正。
适合谁阅读
从事量化金融中因子挖掘或 alpha 信号研究的从业者与研究者设计或评测自主发现系统(不限于金融)的 AI 系统工程师Benchmark / 评测评测Agent 系统
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.00731