正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前合成数据方法(如 Self-Instruct、CoT Self-Instruct、self-challenging)能批量生成样本,但难以直接控制难度与质量:要么对弱模型太简单、缺乏学习信号,要么太难导致奖励接近零,进而削弱下游 RL 训练效果。论文要回答的核心问题是:能否让一个 agent 像数据科学家一样,通过迭代生成、定性检查与定量评估来持续改进数据配方,并且这种 agentic 数据是否真的能转化为更强的模型训练收益。
核心方法
Autodata 把数据构建封装成一个闭环 agent 系统:主 agent 基于 grounding 资料调度 challenger 生成样本,再由 weak solver 与 strong solver 分别作答,judge 根据正确性、难度差距与 GRPO 适配度给出结构化反馈,主 agent 据此更新 prompt 配方并重新生成,直到满足接受条件。论文的具体实现 Agentic Self-Instruct 还允许外层对 agent 自身进行元优化,用内环“数据质量提升”作为外环优化目标。
实验结论
- CS 研究问答:Agentic 数据使 weak solver 平均分从 0.677 降至 0.458,strong-weak gap 从 0.019 提升至 0.314;4B 模型在 Agentic held-out 上 mean@3 从 0.500 升至 0.632。
- 法律推理:Agentic 把 weak rollout 标准差从 7.93 提升至 12.63;4B 模型在 PRBench-Legal 上以 GPT-5 评分达到 0.441,超过未微调 397B 的 0.404。
适合谁阅读
关注合成数据质量与难度控制的研究者做 LLM 后训练与 RL 数据飞轮的工程师构建 benchmark 与评测集的团队研究 agent 系统自我改进与元优化的人Agent 系统
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.25996