正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前大语言模型的强化学习训练流程中,环境配置调整高度依赖人工:实践者需反复查看 rollout 日志和验证失败,推测模型弱点并手动重设计下一阶段环境。这种方式耗时且难以扩展,尤其在训练流程日益复杂的情况下。现有自动化方法如课程学习或自博弈主要在固定环境族内调整样本选择或难度调度,而非让策略模型主动重塑其未来训练分布。本文核心问题是:策略模型能否基于自身失败证据,主动重设计定义其未来 RL 训练分布的环境生成器?
核心方法
论文提出 LLM-as-Environment-Engineer 闭环框架:每轮 RL 训练后,当前策略 checkpoint 接收结构化上下文(包括失败分解、设计指南、历史记录、训练细节等),输出下一轮环境生成器的参数配置(如各地图尺寸的数据比例、障碍比例、等待比例)。同时构建 MAPF-FrozenLake 作为可控测试平台,支持多维度环境配置和多维评估信号(路径有效性、最优性、轨迹长度)。框架不直接合成或选择训练样本,而是修改生成器参数以重塑未来训练分布。
实验结论
- Qwen3-4B 在 LLM-as-Environment-Engineer 框架下,3–5 智能体评测聚合有效率与最优率均超越 GPT-5.4、Gemini-3.1-Pro 等闭源模型及固定环境基线
- RL 训练后的 checkpoint 比原始基座模型更擅长诊断自身弱点,成功环境更新依赖失败证据而非简单难度递增
适合谁阅读
关注 LLM 强化学习训练流程自动化的研究者研究课程学习、环境设计与自改进机制的工程师对多智能体推理与规划评测感兴趣的人员Agent 系统强化学习
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.17682