正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前 LLM 推理训练广泛采用 on-policy distillation(OPD),依赖更大的教师模型为每条采样轨迹提供密集监督信号。这种方式虽然有效,但引入了额外的推理计算、显存占用和部署复杂度。如何在无需外部教师的前提下,为 RLVR 训练提供同样细粒度的监督信号,是本文要解决的核心问题。
核心方法
Self-Distilled RLVR 让模型在 RLVR 训练过程中,利用自身生成的高质量轨迹作为伪教师信号进行自蒸馏。该方法不依赖任何外部更大模型,而是通过筛选和复用模型自身的 on-policy 采样结果,构建细粒度的训练监督。整个流程与标准 RLVR 训练管线无缝集成,无需额外推理开销。
实验结论
- 在多个数学与代码推理基准上,Self-Distilled RLVR 性能持平或优于传统 on-policy distillation,且无需外部教师模型。
- 训练吞吐和资源消耗显著改善,但极端长序列或分布外任务上的泛化能力原文未给出明确数据。
局限性与证据边界
- 具体使用的推理基准名称和数量未在节选中明确列出
- 性能提升或持平的具体数值未在节选中给出
- 训练资源消耗降低的量化指标未提供
- 模型规模、数据集细节和实验设置未在节选中披露
- 作者所属机构未在输入中明确
适合谁阅读
关注 LLM 推理训练效率的研究者希望在不引入大模型教师前提下优化 RLVR 管线的工程师训练与后训练推理与规划强化学习
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2604.03128