正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
现有的大语言模型智能体蒸馏多局限于单轮生成,多轮在线蒸馏虽能提供逐步密集监督但每步需环境交互与教师查询,成本高昂。能否在不依赖在线环境的前提下,复用教师轨迹实现高效且可靠的多轮知识蒸馏?本工作聚焦于在替换在线交互为回放前缀时,如何设计前缀分布以平衡学生相关性与教师可靠性。
核心方法
ReOPD 将多轮在线蒸馏重新表述为可靠性感知的前缀分布设计问题。它利用预先收集的教师轨迹池,在每一步让学生沿教师前缀行动、教师提供动作目标,而无需环境交互。通过几何桥接学生与教师的历史占用分布,推导出步长递减的采样调度,使训练集中更多精力于早期低偏移步骤,从而在保持学生关联性的同时确保教师监督可靠性。
实验结论
- 在数学推理环境中,当教师-学生差距大时,ReOPD 准确率超过在线蒸馏 (OPD),同时训练速度提升 ≥4 倍,无工具调用。
- 在搜索/问答任务中,ReOPD 准确率与 OPD 持平,且支持多环境离线统一训练。
局限性与证据边界
- 原文未给出在特定任务(如搜索)上 ReOPD 相比 OPD 的具体数值提升
- “改进离线策略蒸馏(SFT)”仅在贡献中提及,未提供实验数据支撑
- 理论分析中的教师可靠性误差未给出经验估计
- 步长递减调度的最优性未在所有超参数组合下验证
适合谁阅读
适合关注大模型智能体训练、知识蒸馏效率和离线强化学习的读者。Agent 系统训练与后训练上下文工程
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- Microsoft Research
- 论文 ID
- 2607.04763