正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
在策略蒸馏(OPD)是大语言模型后训练的重要方法,但直接模仿教师模型的输出分布会将预训练阶段习得的自然语言偏好和风格一并传递给学生模型,导致推理能力的学习轨迹不够纯粹。如何从教师模型中剥离预训练偏好,精准提取推理微调(reasoning tuning)带来的知识增量,是提升小模型推理性能的关键问题。
核心方法
本文提出在策略 Delta 蒸馏(OPD²),将蒸馏奖励信号重新定义为教师模型与其基座模型(未经过后训练)之间的对数概率差(Delta 信号)。为稳定训练,引入了零中心化(减去策略期望奖励)和联合条件机制(仅当 Delta 信号与传统 OPD 信号方向一致时才更新梯度),从而确保学生模型专注于学习推理轨迹而非盲目拟合教师输出。
实验结论
- OPD² 在数学、科学和代码推理的 更高水平 benchmark 上 consistently 优于传统 OPD 和 ExOPD,尤其在 Qwen3 和 Gemma4 的小参数量模型上提升显著。
- Token 级信号分析显示,Delta 信号能更一致地抑制错误推理 token,并增强逻辑连接词(如 hence, however),有效剥离了教师模型的预训练语言偏好。
局限性与证据边界
- 原文未给出 OPD² 相比于传统 OPD 在具体 benchmark 上的精确数值提升幅度(如准确率百分比)。
- 原文未详细说明联合条件机制中当信号方向不一致时,梯度被置零对训练稳定性的具体量化影响。
适合谁阅读
大语言模型后训练研究者知识蒸馏与强化学习方向学者关注小模型推理能力提升的工程师训练与后训练强化学习
可核验的原论文来源和作者
- 作者
- Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
- 来源
- arXiv
- 论文 ID
- 2607.15161