正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
零样本强化学习(zero RL)无需人工标注数据即可激发链式思维推理,但现有研究受限于计算资源,多集中于小模型。万亿参数规模下的训练动态与涌现能力尚未被系统探索。朴素扩展 zero RL 至大模型常导致可读性差、token 冗余及推理深度缺乏自适应等问题。
核心方法
Ring-Zero 采用极简多阶段训练流程:第一阶段用截断重要性采样策略梯度激发推理;中间通过自蒸馏压缩思维链并消除训练-推理引擎数值误差;第二阶段改用样本级损失归一化以稳定优化;第三阶段引入分层训练,使模型根据问题难度自适应调整推理深度。系统层面结合混合精度控制与上下文并行优化,保障 1T 规模下的训练稳定性。
实验结论
- 1T 模型在样本效率和性能上限上显著优于 104B 模型
- 模型自发涌现拟人化、自我验证、并行推理等高级认知行为,使人工启发式设计变得冗余
适合谁阅读
大模型推理能力研究强化学习算法优化思维链质量评估大语言模型强化学习
可核验的原论文来源和作者
- 作者
- Xinyu Tang, Qianggang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou
- 来源
- arXiv
- 论文 ID
- 2607.12395