正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
Looped Transformer 通过循环复用少量物理层来增加计算深度,但这种权重共享改变了残差流的缩放行为。传统 Post-LN 设计在非共享架构中表现良好,却在 Looped 设置下随展开深度增加而出现训练不稳定,限制了此类紧凑模型的深度扩展能力。
核心方法
DeepLoop 框架包含 DeepNorm 和 Visit Alignment 两项核心机制。DeepNorm 针对循环复用场景重新设计残差分支的归一化与缩放方式,使梯度在多次经过同一组参数时保持可控。Visit Alignment 则对不同循环轮次中的隐状态进行对齐约束,减少因反复调用相同参数而产生的表征漂移。
实验结论
- 在语言建模任务上,DeepLoop 使 Looped Transformer 在更大展开深度下实现稳定训练,相比未适配的 Post-LN 基线获得了一致的性能改善。该方法在参数紧凑的条件下验证了深度扩展的可行性,但实验主要集中在 Post-LN 架构,对其他归一化范式和更大规模模型的泛化效果尚待进一步验证。
局限性与证据边界
- 具体实验数据集与模型规模
- DeepLoop 相比基线的量化性能提升数字
- Pre-LN 或其他归一化方案的对比实验结果
- 作者所属机构信息
适合谁阅读
关注模型深度扩展与训练稳定性的研究者探索参数高效架构与权重共享机制的工程师模型架构训练与后训练优化与理论
可核验的原论文来源和作者
- 作者
- Shuzhen Li、Yifan Zhang、Jiacheng Guo、Quanquan Gu、Mengdi Wang
- 来源
- arXiv
- 论文 ID
- 2607.13491