正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
Looped Transformer 虽然能复用参数提升表达能力,但循环 N 倍也会使预训练算力成倍增加。以往研究多比较相同参数量下的表现,忽略了固定算力预算下直接扩大非循环模型往往更优这一现实约束。如何在相同预训练耗时条件下,让循环结构真正匹敌或超越常规 Transformer,是本文要回答的核心问题。
核心方法
Loopie 采用 layer-loop,即每层 Attention/MoE 在传递到下一层前先循环执行两次,从而减少存储深度并降低激活内存。Loopie Recipe 先以减半存储层数构建种子模型,再把节省的内存用于翻倍每设备微批次,最后将实测训练效率增益转化为更大的隐藏维度和层数,并按实测优化器步时间与基线对齐。后训练阶段引入监督预训练与强化学习,进一步增强推理能力。
实验结论
- Loopie-20B-A2B 在相同实测优化器步时间下,预训练约 更高水平 token 后超越 Qwen3-30B-A3B 基线
- 后训练模型在 AIME、AMC、OlympiadBench 上分别达到 92.10%、94.21%、80.50%
局限性与证据边界
- 原文未给出 6B-A0.6B 模型的具体后训练评测数字
- 原文未给出强化学习阶段的具体算法名称或超参数
- 原文未给出推理延迟或吞吐量的系统级对比数据
适合谁阅读
关注大模型系统效率与训练成本的研究者探索推理能力后训练方法的团队模型架构系统基础设施训练与后训练
可核验的原论文来源和作者
- 作者
- Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai
- 来源
- arXiv
- 论文 ID
- 2607.16051