正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
Transformer 自回归解码在每一步都将高维隐表示压缩回离散 token 空间,形成信息瓶颈,使中间抽象推理状态难以跨时间步持续影响后续计算。现有隐式推理方法要么仅在 embedding 或最终层做循环,要么通过全层循环增加推理深度,但前者绕过了真正发生抽象推理的中间层,后者带来与循环次数成正比的推理开销。本文要回答的核心问题是:能否以极低推理代价,让中间层计算状态在连续隐空间中跨解码步持续演化?
核心方法
T^2MLR 在标准 decoder-only Transformer 中引入一条跨时间步的中间层循环通路:将上一 token 在 ℓ_end 层的表示缓存为固定大小的 recurrent cache,并通过带可学习门控的融合模块注入当前 token 的 ℓ_start 层之前,使深层抽象状态直接进入当前步的中间计算。训练时采用固定次数的 Jacobi 迭代近似所有 token 的循环依赖,保留序列并行与密集 teacher-forcing 的可扩展性,并支持独立控制前向与反向截断深度。推理时仅增加融合模块的常数级计算,不改变自回归接口。
实验结论
- 仅对约 20% 中间层施加循环(如 30 层中的 6 层)在下游基准上优于全层循环配置
- 改装至 SmolLM2-1.7B-Instruct 并微调后,GSM8K 准确率从 35.8 提升至 39.9,MATH500 从 12.8 提升至 18.0,推理开销仅增加约 8%
适合谁阅读
希望在已有预训练模型上低成本增强推理能力的工程团队研究 Transformer 中间层机制与状态追踪的学者模型架构推理与规划系统基础设施
可核验的原论文来源和作者
- 作者
- Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora
- 来源
- arXiv
- 论文 ID
- 2607.15178