InsightXiv 专题 返回 Feed
Research Topic 03 · Recurrent-Depth Transformers

Looped Transformer:用循环深度换推理深度

研究综合

专题摘要

纳入 16 篇

Looped Transformer 通过参数共享反复调用同一计算块,用多轮迭代增加有效深度,并让隐藏状态在循环间持续更新。这一结构把模型大小与计算深度部分解耦,为潜在推理和按难度分配测试时计算提供了新路径;本专题聚焦它何时优于非循环模型,以及这种优势要付出什么代价。

图 1 / 3Looped Transformer 的基本机制同一个共享模块反复处理隐藏状态;循环次数增加的是计算深度,而不是每一轮都新增一套参数。 点击可查看大图。
16篇核心论文 3篇基础必读 4个阅读阶段 2023–2026研究跨度

建议读法:下面按四个问题分组:第一阶段“基础与表达力”回答循环为什么能增加有效深度;第二阶段“潜在推理”看多算几圈怎样变成更强的推理能力;第三阶段“训练与部署”解决怎么稳定训大、控制算力和缓存;第四阶段“机制与边界”解释它为什么有效、什么时候会失效。第一次了解建议按第一、第二阶段顺读;准备训练或改造模型时重点看第三阶段,做机制研究或判断结论边界时再进入第四阶段。

专题图解接着上方图 1,按图 2 → 图 3 顺序阅读
图 2 / 3四阶段研究路径四个阶段依次回答为何能循环、多算几圈有什么作用、如何稳定训练,以及什么时候会失效。 点击可查看大图。
图 3 / 3循环次数与推理预算更多循环不保证更好;循环次数既控制 test-time compute,也会改变推理稳定性和停止质量。 点击可查看大图。

核心阅读路径

当前展示 16 篇,前 3 篇为基础必读

01
READING STAGE 01

基础、表达力与潜在思维

先理解为什么反复使用同一组参数也能增加计算深度,以及这种设计如何支持程序执行、函数逼近和隐藏状态中的多步思考。

3 篇
arXiv 2023 基础与表达力 ICML 2023 奠基工作

Looped Transformers as Programmable Computers

Angeliki Giannou、Shashank Rajput、Jy-yong Sohn 等 · ICML 2023

标准 Transformer 的计算能力已被广泛研究,但权重共享并循环执行的结构能否实现通用计算仍缺乏严格刻画。本文证明 Looped Transformer 可被编程为通用图灵机:仅需常数层即可模拟任意可计算函数,循环次数与图灵机步数线性相关。该构造性证明为理解 In-context Learning 的表达力边界提供了理论基础,但未涉及实际训练可行性。

Looped Transformers as Programmable Computers 论文首页预览
arXiv 2025 基础与表达力 ICLR 2025 必读

Reasoning with Latent Thoughts: On the Power of Looped Transformers

Nikunj Saunshi、Nishanth Dikkala、Zhiyuan Li 等 · ICLR 2025

大模型提升推理常靠堆参数或显式思维链,成本高且延迟大。本文将循环 Transformer 的迭代过程建模为潜在思维,从理论与实验分析其推理边界。结果表明,循环机制可等效增加有效深度,在多步推理任务上准确率随循环次数显著提升,但面对极端复杂逻辑仍存在表达瓶颈。值得关注的是,揭示 Looped Transformer 通过隐式循环实现深度扩展的理论机制与推理边界。

Reasoning with Latent Thoughts: On the Power of Looped Transformers 论文首页预览
arXiv 2025 基础与表达力 ICML 2025 理论主线

On Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement via Timestep Encoding

Kevin Xu、Issei Sato · ICML 2025

循环 Transformer 通过参数共享反复执行以增强表达力,但其函数逼近边界尚不明确。本文建立理论框架揭示标准循环 Transformer 在特定函数类上存在表达瓶颈,并提出时间步编码机制为每个循环步注入位置信息。理论证明该机制在不增加参数量的前提下严格扩展了可逼近函数类。值得关注的是,首次从理论上严格证明时间步编码可增强循环 Transformer 的函数逼近能力,揭示参数共享下的表达力瓶颈与突破路径。

On Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement via Timestep Encoding 论文首页预览
02
READING STAGE 02

潜在推理与弹性计算

看模型如何在隐藏状态中完成多步推理、根据任务难度调节计算量,并与写出来的思维链保持一致。

3 篇
arXiv 2026 潜在推理 泛化边界代表作

Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers

Harsh Kohli、Srinivasan Parthasarathy、Huan Sun、Yuekun Yao · arXiv 预印本

Transformer单次前向传播难以灵活组合参数化知识完成隐式多跳推理。本文研究循环深度Transformer,通过共享层迭代计算,在系统性泛化与深度外推上显著优于普通Transformer,并揭示三阶段grokking动态与推理时扩展的解锁作用,同时指出过度循环会导致overthinking退化。

Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers 论文首页预览
arXiv 2026 潜在推理 ICLR 2026

LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation

Ahmadreza Jeddi、Marco Ciccone、Babak Taati · ICLR 2026

现有循环 Transformer 因固定迭代次数,无法按算力预算灵活伸缩。LoopFormer 将循环建模为可变轨迹,引入时间-步长联合调制与 shortcut-consistency 自蒸馏,使同一模型在任意预算下平滑调整推理深度。实验显示,即使预算大幅缩减仍保持稳健性能,并随预算增加持续提升。

LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation 论文首页预览
arXiv 2026 潜在推理 3B 潜在推理突破

Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers

Ying Fan、Anej Svete、Kangwook Lee · arXiv 预印本

大规模语言模型的潜在推理(latent reasoning)常落后于显式链式思维(CoT),且差距随模型参数增加而扩大。LOTUS通过在输入中插入可学习潜在块,并利用循环Transformer迭代更新潜在状态,结合并行监督损失直接对齐CoT步骤。首次在Llama-3.2-3B上将GSM8K准确率差距缩小至1.5个点以内,推理延迟降低2.5至6.9倍,且潜在空间可解释。

Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers 论文首页预览
03
READING STAGE 03

训练、扩展与部署

从残差缩放、循环价值评估和混合专家模型训练,读到无需重新训练的模型改造与跨循环键值缓存压缩。

6 篇
arXiv 2026 扩展与工程 训练稳定性关键工作

On the Residual Scaling of Looped Transformers: Stability and Transferability

Shaowen Wang、Bingrui Li、Ge Zhang 等 · arXiv 预印本

本文研究 Looped Transformers 中的残差缩放规则,重点探讨其对模型训练稳定性与超参数可迁移性的具体影响。研究结合了权重共享机制与有效深度的概念,分析了 1/N 缩放等规则在实际训练中的作用机制。由于输入未提供摘要与正文,具体的实验设计、量化证据与适用边界尚未明确披露,但该工作为理解循环架构的优化机制提供了重要方向。

On the Residual Scaling of Looped Transformers: Stability and Transferability 论文首页预览
arXiv 2026 扩展与工程 2026-07 新作

DeepLoop: Depth Scaling for Looped Transformers

Shuzhen Li、Yifan Zhang、Jiacheng Guo、Quanquan Gu、Mengdi Wang · arXiv 预印本

现有循环Transformer在增加网络深度时,往往会面临严重的优化困难与扩展性瓶颈,限制了模型能力的进一步提升。为此,本文提出DeepLoop方法,通过深度融合Post-LN架构、DeepNorm、Visit Alignment以及残差缩放等核心机制,系统性地改进深度缩放过程。该工作旨在突破循环架构的深度扩展限制,不过其实际的性能提升幅度与具体适用边界目前尚待更充分的实验验证。

DeepLoop: Depth Scaling for Looped Transformers 论文首页预览
arXiv 2026 扩展与工程 循环价值量化

How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models

Kristian Schwethelm、Daniel Rueckert、Georgios Kaissis · arXiv 预印本

循环 Transformer 复用参数能换来多少独立层容量?本文在等有效深度下拟合出循环等价指数 φ=0.46,揭示 r=4 时 410M 循环模型性能对标 580M 非循环模型,并诊断出截断 BPTT 削弱循环而 hyperconnections 显著提升容量。值得关注的是,φ=0.46 量化每次循环的“参数折扣”,并暴露截断 BPTT 以降 loss 为代价削弱循环机制。

How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models 论文首页预览
arXiv 2026 扩展与工程 2026-07 最新主线

Loop the Loopies!

Zitian Gao、Yilong Chen、Yihao Xiao 等 · arXiv 预印本

Looped Transformer 重复层会成倍增加算力,固定预算下通常不如直接扩参。本文提出 Loopie 系列 MoE 与 Loopie Recipe,通过层内循环两次并将节省内存转为微批次与容量增益,使 20B-A2B 模型在同算力下超越 30B-A3B 基线,AIME 达 92.10%。

Loop the Loopies! 论文首页预览
arXiv 2026 扩展与工程 部署改造路线

Training-Free Looped Transformers

Lizhang Chen、Jonathan Li、Chen Liang、Ni Lao、Qiang Liu · arXiv 预印本

现有循环Transformer需在训练阶段绑定权重,无法直接用于已发布的冻结模型。本文提出无需训练的推理包装器,将预训练模型中间层视为ODE的Euler步,用阻尼子步或Runge–Kutta积分重复执行。在7个家族45个评测单元上,该方法使87%单元正向或中性变化,Qwen3-4B在MMLU-Pro上提升2.64个百分点,但小于3B蒸馏模型效果有限。

Training-Free Looped Transformers 论文首页预览
arXiv 2026 扩展与工程 长上下文部署关键工作

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers

James O'Neill、Fergal Reid · arXiv 预印本

循环模型虽然减少了权重参数,解码时却仍为每一圈保存独立 K/V cache。Looped Latent Attention 发现同一 token、层和 head 的 K/V 会沿循环轴形成低秩轨迹,于是用 SVD 初始化并经 logit 与 attention-output 蒸馏的 codec 保存紧凑 latent、读取时再重建。它在 Huginn 上可接近无损地压缩 32 倍,并在 H200 上把 4k context 的批容量从 32 提高到 768。

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers 论文首页预览
04
READING STAGE 04

机制、稳定性与边界

从损失曲面、固定点、归一化和过度思考等角度,分析循环模型为何有效、何时能够处理更难问题,以及何时会失效。

4 篇
arXiv 2025 机制与边界 优化机制研究

What Makes Looped Transformers Perform Better Than Non-Recursive Ones

Zixuan Gong、Yong Liu、Jiaye Teng · arXiv 预印本

循环 Transformer 在复杂推理中优于非循环版本,但优势来源长期不明。本文从损失景观几何视角提出 V/U 型谷地模型,证明递归结构形成更陡 V 型谷地,驱动优化沿河道深入探索复杂模式。基于此设计 SHIFT 分阶段训练策略,在保持推理性能的同时显著降低训练开销。值得关注的是,首次用 U 型与 V 型谷地的损失景观几何解释循环 Transformer 优势,并落地为 SHIFT 分阶段训练加速方案

What Makes Looped Transformers Perform Better Than Non-Recursive Ones 论文首页预览
arXiv 2026 机制与边界 63 张图的机制分析

A Mechanistic Analysis of Looped Reasoning Language Models

Hugh Blayney、Álvaro Arroyo、Johan Obando-Ceron 等 · arXiv 预印本

循环推理语言模型反复调用相同计算模式,但其内部机制长期不明。本文通过机制分析追踪隐空间动态,发现隐状态会收敛至固定点或形成周期轨迹,并识别出注意力头在推理早、中、晚期的功能分化。该工作为判断模型是有效推进还是无效重复提供了可解释的内部视角。值得关注的是,机制分析图揭示循环推理模型内部的固定点、周期轨迹与注意力头阶段分工

A Mechanistic Analysis of Looped Reasoning Language Models 论文首页预览
arXiv 2026 机制与边界 固定点理论主线

Stability and Generalization in Looped Transformers

Asher Labovich · arXiv 预印本

循环Transformer通过增加迭代次数实现测试时计算扩展,但何时能从简单训练问题外推到困难问题缺乏理论支撑。本文建立不动点稳定性分析框架,证明自主网络仅具可数不动点且输入依赖性弱,而回忆机制与外部归一化可确保不动点同时具备可达性、局部光滑性及稳定反向传播。在棋类、数独、前缀和等算法任务上,内部回忆变体在数独上显著优于标准忆机制,但无单一架构统治所有任务,结果限于单层Transformer。

Stability and Generalization in Looped Transformers 论文首页预览
arXiv 2026 机制与边界 小规模理论验证

LayerNorm as Implicit Gain Control in Looped Transformers

Matthias M. M. Buehlmaier · arXiv 预印本

Looped Transformer 多次迭代易出现激活值发散或坍缩,本文从动力系统视角证明 LayerNorm 充当隐式增益控制:通过约束激活范数将 Jacobian 谱半径压缩至单位圆附近,保证循环映射渐近稳定。小规模线性实验显示,移除 LayerNorm 后谱半径偏离稳定区间,激活值在数十步内发散。

LayerNorm as Implicit Gain Control in Looped Transformers 论文首页预览
没有找到匹配的论文,试试更短的关键词。
专题依据 Awesome Loop Models 与论文原始页面整理;InsightXiv 选择其中最能串联理论、潜在推理、训练扩展和机制边界的 16 篇核心工作,并按阅读逻辑重新组织。2026 年新作多数仍是 arXiv 预印本,页面已单独标注发表状态与验证边界。