InsightXiv 专题 返回 Feed
Research Topic 03 · Recurrent-Depth Transformers

Looped Transformer:用循环深度换推理深度

Looped Transformer 可以译作“循环式 Transformer”。它在一次计算中反复使用同一组网络模块,不增加新的参数,却能让信息经过更多轮处理。简单来说,就是让模型用同一套大脑多想几遍。

这种设计很适合在模型内部完成多步推理。模型不必把每一步思考都写成文字,而是可以不断更新隐藏状态;遇到难题时多计算几轮,简单问题则少算几轮,从而在模型大小不变的情况下灵活分配算力。

但循环并不等于简单地重复网络层。参数被反复使用后,训练稳定性、推理层数的外推、过度思考和键值缓存都会出现新的问题。近期研究正在回答三个核心问题:循环模型为什么有效、怎样稳定扩大循环次数,以及它能否真正用于大规模语言模型。

16篇核心论文 3篇基础必读 4个阅读阶段 2023–2026研究跨度

建议读法:下面按四个问题分组:第一阶段“基础与表达力”回答循环为什么能增加有效深度;第二阶段“潜在推理”看多算几圈怎样变成更强的推理能力;第三阶段“训练与部署”解决怎么稳定训大、控制算力和缓存;第四阶段“机制与边界”解释它为什么有效、什么时候会失效。第一次了解建议按第一、第二阶段顺读;准备训练或改造模型时重点看第三阶段,做机制研究或判断结论边界时再进入第四阶段。

核心阅读路径

当前展示 16 篇,前 3 篇为基础必读

01
READING STAGE 01

基础、表达力与潜在思维

先理解为什么反复使用同一组参数也能增加计算深度,以及这种设计如何支持程序执行、函数逼近和隐藏状态中的多步思考。

3 篇
arXiv 2023 基础与表达力 ICML 2023 奠基工作

Looped Transformers as Programmable Computers

Angeliki Giannou、Shashank Rajput、Jy-yong Sohn 等 · ICML 2023

现有理论要求 Transformer 深度随程序步数增长,难以解释浅层模型执行长迭代算法的能力。本文将输入设计为含指令与内存的“打孔卡”,让常数层模型循环执行单条 FLEQ 指令,证明 9 层可模拟 SUBLEQ 计算机,13 层能运行矩阵运算及 SGD 反向传播。该框架为少量参数承载长计算提供显式构造,但权重为手工硬编码,尚未验证训练模型是否采用类似机制。

Looped Transformers as Programmable Computers 论文首页预览
arXiv 2025 基础与表达力 ICLR 2025 必读

Reasoning with Latent Thoughts: On the Power of Looped Transformers

Nikunj Saunshi、Nishanth Dikkala、Zhiyuan Li 等 · ICLR 2025

大模型推理能力通常依赖参数堆叠,但本文发现计算深度才是关键。作者将 k 层 Transformer 循环 L 次复用权重,在加法、数学题等任务上以一半参数超越 24 层基线(34.3% vs 29.3%),理论证明循环可模拟 Chain-of-Thought,为推理扩展提供参数高效新路径。

Reasoning with Latent Thoughts: On the Power of Looped Transformers 论文首页预览
arXiv 2025 基础与表达力 ICML 2025 理论主线

On Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement via Timestep Encoding

Kevin Xu、Issei Sato · ICML 2025

Looped Transformer 通过权重绑定实现参数高效推理,但其函数逼近能力缺乏理论刻画。本文定义三类序列连续性模量,首次推导逼近速率上界,揭示循环架构特有的误差放大问题,并提出 Timestep-Modulated Looped Transformer(TMLT)通过时间步编码调制消除该瓶颈,在数独等推理任务上验证了循环次数与时间步调制对准确率的提升。

On Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement via Timestep Encoding 论文首页预览
02
READING STAGE 02

潜在推理与弹性计算

看模型如何在隐藏状态中完成多步推理、根据任务难度调节计算量,并与写出来的思维链保持一致。

3 篇
arXiv 2026 潜在推理 泛化边界代表作

Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers

Harsh Kohli、Srinivasan Parthasarathy、Huan Sun、Yuekun Yao · arXiv 预印本

Transformer单次前向传播难以灵活组合参数化知识完成隐式多跳推理。本文研究循环深度Transformer,通过共享层迭代计算,在系统性泛化与深度外推上显著优于普通Transformer,并揭示三阶段grokking动态与推理时扩展的解锁作用,同时指出过度循环会导致overthinking退化。

Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers 论文首页预览
arXiv 2026 潜在推理 ICLR 2026

LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation

Ahmadreza Jeddi、Marco Ciccone、Babak Taati · ICLR 2026

现有循环 Transformer 因固定迭代次数,无法按算力预算灵活伸缩。LoopFormer 将循环建模为可变轨迹,引入时间-步长联合调制与 shortcut-consistency 自蒸馏,使同一模型在任意预算下平滑调整推理深度。实验显示,即使预算大幅缩减仍保持稳健性能,并随预算增加持续提升。

LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation 论文首页预览
arXiv 2026 潜在推理 3B 潜在推理突破

Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers

Ying Fan、Anej Svete、Kangwook Lee · arXiv 预印本

大规模语言模型的潜在推理(latent reasoning)常落后于显式链式思维(CoT),且差距随模型参数增加而扩大。LOTUS通过在输入中插入可学习潜在块,并利用循环Transformer迭代更新潜在状态,结合并行监督损失直接对齐CoT步骤。首次在Llama-3.2-3B上将GSM8K准确率差距缩小至1.5个点以内,推理延迟降低2.5至6.9倍,且潜在空间可解释。

Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers 论文首页预览
03
READING STAGE 03

训练、扩展与部署

从残差缩放、循环价值评估和混合专家模型训练,读到无需重新训练的模型改造与跨循环键值缓存压缩。

6 篇
arXiv 2026 扩展与工程 训练稳定性关键工作

On the Residual Scaling of Looped Transformers: Stability and Transferability

Shaowen Wang、Bingrui Li、Ge Zhang 等 · arXiv 预印本

循环 Transformer 因权重共享导致残差更新高度相关,传统 1/√L 缩放失效。本文推导并验证了 1/N 线性缩放规则,使残差流范数有界,并实现从小循环到大循环的学习率零成本迁移。值得关注的是,权重共享使残差更新从随机游走变为建设性累积,需要 1/N 而非 1/√N 缩放来稳定训练。

On the Residual Scaling of Looped Transformers: Stability and Transferability 论文首页预览
arXiv 2026 扩展与工程 2026-07 新作

DeepLoop: Depth Scaling for Looped Transformers

Shuzhen Li、Yifan Zhang、Jiacheng Guo、Quanquan Gu、Mengdi Wang · arXiv 预印本

Looped Transformer 复用物理块增加深度却不增参数,但现有残差缩放规则忽略共享参数被多次访问的梯度聚合效应,导致训练不稳定。DeepLoop 引入 visit-alignment coefficient 量化该效应,将缩放指数从 1/4 提升至 1/2,仅修改初始化与残差缩放。在 GPT-2 medium 上循环 7 次时,验证损失降低 0.028 nats,下游任务准确率随循环次数稳定提升。

DeepLoop: Depth Scaling for Looped Transformers 论文首页预览
arXiv 2026 扩展与工程 循环价值量化

How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models

Kristian Schwethelm、Daniel Rueckert、Georgios Kaissis · arXiv 预印本

循环 Transformer 复用参数能换来多少独立层容量?本文在等有效深度下拟合出循环等价指数 φ=0.46,揭示 r=4 时 410M 循环模型性能对标 580M 非循环模型,并诊断出截断 BPTT 削弱循环而 hyperconnections 显著提升容量。值得关注的是,φ=0.46 量化每次循环的“参数折扣”,并暴露截断 BPTT 以降 loss 为代价削弱循环机制。

How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models 论文首页预览
arXiv 2026 扩展与工程 2026-07 最新主线

Loop the Loopies!

Zitian Gao、Yilong Chen、Yihao Xiao 等 · arXiv 预印本

Looped Transformer 重复层会成倍增加算力,固定预算下通常不如直接扩参。本文提出 Loopie 系列 MoE 与 Loopie Recipe,通过层内循环两次并将节省内存转为微批次与容量增益,使 20B-A2B 模型在同算力下超越 30B-A3B 基线,AIME 达 92.10%。

Loop the Loopies! 论文首页预览
arXiv 2026 扩展与工程 部署改造路线

Training-Free Looped Transformers

Lizhang Chen、Jonathan Li、Chen Liang、Ni Lao、Qiang Liu · arXiv 预印本

现有循环Transformer需在训练阶段绑定权重,无法直接用于已发布的冻结模型。本文提出无需训练的推理包装器,将预训练模型中间层视为ODE的Euler步,用阻尼子步或Runge–Kutta积分重复执行。在7个家族45个评测单元上,该方法使87%单元正向或中性变化,Qwen3-4B在MMLU-Pro上提升2.64个百分点,但小于3B蒸馏模型效果有限。

Training-Free Looped Transformers 论文首页预览
arXiv 2026 扩展与工程 长上下文部署关键工作

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers

James O'Neill、Fergal Reid · arXiv 预印本

循环模型虽然减少了权重参数,解码时却仍为每一圈保存独立 K/V cache。Looped Latent Attention 发现同一 token、层和 head 的 K/V 会沿循环轴形成低秩轨迹,于是用 SVD 初始化并经 logit 与 attention-output 蒸馏的 codec 保存紧凑 latent、读取时再重建。它在 Huginn 上可接近无损地压缩 32 倍,并在 H200 上把 4k context 的批容量从 32 提高到 768。

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers 论文首页预览
04
READING STAGE 04

机制、稳定性与边界

从损失曲面、固定点、归一化和过度思考等角度,分析循环模型为何有效、何时能够处理更难问题,以及何时会失效。

4 篇
arXiv 2025 机制与边界 优化机制研究

What Makes Looped Transformers Perform Better Than Non-Recursive Ones

Zixuan Gong、Yong Liu、Jiaye Teng · arXiv 预印本

循环 Transformer 在复杂推理中优于非循环版本,但优势来源长期不明。本文从损失景观几何视角提出 V/U 型谷地模型,证明递归结构形成更陡 V 型谷地,驱动优化沿河道深入探索复杂模式。基于此设计 SHIFT 分阶段训练策略,在保持推理性能的同时显著降低训练开销。值得关注的是,首次用 U 型与 V 型谷地的损失景观几何解释循环 Transformer 优势,并落地为 SHIFT 分阶段训练加速方案

What Makes Looped Transformers Perform Better Than Non-Recursive Ones 论文首页预览
arXiv 2026 机制与边界 63 张图的机制分析

A Mechanistic Analysis of Looped Reasoning Language Models

Hugh Blayney、Álvaro Arroyo、Johan Obando-Ceron 等 · arXiv 预印本

循环推理语言模型通过复用同一组 Transformer 层扩展测试时计算,但其隐空间动态与前馈模型的差异尚不明确。本文对 Ouro、Huginn-0125 等循环模型进行机制分析,发现循环 block 各层收敛到各自固定点并形成稳定周期轨迹,且每次迭代都重演与前馈模型高度相似的推理阶段。

A Mechanistic Analysis of Looped Reasoning Language Models 论文首页预览
arXiv 2026 机制与边界 固定点理论主线

Stability and Generalization in Looped Transformers

Asher Labovich · arXiv 预印本

循环Transformer通过增加迭代次数实现测试时计算扩展,但何时能从简单训练问题外推到困难问题缺乏理论支撑。本文建立不动点稳定性分析框架,证明自主网络仅具可数不动点且输入依赖性弱,而回忆机制与外部归一化可确保不动点同时具备可达性、局部光滑性及稳定反向传播。在棋类、数独、前缀和等算法任务上,内部回忆变体在数独上显著优于标准忆机制,但无单一架构统治所有任务,结果限于单层Transformer。

Stability and Generalization in Looped Transformers 论文首页预览
arXiv 2026 机制与边界 小规模理论验证

LayerNorm as Implicit Gain Control in Looped Transformers

Matthias M. M. Buehlmaier · arXiv 预印本

循环Transformer复用权重以获取深度推理能力,但训练稳定性分析常低估发散风险。本文揭示pre-LayerNorm充当隐式增益控制器,使增量Lipschitz常数与激活尺度反向耦合,即使算子范数大于1(如ρ=0.3时达1.74),谱半径仍保持小于1实现渐近收缩。小规模实验表明线性carry主要负责稳定而非深度记忆,该结论尚需更大规模验证。

LayerNorm as Implicit Gain Control in Looped Transformers 论文首页预览
没有找到匹配的论文,试试更短的关键词。
专题依据 Awesome Loop Models 与论文原始页面整理;InsightXiv 选择其中最能串联理论、潜在推理、训练扩展和机制边界的 16 篇核心工作,并按阅读逻辑重新组织。2026 年新作多数仍是 arXiv 预印本,页面已单独标注发表状态与验证边界。