Looped Transformers as Programmable Computers
标准 Transformer 的计算能力已被广泛研究,但权重共享并循环执行的结构能否实现通用计算仍缺乏严格刻画。本文证明 Looped Transformer 可被编程为通用图灵机:仅需常数层即可模拟任意可计算函数,循环次数与图灵机步数线性相关。该构造性证明为理解 In-context Learning 的表达力边界提供了理论基础,但未涉及实际训练可行性。
01FOUNDATION
Looped Transformer 通过参数共享反复调用同一计算块,用多轮迭代增加有效深度,并让隐藏状态在循环间持续更新。这一结构把模型大小与计算深度部分解耦,为潜在推理和按难度分配测试时计算提供了新路径;本专题聚焦它何时优于非循环模型,以及这种优势要付出什么代价。
本综述对专题收录的 16 篇代表性论文进行定性综合,按“表达力—推理计算—训练扩展—机制边界”组织理论构造、受控推理实验、语言模型结果与部署研究,并区分等参数、等有效深度和等计算预算三种不同比较口径。
理论构造表明,共享参数的循环块可以执行迭代算法甚至模拟程序;受控实验进一步发现,循环深度有助于加法、多跳归纳和数学推理,隐藏状态可承载未逐步解码的中间计算。循环次数因此可作为测试时计算旋钮,但收益并不单调:超出训练分布的额外循环可能造成过度思考,时间步编码、循环深度训练分布与自适应停止会共同决定外推效果。
机制研究显示,权重共享使跨循环残差更新相关,因而需要针对循环数的缩放;LayerNorm、状态回注和外层归一化也会影响梯度传播与稳定状态的可达性。工程研究开始尝试冻结模型的免训练循环化与跨循环 KV 缓存压缩,但每一轮仍增加延迟、计算和中间状态成本;低参数量不等于低推理成本,缓存节省也不能替代端到端吞吐与质量评测。
总体而言,Looped Transformer 以共享参数换取可调计算深度,在潜在推理与弹性计算上有明确潜力,但优势受到稳定性、停止策略和预算口径约束。后续应在等参数、等训练算力与等推理算力下建立统一基线,并同时报告循环外推、过度思考、缓存占用、延迟和自适应停止质量。
关键词:Looped Transformer;参数共享;循环深度;潜在推理;测试时计算;残差缩放;自适应停止;KV 缓存
建议读法:下面按四个问题分组:第一阶段“基础与表达力”回答循环为什么能增加有效深度;第二阶段“潜在推理”看多算几圈怎样变成更强的推理能力;第三阶段“训练与部署”解决怎么稳定训大、控制算力和缓存;第四阶段“机制与边界”解释它为什么有效、什么时候会失效。第一次了解建议按第一、第二阶段顺读;准备训练或改造模型时重点看第三阶段,做机制研究或判断结论边界时再进入第四阶段。
当前展示 16 篇,前 3 篇为基础必读
先理解为什么反复使用同一组参数也能增加计算深度,以及这种设计如何支持程序执行、函数逼近和隐藏状态中的多步思考。
标准 Transformer 的计算能力已被广泛研究,但权重共享并循环执行的结构能否实现通用计算仍缺乏严格刻画。本文证明 Looped Transformer 可被编程为通用图灵机:仅需常数层即可模拟任意可计算函数,循环次数与图灵机步数线性相关。该构造性证明为理解 In-context Learning 的表达力边界提供了理论基础,但未涉及实际训练可行性。
01FOUNDATION
大模型提升推理常靠堆参数或显式思维链,成本高且延迟大。本文将循环 Transformer 的迭代过程建模为潜在思维,从理论与实验分析其推理边界。结果表明,循环机制可等效增加有效深度,在多步推理任务上准确率随循环次数显著提升,但面对极端复杂逻辑仍存在表达瓶颈。值得关注的是,揭示 Looped Transformer 通过隐式循环实现深度扩展的理论机制与推理边界。
02FOUNDATION
循环 Transformer 通过参数共享反复执行以增强表达力,但其函数逼近边界尚不明确。本文建立理论框架揭示标准循环 Transformer 在特定函数类上存在表达瓶颈,并提出时间步编码机制为每个循环步注入位置信息。理论证明该机制在不增加参数量的前提下严格扩展了可逼近函数类。值得关注的是,首次从理论上严格证明时间步编码可增强循环 Transformer 的函数逼近能力,揭示参数共享下的表达力瓶颈与突破路径。
03FOUNDATION
看模型如何在隐藏状态中完成多步推理、根据任务难度调节计算量,并与写出来的思维链保持一致。
Transformer单次前向传播难以灵活组合参数化知识完成隐式多跳推理。本文研究循环深度Transformer,通过共享层迭代计算,在系统性泛化与深度外推上显著优于普通Transformer,并揭示三阶段grokking动态与推理时扩展的解锁作用,同时指出过度循环会导致overthinking退化。
04LOOPED
现有循环 Transformer 因固定迭代次数,无法按算力预算灵活伸缩。LoopFormer 将循环建模为可变轨迹,引入时间-步长联合调制与 shortcut-consistency 自蒸馏,使同一模型在任意预算下平滑调整推理深度。实验显示,即使预算大幅缩减仍保持稳健性能,并随预算增加持续提升。
05LOOPED
大规模语言模型的潜在推理(latent reasoning)常落后于显式链式思维(CoT),且差距随模型参数增加而扩大。LOTUS通过在输入中插入可学习潜在块,并利用循环Transformer迭代更新潜在状态,结合并行监督损失直接对齐CoT步骤。首次在Llama-3.2-3B上将GSM8K准确率差距缩小至1.5个点以内,推理延迟降低2.5至6.9倍,且潜在空间可解释。
06LOOPED
从残差缩放、循环价值评估和混合专家模型训练,读到无需重新训练的模型改造与跨循环键值缓存压缩。
本文研究 Looped Transformers 中的残差缩放规则,重点探讨其对模型训练稳定性与超参数可迁移性的具体影响。研究结合了权重共享机制与有效深度的概念,分析了 1/N 缩放等规则在实际训练中的作用机制。由于输入未提供摘要与正文,具体的实验设计、量化证据与适用边界尚未明确披露,但该工作为理解循环架构的优化机制提供了重要方向。
07LOOPED
现有循环Transformer在增加网络深度时,往往会面临严重的优化困难与扩展性瓶颈,限制了模型能力的进一步提升。为此,本文提出DeepLoop方法,通过深度融合Post-LN架构、DeepNorm、Visit Alignment以及残差缩放等核心机制,系统性地改进深度缩放过程。该工作旨在突破循环架构的深度扩展限制,不过其实际的性能提升幅度与具体适用边界目前尚待更充分的实验验证。
08LOOPED
循环 Transformer 复用参数能换来多少独立层容量?本文在等有效深度下拟合出循环等价指数 φ=0.46,揭示 r=4 时 410M 循环模型性能对标 580M 非循环模型,并诊断出截断 BPTT 削弱循环而 hyperconnections 显著提升容量。值得关注的是,φ=0.46 量化每次循环的“参数折扣”,并暴露截断 BPTT 以降 loss 为代价削弱循环机制。
09LOOPED
Looped Transformer 重复层会成倍增加算力,固定预算下通常不如直接扩参。本文提出 Loopie 系列 MoE 与 Loopie Recipe,通过层内循环两次并将节省内存转为微批次与容量增益,使 20B-A2B 模型在同算力下超越 30B-A3B 基线,AIME 达 92.10%。
10LOOPED
现有循环Transformer需在训练阶段绑定权重,无法直接用于已发布的冻结模型。本文提出无需训练的推理包装器,将预训练模型中间层视为ODE的Euler步,用阻尼子步或Runge–Kutta积分重复执行。在7个家族45个评测单元上,该方法使87%单元正向或中性变化,Qwen3-4B在MMLU-Pro上提升2.64个百分点,但小于3B蒸馏模型效果有限。
11LOOPED
循环模型虽然减少了权重参数,解码时却仍为每一圈保存独立 K/V cache。Looped Latent Attention 发现同一 token、层和 head 的 K/V 会沿循环轴形成低秩轨迹,于是用 SVD 初始化并经 logit 与 attention-output 蒸馏的 codec 保存紧凑 latent、读取时再重建。它在 Huginn 上可接近无损地压缩 32 倍,并在 H200 上把 4k context 的批容量从 32 提高到 768。
12LOOPED
从损失曲面、固定点、归一化和过度思考等角度,分析循环模型为何有效、何时能够处理更难问题,以及何时会失效。
循环 Transformer 在复杂推理中优于非循环版本,但优势来源长期不明。本文从损失景观几何视角提出 V/U 型谷地模型,证明递归结构形成更陡 V 型谷地,驱动优化沿河道深入探索复杂模式。基于此设计 SHIFT 分阶段训练策略,在保持推理性能的同时显著降低训练开销。值得关注的是,首次用 U 型与 V 型谷地的损失景观几何解释循环 Transformer 优势,并落地为 SHIFT 分阶段训练加速方案
13LOOPED
循环推理语言模型反复调用相同计算模式,但其内部机制长期不明。本文通过机制分析追踪隐空间动态,发现隐状态会收敛至固定点或形成周期轨迹,并识别出注意力头在推理早、中、晚期的功能分化。该工作为判断模型是有效推进还是无效重复提供了可解释的内部视角。值得关注的是,机制分析图揭示循环推理模型内部的固定点、周期轨迹与注意力头阶段分工
14LOOPED
循环Transformer通过增加迭代次数实现测试时计算扩展,但何时能从简单训练问题外推到困难问题缺乏理论支撑。本文建立不动点稳定性分析框架,证明自主网络仅具可数不动点且输入依赖性弱,而回忆机制与外部归一化可确保不动点同时具备可达性、局部光滑性及稳定反向传播。在棋类、数独、前缀和等算法任务上,内部回忆变体在数独上显著优于标准忆机制,但无单一架构统治所有任务,结果限于单层Transformer。
15LOOPED
Looped Transformer 多次迭代易出现激活值发散或坍缩,本文从动力系统视角证明 LayerNorm 充当隐式增益控制:通过约束激活范数将 Jacobian 谱半径压缩至单位圆附近,保证循环映射渐近稳定。小规模线性实验显示,移除 LayerNorm 后谱半径偏离稳定区间,激活值在数十步内发散。
16LOOPED