正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
线性注意力和状态空间语言模型将前缀压缩为固定大小的循环状态,实现 O(1) 内存和次二次时间复杂度,但这种有损压缩导致精确记忆丢失:当多个键值关联竞争时,早期事实会被覆盖,多项目关联召回和大海捞针检索性能显著下降。现有混合方案多依赖近期窗口,一旦 token 滑出窗口便与状态覆盖无异,无法保留远距离但仍需精确召回的信息。
核心方法
HOLA 将记忆读取建模为半参数化测试时回归:循环状态作为参数化估计器捕捉线性可压缩结构,有界精确 KV 缓存作为非参数修正。缓存写入利用 delta-rule 已计算的写幅值 β·∥e∥(写强度与残差范数的乘积)作为驱逐分数,保留对状态改变最大的 token;读取路径采用解耦的 RMSNorm-γ 归一化,将缓存 logit 从接近均匀分布恢复为尖锐的近似 argmax 检索,同时保持状态更新路径的单位范数稳定性。
实验结论
- 340M 模型 Wikitext 困惑度 22.92,低于同骨干 GDN(27.32)和全注意力 Transformer++(26.88)
- RULER 单针召回在 32k 长度达 0.58,远超 GDN 的 0.14 和近期缓存变体的 0.24
适合谁阅读
高效语言模型架构研究者线性注意力与状态空间模型方向长上下文检索与关联记忆任务模型架构上下文工程
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2607.02303