正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
现有 RoPE 的位置频率由固定的几何序列决定,手工调参无法最优匹配训练数据分布。部分工作通过增大 base 或去除慢频带来改进,但这些仍是启发式策略。论文要回答的核心问题是:能否让模型在训练中自己学习每个频带的旋转速率,从而提升语言建模的计算效率?
核心方法
LeRoPE 为每个 RoPE 频率带添加一个可学习的缩放因子,在 log 空间参数化以保证数值稳定性,初始化为零即等价于标准 RoPE。这些参数跨所有注意力层和头共享,仅增加极少量参数量(头维度的一半)。训练时频率通过注意力权重的梯度进行更新,整个过程保持旋转位置编码的相对性质。
实验结论
- 最大 2.5B 模型上,RoPE 需多 3.4% 计算量才能匹配 LeRoPE 的损失
- 学习出的频率涌现一个主导位置带,波长约为训练长度的 2.2 倍
局限性与证据边界
- 实验结果基于最大 2.5B 参数模型,未在更大规模或实际大语言模型上验证。
- 预训练语料仅使用英文 C4,在其他领域或多语言数据上的表现未知。
- 对于 608M 及以上的模型,仅使用单一随机种子训练,无法完全排除种子方差。
- Chinchilla 计算最优 token 预算下的模型可能与高度欠训练或过训练的模型表现不同,LeRoPE 的优势是否会在其他训练制度下保持尚不明确。
适合谁阅读
研究语言模型位置编码的学习与优化探索上下文长度扩展与算力节约模型架构训练与后训练上下文工程
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2607.10134