正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前大语言模型的强化学习后训练研究大多将其与预训练割裂,导致两个基本问题悬而未决:预训练的选择(模型规模、数据量)如何影响强化学习的计算回报?强化学习究竟对模型做了什么?由于标准语言模型预训练语料庞大且不可控,跨阶段的系统计算扫描成本过高,这些问题难以直接研究。
核心方法
作者以国际象棋为可控测试平台,复现标准大语言模型训练流程:在 Lichess 人类对局数据上预训练 5M 至 1B 参数模型,用从预训练策略采样的合成推理轨迹做监督微调,再在可验证奖励的谜题环境中用 Group Relative Policy Optimization 进行强化学习。通过 36 种预训练–强化学习计算组合的系统扫描,拟合并验证联合缩放律,并在逐步级别分析策略演化机制。
实验结论
- 预训练验证损失与给定 RL 计算量下的 pass@1 强相关,Spearman 相关系数在 log10 C_ref = 20 时达 −0.99
- RL 局部收益斜率随预训练 token 对数近似线性增长,联合拟合 R² = 0.84
局限性与证据边界
- 原文未给出数学领域实验的具体 pass@1 数值或斜率参数
- 原文未说明该缩放律是否适用于非推理类任务(如生成或分类)
- 原文未提供超过 1B 参数模型的验证结果
- 原文未讨论该规律在自然语言推理任务(如 GSM8K、MATH)上的直接适用性
适合谁阅读
关注大语言模型预训练与后训练计算分配的研究者研究强化学习对推理策略演化机制的工程师设计训练流水线缩放策略的系统团队训练与后训练强化学习
可核验的原论文来源和作者
- 作者
- Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov
- 来源
- arXiv
- 论文 ID
- 2607.16097