正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
大语言模型部署后知识固定,无法持续获取新能力;依赖上下文学习获得的知识随会话结束而丢失,而频繁参数更新又会引发灾难性遗忘。如何在模型全生命周期内高效、增量地将短期脆弱记忆转化为稳定长期知识,是持续学习面临的核心挑战。
核心方法
Sleep 范式将模型运行分为 Wake 与 Sleep 两阶段。Sleep 阶段首先进行 Memory Consolidation:通过周期性参数扩展增加低频模块容量,再用 Knowledge Seeding(结合 on-policy 蒸馏与模仿学习)将高频模块知识迁移至新增参数。随后进入 Dreaming 阶段:模型利用强化学习自动生成合成数据课程,在无人监督下演练新知识并优化已有能力,同时在 MoE 中引入随机低秩专家选择以促进知识混合。
实验结论
- 在事实知识注入、少样本学习、长上下文理解和持续学习四类任务上验证了 Sleep 范式的有效性
- 迭代知识蒸馏配合参数增长可有效缓解灾难性遗忘,支持模型全生命周期持续演化
适合谁阅读
持续学习研究者LLM 部署与运维工程师模型架构设计者训练与后训练Agent 系统
可核验的原论文来源和作者
- 作者
- Ali Behrouz, Farnoosh Hashemi, Adel Javanmard, Vahab Mirrokni
- 来源
- arXiv
- 论文 ID
- 2606.03979