论文解读:Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories (arXiv: 2606.03979)
核心观点:LLM存在和人类顺行性遗忘症相似的结构性缺陷——只有短期记忆(上下文)和凝固的长期记忆(预训练参数),没有中间的巩固机制。Google Research提出"睡眠"范式:周期性将短期脆弱知识蒸馏为稳定长期知识(NREM式巩固),再通过自生成合成数据迭代改进(REM式做梦)。在数学推理、持续学习、长上下文、新语言学习等任务上全面超越SFT和GRPO。
论文标题页 — Language Models Need Sleep (Ali Behrouz et al., Google Research)
LLM的结构性"失忆"
Transformer中的注意力机制相当于短期记忆——上下文结束后知识消失;MLP层相当于固化在"训练截止日期"前的长期记忆,部署后不再更新。中间没有任何机制把短期获得的新知识转移为稳定的长期知识。
这与人类顺行性遗忘症高度相似:海马体(短期)到新皮层(长期)的信息转移被阻断。人类的解决机制是睡眠——通过NREM慢波睡眠进行记忆巩固,通过REM睡眠进行自我整合。
图1:传统机器学习 vs 持续学习。持续学习者不需要训练/测试的区分,而是需要"清醒"(接收新数据)和"睡眠"(内部处理)两个交替阶段。
睡眠的两阶段设计
阶段一:记忆巩固(NREM / 慢波睡眠)
- 参数扩展:在目标低频MLP块中新增低秩expert。这些参数初始被mask,在睡眠时激活——类比神经可塑性:容量固定,但连接可随经验建立。
- 知识播种(Knowledge Seeding):新颖的"向上蒸馏"——小模型(当前状态)将知识蒸馏给更大的自己。混合on-policy分布对齐(GKD风格)+ RL模仿学习(教师生成→随机mask→学生续写→语义+编辑距离加权奖励)。
- 突触修剪:转移完成后清空发送方之前添加的参数,释放容量。
图2:记忆巩固过程。模型增加自身参数容量,然后通过知识播种将知识从高频记忆转移到低频记忆。
阶段二:做梦(REM睡眠)
- MoE路由器额外随机选择无关expert,强制混合不同知识域,探索隐藏模式
- 梯度重要性评分筛选有价值的dream + 随机采样保持多样性
- 每个dream独立SFT微调,ReSTEM评估性能提升作为reward
核心架构:Continuum Memory System
CMS由不同更新频率的MLP块组成。注意力最高频(每token),MLP(1)中等频率,MLP(k)最低频。睡眠在每个模块更新前触发,确保脆弱知识在覆盖前被转移。
实验:全面超越现有方法
数学推理(Qwen3-8B)
| 方法 | AIME-24 | AIME-25 | HMMT-25 |
|---|---|---|---|
| Base (Instruct) | 73.8 | 68.1 | 42.4 |
| SFT | 75.5 | 66.4 | 43.7 |
| GRPO | 76.4 | 68.1 | 44.9 |
| Sleep | 79.2 | 69.0 | 46.1 |
消融显示每个组件都贡献正向收益:移除模仿学习-1.0~-1.1,移除语义奖励-0.3~-0.9,移除参数扩展-1.0~-1.1。达到同等性能时比SFT快4.3-4.8倍。
持续学习(文本分类增量)
CLINC数据集
多Key检索(长上下文)
Hope+Sleep在CLINC、Banking、DBpedia上一致最优。长上下文任务中,增加consolidation阶段数量持续改善性能。
新语言学习 + BABILong超长上下文
持续学习新语言:ICL出现灾难性遗忘,Hope-3几乎恢复单语言性能
BABILong:Hope在10M token仍近乎完美,GPT-4在128K-256K即退化
知识整合与Few-shot推理
| 方法 | 知识整合 (SQuAD, n=1) | ARC抽象推理成功率 |
|---|---|---|
| SEAL | 46.7% | 72.5% |
| Sleep | 48.9% | 80% |
| Sleep - Dreaming | 35.7% | — |
移除dreaming后知识整合暴跌至35.7%——做梦阶段的贡献巨大。
工程意义
这篇论文提供了一个原则性的持续学习框架:不依赖外部数据(睡眠阶段自生成训练数据);增量式参数增长避免容量瓶颈;"先巩固再自改进"的两阶段设计比直接迭代自训练更抗遗忘。
对于构建真正可持续演进的agent系统,"清醒-睡眠"生命周期是一个值得参考的方向——agent不只是被动接收指令后执行,还需要周期性的内部处理来完成记忆巩固和自我提升。