Back to Blog 大模型需要

大模型需要"睡觉"从人类记忆巩固到LLM持续学习新范式

Paper

论文解读:Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories (arXiv: 2606.03979)

核心观点:LLM存在和人类顺行性遗忘症相似的结构性缺陷——只有短期记忆(上下文)和凝固的长期记忆(预训练参数),没有中间的巩固机制。Google Research提出"睡眠"范式:周期性将短期脆弱知识蒸馏为稳定长期知识(NREM式巩固),再通过自生成合成数据迭代改进(REM式做梦)。在数学推理、持续学习、长上下文、新语言学习等任务上全面超越SFT和GRPO。
Paper Title Page
论文标题页 — Language Models Need Sleep (Ali Behrouz et al., Google Research)

LLM的结构性"失忆"

Transformer中的注意力机制相当于短期记忆——上下文结束后知识消失;MLP层相当于固化在"训练截止日期"前的长期记忆,部署后不再更新。中间没有任何机制把短期获得的新知识转移为稳定的长期知识。

这与人类顺行性遗忘症高度相似:海马体(短期)到新皮层(长期)的信息转移被阻断。人类的解决机制是睡眠——通过NREM慢波睡眠进行记忆巩固,通过REM睡眠进行自我整合。

Sleep Paradigm
图1:传统机器学习 vs 持续学习。持续学习者不需要训练/测试的区分,而是需要"清醒"(接收新数据)和"睡眠"(内部处理)两个交替阶段。

睡眠的两阶段设计

阶段一:记忆巩固(NREM / 慢波睡眠)

  • 参数扩展:在目标低频MLP块中新增低秩expert。这些参数初始被mask,在睡眠时激活——类比神经可塑性:容量固定,但连接可随经验建立。
  • 知识播种(Knowledge Seeding):新颖的"向上蒸馏"——小模型(当前状态)将知识蒸馏给更大的自己。混合on-policy分布对齐(GKD风格)+ RL模仿学习(教师生成→随机mask→学生续写→语义+编辑距离加权奖励)。
  • 突触修剪:转移完成后清空发送方之前添加的参数,释放容量。
Memory Consolidation
图2:记忆巩固过程。模型增加自身参数容量,然后通过知识播种将知识从高频记忆转移到低频记忆。

阶段二:做梦(REM睡眠)

  • MoE路由器额外随机选择无关expert,强制混合不同知识域,探索隐藏模式
  • 梯度重要性评分筛选有价值的dream + 随机采样保持多样性
  • 每个dream独立SFT微调,ReSTEM评估性能提升作为reward

核心架构:Continuum Memory System

CMS Frequency
CMS由不同更新频率的MLP块组成。注意力最高频(每token),MLP(1)中等频率,MLP(k)最低频。睡眠在每个模块更新前触发,确保脆弱知识在覆盖前被转移。

实验:全面超越现有方法

数学推理(Qwen3-8B)

方法AIME-24AIME-25HMMT-25
Base (Instruct)73.868.142.4
SFT75.566.443.7
GRPO76.468.144.9
Sleep79.269.046.1

消融显示每个组件都贡献正向收益:移除模仿学习-1.0~-1.1,移除语义奖励-0.3~-0.9,移除参数扩展-1.0~-1.1。达到同等性能时比SFT快4.3-4.8倍。

持续学习(文本分类增量)

CLINC
CLINC数据集
NIAH
多Key检索(长上下文)

Hope+Sleep在CLINC、Banking、DBpedia上一致最优。长上下文任务中,增加consolidation阶段数量持续改善性能。

新语言学习 + BABILong超长上下文

CTNL
持续学习新语言:ICL出现灾难性遗忘,Hope-3几乎恢复单语言性能
BABILong
BABILong:Hope在10M token仍近乎完美,GPT-4在128K-256K即退化

知识整合与Few-shot推理

方法知识整合 (SQuAD, n=1)ARC抽象推理成功率
SEAL46.7%72.5%
Sleep48.9%80%
Sleep - Dreaming35.7%

移除dreaming后知识整合暴跌至35.7%——做梦阶段的贡献巨大。

工程意义

这篇论文提供了一个原则性的持续学习框架:不依赖外部数据(睡眠阶段自生成训练数据);增量式参数增长避免容量瓶颈;"先巩固再自改进"的两阶段设计比直接迭代自训练更抗遗忘。

对于构建真正可持续演进的agent系统,"清醒-睡眠"生命周期是一个值得参考的方向——agent不只是被动接收指令后执行,还需要周期性的内部处理来完成记忆巩固和自我提升。

Tags: #Blog