Back to Blog AutoMem:把记忆管理变成一种可训练的认知技能

AutoMem:把记忆管理变成一种可训练的认知技能

Paper
论文解读 · Stanford · 2026-07-02
人脑有一个重要的元能力——元记忆(metamemory):知道什么值得记、什么时候该检索、如何组织知识。这不是天生的,是通过反复练习习得的技能。Stanford 团队把这一认知科学的洞察搬到了 LLM agent 上:记忆管理不是架构设计问题,而是可训练的技能。

文件系统操作作为一等公民

AutoMem 的核心设计极简:把文件系统操作(read、write、search、append、create)提升为和任务动作(移动、攻击、合成)同等地位的动作。模型在同一次 forward pass 里,既可以选择"向北走",也可以选择追加内容到笔记里。每个记忆决策都是可追踪的动作,完整记录在轨迹中。

这看似简单,但把记忆从"架构模块"变成了"行为技能"。传统 RAG、scratchpad、summary buffer 都是预设的固定机制——系统决定了怎么记,模型只能被动使用。AutoMem 让模型自己决定记什么、什么时候查、怎么组织。

AutoMem Framework
图3:AutoMem 框架。两个外循环(scaffold revision + memory proficiency training)驱动内循环 agent 的记忆技能提升,推理时部署两个模型实例。

两个自动优化循环

记忆技能沿两个轴提升:结构(scaffolding)熟练度(proficiency)。但长时任务里,一个 episode 可以跑上万个 step,一个记忆错误可能隐藏几千步才暴露——人类根本没法审查完整轨迹。

AutoMem 的解法是用一个更强的 LLM(meta-LLM)充当"代码审查者",通过两个外循环自动化这两个轴的优化。

循环一:结构优化。 meta-LLM(Claude Opus 4.6)读取完整的 agent 轨迹,诊断记忆使用的失败模式,然后迭代修改 agent 的代码、prompt 和记忆文件 schema。比如在 Crafter 游戏里,meta-LLM 发现 agent 反复尝试不可能的合成操作,就在 scaffold 里加了一个材质检查门——合成前先验证是否拥有所需材料,否则阻止动作。Crafter 经过 5 轮迭代,MiniHack 4 轮,NetHack 2 轮。

循环二:熟练度训练。 在最终 scaffold 上跑大量 episode,meta-LLM(Claude Opus 4.7)从轨迹中筛选"好的记忆决策"作为监督数据,用 LoRA 微调一个专门的 memory specialist。关键是只训练记忆操作部分,不动任务动作的模型权重——通过两个模型实例共享对话历史的方式部署。这保证了记忆技能的提升不会损害已有的任务执行能力。

Performance Results
图1:Memory skill optimization。从 base agent(v0)出发,通过 scaffold 优化和 memory proficiency 训练,三个游戏上均获得显著提升。

不改模型权重,性能翻倍

结果令人印象深刻。用 Qwen2.5-32B-Instruct 作为 base model,只优化记忆(完全不动任务动作的权重),三个程序化生成的长时游戏上获得 2x–4x 的提升:Crafter 25%→51.4%,MiniHack 7.5%→30%,NetHack 0.42%→1.85%。

更关键的是对标:优化后的 32B 模型大幅超越 Qwen2.5-72B,达到 Claude Opus 4.5 和 Gemini 3.1 Pro Thinking 的水平。这意味着在长时任务上,良好的记忆管理比模型规模更有效。

AgentCrafter (%)MiniHack (%)NetHack (%)
前沿闭源模型
Gemini-3.1-Pro-Thinking55.027.52.6
Claude-Opus-4.549.527.52.0
开源模型
DeepSeek-R1 (671B)36.425.01.4
Qwen2.5-72B-Instruct27.35.00.3
AutoMem (Qwen2.5-32B)
base (v0)25.07.50.42
+ scaffold opt.47.2727.51.57
+ memory training51.3630.01.85
Scaffold Analysis
图4:scaffold 优化对行为指标的影响。无效动作率下降32-65%,冗余写入减少68-83%,空检索率降低13-50%。

对 Agent 设计的启示

AutoMem 最重要的洞见不是技术上的,而是观念上的:记忆管理是一种独立可学的技能,和推理、规划一样值得被专门训练。

这和当前 agent 框架(OpenClaw 等)的做法形成了鲜明对比。大部分框架的记忆是预设架构——代码决定了怎么存、怎么取。AutoMem 提出的问题是:如果让模型自己学怎么管理记忆,效果会不会更好?答案是肯定的,而且提升幅度远超预期。

第二个启示是 meta-LLM 驱动的自动化优化。长时任务的轨迹审查是人类无法完成的,但 Claude Opus 4.6/4.7 可以读取上万步的完整轨迹并给出精确的诊断和修改建议。这实际上是一种"LLM 做 LLM 的 system engineer"的模式——用更强的模型来优化 agent 的非参数组件(代码、prompt、数据选择)。

局限也很明显:当前记忆是 episodic 的(每次 episode 重置),不支持跨 episode 的持久记忆;只在游戏环境验证;每个环境需要独立优化 scaffold。但从 32B 撑到 frontier 级别这个结果,足以说明记忆技能的杠杆率有多高。

Tags: #Blog