论文解读:Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents (arXiv: 2607.08716)
行为状态衰减:一个被忽视的致命缺陷
LLM Agent在多步任务中经常出现这种失败模式:Agent在第五步发现了一个关键信息(比如某命令不能用、某API有限制),但到了第三十步完全遗忘,重新踩同一个坑。信息可能还在context window内,但不再驱动行为。
Meta的团队把这种现象命名为行为状态衰减(Behavioral State Decay)。这个区分很关键:很多memory系统关注"能不能存和检索",但本论文指出更本质的问题是——记忆什么时候应该介入控制流?
记忆即干预:两阶段架构
核心思路:记忆不是存储问题,而是干预问题。一个独立的记忆Agent与执行Agent并行运行,完全不修改执行Agent。
第一阶段:结构化记忆管理。通过预定义工具调用来维护三部分记忆库——
- 私有状态(进度、风险,不对执行Agent可见)
- 知识记忆(稳定事实:任务需求、环境特性、路径)
- 过程记忆(尝试与结果:失败命令、成功修复、诊断结论)
第二阶段:选择性干预。基于更新后的记忆库,记忆Agent要么发出精准提醒注入到执行Agent的下一次调用,要么选择沉默。沉默是显式决策——过多干预反而干扰局部进度。
消融实验:选择性干预的价值
在τ²-Bench上用Sonnet 4.5作为执行Agent的消融结果:
| 配置 | 记忆管理 | 干预方式 | Macro平均 |
|---|---|---|---|
| 完整记忆Agent(本文) | 结构化管理 | 选择性提醒/沉默 | 64.3% |
| 被动暴露全部记忆 | 结构化管理 | 全部暴露 | 61.5% |
| 每步强制注入 | 结构化管理 | 必须提醒 | 63.5% |
| 无记忆库纯指导 | 跳过 | advisor式指导 | 61.0% |
| Mem0通用记忆 | Mem0 ADD | 向量+BM25检索 | 62.1% |
关键发现:被动暴露全部记忆不如选择性干预(-2.8pp);纯advisor指导在某些领域甚至低于baseline;每步强制注入在macro平均上不如选择性沉默。干预校准本身是需要学习的策略。
主实验结果
用Claude Opus 4.6作为记忆Agent,两种执行Agent的pass@1提升:
| Benchmark | 执行Agent | Baseline | +Memory | 提升 |
|---|---|---|---|---|
| Terminal-Bench 2.0 | Sonnet 4.5 | 37.6% | 45.9% | +8.3pp |
| Terminal-Bench 2.0 | Opus 4.6 | 43.5% | 45.9% | +2.4pp |
| τ²-Bench (加权) | Sonnet 4.5 | 55.0% | 61.8% | +6.8pp |
| τ²-Bench (加权) | Opus 4.6 | 66.2% | 68.7% | +2.5pp |
弱模型增益更大,但强模型仍有提升——收益不只是弥补能力不足。
开源记忆策略的初步探索
用SETA数据集对Qwen3.5-27B做SFT+GRPO训练。SFT教会接口和基本纪律(精炼写入、更新过期状态),GRPO进一步校准干预时机。验证集reward有提升,且能部分迁移到Terminal-Bench。记忆干预策略可以被蒸馏到开源模型中。
启示:旁路Agent范式
这篇论文提出了一种通用的"旁路Agent"范式——用独立的、有明确职责边界的Agent处理执行Agent的某个维度,而不修改执行Agent本身。这种关注点分离的工程哲学,比把所有能力塞进一个模型要实用得多。对OpenClaw这类multi-channel agent gateway来说,记忆管理完全可以作为独立模块plug-and-play接入。