中心化记忆的三重毒害
多智能体系统(MAS)的记忆几乎都是中心化的:MetaGPT 的全局消息池、G-Memory 的层次化共享图——所有 agent 从同一个池子读写。DecentMem 的作者认为这是"错误的默认值",并给出了三个致命问题:
❌ 中心化记忆
- 多样性坍缩:所有 agent 从同一池检索 → 行为趋同 → 系统退化为单策略
- 协调税:并发读写需同步,开销随 agent 数线性增长
- 隐私风险:一个 agent 的经验对所有 agent 可见
✅ DecentMem 去中心化
- 多样性保持:经验私有,agent 保持角色互补性
- 低开销:私有池无并发冲突,检索/更新高效
- 隐私安全:经验不跨 agent 泄露
一个关键实验发现:协调随机性越高,去中心化的优势越大。在 Qwen3 系列上,从 AutoGen(预设工作流)到 DyLAN(部分随机)到 AgentNet(机会主义),DecentMem 对中心化基线的优势从 2.7% 扩大到 23.1%。这直接验证了核心论点——协调越不可预测,中心化记忆的同质化效应越严重。
双池记忆 + 在线路由
DecentMem 的核心设计是每个 agent 维护两个私有记忆池:
利用池(E-pool):存储已验证的成功轨迹。Agent 通过语义相似性匹配在 E-pool 中进行局部搜索,复用已知的好策略。E-pool 覆盖"已知好区域"——经验积累的价值在这里体现。
探索池(X-pool):存储 LLM 生成的候选策略,覆盖 agent 从未尝试过的策略空间。X-pool 注入"新区域的概率质量"——打破纯利用的局部最优陷阱。
两个池的组合是一个经典的 explore-exploit 问题,但 DecentMem 的关键创新在于在线加权:不是用固定 ε-greedy 或固定比例,而是由 LLM-as-a-judge 在每个推理阶段评估后动态调整 E-pool 和 X-pool 的贡献权重。相当于每个 agent 在运行时自己学习自己的探索-利用平衡。
消融实验证实了这个设计的必要性:
| 路由策略 | AgentNet | DyLAN | AutoGen |
|---|---|---|---|
| 在线加权(DecentMem) | 最佳 | 最佳 | 最佳 |
| 仅利用(α=1) | -6.93% | -3.51% | -3.38% |
| 仅探索(α=0) | BBH 崩溃 | BBH 崩溃 | BBH 崩溃 |
| 固定 50/50 | 最弱 | 最弱 | 最弱 |
值得注意的是"仅探索"在不同 benchmark 上表现差异极大——在 BBH(需要可复用结构的推理任务)上彻底崩溃,但在 AIME(新鲜数学推理)上仍有竞争力。这说明探索能力对新问题有效,但无法替代经验积累。
理论保证
论文给出了两个理论结果,为经验观察提供解释:
全局可达性:E-pool 和 X-pool 的联合覆盖保证所有 agent 的联合策略空间都能被探索到。E-pool 覆盖已知好区域(基于已验证轨迹的邻域搜索),X-pool 注入覆盖(LLM 生成候选策略填充未访问区域)。两者互补确保没有可行解被遗漏。
O(log T) 累积遗憾:在线路由策略的累积遗憾与随机 bandit 的信息论下界只差常数因子。这意味着 DecentMem 的在线路由策略在信息效率上接近最优——每个 agent 学到足够快的 explore-exploit 平衡。
关键实验:Qwen3 系列
以下展示 Qwen3-4B 和 Qwen3-14B 在三个 MAS 框架上的核心结果(AIME 数学、MBPP-Plus 代码、ALFWorld 具身、BBH 推理):
| 框架 | 记忆方法 | AIME | MBPP | ALFWorld | BBH | 平均 |
|---|---|---|---|---|---|---|
| Qwen3-4B | ||||||
| AgentNet | No memory | 13.33 | 53.20 | 46.12 | 28.13 | 35.20 |
| MetaGPT | 8.33 | 59.14 | 50.47 | 40.86 | 39.70 | |
| ChatDev | 18.33 | 56.40 | 49.23 | 33.67 | 39.41 | |
| G-Memory | 10.00 | 63.18 | 52.14 | 48.14 | 43.37 | |
| DecentMem | 23.33 | 67.53 | 64.45 | 59.43 | 53.69 | |
| DyLAN | No memory | 16.67 | 54.72 | 48.54 | 41.17 | 40.28 |
| G-Memory | 18.33 | 63.93 | 52.30 | 43.97 | 44.63 | |
| DecentMem | 26.67 | 64.50 | 57.25 | 52.19 | 50.15 | |
| ChatDev | 21.67 | 61.23 | 48.56 | 44.73 | 44.05 | |
| Qwen3-14B | ||||||
| AgentNet | No memory | 26.67 | 68.72 | 66.20 | 42.61 | 51.05 |
| G-Memory | 23.33 | 71.29 | 75.61 | 68.52 | 59.69 | |
| DecentMem | 41.66 | 82.27 | 83.59 | 84.30 | 72.95 | |
| ChatDev | 36.67 | 76.78 | 68.50 | 48.92 | 57.72 | |
| AutoGen | No memory | 30.00 | 74.21 | 81.51 | 67.33 | 63.26 |
| G-Memory | 33.33 | 85.23 | 96.69 | 89.20 | 76.11 | |
| ChatDev | 33.33 | 80.36 | 94.89 | 79.28 | 71.97 | |
| DecentMem | 35.00 | 84.74 | 93.13 | 90.50 | 75.84 | |
几个值得注意的模式:
Qwen3-4B + AgentNet 是 DecentMem 优势最大的场景——从无记忆的 35.2% 提升到 53.7%(+18.5pp,相对提升 52.5%)。在小模型 + 高随机性协调的组合下,中心化记忆的劣势暴露得最彻底。
Qwen3-14B + AgentNet 上 DecentMem 在 BBH 达到 84.3%,比 G-Memory 的 68.5% 高出 15.8pp。这个差距在推理任务上尤为显著——中心化记忆让 agent 陷入相似的推理路径,而私有记忆让不同 agent 发展出互补的推理策略。
成本分析:Token 减半
在 BBH benchmark 上(Qwen3-8B),DecentMem 在三个框架上都位于"性能-成本"帕累托前沿的左上角——最高准确率 + 最低 token 成本。token 消耗减少的原因直观:私有记忆池比共享池更小、更聚焦,agent 只检索与自己角色相关的经验,避免了共享池中大量无关记忆的检索开销。
具体数据:在 AgentNet 上 token 从 G-Memory 的 ~5.5×10⁸ 降到 DecentMem 的 ~2.1×10⁸(-62%);在 DyLAN 上从 ~3.9×10⁸ 降到 ~3.9×10⁸(持平);在 AutoGen 上从 ~5.5×10⁸ 降到 ~2.1×10⁸(-62%)。
与 DeLM 的对照
这篇论文与 DeLM(arXiv 2606.10662)形成了天然互补:
| 维度 | DeLM | DecentMem |
|---|---|---|
| 解决的问题 | 协调机制的去中心化 | 记忆存储的去中心化 |
| 核心机制 | 共享已验证上下文 + 任务队列 | 私有双池记忆 + 在线路由 |
| 共享策略 | 共享上下文(但验证后写入) | 完全私有,不跨 agent |
| 目标 benchmark | SWE-bench, LongBench | AIME, MBPP, ALFWorld, BBH |
| 理论支撑 | 无(纯工程) | 全局可达性 + O(log T) 遗憾 |
两者指向同一方向:在多智能体系统中,去中心化不是妥协,而是更高效的默认选项。一个有趣的未来方向是两者结合——用 DecentMem 的私有双池作为 DeLM 框架中每个 agent 的本地记忆,同时保留 DeLM 的共享验证上下文作为"公告栏"。私有记忆保持多样性,共享上下文保证基本协调,验证写入防止信息污染。
评价
DecentMem 的贡献不仅在性能数字——更重要的是它动摇了一个根深蒂固的默认假设:多智能体应该共享记忆。论文用实证和理论双重证据说明,共享记忆带来的同质化效应足以抵消其信息共享的好处。
双池记忆 + 在线路由的设计本身并不复杂,但论文的实验设计非常扎实:5 个 benchmark × 3 个 MAS 框架 × 5 个 backbone = 75 组实验,加上消融、自演化曲线和成本分析,结论的可信度高。
一个值得注意的局限:论文假设 agent 之间可以通过任务分配机制实现间接协调(通过 MAS 框架),但记忆完全私有。在需要 agent 之间直接共享经验的场景下(如跨 agent 的技能迁移),DecentMem 的设计可能需要扩展——比如允许经过验证的"技能片段"在 agent 之间有条件共享。