中心化 MAS 的瓶颈在哪里
多智能体系统(MAS)通过将复杂问题分解为并行子任务来放大 LLM 的推理能力。但绝大多数现有框架——包括 Claude Code Subagents、Kimi Agent Swarm、AOrchestra——都采用中心化编排模式:一个主 agent 负责问题分解、子任务分配、结果收集和合并。这是一个同步的 scatter-gather 循环。
这种模式的问题随着子任务数量增长而急剧放大。控制器成为通信和集成的瓶颈,整体进度被最慢的子 agent 锁定。DeLM 的出发点很简单:这个瓶颈是不必要的。
DeLM 架构:共享上下文 + 任务队列
DeLM 的核心是两个共享数据结构:
共享上下文 C:一个所有 agent 都能读写、持续累积的已验证状态。每个 agent 可以读取前人的进展,在此基础上继续推进,而不需要经过任何中央路由。这相当于一个多写多读的共享黑板(blackboard)。
任务队列 T:初始子任务和运行中动态生成的新子任务排队等待被认领。Agent 异步地从队列中认领任务,而不是等控制器分配。
每个 agent 执行一个统一的三步循环:
第一步:认领与读取。Agent 从任务队列认领子任务 Ti,读取当前共享上下文 C(包含所有已验证的前序进展)和相关的本地上下文(原始代码、文档等)。
第二步:本地推理。Agent 基于认领的子任务和已有上下文独立执行推理,产出结果 ri。这一步完全并行,不同 agent 之间没有通信。
第三步:压缩、验证、写回。结果 ri 被压缩为紧凑的 gist Gi,经过验证后写入共享上下文。验证确保只有忠实反映原始推理结果的更新才能进入全局状态。
这三个步骤的异步性是关键:agent 不需要等所有其他 agent 完成,不需要同步屏障,共享上下文充当"解耦"的通信介质。
两层压缩与入场验证
在长文档场景中,agent 处理的内容可能非常庞大,如果直接写回共享上下文,上下文会迅速膨胀,后续 agent 的信息检索效率也会降低。DeLM 采用两层压缩策略:
第一层:带引用摘要 Si。原始内容 ui 被压缩为一组要点,每个要点必须以 [ref: head ... tail] 格式引用原文中的精确片段。这个引用机制提供了可追溯性——任何摘要要点都可以追溯到原始文档的某个位置。
第二层:紧凑 gist Gi。摘要 Si 进一步被压缩为更紧凑的 gist,存入共享上下文 C。Gist 是后续 agent 默认看到的信息层——它足够浓缩,不会撑爆上下文窗口。
入场验证机制:只有通过验证的更新才能写入共享上下文。摘要的每个要点必须通过引用验证(head 和 tail 必须在原文中按原样出现);gist 必须通过一个轻量级 LLM 的语义一致性检查。未通过的更新要么重写,要么被退回任务队列附上拒绝原因。
这个设计防止了错误信息和幻觉的级联传播——一旦某個 agent 的错误结论写入共享上下文,后续所有 agent 都会基于错误前提推理。验证机制是阻断这种传播的防火墙。
关键实验:SWE-bench Verified
| 方法 | Avg.@1 | Pass@2 | Pass@4 | 成本/任务 |
|---|---|---|---|---|
| 基础模型:Gemini 3 Flash | ||||
| mini-SWE-agent | 54.7% | 65.6% | 75.1% | $0.26 |
| Claude Code | 49.3% | 57.1% | 66.3% | – |
| AOrchestra | 55.2% | 64.5% | 73.2% | $0.24 |
| AOrchestra-Parallel | 56.4% | 63.2% | 71.8% | $0.25 |
| DeLM | 65.7% | 72.9% | 77.4% | $0.12 |
| 基础模型:Claude Opus 4.6 | ||||
| mini-SWE-agent | 76.9% | 79.8% | 81.7% | $0.61 |
| Claude Code | 76.1% | 79.5% | 81.3% | $0.69 |
| AOrchestra | 74.7% | 78.3% | 80.1% | $0.70 |
| AOrchestra-Parallel | 75.2% | 78.1% | 79.7% | $0.73 |
| DeLM | 78.0% | 80.7% | 82.5% | $0.63 |
基于 Gemini 3 Flash 的结果尤其令人印象深刻:DeLM 的 Avg.@1 从 AOrchestra 的 55.2% 跳到 65.7%(+10.5pp),Pass@4 从 73.2% 升到 77.4%,同时成本从 $0.24 降到 $0.12——成本减半,性能反而大幅提升。这说明中心化协调的开销不仅体现在延迟上,也体现在质量上。
基于 Claude Opus 4.6 的结果中,由于基线已经很高(~76-77%),DeLM 的提升相对温和(+1.1-1.8pp),但仍然在所有指标上一致领先,且成本最低。
长文档问答:LongBench-v2
| 方法 | 金融(15) | 政务(23) | 新闻(23) | 法律(14) | 学术(50) | 平均 |
|---|---|---|---|---|---|---|
| 基础模型:GPT-5.4 | ||||||
| Base | 62.2 | 39.1 | 50.5 | 62.0 | 56.0 | 53.9 |
| Claude Code | 65.0 | 36.2 | 50.7 | 59.5 | 60.7 | 54.4 |
| ReadAgent | 57.8 | 34.8 | 52.2 | 61.9 | 58.0 | 53.0 |
| DeLM | 71.1 | 43.5 | 65.2 | 64.3 | 56.0 | 60.1 |
| 基础模型:Claude Sonnet 4.6 | ||||||
| Base | 68.9 | 34.8 | 46.4 | 52.4 | 64.0 | 53.3 |
| Claude Code | 66.7 | 42.0 | 47.8 | 50.0 | 52.0 | 51.7 |
| ReadAgent | 62.2 | 44.9 | 43.5 | 57.1 | 64.7 | 54.5 |
| DeLM | 73.3 | 46.4 | 55.1 | 59.5 | 64.7 | 59.8 |
DeLM 在四个模型家族(GPT-5.4、Claude Sonnet 4.6、Gemini 3 Flash、Claude Opus 4.6)上的五个领域均取得了最高平均准确率。在 GPT-5.4 上,从基线的 53.9% 提升到 60.1%(+6.2pp),在 Gemini 3 Flash 上从 57.1% 提升到 62.3%。
尤其值得注意的是政务领域的表现——传统上这个领域最难,但 DeLM 在 GPT-5.4 上从 39.1% 提升到 43.5%,在 Claude Sonnet 4.6 上从 34.8% 提升到 46.4%。这暗示去中心化的并行文档处理确实有效提升了复杂推理场景下的信息整合质量。
消融分析:哪些组件真正有效
消融实验揭示了几个关键发现:
验证模块不可省略。去掉入场验证后,准确率显著下降——这证实了防止错误信息在共享上下文中传播的重要性。没有验证的共享状态就像没有审核的维基百科——信息质量会迅速退化。
压缩的有效性。两层压缩(带引用摘要 + gist)显著优于只用单层压缩。Stage-1 的引用机制提供了可追溯性,Stage-2 的 gist 控制了上下文大小——两者互补,缺一不可。
按需展开。Agent 默认只读 gist,但可以按需展开到摘要层获取细节。消融显示这个机制在需要精细证据推理的子任务上特别重要——它避免了"一刀切"的信息粒度。
与 RLM 的对比
论文还对比了 DeLM 与近期热门的 Reasoning Language Model (RLM) 方法。有趣的是,两者的组合(DeLM + RLM)在两个 benchmark 上都取得了最佳效果:
| 方法 | LongBench-v2 准确率 | 成本/任务 |
|---|---|---|
| RLM | 55.8% | $0.29 |
| DeLM | 57.9% | $0.30 |
| DeLM + RLM | 60.3% | $0.24 |
组合后不仅准确率最高,成本反而最低——DeLM 的共享上下文减少了冗余的 token 消耗,RLM 的推理增强提升了单次执行质量,两者产生了协同效应。
KV-cache 复用:一个被低估的工程优势
DeLM 的共享上下文设计还带来了一个意外的工程优势:由于共享上下文 C 作为累积的稳定前缀出现在每次 LLM 调用的开头,KV-cache 可以跨调用复用。在多步推理场景中,很多 LLM 调用共享相同的前缀但只差异在任务特定的后缀——这意味着重复的前缀计算可以被摊销。
随着推理步骤增多,这个优势会线性增长。这是中心化 MAS 做不到的——因为每个子 agent 看到的"全局状态"是控制器临时组装的,每次调用都不同,KV-cache 无法跨调用累积。
评价
DeLM 的贡献不在某个惊天的算法突破,而在于一个"正确的"架构选择:用共享状态替代中央控制。这个选择带来的好处是全方位的——更高的准确率、更低延迟、更低成本、更好的 KV-cache 利用、更好的可扩展性。
从更广的视角看,这篇论文印证了一个正在形成的共识:在多智能体场景中,瓶颈不在单个 agent 的智能水平,而在 agent 之间的协调效率。DeLM 给出了一个经过充分验证的工程答案——共享已验证上下文 + 任务队列 + 异步并行。这个模式的适用范围远超 SWE-bench 和 LongBench——任何需要多 agent 并行处理复杂任务的场景都值得参考。
一个值得思考的问题:两层压缩 + 引用验证的模式,能否扩展到 agent 协作产出的不仅是摘要,而是代码、实验结果、甚至是新的研究假设?如果可以,DeLM 的架构可能就是 DeepMind 那篇 ASI 报告中"多智能体涌现"路径的基础设施原型。