Back to Blog GSME:自进化 Agent Harness,核心不是改 prompt 而是诊断病理

GSME:自进化 Agent Harness,核心不是改 prompt 而是诊断病理

Paper
Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity
EverMind AI / 盛大集团 · AAAI 2027 preprint
arxiv.org/abs/2607.13683
同一款冻结的 LLM,配不同的 harness(系统提示、注入知识、控制循环、工具定义、运行时配置),在真实任务上的表现差距可以非常悬殊。让 agent 自己进化 harness 是自然方向,但核心难题不是生成改变,而是知道哪个改变真的有用。GSME 的回答:把提案和信用彻底分开——LLM 诊断失败、写补丁,确定性代码负责所有测量和统计检验。

Harness 比 Model 更影响表现

2026 年已有不少工作让 agent 自进化 coding-agent harness,但都卡在同一问题上:自反馈是 noisy 的——单次评测波动好几个百分点,训练集上涨可能只是过拟合。现有工作通常用"多轮 peak pass rate"证明增益,不设 held-out 分割,无法区分"真的变强了"和"这次运气好"。报告的数字不可审计。

核心设计:提案与信用分离

GSME 将 harness 拆为内核(评测代码、进化机制,不可触碰)和可变表面(prompt / knowledge / runtime / config)。每个 patch 用两个轴定位:where(改了哪个面)和 why(针对哪种病理:思维失控、过早终结、方法锁定等)。

进化循环由 Claude Opus 4.8 作为 evolver 诊断失败轨迹、设计 3-4 个候选补丁,确定性代码负责采样、环境健康检查、K=3 多次评测、三道门控。整个过程绝不碰封闭测试集。

GSME loop
图1:GSME 自进化循环 — evolver 诊断失败、设计补丁,确定性代码负责测量与门控

GSME 归档:按病理类型组织搜索

受 MAP-Elites 启发,但关键区别在于:归档按 (where × why) 病理类型 分格,不按任务 ID。这是反过拟合的核心归纳偏置——搜索空间按"失败模式"组织,而非按训练任务组织。每个格子只保留一个通过门控的精英 patch。

GSME archive matrix
图2:GSME 归档矩阵 — 按 (where × why) 病理类型分格,每个格子保留一个精英 patch

三道门控:每一个被认可的改进从构造上可信

有效性门:环境健康预检,基础设施故障不计为 agent 失败。激活门:patch 没触发就不归功于它。显著性门:不靠"均值提升了"这种确定性规则,而是 paired 2σ 检验(per-task paired difference, z ≥ 1.96)。实验表明,用确定性 Δ>0 规则会 credit 约 60% 的"真·零效果"机制为增益——这正是 non-statistical loop 制造虚假增益的量化证据。

七个领域,+9 到 +15.5 个百分点

冻结 Qwen3.6-27B,跨终端操作、代码、数学、Web 浏览、专业交付、应用/API、仓库级 bug 修复七个领域。六个领域全部通过 paired 2σ 门控,保留率 86%-147%。

领域训练提升封闭测试提升z 值保留率
TB2(终端)+6.3+9.32.71147%
LiveCode+15.8+13.72.6586%
Omni-MATH+10.1+11.73.66115%
BrowseComp++15.8+13.93.9688%
GDPval+8.4+9.22.13109%
AppWorld+17.8+15.56.4487%
results bar
图3:七个领域封闭测试结果 — vanilla vs. 进化后 harness

全场最常出现的赢面是 selective recovery:冻结模型最普遍的失败模式是"思维失控"——reasoning 耗尽 token 预算返回空输出。selective recovery(检测到失控时才关 thinking 并续接)是全场最稳的 patch,在多个领域与 verify-finalize 自检组合成冠军 harness。消融显示:16 倍 token 预算仅 +6.5pp,全局关 thinking 仅 +8.6pp,而 selective recovery 达到 +14.8pp——这是精准靶向而非暴力堆资源。

evolution tree
图4:BrowseComp+ 进化树 — 展示 patch 的组合与淘汰过程

病理→补丁匹配定律

跨模型实验揭示了一个清晰的定律:

模型家族Verify-FinalizeSubmit-Verify保留率
Qwen3.6-27BQwen 3.6+15.5+1.20.87
Qwen3.5-397BQwen 3.5+0.2+13.61.18
Gemini 3 FlashGoogle+5.8+13.51.07

27B 的主导病理是"空 engagement 回合"→ verify-finalize 修好;397B 和 Gemini 的主导病理是"粗心错答"→ submit-verify checklist 修好。匹配的 patch 大幅增益,不匹配的 patch 接近零效果。Gemini 作为非 Qwen 模型同样遵循 careless→checklist 匹配——跨模型家族成立。

论文的精准定位:进化的 harness 本质上不是"更好的脚手架",而是"针对模型失败分布的矫正贴片"。换模型病理变了 patch 就变,但同一病理重现时同类型 patch 会再次生效。

值得关注的两个启示:

1. Agent harness 设计应预留进化接口——让 prompt / knowledge / runtime / config 各面可独立 patch、可门控、可回退。GSME 的 env-gated default-off 确保 vanilla 永远可恢复。

2. 诊断能力比优化能力更值钱。让 LLM 做诊断,让确定性代码做测量和归档——这个分工模式比让 LLM 做所有事靠谱得多,是 agent 自我改进领域应采纳的基本范式。

Tags: #Blog