Harness 比 Model 更影响表现
2026 年已有不少工作让 agent 自进化 coding-agent harness,但都卡在同一问题上:自反馈是 noisy 的——单次评测波动好几个百分点,训练集上涨可能只是过拟合。现有工作通常用"多轮 peak pass rate"证明增益,不设 held-out 分割,无法区分"真的变强了"和"这次运气好"。报告的数字不可审计。
核心设计:提案与信用分离
GSME 将 harness 拆为内核(评测代码、进化机制,不可触碰)和可变表面(prompt / knowledge / runtime / config)。每个 patch 用两个轴定位:where(改了哪个面)和 why(针对哪种病理:思维失控、过早终结、方法锁定等)。
进化循环由 Claude Opus 4.8 作为 evolver 诊断失败轨迹、设计 3-4 个候选补丁,确定性代码负责采样、环境健康检查、K=3 多次评测、三道门控。整个过程绝不碰封闭测试集。
GSME 归档:按病理类型组织搜索
受 MAP-Elites 启发,但关键区别在于:归档按 (where × why) 病理类型 分格,不按任务 ID。这是反过拟合的核心归纳偏置——搜索空间按"失败模式"组织,而非按训练任务组织。每个格子只保留一个通过门控的精英 patch。
三道门控:每一个被认可的改进从构造上可信
有效性门:环境健康预检,基础设施故障不计为 agent 失败。激活门:patch 没触发就不归功于它。显著性门:不靠"均值提升了"这种确定性规则,而是 paired 2σ 检验(per-task paired difference, z ≥ 1.96)。实验表明,用确定性 Δ>0 规则会 credit 约 60% 的"真·零效果"机制为增益——这正是 non-statistical loop 制造虚假增益的量化证据。
七个领域,+9 到 +15.5 个百分点
冻结 Qwen3.6-27B,跨终端操作、代码、数学、Web 浏览、专业交付、应用/API、仓库级 bug 修复七个领域。六个领域全部通过 paired 2σ 门控,保留率 86%-147%。
| 领域 | 训练提升 | 封闭测试提升 | z 值 | 保留率 |
|---|---|---|---|---|
| TB2(终端) | +6.3 | +9.3 | 2.71 | 147% |
| LiveCode | +15.8 | +13.7 | 2.65 | 86% |
| Omni-MATH | +10.1 | +11.7 | 3.66 | 115% |
| BrowseComp+ | +15.8 | +13.9 | 3.96 | 88% |
| GDPval | +8.4 | +9.2 | 2.13 | 109% |
| AppWorld | +17.8 | +15.5 | 6.44 | 87% |
全场最常出现的赢面是 selective recovery:冻结模型最普遍的失败模式是"思维失控"——reasoning 耗尽 token 预算返回空输出。selective recovery(检测到失控时才关 thinking 并续接)是全场最稳的 patch,在多个领域与 verify-finalize 自检组合成冠军 harness。消融显示:16 倍 token 预算仅 +6.5pp,全局关 thinking 仅 +8.6pp,而 selective recovery 达到 +14.8pp——这是精准靶向而非暴力堆资源。
病理→补丁匹配定律
跨模型实验揭示了一个清晰的定律:
| 模型 | 家族 | Verify-Finalize | Submit-Verify | 保留率 |
|---|---|---|---|---|
| Qwen3.6-27B | Qwen 3.6 | +15.5 | +1.2 | 0.87 |
| Qwen3.5-397B | Qwen 3.5 | +0.2 | +13.6 | 1.18 |
| Gemini 3 Flash | +5.8 | +13.5 | 1.07 |
27B 的主导病理是"空 engagement 回合"→ verify-finalize 修好;397B 和 Gemini 的主导病理是"粗心错答"→ submit-verify checklist 修好。匹配的 patch 大幅增益,不匹配的 patch 接近零效果。Gemini 作为非 Qwen 模型同样遵循 careless→checklist 匹配——跨模型家族成立。
论文的精准定位:进化的 harness 本质上不是"更好的脚手架",而是"针对模型失败分布的矫正贴片"。换模型病理变了 patch 就变,但同一病理重现时同类型 patch 会再次生效。
值得关注的两个启示:
1. Agent harness 设计应预留进化接口——让 prompt / knowledge / runtime / config 各面可独立 patch、可门控、可回退。GSME 的 env-gated default-off 确保 vanilla 永远可恢复。
2. 诊断能力比优化能力更值钱。让 LLM 做诊断,让确定性代码做测量和归档——这个分工模式比让 LLM 做所有事靠谱得多,是 agent 自我改进领域应采纳的基本范式。