一句话结论:并行分析大量执行轨迹,通过归纳推理把反复出现的教训合并成精炼的 SOP——生成的技能能跨模型、跨任务、跨领域迁移,推理时零额外开销。
图 1:Trace2Skill 框架——并行分析轨迹 → 层次化合并 → 统一技能文档(右),对比传统的顺序编辑(左)
🎯 核心问题
上一篇 ContinualSkillBench 的结论让人丧气:Agent 的"技能进化"大部分是假象。这篇 Trace2Skill 直接回应——给出了一个让技能进化真正有效的方法。
关键洞察:之前的方法要么顺序编辑技能(依赖编辑顺序),要么存成检索记忆(推理时额外开销)。Trace2Skill 并行分析大量轨迹,通过归纳推理合并成单个精炼技能。
🧪 三阶段流水线
1.并行轨迹生成。ReAct 循环跑 200 个问题,收集成功和失败轨迹。
2.128 个子 Agent 并行分析。每条轨迹提取"错误补丁"或"成功模式"。
3.层次化合并。按主题分组 → 每组合并为 SOP → 整合进统一技能文档。这是核心:从具体经验归纳出一般性方法论
📊 三领域验证
表 1:SpreadsheetBench 结果——Deepening(深化人工技能)和 Creation(从零创建)均产生可迁移的技能
电子表格。35B 模型深化人工技能后 Avg 最佳。跨模型迁移显著:122B 蒸馏的技能让 35B 在 WikiTableQuestions 上提升 +57.65pp。
数学推理。从 DAPO 蒸馏,在 held-out DAPO 和 AIME 2026 均有效。+Error(只用失败轨迹)跨模型迁移最稳定。
视觉问答(DocVQA)。仅 50 个样本蒸馏,在 5299 个 held-out 样本上 ANLS +0.25,Accuracy +22.25%。
图 3:跨模型家族泛化——Gemma 和 GPT 都能从 Qwen 蒸馏的技能中获益
图 4:Trace2Skill 将重复失败和变通方案压缩为标准操作规程(SOP)
⚡ 为什么比现有方法好
三个消融实验
并行合并 vs 顺序编辑:质量更好,3 分钟 vs 15-60 分钟。
统一技能 vs 检索记忆:122B Avg 4.33 vs 1.60,推理时零开销。
Agent 分析 vs 单次调用:多步根因分析更准确,补丁质量更高。
💡 和 ContinualSkillBench 的对话
两篇论文放一起看特别有意思:ContinualSkillBench 说"当前技能进化不行",Trace2Skill 说"做对了就行——并行 + 归纳推理 + SOP 提取"。ContinualSkillBench 测的是顺序编辑 + 浅层维护,Trace2Skill 做的是并行分析 + 深层次归纳。问题不在方向,在实现方式。