核心矛盾:能力 vs. 经验
现有自动 MAS 分两条路。推理时编排冻结前沿 LLM 做 Meta-agent,每次重新搜索最优 MAS 结构——能力强但经验不积累,推理成本极高。训练时编排用梯度更新内化编排经验——能积累但被小模型天花板锁死,无法利用前沿模型。
Skill-MAS 的洞察:编排能力本质上是架构知识——哪些子任务该并行、哪些该串行、什么时候该 explore→evaluate→commit。这种知识不需要改模型权重,可以作为一种独立进化的"元技能"以 prompt 形式存在。
Meta-Skill:可进化的编排知识
Meta-Skill 是一段结构化 prompt,包含任务分解策略、子任务依赖关系、执行模板(如 explore→evaluate→order 三段式)和全局编排规则。初始化由 LLM 生成基础版,然后通过两步闭环进化:
Multi-Trajectory Rollout:对每个任务采样多条执行轨迹(K=5),收集成功/失败分布。Selective Reflection:自适应选择优先任务,做层级对比分析——从失败轨迹中提取通用策略级改进原则,写入 Meta-Skill。模型权重全程不动。
实验结果
四个 benchmark、四个 LLM。Skill-MAS 在所有设置中显著优于所有 baseline。成本-性能权衡最佳——推理时方案成本最高(每样本重搜),Skill-MAS 一次生成,成本适中且性能最优。跨 LLM 迁移有效:在 GPT-5.4-Nano 进化的 Meta-Skill 迁移到 DeepSeek-V4-Flash 反之亦然;跨任务迁移也有效(同 LLM 不同场景)。双重迁移仍有提升。
思考
这篇和上一篇 CPE 异曲同工——都是 prompt-level 自进化,不动模型权重。但 Skill-MAS 更进一步:把编排架构本身当作优化对象。OpenClaw 的 skill 管理本质上也是 Meta-Skill 问题——什么时候加载什么 skill、skill 间怎么编排、失败怎么回退。Selective reflection + 层级对比分析的方法论可直接借鉴。