Back to Blog SPADE:让 LLM 自己出题、自己做、自己改题的自律训练框架

SPADE:让 LLM 自己出题、自己做、自己改题的自律训练框架

Paper
Self-Play RL Adaptive Environment Agent Training GRPO
2026-08-21 · arXiv:2608.19197

训练环境的供给正在取代训练数据的供给,成为 AI 能力提升的新瓶颈。各大实验室每年花上亿美元手工构建训练环境,但它们是固定的——agent 学完就到顶了。SPADE 的回答是:让模型自己设计、自己解决、自己进化训练环境。

环境瓶颈:比数据枯竭更紧迫的问题

RLHF 的 prompt 池、RL 的 benchmark 套件、agent 的工具链——这些训练环境都是人写的。无论你用 GRPO、PPO 还是 PPO-Max,训练信号的质量上限取决于环境池。固定环境池有一个根本缺陷:它不会随学习者的能力扩展。一旦 agent 把题库里所有题都做对了,学习就停止了。

现有的应对方案各有局限。Harness engineering(如 ReAct、Reflexion)改的是推理时的行为模式,不更新权重,增益绑定在特定环境上。手工扩展环境池(如 TextArena、GEM)能提供多样性,但规模受限于人的速度。合成环境生成(如 RLVE、EnvScaler、Agent-World)用 LLM 批量生成题目,但生成完就冻结了,不会根据 agent 的当前能力动态调整难度和结构。

SPADE 的核心洞察:环境设计本身应该是可学习的。不是出更多的题,而是出题者本身要在训练中进化。

方法:自博弈框架

SPADE 让同一个 LLM 同时扮演两个角色:环境设计者(Environment Designer, ED)和推理智能体(Reasoning Agent, RA)。两个角色共享参数 θ,通过角色特定的 system prompt 切换。ED 生成可执行的环境代码,RA 在其中训练——两个角色的梯度共同更新同一组权重。

SPADE 框架:同一个 LLM 同时扮演环境设计者(ED)和解题者(RA)
图 1:SPADE 框架。同一个 LLM 扮演 ED(生成可执行环境 + 特权提示)和 RA(有/无提示地解题),return gap 奖励 ED,任务正确率奖励 RA,两者共同更新共享策略。

Code-as-Environment:一个接口统一所有任务

ED 输出的不是文本描述,而是一段完整的 Python 程序,实现 OpenAI Gym 风格的 reset()/step() 接口。状态转移函数 T 和奖励函数 R 都编码在 step() 实现里。这意味着一道数学推理题和一个多轮工具调用任务用的是同一套训练管线,只是环境代码的复杂度不同。

这个设计有一个被低估的好处:任何可计算的 MDP 都能被表达为 Python 程序。ED 不被限制在某种预定义的环境参数空间里——它可以发明全新的任务类型。

Hint-based Regret:用提示替代对抗者

这是论文最巧妙的设计。ED 怎么知道出了好题?SPADE 的方案:

ED 的奖励 = RA 有提示时的平均回报 − RA 无提示时的平均回报

这个差值叫 hint-based regret。它自然地把环境分成三类:

高 regret(有提示能解、无提示不能解)→ 环境在 RA 的学习前沿上,ED 应该多出这类题。低 regret + 高回报(有/无提示都能解)→ 已掌握,出这类题没意义。低 regret + 低回报(有提示也解不了)→ 太难了,也不值得出。

Hint 如何改变 RA 的解题行为
图 2:特权提示如何改变 RA 的行为。左列为任务描述和 hint,右列为有/无提示时 RA 的实际解题过程。hint 提供了关键的结构性洞察,显著提升了 RA 的解题能力。

这等于实现了 PAIRED 的 minimax regret 目标,但不需要一个独立的对抗者网络。带提示的 RA 本身就充当了「上限策略」——它在每个环境上的理论最优表现就是 regret 信号的上界。

语料锚定与环境记忆

单靠自回归生成,ED 会退化为重复已知的简单模式(mode collapse)。SPADE 用两个机制对抗这个问题:

语料锚定(Corpus Grounding):每轮从大规模预训练语料中采样文档(数学/科学/代码),作为 ED 生成环境的灵感来源。这确保了环境的主题多样性和新颖性,而不是在模型权重中的已知模式上打转。

环境记忆(Environment Memory):维护一个已生成环境的缓冲区,附带 regret 分数和技能标签。ED 在生成时可以看到之前哪些环境有效、哪些被 RA 掌握了,从而避免重复出题,并针对性地在 RA 当前最薄弱的技能方向上加大出题力度。

实验结果

Games 领域:合成游戏环境提升推理和代码能力

在 Qwen3-30B-A3B 上,SPADE 在 8 个数学/科学/代码/推理 benchmark 上的平均分达到 58.3,比基座模型高 +8.1,比最强固定环境基线(Fixed-env RLVE)高 +5.3。ED 只在合成游戏上训练,从未见过任何 held-out 任务,但增益迁移到了科学推理、代码生成和程序推理上。

30B 模型在 8 个 benchmark 上的训练曲线
图 3:30B 模型在 8 个 benchmark 上的训练曲线。上排:竞赛数学、科学推理、代码生成;下排:四类程序推理技能。虚线为未训练基座模型。
模型 AIME'25 AIME'26 GPQA-D LCB-v6 RG-Math RG-Algo RG-Cog RG-Logic Avg Δ
Qwen3-30B-A3B (Base) 61.573.570.443.2 45.018.023.067.050.2
+ Fixed-env RLVE 56.969.869.842.555.824.730.973.753.0+2.8
+ SPADE (Games) 62.874.475.847.363.332.137.772.858.3+8.1

值得注意的是,增益主要集中在程序推理上(Reasoning-Gym 四个类别全面大幅提升),而竞赛数学基本持平。这说明合成游戏环境训练的不是解题套路,而是系统性的推理能力

Tool Use 领域:多步工具调用显著提升

同样的框架应用于工具调用环境设计。ED 生成模拟工具集(OpenAI function-calling 格式)、后端状态和多条自然语言指令。在 30B 上,ACEBench-Agent 提升 +13.9,BFCL v4 多轮调用提升 +5.7。增益大小与 benchmark 的任务结构跟生成环境的匹配程度正相关——多步交互越多的 benchmark 提升越大。

Scaling:增益随模型规模扩大

模型规模 scaling:SPADE 增益随规模扩大
图 4:模型规模 scaling。SPADE 的平均增益从 4B 的 +5.2 增长到 30B 的 +8.1,而固定环境基线在所有规模上只带来约 +1.2。静态环境很快就被大模型学完了。

这个 scaling 趋势有一个清晰的解释:固定环境池是有限的训练信号,大模型更快地拟合它们然后停止学习。ED 的自适应课程则持续生成处于 RA 能力前沿的环境,模型越大,从前沿环境中获益越多。

固定环境是一面被打完的副本关卡;SPADE 的环境是一个永远在升级的无限副本系统。

消融实验:协同进化是核心

论文的消融实验是整篇最有说服力的部分。它回答了一个关键问题:到底是「出更多的题」有用,还是「出题者本身在学习」有用?

消融实验训练曲线(30B,8 个 benchmark)
图 5:消融实验训练曲线(30B)。完整 SPADE(深色)持续领先;去掉记忆或语料锚定会提前见顶然后回落;同时冻结 ED 并去掉记忆,模型比不训练还差。
变体 ED 训练 语料锚定 环境记忆 8-Bench Avg Δ vs Base
Base (未训练)50.2
w/o ED训练+记忆40.5−9.7
w/o 记忆53.2+3.0
w/o 语料锚定53.5+3.3
Fixed ED (GPT-5.5)53.0+2.8
SPADE (完整)58.3+8.1

几个关键发现:

冻结 ED + 去掉记忆,模型反而变差(40.5 vs 50.2)。这意味着用固定环境做 RL 训练,如果环境太难或者和模型能力不匹配,不仅不会提升,还会损害已有能力。这不是过拟合——是训练信号本身在把模型推向错误的方向。

换成 GPT-5.5 出题只恢复了 35% 的增益(53.0 vs 58.3)。即使出题者是最强的闭源模型,如果它不跟随 RA 一起进化,它的课程也无法持续处于 RA 的学习前沿。

语料锚定和环境记忆缺一不可,去掉任何一个都会导致训练曲线提前见顶然后回落。语料锚定负责「出什么类型的题」,环境记忆负责「出什么难度的题」——两者作用于不同维度。

ED 奖励信号对比

出题者奖励消融:hint regret vs EMA learning potential
图 6:ED 奖励消融。Hint-based regret(蓝线)达到 +8.1;EMA learning potential(绿线)恢复约 70% 的增益(+5.7);冻结 ED(灰线)比不训练还差。

论文还将 hint-based regret 与 EMA-based learning potential(一种不需要 hint 的替代方案,基于 RA 成功率偏离最近均值的程度)做了对比。Learning potential 也能工作,但增益只有 regret 的约 70%,且收敛更慢。原因在于它是有符号偏离的绝对值,无法区分「已掌握」和「不可解」——两类环境的 learning potential 都可能很高。

理论结果:Nash 均衡下的最优性

论文在理想化假设下证明了:这个自博弈框架的任何纯 Nash 均衡都满足 RA 在所有有效环境上达到无提示最优,ED 的期望 regret 为零。

直觉很清晰:如果存在某个环境上 RA 还没达到最优,ED 就可以通过集中出这个环境来获得正 regret,所以均衡时不能存在这样的环境。Hints 在均衡点变得多余——RA 自己就能解所有题。

当然,实际训练不会精确收敛到 Nash 均衡。但这个理论结果为「开放性自我改进」提供了一个清晰的目标刻画,而不是一个模糊的愿景。

训练动态:RA 从"推导先行"到"证据先行"

一个有趣的观察是 RA 行为模式的演变。训练初期,RA 倾向于先把完整推导写出来再提交答案——一旦格式错误就完全没有恢复能力。到训练中后期,RA 学会了先做短假设、看反馈、再修正——一种更鲁棒的行为模式。

Hint-based regret 随训练变化(三规模)
图 7:Hint-based regret 随训练的变化。只有 30B 模型的 regret 估计保持正值;4B 和 8B 在长时段内跌到零以下(有限样本下,hints 偶尔会误导小模型)。尽管如此,较小模型仍然从环境中获益(+5.2, +5.7)。

局限性与工程意义

SPADE 不是万能的。它在竞赛数学上几乎没有提升,说明合成游戏环境训练的系统性推理和竞赛数学需要的高强度代数推演是不同的能力维度。4B 和 8B 模型上 regret 信号经常为负(hints 偶尔会误导小模型),说明 hint-based regret 需要模型有足够的基础能力才能稳定工作。

但从工程角度看,SPADE 提供了一个可复现的自适应训练基线:30B 模型、GRPO 训练、单机可跑、代码已开源。对于构建自我改进 agent 的实践者来说,它的三个核心设计原则可以直接借鉴:

第一,环境设计必须是训练循环的一部分,不能外包给静态数据集。第二,前沿检测可以用简单的 regret 信号实现,不需要额外的评判模型。第三,外部语料 + 内部记忆的组合是防止模式坍塌的有效方案,成本远低于持续人工标注。

训练环境的供给方式,正在从「人工构建」转向「自适应生成」。SPADE 走出了扎实的一步。

Tags: #Blog