核心思路:推理时能力迁移
传统蒸馏的路线是"改弱模型本身"——用强模型的输出做训练数据,或在策略蒸馏中让弱模型边行动边吸收反馈。这篇论文问了一个互补的问题:如果弱模型的失败,不全是能力不足,而是"任务呈现方式"造成的认知负荷过重呢?
答案是肯定的。作者提出"强到弱脚手架"(Strong-to-Weak Scaffolding)范式:一个强 Builder 模型只看 5% 的验证数据,迭代编写代码形式的 Scaffold,交给固定的弱 Target 模型去执行。目标模型参数完全不动,Builder 永远看不到测试集。成功了,说明 Scaffold 捕捉到了可复用的任务结构。
实验设计
选择四个 Theory-of-Mind(心智理论)基准作为测试场:BigToM(社会推理)、Hi-ToM(高阶嵌套信念)、MMToM-QA(贝叶斯目标推理)、MuMA-ToM(多智能体交互),共 3900 道题。Target 用 GPT-5.4-mini(弱)和 Gemini-3.5-flash(强),Builder 覆盖 11 种配置(GPT-5.5、Opus-4.7 各推理强度档位、Sonnet-4.6、Gemini 等),运行在 Cursor、Claude Code、GPT Codex 三种平台上,每种 3 次重复,共 72 轮实验。
效果有多强?
三个数字足够震撼:所有 72 轮实验无一例外超越了 baseline。平均提升 +0.275(0.488 → 0.763),最佳单次跑分 0.912(GPT-5.5 搭配 GPT Codex)。更值得注意的是,最佳 Scaffold 的 GPT-5.4-mini 超过了无脚手架的 GPT-5.4,接近人类手工设计的 UserHarness(0.912 vs 0.939)。
同一弱模型给自己建脚手架(self-scaffolding),也已有 +0.17 到 +0.22 的提升。说明 Scaffold 捕捉的结构是真实存在的,只是强 Builder 能挖掘出更深层部分。
性能提升的本质:认知负荷卸载
这篇论文最深刻的洞察,在于量化了提升的因果机制。作者统计每个 Scaffold 中"确定性代码直接回答"的比例(Determinism Fraction),发现它与最终准确率高度相关(r = 0.72)。Builder 把越多推理工作编译成确定性规则,Target 的负担越轻,效果越好。
但不同任务的"可编译性"差异巨大:BigToM 几乎完全可编译(确定性比例 ~94%),因为答案通常取决于"是否观察到世界变化";Hi-ToM 部分可编译(~51%),通过符号化信念状态跟踪;MuMA-ToM 最难编译(~36%),自由对话推理难以转化为规则。
不是越多验证越好
一个反直觉的发现:Builder 的验证次数和最终性能几乎无关(r = 0.17)。中位只用了 5 次验证,验证集与测试集准确率的相关系数高达 0.96。关键不是"量",而是 Builder 的假设质量——强 Builder 几次 principled refinement 就够了,弱 Builder 测再多也没用。
Builder 越强越好,平台影响有限
Builder 推理努力是单调杠杆——Opus-4.7 从低到高推理强度,Scaffold 质量严格递增(Spearman ρ = 0.77)。但平台选择是二阶因素:原生平台优势平均仅 +0.013,不具统计显著性。
强到弱迁移的"余量定律"
当 Target 换成更强的 Gemini-3.5-flash 时,整体提升显著缩小(+0.110 vs +0.262)。但论文发现了一个更精确的规律——提升幅度与 Target 的"余量"(1 - baseline)高度相关(r = 0.75)。Scaffolding 本质上是一个"能力恢复"机制:它帮 Target 释放本来就有但未稳定发挥的潜在能力。
剩余错误的边界
顶级 Scaffold 修复了 83% 的 baseline 错误,仅破坏 7% 的正确项。残余错误集中在最难编译的核心:Hi-ToM 深层递归(order 3-4 准确率降至 0.70-0.75)和欺骗场景、MMToM-QA 的贝叶斯目标推理。
实用配方与评价视角转换
论文给出的行动指南很直接:用最强 Builder + 最高推理努力;验证集少量即可(5%);优先做确定性卸载;预算允许时建多个独立 Scaffold 取最优。
但更深远的影响是一个评价视角转换:"一个模型好不好"不应只问"它能不能解题",还应问"它能不能为更弱的模型设计解题环境"。这对 Agent 系统设计有启示——进步不只来自模型变强,还来自让模型身边的环境变好。