一个 Gemini 2.5 Flash 被问到一个简单的问题:"银行经理的名字是 Alice 还是 Bob?"对话前文明确说过 "Alice was the bank manager"。模型回答 "Bob"。
这不是能力不足——同一个模型有时能答对。这是一个架构级的弱点:Transformer 在处理完每个 token 后,状态信息被推到了固定深度,无法持续迭代更新。
深度限制:被锁住的状态
RNN 通过循环更新隐状态来跟踪动态信息——每处理一步,z(t) 更新为 z(t+1) = f(z(t), x(t))。这个更新函数可以是任意的,因为它在同一个网络层上反复执行。
Transformer 的前馈结构天然排斥这种做法。模型有 N 层,就最多只能做 N 次状态转换。Merrill 和 Sabharwal 证明了识别长度为 n 的正则语言串需要 log(n) 层——但这是构造性的界,不是学习性的界。实践中,Transformer 确实学会了各种巧妙的并行状态追踪方案,但这些方案在更长的序列和更复杂的对话中会失效。
这种失效的后果很具体:多轮对话中丢失上下文连贯性、信息收集效率低下、多 Agent 协作中沟通崩溃。
Recirculation:一个极简的修复
Recirculation 的做法简单到令人怀疑它能否有效:推理时,在处理每个 token 之后,把某个深层(source layer)的激活取一小部分(系数 α),注入到下一个 token 的某个浅层(destination layer)。
具体来说,对于第 t 个 token,浅层 d 的输入被修改为:
hd(t) = (1 − α) · hd(t) + α · normalize(hs(t−1))
其中 hs(t−1) 是上一个时间步深层 s 的输出,normalize 将源向量缩放到与目标向量相同的 L2 范数。α 通常很小(0.07~0.15)。
只有三个超参数:混合系数 α、源层 s、目标层 d。不需要训练,不需要改模型权重,开箱即用。
关键设计选择:Recirculation 将源层激活注入下一个 token 的浅层,而非同一个 token 的浅层。这个「时间步偏移」是它区别于简单 activation patching 的核心。
不是 CoT,不是 Looping
Chain-of-thought 也在深层和浅层之间传递信息——但它通过生成额外的 token 来实现,每个推理步骤都消耗序列长度。CoT 适合复杂的多步推理,但用来做基础的状态追踪(「前面提到的是 Alice 还是 Bob」)就像用牛刀杀鸡。
Recirculation 不生成任何额外 token,在隐空间完成状态传播,专门补充 Transformer 在基本状态追踪上的短板。
Looped transformer 是另一种流行的深度扩展方法——将一段层重复执行多次,本质上等价于一个更深的、带权重共享的前馈网络。Looping 的递归只发生在深度维度上,数学上仍然受限于「深度有限」的性质。
Recirculation 的递归同时发生在深度和时间步两个维度上。这意味着同一个网络层在不同时刻可以承载不同的状态 z(t) 和 z(t+1)——这恰恰是实现任意状态更新函数所需的计算模式。
超参数搜索:模型自己告诉你答案
作者在 Gemma3 1B 上做了系统性的网格搜索。结果出乎意料地清晰:存在一个稳健的最优区域,在这个区域内,十个语言建模数据集中有九个的 perplexity 显著下降。
对于三个模型规模,最优的源-目标对分别是:1B 使用 {11, 4},4B 使用 {18, 9},12B 使用 {35, 16}。随着模型增大,有效连接跨越的层数也增加,这符合直觉——更大的模型有更丰富的深层特征可以利用。
Perplexity 评估
在十个数据集上的评估结果:
| 数据集 | Gemma3 1B 基线 |
1B Recirc | 1B 降幅 | Gemma3 4B 基线 |
4B Recirc | 4B 降幅 | Gemma3 12B 基线 |
12B Recirc | 12B 降幅 |
|---|---|---|---|---|---|---|---|---|---|
| ArXiv | 16.54 | 14.87 | 10.1% | 11.89 | 10.34 | 13.0% | 12.00 | 8.92 | 25.7% |
| PubMed | 15.65 | 13.56 | 13.4% | 10.27 | 8.93 | 13.0% | 10.36 | 7.66 | 26.1% |
| PG19 | 16.54 | 14.08 | 14.9% | 11.84 | 10.26 | 13.3% | 11.49 | 8.14 | 29.2% |
| BookSum | 14.12 | 12.23 | 13.4% | 10.15 | 8.96 | 11.7% | 10.16 | 7.47 | 26.5% |
| Gov Report | 14.68 | 12.88 | 12.3% | 10.25 | 9.02 | 12.0% | 10.47 | 7.79 | 25.6% |
| OpenWebText | 16.28 | 14.34 | 11.9% | 11.46 | 10.14 | 11.5% | 11.57 | 8.56 | 26.0% |
12B 模型在多个数据集上实现了 25-35% 的 perplexity 下降。九个数据集中有九个显著改善,唯一的例外是 Lambada(极短序列,recirculation 的优势在于长上下文)。
排除替代解释
perplexity 下降是不是只是因为 recirculation 相当于调低了 softmax 温度?作者做了对照实验:单独调温(1.2)降低 perplexity 8.48%,单独 recirculation 降低 14.21%,两者叠加降低 19.55%——接近线性叠加。效果是近似可加的,排除了温度调谐的替代解释。
和 looping 的对比同样明确。在 Gemma3 1B 上,looping 几乎没有稳定的收益区域;在 4B 和 12B 上 looping 有一定效果但远不如 recirculation 系统且微弱。两者的热力图模式完全不同,确认它们作用于不同的原理。
哪些 token 受益最大?
作者做了精细的分析。位置上,上下文窗口中的第 20~200 个 token 的 recirculation 效果最持久,即使影响跨度达到 256 个 token 仍有可测量的收益。内容上,副词、形容词和动词从 recirculation 中受益最大,而数字、限定词和代词几乎不受影响。
GSM8k:推理能力的提升
对于单 token 回答的数据集(MMLU、ARC 等),recirculation 的改善幅度较小但方向一致。但当任务涉及多步推理(GSM8k),recirculation 的优势变得显著。
pass@1 从 30.6% 提升到 35.5%,pass@128 从 94.9% 提升到 96.0%。pass@1 的提升意味着能力锐化——正确答案在候选分布中变得更突出;pass@128 的提升意味着能力扩展——正确答案出现在更大的采样空间中。
Adaptive Recirculation:轻量调参,大幅提升
固定超参数的 recirculation 已经有效,但作者进一步提出 adaptive 变体:不调模型权重,只学习 per-token 条件化的 α 和 β 系数向量。训练集只有约 1.5M token。
结果令人惊讶:学习条件化的 recirculation 系数(不碰模型权重)的效果甚至超过了完整微调模型权重。这说明「学会在正确的位置、用正确的强度注入深层信号」比「调整所有权重」更有效率。
Adaptive recirculation 在 Gemma3 4B 上将 GSM8k pass@1 进一步推到 37.5%,perplexity 在九个数据集上平均下降 23%。
五个模型族都有效
这五种模型使用了不同的归一化方案(Pre-LN、Post-LN、RMSNorm)、不同的训练配方的不同架构细节,但 recirculation 在所有模型上都找到了有效的源-目标对。这不是某个特定训练配方的巧合产物,而是 Transformer 普遍存在的可利用的结构特性。
代价与权衡
Recirculation 在自回归生成阶段几乎零额外延迟——两个 stack 并行跑,现代 GPU 上和单 stack 几乎一样快。但在 prefill 阶段需要逐 token 串行处理,和标准并行 prefill 相比有实质性计算开销。对于长上下文场景,作者提出 blockwise recirculation(每 K 个 token 并行处理再 recirculate)作为可能的缓解方案,但尚未实验验证。
Recirculation 的真正价值不在于它让模型「更强」,而在于它揭示了一个被忽视的事实:现成的 Transformer 内部已经编码了足够的状态跟踪能力,只是前馈结构把它锁在了固定深度。通过一个极简的推理时干预,这些能力就能被释放。
方法论启示
作者没有设计一个「应该有效」的架构然后训练它,而是用超参数搜索让模型自己「告诉」你哪些层的连接最有效。这种「让模型指导架构修改」的范式——用已训练网络的内部动态信号来指导推理时架构调整——和 LOPD(可学习的特权上下文)的哲学一脉相承。
它指向一个更一般的方向:与其人为设计架构改进,不如先问模型——你的内部结构支持什么样的修改?Recirculation 的成功暗示,Transformer 的层间信息流中存在大量未被利用的「冗余容量」,等待被合适的推理时干预所释放。