问题:所有层都一样宽,合理吗?
从原始 Transformer 到线性 RNN、记忆增强架构,一个共同默认设置从未被质疑:每一层的参数量相同。但早退法证明残差流在到达最后一层前就收敛了;层剪枝发现深层冗余度高;可解释性工作显示底层捕获语法,上层编码语义。
既然各层重要性不同,参数分配为什么还是均匀的?
控制实验:前宽后窄赢了
把 440M Transformer 的层分成三组,固定总参数量下分配不同 MLP 宽度:
前宽后窄改善 0.32 点,反向分配恶化超过 1 点。容量不是被动资源,方向决定了一点多。
cosine 衰减是最佳 schedule
把分块改为平滑递减,测试三种衰减(线性、cosine、sigmoid)和五种宽度比:
Cosine 在所有宽度比上严格最优。最优配置 1.5/0.5:首层 MLP 宽度为 baseline 的 1.5 倍,末层 0.5 倍,ppl 从 16.28 降到 14.44,改善 1.84 点。
为什么有效?层的新颖度递减
测量每层 MLP 输出与输入残差流的余弦相似度。随深度增加,MLP 输出越来越"对齐"已有残差——后面的层在做的事情越来越冗余,宽度却一样,参数浪费了。Tapering 把容量从冗余层转移到仍在产出新信息的浅层。
跨架构验证
在四种架构、两种规模上,cosine 1.5/0.5 全部提升平均常识推理准确率,LAMBADA perplexity 八组对比全部改善:
| 架构 | 规模 | ppl ↓ | 基准 ppl | Avg. ↑ |
|---|---|---|---|---|
| Transformer | 760M | 21.42 | 21.86 | 52.84 / 52.25 |
| Gated Attention | 760M | 19.98 | 20.74 | 52.88 / 52.61 |
| Hope-attention | 760M | 20.50 | 20.62 | 54.05 / 53.69 |
| Titans | 760M | 20.77 | 21.58 | 53.29 / 52.30 |
| Transformer | 1.3B | 17.17 | 17.39 | 56.38 / 56.05 |
| Gated Attention | 1.3B | 15.92 | 16.03 | 56.80 / 56.51 |
| Hope-attention | 1.3B | 15.94 | 15.91 | 57.05 / 56.95 |
| Titans | 1.3B | 15.76 | 16.05 | 57.08 / 56.73 |
长上下文检索(Needle-in-a-Haystack)也不降反升。
VWT 提出 × 形轮廓(两头宽、中间窄),TLM 提出单调递减(前宽后窄)。TLM 控制更干净——单一变量(只改 MLP 宽度)、固定参数预算、有机制分析支撑。控制实验明确证明反向分配有害,说明存在一个清晰的单调方向。
思考
工程价值极高:零成本(不增参数、不增 FLOPs)、零风险(任何架构都能用)、改动极小。作者提到 attention head 数、KV 维度、RNN 状态大小、MoE expert 数都可以 taper。如果所有轴都可以单调递减,那"均匀层"这个默认值确实该被终结了。