核心贡献:Layer-loop(层级循环)替代传统 Model-loop(模型级循环),配合 MoE 架构和计算匹配的扩增配方,Loopie-20B-A2B 在同等训练时间下全面超越 Qwen3-30B-A3B、gpt-oss-20B 等非循环基线,并在 IMO 2025 和 IPhO 中无需工具达到金牌水平。
一个七年的技术债
2019年,Dehghani等人提出Universal Transformer时,核心idea干净利落:与其堆48层不同的参数,为什么不让同一组参数反复运行?循环Transformer的承诺是——计算深度可以远大于存储深度,参数效率的天花板被打开。
但过去几年的事实很残酷。给定相等的计算预算,增参数N倍的非循环模型,几乎总是吊打循环N次的模型。Ouro、Huginn等代表性工作在参数效率上有亮点,但在大模型尺度上始终无法正面竞争。
这里有一个微妙的陷阱。循环Transformer的优势通常用"参数效率"来宣传:达到同样性能需要更少参数。但参数效率并不自动转化为计算效率。在大规模预训练中,计算预算才是真正的硬约束。循环架构减少了存储参数,却增加了执行FLOP——而在现代GPU上,FLOP通常不是瓶颈,显存才是。
Loopie的团队抓住了一个关键的洞察:循环Transformer真正的优势不在参数效率,而在显存效率。存储层数减半意味着激活内存减半,省下的显存可以投资到更大的microbatch或更宽的hidden dim上。这才是正确的跑道。
Layer-Loop:把循环从外圈挪到内圈
说到循环Transformer,直觉上都会想"把整个模型跑两遍"。这也确实是之前所有工作的做法——先走完整个layer stack,输出再喂回去,再来一遍。Loopie把这种模式称为model-loop。
Loopie的做法是layer-loop:每一层自己先循环R次,然后才把结果传给下一层。
这个"把循环从外圈挪到内圈"的改动,物理意义远大于形式差异:
梯度冲突的根源被削弱了。 在model-loop中,同一组参数要在第1层(刚读到输入的浅层状态)和第48层(已经推了好几轮的深层状态)之间反复横跳。功能需求差异巨大,梯度方向经常打架。layer-loop把重用限制在相邻depth位置,参数面对的"功能身份"更一致,优化路径更干净。
基础设施更友好。 同一层的多次应用在计算图中相邻出现,激活检查点和梯度累积的开销显著降低。前向和后向计算中的参数复用距离缩短,缓存命中率提高。
可扩展性更好。 实验发现,model-loop在训练早期(约前1T token)略优于layer-loop,但在~1.2T token处被反超,之后差距持续扩大。如果你只训几个B token就下结论,model-loop看起来更好。但大规模预训练拼的是后期——lay-loop在这个维度上赢得很清楚。
Loopie Recipe:计算匹配的扩增哲学
Loopie的另一项核心贡献是一套compute-matched scaling recipe。它的逻辑链条异常清晰:
① 从参考模型出发。假设计算预算刚够训练一个Qwen3风格的30B-A3B模型(48层,hidden dim=2048)。
② 构建循环种子。把存储层数从48砍到24,循环次数R=2。总Transformer block执行次数不变(24×2=48),但激活内存直接减半。
③ 挥霍省下的内存。激活内存少了,microbatch可以翻倍,gradient accumulation步数减半。把省下的效率投资到更大hidden dim和更多层——Loopie-20B-A2B最终选择了2432维度、28层、R=2的配置。
④ 匹配的是端到端wall-clock时间,不是理论FLOP。 这是整个方法论的关键。Loopie的理论FLOP实际上比非循环基线更高(多出的计算来自循环的额外开销),但更高的显存效率和microbatch利用率完全抵消了这一点。不管FLOP怎么算,如果两台机器花一样的时间训练,Loopie的结果更好——这才是诚实的比较。
下面的表格来自论文Table 1,展示了从参考配置到候选Loopie配置的搜索空间:
| 配置 | D | L | R | 计算代理 | 激活内存代理 |
|---|---|---|---|---|---|
| Qwen3 30B-A3B | 2048 | 48 | 1 | 1.00× | 1.00× |
| Seed Loopie | 2048 | 24 | 2 | 1.00× | 0.50× |
| Loopie候选1 | 2176 | 25 | 2 | 1.18× | 0.55× |
| Loopie候选2 | 2304 | 27 | 2 | 1.42× | 0.63× |
| Loopie候选3 | 2432 | 28 | 2 | 1.65× | 0.69× |
最终选定的是候选3——计算代理1.65×(理论FLOP多了65%),但端到端训练时间与参考模型持平。
硬核成绩:AIME 92%,IMO金牌
Loopie-20B-A2B(20B总参数,2B活跃参数)的关键benchmark如下:
| Benchmark | Loopie-20B-A2B | Qwen3-30B-A3B | gpt-oss-20B | Nemotron-30B-A3B |
|---|---|---|---|---|
| AIME | 92.10% | 90.10% | 85.00% | 88.33% |
| AMC | 94.21% | — | 91.05% | 91.80% |
| OlympiadBench | 80.50% | 76.68% | 70.03% | 81.20% |
| IFEval | 84.72% | — | 70.64% | 79.21% |
| ARC-Challenge | 93.52% | — | 92.42% | 93.86% |
| MMLU-Redux | 83.61% | — | 83.40% | 83.89% |
最震撼的不是某个单项,而是全面领先。数学推理(AIME 92.1%)、竞赛数学(AMC 94.2%)、指令跟随(IFEval 84.7%)——三个维度上Loopie都压制了所有等计算预算的对比模型。
在2025年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)上,Loopie-20B-A2B在没有使用任何外部工具(无代码执行、无搜索、无验证器)的条件下达到金牌水平。对循环架构来说,这是一个分水岭式的信号。