Back to Blog LoopWM:循环世界模型——迭代隐深度,世界模拟的第三条缩放轴

LoopWM:循环世界模型——迭代隐深度,世界模拟的第三条缩放轴

Paper
World Model Looped Transformer Adaptive Computation Latent Dynamics
2026-06-16 · arXiv: 2606.18208 · FaceMind Research Asia

一个 1B 参数的小模型,在 ScienceWorld 文本世界模型基准上,精确匹配率 68.4%,超过参数量 100 倍以上的 Claude Opus 4 Max(47.2%)整整 21 个百分点。这不是更大更强的胜利,而是"反复思考"对"堆砌参数"的胜利。

LoopWM 证明了世界模型存在一个被长期忽视的缩放轴:迭代隐深度(iterative latent depth)——与模型大小和训练数据正交的第三条路。同一组参数,多迭代几次,预测能力就上一个台阶。

世界模型的根本矛盾

世界模型的核心任务是预测:给定当前状态和动作,环境下一步如何演化。这本质上是一个迭代过程——物理规律反复作用于状态,状态累积变化,产生复杂的动力学行为。

但主流世界模型架构——从 RSSM(Dreamer 系列)到自回归 Transformer(IRIS),再到扩散模型(DIAMOND)——都采用固定深度的前向计算。无论状态转移是简单的自由飞行还是复杂的多体碰撞,模型都分配完全相同的计算量。

这导致了两个经典失败模式。第一,预测误差在长时程推演中指数级累积,轨迹质量迅速崩塌——这是世界模型领域十年来没有根本解决的问题。第二,加深模型来对抗崩塌会导致参数量膨胀、推理成本飙升,在自动驾驶和机器人这类资源受限场景中完全不可部署。

一个自然但被忽视的对应

循环 Transformer(Looped Transformer)不是新概念。Universal Transformer(2019)最早提出跨层参数共享 + 自适应停机,之后在语言模型领域发展出了 Ouro、Geiping 等一系列工作,证明循环深度可以 2-3 倍参数效率匹配固定深度模型的效果。理论上,循环 Transformer 甚至能模拟任意迭代算法。

但所有这些工作都局限于语言建模。LoopWM 是第一个将循环架构引入世界模型的工作。

这个对应关系不是牵强附会。环境动力学本身就是"对近似平稳的物理规律反复应用"——牛顿第二定律在每个时间步都以相同形式作用于状态。而循环 Transformer 的计算图——一个共享函数 fθ 递归作用于隐状态 h——在结构上直接同构于动力学演化。两者的迭代本质是同一个东西。

LoopWM 整体架构图
图 1:LoopWM 整体架构。观测编码器 → 动作嵌入 → 循环动力学核心(内循环迭代精化)→ 预测头。谱约束确保隐状态有界。

三层递归的稳定动力学

LoopWM 的动力学核心由三个模块组成,结构清晰而精致。

前奏块(Prelude):一小堆 Transformer 层处理上一步隐状态 hk-1 + 当前观测嵌入 ek + 动作嵌入 uk,输出条件信号 e。Layer Normalization 防止输入幅度导致后期损失尖峰。

循环块(Recurrent Block)——这是核心。LR 个共享参数的 Transformer 层迭代 T 次。每一步的更新规则是:

h(t+1) = Ā · h(t) + B̄ · e + R̄(h(t), e)

其中 Ā 是状态保持矩阵,B̄ 控制输入注入,R̄ 包含注意力非线性部分。关键在于:所有 T 次迭代的参数完全共享,计算深度与参数量彻底解耦。

谱稳定性约束是工程上最精巧的设计。为了保证隐状态不随迭代次数爆炸——长时程推演中迭代次数可能很高——LoopWM 将 Ā 参数化为 A = diag(-exp(a)),然后通过零阶保持离散化得到 Ā = exp(Δ · A)。因为 A 的对角元素严格为负,exp(·) 将它们映射到 (0, 1) 区间,从而谱半径 ρ(Ā) < 1 恒成立。这个约束是结构性保证的——训练全程自动满足,不需要梯度裁剪、后处理归一化或敏感的超参调优。

尾奏块(Coda):独立参数的 Transformer 层处理最终隐状态 h(T),输出下一步预测。

双层循环结构是 LoopWM 的精髓:内循环在单步转移内迭代精化隐状态,外循环跨时间步传递信息。谱约束确保两层循环都有界,鼓励时间连续性同时防止隐状态漂移。

延迟解码:只在终点看一眼

在此基础上,论文进一步提出了延迟解码(Deferred Decoding)。在 K 步动作推演中,只在第 K 步才调用解码器重建观测,中间步骤完全在隐空间中完成。

这将解码器调用从 K 次降为 1 次,配合隐一致性损失(用冻结编码器对齐中间隐状态)和谱收缩预算(约束隐状态漂移幅度),模型在无中间监督的情况下保持稳定。训练采用递进课程:从 K=1 开始逐步增加 K,让模型先学会单步转移再挑战更长推演。

延迟解码的效果随推演步数增加而放大——这正是世界模型需要的特性。越长的规划窗口,计算节省越显著。

自适应计算:简单少算,复杂多算

物理模拟有天然的非均匀计算需求:自由飞行几乎不需要处理,碰撞和接触需要深度迭代精化。LoopWM 的循环架构天然支持这种自适应——简单转移只需 1-2 次迭代就"想通了",复杂事件自然延伸到更多步。

训练时循环深度 T 从泊松分布采样(每个序列独立采样,而非整个 mini-batch 共享),配合熵正则化的早退机制。模型学会在保证质量的同时大幅降低平均推理成本。

实验:1B 参数碾压 Claude Opus

在 ScienceWorld 文本世界模型基准上,LoopWM(约 1B 参数)全面超越 Claude Opus 4 Max:

指标LoopWM (1B)Claude Opus 4 Max差距
精确匹配率 (EM)68.4%47.2%+21.2pp
Token F185.3%72.8%+12.5pp
BLEU-480.7%64.4%+16.3pp
实体识别83.9%72.3%+11.6pp

最极端的案例:Lifespan 任务上,LoopWM 达到 100%,而 Claude Opus 是 0%。这不是微弱优势,而是范式级差距。

ScienceWorld 各任务详细对比
ScienceWorld 各任务类型的详细对比。LoopWM 在大部分任务上全面领先。

在 AlfWorld 基准上,LoopWM 在 BLEU 指标上取得最佳成绩,EM 和 Token F1 排名第二,且是所有模型中最小的。

延迟解码的效果验证

延迟解码的效果随推演步数增加而显著放大。在 ScienceWorld 的 Boil 任务上:

推演步数EM 相对提升F1 相对提升BLEU 相对提升
Step 1+100.0%+3.5%+39.6%
Step 2+50.2%+33.4%+61.3%
Step 3+250.5%+57.5%+136.2%
Step 4+700.9%+120.0%+503.5%
Step 5+500.9%+29.9%+101.9%

Step 4 的 BLEU 相对提升达到 503.5%——这意味着延迟解码在长推演场景中的价值是压倒性的。

工程意义

LoopWM 建立了一个被忽视的缩放轴,其工程含义是深远的:

第一,参数效率的指数级提升。世界模型的核心成本不在训练而在推理——长时程推演需要执行成百上千次前向传播。一个参数效率高 100 倍的模型,每步推理的节省会复合到整个规划序列上。

第二,自适应推理与物理计算的自然对齐。自动驾驶中,直线匀速行驶只需极少计算,而路口多车交汇需要深度推理。LoopWM 的自适应深度天然匹配这种非均匀需求——这是固定深度架构做不到的。

第三,延迟解码解锁超长规划窗口。对于机器人任务规划、自动驾驶场景推演,K 步解码只需一次解码器调用。配合循环深度的自适应,总 FLOPs 降低可能达到两个数量级。

世界模型的缩放不必只有"更大"这一条路。迭代隐深度——让同一组参数多想几次——是正交于模型规模和训练数据的第三条缩放轴,而且对资源受限部署场景,它可能是最实际的一条路。

局限与思考

论文诚实地承认了几个局限。当前实验主要集中在文本世界模型(ScienceWorld、AlfWorld),视觉连续环境的验证尚未充分展开。缩放律的完整刻画——更大模型、更长推演、更多任务——留待后续工作。

此外,训练稳定性需要课程式工程策略配合。循环架构的收敛特性与传统固定深度模型有本质不同,优化器选择、学习率调度等训练细节可能需要专门研究。

但核心贡献是清晰的:LoopWM 打开了世界模型的一个新维度。不是用更多参数堆砌预测能力,而是用迭代精化把同一组参数的潜力榨干。在自动驾驶、机器人、边缘计算这些参数预算永远不够的场景里,这可能是比"更大模型"更实际的方向。

Tags: #h(t+1) = Ā#h(t) + B̄#e + R̄(h(t), e)