Back to Blog Spatial-TTT:用 Test-Time Training 给 MLLM 装上空间记忆

Spatial-TTT:用 Test-Time Training 给 MLLM 装上空间记忆

Paper
2026-03-12 arXiv 2603.12255
Test-Time Training Spatial Intelligence 流式视频 清华 · 腾讯混元
清华+腾讯混元把 TTT 引入多模态大模型的空间理解:用 fast weights 做流式压缩的空间记忆,以线性复杂度处理任意长度空间视频流。一个 2B 模型在 VSI-Bench 上超越 GPT-5 和 Gemini-3-Pro。

问题:MLLM 不懂空间

MLLM 在 2D 语义理解上已经很强,但空间理解一塌糊涂——缺乏 3D 几何先验。现有空间增强方案大多只处理单图或短视频(16-32 帧),视频拉长到上千帧就崩溃——超出上下文窗口或显存爆炸。

关键洞察:人类理解空间不是一次性看完整个场景,而是通过持续的视觉流逐步积累空间证据。需要一种流式、增量式的空间记忆机制。

Spatial-TTT Overview
图1:Spatial-TTT 概览。视频按 chunk 逐块输入,每个 chunk 更新 fast weights(空间状态),逐步累积长距离空间证据后回答空间问题。

TTT 做空间记忆

Test-Time Training 在推理时更新一小部分参数(fast weights)作为自适应记忆。每个 token 先更新 fast weights(Update),再用更新后的 weights 处理当前 query(Apply)。由于 fast weights 是线性复杂度,天然适合长序列。

Spatial-TTT 把视频切成大 chunk,逐 chunk 更新 fast weights,把长范围时空依赖压缩进自适应记忆。每个 chunk 处理完后,fast weights 就"记住"了这批帧的空间信息,后续 chunk 在此基础上继续累积。

混合架构 + 空间预测机制

直接把所有 attention 层替换成 TTT 会破坏预训练的多模态对齐。Spatial-TTT 用 3:1 混合:75% 层用 TTT(线性复杂度压缩长距离依赖),25% 保留标准 self-attention 作为锚点层(保留全局上下文推理能力)。

在每个 TTT 层内,sliding-window attention 和 TTT 分支并行运行,共享 Q/K/V 投影。TTT 分支引入空间预测机制:用 3D 时空卷积(3×3×3 depthwise conv)注入局部时空归纳偏置,帮助 fast weights 捕获几何对应和时间连续性。Dirac 初始化确保初始行为等价于原始模型。

Hybrid TTT Architecture
图2:混合 TTT 架构。TTT 层与 self-attention 锚点层以 3:1 交替排列。TTT 层内,sliding-window attention 和 TTT 分支并行,共享 Q/K/V 投影,TTT 分支使用 3D 时空卷积捕获空间结构。

两阶段渐进训练

第一阶段:用构造的密集 3D 场景描述数据集(~16k 样本)训练 fast weight 更新动态,教会模型"记住"空间信息。Sliding window 从覆盖全序列逐步退火到等于 chunk size,强制 TTT 层逐步接管跨 chunk 信息传递。

第二阶段:用 300 万空间 VQA 数据微调,覆盖方向/距离估计、计数、路径规划等任务,教会模型"回忆和推理"。

实验结果:2B 模型超越闭源巨头

VSI-Bench(视频空间理解):Spatial-TTT-2B 取得 Avg. 64.4,超越所有闭源模型和所有开源模型:

模型规模Avg.
GPT-5-55.0
Gemini-3-Pro-56.0
Kimi-K2.5-53.6
Qwen3-VL-8B8B57.9
Spatial-MLLM-4B4B47.0
Spatial-TTT2B64.4

在需要跨视角几何一致性的任务(相对方向 73.0、路径规划 77.0)上优势尤其明显。

MindCube(多视角空间推理):76.2 ACC,超越 Gemini-3-Pro(63.9)12.3 个百分点。

VSI-SUPER(10-120 分钟长视频流式感知):其他模型要么 OOM 要么性能崩溃,Spatial-TTT 保持稳定,计数任务大幅超越所有 baseline。

效率:1024 帧时 TFLOPs 和显存都比 Qwen3-VL-2B 降低 40%+,接近理论线性扩展。Spatial-MLLM-4B 在 512 帧就 OOM。

思考

这篇论文的价值在于把 TTT 从 NLP 领域成功迁移到视觉空间理解,且设计很工程化——混合架构保护预训练知识、渐进训练、双 KV cache 常驻内存流式推理。fast weights 作为非线性记忆,比简单的 token 压缩或注意力池化更适合保留结构化的空间信息。

Tags: #Blog