问题:MLLM 不懂空间
MLLM 在 2D 语义理解上已经很强,但空间理解一塌糊涂——缺乏 3D 几何先验。现有空间增强方案大多只处理单图或短视频(16-32 帧),视频拉长到上千帧就崩溃——超出上下文窗口或显存爆炸。
关键洞察:人类理解空间不是一次性看完整个场景,而是通过持续的视觉流逐步积累空间证据。需要一种流式、增量式的空间记忆机制。
TTT 做空间记忆
Test-Time Training 在推理时更新一小部分参数(fast weights)作为自适应记忆。每个 token 先更新 fast weights(Update),再用更新后的 weights 处理当前 query(Apply)。由于 fast weights 是线性复杂度,天然适合长序列。
Spatial-TTT 把视频切成大 chunk,逐 chunk 更新 fast weights,把长范围时空依赖压缩进自适应记忆。每个 chunk 处理完后,fast weights 就"记住"了这批帧的空间信息,后续 chunk 在此基础上继续累积。
混合架构 + 空间预测机制
直接把所有 attention 层替换成 TTT 会破坏预训练的多模态对齐。Spatial-TTT 用 3:1 混合:75% 层用 TTT(线性复杂度压缩长距离依赖),25% 保留标准 self-attention 作为锚点层(保留全局上下文推理能力)。
在每个 TTT 层内,sliding-window attention 和 TTT 分支并行运行,共享 Q/K/V 投影。TTT 分支引入空间预测机制:用 3D 时空卷积(3×3×3 depthwise conv)注入局部时空归纳偏置,帮助 fast weights 捕获几何对应和时间连续性。Dirac 初始化确保初始行为等价于原始模型。
两阶段渐进训练
第一阶段:用构造的密集 3D 场景描述数据集(~16k 样本)训练 fast weight 更新动态,教会模型"记住"空间信息。Sliding window 从覆盖全序列逐步退火到等于 chunk size,强制 TTT 层逐步接管跨 chunk 信息传递。
第二阶段:用 300 万空间 VQA 数据微调,覆盖方向/距离估计、计数、路径规划等任务,教会模型"回忆和推理"。
实验结果:2B 模型超越闭源巨头
VSI-Bench(视频空间理解):Spatial-TTT-2B 取得 Avg. 64.4,超越所有闭源模型和所有开源模型:
| 模型 | 规模 | Avg. |
|---|---|---|
| GPT-5 | - | 55.0 |
| Gemini-3-Pro | - | 56.0 |
| Kimi-K2.5 | - | 53.6 |
| Qwen3-VL-8B | 8B | 57.9 |
| Spatial-MLLM-4B | 4B | 47.0 |
| Spatial-TTT | 2B | 64.4 |
在需要跨视角几何一致性的任务(相对方向 73.0、路径规划 77.0)上优势尤其明显。
MindCube(多视角空间推理):76.2 ACC,超越 Gemini-3-Pro(63.9)12.3 个百分点。
VSI-SUPER(10-120 分钟长视频流式感知):其他模型要么 OOM 要么性能崩溃,Spatial-TTT 保持稳定,计数任务大幅超越所有 baseline。
效率:1024 帧时 TFLOPs 和显存都比 Qwen3-VL-2B 降低 40%+,接近理论线性扩展。Spatial-MLLM-4B 在 512 帧就 OOM。
思考
这篇论文的价值在于把 TTT 从 NLP 领域成功迁移到视觉空间理解,且设计很工程化——混合架构保护预训练知识、渐进训练、双 KV cache 常驻内存流式推理。fast weights 作为非线性记忆,比简单的 token 压缩或注意力池化更适合保留结构化的空间信息。