ConvNet 在图像分类上已经能跟 Transformer 分庭抗礼,但一到目标检测和语义分割就明显掉队。为什么?OverLoCK 的答案很直接:卷积核尺寸固定,输入分辨率增大时感受场跟不上。这不是调大核就能解决的——大核卷积成本高,可变形卷积又丢了归纳偏置。
问题:金字塔架构的自上而下盲区
人类视觉系统有一个关键机制:自上而下注意力。大脑先快速形成对场景的整体感知(overview),再回到感官层面精确定位目标(look closely)。但现代 ConvNet 的金字塔架构是从底向上逐层编码——每一层的输入只依赖前面的层,中间层缺乏显式的全局语义引导。
论文用可视化揭示了这个问题:Swin-T、ConvNeXt-T、VMamba-T 在 Stage 3(离分类器远的层)的类激活图经常定位不准,甚至给出错误的类别标签。这些模型其实都能捕捉某种程度的长程依赖,但缺少从高层语义到低层特征的反馈通路。
核心架构:三子网分工的 DDS 策略
Base-Net 负责编码低/中层特征,将输入图像下采样到 H/16。然后兵分两路——
Overview-Net 是一个轻量网络,立即将 H/16 特征下采样到 H/32,快速生成一张语义丰富但分辨率粗糙的全局特征图。这就是人类"扫一眼"的产物,论文叫它 context prior(上下文先验)。
Focus-Net 在 context prior 的引导下精炼中层特征。context prior 既在特征层面调制 Focus-Net 的输出(通过 gate 机制),也在核权重层面注入全局信息(通过 ContMix)。
DDS 的精妙之处:Overview-Net 和 Focus-Net 共享同一个 Base-Net,不重复编码低/中层特征。预训练时两个子网各接一个分类头,迁移到下游任务时 Overview-Net 不再加辅助 loss。
Context Flow:context prior 在 Focus-Net 每一层被更新流动——进入 block 前与特征 concat,处理后拆分出更新的 prior 和新特征。同时初始先验 P₀ 通过残差连接参与更新(Pi+1 = αP′i + βP₀),防止信息在深层稀释。
ContMix:固定尺寸核也能捕捉长程依赖
思路:对每个 token,计算它和所有 区域中心(adaptive average pooling 得到的 S×S 个点)的亲和力,用可学习线性层 Wd 聚合成 K×K 动态卷积核。Q 来自当前特征 Zi,K 来自 context prior Pi——分别用不同信息计算亲和力。
多组设计:一半用大核捕捉长程依赖,一半用 5×5 小核捕捉局部细节。S=7,计算复杂度线性。
每个位置的卷积核都不同,且每个核都携带全局上下文。卷积核只有 K×K 大小,但每次卷积都在和全局信息交互——"固定尺寸核也能建模长程依赖"的关键。
实验:全面碾压
ImageNet-1K 上,OverLoCK-T 达到 84.2% Top-1,用约 1/3 计算量超过 ConvNeXt-B,超过 MogaNet-S 0.8%、UniRepLKNet-T 1.0%、VMamba-T 1.6%。
| Backbone | 类型 | FLOPs(G) | Params(M) | Top-1(%) |
|---|---|---|---|---|
| ConvNeXt-B | C | 15.4 | 89 | 84.0 |
| MogaNet-S | C | 5.0 | 25 | 83.4 |
| UniRepLKNet-T | C | 4.9 | 31 | 83.2 |
| VMamba-T | M | 6.4 | 25 | 82.6 |
| BiFormer-T | T | 5.3 | 27 | 82.9 |
| OverLoCK-T | C | 5.5 | 33 | 84.2 |
| OverLoCK-B | C | 16.7 | 95 | 85.1 |
下游任务更有说服力——论文揭示了 ConvNet 分类能打平 Transformer 但检测分割差距明显的根本原因:固定核尺寸导致大分辨率下感受场不够。
| Backbone | COCO APb(Cascade 3×) | ADE20K mIoU |
|---|---|---|
| MogaNet-B | 52.6 | 50.1 |
| UniRepLKNet-S | 53.0 | 50.5 |
| ConvNeXt-B | 52.7 | 50.0 |
| OverLoCK-S | 53.6 | 51.3 |
| OverLoCK-B | 53.9 | 51.7 |
消融:每一步都有收益
| 方法 | FLOPs(G) | Top-1(%) | mIoU(%) |
|---|---|---|---|
| PlainNet | 2.5 | 76.3 | 38.8 |
| + RepConv + SE + Local Conv | 2.5 | 77.1 | 39.6 |
| → ConvFFN | 2.6 | 78.5 | 41.1 |
| → DDS 分解(非循环) | 2.6 | 79.0 | 41.6 |
| + ContMix 动态卷积 | 2.6 | 80.0 | 42.9 |
| + 初始先验 + Gate (完整 OverLoCK) | 2.6 | 80.8 | 43.8 |
循环模型反而比 DDS 分解差——显式分支设计比循环反馈更高效。
评价与工程意义
OverLoCK 指出了 ConvNet 骨干被忽视的根本问题:自上而下注意力的缺失。DDS 用最简洁的方式——三子网分支 + context prior 流动——解决了它。ContMix 作为通用 plug-and-play 模块,对视频理解、医学影像等需要强语义引导的场景都有潜力。
挑刺:三子网增加了工程复杂度(预训练双分类头),Overview-Net 下游仍占计算。但考虑到性能提升幅度,这个 trade-off 很划算。
ConvNet 不需要变成 Transformer 才能变强。正确的问题是:人类视觉的自上而下注意力,怎么用最纯的卷积来实现。OverLoCK 给了一个漂亮的答案。