112、顶会注意力机制复现:FocalModulation焦点调制注意力在YOLOv12中的应用——替代Area Attention的涨点实验
112、顶会注意力机制复现:FocalModulation焦点调制注意力在YOLOv12中的应用——替代Area Attention的涨点实验调试了三天的困惑上周在跑YOLOv12的C2f模块时,发现Area Attention在特征图分辨率降到20x20以下后,计算量不降反升。查了CUDA内存分配日志,发现是Area Attention的窗口划分逻辑在低分辨率下产生了大量冗余的padding操作。这让我开始怀疑:YOLOv12默认的Area Attention真的适合所有检测尺度吗?尤其是对于小目标密集场景,窗口内的信息交互是否过于局部化?带着这个疑问,我翻到了NeurIPS 2023的Focal Modulation Networks。这篇论文提出的焦点调制机制,用层次化调制替代了传统的点积注意力,在ImageNet分类上以更少的FLOPs超越了Swin Transformer。但真正吸引我的是它的"焦点"特性——通过不同深度的卷积核逐步聚合上下文信息,这恰好能弥补Area Attention在低分辨率下感受野受限的问题。FocalModulation的核心思想:别把注意力当成唯一解FocalModulation的出发点很朴素:既然注意力机制的核心是让每个token根据上下文调整自身表征,那为什么一定要用Query-Key的点积来度量相关性?论文提出了三个替代步骤:第一步:分层上下文聚合。用四组不同深度和膨胀率的深度可