
本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。Conv2Former(Huo et al., CVPR 2023《Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition》,官方源码 github.com/HVision-NKU/Conv2Former)把自注意力简化到极致:用大核深度卷积生成与内容相关的调制权重,直接逐通道缩放 value——没有 QK^T、没有注意力矩阵。本文把官方 Block 插进 v13n 层 8 之后(P5 出口,256 通道 @20×20),实测+747,520 参数、GFLOPs 6.5→7.13,与官方逐位一致(max diff = 0),1 轮冒烟训练正常完成。前言"动态卷积/注意力"家族的又一条线:CondConv/ODConv(第 17 篇)学多个卷积核做加权,DynamicConv2d(第 86 篇)对卷积核做 softmax 注意力,FocalModulation(第 20 篇)用卷积生成焦点调制——Conv2Former 走得更简:空间注意力权重不用算相似度,直接用一个大核深度卷积从特征里"卷"出来(大核天然覆盖长距离上下文),然后att ⊙ v逐通道调制 value。作者证明了这条"卷积式注意力"路线在分类/检测