260923-report

发布时间:2026/9/25 21:48:29
260923-report 260923-report‍AuthorZenosOverview本文档主要记录26年9月第三周学习内容以及后续学习计划。文章目录260923-report[toc]一、研究背景1.1 微小目标检测1.1.1 微小目标检测面临的挑战1.1.2 常见的一阶段目标检测流程二、近期学习内容2.1 [FRFDet](https://arxiv.org/abs/2607.04125v1)2.2 [ZoomDet](https://arxiv.org/abs/2602.07512v2)2.3 YOLO26 相关实验三、后续学习计划附录一、研究背景1.1 微小目标检测在无人机视角中的目标通常包括人、车辆、船只、动物、建筑物局部目标等。和普通目标检测相比难点不是有没有目标而是这些目标在图像里往往只占很少的像素这给目标检测任务带来了很大的挑战。1.1.1 微小目标检测面临的挑战样本分布不平衡航拍图像样本正负不均、密集遮挡空间分布与背景干扰优化聚焦目标密集区域抑制背景噪声。类别与样本数量优化处理长尾类别分布稀有样本少动态样本选择平衡正负样本解决类别不平衡问题。遮挡与特征混淆优化挖掘漏检目标特征对齐融合增强小目标特征解决密集遮挡下的漏检问题。尺度变化多样性航拍目标跨度大图像感知增强放大小目标区域增强小目标特征表达。上下文信息聚合整合不同尺度的上下文信息提升模型对尺度变化的适应性。特征对齐优化解决多尺度特征的不对齐问题因为下采样、旋转或视角变化导致它和原始图像中的物体在位置、形状或方向上对不上抑制大目标对小目标的特征压制。全局特征感知整合全局语义信息减少复杂背景的干扰。小目标检测回归优化回归指标优化适配小目标的标签分配改进传统分配策略通过中心区域采样、动态标签分配为小目标生成更多正样本解决小目标正样本不足的问题。边界框回归优化针对航拍旋转目标设计定向边界框回归方法解决任意方向目标的定位问题。损失函数设计提出适配小目标的新度量同时改进旋转目标的损失函数提升角度预测精度。1.1.2 常见的一阶段目标检测流程下面以FCOS为例,介绍常见的单阶段目标检测算法流程Backbone首先输入图像经过Backbone 主干网络进行特征提取。随着网络不断加深特征图会逐渐下采样例如图中的 (C3、C4、C5)它们大致对应原图的 (1/8、1/16、1/32) 尺度。浅层特征分辨率高保留的细节信息比较多深层特征分辨率低但语义信息更强。Neck不同尺度的特征会进入FPN特征金字塔进行多尺度特征融合得到 (P3、P4、P5) 等特征层同时还可以继续生成 (P6、P7)。这样做的目的是让高分辨率特征获得更强的语义信息同时保留不同尺度目标的检测能力。Head最后每一个 FPN 层都会输入到Detection Head输出预测类别分类和检测框位置。二、近期学习内容近期学习主要围绕微小目标检测优化方案、无人机相关基础知识展开。2.1FRFDet小结本文针对无人机影像中小目标检测在复杂天气、低照度与传感器噪声下易受背景冗余、细节退化和跨尺度语义—空间融合不佳影响的问题提出轻量单阶段检测器FRFDet。其核心包括两个即插即用模块逆双向采样 IBS通过通道扩展—压缩与双向模式重建以近似对称的可学习下采样/上采样保留空间细节、抑制背景冗余尺度—特征关系交叉融合 SFRCF则显式建模融合策略与模型容量的关系紧凑模型采用组间逐元素乘法增强非线性交互较大模型采用组间加法以稳定梯度并保持语义。在 VisDrone、UAVDT、HazyDet 和 MS COCO 上的实验表明FRFDet 以较低参数量、FLOPs 和较快推理达到轻量检测器的先进水平如 VisDrone 上 FRFDet-S 为 26.1 AP、FRFDet-X 为 30.8 APCOCO 紧凑变体较近期实时检测器最高提升 1.8 AP。研究意义在于为资源受限的无人机平台提供了准确、高效且可扩展的实时航拍感知方案并验证了采样对称性与尺度自适应融合对无人机小目标检测的价值。IBS——逆向双采样IBS让上下采样尽可能使用一套对应的结构原本的非对称采样会导致细节损失、背景冗余、空间错位对小目标检测影响比较大。其主要流程如下其公式如下F D T r e o r g ( F E C ( X i ) ) F_D T_{\mathrm{reorg}} \left( F_{EC}(X_i) \right)FD​Treorg​(FEC​(Xi​))IBS分为两个主要部分F E C ( ) F_{EC}()FEC​()Expansion–Compression特征处理使用一套卷积流程1 × 1 C o n v → 3 × 3 D W C o n v → 1 × 1 C o n v 1\times1 Conv \rightarrow 3\times3 DWConv \rightarrow 1\times1 Conv1×1Conv→3×3DWConv→1×1Conv实现通道像扩展再压缩C → 2 C → C ′ C \rightarrow 2C \rightarrow CC→2C→C′对特征图先扩展放大边缘信息然后再利用DWConv来进行局部信息的提取最后再进行压缩通道提取局部信息。T r e o r g ( ) T_{\mathrm{reorg}}()Treorg​()Spatial Rearrangement空间重排不是使用简单的下采样方法而是将一个通道的特征图拆分成小块搬进通道这个维度。SFRCF——尺度特征关系交叉融合SFRCF根据模型规模决定怎么融合不同尺度的特征。传统的FPN/PAN大多时候都是使用类似add/concate的融合方法。SFRCF其主要流程如下将两个相邻尺度特征图的各自通道分为2组每组做不同感受野的特征提取F j P W C o n v ( D W C o n v ( X ( j ) ) ) F^j PWConv(DWConv(X^{(j)}))FjPWConv(DWConv(X(j)))特征融合:F a d d W 1 T x 1 W 2 T x 2 F_{add} W_1^Tx_1 W_2^Tx_2Fadd​W1T​x1​W2T​x2​F m u l ( W 1 T x 1 ) ⊙ ( W 2 T x 2 ) F_{mul}(W_1^Tx_1)\odot(W_2^Tx_2)Fmul​(W1T​x1​)⊙(W2T​x2​)根据模型规模来选择不同的融合操作S、T、M用F m u l F_{mul}Fmul​L、X用F a d d F_{add}Fadd​作者分析认为小模型通道数量少表达能力有限需要更强的跨尺度非线性融合而大规模模新通道多本身表达能力就已经很强Mul操作会导致过多的特征纠缠反而效果更差。2.2ZoomDet小结ZoomDet 针对无人机航拍图像中目标普遍较小且分布稀疏、非均匀导致现有检测器难以有效优化的问题提出了一种“自适应放大再检测”的框架。其核心方法是用一个轻量级OffsetNet预测逐像素空间偏移实现对输入图像的非均匀放大并设计基于目标框面积的放大损失来监督偏移学习同时提出角点对齐的边界框变换方法将标注框映射到放大空间用于训练并在推理时将预测框映射回原空间从而避免求解复杂的逆变换。在 VisDrone、UAVDT 和 SeaDronesSee 三个无人机目标检测数据集上的实验表明ZoomDet 能显著提升 Faster R-CNN 和 YOLOv8 的检测精度尤其在 SeaDronesSee 上为 Faster R-CNN 带来 8.4 个 mAP 的绝对提升而额外延迟仅约 3 ms小目标放大倍数可超过 2.6 倍。该方法与检测架构无关还可与基于分块或特征级放大的方法结合进一步提升性能并初步展示了对遥感视觉语言模型等更广泛任务的扩展潜力为无人机及遥感小目标检测提供了一种低成本、高收益的图像级增强思路。逐像素空间偏移预测网络OffsetNetOffsetNet给每个采样点预测一个偏移量原来的位置( x , y ) (x,y)(x,y)经过OffsetNet后变为( x Δ x , y Δ y ) (x\Delta x,y\Delta y)(xΔx,yΔy)让更多的采样点挤到汽车附近。让汽车在输出特征图上占据更多的像素。Object Zooming Loss作者明确指出仅依赖 detection loss 反向传播不足以有效学习目标放大因此给OffsetNet设计了损失函数。L z o o m ∑ i [ max ⁡ ( log ⁡ α ϵ m i ϵ , 0 ) ] β \mathcal L_{zoom} \sum_i \left[ \max \left( \log \frac{\alpha\epsilon} {m_i\epsilon}, 0 \right) \right]^\betaLzoom​i∑​[max(logmi​ϵαϵ​,0)]β其中α \alphaα是目标放大倍率m i m_imi​就是变换后目标面积/原目标面积m i s u m ( a i ′ ) s u m ( a i ) m_i \frac{\mathrm{sum}(a_i)}{\mathrm{sum}(a_i)}mi​sum(ai​)sum(ai′​)​角点对齐的边界框变换(Corner-aligned Bounding Box Transformation)使用GT左上角和右下角坐标使用最近邻搜索最近采样点对应到Zoomed图像标记为新的角点坐标形成新的预测框。推理阶段反转该流程。总损失L L d e t e c t i o n L z o o m \mathcal L \mathcal L_{detection} \mathcal L{zoom}LLdetection​Lzoom2.3 YOLO26 相关实验修改特征图、输入分辨率后进行相关对比实验。三、后续学习计划在yolo26上复现相关论文中的模块。继续读有关微小目标检测的论文。附录