261008-report
🧑🏻💻Author:Zenos
📝Overview:本文档主要记录26年10月第一周学习内容以及后续学习计划。
文章目录
- 261008-report
- @[toc]
- 一、研究背景
- 1.1 微小目标检测
- 1.1.1 微小目标检测面临的挑战
- 1.1.2 常见的一阶段目标检测流程
- 二、近期学习内容
- 2.1 [SET: Official implementation of SET: Spectral Enhancement for Tiny Object Detection (CVPR 2025).](https://github.com/HuixinSun/SET)
- **总损失函数** $$ \mathcal L
- 2.2 相关实验
- 三、后续学习计划
- 问题
- 附录
文章目录
- 261008-report
- @[toc]
- 一、研究背景
- 1.1 微小目标检测
- 1.1.1 微小目标检测面临的挑战
- 1.1.2 常见的一阶段目标检测流程
- 二、近期学习内容
- 2.1 [SET: Official implementation of SET: Spectral Enhancement for Tiny Object Detection (CVPR 2025).](https://github.com/HuixinSun/SET)
- **总损失函数** $$ \mathcal L
- 2.2 相关实验
- 三、后续学习计划
- 问题
- 附录
一、研究背景
1.1 微小目标检测
在无人机视角中的目标,通常包括人、车辆、船只、动物、建筑物局部目标等。和普通目标检测相比,难点不是有没有目标,而是这些目标在图像里往往只占很少的像素,这给目标检测任务带来了很大的挑战。
1.1.1 微小目标检测面临的挑战
样本分布不平衡
航拍图像样本正负不均、密集遮挡
空间分布与背景干扰优化
聚焦目标密集区域,抑制背景噪声。
类别与样本数量优化
处理长尾类别分布(稀有样本少),动态样本选择平衡正负样本,解决类别不平衡问题。
遮挡与特征混淆优化
挖掘漏检目标,特征对齐融合增强小目标特征,解决密集遮挡下的漏检问题。
尺度变化多样性
航拍目标跨度大
图像感知增强
放大小目标区域,增强小目标特征表达。
上下文信息聚合
整合不同尺度的上下文信息,提升模型对尺度变化的适应性。
特征对齐优化
解决多尺度特征的不对齐问题(因为下采样、旋转或视角变化,导致它和原始图像中的物体在位置、形状或方向上对不上),抑制大目标对小目标的特征压制。
全局特征感知
整合全局语义信息,减少复杂背景的干扰。
小目标检测回归优化
回归指标优化
适配小目标的标签分配
改进传统分配策略,通过中心区域采样、动态标签分配,为小目标生成更多正样本,解决小目标正样本不足的问题。
边界框回归优化
针对航拍旋转目标,设计定向边界框回归方法,解决任意方向目标的定位问题。
损失函数设计
提出适配小目标的新度量,同时改进旋转目标的损失函数,提升角度预测精度。
1.1.2 常见的一阶段目标检测流程
下面以FCOS为例,介绍常见的单阶段目标检测算法流程:
Backbone
首先,输入图像经过Backbone 主干网络进行特征提取。随着网络不断加深,特征图会逐渐下采样,例如图中的 (C3、C4、C5),它们大致对应原图的 (1/8、1/16、1/32) 尺度。浅层特征分辨率高,保留的细节信息比较多;深层特征分辨率低,但语义信息更强。
Neck
不同尺度的特征会进入FPN特征金字塔进行多尺度特征融合,得到 (P3、P4、P5) 等特征层,同时还可以继续生成 (P6、P7)。这样做的目的,是让高分辨率特征获得更强的语义信息,同时保留不同尺度目标的检测能力。
Head
最后,每一个 FPN 层都会输入到Detection Head,输出预测类别分类和检测框位置。
二、近期学习内容
近期学习主要围绕SET方法迁移到yolo26进行相关实验展开。
2.1SET: Official implementation of SET: Spectral Enhancement for Tiny Object Detection (CVPR 2025).
小结
本文针对微小物体检测中目标像素少、背景高频噪声干扰强、特征判别性不足的问题,提出一种频谱增强方法 SET。作者首先通过频域遮挡归因分析发现,微小物体在特征编码后高频特征较弱、更易受高频噪声影响;据此设计两个模块:层次化背景平滑模块 HBS根据真值掩码分离前景与背景,对背景进行自适应平滑以抑制高频噪声;对抗扰动注入模块 API在 FPN 特征上注入多分支对抗扰动,增强关键区域显著性并提升特征鲁棒性。实验在 AI-TOD、VisDrone2019、DOTA-v2.0 和 COCO 上进行,结果表明 SET 可广泛提升多种检测器性能,例如在 AI-TOD 上将 RFLA 提升 3.2% AP,在 COCO 上将 FCOS 提升 1.0% AP。研究意义在于从频域视角为微小物体检测提供新的分析和增强思路,且 SET 训练后不增加推理开销,具有较强的通用性和实用性。
SET方法
SET方法主要运用训练时在FPN特征检测和检测头之间:p i p_ipi→ HBS → API → Head。
SET方法主要在训练阶段的使用,推理阶段不会给基础检测器添加额外负担。
HBS
分层背景平滑。对不同层的特征背景进行平滑处理
先将特征图中的目标和背景分离
将训练数据中标定的目标和背景通过一个二值掩码进行分离,目标标记为1,背景标记为0。利用 GT box 构造这个二值 mask,然后把 FPN 特征拆成前景和背景两部分。
将P3特征切割成两块
目标:P i f g = P i ⊙ M P_i^{fg}=P_i\odot MPifg=Pi⊙M
背景:P i b g = P i ⊙ ( 1 − M ) P_i^{bg}=P_i\odot(1-M)Pibg=Pi⊙(1−M)
训练可学习的smoothing
对背景特征进行卷积、通道压缩->c->c/r->Relu->卷积、通道恢复->C/r->c
Residual 残差连接
背景特征不能被压缩的太狠,所以使用了处理后的背景和原始背景残差连接
API
HBS使背景更安静了,但是小目标的特征表现仍然很弱,引入对抗扰动注入(API),根据Loss梯度有目的地对抗学习,让网络对小目标特征学习更加鲁棒。
API的目标函数
min P i , θ i ( max ∥ ϵ i , c l s ∥ 2 ≤ ρ L c l s ( P i + ϵ i , c l s ) + γ ∥ P i ∥ 2 2 ) \min_{P_i,\theta_i} \left( \max_{\|\epsilon_{i,\mathrm{cls}}\|_2\le \rho} \mathcal L_{\mathrm{cls}}(P_i+\epsilon_{i,\mathrm{cls}}) + \gamma\|P_i\|_2^2 \right)Pi,θimin(∥ϵi,cls∥2≤ρmaxLcls(Pi+ϵi,cls)+γ∥Pi∥22)
其中,L c l s L_{cls}Lcls表示分类损失,内部优化将对抗性扰动ϵ i , c l s \epsilon_{i,\mathrm{cls}}ϵi,cls注入到P i P_iPi的特征空间中,其中ρ ρρ定义扰动大小,γ \gammaγ是控制正则化强度的超参数,θ i θ_iθi表示第i ii层的模型参数。扰动选择
特征图添加的扰动并非随机生成,而是选择梯度上升的方向:
ϵ i , c l s ∗ ≈ ρ ∇ P i L c l s ( P i ) ∥ ∇ P i L c l s ( P i ) ∥ 2 \epsilon_{i,\mathrm{cls}}^* \approx \rho \frac{ \nabla_{P_i}\mathcal L_{\mathrm{cls}}(P_i) }{ \|\nabla_{P_i}\mathcal L_{\mathrm{cls}}(P_i)\|_2 }ϵi,cls∗≈ρ∥∇PiLcls(Pi)∥2∇PiLcls(Pi)
其中,∇ P i L \nabla_{P_i}L∇PiL表示如何改变P i P_iPi会改变Loss,ρ \rhoρ是学习率。作者把多种任务扰动(分类分支、回归分支等)组合起来:
ϵ i a d v = ∑ m = 1 M λ m ϵ i , m ∗ \epsilon_i^{adv} = \sum_{m=1}^{M} \lambda_m\epsilon_{i,m}^{*}ϵiadv=m=1∑Mλmϵi,m∗
将扰动加到特征图中:P i + ϵ i a d v P_i+\epsilon^{adv}_iPi+ϵiadv,再进行训练。
总损失函数
$$
\mathcal L\mathcal L_{\mathrm{detection}}
+
\lambda
\sum_{i=1}^{N}
\mathcal L_i^{\mathrm{aux}}
\left(
P_iE+\epsilon_i{adv}
\right)
$$
2.2 相关实验
| AR | mAP50 | mAP50-95 | A P v t AP_{vt}APvt | A P t AP_{t}APt | A P s AP_{s}APs | A P m AP_{m}APm | A R v t AR_{vt}ARvt | A R t AR_{t}ARt | A R s AR_{s}ARs | A R m AR_{m}ARm | |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Origin | 38.56% | 37.62% | 21.86% | 2.49% | 9.88% | 21.84% | 36.47% | 9.42% | 22.91% | 37.27% | 51.28% |
| Gaussian | 38.33% | 37.35% | 21.65% | 2.18% | 9.02% | 20.97% | 37.23% | 7.29% | 22.05% | 36.51% | 53.67% |
| HBS | 39.19% | 37.27% | 21.53% | 2.21% | 9.11% | 21.32% | 35.98% | 7.25% | 21.70% | 36.90% | 53.12% |
| EnHBS | 37.93% | 36.40% | 21.12% | 2.16% | 8.78% | 20.60% | 36.12% | 8.00% | 21.31% | 35.96% | 52.63% |
| API | 38.64% | 37.54% | 21.85% | 2.39% | 9.16% | 21.36% | 36.96% | 9.70% | 22.65% | 37.31% | 53.72% |
| HBS + API | 39.12% | 37.46% | 21.81% | 2.93% | 9.84% | 21.67% | 35.33% | 10.93% | 23.08% | 36.40% | 50.58% |