0
0

参数直降 28.8%,精度暴涨 7.5%!AeroLight:专为无人机巡检打造的轻量化小目标检测模型

2026-08-02
2026-08-03
参数直降 28.8%,精度暴涨 7.5%!AeroLight:专为无人机巡检打造的轻量化小目标检测模型
文章摘要
|

(来源:计算机视觉研究院 计算机视觉研究院)

计算机视觉研究院

公众号ID计算机视觉研究院

学习群扫码在主页获取加入方式

https://pmc.ncbi.nlm.nih.gov/articles/PMC12430999/pdf/sensors-25-05369.pdf

计算机视觉研究院专栏

Column of Computer Vision Institute

文提出了全新的轻量化检测架构AeroLight,在 VisDrone2019 数据集上 mAP50 较基线提升 7.5%,参数量反而减少 28.8%,在精度与效率之间实现了极佳平衡。

PART/1

痛点   

为什么航拍小目标检测这么难?

无人机遥感技术已经广泛应用在智慧农业、交通巡检、应急救援、基建监测等领域,但目标检测算法落地始终面临三大瓶颈:

目标像素占比极低:高空拍摄的车辆、行人通常只有几十甚至十几个像素,特征信息极易在网络下采样中丢失;

场景复杂干扰多:目标密集排布、遮挡严重,背景杂乱容易产生大量误检;

部署算力受限:机载边缘设备算力有限,大模型无法满足实时检测的要求。

主流的 YOLO 系列等通用检测模型,原本针对地面视角数据设计,特征金字塔的下采样幅度大、融合策略简单,放到航拍场景下往往 “水土不服”。此前的改进方案大多只做单点优化,缺少针对航拍场景的系统性架构设计。

PART/2

创新   

三大核心创新,打造专属航拍的轻量化模型

AeroLight 没有停留在局部模块的修修补补,而是从特征金字塔、特征融合、边界框回归三个层面进行了系统性重构,整体架构如下图所示: 

【AeroLight 模型整体架构图】【AeroLight 模型整体架构图】

1. 任务感知特征金字塔:把算力花在小目标上

针对航拍场景小目标占主导的特点,团队对特征金字塔做了 “一增一减” 的重构:

  • 新增 P2 高分辨率检测头:引入 160×160 分辨率的检测分支,保留更细粒度的空间细节,专门负责极小目标检测;

  • 移除 P5 低分辨率检测头:砍掉负责大目标、算力消耗高的 P5 分支,大幅压缩参数量与计算量。

【特征金字塔重构示意图】【特征金字塔重构示意图】

这种 “定向挪算力” 的设计,没有盲目增加网络复杂度,而是精准匹配航拍场景的目标分布。仅这一项改动就带来了 5.6% 的 mAP50 提升,同时参数量从 2.57M 降至 1.83M。

2. 动态特征融合(DFF)模块:双注意力并行滤除噪声

多尺度特征融合是小目标检测的关键,但传统的简单拼接 / 相加容易造成特征稀释、背景噪声干扰。 AeroLight 提出了全新的 DFF 模块,采用通道注意力 + 空间注意力并行的双路径结构:

  • 通道注意力分支:学习 “哪些特征通道更重要”,强化有效特征、抑制无用通道;

  • 空间注意力分支:学习 “哪些区域是目标”,聚焦目标位置、过滤背景杂波。

【DFF 模块架构图】【DFF 模块架构图】

两路注意力权重同时对特征图进行自适应重校准,避免了串行注意力的信息损耗,让融合后的特征更具区分度,在复杂背景下也能精准锁定小目标。

3. Shape-IoU 损失:形状感知,定位更精准

航拍视角下的目标往往存在旋转、形状不规则的问题,传统 CIoU 损失只考虑中心距离与宽高比,定位精度不足。 团队替换为 Shape-IoU 损失函数,在重叠度、中心距离的基础上,额外加入了形状匹配惩罚项,对边界框的宽度、高度差异进行更精细的约束,让回归方向更稳定,显著提升不规则目标的定位精度。

PART/3

实验    

实验验证:精度、效率、泛化性全面领先

团队在三大数据集上完成了充分验证,结果充分证明了 AeroLight 的实力。

1. VisDrone2019:轻量模型里的新 SOTA

作为无人机检测的核心基准,VisDrone2019 包含密集、多类别、多尺度的城市场景,极具挑战性。对比结果如下:

【VisDrone2019 验证集性能对比表】【VisDrone2019 验证集性能对比表】
  • 相较基线 YOLOv12n,AeroLight 的 mAP50 从 32.3% 提升至 39.8%(+7.5%),mAP50-95 提升 3.3%;

  • 参数量仅 1.83M,比基线减少 28.8%;GFLOPs 仅 11.5,远低于同精度级别模型;

  • 对比同属轻量型的 YOLO11s,AeroLight 精度更高,参数量仅为其 19.5%。

消融实验也验证了每个模块的独立贡献,三个模块协同作用,实现了 “1+1+1>3” 的效果:

【消融实验结果表】【消融实验结果表】

从检测效果可视化来看,AeroLight 在密集遮挡、远距离小目标、低光照等场景下,漏检、误检都显著少于基线模型:

【VisDrone2019 复杂场景检测效果对比图】【VisDrone2019 复杂场景检测效果对比图】

分类别来看,行人、摩托车、自行车这类极小目标的 mAP50 提升超过 10%,精准命中了航拍检测的核心痛点。

2. 跨数据集泛化性拉满

除了城市场景,团队还在 RSOD 遥感数据集、自建华兴农场无人机数据集上进行了验证: 

【RSOD 数据集性能表】【RSOD 数据集性能表】

在 RSOD 数据集上,AeroLight 的 mAP50 达到 95.6%,优于所有对比基线。

【华兴农场无人机数据集性能表】【华兴农场无人机数据集性能表】

在高空农田场景的自建数据集中,目标像素极低,AeroLight 仍取得了 83.7% 的 mAP50,较基线提升 3.1%,肉眼难以分辨的极小车辆也能稳定检出:

【农场数据集检测效果对比图】【农场数据集检测效果对比图】

PART/4

总结与展望   

AeroLight 针对无人机航拍场景做了系统性的架构优化,通过特征金字塔重构、动态特征融合、形状感知损失三大创新,实现了 “更高精度、更小体积” 的双重突破,为机载端侧实时检测提供了可行的落地方案。

当然,目前模型仍有拓展空间:当前仅支持 RGB 输入,未来可融合红外、多光谱等多模态数据;同时也将进一步验证雾天、阴天等极端天气下的鲁棒性。

未来,这类面向特定场景的 “任务定制化” 轻量模型,会成为无人机端侧 AI 的重要发展方向,推动智慧农业、安防巡检、应急救援等场景的智能化落地。

有相关需求的你可以联系我们!

支持与分享

如果这篇文章对你有帮助,欢迎分享给更多人或者给予支持!