参数直降 28.8%,精度暴涨 7.5%!AeroLight:专为无人机巡检打造的轻量化小目标检测模型
(来源:计算机视觉研究院 计算机视觉研究院)
计算机视觉研究院

公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC12430999/pdf/sensors-25-05369.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute
本文提出了全新的轻量化检测架构AeroLight,在 VisDrone2019 数据集上 mAP50 较基线提升 7.5%,参数量反而减少 28.8%,在精度与效率之间实现了极佳平衡。
PART/1
痛点
为什么航拍小目标检测这么难?
无人机遥感技术已经广泛应用在智慧农业、交通巡检、应急救援、基建监测等领域,但目标检测算法落地始终面临三大瓶颈:
目标像素占比极低:高空拍摄的车辆、行人通常只有几十甚至十几个像素,特征信息极易在网络下采样中丢失;
场景复杂干扰多:目标密集排布、遮挡严重,背景杂乱容易产生大量误检;
部署算力受限:机载边缘设备算力有限,大模型无法满足实时检测的要求。
主流的 YOLO 系列等通用检测模型,原本针对地面视角数据设计,特征金字塔的下采样幅度大、融合策略简单,放到航拍场景下往往 “水土不服”。此前的改进方案大多只做单点优化,缺少针对航拍场景的系统性架构设计。
PART/2
创新
三大核心创新,打造专属航拍的轻量化模型
AeroLight 没有停留在局部模块的修修补补,而是从特征金字塔、特征融合、边界框回归三个层面进行了系统性重构,整体架构如下图所示:
【AeroLight 模型整体架构图】1. 任务感知特征金字塔:把算力花在小目标上
针对航拍场景小目标占主导的特点,团队对特征金字塔做了 “一增一减” 的重构:
新增 P2 高分辨率检测头:引入 160×160 分辨率的检测分支,保留更细粒度的空间细节,专门负责极小目标检测;
移除 P5 低分辨率检测头:砍掉负责大目标、算力消耗高的 P5 分支,大幅压缩参数量与计算量。
【特征金字塔重构示意图】这种 “定向挪算力” 的设计,没有盲目增加网络复杂度,而是精准匹配航拍场景的目标分布。仅这一项改动就带来了 5.6% 的 mAP50 提升,同时参数量从 2.57M 降至 1.83M。
2. 动态特征融合(DFF)模块:双注意力并行滤除噪声
多尺度特征融合是小目标检测的关键,但传统的简单拼接 / 相加容易造成特征稀释、背景噪声干扰。 AeroLight 提出了全新的 DFF 模块,采用通道注意力 + 空间注意力并行的双路径结构:
通道注意力分支:学习 “哪些特征通道更重要”,强化有效特征、抑制无用通道;
空间注意力分支:学习 “哪些区域是目标”,聚焦目标位置、过滤背景杂波。
【DFF 模块架构图】两路注意力权重同时对特征图进行自适应重校准,避免了串行注意力的信息损耗,让融合后的特征更具区分度,在复杂背景下也能精准锁定小目标。
3. Shape-IoU 损失:形状感知,定位更精准
航拍视角下的目标往往存在旋转、形状不规则的问题,传统 CIoU 损失只考虑中心距离与宽高比,定位精度不足。 团队替换为 Shape-IoU 损失函数,在重叠度、中心距离的基础上,额外加入了形状匹配惩罚项,对边界框的宽度、高度差异进行更精细的约束,让回归方向更稳定,显著提升不规则目标的定位精度。
PART/3
实验
实验验证:精度、效率、泛化性全面领先
团队在三大数据集上完成了充分验证,结果充分证明了 AeroLight 的实力。
1. VisDrone2019:轻量模型里的新 SOTA
作为无人机检测的核心基准,VisDrone2019 包含密集、多类别、多尺度的城市场景,极具挑战性。对比结果如下:
【VisDrone2019 验证集性能对比表】相较基线 YOLOv12n,AeroLight 的 mAP50 从 32.3% 提升至 39.8%(+7.5%),mAP50-95 提升 3.3%;
参数量仅 1.83M,比基线减少 28.8%;GFLOPs 仅 11.5,远低于同精度级别模型;
对比同属轻量型的 YOLO11s,AeroLight 精度更高,参数量仅为其 19.5%。
消融实验也验证了每个模块的独立贡献,三个模块协同作用,实现了 “1+1+1>3” 的效果:
【消融实验结果表】从检测效果可视化来看,AeroLight 在密集遮挡、远距离小目标、低光照等场景下,漏检、误检都显著少于基线模型:
【VisDrone2019 复杂场景检测效果对比图】分类别来看,行人、摩托车、自行车这类极小目标的 mAP50 提升超过 10%,精准命中了航拍检测的核心痛点。
2. 跨数据集泛化性拉满
除了城市场景,团队还在 RSOD 遥感数据集、自建华兴农场无人机数据集上进行了验证:
【RSOD 数据集性能表】在 RSOD 数据集上,AeroLight 的 mAP50 达到 95.6%,优于所有对比基线。
【华兴农场无人机数据集性能表】在高空农田场景的自建数据集中,目标像素极低,AeroLight 仍取得了 83.7% 的 mAP50,较基线提升 3.1%,肉眼难以分辨的极小车辆也能稳定检出:
【农场数据集检测效果对比图】PART/4
总结与展望
AeroLight 针对无人机航拍场景做了系统性的架构优化,通过特征金字塔重构、动态特征融合、形状感知损失三大创新,实现了 “更高精度、更小体积” 的双重突破,为机载端侧实时检测提供了可行的落地方案。
当然,目前模型仍有拓展空间:当前仅支持 RGB 输入,未来可融合红外、多光谱等多模态数据;同时也将进一步验证雾天、阴天等极端天气下的鲁棒性。
未来,这类面向特定场景的 “任务定制化” 轻量模型,会成为无人机端侧 AI 的重要发展方向,推动智慧农业、安防巡检、应急救援等场景的智能化落地。
有相关需求的你可以联系我们!