首页/新闻资讯/正文详情

260923-report

发布时间:2026/9/25 21:48:29 来源:云帆数科 栏目:资讯中心
260923-report
260923-report‍AuthorZenosOverview本文档主要记录26年9月第三周学习内容以及后续学习计划。文章目录260923-report[toc]一、研究背景1.1 微小目标检测1.1.1 微小目标检测面临的挑战1.1.2 常见的一阶段目标检测流程二、近期学习内容2.1 [FRFDet](https://arxiv.org/abs/2607.04125v1)2.2 [ZoomDet](https://arxiv.org/abs/2602.07512v2)2.3 YOLO26 相关实验三、后续学习计划附录一、研究背景1.1 微小目标检测在无人机视角中的目标通常包括人、车辆、船只、动物、建筑物局部目标等。和普通目标检测相比难点不是有没有目标而是这些目标在图像里往往只占很少的像素这给目标检测任务带来了很大的挑战。1.1.1 微小目标检测面临的挑战样本分布不平衡航拍图像样本正负不均、密集遮挡空间分布与背景干扰优化聚焦目标密集区域抑制背景噪声。类别与样本数量优化处理长尾类别分布稀有样本少动态样本选择平衡正负样本解决类别不平衡问题。遮挡与特征混淆优化挖掘漏检目标特征对齐融合增强小目标特征解决密集遮挡下的漏检问题。尺度变化多样性航拍目标跨度大图像感知增强放大小目标区域增强小目标特征表达。上下文信息聚合整合不同尺度的上下文信息提升模型对尺度变化的适应性。特征对齐优化解决多尺度特征的不对齐问题因为下采样、旋转或视角变化导致它和原始图像中的物体在位置、形状或方向上对不上抑制大目标对小目标的特征压制。全局特征感知整合全局语义信息减少复杂背景的干扰。小目标检测回归优化回归指标优化适配小目标的标签分配改进传统分配策略通过中心区域采样、动态标签分配为小目标生成更多正样本解决小目标正样本不足的问题。边界框回归优化针对航拍旋转目标设计定向边界框回归方法解决任意方向目标的定位问题。损失函数设计提出适配小目标的新度量同时改进旋转目标的损失函数提升角度预测精度。1.1.2 常见的一阶段目标检测流程下面以FCOS为例,介绍常见的单阶段目标检测算法流程Backbone首先输入图像经过Backbone 主干网络进行特征提取。随着网络不断加深特征图会逐渐下采样例如图中的 (C3、C4、C5)它们大致对应原图的 (1/8、1/16、1/32) 尺度。浅层特征分辨率高保留的细节信息比较多深层特征分辨率低但语义信息更强。Neck不同尺度的特征会进入FPN特征金字塔进行多尺度特征融合得到 (P3、P4、P5) 等特征层同时还可以继续生成 (P6、P7)。这样做的目的是让高分辨率特征获得更强的语义信息同时保留不同尺度目标的检测能力。Head最后每一个 FPN 层都会输入到Detection Head输出预测类别分类和检测框位置。二、近期学习内容近期学习主要围绕微小目标检测优化方案、无人机相关基础知识展开。2.1FRFDet小结本文针对无人机影像中小目标检测在复杂天气、低照度与传感器噪声下易受背景冗余、细节退化和跨尺度语义—空间融合不佳影响的问题提出轻量单阶段检测器FRFDet。其核心包括两个即插即用模块逆双向采样 IBS通过通道扩展—压缩与双向模式重建以近似对称的可学习下采样/上采样保留空间细节、抑制背景冗余尺度—特征关系交叉融合 SFRCF则显式建模融合策略与模型容量的关系紧凑模型采用组间逐元素乘法增强非线性交互较大模型采用组间加法以稳定梯度并保持语义。在 VisDrone、UAVDT、HazyDet 和 MS COCO 上的实验表明FRFDet 以较低参数量、FLOPs 和较快推理达到轻量检测器的先进水平如 VisDrone 上 FRFDet-S 为 26.1 AP、FRFDet-X 为 30.8 APCOCO 紧凑变体较近期实时检测器最高提升 1.8 AP。研究意义在于为资源受限的无人机平台提供了准确、高效且可扩展的实时航拍感知方案并验证了采样对称性与尺度自适应融合对无人机小目标检测的价值。IBS——逆向双采样IBS让上下采样尽可能使用一套对应的结构原本的非对称采样会导致细节损失、背景冗余、空间错位对小目标检测影响比较大。其主要流程如下其公式如下F D T r e o r g ( F E C ( X i ) ) F_D T_{\mathrm{reorg}} \left( F_{EC}(X_i) \right)FD​Treorg​(FEC​(Xi​))IBS分为两个主要部分F E C ( ) F_{EC}()FEC​()Expansion–Compression特征处理使用一套卷积流程1 × 1 C o n v → 3 × 3 D W C o n v → 1 × 1 C o n v 1\times1 Conv \rightarrow 3\times3 DWConv \rightarrow 1\times1 Conv1×1Conv→3×3DWConv→1×1Conv实现通道像扩展再压缩C → 2 C → C ′ C \rightarrow 2C \rightarrow CC→2C→C′对特征图先扩展放大边缘信息然后再利用DWConv来进行局部信息的提取最后再进行压缩通道提取局部信息。T r e o r g ( ) T_{\mathrm{reorg}}()Treorg​()Spatial Rearrangement空间重排不是使用简单的下采样方法而是将一个通道的特征图拆分成小块搬进通道这个维度。SFRCF——尺度特征关系交叉融合SFRCF根据模型规模决定怎么融合不同尺度的特征。传统的FPN/PAN大多时候都是使用类似add/concate的融合方法。SFRCF其主要流程如下将两个相邻尺度特征图的各自通道分为2组每组做不同感受野的特征提取F j P W C o n v ( D W C o n v ( X ( j ) ) ) F^j PWConv(DWConv(X^{(j)}))FjPWConv(DWConv(X(j)))特征融合:F a d d W 1 T x 1 W 2 T x 2 F_{add} W_1^Tx_1 W_2^Tx_2Fadd​W1T​x1​W2T​x2​F m u l ( W 1 T x 1 ) ⊙ ( W 2 T x 2 ) F_{mul}(W_1^Tx_1)\odot(W_2^Tx_2)Fmul​(W1T​x1​)⊙(W2T​x2​)根据模型规模来选择不同的融合操作S、T、M用F m u l F_{mul}Fmul​L、X用F a d d F_{add}Fadd​作者分析认为小模型通道数量少表达能力有限需要更强的跨尺度非线性融合而大规模模新通道多本身表达能力就已经很强Mul操作会导致过多的特征纠缠反而效果更差。2.2ZoomDet小结ZoomDet 针对无人机航拍图像中目标普遍较小且分布稀疏、非均匀导致现有检测器难以有效优化的问题提出了一种“自适应放大再检测”的框架。其核心方法是用一个轻量级OffsetNet预测逐像素空间偏移实现对输入图像的非均匀放大并设计基于目标框面积的放大损失来监督偏移学习同时提出角点对齐的边界框变换方法将标注框映射到放大空间用于训练并在推理时将预测框映射回原空间从而避免求解复杂的逆变换。在 VisDrone、UAVDT 和 SeaDronesSee 三个无人机目标检测数据集上的实验表明ZoomDet 能显著提升 Faster R-CNN 和 YOLOv8 的检测精度尤其在 SeaDronesSee 上为 Faster R-CNN 带来 8.4 个 mAP 的绝对提升而额外延迟仅约 3 ms小目标放大倍数可超过 2.6 倍。该方法与检测架构无关还可与基于分块或特征级放大的方法结合进一步提升性能并初步展示了对遥感视觉语言模型等更广泛任务的扩展潜力为无人机及遥感小目标检测提供了一种低成本、高收益的图像级增强思路。逐像素空间偏移预测网络OffsetNetOffsetNet给每个采样点预测一个偏移量原来的位置( x , y ) (x,y)(x,y)经过OffsetNet后变为( x Δ x , y Δ y ) (x\Delta x,y\Delta y)(xΔx,yΔy)让更多的采样点挤到汽车附近。让汽车在输出特征图上占据更多的像素。Object Zooming Loss作者明确指出仅依赖 detection loss 反向传播不足以有效学习目标放大因此给OffsetNet设计了损失函数。L z o o m ∑ i [ max ⁡ ( log ⁡ α ϵ m i ϵ , 0 ) ] β \mathcal L_{zoom} \sum_i \left[ \max \left( \log \frac{\alpha\epsilon} {m_i\epsilon}, 0 \right) \right]^\betaLzoom​i∑​[max(logmi​ϵαϵ​,0)]β其中α \alphaα是目标放大倍率m i m_imi​就是变换后目标面积/原目标面积m i s u m ( a i ′ ) s u m ( a i ) m_i \frac{\mathrm{sum}(a_i)}{\mathrm{sum}(a_i)}mi​sum(ai​)sum(ai′​)​角点对齐的边界框变换(Corner-aligned Bounding Box Transformation)使用GT左上角和右下角坐标使用最近邻搜索最近采样点对应到Zoomed图像标记为新的角点坐标形成新的预测框。推理阶段反转该流程。总损失L L d e t e c t i o n L z o o m \mathcal L \mathcal L_{detection} \mathcal L{zoom}LLdetection​Lzoom2.3 YOLO26 相关实验修改特征图、输入分辨率后进行相关对比实验。三、后续学习计划在yolo26上复现相关论文中的模块。继续读有关微小目标检测的论文。附录

相关推荐

Windows 11非分页池泄漏排查实战:PoolMon+RAMMap精解
Windows 11非分页池泄漏排查实战:PoolMon+RAMMap精解

1. 这不是蓝屏前的幻觉:Windows 11里“吃内存”的幽灵真存在你有没有遇到过这种情况:刚重启完系统,任务管理器显示已用内存才2GB,可两小时后,它就悄无声息地涨到6GB、7GB,甚至8GB以上?打开的任务… · 2026/9/25 21:48:22

perl踩坑系列之foreach
perl踩坑系列之foreach

先上代码:#!/usr/bin/perl -w use strict; use Cwd realpath; use File::Basename; use FindBin qw($Bin $Script); use Getopt::Long; use Storable; use lib /mnt/lustre/user/wubin/01.Program/Scripts/01.script/GeneLab; use Common;my $common Common ->… · 2026/9/25 21:48:22

Hermes 客户端部署加载失败排查:TaoToken 统一 Key 接入 settings.json 配置骨架与验证动作(含安装包)
Hermes 客户端部署加载失败排查:TaoToken 统一 Key 接入 settings.json 配置骨架与验证动作(含安装包)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 21:47:45

为什么我给智能体做技能库,而不是写一堆 Prompt?
为什么我给智能体做技能库,而不是写一堆 Prompt?

为什么我给智能体做了一套“技能库”而不是写一堆Prompt做AI Agent开发这段时间,我踩过最深的坑,就是看着模型一本正经地“表演”干活,最后却给我返回一堆毫无用处的文本。你问它今天天气,它能给你写一篇80字的作文;你… · 2026/9/25 22:25:55

Atlas 300V 24G实战:用NPU加速卡部署YOLO推理的全流程指南
Atlas 300V 24G实战:用NPU加速卡部署YOLO推理的全流程指南

前阵子项目做边缘侧视频流目标检测,手里原本用的是GPU,但客户指定设备时偏偏是一块Atlas 300V 24G。拿到卡的第一反应其实和很多人一样:这东西到底算不算运算加速卡?能不能直接把YOLO塞进去跑?后来折腾了几天&#xff… · 2026/9/25 22:25:55

【无标题】27届软件工程找实习总结
【无标题】27届软件工程找实习总结

很多同学并不是能力不够,而是准备方向和现在企业真正需要的能力出现了偏差。很多计算机学生到了大三、大四,准备秋招的时候,依然把大量时间投入在传统Java项目上,比如SpringBoot商城系统、校园二手交易平台、博客管理系统、后台管… · 2026/9/25 22:25:55

Atlas 300V实战:昇腾AI加速卡上部署YOLO模型全攻略
Atlas 300V实战:昇腾AI加速卡上部署YOLO模型全攻略

先回答那个被搜了很多次的问题:Atlas 300V 24G,确实是一块运算加速卡,而且是一块专门为AI推理设计的加速卡。但它和你熟悉的英伟达GPU有本质区别——它不是拿来跑CUDA的,底层走的是完全不同的计算架构和软件栈。很多人第一次接触A… · 2026/9/25 22:25:55

Codeg 浏览器智能体:如何让 AI Agent 读取并操作网页的完整指南
Codeg 浏览器智能体:如何让 AI Agent 读取并操作网页的完整指南

Codeg 浏览器智能体:如何让 AI Agent 读取并操作网页的完整指南 【免费下载链接】codeg Collaborative multi-agent AI coding workspace: aggregate sessions from Claude Code, Codex, OpenCode, Pi, Grok Build, etc. Desktop app, self-hosted server, or Docke… · 2026/9/25 22:25:17

Atlas 300V 24G部署YOLO全攻略:从模型转换到推理调优
Atlas 300V 24G部署YOLO全攻略:从模型转换到推理调优

1. 先搞清楚:Atlas 300V 24G到底是不是一张“运算加速卡”服务器到货那天,我做第一件事不是急着装系统,而是先插上一块全新的计算卡。卡身上的印刷体小字写得很克制:Atlas 300V 24GB。随后我打开终端敲了一句npu-smi info&#xf… · 2026/9/25 22:24:20

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码