YOLO 源代码分析(三) YOLOv3 主干网络
ultralytics 版 YOLOv3 的主干网络是由 Darknet53 加上 SPP 结构再加上残差网络构成的。这个版本的主干网络是通过解析配置文件来加载的,由于网络整体结构比较简单,不过多介绍,本文主要介绍如果解析配置文件。
ultralytics 版 YOLOv3 的主干网络是由 Darknet53 加上 SPP 结构再加上残差网络构成的。这个版本的主干网络是通过解析配置文件来加载的,由于网络整体结构比较简单,不过多介绍,本文主要介绍如果解析配置文件。
数据集处理是基于 VOC 数据集的,我们知道 YOLO 网络在训练的时候拟合的是目标的中心点坐标和宽高,而 VOC 数据集标注的是目标的左上角坐标和右下角坐标,所以要先将数据集的标注信息进行处理。
YOLO 的主要思想是将一幅图像分成 SxS 个网格 (grid cell) ,如果某个 object 的中心落在这个网格中,则这个网格就负责预测这个 object 。每个网格要预测 B 个 bounding box ,每个 bounding box 除了要预测位置之外,还要附带预测...
看一下 encode 函数。该函数负责划分正负样本, SSD 网络选择正样本的策略有两条,第一, 与 gt box 有最大 iou 的 Default Box 被划分为正样本;第二,与 gt box 的 iou > 0.5 的 Default Box 被划分为正样本。为什么这样...
本篇文章开始介绍 SSD 网络, SSD ,是 Single Shot MultiBox Detector 的简称,是一种 one-stage 的多尺度目标检测网络,相比较 Faster-RCNN 这种 two-stage 的网络来说,模型检测速度快,并且由于在不同特征尺度上预测不同...
在 Faster RCNN 原论文中使用的 ROI pooling 层对预测特征层进行处理,但 ROI pooling 层在计算的过程中有两次整数化的过程,首先是对 RPN 网络生成的候选框进行取整操作;其次是将整数化后的边界区域平均分割成 k*k 个单元,对每个单元的边界进行整数化...
本篇文章介绍 RPN 网络,相比于 Fast-RCNN 网络, RPN 网络是 Faster-RCNN 最重要的改进之一。使用 RPN 结构生成候选框,将 RPN 生成的候选框投影到特征图上获得相应的特征矩阵。对于特征图上的每个 3x3 的滑动窗口,计算出滑动窗口中心点对应原始图像上...
这篇文章我们介绍一下 Faster-RCNN 网络的整体框架,以及 pytorch 的实现。 Faster-RCNN 网络主要由两部分组成, RPN 网络和 ROI 网络,下面分别介绍这两部分。
这篇文章我们介绍一下在 pytorch 官方提供的 Faster-RCNN 源码实现中使用的 backbone —— resnet50_fpn 。
存放 XML 文件,存放图像的标注信息,与 JPEGImages 中的图片一一对应。XML前面部分声明图像数据来源,大小等元信息。常用的标注信息如下: