transformer 在 CV 中的应用(三) ViT 分类网络
ViT 网络是谷歌在 2020 年提出的基于纯 Transformer 实现的分类网络,它完全抛弃了 CNN 网络。 ViT 网络中的 Transformer 与传统意义上的 Transformer 存在明显的不同,传统的 Transformer 是用于 NLP 中的机器翻译任务中,...
ViT 网络是谷歌在 2020 年提出的基于纯 Transformer 实现的分类网络,它完全抛弃了 CNN 网络。 ViT 网络中的 Transformer 与传统意义上的 Transformer 存在明显的不同,传统的 Transformer 是用于 NLP 中的机器翻译任务中,...
DETR 目标监测网络是 Facebook 提出的目标监测网络,它是 transformer 在目标检测网络中的首次尝试。相比之前使用 anchor 的目标检测网络, DETR 是一种 anchor free 的目标检测网络,网络最终输出为无序预测集合 (set prediction...
本文参考了英飞凌开源的远程证明代码的实现,并在此基础上进行了修改,这份开源的代码有三个分支, master 分支是远程证明实现相关的文档; device 分支是远程证明的客户端实现; server 分支是远程证明的服务端实现。除此之外还参考内核完整性度量模块相关的代码。
Transformer 是 Google 的团队在 2017 年提出的一种 NLP 经典模型,经过近几年的发展, Transformer 不仅在 NLP 领域有很好的应用,在 CV 领域也得到了快速发展。最初 Transformer 是为了替换 RNN 网络而出现的,因为 RNN 循...
本文介绍基于 Sort 算法的多目标跟踪方案,实现车流量统计。该方案主要由三个部分组成。 yolov3 进行目标检测、使用匈牙利算法对目标进行关联、使用卡尔曼滤波器对跟踪目标进行修正。
IOU 是 Intersection over Union 的缩写,意为交并比。它用来衡量真实边界框与预测边界框的重合程度,它的计算公式为 [交集/并集] 。
EfficientNet 是谷歌在 2019 年提出的新的特征提取网络。它的主要创新点并不是结构,不像 ResNet 、 SENet 发明了 shortcut 或 attention 机制, EfficientNet 的 base 结构是利用结构搜索搜出来的,然后使用 compoun...
MobileNet 是 谷歌 2017 提出的用于移动设备上的轻量级神经网络。那么为什么 MobileNet 是如何做到在不影响模型精度的条件下,大幅减少模型参数的呢?答案是深度可分离卷积。在随后的两年谷歌又推出了 V2 和 V3 版本。
下面的 accumulate 是模拟一个更大的 batchsize 来进行梯度下降,一定条件下, batchsize 越大训练效果越好,梯度累加则实现了 batchsize 的变相扩大,如果 accumulate 为 8 ,则 batchsize ‘变相’ 扩大了 8 倍。
ultralytics 版 YOLOv3 的主干网络是由 Darknet53 加上 SPP 结构再加上残差网络构成的。这个版本的主干网络是通过解析配置文件来加载的,由于网络整体结构比较简单,不过多介绍,本文主要介绍如果解析配置文件。