极简笔记 YOLO9000 Better, Faster, Stronger

YOLOv2原文+翻译】YOLO9000: Better, Faster, Stronger 最近新出了YOLOV4,我系统的从V1开始整理出稿,传送门: 【YOLOv1原文+翻译】You Only Look Once Unified, Real-Time Object Detection 【YOLOv2原文+翻译】YOLO9000: Better, Faster, StrongerYOLOv3原文+翻译】YOLOv3:An Incremental Improvement 【YOLOv4原文+翻译】YOLOv4:Optimal Speed and Accuracy of Object Dete 阅读详情

极简笔记 YOLO9000: Better, Faster, Stronger

论文地址 https://arxiv.org/abs/1612.08242

文章核心就是提出了第二弹YOLOv2,在速度和精度上相较于上一代YOLO有大幅提高,完全超越SSD,唯一遗憾的就是用了类似于RPN的结构,不再是single-shot detector了。
对比
首先先放一张YOLO vs. YOLOv2对比图,然后逐一介绍v2的改进。

Batch Normalization

文章在原YOLO所有卷积层后都加了BN,提高了2%mAP

High Resolution Classifer

YOLO分类器是在224x224输入图片上pretrain,之后再增加到448做detection。YOLOv2分类器则先在448x448尺度ImageNet数据集上进行fine-tuning。效果+4%mAP

Convolutional with anchor boxes

YOLO直接回归到bbox的绝对坐标,改成使用RPN回归到offset,更容易训练。作者也把输入尺寸改成了416x416,为了除32之后是13x13的奇数尺寸,在最中间只有一个像素。YOLO每张图预测98bbox,69.5mAP,81%recall;而RPN预测上千个proposal,69.2mAP,88%recall,为了更大的提升空间作者选择了后者。

Dimension Clusters

RPN的anchor尺寸作者没有直接设置,而是在training set里做了一下聚类。这里并不是简单的欧氏距离k-means,而是利用bbox和最接近的centroid(feature map上最接近的像素框)的IOU进行距离定义:

d(box,centroid)=1IOU(box,centroid) d ( b o x , c e n t r o i d ) = 1 − I O U ( b o x , c e n t r o i d )

这样做的好处是能聚类到较好的宽高比。取聚类中心个数k=5作为复杂度与性能的tradeoff
cluster

Direct location prediction

在预计anchor位置偏移时候是直接回归,没有其他约束,导致训练初期较难收敛。作者将其改成回归 tx t x ,之后用sigmoid函数将其约束到0-1,即 bboxx=σ(tx)+cx b b o x x = σ ( t x ) + c x 。此外也如图修改了宽和高的约束( px,py p x , p y 是bbox prior,即前面cluster的结果。
regression

Fine-Grained Features

把浅层26x26x512尺寸feature map passthrough过来变成13x13x2048 和深层feature map concatenate在一起,+1%性能

Multi-Scale Training

输入图片尺寸从320-608都有,把网络在不同输入尺寸上训练。

New Network

使用Darknet-19网络,参数个数5.58 billion,相比VGG-16参数更少(30.69 billion),且在ImageNet top-5 accuracy高了1.2个点,速度也更快。

Hierarchical classification

建了一个类别WordTree树状结构,区别于WordNet有向图结构。相对于原有类别提出了很多归纳性的类别,例如自然景观(里面有草,树)、人造物(里面有飞机、汽车等等)。在分类过程中最细粒度的类别需要父节点通过贝叶斯概率连乘计算。这样训练的结果能对没有学习过的类别有较好的效果。比如网络从来没有见过金毛犬,但是见过狗。所以分类结果狗的概率会很高,但是下面的子类别比如哈士奇、泰迪等等种类的概率就会普遍很低。
wordtree
最后来一张速度性能对比,感受一下
speed
acc

文献阅读记录2-YOLO9000: Better, Faster, Stronger 我只是翻译或转载文献,截屏论文图片,记录下阅读记录。如有侵权,请联系删帖。 原标题: YOLO9000: Better, Faster, Stronger 原作者: Joseph Redmon, Ali Farhadi 阅读详情

相关推荐

论文翻译——YOLO9000: Better, Faster, Stronger

摘要 翻译: 我们介绍YOLO9000,一个最先进的,实时的物体检测系统,可以检测超过9000个物体类别。首先,我们提出了对YOLO检测方法的各种改进,既有新颖的,也有来自之前工作的改进。改进后的YOLOv2在PASCAL VOC和COCO等标准检测任务上是最先进的。使用一种新的,多尺度的训练方法,同样的YOLOv2模型可以运行在不同的大小,提供了一个单的折衷速度和准确性。在67帧每秒时,YOLOv2在2007 VOC上得到76.8的映射。在40帧/秒的时候,YOLOv2得到了78.6的贴图,超过了最

b_dxac的博客 650

YOLOv2目标检测算法——通俗易懂的解析

YOLOv2目标检测算法——通俗易懂的解析

chase 6744

FastestDet:比yolov-fastest更快!更强!全新设计的超实时Anchor-free目标检测算法

FastestDet是设计用来接替yolo-fastest系列算法,相比于业界已有的轻量级目标检测算法如yolov5n, yolox-nano, nanoDet, pp-yolo-tiny, FastestDet和这些算法压根儿不是一个量级,FastestDet无论在速度还是参数量上,都是要小好几个数量级的(不要在拿int8的模型和我fp32的模型比体积了,不公平),但是精度自然而然也比不过。FastestDet是针对计算资源紧缺的ARM平台设计的。

@bangbang的博客 1154

YOLO 超详细入门02 v2 (含代码及原文)

YOLO超详细入门02 零基础看懂 图文详解(含代码及原文)——网络架构,BN,高分辨率,细粒度特征……

IanYue的博客 8889

细粒度分类 | 细粒度识别中的深度定位与对齐

1.细粒度图像分析任务(又叫子类别图像分类)         分类:强监督(物体标准框、局部标注点)、弱监督(无人工标注信息或者只包含物体标注框);   图 1 细粒度图像识别与粗类识别的区别   数据集描述:Caltech-UCSD Birds-200-2011                                                           ...

东南风的博客 5216

【深度学习论文翻译】YOLO9000: 更好, 更快, 更强(YOLO9000: Better, Faster, Stronger)01

目录 前言 一、Abstract(摘要) 二、Introduction(引言) 三、Better(更好) 1、Batch Normalization(批标准化) 2、High Resolution Classifier(高分辨率分类器) 3、Convolutional With Anchor Boxes(具有锚盒的卷积) 4、Dimension Clusters(维度聚类) 5、...

水亦心的博客 2524

YOLO9000: Better, Faster, Stronger

YOLO9000 论文YOLO9000在CVPR2017目标检测领域大放异彩。首先这篇文章没有Related Work给我的第一感觉就是干货满满,这样的好文章当然不容错过。本篇博客,单的介绍了一下YOLO9000到底采用了哪些技术。BetterBatch Normalization在Google的这篇文章Batch Normalization: Accelerating Deep Network

南有乔木NTU的博客 9654

【论文阅读笔记YOLO9000:Better, Faster, Stronger

为了让网络更好地适应高分辨率的输入,YOLOv2 提出了 高分辨率分类器 的概念:在开始进行检测任务的训练之前,先对分类网络进行微调(fine-tuning),使其在更高分辨率的输入(如 448×448)上进行预训练。之间取得更好的平衡。通过对网络结构、边界框预测、训练方法等多方面的改进,YOLOv2 成为了当时最先进的实时目标检测系统之一,在多种标准数据集(如 PASCAL VOC 和 COCO)上的表现超越了许多其他方法,如 Faster R-CNN 和 SSD,同时显著提高了处理速度。

2301_78395772的博客 1659

YOLO9000 Better, Faster, Stronger

yolo9000,最先进的,实时的目标检测系统,可以检测超过9000个类别。yolov2提出了很多新的改进方法,无论是新的还是在原有的yolov1中汲取的。yolov2使用新颖的,多尺度训练方法,它可以在各种尺寸的图片上运行(yolov1固定图片尺寸448*448),从而在速度与准确度之间平衡。

qq_46539177的博客 2579

[论文阅读]YOLO9000BetterFasterStronger

我们引入了YOLOv2和YOLO9000实时检测系统。其中YOLOv2是最先进的,比其他检测系统在各种检测数据集上都更快。此外,它可以在各种图像尺寸下运行,以提供速度和精度之间的平滑权衡。YOLO9000是一个实时检测框架,通过对检测和分类的共同优化,可以检测9000多种目标类别。我们使用WordTree结合各种来源的数据和我们的联合优化技术在ImageNet和COCO上同时训练。YOLO9000是缩小检测和分类之间数据集大小差距的有力一步。我们的许多技术推广到目标检测之外。

qq_41776136的博客 1630

【论文阅读】YOLO9000Better, Faster, Stronger

YOLOv2,YOLO9000

qq_34222839的博客 1221

YOLOv2全文翻译】YOLO9000: Better, Faster, Stronger

目录 Abstract 1. Introduction 2. Better 3. Faster 4. Stronger 5. Conclusion Abstract 我们将介绍一个先进的,实时目标检测的网络YOLO9000,它可以检测超过9000个类别的物体。首先,我们针对YOLO检测网络提出了许多从以前的工作中得出的,新颖的改进。改进后的网络称为YOLOv2,在标准...

My Blogs 2721

【论文#目标检测】YOLO9000: Better, Faster, Stronger

我们介绍了YOLO9000,这是一个最先进的实时目标检测系统,能够检测超过9000个目标类别。首先,我们提出了对YOLO检测方法的各种改进,这些改进既包括创新性的,也包括借鉴以往工作的。改进后的模型YOLOv2在标准检测任务(如PASCAL VOC和COCO)上达到了最先进的水平。通过一种新颖的多尺度训练方法,同一个YOLOv2模型可以在不同尺寸下运行,从而在速度和准确性之间提供了一个便捷的权衡。在67帧/秒(FPS)时,YOLOv2在VOC 2007上达到了76.8%的平均精度均值(mAP)。

weixin_42877471的博客 1199

Better,Faster,Stronger——YOLO 9000

YOLO9000: Better, Faster, Stronger 文章目录YOLO9000: Better, Faster, Stronger介基本原理Betterbatch normalizationhigh resolution classifierconvolutional with anchor boxesdimension clustersdirect location predictionfine-grained features(细粒度特征)multi-scale trainingFas

稚与的博客 859

【论文泛读】 YOLO v2:Better,Faster,Stronger

【论文泛读】 YOLO v2:Better,Faster,Stronger 文章目录【论文泛读】 YOLO v2:Better,Faster,Stronger摘要 Abstract介绍 Introduction预测更准确(Better)batch normalization 批归一化High Resolution ClassifierConvolutional With Anchor BoxesDimension ClustersDirect location predictionFine-Grained

风信子的猫Redamancy的快乐星球 5650

yolo9000Better, Faster, Stronger的目标检测网络

YOLOv2相对v1版本,在继续保持处理速度的基础上,从预测更准确(Better),速度更快(Faster),识别对象更多(Stronger)这三个方面进行了改进。其中识别更多对象也就是扩展到能够检测9000种不同对象,称之为YOLO9000

慕溪同学的博客 1798

YOLOv2:YOLO9000:Better, Faster, Stronger——更好、更快、更强

YOLOv2:YOLO9000: Better, Faster, Stronger——更好、更快、更强

Together_CZ的博客 1158
上一篇: 极简笔记 Path Aggregation Network for Instance Segmentation
下一篇: 极简笔记 Meta-Learning for semi-supervised few-shot classification
Hibercraft
博客等级 码龄9年 78粉丝 38原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值