计算机视觉领域有哪些研究方向

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情

计算机视觉,即 Computer Vision,简称 CV,是指用计算机实现人的视觉功能—对客观世界的三维场景的感知、识别和理解。目前,计算机视觉仍然是深度学习中最热门的研究领域之一,其主要包含以下四个任务:图像分类目标检测语义分割实例分割首先我们将介绍以下四种任务分别有什么特点,以及分别在解决什么问题。

图像分类 - Image Classification:解决的是“是什么”的问题。图像分类的任务便是要找出图中包含着哪些目标,如图(a)所示,图中包含 bottle、cup 和 cube 三种目标。与此任务相关的挑战包括视点变化、尺度变化、类内变化、图像变形、图像遮挡、光照条件、背景杂乱等。

目标检测 - Object Detection:解决的是“是什么+在哪里”的问题。在图像分类中,我们可以知道当前图片中包含了哪些目标物体。进一步地,我们更希望知道这个目标具体在哪个位置,这便是目标检测的任务。如图(b)所示,我们为图中的每一个目标物体都给定一个矩形框标识着当前目标所在的位置。

语义分割 - Semantic Segmentation:解决的是“每个像素点是什么”的问题。语义分割是对目标物体进行一个像素级分割,即对图像中的每一个像素点都进行分类。但是同一物体的不同实例不需要单独分割出来,如图(c)中所示的 cube,都归属于同一个语义类别。

实例分割 - Instance Segmentation:在语义分割的基础上,进一步区分属于同一个类别的不同实例。如图(d)中所示的 cube,我们还需要将其具体的区分为不同的 cube。

目前,计算机视觉仍然是深度学习中最热门的研究领域之一,它主要涵盖了以下应用:

(1)光学字符识别 OCR

OCR 包含了:手写数字识别、中文字符识别、英文字符识别等等。这个任务算是计算机视觉领域中最早落地的方向,早在 1989 年,LeCun 等人在贝尔实验室提出了 LeNet 用于解决邮政编码识别,并成功落地应用。

(2)人脸相关

人脸相关的算法主要有:人脸检测、人脸验证、人脸关键点检测、表情识别等等。其中最常见的任务便是人脸检测以及人脸验证了。其中,检测是验证的前置要求,而人脸验证是将候选人脸与另一个人脸进行比较,并验证其是否匹配的任务。

(3)姿态估计 Pose Estimation

姿态估计方向主要包含:人体姿态估计(2D/3D)、人体姿态预测(视频)、手势姿态估计、头部姿态估计、动物姿态估计等等。其中人体姿态估计为比较热门的研究方向,主要可以用于人体行为判断、AR 试衣、自动驾驶(预测路人行动)等领域。其主要实现的方式是通过检测人体关键点来完成人体的动作、行为识别。


(4)超分辨率 Super Resolution

超分辨率方向主要包含:单帧图像超分辨率、视频超分辨率、点云超分辨率等等。简单地来说,超分辨率的目的是为了提升图像/点云的分辨率。尽管传统图像变换采用的线性插值、最邻近插值等方式可以提高图像的分辨率,但是图像中的信息并没有增加,细节信息也并没有得到恢复,因此只是简单的放大操作。而超分辨率可以通过对训练样本的学习,通过学习不同的模式并将其添加到图像当中从而恢复图像缺失的细节信息。

(5)图像生成 Image Generation

图像生成方向主要包含:风格迁移、图像到图像转换、人脸生成、人体姿态生成、面部修复等等。其主要使用的是生成网络来分离出两者共有的结构分布,和独有风格分布,从而进行进一步的融合以生成目的图像。


(6)自动驾驶 Autonomous Driving

自动驾驶方向包含的视觉任务主要有:车道线检测、交通信号灯检测、全景分割、行人检测等等。当然,完成自动驾驶还需要有诸如定位、导航、控制等算法,我们这里只列举了其中与视觉相关的算法。

(7)即时定位与地图构建

SLAM近年来,由于无法使用 GPS 或 GNSS 的室内制图技术,机器人技术和自动驾驶汽车技术的使用引起了广泛的关注,该技术被称为 SLAM。SLAM 是一种即时定位与地图构建任务,在此过程中,机器人会构建代表其空间环境的地图,同时跟踪其在构建的地图中的位置。


(8)图像去噪 Image Denoising

去噪方向主要包含:去噪、图片去噪。由于数字设备常受到相机抖动、运动的物体、暗光和噪声等影响而导致捕获的照片“不干净”。因此去噪技术具有很大的应用价值。传统去噪方法有:利用非局部相似性、字典学习、MRF、WNNM 等;现代方法主要是基于深度学习技术:栈式稀疏去噪自编码器、多层感知机、卷积编解码网络、深层神经网络等。相对于前者,后者是一种端对端的训练方式,无需手动调整参数,拥有更强的学习能力。

(9)图像去雾 Image Dehazing

图像去雾的目的是消除雾霾环境对图像质量的影响,增加图像的可视度。传统的图像去雾方法主要有暗通道先验(DCP) 方法,最大对比度(MC)方法,颜色衰减先验(CAP)方法,色度不一致方法,其中以何凯明的暗通道先验方法最为著名;现代深度学习图像去雾方法主要分为两种:一种是基于大气退化模型,另一种则是训练一种端到端的图像去雾模型!其中端到端方式已成为深度学习中的主流去雾模型。

(10)图像去雨 Image Deraining

图像去雨是从包含雨水的图像生成去除雨水的图像。早期的去雨方法主要包含稀疏编码和 GMM 方法。现代基于深度学习的去雨方法绝大部分使用:全监督方法,其采用多阶段的方式或 encoder-decoder 的架构,用全卷积学习雨图到无雨图的映射或残差来训练模型。

(11)行人重识别 Person Re-ID

行人重识别研究研究不同于目标识别,它能够实现跨越时间和空间对目标人体(人群)进行跟踪、匹配与身份鉴定,这是近年来计算机视觉的研究热点之一。因此,行人重识别技术需要分析目标的空间依赖关系,还需要分析目标变化的历史信息。行为识别涉及到技术主要包含兴趣点提取,密集轨迹,光流和表观并举,3D 卷积网络,LSTM 和 GCN 等。

(12)缺陷检测 Defect Detection

缺陷检测,在工业上应用非常广泛,如电路板表面缺陷检测、金属零部件表面缺陷检测、布匹检测、固件缺陷检测、混凝土裂缝检测、公路裂缝检测等。传统的基于机器视觉的算法很难对缺陷特征进行完整的识别,而且通常会耗费大量精力,得不偿失。由于卷积神经网络在特征提取业的强大能力以及目标检测算法日趋成熟的背景下,使得业界普遍将度学习技技术应用到陷检测领域当中。

(13)视频理解 Video Understanding

视频理解,主要是基于视频中的时序信息来进行视频分析。相对于图像而言,视频多了一维时序信息,其应用场景相对也比较广泛,比如在智能安防领域中我们可以使用视频理解技术来取代人工进行相应的视频监控。

(14)图像融合 Image Fusion

图像融合是用特定的算法将两幅或多幅图像综合成一幅新的图像。融合后得到的图像可以对场景有更全面、清晰的描述,从而更有利于人眼的识别和机器的自动探测!图像融合技术在遥感探测、安全导航、医学图像分析、反恐检查、环境保护、交通监测、清晰图像重建、灾情检测与预报尤其在计算机视觉等领域都有着重大的应用价值,一般图像融合方法主要包含空间域融合和变换域融合方法;其中空间域融合方法主要包含:简单组合式图像融合方法,逻辑滤波器法,数学形态法和图像代数法。而变换域融合方法主要包含:HIS 变换法,PCA 变换法,高通滤波法 HPF,金字塔分解法和小波变换法。

(15)图像检索 Image Retrieval

图像检索是一种用于从大型数字图像数据库中浏览,搜索和检索图像的一种技术。常规的图像检索有基于文本的检索、基于内容的检索以及基于语义的检索。其中基于语义的检索由于其需要对海量的图片进行语义级别的标注,不仅主观性强而且费时费力,同时其语义也很难全面的表达图像中所包含的所有信息,因此实际中很少实现。而基于内容的检索,也称为 CBIR 技术,常见的应用场景有 “以图搜图”,在实际中被广泛使用。

(16)全景分割 Panoptic Segmentation

图像全景分割是语义分割与实例分割的结合,在全景分割中,图像中每个像素点都必须被分配一个语义标签和实例 ID,其中语义标签指的是物体类别,而实例 ID 则对应同类物体的不同编号。

(17)医学图像 Medical Image

医学图像任务主要包括:病变检测、图像分割、图像配准。类似于自然图像领域,卷积神经网络比传统算法能更有效地作用于医学图像,然而医学图像还存在着以下难点

1.样本数据量少且无法人工生成;

2.噪声大,关键信息占比小;

3.标注成本高。

鉴于这些困难,一些基于深度学习的技术如:迁移学习和微调能有效地解决以上问题。

(18)遥图图像 Remote Sensing Image

遥感图像能够精确的描述各种地理空间物体,如车辆、船舶和飞机等。遥感图像一般都是高空间分辨率,从遥感团行中自动提取感兴趣的对象对城市管理计划和检测非常有帮助。地理空间对象分割作为对象提取中的重要角色,可以为感兴趣的对象提供语义和位置信息,该信息属于特定的语义分割任务,目的是将图像像素分为前景对象和背景区域的两个子集 。同时,它还需要为前景对象区域中的每个像素进一步分配唯一的语义标签。

以上列举的只是CV领域中当前比较热门的研究方向,由于篇幅原因,还有许多具有前景的研究方向我们还没有列出来。

计算机视觉配套资料整理打包好了+人工智能学习路线
希望可以帮助到大家

计算机视觉顶刊《International Journal of Computer Vision》2025年5月前沿热点可视化分析 本文可视化分析了计算机视觉顶刊《International Journal of Computer Vision》2025年5月前沿热点,方便读者参考。 阅读详情

相关推荐

计算机视觉顶会论文趋势分析:从CVPR2023看领域最新研究方向

本文基于CVPR2023近2000篇论文的系统分析,揭示了计算机视觉领域的最新研究趋势,包括基础模型革新、任务边界模糊化和物理世界交互深化。重点关注视觉Transformer的轻量化革命、多模态统一建模以及从数字世界到物理世界的技术迁移,为未来3-5年的研究方向提供了重要参考。

weixin_29093169的博客 375

GAN属于计算机视觉领域嘛_计算机视觉领域有哪些可研究方向

封面图为Leena,该图在数字图像处理学习与研究中颇为知名,常被用作数字图像处理各种实验。计算机视觉任务——————计算机视觉,即Computer Vision,简称 CV,是指用计算机实现人的视觉功能—对客观世界的三维场景的感知、识别和理解。目前,计算机视觉仍然是深度学习中最热门的研究领域之一,其主要包含以下四个任务:图像分类、目标检测、语义分割、实例分割。首先我们将介绍以下四种任务...

weixin_39574708的博客 965

CV:人工智能计算机视觉方向的简介(CV发展史+传统方法对比CNN类算法+CV类会议/期刊、主要研究方向)、计算机视觉四大研究方向以及十大具体应用领域(知识导图+经典案例)之详细攻略

计算机视觉(CV,Computer Vision),是一门研究如何使机器“看”的科学,更进一步的说,就是是指用摄影机和电脑代替人眼对目标进行识别、跟踪和测量等机器视觉,并进一步做图形处理,使电脑处理成为更适合人眼观察或传送给仪器检测的图像。作为一个科学学科,计算机视觉研究相关的理论和技术,试图建立能够从图像或者多维数据中获取‘信息’的人工智能系统。这里所指的信息指Shannon(香农,信息论及数字通信之父)定义的,可以用来帮助做一个“决定”的信息。

头部AI社区如有邀博主AI主题演讲请私信—心比天高,仗剑走天涯,保持热爱,奔赴向梦想!低调,专注,谦虚,自律,反思,成长,还算比较正能量的博主,公益免费传播…内心特别想在AI界做出一些可以推进历史进程影响力的技术(兴趣使然,有点小情怀,也有点使命感呀 1万+

跟着小狼学神经网络 | 各种GAN(生成式对抗网络)入门与实践

(未完待续中) 这个系列的缘由,是我在学习DCGAN时,隐约觉得神经网络及实践并没有想象得那么难………入门比起SLAM领域要好很多。 同时,对于GAN这个话题,有太多的故事可以讲,不同的模型DCGAN、CGAN、ACGAN、WGAN等等,而且有很多不同的应用场景。 这里,本博客将主要涉及用GAN生成假图片的任务。 先留个名。。。。有空的话争取暑假期间完成整理。 所有的博客计划暂时...

Welcome to the Western World 373

GAN--提升GAN训练的技巧汇总

点击上方“小白学视觉”,选择加"星标"或“置顶”重磅干货,第一时间送达前言GAN模型相比较于其他网络一直受困于三个问题的掣肘:1. 不收敛;模型训练不稳定,收敛的慢,甚至不收敛;2. ...

小白学视觉 5603

计算机视觉方向怎么样?应该怎么准备计算机视觉方向保研?

2022年是计算机视觉的蓬勃发展之年,也是迄今以来计算机视觉的巅峰之年,出现了无数新科技(视觉Transformer、Pix2Seq)、新产品(Imagen、DALL-E2)、新模型(YOLOv7)。人工智能(尤其是算法)的实现需要强大的计算能力的支撑,特别是深度学习算法的大规模使用,对计算能力提出了更高的要求。作为一个新兴的研究方向,为它专门开设一门专业的院校其实并不是特别多,更多情况下是纳入计算机应用技术专业招生,或者从事该方向的老师发布具有针对性的招生要求。即使以后想改换专业,也能有更多的退路。

Baoyan_cs的博客 2170

计算机视觉下哪个小方向目前更有发展前途?

点击上方“小白学视觉”,选择加"星标"或“置顶”重磅干货,第一时间送达编者荐语知乎问题:计算机视觉(cv)下哪个小方向目前更有发展前途?计算机视觉方向越来越饱和,选个“好”方向可能越来越重要了。转载自丨知乎整理丨计算机视觉CV链接丨https://www.zhihu.com/question/496500060回答1目前想到的有如下方向,排名不分先后,欢迎大家讨论。自监督:以MAE,BEiT为代...

小白学视觉 1171

计算机视觉领域研究方向最全详细指南

计算机视觉作为一门将人类的视觉能力赋予机器的学科,其研究领域和应用场景都非常广泛。随着技术的不断发展,计算机视觉的应用前景将会更加广阔。为了更好地推进计算机视觉技术的发展和应用,需要不断探索新的研究方向和技术手段,同时结合实际应用场景进行深入研究和应用实践。

DFCED的博客 3991

2020年,计算机视觉领域会有哪些新的研究方向值得提前探索?

点击上方“视学算法”,选择“星标”干货第一时间送达整理:3D视觉工坊 | 来源:知乎https://www.zhihu.com/question/330153893/answer/129...

zandaoguang的博客 1676

计算机视觉领域里重要的研究方向

整理文章:https://www.cnblogs.com/YSPXIZHEN/p/11232932.html 图像分类:对图像的内容对图像进行标记 详细:通常会有一组固定的标签,通过模型预测出最适合图像的标签。 图像说明:计算机视觉+自然语言处理,为图像生成一个最适合图像的标题,图像检测+说明 目标识别/检测:对边界框围绕目标检测体 图像/实例分割:将图像划分成互不相交的区域 普通分割:狗,猫,...

lee__7的博客 996

计算机视觉的主要研究领域和细分方向(超全超赞)

非常完整的机器视觉研究方向总结,按技术原理、按应用场景进行划分。 转自:http://studyai.com/article/70f86341 PS: 若MarkDown不支持 TOC 和 TOCM 标题预览,可访问上述地址,分类结构更加清晰。 [TOCM] [TOC] 图像与视频 图像处理 图像分类 单标签分类、多标签分类、细粒度分类 目标检测与分割 检测定位、语义分割、实例分割、全景分割 ...

海尔兄弟的博客 2万+

图像处理是计算机视觉领域的重要研究方向

在图像处理中,一项常见的任务是对图像进行变换,从而改变其形状、大小或者透视效果。本文将介绍OpenCV中的三种常见的图像变换技术:仿射变换、透视变换和对数极坐标变换,并提供相应的源代码示例。通过以上的示例代码,我们介绍了OpenCV中的三种常见图像变换技术:仿射变换、透视变换和对数极坐标变换。函数的第一个参数是输入图像,第二个参数是变换中心点的坐标,第三个参数是极径的缩放因子,第四个参数是填充方式。透视变换是一种非线性变换,它可以改变图像的透视效果,使得远离观察者的物体在图像中呈现出缩小的效果。

HnrzLinux的博客 297

别再为创新点发愁!计算机视觉领域5个冷门但高效的研究方向

本文揭示了计算机视觉领域五个冷门但高效的研究方向,帮助研究者突破创新瓶颈。从少样本医学图像分割到工业缺陷检测,再到农业跨季节识别、微观视频分析和边缘设备优化,这些方向不仅论文引用增长快,还为独立研究者提供了独特机会。特别关注计算机视觉领域知识的深度结合,为CVPR、ICCV等顶级会议论文提供创新思路。

weixin_29069131的博客 120

计算机视觉领域近三年研究方向汇总

最近需要调研CV领域的一些研究方向,所以爬取了近三年CVPR(2018、2019、2020)、ECCV2018、ICCV2019的文章和链接,根据标题生成对应词云,统计不同单词的出现频次生成折线图,所有爬取的文章标题列表和下载链接:戳这里 CVPR2018 CVPR2019 CVPR202 ECCV2018 ICCV2019 ...

Soheyi的博客 1909

计算机视觉领域研究方向,2020年,计算机视觉领域会哪些新的研究方向值得提前探索?...

前言结合计算机视觉、机器人领域5大顶会(CVPR/ICCV/IROS/ICRA/ECCV),以及产业界的需求,总结3个当下热门及前沿的研究领域。三维视觉三维视觉是传统的研究领域,但最近 5 年内得到快速发展。三维视觉主要研究内容有:三维感知(点云获取及处理)、位姿估计(视觉SLAM)、三维重建(大规模场景的三维重建、动态三维重建)、三维理解(三维物体的识别、检测及分割等)。视频理解随着新型网络媒体...

weixin_30767863的博客 1204

终极指南:如何利用Awesome Computer Vision Paper List快速掌握计算机视觉前沿研究

探索计算机视觉的奇妙世界,Awesome Computer Vision Paper List是您不可错过的宝贵资源。这个精心整理的计算机视觉论文列表汇集了顶级会议的最新研究成果,为研究人员、学生和从业者提供了便捷的搜索工具,让您轻松追踪技术发展趋势。 ## 🔍 为什么选择这个计算机视觉论文列表? **Awesome Computer Vision Paper List** 是一个专门收集计

gitblog_00049的博客 419

计算机视觉中video understanding领域有什么研究方向和比较重要的成果

转自:https://www.zhihu.com/question/64021205 ideo understand,是属于visual analysis的第三个层次,比较high-level的研究方向。 1)最基础的video classification,从相应数据集来看,比如sport1m,hmdb51,activity-net等,大都属于运动/行为类型的类别,所以,

haima1998的专栏 4778

计算机视觉领域热门研究方向state-of-art算法实时更新

细粒度识别 目标检测 Bottom-up Object Detection by Grouping Extreme and Center Points;论文链接;代码链接 目标跟踪 语义分割 人体解析 Devil in the Details: Towards Accurate Single and Multiple Human Parsing;论文链接;代码链接 密集场景人脸识别 Selecti...

WZZ18191171661的博客 2607
上一篇: 看了上百篇YOLO的论文,发现这些才是它发文的捷径!
下一篇: 计算机视觉最不卷的方向:三维重建学习路线梳理
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值