计算机视觉最不卷的方向:三维重建学习路线梳理

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情

提到计算机视觉(CV),大多数人脑海中会立马浮现出一个字:“卷”。卷到什么程度呢?2022年秋招CV工程师岗位数下降了16%,但求职人数增加了23%,求职人数与招聘岗位的比例达到了恐怖的15:1,大部分CV领域的求职者都转向了开发或者产品运营岗位。

为什么这么卷呢?因为2D视觉的算法大部分都开源了,并且深度学习的理论没有门槛,经典的YOLO等物体检测算法基本人人都了解,差异化不大。但是,与2D视觉形成明显对比的是,3D视觉领域依然处于供需平衡的状态,尤其是三维重建方向,更是供不应求。当下三维重建快速发展,在自动驾驶高精地图、AR、娱乐等产业落地广泛。但三维重建方向融合了计算机视觉、计算机图形学、图像处理等多门学科的知识,是一套非常复杂的工程系统,涉及知识点甚多,入门门槛较高,并且国内并没有完整的书籍、教程作为学习资料,使得大部分同学入门即放弃

动图封面

图1 三维重建效果图

经典三维重建系统的整个pipeline从相机标定、基础矩阵与本质矩阵估计、特征匹配到运动恢复结构(SFM),从SFM到稠密点云重建、表面重建、纹理贴图。熟悉SFM的工程师已经是行业内的佼佼者,能掌握稠密点云重建与表面重建的工程师更是凤毛麟角。

图2 经典三维重建系统pipeline

三维重建是当下计算机视觉的一个研究热点,虽然从业者们会给新人提供很多意见和建议,但三维重建的学习路线还是会因人而异,这要取决于个人的背景知识、兴趣和职业目标。对于初学者,三维重建基础的学习路线大概包括以下几个方面:

  • 数学基础知识:线性代数、微积分、优化理论等是三维重建的基础知识,建议入门者先花时间学好这些数学基础知识。
  • 计算机图形学:三维重建需要理解计算机图形学中的基本概念和技术,例如多边形网格、曲面拟合和光照模型等。
  • 多视图几何:学习多视图几何是三维重建的核心。了解基础的三维几何知识以及相机模型、基本矩阵、本质矩阵和三维重建中的三角化等概念。
  • 点云处理和重建:点云是三维重建中最基本的表示形式之一,需要学习点云的采集、去噪、配准和重建等技术。
  • 深度学习:近年来,深度学习技术在三维重建中的应用越来越广泛。学习深度学习的基本原理和常用模型,如CNN、PointNet和GAN等,可以让你在三维重建领域有更好的表现。

最后,基于图像的三维模型重建是非常偏重工程实践的研究任务,它涉及到多个学科,知识分散不系统,因此会给初学者带来极大挑战。大家可以尝试在现有的三维重建数据集上进行实验和调试,或自己创建一些数据集,以便更好地理解和应用三维重建技术。

现也将深蓝学院开设的『基于图像的三维重建』在线课程的推荐资料分享给大家,希望有所帮助。资料主要包括:

针对初学者

书籍I Multiple View Geometry in Computer Vision (Second Edition)

书籍II Computer Vision Algorithms and Applications

针对具备一定基础的同学

三维重建的每个基础模块挑选了1-2篇代表性文献,强烈建议阅读以下相关的原著文献, 这些文献是经过时间检验非常经典的文献,这将大大提升你们的科研和工程能力。 这些文章包括:

运动恢复结构SFM

Hierarchical SFM

  • 《Structure-and-Motion Pipeline on a Hierarchical Cluster Tree》

这篇论文提出了一种基于分层聚类树的结构和运动恢复方法,用于从多张图像中估计场景中的点和相机的3D位置和姿态。

在这个方法中,首先使用特征点检测和匹配算法来确定相邻图像之间的点对,然后使用这些点对来计算相机之间的运动和点的3D位置。然后,通过对点进行聚类并构建分层聚类树来对场景进行建模,从而可以更准确地估计点的3D位置和姿态。

这篇论文的主要贡献在于将分层聚类树引入到三维重建中,提出了一种新的方法来估计点的3D位置和姿态。该方法具有较高的精度和鲁棒性,适用于从大量图像中重建复杂的三维场景。该论文的方法和思想在三维重建领域中得到广泛应用,成为了多视图几何和三维重建的基础方法之一。

Incremental SFM

  • 《Photo Tourism:Exploring Photo Collections in 3D》

这篇论文介绍了一种基于计算机视觉和计算机图形学技术的方法,利用从互联网上获取的大量图片,生成高质量的三维重建模型,从而实现对不同场景的浏览和探索。

具体来说,该方法通过将大量的图片投影到三维场景中,自动识别图片之间的相同特征点,并利用这些特征点计算相机位置和姿态,进而估计每张图片的三维位置。通过将所有图片的三维位置进行优化和整合,最终生成一个高质量的三维重建模型。

这篇论文对三维重建领域产生了深远的影响。它提出的方法不仅能够生成高质量的三维重建模型,而且可以在大规模的图片集上运行,并且不需要人工干预。这使得人们可以利用互联网上的大量图片,快速地生成三维场景,并在其中进行虚拟探索和导航。此外,该方法还启发了许多后续的研究,如结合深度学习的三维重建方法、多视角图像合成等,推动了三维重建领域的发展。

  • 《Towards Linear-time Incremental Structure from Motion》

这篇论文提出了一种新的算法来加速三维重建的过程。该算法称为“Linear-time Incremental Structure from Motion”(简称LIMO)。

在传统的三维重建算法中,通常需要先对所有图像进行特征提取、匹配、三角化等操作,然后再进行优化,以得到最终的三维重建结果。这个过程往往十分耗时,尤其是当图像数量较大时,计算量会呈指数级增长。

LIMO算法通过将这个过程分解成多个步骤,并通过一些技巧来减少计算量,从而实现了线性时间的增量三维重建。具体来说,它采用了基于几何约束的两步法来处理每个新的图像,从而避免了对所有图像进行处理的开销,并且可以在新的图像到来时,快速更新整个三维重建结果。

该论文的算法在性能上优于许多传统的三维重建算法,能够在更短的时间内处理更多的图像,并且能够处理非常大的数据集。因此,它对于三维重建领域的研究和实际应用都有着重要的影响。

稠密重建

  • 《Accurate Multiple View 3D Reconstruction Using Pathch-Based Stereo for Large-Scale Scenes》

这篇论文主要介绍了一种用于大规模场景的准确多视角三维重建方法。该方法基于基于图像的渐进三角测量(Incremental Triangulation),使用基于路径的立体匹配(Patch-Based Stereo)来提高几何约束的准确性。与传统方法相比,该方法能够减少估计误差,并在具有大量图像的情况下提高效率。

该论文的主要贡献在于提出了一种有效的多视角三维重建方法,可以处理大规模的场景,并能够更准确地恢复物体的几何形状。该方法还具有高效的计算能力,因此可以应用于实际的应用中,例如建筑物重建、虚拟现实、医学影像学等。许多后续的研究工作基于该论文提出的方法进行了改进和拓展,使得多视角三维重建的准确性和效率得到了进一步的提高。

  • 《Accurate, Dense, and Robust Multiview Stereopsis》

该论文提出了一种多视角的立体视觉算法,用于从多个图像中恢复场景的三维结构。该算法首先通过特征点匹配建立多个视角之间的对应关系,然后使用基础矩阵估计技术来计算每个视角之间的相对姿态。接着,通过三角测量技术将多个视角的二维图像坐标转化为三维点云,最终通过密集匹配算法得到稠密的深度图。

该算法相对于以往的三维重建算法具有更高的精度、更高的密度和更强的鲁棒性,因此被广泛应用于计算机视觉、机器人、虚拟现实等领域,并成为了当前三维重建领域的基础算法之一。

这篇论文对于三维重建领域的发展产生了深远的影响,推动了三维重建算法从传统的基于单个图像的方法向基于多个图像的方法发展,并开创了多视角立体视觉的新时代。同时,该算法的核心思想也被广泛应用于其他领域,如图像匹配、视觉SLAM等。

  • 《Multi-View Stereo for Community Photo Collections》

这篇论文的主要内容是提出了一种基于社区照片集合的多视角立体重建方法。该方法可以从一个大规模的非结构化图像集合中,自动地恢复三维场景的形状和外观,同时还能够重建出高质量的纹理和表面细节。该方法基于多视角几何的原理,通过匹配多个视角的图像来估计场景的深度和表面法向量,最终生成高质量的三维模型。

这篇论文对三维重建领域的影响非常大,它的方法为处理大规模非结构化图像集合提供了一种全新的思路,也为三维重建的自动化和高效性提供了重要的基础。该方法在实践中已被广泛应用于各种领域,例如建筑、文化遗产保护、虚拟现实等等。此外,该论文还为三维重建领域的后续研究提供了重要的参考和启示。

表面重建

  • 《High Accuracy and Visibility-Consistent Dense Multiview Stereo》

这篇论文是一篇关于多视角立体视觉的论文,旨在提出一种高精度和可见性一致性的密集多视角立体视觉方法。具体来说,它提出了一种新的深度图优化方法,该方法考虑了三个方面的约束:像素亮度一致性、相邻像素深度一致性和视图可见性一致性。该方法可以在充分利用多视角信息的同时,克服传统立体视觉方法中由于光照、纹理等因素引起的错误匹配问题。

这篇论文对三维重建领域的影响非常大,因为它提出了一种新的方法来解决立体视觉中的问题,该方法可以提高三维重建的精度和可靠性。它的创新之处在于它考虑了多个约束条件,这些约束条件可以帮助减少错误匹配和噪声,从而提高重建的准确性。此外,该方法还可以处理复杂的场景,包括多个不同角度的光照和纹理,从而使其在实际应用中更加具有实用性。因此,这篇论文被广泛引用和应用于计算机视觉和机器人领域,为三维重建和虚拟现实等领域的研究和应用提供了重要的参考。

  • 《Poisson Surface Reconstruction》

该论文介绍了一种基于点云数据的三维重建算法,可以将离散的、不规则的点云数据转换为光滑的三维曲面模型。

具体而言,该算法使用泊松方程来重建曲面模型。它首先将点云数据转换为密集的体网格表示形式,然后通过求解泊松方程来计算一个标量场,并在此基础上计算法向量和曲率。最后,通过等值面提取技术来生成三维曲面模型。

该算法有许多优点,包括能够处理大规模点云数据、具有高质量的输出结果、能够保持细节信息和形状特征等。因此,它已被广泛应用于三维重建、计算机图形学、计算机视觉和机器人等领域。

这篇论文在三维重建领域产生了很大的影响,并被认为是三维重建领域的经典论文之一。许多后续的研究工作都建立在这篇论文的基础上,包括改进算法的速度和精度、扩展到多种类型的输入数据、应用于更广泛的应用场景等。

纹理贴图

  • 《Let There Be Color! - Large-Scale Texturing of 3D Reconstructions》

是一篇关于三维重建和纹理映射的论文。该论文提出了一种新的方法,能够在大规模三维重建中对模型进行自动纹理贴图,从而提高重建模型的视觉效果。

该论文的主要贡献在于:将传统的纹理映射方法与现代计算机视觉技术相结合,通过对大规模重建数据集的分析和学习,自动地将高质量的纹理贴图应用到三维模型中。

具体而言,该方法使用了大规模图像检索技术来寻找与三维模型相匹配的图像,并利用这些图像来进行纹理映射。该方法还能够自动检测和修复纹理贴图中的缺陷,从而获得更加真实的纹理映射结果。

该论文的方法已经在许多实际的应用中得到了验证,例如在建筑重建、文物保护和虚拟现实等领域中。该方法不仅能够提高重建模型的视觉效果,还能够为更高级别的三维分析和应用奠定基础。

总之,这篇论文对三维重建领域产生了积极的影响,为三维重建的高效纹理映射提供了新的思路和方法。

相关网站

我们也提供一些相关的网站,这些网站是一些比较著名的开源系统。

计算机视觉三维重建配套资料整理好了+人工智能学习路线图指南

计算机视觉三维重建(4)---三维重建基础与极几何 那么我们可以根据这两个式子,对于同一个点以及两个像平面点之间的对应关系,写出四个齐次方程,但是未知数只有三个,所以是一个超定齐次线性方程组,可以用齐次方程的小二乘解来进行计算。2. 基础矩阵作用:基础矩阵中包含了摄像机内参数信息,所以给了基础矩阵,我们无需知道两个摄像机的内外参数就可以建立相同场景在同视图的对应关系。通过极几何的约束,可以将搜索范围缩小到对应的极线上,而并没有做到对应点,所以存在一个方向上的误差问题。基础矩阵:对一般的透视摄像机拍摄的两个视点的图像间的极几何关系进行代数描述。 阅读详情

相关推荐

初探三维计算机视觉三维重建) —— 相机模型 + 双目系统 + 点云模型

咱就是说注终于到三维计算机视觉部分了,本篇内容主要先浅谈一下三维计算机视觉的基本概念和应用,在后续我们会好好学学三维重建hiahiahia~

小菜鸡的小博客 9497

基于深度学习三维重建算法——详解与实现

随着深度学习技术的迅猛发展,基于深度学习三维重建算法在近几年取得了显著的进展。而基于深度学习三维重建算法通过利用深度神经网络,能够从大规模数据中学习到更准确、鲁棒的三维结构表示。本文综述了基于深度学习三维重建算法,并给出了相应的源代码。随着深度学习技术的断发展,我们相信基于深度学习三维重建算法将会在未来得到更广泛的应用。实验结果表明,基于深度学习三维重建算法在准确性和鲁棒性方面取得了显著的提升。以上是关于基于深度学习三维重建算法的详细介绍与实现,希望对您有所帮助。

CyberGenius的博客 1202

计算机视觉入门避坑指南:北邮鲁鹏课程重点提炼(含B站/GitHub资源链接)

本文基于北邮鲁鹏老师的计算机视觉课程,提炼出一份高效的入门避坑指南。文章系统梳理了课程核心知识图谱与学习路径,提供了B站与GitHub资源链接,并针对环境配置、代码运行等常见难题给出实用解决方案,旨在帮助初学者建立系统性认知,跨越语义鸿沟,顺利开启CV学习之旅。

sat99的博客 644

计算机视觉学习路线研究

此外,推荐优质的学习资源,如经典教材、在线课程、实践项目等,能够为学习者提供丰富多样的学习选择,满足同层次和需求的学习者。例如,在CVPR会议上,每年都有大量关于深度学习目标检测、图像分割、视频分析等热点话题的论文发表,这些论文仅展示了新的技术成果,更提供了深入的思考与讨论,对于学习者来说具有极高的参考价值。例如,Udacity平台上的“计算机视觉纳米学位”课程,这门课程涵盖了从基础图像处理到深度学习计算机视觉中的应用等一系列内容,通过项目式的学习方式,让学习者在实践中掌握知识和技能。

阿尔法星球的专栏 1855

三维重建整体框架与学习路线笔记】

输入图像和位姿(SFM/Slam)——>稠密重建——>点云融合——>初始网格重建——>网格优化——>输出纹理贴图。所有的颜色信息存储在一张纹理图上,显示时根据每个网格的纹理坐标和对应的纹理图进行渲染得到高分辨率的彩色模型。多视图立体几何,深度图估计,点云处理,网格重建和优化,纹理贴图,马尔科夫随机场,图割等。视差图:同一个场景在两个相机下成像的像素的位置偏差dis。包含了丰富的信息,包括三维坐标XYZ,颜色RGB等信息。由物体的邻接点云构成的多边形组成的。图文均来自计算机视觉life。

qq_45028907的博客 660

基于深度学习三维重建(一):三维重建简介、patchmatchNet环境部署、用colmap如何测试自己的数据集

三维重建简介、patchmatchNet环境部署、用colmap如何测试自己的数据集

qq_41694024的博客 1万+

2023年计算机视觉方向三维重建学习路线梳理!如何入门一览便知

近几年来,人工智能领域出现过很多热门的话题,有些热度持续很长时间,有些如同昙花一现,而随着机器人、自动驾驶、AR等技术的飞速发展,这些领域涌现了大量独角兽公司,开发出大量以3D感知、融合定位、重建、测距等多个应用场景的产品。三维重建这个名词也再次变得火热起来。简单来说,三维重建(3D Reconstruction)是指用相机等传感器拍摄真实世界的物体、场景,并通过计算机视觉技术进行处理,从而得到物...

CV_Autobot的博客 1236

计算机视觉学习路线:从入门到精通

计算机视觉人工智能领域的重要分支,广泛应用于图像识别、视频分析和自动驾驶等领域。本文详细梳理计算机视觉学习路线,从基础知识到前沿技术,帮助学习者逐步精通。首先,掌握数学(线性代数、概率论、微积分、几何学)和编程(Python、NumPy、Matplotlib、OpenCV)是基础。其次,理解图像处理(滤波、边缘检测)和特征提取(SIFT、HOG、深度学习)等核心概念。接着,学习深度学习框架(TensorFlow、PyTorch)以搭建视觉模型。然后,探索高级应用如目标检测(R-CNN、Faster R

2501_91624122的博客 2473

学习路线分享」SLAM/深度估计/三维重建/相机标定/传感器融合(目录)

目录 1. 单双目深度估计 2. ORB-SLAM2源码解析 3. VIO灭霸——ORB-SLAM3源码解析 4. VIO经典系列之VINS: Mono + Fusion手推公式 + 源码解析 5. 激光SLAM之 Cartographer源码解析 6. 基于LiDAR的多传感器融合 7. 视觉几何之三维重建:入门到精通 8. 三维重建深度学习方法 9. 相机标定学习路线 转载:「学习路线」SLAM/深度估计/三维重建/标定/传感器融合...(本文较长,建议收藏) 目前市面上...

惊鸿一博 1069

计算机视觉入门终极指南:从零开始掌握AI视觉技术

想要快速入门计算机视觉知从何开始?Awesome Computer Vision为你提供了全面的学习路线图!这个精心策划的资源库汇集了计算机视觉领域的所有精华内容,从基础理论到前沿应用,帮助你系统性地掌握这一革命性技术。 ## 为什么选择计算机视觉?🤔 计算机视觉正在改变我们的世界——从自动驾驶汽车识别道路标志,到医疗影像诊断疾病,再到智能手机的人脸解锁功能。这项技术让机器能够"看懂"

gitblog_01108的博客 717

工程化三维重建项目的编程与实现相关的技术与软件

本文系统介绍了工程化三维重建项目所需的技术栈,涵盖数据采集、稀疏/稠密重建、点云处理、表面重建、纹理映射等全流程。重点推荐Python+Open3D+COLMAP+OpenMVS核心工具链,并提供了专业级重建工具(如MeshCoder、LVR2)和开发环境配置建议。文章还针对教学大纲三节课设计了学习路径,并给出简历技术关键词的撰写示例,为三维重建项目开发提供全面技术参考。

小宝哥Code的专栏 989

收藏!程序员入局大模型必看:6大黄金职业方向全解析

再好的大模型,能落地到生产环境产生价值就是“空中楼阁”。大模型部署工程师的核心职责,就是打通大模型从实验室到生产环境的“后一公里”——搭建基础设施、适配硬件平台、优化运行效率,确保模型在CPU/GPU集群、云端/边缘设备等同环境下高效、稳定运行。随着企业大模型应用需求的爆发,部署工程师的需求也水涨船高。这类岗位更侧重工程实践,对算法理论要求相对较低,适合有运维、云计算、分布式系统经验的程序员转型,入门门槛低于算法工程师,且薪资竞争力强(年薪普遍25-60万),是技术落地导向程序员的优质选择。

EnjoyEDU的博客 1139

受欢迎的CV、NLP、深度学习方向的公众号!

现在人工智能方向越来越了,系统化学学习能够让你高效的利用时间,提供效率!给大家推荐几个知名大佬的公众号,包括CV、NLP、多模态、深度学习、图网络、PyTorch等众多方向技术干货分享和论文解读!希望能够大家的学习提供更多的帮助!CVHubCVHub是一家专注于计算机视觉领域的高质量知识分享平台,全站技术文章原创率达99%,每日为您呈献全方位、多领域、有深度的前沿AI论文解决及配套的行业级应用解...

weixin_40920183的博客 2104

计算机视觉101:从积滤波到CNN积神经网络的完整教程(Robotics and Perception 视觉篇)

计算机视觉(Computer Vision)是让机器"看懂"世界的核心技术,而**积**(Convolution)正是整个计算机视觉领域重要的基石——从基础的图像滤波,到如今大放异彩的**CNN积神经网络**,都离开这个看似简单的数学运算。本文基于开源项目 *Robotics and Perception*(由 Frank Dellaert 与 Seth Hutchinson 合著的机器

gitblog_00840的博客 303

计算机视觉入门书单与学习路径全解析

计算机视觉作为人工智能的重要分支,通过算法让机器理解和处理图像信息。其核心技术包括图像处理、特征提取和模式识别等,在自动驾驶、医疗影像等领域有广泛应用。对于初学者而言,掌握OpenCV等工具库和积神经网络(CNN)原理是入门关键。本文推荐的书单从传统算法到深度学习系统覆盖,特别强调通过《Computer Vision: Algorithms and Applications》建立理论框架,配合《Learning OpenCV 4》进行实践。针对工业场景中的目标检测等需求,还介绍了实用的图像预处理技巧和模型

weixin_30245867的博客 392

英伟达新方法入选CVPR 2023:对未知物体的6D姿态追踪和三维重建

Bowen 投稿自 凹非寺量子位 | 公众号 QbitAI普通手机“随手”拍的雕像,一下就变成了精细的三维重建图。水杯来回动的动态场景下,细节清晰可见:静态场景效果也同样nice,狗狗突出的肋骨都被还原了出来:对比来看其他方法,效果是酱婶的……这就是英伟达新提出的方法BundleSDF。这是一种可对未知物体的6D姿态追踪和三维重建的方法。用于从单目RGBD视频序列中跟踪未知物体的6自由度运动,同...

3D视觉工坊 820

计算机视觉方向简介 | 驾驶员监控DMS

作者丨黄浴(奇点汽车美研中心首席科学家兼总裁)来源丨https://zhuanlan.zhihu.com/p/68127887编辑丨新机器视觉驾驶员监控系统(driver monitoring system,DMS)一般是对L2-L3级别的自动驾驶系统而言的,对L4级别是没有意义的,除非系统仍然是需要安全员的测试环节。监控的目的是发现驾驶员走神(distraction)、...

3D视觉工坊 1433

计算机视觉入门:5本免费经典书籍推荐

计算机视觉作为人工智能的重要分支,通过算法让机器获得视觉理解能力。其核心技术包括图像处理、特征提取和深度学习等,广泛应用于自动驾驶、医疗影像和工业检测等领域。对于初学者而言,选择合适的学习资源尤为关键。本文推荐的5本免费经典书籍覆盖从传统算法到深度学习的完整知识体系,特别适合学生、开发者和转行人员。《Computer Vision: Algorithms and Applications》系统讲解基础理论,《Programming Computer Vision with Python》提供实践指南,而《D

weixin_31591833的博客 505

收藏这篇就够了!程序员转型大模型的6大方向与技能提升指南

程序员转行进入大模型领域,无论是投身自然语言处理、计算机视觉,还是专注于大模型算法研究、部署工作,亦或是转型为产品经理,都有着广阔的发展前景和良好的职业机遇。然而,每个方向都对技能有着明确且严格的要求,程序员需要根据自身兴趣和优势,有针对性地学习和提升技能,才能在大模型领域顺利实现职业转型,开启新的职业篇章。

大模型研究中心 615
上一篇: 计算机视觉领域有哪些研究方向
下一篇: 整理了6个Python经典项目(python爬虫、python人工智能、python数据分析、python web
评论 2
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值