1. 机器视觉中的3D重建技术概述
3D重建技术正在彻底改变机器感知世界的方式。与传统的2D图像识别不同,3D重建让机器不仅能"看到"物体,还能精确理解物体的空间结构和位置关系。这项技术的核心在于通过各种传感器和算法,将2D图像信息转化为3D空间数据。
1.1 3D重建的基本原理
3D重建的本质是一个逆向投影过程。当3D物体通过相机镜头成像时,会丢失深度信息(Z轴数据)。3D重建算法就是要从这些2D图像中恢复出完整的3D坐标(X,Y,Z)。这个过程主要依赖以下几个关键概念:
- 点云(Point Cloud) :重建的第一步通常是生成大量带有空间坐标的采样点
- 三角测量(Triangulation) :利用几何关系确定点在空间中的位置
- 深度图(Depth Map) :每个像素点代表与相机的距离
1.2 3D重建的技术分类
根据工作原理的不同,3D重建技术可以分为两大类:
-
被动视觉(Passive Vision) :仅依赖环境光成像
- 单目重建(Structure from Motion)
- 双目/多目立体视觉
- 神经辐射场(NeRF)
- 3D高斯泼溅(3DGS)
-
主动视觉(Active Vision) :自带光源辅助测量
- 结构光技术
- 飞行时间法(ToF)
2. 被动视觉重建技术详解
2.1 单目重建(SfM)
单目重建,也称为运动恢复结构(Structure from Motion),是通过单台相机在不同位置拍摄的多张照片来计算相机位姿变化并重建场景的技术。
2.1.1 SfM的核心流程
一个标准的SfM系统包含以下关键步骤:
- 特征提取与匹配 :使用SIFT或ORB算法识别图像中的特征点并建立对应关系
- 计算几何关系 :利用对极几何理论计算相机间的变换关系
- 三角测量 :通过两条射线的交点确定特征点的3D坐标
- 增量式重建 :逐步添加新图像扩展重建区域
- 光束法平差(BA) :全局优化相机位姿和3D点坐标
2.1.2 SfM的局限性
单目SfM最大的问题是 尺度不确定性 。由于缺乏绝对距离参考,重建结果只能保持相对比例,无法确定实际物理尺寸。例如,算法无法区分一个10厘米的水杯和一个10米的巨型水杯模型。
2.2 双目/多目立体视觉
双目立体视觉模拟人类双眼的工作原理,通过计算左右图像中同一物体的视差来获取深度信息。
2.2.1 双目视觉的核心原理
双目视觉的深度计算基于简单的三角测量公式:
Z = (f × B)/d
其中:
- Z:深度值
- f:相机焦距
- B:基线距离(两相机间距)
- d:视差(同一特征点在左右图像中的水平位移)
2.2.2 双目视觉的完整流程
- 相机标定 :确定相机内参和外参
- 立体校正 :将图像对齐到同一平面
- 立体匹配 :寻找左右图像中的对应点
- 视差转深度 :利用公式计算实际距离
2.2.3 双目视觉的优缺点
优点 :
- 可直接获得真实物理尺度
- 适合实时应用
- 硬件成本相对较低
缺点 :
- 依赖环境纹理
- 测量距离受基线限制
- 存在遮挡问题
2.3 神经辐射场(NeRF)
神经辐射场(NeRF)是近年来革命性的3D重建技术,它使用神经网络隐式表示3D场景。
2.3.1 NeRF的核心原理
NeRF将场景表示为一个连续的5D函数:
- 输入:空间位置(X,Y,Z)和观察方向(θ,φ)
- 输出:颜色(RGB)和体积密度(σ)
2.3.2 NeRF的工作流程
- 准备多视角图像和相机位姿
- 沿相机光线采样3D点
- 通过MLP网络预测各点的颜色和密度
- 使用体渲染合成最终图像
- 通过反向传播优化网络参数
2.3.3 NeRF的优势与局限
优势 :
- 照片级真实感
- 无限分辨率
- 出色的视角插值能力
局限 :
- 训练和渲染速度慢
- 只能处理静态场景
- 依赖精确的相机位姿
2.4 3D高斯泼溅(3DGS)
3D高斯泼溅是2023年提出的新技术,通过大量3D高斯椭球体表示场景,实现了比NeRF更快的渲染速度。
2.4.1 3DGS的核心特点
每个3D高斯椭球体包含以下参数:
- 中心位置(X,Y,Z)
- 协方差矩阵(决定形状和方向)
- 不透明度(α)
- 球谐函数颜色(SH)
2.4.2 3DGS的工作流程
- 从SfM点云初始化3D高斯
- 可微分投影和光栅化渲染
- 自适应密度控制(克隆、分裂、修剪)
- 通过梯度下降优化参数
2.4.3 3DGS的优势
- 实时渲染(100+ FPS)
- 训练速度快(5-10分钟)
- 显式表示,可编辑性


1万+

被折叠的 条评论
为什么被折叠?



