【CVPR25】LogoSP: Local-global Grouping of Superpoints for Unsupervised Semantic Segmentation of 3D

1.1 LogoSP: Local-global Grouping of Superpoints for Unsupervised Semantic Segmentation of 3D Point Clouds(CVPR 2025 | 港理工
论文链接:https://www.arxiv.org/abs/2506.07857
代码链接:https://github.com/vLARgroup/LogoSP

一图概括任务
无监督3D语义分割

[图片]

1.1.1 Motivation
最近的 Gaussian Splatting 实现了 3D 场景的高质量和实时新颖视图合成。然而,它仅仅集中于外观和几何建模,而缺乏细粒度的对象级场景理解。
新兴方法的局限:尽管一些新方法尝试利用大型2D视觉或语言模型(如CLIP, SAM)来减轻标注负担,但它们仍然需要繁琐的人工标注或跨模态对齐工作。
对现有方法的批判性分析

  • 现有方法的共性缺陷:大部分现有方法都遵循一个相似的范式,即“学习逐点的局部特征 + 简单的分组策略”,这种模式缺乏发现局部特征之外的、更丰富的全局语义信息的能力。
  • 对 GrowSP 的批判:
    • 性能不理想: 尽管GrowSP是该领域的开创性工作,但其分割性能仍不尽人意。
    • 原因一:初始特征不佳。GrowSP的骨干网络是随机初始化的,没有利用任何语义先验知识,导致其初始生成的点特征或超点特征区分度不足。
    • 原因二:分组策略过于简单。GrowSP后续合并超点的方法过于简单,这导致生成的伪标签质量不高,反过来限制了网络的学习效果。
  • 对 PointDC 的批判:
    • 伪标签质量问题: PointDC虽然聪明地从强大的2D自监督模型(如DINO)中“蒸馏”特征到3D,但其后续的超体素聚类过程容易出错,生成的软伪标签(soft pseudo-labels)精度不足,最终也限制了其在3D点云上的分割性能。
  1. LogoSP的核心创新动机
    正是为了解决上述“特征区分度不足”和“分组策略过于简单”两大核心痛点,LogoSP被提了出来。其动机是设计一个能同时利用局部和全局特征的全新框架。
  • 核心洞察:从频域寻找全局语义
    • 作者认为,复杂的3D场景是由许多宏观结构(如平面、曲面、边缘、角点)组成的,这些是描述3D语义的关键。
    • 一个关键的直觉是,这些宏观结构特征的差异,在频域中可以被更好地描述。例如,在2D图像中,低频分量对应背景轮廓,高频分量对应细节。
    • 由于3D点云的不规则性,不能直接用傅里叶变换(FFT),因此作者转向使用图傅里叶变换(Graph Fourier Transform, GFT)。
  • 最终目标:生成高质量伪标签
    • LogoSP的最终动机,就是通过构建一个全局超点图,并在频域中根据超点的“全局模式(global patterns)”来对它们进行分组。
    • 作者相信,这种基于全局信息的方法能够生成高度准确的语义伪标签,从而可以训练出一个性能卓越的分割网络。

1.1.2 Introduction
代表性工作是 GrowSP 和 PointDC。然而,这些现有方法存在局限性:

  • GrowSP:该方法通过创建并逐步增长3D“超点”来学习语义。但其性能受限,因为它在初始化阶段缺乏语义先验知识,且其后续的超点分组策略过于简单,导致生成的伪标签质量不高。
  • PointDC:该方法将自监督2D模型的特征提取到3D点云中。但其超体素聚类过程容易出错,生成的软伪标签不够准确,最终影响了分割性能。
    为了克服这些局限性,LogoSP 方法在借鉴先前工作优点的基础上进行了改进。其核心思想是结合局部和全局点特征来学习3D语义。该方法的关键创新在于,它通过在频域中根据超点的全局模式进行分组来发现3D语义信息,从而为分割网络的训练生成高度准确的语义伪标签。
    LogoSP 的流程包含三个主要部分:
  1. 2D-3D特征提取:利用自监督的预训练2D模型,为3D点云获取高质量的初始逐点特征。
  2. 自下而上的超点增长:根据局部特征的相似性,将原始3D点组合成超点。
  3. 自上而下的伪标签生成:构建一个全局超点图,并通过图傅里叶变换,在频域中对超点进行分组,从而生成语义伪标签。
    1.1.3 Overview
    [图片]

2D-to-3D Distillation Module
其目标是利用在2D图像上经过自监督预训练的模型(如DINO/v2),将语义知识(semantic priors)提取并应用到3D点云中。
该模块包含以下三个步骤:

  • 第一步: 将与3D点云场景关联的所有2D图像输入到预训练模型中,从而获得每个像素的特征。接着,借助深度图像,这些2D特征被投影到3D空间中。如果一个3D点对应多个来自不同图像的特征向量,则将这些向量取平均值;如果某个点没有对应的特征向量,那么它在下一步中将不会被监督。
  • 第二步: 对于一个特定的3D点,经过第一步后会得到其最终的投影特征 fnh。然后,会从零开始训练一个名为 g 的蒸馏网络(具体为SparseConv网络),目的是让这个网络学会为每个3D点预测其对应的投影特征。该网络的训练由一个损失函数监督,该函数计算预测的3D特征和投影的3D特征之间的余弦相似度。
  • 第三步: 通过训练好的蒸馏网络 g,为整个训练数据集中的每一个3D点生成一个新的3D特征向量。这些新的3D特征不仅继承了来自2D图像的语义信息,还包含了更多的空间信息。这个训练好的网络 g 会在后续的操作中被重复使用。

Bottom-up Superpoint Growing
在获得每个点的3D特征后,此模块的目标是将这些点逐步聚合成更大、更包含语义信息的“超点” (superpoints)。
此过程也分为三个步骤:

  • 第一步:创建初始超点
    • 为每个点云创建一组初始超点。初始超点的数量 M0 在不同场景中是不同的。
  • 第二步:计算超点特征
    • 计算每个初始超点的平均特征。这是通过对其内部所有点的3D特征(由蒸馏模块生成)求平均得到的。
  • 第三步:合并超点
    • 使用K-means聚类算法,将所有初始超点的平均特征向量聚类成 M1 个簇,其中 M1 小于 M0。
    • 每个簇就形成了一个新的、更大的超点。
      这个增长过程会重复进行多轮,每一轮都会通过计算特征和聚类来合并超点,从而使超点的数量从 M1 逐步减少到一个预设的最终值 M T M^T MT.

Top-down Semantic Pseudo-label Generation
受2D启发,在2D域中,通过2D FFT将图像转换到频域后,低频分量倾向于表示一般的图像背景形状,而高频分量可能代表次要物体或细节的形状。
[图片]

有了这个见解,我们的目标是在频率域中对超点进行分组,这倾向于从自上而下的角度捕获语义先验。由于三维点云是不规则和无秩序的,直接应用3D FFT是具有挑战性的,并且计算量极大
对此,我们转而将三维点云转换为全局图,然后应用图傅里叶变换( GFT )。

该模块分为以下三个步骤:

  1. 构建全局超点图 (Constructing a Global Superpoint Graph)
  • 构建图: 首先,将数据集中所有场景的所有超点视为图的“节点” (nodes)。节点总数为 S。
  • 定义边: 任意两个超点(节点)之间的“边” (edge) 的权重由它们特征向量的相似度决定,具体通过公式
    a i j = e x p ( − ∣ ∣ f ~ i − f ~ j ∣ ∣ 2 ) a_{ij} = exp(-||\tilde{f}^{i} - \tilde{f}^{j}||_2) aij=exp(∣∣f~if~j2)计算得出。这样就构建了一个包含S个节点的全局图 G。
  • 计算全局模式:
    • 通过图的邻接矩阵计算出归一化拉普拉斯矩阵 L。
    • 对矩阵 L 进行特征分解 (L=U⋅Λ⋅UT),得到特征向量 U。
    • 这里的每个特征向量都被视为一个“全局模式” (global pattern),它代表了由所有S个超点共同定义的一个特定频率分量 。这些全局模式蕴含了丰富的语义信息。
  1. 分组全局模式 (Grouping Global Patterns)
    直接从上一步获得的S个全局模式可能存在冗余,不够有区分度(例如,不同方向的墙面可能对应不同的模式。因此,需要对这些模式进行分组和提炼。
  • 特征变换: 首先,将所有超点的原始特征 F~ 通过全局模式 U 转换到频域,得到频域特征 F~feq 。
  • 模式聚类: 使用K-means算法对这些频域特征向量进行聚类,将S个全局模式分组为 S′ 个新的簇。
  • 生成新模式: 对每个新簇内的所有全局模式取平均值,从而生成一个新的、更具代表性的全局模式 vs′。通过这个过程,原始的S个全局模式被提炼成了 S′ 个新的全局模式 V,这些新模式因为聚合了频域中特征相似的原始模式,所以通常带有更明确的语义 。
  1. 生成语义伪标签 (Generating Semantic Pseudo-labels)
    这是最后一步,利用提炼后的新全局模式来为所有超点生成伪标签。
  • 新特征表示: 对于提炼后的新全局模式矩阵 V,其第 s 行的向量 vs 可以被看作是第 s 个超点在频域中的一组新特征 。这个新特征向量描述了该超点如何对所有 S′ 个新全局模式做出贡献,从而蕴含了语义信息。
  • 最终聚类: 基于这一理解,直接对矩阵 V 的所有行向量应用K-means算法,将全部S个超点聚类成C个类别 。
  • 生成伪标签: 聚类的结果就是为数据集中所有超点生成的语义伪标签 。这些伪标签随后可用于训练分割网络。

Generating Semantic Pseudo-labels
核心思想和步骤如下:

  1. 回顾并引入关键概念:
  • 文章首先回顾了之前的两个步骤:
    1. 从整个数据集的 S 个超点中,首先得到了原始的 S 个全局模式 U=[u1⋯uS]。这里的 us 就是指第 s 个特征向量(如我们之前讨论的,它代表一个全局模式或频率分量)。
    2. 然后,这些原始的全局模式被分组(聚合)成了 S′ 个新的全局模式 V=[v1⋯vS′]。矩阵 V 的维度是 S×S′。
  1. 对矩阵 V 进行关键性解读:
  • 这是一个核心的视角转换。之前我们把 V 的列 (vs′) 看作是新的全局模式。
  • 现在,文章指出,矩阵 V 的第 s 行向量,记作 v~s∈R1×S′,实际上代表了对应的第 s 个超点 p~s 如何贡献于(或与)总共 S′ 个新的、包含语义先验的全局模式相关联。
  • 简而言之,对于每一个超点 p~s,它的特征现在由 v~s 这个向量来表示,这个向量包含了它与所有 S′ 个新的全局模式的关联程度,从而从“频率域中新的全局模式”的角度提供了一组新的特征。
  1. 生成语义伪标签的核心操作(公式11):
  • 有了上述洞察,就可以将总共 S 个超点(现在每个超点由 V 矩阵的对应行向量 v~s 作为特征)直接分组到 C 个语义类别中。
  • 方法: 应用 K-means 聚类算法。
  • 输入: 聚类操作的对象是矩阵 V 的所有行向量,即 {v1⋯vS}(这些代表了各个超点的特征)。
  • 目的: 为所有超点生成语义伪标签。
  • 公式11 概括了这一过程:C classes ←K-means on V {p1…pS} 这意味着 K-means 算法作用于矩阵 V(即其行向量),目的是将超点 {p1…pS} 划分到 C 个类别中。这些类别就是为每个超点分配的伪标签。

Experiment
在使用语义标签预测实例后,我们使用匈牙利匹配将语义标签映射到真实数据集中的类名(详细信息在 附录B 中)。它评估预测语义片段与真实标签的一致性,而不受预测类标签中任何排列的影响。

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值