聚类基础:模型与算法解析
1. 聚类概述
聚类作为数据分析的基础工具,在众多工程和科学领域有着广泛应用,如模式识别、特征提取、矢量量化、图像分割、生物信息学和数据挖掘等。它还是基于核的神经网络(如径向基函数网络)原型选择的经典方法,对神经模糊系统也非常有用。
聚类是一种无监督分类技术,基于相似性度量识别一组对象中存在的固有结构。聚类方法可从统计模型或竞争学习中推导得出,相应地可分为生成式(或基于模型)和判别式(或基于相似性)方法。聚类问题也可建模为约束优化问题。聚类神经网络是统计模型,通过学习参数来估计数据的概率密度函数(pdf)。
1.1 矢量量化
矢量量化是一种经典方法,使用有限数量的原型来逼近矢量变量 $x \in R^n$ 的连续概率密度函数 $p(x)$。即,用有限的原型集 ${c_1, \ldots, c_K} \in R^n$ 表示一组特征向量 $x$,这个有限的原型集被称为码本。码本设计可通过聚类算法实现。
一旦码本确定,对 $x$ 的逼近需要找到最接近 $x$ 的参考向量 $c$,满足:
[
\vert x - c \vert = \min_{i} \vert x - c_i \vert
]
这是最近邻范式,实际上是简单的竞争学习过程。
码本可通过最小化期望平方量化误差来设计:
[
E = \int \vert x - c \vert^2 p(x)dx
]
其中 $c$ 满足上述最近邻条件,即 $c$ 是 $x$ 和 $c_i$ 的函数。
从上述准则可推导出寻找码本的迭代逼近方案:
[
超级会员免费看
订阅专栏 解锁全文

3万+

被折叠的 条评论
为什么被折叠?



