主成分分析:高维数据处理与潜在变量视角
1. 高维数据中的PCA
在处理高维数据时,传统的主成分分析(PCA)可能会面临计算挑战。因为计算数据协方差矩阵的特征值和特征向量的计算复杂度与数据维度的立方成正比。例如,对于100×100像素的图像,需要计算一个10,000×10,000的协方差矩阵的特征分解,这在计算上是非常昂贵的。
1.1 迭代求特征向量
可以通过迭代的方法找到与最大特征值相关的特征向量。迭代公式如下:
[x_{k + 1} = \frac{Sx_k}{|Sx_k|}, k = 0, 1, \cdots]
其中,向量 (x_k) 在每次迭代中与矩阵 (S) 相乘,然后进行归一化,使得 (|x_k| = 1)。这个向量序列会收敛到矩阵 (S) 最大特征值对应的特征向量。原始的Google PageRank算法就使用了类似的算法来根据网页的超链接对网页进行排名。
1.2 数据协方差矩阵的转换
假设我们有一个中心化的数据集 (x_1, \cdots, x_N),其中 (x_n \in \mathbb{R}^D),数据协方差矩阵为:
[S = \frac{1}{N}XX^{\top} \in \mathbb{R}^{D \times D}]
其中 (X = [x_1, \cdots, x_N]) 是一个 (D \times N) 的矩阵,其列是数据点。
当数据点的数量 (N) 远小于数据的维度 (D)(即 (N \ll D)),且没有重复的数据点时,协方差矩阵 (S) 的秩为 (N),有 (D - N + 1) 个特征值为0,这意味着数据存在一些冗余。我们可以利用这一点
超级会员免费看
订阅专栏 解锁全文

1979

被折叠的 条评论
为什么被折叠?



