欢迎来到主成分分析 (Principal Component Analysis, PCA) 的世界!
各位准精算师们好!今天我们要深入探讨非监督式学习 (Unsupervised Learning) 工具箱中强大的工具之一:主成分分析,简称 PCA。
别被这个名称吓到了。如果你曾经尝试将一本 500 页的书浓缩成 1 页的执行摘要,那么你已经做过一次“脑内 PCA”了。在数据世界里,我们经常需要处理数十(甚至数百)个变量。PCA 能协助我们找出几个“超级变量”,在剔除噪声的同时捕捉数据的核心精髓。让我们一步一步来拆解它!
1. 到底什么是 PCA?
PCA 是一种用于降维 (dimension reduction) 的技术。在许多数据集中,变量之间往往存在相关性(彼此相关)。例如,在房价数据集中,“坪数”和“房间数量”通常会同步变动。PCA 并非分开检视这两个变量,而是找到一种方法将它们结合成一个单一的分数。
目标:在尽可能保留变异数 (variation) 的前提下,找到数据集的低维度表示。
类比:想象你要帮一座 3D 雕像拍一张 2D 照片。你会希望站在一个能看见最多细节和“深度”的角度。PCA 就是在帮你的数据找到那个最完美的拍摄角度。
快速复习:PCA 是非监督式的,因为这里没有“目标”或“反应”变量 (\(y\))。我们只关注预测变量 (\(x_1, x_2, \dots, x_p\))。
2. 第一主成分 (\(PC_1\))
第一主成分是指变量的某种线性组合,该组合具有最大的变异数。
在数学上,对于一组特征 \(x_1, x_2, \dots, x_p\),第 \(i\) 个观察值的第一主成分得分为:
\( Z_{i1} = \phi_{11}x_{i1} + \phi_{21}x_{i2} + \dots + \phi_{p1}x_{ip} \)
需要记住的关键术语:
负载量 (Loadings, \(\phi\)):这些是权重。例如,\(\phi_{11}\) 是第一个变量在第一主成分中的负载量。它们告诉我们每个变量在新的成分中占了多少“比重”。
得分 (Scores, \(Z\)):这是转换后的数据点在新的“PCA 空间”中的实际数值。
限制条件:
为了让数学运算成立,我们有一个规则:负载量的平方和必须等于 1。
\( \sum_{j=1}^{p} \phi_{j1}^2 = 1 \)
为什么?如果没有这条规则,我们只要随意选取巨大的权重,就能让变异数无限大!这个限制条件能确保数据标准化。
关键要点:第一主成分是数据中观察值变异程度最大的“方向”。
3. 计算后续成分
在找到第一主成分 (\(PC_1\)) 后,我们可以接着找到第二主成分 (\(PC_2\)),以此类推。
正交性原则 (Rule of Orthogonality):第二主成分 (\(PC_2\)) 必须与 \(PC_1\) 不相关 (uncorrelated)。从几何角度来看,这意味着 \(PC_2\) 的方向与 \(PC_1\) 垂直 (orthogonal)。
你知道吗?主成分的数量最多只能有 \(min(n-1, p)\) 个,其中 \(n\) 为观察值的数量,\(p\) 为变量的数量。
逐步计算逻辑:
1. 找出捕捉最多变异数的方向 (\(PC_1\))。
2. 在与第一个方向垂直的前提下,找出捕捉剩余最多变异数的下一个方向 (\(PC_2\))。
3. 重复上述步骤,直到解释了所有变异数或达到成分数量的上限。
4. 标准化的重要性
千万别跳过这步!这是考试非常热门的考点。在进行 PCA 计算之前,几乎总是应该对变量进行标准化 (scaling),使其平均数为 0,标准差为 1。
为什么?PCA 对测量单位非常敏感。想象一个数据集同时包含“年收入”(以美元计算)和“年龄”(以岁计算)。仅仅因为单位差异,收入的数值会大得多,变异数也会大得多。如果不进行标准化,PCA 会因为数值较大,而误以为收入是唯一重要的变量。
小撇步:如果所有变量的测量单位相同(例如都是 0-100 的考试成绩),则可能不需要标准化。但在大多数 SRM 题目中,标准化是安全且正确的做法。
常见错误:忘记将数据置中(减去平均数)。PCA 寻找的是围绕平均数的变异数。
5. 变异数解释比例 (PVE)
我们应该保留多少个主成分?为了解答这个问题,我们要看变异数解释比例 (Proportion of Variance Explained, PVE)。
我们想知道的是:“前 \(m\) 个主成分捕捉了原先 \(p\) 个变量中多少比例的总信息?”
数据集的总变异数等于每个个体变量变异数的总和。第 \(m\) 个成分的 PVE 计算公式如下:
\( PVE_m = \frac{\text{Variance explained by } PC_m}{\text{Total Variance}} \)
陡坡图 (Scree Plot)
我们通常会使用陡坡图 (Scree Plot) 来可视化 PVE。这是一个简单的图表,横轴为成分编号,纵轴为 PVE。
“肘部”法则 (Elbow Method):观察 PVE 下降幅度显著变小且曲线趋于平缓的转折点(即“肘部”)。这通常是保留成分数量的理想位置。
关键要点:累积 PVE 告诉我们拥有了多少“总信息量”。如果前 3 个成分就能解释 95% 的变异数,那我们通常就可以忽略其他 20 个变量了!
6. 总结与最后建议
PCA 就像一支强力手电筒。它能照亮混乱、高维度空间中最关键的模式。
记忆口诀(PCA 的 3 个 S):
1. Scale the data first! (优先标准化数据!)
2. Scores are the new data points. (得分是转换后的数据点。)
3. Scree plots help you decide when to stop. (利用陡坡图决定何时停止。)
快速复习箱:
- PCA 是监督式还是非监督式学习? 非监督式。- 负载量 (Loadings) 代表什么? 成分中各原始变量的权重。
- PC1 与 PC2 的关系为何? 它们不相关(正交)。
- 为什么要标准化? 防止测量单位大的变量主导整个分析。
如果刚开始觉得数学很难,别担心!对于 SRM 考试,请专注于概念:我们为何使用 PCA(降维)、标准化的重要性,以及如何解读 PVE。你一定行的!