主成分分析 (PCA) 简介

欢迎来到这一章!我们将一起探索精算师数据工具箱中最强大的工具之一:主成分分析 (Principal Component Analysis,简称 PCA)。如果你曾面对拥有数十个字段的数据集而感到不知所措,PCA 正好可以帮到你。这是一种用来“简化”复杂数据的技术,同时能确保不会丢失数据背后最重要的故事。

想象一下,PCA 就像是为一个复杂的物体进行高分辨率的 3D 扫描,然后找一个完美的 2D 角度来拍摄它,让你依然能一眼认出它的绝大部分特征。在精算学术语中,我们称之为降维 (dimensionality reduction)——将众多变量转化为少数几个核心变量。

什么是降维?

在许多精算问题中,我们需要处理大量的解释变量 (explanatory variables)。例如,在为保险定价时,你可能拥有司机的年龄、驾龄、发动机排量、当地犯罪率,甚至是汽车颜色等数据。这就是所谓的“高维”数据。

降维是指通过获取一组“主成分”变量,来减少所考虑的变量数量的过程。其目标是:

  • 简化数据集。
  • 去除噪声和冗余(具有相关性的变量)。
  • 使数据更易于可视化和建模。

核心要点:PCA 通过专注于提供最多“信息”的变量来帮助我们压缩数据(在统计学中,我们用方差 (variance) 来衡量信息量)。

PCA 如何运作:概念步骤

如果底层的线性代数让你感到畏缩,请不用担心;在 CS1 考试中,重点在于该方法的目的应用。以下是 PCA 转换数据的逻辑流程:

1. 数据标准化 (Standardizing the Data)

由于变量通常以不同的单位衡量(例如:以“年”为单位的年龄 vs 以“千元”为单位的收入),我们通常会先进行标准化。这能确保数值较大的变量不会不公平地主导整个分析结果。

2. 识别主成分 (Principal Components, PCs)

PCA 会为数据寻找一组新的坐标轴。
第一主成分 (\(PC_1\)) 是数据中捕捉到最大方差的方向。
第二主成分 (\(PC_2\)) 是捕捉到次高方差的方向,但有一个重要规则:它必须与 \(PC_1\) 不相关(正交)。

3. 转换变量

每个主成分都是原始变量的线性组合 (linear combination)。如果你的原始变量是 \(X_1, X_2, \dots, X_p\),那么主成分 \(Z_i\) 看起来会像这样:
\(Z_i = a_{i1}X_1 + a_{i2}X_2 + \dots + a_{ip}X_p\)

这些系数 (\(a_{i1}, a_{i2}, \dots\)) 被称为载荷 (loadings)。它们告诉我们每个原始变量在该特定主成分中所占的权重。

主成分的关键特性

关于主成分,有几条在考试题目中非常常见的“黄金法则”:

  • 最大方差:\(PC_1\) 总是解释了数据中总方差的最大部分。
  • 不相关:每个主成分之间完全不相关。这对于之后进行回归建模是一个巨大的优势!
  • 重要性递减:主成分是有顺序的。\(PC_1\) 的“信息量”比 \(PC_2\) 多,\(PC_2\) 又比 \(PC_3\) 多,依此类推。
  • 总方差不变:所有主成分的方差总和等于原始变量的方差总和。我们并没有“创造”新信息,只是重新排列了它。

你知道吗?在许多精算数据集间,前两个或三个主成分通常就能解释超过 80% 的总方差,这让你可以在几乎不损失信息的情况下,舍弃其余数十个变量!

解读结果

Paper B 考试中,你可能会使用 R 等软件来执行 PCA。你需要解读两个主要部分:

1. 解释方差比例 (Proportion of Variance Explained, PVE)

这告诉你每个成分承载了总“信息量”的百分比。
如果 \(PC_1\) 的 PVE 为 \(0.60\),这意味着它解释了整个数据集中 60% 的方差。

2. 累积比例 (Cumulative Proportion)

这是 PVE 的累计总额。如果你决定保留前三个成分,你会查看 \(PC_3\) 的累积比例,看看你保留了原始数据中多少的故事内容。

常见错误:学生有时会认为必须保留所有成分。PCA 的核心意义在于降低维度。如果你有 10 个原始变量并保留了 10 个主成分,那你根本没有简化任何东西!

选择主成分的数量

我们该如何决定何时停止?多少个主成分才算“足够”?在数据分析中,有两种常用的方法:

  • 碎石图 (Scree Plot):一个显示每个主成分所解释方差的折线图。我们会寻找“肘部 (elbow)”——即图形趋于平缓的点。通常我们会保留肘部之前的所有成分。
  • 阈值法 (Threshold Method):我们先设定一个目标,例如“解释 80% 或 90% 的总方差”,然后保留达到该目标所需的最少主成分数量。

快速回顾:为什么在精算工作中使用 PCA?

1. 简化:处理 3 个变量比处理 50 个变量要容易得多。

2. 可视化:我们无法想象 10 维数据,但我们可以轻松地在 2D 散点图上绘制 \(PC_1\) 与 \(PC_2\) 的关系,从而观察保单持有人数据中是否存在任何天然的聚类或模式。

3. 避免多重共线性 (Multicollinearity):在回归分析(你将在第 4 单元学习)中,高度相关的解释变量会导致问题。由于主成分之间是不相关的,将它们作为回归模型的输入可以完美解决这个问题。

总结:PCA 是一种降维工具,它将一组大量且具相关性的变量,转换为一组较小且不相关的变量,称为“主成分”,并按其解释方差的多寡进行排序。