导论:理解数据中的关系

在精算学的世界里,我们很少孤立地观察单一数据。相反,我们通常对两个事物如何共同变化感兴趣。例如,如果被保险人的年龄增加,他们的保险索赔频率是否也会随之增加?这就是我们所说的相关性 (correlation)。 在本章中,我们将探索三种主要方法,用来衡量两个变量(二元数据)之间关系的强度和方向:皮尔逊 (Pearson’s)斯皮尔曼 (Spearman’s)肯德尔 (Kendall’s) 相关系数。你可以将这些视为不同的“透镜”,透过它们观察相同的数据,可以看到不同类型的联系。

1. 皮尔逊积差相关系数 (Pearson’s Product-Moment Correlation Coefficient)

皮尔逊相关系数通常用样本的 \(r\) 或总体的 \(\rho\) 表示,是最常用的相关性衡量指标。它衡量的是两个连续变量之间线性 (linear) 关系的强度。

它告诉我们什么?

\(r\) 的值始终介于 \(-1\) 与 \(+1\) 之间:
  • \(r = +1\):完全正线性关系(当一个增加时,另一个以直线方式增加)。
  • \(r = -1\):完全负线性关系(当一个增加时,另一个以直线方式减少)。
  • \(r = 0\):完全没有线性关系。

计算公式

对于含有 \(n\) 对数据 \((x_i, y_i)\) 的样本,公式为:

\(r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}\)

你可能也会看到使用“平方和”符号的写法:

\(r = \frac{S_{xy}}{\sqrt{S_{xx} S_{yy}}}\)

重要注意事项

皮尔逊相关系数非常敏感。它假设关系是一条直线,并且受离群值 (outliers)(极端值)的影响很大。如果你的数据呈现曲线(例如“U”形),即使存在很强的关系,皮尔逊系数也可能告诉你没有相关性!
核心重点:当你预期存在直线关系且数据中没有极端离群值时,请使用皮尔逊系数。

2. 斯皮尔曼等级相关系数 (Spearman’s Rank Correlation Coefficient)

有时候,我们不在乎具体的数值,而在乎数据的等级 (rank) 或顺序。这就是斯皮尔曼等级相关系数 (\(r_s\) 或 \(\rho_s\)) 发挥作用的地方。

运作原理

我们不使用原始数据(如 $1,250 和 $5,000),而是将它们排名(第 1、第 2、第 3 等)。然后,我们对这些排名计算皮尔逊相关系数。 如果没有重复的排名(tied ranks),我们可以使用这个简化公式:

\(r_s = 1 - \frac{6 \sum d_i^2}{n(n^2 - 1)}\)

其中 \(d_i\) 是 \(x_i\) 的排名与 \(y_i\) 的排名之间的差。

为什么要使用它?

斯皮尔曼相关系数衡量的是单调 (monotonic) 关系。如果当一个变量增加时,另一个变量也倾向于增加(即使不是呈直线),则该关系是单调的。
  • 它对离群值具有稳健性 (robust),因为排名限制了极端值的影响。
  • 它可以用于定序数据 (ordinal data)(具有自然顺序的数据,如“低”、“中”、“高”)。

核心重点:斯皮尔曼系数非常适合处理呈现曲线但持续增长的关系,或者是包含杂乱离群值的数据。

3. 肯德尔等级相关系数 (Kendall’s Rank Correlation Coefficient / Tau)

肯德尔 Tau (\(\tau\)) 是另一种基于排名的衡量方法,但其运作方式与斯皮尔曼略有不同。它观察的是数据点对的方向

一致对 (Concordant) 与不一致对 (Discordant)

想象从数据集中任选两个人:
  • 如果一个人在两个变量中的排名都高于另一个人,则这一对是一致的 (concordant)。他们在方向上“达成共识”。
  • 如果一个人在第一个变量中排名较高,但在第二个变量中排名较低,则这一对是不一致的 (discordant)。他们“意见分歧”。
公式为:

\(\tau = \frac{(\text{一致对的数量}) - (\text{不一致对的数量})}{\frac{1}{2} n(n - 1)}\)

为什么要使用肯德尔系数?

虽然斯皮尔曼较为常见,但在以下情况下通常优先选择肯德尔 Tau:
  • 数据集非常小。
  • 存在许多重复的排名(ties)。
  • 在某些情境下,你希望衡量指标在假设检验中具有更好的统计特性。

核心重点:肯德尔系数观察的是成对数据之间的“一致性”,对于样本量小或重复排名多的数据集非常有用。

4. 相关性的统计推断 (Statistical Inference)

计算出一个数字只是开始。作为精算师,我们需要知道:这个相关性是真实存在的,还是仅仅是随机概率产生的结果?

假设检验 (Hypothesis Testing)

我们通常检验原假设:

\(H_0: \rho = 0\)(总体中不存在相关性)

对抗备择假设:

\(H_1: \rho \neq 0\)(存在相关性)

对于皮尔逊相关系数,如果数据服从二元正态分布,我们可以使用具有 \(n - 2\) 自由度的 \(t\) 检验:

\(t = r \sqrt{\frac{n - 2}{1 - r^2}}\)

注:斯皮尔曼和肯德尔也有类似的检验方法,通常涉及查阅图表中的临界值或使用 R 等软件(正如你在 Paper B 中所做的那样)。

总结与比较

快速比较表

皮尔逊 (Pearson):线性关系;对离群值敏感;需要连续数据。
斯皮尔曼 (Spearman):单调关系;使用排名;对离群值具稳健性。
肯德尔 (Kendall):基于成对数据的一致性;最适合小样本或多重复排名的数据。

应避免的常见错误
  • 相关性 \(\neq\) 因果关系:仅仅因为两件事相关,并不意味着其中一件导致了另一件。(例如:冰淇淋销量和鲨鱼袭击事件相关,是因为天气炎热,而不是因为冰淇淋吸引鲨鱼!)
  • 误解 \(r = 0\):对于皮尔逊系数,\(r = 0\) 仅表示没有线性关系。两者之间可能仍存在非常强的非线性关系。
  • 忽略散点图 (Scatterplot):在选择相关性衡量方法之前,务必先观察数据的可视化图表!
快速复习题
  1. 对于呈现曲线但始终向上增长的关系,你会使用哪种衡量方法?(答案:斯皮尔曼或肯德尔)
  2. 如果 \(r = -0.9\),这告诉你关于两者关系的什么信息?(答案:强负线性关系)
  3. 为什么对于含有离群值的数据,斯皮尔曼通常优于皮尔逊?(答案:因为排名“中和”了极端值的影响)

欲了解更多有关数据可视化的信息,请参阅“摘要统计与探索性数据可视化”章节。若想了解这些变量在预测模型中的关系,请参考“回归理论与应用”部分。