欢迎来到独立性参数检验与无参数检验(Parametric and Non-Parametric Tests of Independence)的世界!

在你的 CFA 学习之旅中,你已经学过如何描述数据,并针对单一平均数或方差进行假设检验。但在真实的金融世界里,我们很少只单独看一件事。我们通常想了解的是:股票的表现是否与其所属行业有关?执行长的学历会影响公司回报吗?

在本章中,我们将探讨如何检验两个变量是独立的(代表两者没有关系)还是相关的(代表两者有关联)。我们将探讨两个主要工具:卡方检验(Chi-Square Test)斯皮尔曼等级相关系数(Spearman’s Rank Correlation)。不用担心这些名字听起来很复杂——我们会一步步拆解它们!

快速回顾:「独立」是什么意思?
如果两个事件是独立的,那么其中一个事件的发生对于另一个事件的概率不会提供任何信息。例如,掷硬币的结果与伦敦的天气是独立的。然而,利率与债券价格则是相关的(dependent)


1. 参数检验与无参数检验:宏观概览

在深入研究具体的检验方法之前,我们需要先了解统计检验的这两个「家族」。

参数检验(Parametric Tests)

这类检验对基础数据有严格的假设。通常,它们假设数据遵循某种特定分布(如常态分布),并使用诸如平均数(mean)方差(variance)等参数。想象一下,这就像一个严格的烘焙食谱——如果你的材料不够精准,蛋糕就不会发起来。

无参数检验(Non-Parametric Tests)

这些检验更具弹性。它们不要求数据必须呈常态分布。通常在我们有小样本量异常值(outliers),或是处理的是等级数据(ranked data)(例如「第一名、第二名」)而非精确数值时使用。把它们想象成「Taco 自助餐」——你可以随意替换配料,餐点依然美味!

关键要点:当我们的数据比较「混乱」或不符合参数检验的严格要求时,我们就会使用无参数检验。


2. 卡方(\(\chi^2\))独立性检验

当我们有类别数据(categorical data)时,我们会使用卡方检验。这意味着数据是被分类到不同的组别或「桶子」中,而不是连续的数值。例如,将公司按产业(科技、能源、金融)和股利政策(发放股利、不发放股利)进行分类。

列联表(Contingency Tables)

为了执行此检验,我们使用列联表(也称为交叉表)。它能同时展示两个类别变量的计数(频率)。

假设(Hypothesis)

虚无假设(\(H_0\)):两个变量是独立的(没有关系)。
对立假设(\(H_a\)):两个变量是相关的(存在关系)。

计算检验统计量

卡方统计量衡量的是我们实际观察到的数据 (\(O\)) 与如果变量完全独立时我们预期会看到 (\(E\)) 的数据之间的差异。

公式为:
\( \chi^2 = \sum \frac{(O - E)^2}{E} \)

逐步流程:
1. 计算期望值 (\(E\)): 对于表格中的每个格子,使用这个技巧:
\( E = \frac{(\text{列总计} \times \text{行总计})}{\text{总计}} \)
2. 求出差异: 对于每个格子,用实际观察值减去期望值 (\(O - E\))。
3. 平方并相除: 将差异平方后,除以期望值。
4. 加总: 将所有格子的计算值加在一起,即可得到你的 \(\chi^2\) 统计量。

自由度(Degrees of Freedom, \(df\))

对于卡方独立性检验,自由度的计算方式为:
\( df = (r - 1) \times (c - 1) \)
其中 \(r\) 是列数,\(c\) 是行数。

你知道吗? 卡方分布总是正值,且向右偏斜。随着自由度增加,它会看起来越来越像常态分布!

关键要点: 如果计算出的 \(\chi^2\) 远大于表格中的「临界值」,我们就会拒绝虚无假设,并推论这些变量之间存在关系。


3. 斯皮尔曼等级相关系数(Spearman’s Rank Correlation, \(r_s\))

有时候我们想知道关系的强度,但我们的数据是顺序型的(ordinal/ranked),或者包含了会破坏标准相关系数计算的极端异常值。这时候就是斯皮尔曼等级相关系数出场的时候了。

类比: 想象两位评审在选秀节目中给 10 位参赛者排名。即使评审给出的确切分数不同,但如果他们都同意参赛者 A 比参赛者 B 优异,那么他们的排名就是相关的。

为什么要用它?

  • 它是皮尔逊(Pearson)相关系数的无参数替代方案。
  • 当数据是非线性但仍遵循某种趋势(单调)时使用。
  • 它对于异常值具有稳健性(robust),因为它看的是数据的顺序,而非实际数值。

计算方式:

1. 将两个变量的数据分别从小到大(或从大到小)进行排名。
2. 计算每一对排名之间的差异 (\(d_i\))。
3. 使用公式:
\( r_s = 1 - \frac{6 \sum d_i^2}{n(n^2 - 1)} \)

解读结果:
\(r_s\) 的值永远介于 -1 到 +1 之间。
- +1: 完美的正等级相关(当一个排名上升,另一个也总是上升)。
- -1: 完美的负等级相关。
- 0: 排名之间没有关系。

常见错误: 别忘了分子里的「6」!无论你的样本量是多少,这都是公式中的常数。

关键要点: 当你的数据不呈常态分布,或是处理的是排名而非原始测量数据时,斯皮尔曼等级相关系数是你的首选工具。


4. 何时使用无参数检验?(快速指南)

在 CFA 考试中,你可能会被要求辨识何时使用无参数检验比参数检验更合适。请记住这四种情境:

  1. 数据是类别型的: 当你是在计算「桶子」里的数量时,使用卡方检验。
  2. 数据是顺序型的(有排名的): 使用斯皮尔曼等级相关系数。
  3. 样本量小: 当样本过小,无法假设其为常态分布时。
  4. 存在极端异常值: 当几个异常数据点会将平均数或相关系数拉向某一极端时。

如果起初觉得这些很棘手,别担心! 只要记住:参数检验 = 精确/严格无参数检验 = 排名/弹性


总结与快速回顾栏

卡方检验: 使用列联表检验两个类别变量之间的独立性。使用 \(df = (r-1)(c-1)\)。

斯皮尔曼等级相关: 衡量排名数据之间关系的强度。范围从 -1 到 +1。

独立性: 虚无假设通常指出没有关系。如果我们的检验统计量很高,我们就「开除」(拒绝)虚无假设!

测试你的理解:
如果你正在比较「分析师评级」(买入/持有/卖出)与「行业」(科技/零售),你会使用哪种检验?
答案: 卡方独立性检验(因为这些都是类别!)。