引言:理论与现实的对比

在精算工作中,我们经常从一个数学“猜想”或模型开始。例如,我们会假设每天的保险索赔次数符合 泊松分布 (Poisson distribution),或者男性和女性保单持有人续保的可能性相同。但我们如何知道这些假设是否与现实相符?这就是 卡方 (\(\chi^2\)) 检验 发挥作用的地方。

在本章中,我们将学习两个强大的工具:拟合优度检验 (Goodness of Fit test)(用于检查数据是否符合特定分布)以及 列联表 (Contingency Tables)(用于检查两个因素是否相互独立)。这些检验让我们能从“我认为是这样”提升到“统计证据显示事实的确如此”。

1. 卡方拟合优度检验

拟合优度检验的目标是判断一组观测数据是否“符合”某个理论概率分布(例如二项分布、泊松分布或正态分布)。

核心逻辑

side我们会将实际观察到的数据(观测频数,\(O_i\))与假设理论正确时应看到的数据(期望频数,\(E_i\))进行比较。

如果 \(O_i\) 与 \(E_i\) 之间的差异很小,说明我们的理论很可能是正确的;如果差异巨大,则理论可能存在错误。

检验统计量

标准检验统计量的计算公式如下:

\( \chi^2 = \sum \frac{(O_i - E_i)^2}{E_i} \)

其中:
- \(O_i\) = 第 \(i\) 类别的观测频数
- \(E_i\) = 第 \(i\) 类别的期望频数

操作步骤

  1. 建立假设:
    \(H_0\):数据符合指定的分布。
    \(H_1\):数据不符合指定的分布。
  2. 计算期望频数: 将总观测次数 (\(n\)) 乘以落入该类别的概率 (\(p_i\))。即 \(E_i = n \times p_i\)。
  3. 检查“5 之规则”: 为了使卡方检验有效,每个期望频数 \(E_i\) 应至少为 5。如果某个 \(E_i\) 小于 5,你必须将相邻的类别进行 合并 (group),直到新的合并 \(E_i\) 达到 5 或以上。
  4. 计算统计量: 对所有(可能已合并的)类别求和算出 \( \frac{(O_i - E_i)^2}{E_i} \)。
  5. 确定自由度 (df): 这是最容易失分的地方!
    \(df = k - 1 - p \)
    其中 \(k\) 是(合并后的)类别数量,而 \(p\) 是为了计算期望值而必须从数据中估算的参数数量。
  6. 与临界值比较: 如果计算出的 \(\chi^2\) 大于显著性水平(通常为 5%)下的查表临界值,我们则 拒绝 \(H_0\)

小贴士:如果题目直接给出了参数(例如“检验此数据是否符合 \(\lambda = 2\) 的泊松分布”),则 \(p = 0\)。如果你需要利用数据的平均值自己计算 \(\lambda\),则 \(p = 1\)。

2. 列联表(独立性检验)

精算师经常需要知道两个分类变量是否相关。例如,“吸烟状况”(吸烟者/非吸烟者)是否与“保单失效”(失效/有效)相互独立?我们可以使用 双向列联表 (two-way contingency table) 来找出答案。

独立性检验的假设

\(H_0\):两个分类标准是相互独立的。
\(H_1\):两个分类标准不是相互独立的(存在关联)。

计算表格中的期望频数

在一个有 \(r\) 行和 \(c\) 列的表格中,我们假设独立的前提下计算每个单元格的期望频数:

\( E_{ij} = \frac{\text{该行总计} \times \text{该列总计}}{\text{总样本量}} \)

列联表的自由度

对于列联表,自由度始终为:
\(df = (r - 1) \times (c - 1) \)

例子:一个 \(3 \times 2\) 的表格,其自由度为 \((3-1) \times (2-1) = 2 \times 1 = 2\)。

快速回顾:比较表

特性 拟合优度检验 列联表
目的 数据是否符合特定分布? 两个变量是否独立?
自由度 (df) \(k - 1 - p\) \((r - 1)(c - 1)\)
合并类别 若 \(E_i < 5\),合并类别。 若 \(E_{ij} < 5\),合并行/列。

3. 实务操作的重要考虑事项

“5 之规则”与合并类别

如果你因为期望值太小而必须合并类别,请记住这会 减少 你的自由度。
例子: 如果你原本有 6 个类别 (\(k=6\)),但必须将最后两个合并为一个,那么新的 \(k\) 就是 5。计算自由度时必须使用这个新的 \(k\)。

结果解读

如果计算出的 \(\chi^2\) 非常小,意味着观测数据与预期非常接近,我们 不能拒绝 \(H_0\)
如果计算出的 \(\chi^2\) 非常大,意味着“不吻合度”太大,无法单纯用随机误差来解释,我们 拒绝 \(H_0\)

你知道吗?
卡方检验是一种 近似 (approximate) 检验。随着样本量增加,它会变得越精确。这就是为什么我们有“5 之规则”——它能确保这种近似对于精算决策来说足够可靠。

4. 应避免的常见错误

  • 忘记扣除估算参数: 在拟合优度检验中,如果你计算了平均值 (\(\bar{x}\)) 并将其作为泊松分布的 \(\lambda\),你 必须 在自由度中额外减去 1。
  • 错误地用 \(O_i\) 来判断“5 之规则”: 只有 期望 频数才对合并规则有影响。即使观测频数小于 5 也没问题。
  • 计算错误: 在计算 \( \frac{(O-E)^2}{E} \) 时很容易产生输入错误。请务必仔细复核你的数值表。
  • 列联表自由度错误: 学生常会对列联表误用 \(n-1\)。请记住始终使用 \((r-1)(c-1)\)。

重点归纳

1. 检验统计量: 始终是 \( \sum \frac{(O-E)^2}{E} \)。
2. 拟合优度自由度: \( (\text{类别数量}) - 1 - (\text{估算参数数量}) \)。
3. 独立性检验自由度: \( (r-1)(c-1) \)。
4. 低频数处理: 若 \(E < 5\),则合并类别。
5. P 值: 在 Paper B (R 语言) 中,你会使用 chisq.test() 函数,它会自动为你处理计算并提供 p 值。如果 p 值小于 \(\alpha\)(例如 0.05),则拒绝 \(H_0\)。