引言:理论与现实的对比
在精算工作中,我们经常从一个数学“猜想”或模型开始。例如,我们会假设每天的保险索赔次数符合 泊松分布 (Poisson distribution),或者男性和女性保单持有人续保的可能性相同。但我们如何知道这些假设是否与现实相符?这就是 卡方 (\(\chi^2\)) 检验 发挥作用的地方。
在本章中,我们将学习两个强大的工具:拟合优度检验 (Goodness of Fit test)(用于检查数据是否符合特定分布)以及 列联表 (Contingency Tables)(用于检查两个因素是否相互独立)。这些检验让我们能从“我认为是这样”提升到“统计证据显示事实的确如此”。
1. 卡方拟合优度检验
拟合优度检验的目标是判断一组观测数据是否“符合”某个理论概率分布(例如二项分布、泊松分布或正态分布)。
核心逻辑
side我们会将实际观察到的数据(观测频数,\(O_i\))与假设理论正确时应看到的数据(期望频数,\(E_i\))进行比较。
如果 \(O_i\) 与 \(E_i\) 之间的差异很小,说明我们的理论很可能是正确的;如果差异巨大,则理论可能存在错误。
检验统计量
标准检验统计量的计算公式如下:
\( \chi^2 = \sum \frac{(O_i - E_i)^2}{E_i} \)
其中:
- \(O_i\) = 第 \(i\) 类别的观测频数
- \(E_i\) = 第 \(i\) 类别的期望频数
操作步骤
- 建立假设:
\(H_0\):数据符合指定的分布。
\(H_1\):数据不符合指定的分布。 - 计算期望频数: 将总观测次数 (\(n\)) 乘以落入该类别的概率 (\(p_i\))。即 \(E_i = n \times p_i\)。
- 检查“5 之规则”: 为了使卡方检验有效,每个期望频数 \(E_i\) 应至少为 5。如果某个 \(E_i\) 小于 5,你必须将相邻的类别进行 合并 (group),直到新的合并 \(E_i\) 达到 5 或以上。
- 计算统计量: 对所有(可能已合并的)类别求和算出 \( \frac{(O_i - E_i)^2}{E_i} \)。
- 确定自由度 (df): 这是最容易失分的地方!
\(df = k - 1 - p \)
其中 \(k\) 是(合并后的)类别数量,而 \(p\) 是为了计算期望值而必须从数据中估算的参数数量。 - 与临界值比较: 如果计算出的 \(\chi^2\) 大于显著性水平(通常为 5%)下的查表临界值,我们则 拒绝 \(H_0\)。
小贴士:如果题目直接给出了参数(例如“检验此数据是否符合 \(\lambda = 2\) 的泊松分布”),则 \(p = 0\)。如果你需要利用数据的平均值自己计算 \(\lambda\),则 \(p = 1\)。
2. 列联表(独立性检验)
精算师经常需要知道两个分类变量是否相关。例如,“吸烟状况”(吸烟者/非吸烟者)是否与“保单失效”(失效/有效)相互独立?我们可以使用 双向列联表 (two-way contingency table) 来找出答案。
独立性检验的假设
\(H_0\):两个分类标准是相互独立的。
\(H_1\):两个分类标准不是相互独立的(存在关联)。
计算表格中的期望频数
在一个有 \(r\) 行和 \(c\) 列的表格中,我们假设独立的前提下计算每个单元格的期望频数:
\( E_{ij} = \frac{\text{该行总计} \times \text{该列总计}}{\text{总样本量}} \)
列联表的自由度
对于列联表,自由度始终为:
\(df = (r - 1) \times (c - 1) \)
例子:一个 \(3 \times 2\) 的表格,其自由度为 \((3-1) \times (2-1) = 2 \times 1 = 2\)。
快速回顾:比较表
| 特性 | 拟合优度检验 | 列联表 |
|---|---|---|
| 目的 | 数据是否符合特定分布? | 两个变量是否独立? |
| 自由度 (df) | \(k - 1 - p\) | \((r - 1)(c - 1)\) |
| 合并类别 | 若 \(E_i < 5\),合并类别。 | 若 \(E_{ij} < 5\),合并行/列。 |
3. 实务操作的重要考虑事项
“5 之规则”与合并类别
如果你因为期望值太小而必须合并类别,请记住这会 减少 你的自由度。
例子: 如果你原本有 6 个类别 (\(k=6\)),但必须将最后两个合并为一个,那么新的 \(k\) 就是 5。计算自由度时必须使用这个新的 \(k\)。
结果解读
如果计算出的 \(\chi^2\) 非常小,意味着观测数据与预期非常接近,我们 不能拒绝 \(H_0\)。
如果计算出的 \(\chi^2\) 非常大,意味着“不吻合度”太大,无法单纯用随机误差来解释,我们 拒绝 \(H_0\)。
你知道吗?
卡方检验是一种 近似 (approximate) 检验。随着样本量增加,它会变得越精确。这就是为什么我们有“5 之规则”——它能确保这种近似对于精算决策来说足够可靠。
4. 应避免的常见错误
- 忘记扣除估算参数: 在拟合优度检验中,如果你计算了平均值 (\(\bar{x}\)) 并将其作为泊松分布的 \(\lambda\),你 必须 在自由度中额外减去 1。
- 错误地用 \(O_i\) 来判断“5 之规则”: 只有 期望 频数才对合并规则有影响。即使观测频数小于 5 也没问题。
- 计算错误: 在计算 \( \frac{(O-E)^2}{E} \) 时很容易产生输入错误。请务必仔细复核你的数值表。
- 列联表自由度错误: 学生常会对列联表误用 \(n-1\)。请记住始终使用 \((r-1)(c-1)\)。
重点归纳
1. 检验统计量: 始终是 \( \sum \frac{(O-E)^2}{E} \)。
2. 拟合优度自由度: \( (\text{类别数量}) - 1 - (\text{估算参数数量}) \)。
3. 独立性检验自由度: \( (r-1)(c-1) \)。
4. 低频数处理: 若 \(E < 5\),则合并类别。
5. P 值: 在 Paper B (R 语言) 中,你会使用 chisq.test() 函数,它会自动为你处理计算并提供 p 值。如果 p 值小于 \(\alpha\)(例如 0.05),则拒绝 \(H_0\)。