简介:你的模型真的好用吗?
既然你已经选好了分布、挑选了连接函数,并让软件(如 R)帮你好计算了广义线性模型 (GLM) 的参数,恭喜你!但在你开始用这个模型来预测保险索赔或死亡率之前,你必须问一个关键问题:这个模型真的契合数据吗?
在本章中,我们将探讨精算界的“诊断工具”。就像医生使用验血和 X 光来检查病人的健康状况一样,我们使用残差 (residuals) 和统计检验 (statistical tests) 来检查模型的健康状况。我们需要确保模型确实捕捉到了数据中的模式,而不仅仅是看到了“噪声”。
注:本章假设你已熟悉 GLM 的基础知识,例如线性预测量 (linear predictor) 和连接函数 (link function),这些内容已在回归章节的前几部分中涵盖。
1. GLM 残差:模型剩余的“残渣”
在简单线性回归中,残差只是观测值与预测值之间的差异:\(y_i - \hat{y}_i\)。然而,在 GLM 中情况会复杂一些,因为数据的方差 (variance) 通常会随平均值而改变(例如在泊松分布 (Poisson distribution) 中,方差等于平均值)。
为了考虑到这一点,我们在 GLM 中使用两种特定类型的残差:
A. Pearson 残差 (Pearson Residuals)
Pearson 残差本质上是原始误差的“标准化”版本。它将原始残差除以观测值的估计标准差。
第 \(i\) 个 Pearson 残差的公式为:
\(r_i = \frac{y_i - \hat{\mu}_i}{\sqrt{V(\hat{\mu}_i)}}\)
其中:
\(y_i\) 是实际观测值。
\(\hat{\mu}_i\) 是我们模型预测的值。
\(V(\hat{\mu}_i)\) 是方差函数 (variance function)(取决于我们选择的分布,如泊松分布或 Gamma 分布)。
小贴士:如果你将所有 Pearson 残差平方并求和,你就会得到 Pearson 卡方统计量 (\(X^2\)),我们用它来测试模型的拟合优度!
B. 离差残差 (Deviance Residuals)
精算师通常更偏好离差残差,因为它们直接与模型的“似然 (likelihood)”相关。它们衡量每个单独观测值对总离差 (deviance)(即“拟合不良程度”的衡量指标)的贡献。
虽然公式比较复杂,但重要的是要记住,它们通常比 Pearson 残差更接近“正态分布”,因此非常适合用于可视化检查。
我们如何使用这些残差?
我们通常会将这些残差绘制成图表。如果我们的模型“拟合良好”,我们预期会看到:
1. 残差随机散布在零的周围。
2. 没有明显的模式(例如“漏斗状”或曲线)。
3. 没有极端的离群值 (outliers)(距离零非常远的点)。
重点总结:残差告诉我们模型在哪些地方失败了。如果你发现“年轻驾驶者”的所有残差都是正数,那代表你的模型一直低估了他们的风险!
2. 模型可接受性的统计检验
可视化检查固然好,但有时我们需要一个明确的“是/否”答案。我们使用两个主要的统计检验来确定 GLM 是否可以被接受。
A. 似然比检验 (Likelihood-Ratio Test, LRT)
当我们想要比较两个模型时,会使用似然比检验:一个是“小”模型(变量较少),另一个是“大”模型(同样的模型但增加了额外的变量)。
核心问题:那些额外的变量真的有帮助吗?还是它们只是增加了“噪声”?
检验统计量:
\(LRT = 2 \times (l_{big} - l_{small})\)
其中 \(l\) 代表模型的对数似然值 (log-likelihood)。
若以离差 (Deviance, \(D\)) 表示,通常写作:
\(LRT = D_{small} - D_{big}\)
分布状况:在原假设(即额外变量无用)下,此统计量服从卡方 (\(\chi^2\)) 分布,其自由度等于增加的参数数量。
决策准则:如果 \(LRT\) 值非常大(高于卡方分布表中的临界值),我们就拒绝原假设。这意味着较大的模型显著地更好!
B. Pearson 卡方检验 (Pearson’s Chi-square Test)
此检验检查模型的整体适用性。它问的是:“我的数据与模型之间的总体差异,是否小到可以用随机机会来解释?”
检验统计量:
\(X^2 = \sum \frac{(y_i - \hat{\mu}_i)^2}{V(\hat{\mu}_i)}\)
进行比较:我们将 \(X^2\) 与自由度为 \(n - p\) 的 \(\chi^2\) 分布进行比较(其中 \(n\) 是观测值数量,\(p\) 是模型中的参数数量)。
你知道吗?对于一个拟合良好的模型,标度离差 (scaled deviance) 和 Pearson 卡方统计量都应该大约等于自由度 (\(n - p\))。如果它们远大于自由度,你的模型可能存在“过度离散 (over-dispersion)”的问题(即数据的散布程度比模型预期的要大)。
3. 解读软件输出结果(Paper B 重点)
在 CS1B 考试中,你很可能会使用 R 来拟合 GLM。当你执行 summary(my_model) 之类的指令时,你需要知道该看哪里:
- Null Deviance(零离差):仅含“常数项”的模型拟合程度(最坏的情况)。
- Residual Deviance(残差离差):你的模型拟合程度。你希望这个值显著低于 Null Deviance。
- AIC (Akaike Information Criterion,赤池信息量准则):一个“金发姑娘”式的衡量标准(恰到好处)。它会奖励拟合良好的模型,但会惩罚拥有过多变量的模型。AIC 越低越好!
- 系数的 p 值 (p-values for coefficients):如果某个变量的 p 值 \( < 0.05\),该变量通常被认为具有“统计显著性”。
要避免的常见错误:不要只看 p 值!一个模型可能拥有显著的变量,但整体而言仍然“拟合不良”。务必同时检查残差和总离差。
快速复习:模型可接受性“清单”
在评估 GLM 时,请遵循以下步骤:
- 检查残差:它们是随机分布的吗?有离群值吗?使用 Pearson 或离差残差。
- 比较离差:使用似然比检验来判断增加变量是否值得。
- 检查显著性:各个参数 (\(\beta\)) 是否显著地不等于零?
- 整体拟合度:使用 Pearson 卡方检验来检查整体模型是否可以接受。
- 比较 AIC:如果你有两个不同的模型,通常偏好 AIC 较低 的那一个。
重点总结:没有模型是完美的!我们的目标不是寻找一个完美的模型,而是寻找一个有用且在统计上站得住脚的模型。正如统计学中的名言所说:“所有模型都是错误的,但有些是有用的。”