残差分析与模型验证简介

欢迎来到“回归理论及应用”章节中最具实用价值的内容之一!到目前为止,你已经学习了如何拟合简单线性回归和广义线性模型 (GLM)。但我们该如何判断所建立的模型是否真的好用呢?

把建立模型想象成裁制一套西装:你会先测量尺寸(拟合模型),但随后你必须亲自试穿并照照镜子,看看哪里太紧或哪里太宽。残差分析就是那个“照镜子”的检查过程。我们会观察“剩余的部分”(即残差),看看模型是否遗漏了数据中的任何重要模式。

在本章中,我们将学习如何利用残差来验证模型,确保模型在进行精算预测时准确可靠。


1. 什么是残差?

残差(Residual)简单来说,就是实际发生的情况(观测值)与模型预测结果(预测值)之间的差异。

对于特定的观测值 \(i\),残差 \(e_i\) 的计算方式如下:

\(e_i = y_i - \hat{y}_i\)

其中:

\(y_i\) = 响应变量(Response variable)的观测值。
\(\hat{y}_i\) = 模型算出的预测值(或称拟合值,Fitted value)。

最终目标:如果模型是完美的,残差应该看起来像“白噪声”(White noise)——完全随机且没有任何可辨识的规律。如果我们发现了某种模式,就代表模型“漏掉”了一些信息。


2. 线性回归中的残差分析

在标准线性回归模型中,我们对误差项 (\(\epsilon\)) 有几项基本假设。我们利用残差来检查这些假设在现实中是否成立。

A. 检查线性(Linearity)与常数方差(Constant Variance)

我们通常会将残差 (\(e_i\)) 放在 y 轴,将拟合值 (\(\hat{y}_i\)) 放在 x 轴进行绘图。

观察重点:

  • 随机分布的“点云”: 这是理想情况!这表示变量之间具备线性关系,且方差是常数(即具备同方差性 homoscedasticity)。
  • “漏斗”形状: 如果点云随着拟合值的增加而变得愈来愈宽,代表方差并非定值。这称为异方差性(heteroscedasticity)
  • 曲线模式(U 形): 这表示变量之间的关系并非直线,我们可能需要加入非线性项(例如 \(x^2\))。

B. 检查正态性(Normality)

在 CS1 课程中,我们通常假设残差服从正态分布,具体为 \(e_i \sim N(0, \sigma^2)\)。为了检查这一点,我们会使用 Q-Q 图(分位数图)。

小贴士:在 Q-Q 图上,如果点大致落在对角直线上,则满足正态性假设。如果线的两端显著弯曲,数据可能存在“肥尾”(Fat tails)或偏态(Skewed)。

C. 检查独立性(Independence)

如果数据是按时间顺序收集的,我们会按时间顺序绘制残差图。如果看到“蛇形”模式或某种趋势,说明观测值之间可能存在相关性,这违反了独立性假设。

核心要点:如果残差不是随机的,你的模型就会存在偏差或缺乏效率。这时你就需要重新审视模型的设计了!


3. 广义线性模型 (GLM) 中的残差

在 GLM 中,“原始”残差 (\(y - \hat{y}\)) 的参考价值较低,因为方差通常会随平均值改变(例如在泊松模型中,方差等于平均值)。因此,我们会使用“缩放”后的残差版本。

皮尔森残差 (Pearson Residuals)

皮尔森残差 (\(r_P\)) 是将原始残差除以分布的标准差来进行缩放:

\(r_{P,i} = \frac{y_i - \hat{\mu}_i}{\sqrt{Var(Y_i)}}\)

这种处理方式使残差标准化,让我们能更容易地在解释变量的不同数值之间进行比较。

离差残差 (Deviance Residuals)

离差残差 (\(d_i\)) 衡量每个观测值对模型总离差(Deviance)的贡献程度。离差是衡量模型与数据之间“不吻合度”的指标。

为什么要使用它? 在 GLM 中,离差残差通常比皮尔森残差更受青睐,因为它们 abrupt 的分布通常比皮尔森残差更接近正态分布,在诊断图中更容易解读。


4. 模型验证:模型是否可以接受?

观察完图表后,我们可以使用正式的统计检验来决定模型是否“可以接受”。教学大纲中强调了 GLM 的两项主要检验。

A. 皮尔森卡方检验 (Pearson’s Chi-square Test)

我们可以使用皮尔森残差的平方和来进行拟合优度检验。统计量为:

\(X^2 = \sum r_{P,i}^2\)

在模型正确的原假设下,\(X^2\) 服从卡方 (\(\chi^2\)) 分布。如果计算出的统计量远大于表中的临界值,我们就会拒绝该模型。

B. 似然比检验 (Likelihood-Ratio Test, LRT)

这用于比较两个模型:一个“虚无”模型(较简单)和一个“备选”模型(较复杂)。我们想看看增加更多的解释变量是否能显著改善拟合效果。

该检验统计量基于离差 (\(D\)):

\(LRT = D_{Simple} - D_{Complex}\)

判断法则:如果离差的降幅 (\(LRT\)) 很大,则较复杂的模型显著较优。我们会将此差异与 \(\chi^2_k\) 分布进行比较,其中 \(k\) 是额外增加的参数个数。


5. 常见陷阱与学生建议

如果起初觉得这些概念很棘手,请不要担心! 以下是应避免的一些常见陷阱:

  • 混淆“相关性”与“拟合度”: 高 \(R^2\)(判定系数)并不总是代表模型是好的。务必检查你的残差图!一个模型的 \(R^2\) 可能很高,但残差中仍可能存在非线性模式。
  • 离群值 (Outliers): 单一个“怪异”的数据点就可能将回归线拉离其余数据。残差图能帮你识别这些离群值——它们会是那些远离零线的点。
  • Paper B (R 语言) 小贴士: 在 R 中,你经常会使用 plot(model_name) 命令。这会自动生成四张诊断图,包括“残差对拟合值图”和“正态 Q-Q 图”。试着练习用自己的语言来描述这些图表!

你知道吗?“残差”(Residual) 一词源自拉丁语 residuum,意为“剩余的东西”。在精算学中,我们希望“剩余”下来的东西纯粹只是无法预测的随机偶然!


总结清单

1. 残差: \(y - \hat{y}\)。它们应该看起来是随机的。

2. 线性回归检查: 使用图表检查线性、常数方差(同方差性)和正态性。

3. GLM 残差: 了解皮尔森残差(按方差标准化)与离差残差(对总拟合度的贡献)之间的区别。

4. 验证检验: 使用皮尔森卡方检验似然比检验来正式决定模型是否可接受,或者是否需要更复杂的模型。