简介:寻找“最佳”模型

在之前的章节中,我们探讨了广义线性模型 (GLMs) 的基本组成部分:指数族 (exponential family)、链接函数 (link functions) 和线性预测值 (linear predictors)。现在,我们进入了流程中的“决策”阶段。我们实际上是如何计算模型的参数呢?而当我们建立了一个模型后,又该如何判断它是否真的理想,或者另一个模型会否更好?

把这一章看作精算建模中的质量控制 (quality control) 阶段。我们将学习如何估计参数的“最佳”数值,并利用一个名为偏差 (Deviance) 的强大工具来比较不同的模型。如果一开始觉得数学公式很晦涩,别担心;我们会将其拆解成逻辑清晰的步骤,即使是对数学感到畏惧的同学也能轻松跟上。


1. 估计参数:极大似然法

在简单线性回归中,我们通常使用“最小二乘法”(Least Squares) 来寻找最佳拟合线。在 GLM 中,我们使用一种更通用的方法,称为极大似然估计 (Maximum Likelihood Estimation, MLE)

核心概念

MLE 的目标是寻找一组参数值(线性预测值中的 \(\beta\) 系数),使得我们实际观测到的数据出现的可能性 (likelihood) 最大

想象你有一个装有红球和蓝球的桶子。如果你抽出了 10 个球,其中 9 个是红色的,那么你对红球比例的“极大似然估计”就是 0.9。在 GLM 中,我们做的是同样的事情,只是涉及的公式和分布(如泊松分布 Poisson 或伽马分布 Gamma)更为复杂。

操作步骤:

  1. 写出似然函数 (Likelihood Function) \(L\),它代表在给定参数下,数据出现的联合概率。
  2. 由于数学计算上的便利,我们会取自然对数得到对数似然函数 (Log-likelihood) \(\ell = \ln(L)\)。
  3. 寻找令 \(\ell\) 最大化的 \(\beta\) 值。在实际操作中,由于通常没有简单的“一步到位”公式,这会由电脑软件(如 R)通过迭代程序 (iterative process) 来完成。

快速复习: 在考试中,你通常不需要手动进行这些迭代计算,但你必须理解参数 \(\beta\) 的选择是为了让观测数据的对数似然值最大化。


2. 理解偏差 (Deviance):“拟合欠佳度”

在标准回归中,我们会讨论“残差平方和”(Residual Sum of Squares) 来查看模型与数据的偏离程度。在 GLM 中,我们则使用偏差 (Deviance)

重要概念: 偏差是一种衡量距离的指标。具体来说,它衡量的是我们的拟合模型与“完美”模型之间的距离。

饱和模型 vs. 拟合模型

为了理解偏差,我们会比较两个模型:

  • 饱和模型 (The Saturated Model, \(S\)): 一个理论上的模型,能完美拟合数据。它的参数数量与数据点的数量一样多。它能解释 100% 的变动,但对于预测来说毫无用处,因为它只是“死记硬背”了噪声 (noise)。
  • 拟合模型 (The Fitted Model, \(M\)): 我们实际测试的模型,使用较少的参数来尝试捕捉底层的趋势。

相关公式

偏差 (\(D\)) 的定义为:

\(D = 2(\ell(S) - \ell(M))\)

其中:

  • \(\ell(S)\) 是饱和模型的对数似然值。
  • \(\ell(M)\) 是我们拟合模型的对数似然值。

调整偏差 (Scaled Deviance, \(D^*\)): 有时我们需要考虑分布的“尺度参数” (\(\phi\))(例如正态分布中的方差)。公式为:

\(D^* = \frac{D}{\phi}\)

核心重点: 由于我们希望模型尽可能接近“完美”,因此偏差越低,代表拟合效果越好。


3. 模型选择:偏差分析

精算师经常要在简单模型(变量较少)和复杂模型(变量较多)之间做出选择。我们使用一种称为偏差分析 (Analysis of Deviance) 的程序来决定增加的复杂性是否值得。

嵌套模型 (Nested Models)

这种方法适用于模型之间存在嵌套关系的情况。这意味着模型 1 是模型 2 的简化版本(例如,模型 2 包含了模型 1 的所有变量,再加上一个额外的变量)。

似然比检验 (Likelihood Ratio Test, LRT)

为了查看模型 2 中的额外变量是否真的有用,我们计算两者偏差的差值:

\(\text{Test Statistic} = D_1 - D_2\)

(如果使用调整偏差,则为 \(D_1^* - D_2^*\))

规则: 如果模型拟合良好,这个差值大约服从卡方 (\(\chi^2\)) 分布
\(\text{自由度 (df)} = \text{模型 2 中额外参数的数量}\)

决策步骤:

  1. 计算偏差的减少量:\(D_1 - D_2\)。
  2. 使用参数数量的差值作为自由度 (\(df\)),查阅 \(\chi^2\) 分布表。
  3. 如果减少量大于临界值(或者 p-值很小,通常 \(< 0.05\)),那么额外的变量具有统计显著性。保留复杂模型!
  4. 如果减少量很小,则额外变量提供的价值不大。应坚持使用简单模型(简约原则 Parsimony)。

类比:想象给汽车加装一个华丽的尾翼。如果汽车没有因此跑得更快(偏差减少量很小),那么尾翼只是额外的重量。保持汽车设计简约吧!


4. 检验参数显著性

在比较两个大型模型之前,我们通常会先观察单个参数。当你查看软件输出(如在 Paper B 中)时,你会看到每个系数 (\(\beta\)) 的 p-值 (p-value)

  • 原假设 (\(H_0\)): 参数 \(\beta_i = 0\)(意即该变量没有影响)。
  • 备择假设 (\(H_1\)): 参数 \(\beta_i \neq 0\)。

If p-值非常小(通常 \(p < 0.05\)),我们拒绝 \(H_0\)。这告诉我们该变量是一个显著的预测因子,应保留在模型中。


5. 实务解读(Paper B 重点)

在考试中,题目可能会给你一个关于“索赔次数”(泊松分布 Poisson) 或“索赔金额”(伽马分布 Gamma) 的 GLM 拟合结果表。以下是需要留意的重点:

1. 空偏差 (Null Deviance): 没有解释变量(只有截距项)时模型的偏差。这是你的起点。

2. 残差偏差 (Residual Deviance): 加入变量后模型的偏差。你希望它明显低于空偏差。

3. AIC (Akaike 信息准则): 你可能会在软件输出中看到这个指标。它类似于偏差,但会对增加过多变量进行“惩罚”。AIC 越低越好。

你知不知道? “简约原则”(Parsimony) 一词在精算学中经常被使用。它源于“奥卡姆剃刀”(Occam's Razor) 原则——如果两个模型对数据的解释能力不相上下,通常选择较简单的模型对未来预测会更好。


快速复习方块

极大似然法 (Maximum Likelihood): 用于寻找最佳 \(\beta\) 值的方法。

偏差 (Deviance): 衡量“拟合欠佳度”。越低 = 拟合越好。

饱和模型 (Saturated Model): 作为基准的“完美”但过度拟合的模型。

似然比检验 (Likelihood Ratio Test): 使用 \(D_1 - D_2 \sim \chi^2_k\) 来比较嵌套模型。

显著变量: 寻找较小的 p-值 (\(< 0.05\)) 以证明保留变量的合理性。

别担心这些概念起初看起来很棘手!关键是要记住,我们总是在良好的拟合度(低偏差)与模型的简约性(参数较少)之间寻求平衡。