简介:寻找“最佳”模型
在之前的章节中,我们探讨了广义线性模型 (GLMs) 的基本组成部分:指数族 (exponential family)、链接函数 (link functions) 和线性预测值 (linear predictors)。现在,我们进入了流程中的“决策”阶段。我们实际上是如何计算模型的参数呢?而当我们建立了一个模型后,又该如何判断它是否真的理想,或者另一个模型会否更好?
把这一章看作精算建模中的质量控制 (quality control) 阶段。我们将学习如何估计参数的“最佳”数值,并利用一个名为偏差 (Deviance) 的强大工具来比较不同的模型。如果一开始觉得数学公式很晦涩,别担心;我们会将其拆解成逻辑清晰的步骤,即使是对数学感到畏惧的同学也能轻松跟上。
1. 估计参数:极大似然法
在简单线性回归中,我们通常使用“最小二乘法”(Least Squares) 来寻找最佳拟合线。在 GLM 中,我们使用一种更通用的方法,称为极大似然估计 (Maximum Likelihood Estimation, MLE)。
核心概念
MLE 的目标是寻找一组参数值(线性预测值中的 \(\beta\) 系数),使得我们实际观测到的数据出现的可能性 (likelihood) 最大。
想象你有一个装有红球和蓝球的桶子。如果你抽出了 10 个球,其中 9 个是红色的,那么你对红球比例的“极大似然估计”就是 0.9。在 GLM 中,我们做的是同样的事情,只是涉及的公式和分布(如泊松分布 Poisson 或伽马分布 Gamma)更为复杂。
操作步骤:
- 写出似然函数 (Likelihood Function) \(L\),它代表在给定参数下,数据出现的联合概率。
- 由于数学计算上的便利,我们会取自然对数得到对数似然函数 (Log-likelihood) \(\ell = \ln(L)\)。
- 寻找令 \(\ell\) 最大化的 \(\beta\) 值。在实际操作中,由于通常没有简单的“一步到位”公式,这会由电脑软件(如 R)通过迭代程序 (iterative process) 来完成。
快速复习: 在考试中,你通常不需要手动进行这些迭代计算,但你必须理解参数 \(\beta\) 的选择是为了让观测数据的对数似然值最大化。
2. 理解偏差 (Deviance):“拟合欠佳度”
在标准回归中,我们会讨论“残差平方和”(Residual Sum of Squares) 来查看模型与数据的偏离程度。在 GLM 中,我们则使用偏差 (Deviance)。
重要概念: 偏差是一种衡量距离的指标。具体来说,它衡量的是我们的拟合模型与“完美”模型之间的距离。
饱和模型 vs. 拟合模型
为了理解偏差,我们会比较两个模型:
- 饱和模型 (The Saturated Model, \(S\)): 一个理论上的模型,能完美拟合数据。它的参数数量与数据点的数量一样多。它能解释 100% 的变动,但对于预测来说毫无用处,因为它只是“死记硬背”了噪声 (noise)。
- 拟合模型 (The Fitted Model, \(M\)): 我们实际测试的模型,使用较少的参数来尝试捕捉底层的趋势。
相关公式
偏差 (\(D\)) 的定义为:
\(D = 2(\ell(S) - \ell(M))\)
其中:
- \(\ell(S)\) 是饱和模型的对数似然值。
- \(\ell(M)\) 是我们拟合模型的对数似然值。
调整偏差 (Scaled Deviance, \(D^*\)): 有时我们需要考虑分布的“尺度参数” (\(\phi\))(例如正态分布中的方差)。公式为:
\(D^* = \frac{D}{\phi}\)
核心重点: 由于我们希望模型尽可能接近“完美”,因此偏差越低,代表拟合效果越好。
3. 模型选择:偏差分析
精算师经常要在简单模型(变量较少)和复杂模型(变量较多)之间做出选择。我们使用一种称为偏差分析 (Analysis of Deviance) 的程序来决定增加的复杂性是否值得。
嵌套模型 (Nested Models)
这种方法适用于模型之间存在嵌套关系的情况。这意味着模型 1 是模型 2 的简化版本(例如,模型 2 包含了模型 1 的所有变量,再加上一个额外的变量)。
似然比检验 (Likelihood Ratio Test, LRT)
为了查看模型 2 中的额外变量是否真的有用,我们计算两者偏差的差值:
\(\text{Test Statistic} = D_1 - D_2\)
(如果使用调整偏差,则为 \(D_1^* - D_2^*\))
规则: 如果模型拟合良好,这个差值大约服从卡方 (\(\chi^2\)) 分布。
\(\text{自由度 (df)} = \text{模型 2 中额外参数的数量}\)
决策步骤:
- 计算偏差的减少量:\(D_1 - D_2\)。
- 使用参数数量的差值作为自由度 (\(df\)),查阅 \(\chi^2\) 分布表。
- 如果减少量大于临界值(或者 p-值很小,通常 \(< 0.05\)),那么额外的变量具有统计显著性。保留复杂模型!
- 如果减少量很小,则额外变量提供的价值不大。应坚持使用简单模型(简约原则 Parsimony)。
类比:想象给汽车加装一个华丽的尾翼。如果汽车没有因此跑得更快(偏差减少量很小),那么尾翼只是额外的重量。保持汽车设计简约吧!
4. 检验参数显著性
在比较两个大型模型之前,我们通常会先观察单个参数。当你查看软件输出(如在 Paper B 中)时,你会看到每个系数 (\(\beta\)) 的 p-值 (p-value)。
- 原假设 (\(H_0\)): 参数 \(\beta_i = 0\)(意即该变量没有影响)。
- 备择假设 (\(H_1\)): 参数 \(\beta_i \neq 0\)。
If p-值非常小(通常 \(p < 0.05\)),我们拒绝 \(H_0\)。这告诉我们该变量是一个显著的预测因子,应保留在模型中。
5. 实务解读(Paper B 重点)
在考试中,题目可能会给你一个关于“索赔次数”(泊松分布 Poisson) 或“索赔金额”(伽马分布 Gamma) 的 GLM 拟合结果表。以下是需要留意的重点:
1. 空偏差 (Null Deviance): 没有解释变量(只有截距项)时模型的偏差。这是你的起点。
2. 残差偏差 (Residual Deviance): 加入变量后模型的偏差。你希望它明显低于空偏差。
3. AIC (Akaike 信息准则): 你可能会在软件输出中看到这个指标。它类似于偏差,但会对增加过多变量进行“惩罚”。AIC 越低越好。
你知不知道? “简约原则”(Parsimony) 一词在精算学中经常被使用。它源于“奥卡姆剃刀”(Occam's Razor) 原则——如果两个模型对数据的解释能力不相上下,通常选择较简单的模型对未来预测会更好。
快速复习方块
极大似然法 (Maximum Likelihood): 用于寻找最佳 \(\beta\) 值的方法。
偏差 (Deviance): 衡量“拟合欠佳度”。越低 = 拟合越好。
饱和模型 (Saturated Model): 作为基准的“完美”但过度拟合的模型。
似然比检验 (Likelihood Ratio Test): 使用 \(D_1 - D_2 \sim \chi^2_k\) 来比较嵌套模型。
显著变量: 寻找较小的 p-值 (\(< 0.05\)) 以证明保留变量的合理性。
别担心这些概念起初看起来很棘手!关键是要记住,我们总是在良好的拟合度(低偏差)与模型的简约性(参数较少)之间寻求平衡。