欢迎来到广义线性模型 (GLM) 的世界!
在你的 CS1 学习旅程中,你应该已经接触过线性回归 (Linear Regression)。它是一个强大的工具,但有一个重大限制:它假设数据符合正态分布 (Normal Distribution)。但在现实世界(以及精算考试中!),数据往往没那么「听话」。例如赔款次数可能是计数(泊松分布 Poisson),或者是「有/无」类型的事件(二项分布 Binomial)。
这就是广义线性模型 (Generalised Linear Models, GLMs) 大显身手的时候!它们就像是线性回归的「强化版」,让我们能够为几乎任何类型的数据建模。如果一开始觉得这些概念有点抽象也不用担心,我们会一点一点拆解给你听。
1. 指数分布族 (The Exponential Family of Distributions)
在建立 GLM 之前,我们需确保数据来自一个特定的分布家族,称为指数分布族 (Exponential Family)。这包括正态分布、泊松分布、二项分布、伽玛分布 (Gamma) 和指数分布。
若一个分布的概率密度函数 (PDF) 或概率质量函数 (PMF) 可以写成以下特定格式,它就属于这个家族:
\( f(y; \theta, \phi) = \exp \left[ \frac{y\theta - b(\theta)}{a(\phi)} + c(y, \phi) \right] \)
公式拆解:
- \( y \):实际数据点(观测值)。
- \( \theta \) (Theta):自然参数 (Natural parameter)。它与平均值有关。
- \( \phi \) (Phi):离散参数 (Dispersion parameter)。它与方差有关(即数据的分散程度)。
- \( a, b, c \):这些函数取决于你所使用的具体分布。
为什么我们在乎这种格式?
因为如果分布符合这个「模板」,我们就可以用简单的捷径找到平均值 (Mean) 和方差 (Variance):
1. 平均值: \( E[Y] = \mu = b'(\theta) \) (\( b \) 的一阶导数)
2. 方差: \( Var(Y) = a(\phi)b''(\theta) \) (\( b \) 的二阶导数,并由 \( a \) 进行缩放)
小撇步: 在考试中,你常会被要求证明某个分布属于指数分布族。只需将 PDF/PMF 取对数,然后尝试整理成上述公式的模样即可!
重点总结: 指数分布族提供了一个统一的架构,让我们可以用同样的数学逻辑处理不同类型的数据(如赔款次数和赔款金额)。
2. GLM 的三个组成部分
每个 GLM 都由三个必要成分组成,可以把它想像成模型的「食谱」:
成分 1:随机成分 (The Random Component)
这是响应变量 \( Y \) 的概率分布。我们假设观测值是独立的,并来自指数分布族(例如用泊松分布来模拟汽车事故次数)。
成分 2:系统成分 (The Systematic Component)
这是我们的线性预测因子 (Linear Predictor),以希腊字母 eta (\( \eta \)) 表示。它是解释变量(如年龄、车型或地区)的线性组合:
\( \eta = \beta_1 x_1 + \beta_2 x_2 + ... + \beta_k x_k \)
成分 3:连接函数 (The Link Function)
这是连接平均值 (Mean, \( \mu \)) 和线性预测因子 (\( \eta \)) 的「桥梁」:
\( g(\mu) = \eta \)
情境比喻:
想像你正试图根据音乐音量来预测参加派对的人数。
- 随机成分是参加派对的实际人数(计数)。
- 系统成分是音乐的音量。
- 连接函数就是把音量转换成人数的「氛围机制」。它确保即便你把音乐调到「100」,模型也不会预测出负数人数(这是不可能的!)。
重点总结: GLM = 分布 + 线性预测因子 + 连接函数。
3. 常见的连接函数
连接函数 \( g(\mu) \) 至关重要,因为它确保模型保持在合理的范围内。例如,概率必须介于 0 和 1 之间。
- 恒等连接 (Identity Link): \( \eta = \mu \)。 (用于标准正态回归)。
- 对数连接 (Log Link): \( \eta = \ln(\mu) \)。 (常用于泊松数据,确保 \( \mu > 0 \))。
- Logit 连接 (Logit Link): \( \eta = \ln \left( \frac{\mu}{1-\mu} \right) \)。 (二项数据/概率的标准选择)。
你知道吗? 每个分布都有一个正则连接 (Canonical Link)。这是一种特殊的连接函数,其中 \( \eta = \theta \)。使用正则连接会使电脑在计算时简化许多数学过程!
4. 参数估计与「离差」(Deviance)
我们如何找到 \( \beta \) 系数的最佳值?在 GLM 中,我们使用最大似然估计法 (Maximum Likelihood Estimation, MLE)。我们不是通过最小化「误差平方和」(像普通最小二乘法 OLS 那样),而是寻找让观测数据出现概率最大的系数值。
什么是离差 (Deviance)?
在标准回归中,我们谈论的是「残差平方和」。在 GLM 中,我们则谈论离差 (Deviance)。
离差是用来衡量模型偏离「完美模型」(称为饱和模型 Saturated Model)的程度。
- 低离差 = 拟合良好。
- 高离差 = 拟合不佳。
常见错误: 不要把离差 (Deviance) 和缩放离差 (Scaled Deviance) 搞混了。缩放离差会调整离散参数 \( \phi \)。在泊松和二项分布中,由于 \( \phi = 1 \),两者是相同的!
复习箱:
- 饱和模型 (Saturated Model): 一个完美的模型,为每个数据点都设定一个参数。
- 虚无模型 (Null Model): 一个简单模型,假设所有数据点都有相同的平均值(无解释变量)。
- 你的模型: 介于两者之间。
5. 检查模型是否有效(残差分析)
建立模型后,你需要检查剩下的部分——即残差 (Residuals)。如果模型是好的,残差看起来应该像随机噪声。
- 皮尔逊残差 (Pearson Residuals): 这类似于「标准化」误差。我们计算实际值与预测值的差,再除以标准差。
- 离差残差 (Deviance Residuals): 这比较复杂,但在 GLM 中更受偏好。它们代表每个单独观测值对总离差的贡献。
重点总结: 如果你绘制残差图并看到特定规律(例如「U」型),说明你的模型漏掉了重要的信息!
6. 模型选择:哪一个比较好?
通常你需要比较两个模型。例如:「加入『驾驶年龄』真的能让我的保险模型更好吗?」
- 似然比检验 (Likelihood Ratio Test, LRT): 用于比较嵌套 (nested) 模型(即其中一个是另一个的简化版)。检验统计量为 \( 2 \times (\ln L_{big} - \ln L_{small}) \),它服从卡方分布 (Chi-square distribution)。
- AIC (Akaike Information Criterion): 一种「公平性」评分。它奖励拟合度良好的模型,但会惩罚加入过多不必要变量的模型。AIC 越低越好!
总结与最后的鼓励
GLM 是现代精算工作的基石。通过超越简单的直线和正态分布,你可以准确地模拟现实世界中的风险,如保险赔款频率和严重程度。
记住核心步骤:
1. 检查分布是否属于指数分布族。
2. 选择你的连接函数。
3. 使用 MLE 求出系数。
4. 检查离差 (Deviance) 和 AIC 来确认模型品质。
如果一开始觉得指数分布族的代数处理很困难,请别担心。只要多练习推导几次泊松和二项分布的 PDF,这些就会变成你的本能!你可以的!