简介:构建广义线性模型 (GLM)
在我们之前学习简单和多元线性回归时,我们假设响应变量服从正态分布 (Normal distribution),且平均响应值是解释变量的直接线性组合。然而,在保险精算的现实世界中,数据很少会如此“听话”。我们经常要处理索赔次数(不能为负数)或索赔概率(必须介于 0 与 1 之间)。
这正是广义线性模型 (GLM) 大显身手的地方!在本章中,我们将学习 GLM 的“引擎”:线性预测项 (linear predictor),以及连接它与数据的“桥梁”:链接函数 (link function)。我们还会探讨如何处理不同类型的数据,例如类别(因子/因子)以及变量之间互相影响的情况。如果起初觉得这些概念很抽象,请不用担心;只要看清了它的结构,一切就像拼图一样自然衔接起来!
1. 线性预测项 \(\eta\)
线性预测项通常用希腊字母 eta \(\eta\) 表示,是模型中捕捉解释变量影响的部分。它是未知参数 (\(\beta\)) 与观测变量的线性组合。
对于一组解释变量 \(x_1, x_2, ..., x_k\),第 \(i\) 个观测值的线性预测项写作:
\(\eta_i = \beta_0 + \beta_1 x_{i1} + \beta_2 x_{i2} + ... + \beta_k x_{ik}\)
线性预测项的形式
线性预测项非常灵活。根据问题的不同,它可以有几种形式:
- 简单线性模型: \(\eta = \beta_0 + \beta_1 x\) (直线关系)。
- 多项式模型: \(\eta = \beta_0 + \beta_1 x + \beta_2 x^2\) (用于关系呈曲线的情况,但在参数 \(\beta\) 方面它仍是“线性”的)。
- 包含因子的模型: 如果我们观察不同的组别(例如“吸烟者”与“非吸烟者”),预测项会根据观测值所属的组别而改变。
重点归纳: 尽管变量与响应值之间的关系可能是曲线(如多项式),但该模型仍被称为“线性”,因为它是参数 (\(\beta_i\)) 的线性总和。
2. 链接函数 \(g(\mu)\)
在标准线性模型中,我们假设平均响应值 \(\mu = E[Y]\) 等于线性预测项 \(\eta\)。在 GLM 中,我们使用链接函数 \(g(\cdot)\) 将它们连接起来:
\(g(\mu_i) = \eta_i\)
为什么要这样做?想象你在预测汽车保险索赔的概率。概率必须介于 0 和 1 之间。如果我们使用简单线性模型,预测结果可能是 1.5 或 -0.2,这是不可能的!链接函数将均值的范围(例如 0 到 1)映射到线性预测项的范围(负无穷大到正无穷大)。
标准链接函数 (The Canonical Link Function)
指数族 (exponential family) 中的每种分布都有一个源于其数学结构的“自然”链接函数,称为标准链接函数。虽然你也可以使用其他链接函数,但在 CS1 考试中,以下这些非常常见:
正态分布 (Normal Distribution): 恒等链接 (Identity link) \(\implies g(\mu) = \mu\)
泊松分布 (Poisson Distribution): 对数链接 (Log link) \(\implies g(\mu) = \ln(\mu)\)
二项分布 (Binomial Distribution): Logit 链接 (Logit link) \(\implies g(\mu) = \ln(\frac{\mu}{1-\mu})\)
伽马 / 指数分布 (Gamma / Exponential Distributions): 倒数链接 (Reciprocal link) \(\implies g(\mu) = \frac{1}{\mu}\)
注:有关指数族的更多信息,请参阅“指数族、方差函数与尺度参数”章节。
3. 变量与因子 (Variables vs. Factors)
在精算建模中,我们使用两种主要的解释输入:
连续变量 (Continuous Variables)
这些是可以取某个范围内任何数值的数值测量。
例子: 保单持有人的年龄、人寿保单的保额或汽车的发动机排量。
因子 / 类别变量 (Factors / Categorical Values)
因子代表定性的分组。它们具有离散的“水平”(levels)。
例子: 性别(男、女)、地区(北、南、东、西)或燃料类型(汽油、柴油、电力)。
“基准水平”的小贴士: 当我们在 GLM 中加入一个有 \(k\) 个水平的因子时,通常不会创建 \(k\) 个参数。相反,我们会选择一个水平作为基准水平 (base level / reference level),并创建 \(k-1\) 个哑变量 (dummy variables)。其他水平的参数则代表该水平与基准水平之间的差异。
常见错误: 忘记排除基准水平的参数!如果你有 3 个地区并包含 3 个参数外加一个截距,模型便会出错(这被称为“完全共线性”perfect collinearity)。如果存在截距 \(\beta_0\),对于有 \(k\) 个水平的因子,务必只使用 \(k-1\) 个参数。
4. 交互作用项 (Interaction Terms)
有时候,一个变量的影响取决于另一个变量的水平。这被称为交互作用。
现实例子: 假设我们正在为医疗保险索赔风险建模。“年龄”和“吸烟状况”都很重要。然而,吸烟带来的额外风险,对于 60 岁的人可能比对于 20 岁的人高得多。这种“额外”的综合效应就是交互作用。
在数学上,我们通过在线性预测项中将两个变量相乘来表示交互作用:
\(\eta = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \beta_{12}(x_1 \cdot x_2)\)
其中 \((x_1 \cdot x_2)\) 就是交互作用项。
快速复习:GLM 的组成部分
1. 随机部分 (Random Component): 响应变量 \(Y\) 的分布(例如泊松分布)。
2. 系统部分 (Systematic Component): 线性预测项 \(\eta = \sum \beta_i x_i\)。
3. 链接函数 (Link Function): 连接两者的函数 \(g(\mu) = \eta\)。
5. 按部就班:构建预测项
当你在考试中被要求写出线性预测项的形式时,请遵循以下步骤:
- 确定截距: 通常是 \(\beta_0\)。
- 加入连续变量: 为每个变量加入如 \(\beta_i x_i\) 的项。
- 加入因子: 确定水平数量 \(k\),并加入 \(k-1\) 个项。
- 检查交互作用: 如果题目提到 \(X\) 的影响随 \(Y\) 而变化,请加入乘积项。
例子: 如果我们有一个包含截距、一个连续变量(年龄,\(x_1\))和一个因子(性别,水平为 \(L_1 = \) 男和 \(L_2 = \) 女)的索赔模型 (\(\mu\)),并使用对数链接:
\(\ln(\mu) = \beta_0 + \beta_1 x_1 + \beta_2 x_{Gender}\)
其中如果为女性,\(x_{Gender} = 1\);如果为男性,则为 \(0\)(使男性成为基准水平)。
总结表:链接函数与预测项
概念: 线性预测项 (\(\eta\))
定义: 模型的“数学公式”端。
精算应用: 结合年龄、地区和保单类型来估算风险。
概念: 链接函数 (\(g\))
定义: 通往平均响应值的“桥梁”。
精算应用: 确保索赔次数不为负(对数链接)或概率介于 0 与 1 之间(Logit 链接)。
概念: 因子与交互作用
定义: 处理类别和综合效应。
精算应用: 按地区或车型区分保费。
在接下来的章节中,我们将学习如何使用最大似然估计 (maximum likelihood) 来估计这些 \(\beta\) 参数,以及如何测试我们的模型是否真正拟合数据。