简介:超越“标准”模型
欢迎来到统计的世界!如果你曾经花时间钻研统计学,想必对普通最小二乘法 (Ordinary Least Squares, OLS) 回归模型并不陌生。它是预测模型中的“家常便饭”。然而,在精算科学的真实世界里——我们处理的是保险理赔、事故发生频率以及死亡率——OLS 往往显得力不从心。
在本章中,我们将探讨为什么有时需要抛弃僵化的 OLS 模型,转而采用更灵活的广义线性模型 (Generalized Linear Model, GLM)。我们会深入了解区分两者的特定假设。如果起初觉得这些概念有些抽象,请不用担心;一旦你看懂了其中的规律,一切都会豁然开朗!
1. 起点:OLS 的假设
在了解 GLM 有何不同之前,我们必须先回顾 OLS 对数据的要求。你可以运用 LINE 这个记忆口诀来记住 OLS 的核心假设:
L – Linearity (线性):预测变量与响应变量之间的关系呈现直线关系。
I – Independence (独立性):观测值(数据点)之间互不相关。
N – Normality (正态性):误差项(残差)遵循正态分布 (Normal/Gaussian distribution)。
E – Equal Variance (等方差性):误差的方差维持恒定(这是一个专业术语,称为同方差性 (homoscedasticity))。
类比:想象 OLS 就像一件标准“M 号”的 T 恤。它能让大多数人穿起来还算合身,但如果你特别高或特别矮,穿起来就会很奇怪。OLS 非常适合“正常”的数据,但保险数据往往比较“古怪”。
重点总结:
OLS 假设你的目标变量是连续的,数值可正可负,且无论预测值为何,其变异程度(方差)都保持一致。
2. 为什么 OLS 在精算工作中会失败?
在 SRM 考试的“线性模型”章节中,你会发现保险数据经常违反 OLS 的规则。考虑以下两个常见情境:
1. 理赔件数:事故发生次数不可能为 -2。OLS 可能会预测出负数,这完全不合理!此外,件数是离散的整数(0, 1, 2...),而非连续值。
2. 理赔金额:大型保险理赔(例如房子烧毁)的方差通常远高于小型理赔(例如挡风玻璃破裂)。OLS 假设两者的方差相同,这通常是错误的。
3. GLM 的解决方案:灵活的框架
广义线性模型 (GLM) 放宽了 OLS 的严格限制。GLM 不再强迫数据塞进“正态”的框框里,而是由三个特定部分组成:
A. 随机成分 (Random Component - 分布)
在 OLS 中,我们假设响应变量 \(Y\) 遵循正态分布。在 GLM 中,我们假设 \(Y\) 遵循指数族分布 (Exponential Family)。这个家族包含:
- 正态分布 (Normal)(用于标准的连续数据)
- 泊松分布 (Poisson)(用于计算事件发生的次数)
- 二项分布 (Binomial)(用于是/否的二元结果)
- 伽马分布/反高斯分布 (Gamma/Inverse Gaussian)(用于正值且偏态的保险理赔金额)
B. 系统成分 (Systematic Component - 线性预测值)
这部分看起来很眼熟!它就是解释变量 (\(X\)) 与其系数 (\(\beta\)) 的组合。我们称之为 eta (\(\eta\)):
\(\eta = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + ... + \beta_p X_p\)
C. 链接函数 (Link Function)
这是连接两者的“桥梁”。它将我们数据的平均值 (\(\mu\)) 与线性预测值 (\(\eta\)) 连接起来。
公式如下:\(g(\mu) = \eta\)。
在 OLS 中,链接函数是“恒等 (identity)”,意味着我们假设 \(\mu = \eta\)。在 GLM 中,我们可以使用“对数 (Log)”链接 (\(ln(\mu) = \eta\)) 来确保我们的预测结果保持为正数!
你知道吗?
OLS 其实就是 GLM 的一种特殊形式!如果你选择正态分布和恒等链接函数,你的 GLM 就会变成 OLS 模型。
4. OLS 与 GLM:并排比较
让我们拆解它们在假设上的主要差异,让你能在考试中一眼辨识出来:
1. 响应变量的分布
- OLS:必须是正态分布。
- GLM:可以是指数族中的任何分布(泊松、二项、伽马等)。
2. 方差的关系
- OLS:方差是恒定的,且不依赖于平均值(同方差性)。
- GLM:方差是平均值的函数。例如,在泊松分布中,随着平均值增加,方差也会增加。这对于保险数据来说要真实得多!
3. 关系转换
- OLS:假设 \(\mu = \beta X\)(直接的线性关系)。
- GLM:假设 \(g(\mu) = \beta X\)。链接函数 \(g(.)\) 允许关系呈现非线性,同时保持参数的线性。
快速复习:常见错误
- 不要说 GLM 假设数据是非线性的。其参数 (\(\beta\)) 仍然是线性的!是因为与平均值的链接方式可以是线性的。
- 不要假设 GLM 的残差必须是正态的。我们关心的是响应变量的分布,而不是像 OLS 那样只看“误差”。
5. 考试重点总结
当你参加 SRM 考试时,请记住 GLM 与 OLS 假设的这三大支柱:
1. 灵活性:GLM 允许使用非正态分布(指数族)。
2. 方差非恒定:GLM 允许方差随着平均值改变(为平均值的函数)。
3. 链接函数:GLM 使用链接函数将平均值与线性预测值挂钩,这有助于将预测值保持在有效范围内(例如确保理赔件数不为负)。
鼓励的话:如果链接函数背后的数学看起来很沉重,只需记住其目的:我们只是在寻找一种方法,确保模型的“数学逻辑”能与我们研究数据的“现实情况”相符。你一定能搞定的!
重点总结:
GLM 相对于 OLS 的主要优势在于,它移除了正态性与恒定方差的“紧身衣”,使我们能够更准确地对现实世界的风险进行建模。