欢迎来到广义线性模型 (GLM) 的世界!
你好!如果你一直在研读线性回归,你应该知道它是一个强大的工具。但如果你的数据不符合完美的「钟形曲线」(常态分布)时该怎么办呢?如果你要建立的模型是关于汽车意外的次数(不可能为负数),或者人寿保险单是否失效(是/否),你该如何处理?
这就是广义线性模型 (Generalized Linear Models, GLMs) 的用武之地。在本章中,我们将探讨 GLM 的「骨架」:指数族 (Exponential Family) 与连接函数 (Link Functions)。你可以把指数族想象成概率分布的「贵宾俱乐部」,而连接函数则是让这些分布能与线性模型相容的「秘密暗号」。让我们开始吧!
1. 什么是指数族 (Exponential Family)?
指数族是一组具有相同数学结构的概率分布。通过将它们转换成这种特定的格式,我们可以使用一套统一的框架来解决许多不同类型的问题。
如果一个概率分布的概率密度(或质量)函数可以写成以下形式,它就属于指数族:
\( f(y; \theta, \phi) = \exp \left( \frac{y\theta - b(\theta)}{a(\phi)} + c(y, \phi) \right) \)
别被这些符号吓到了!让我们拆解一下这个方程式中的「主要角色」:
- \( y \): 这是你的观测数据(应变量)。
- \( \theta \) (Theta): 这称为标准参数 (canonical parameter)(或称自然参数)。它与分布的平均值有关。
- \( \phi \) (Phi): 这称为离散参数 (dispersion parameter)。它与数据的散布程度(尺度)有关。
- \( a(\phi) \)、\( b(\theta) \) 和 \( c(y, \phi) \): 这些只是会根据你使用的分布(常态、泊松等)而改变的函数。
为什么这很有用?
类比: 想象一家运输公司只处理特定尺寸的箱子。如果你想运送一辆车、一台钢琴或一袋弹珠,你必须先将它们装进那个标准箱子里。一旦装箱后,运输公司就不会在意里面装的是什么——他们以同样的方式对待每一个箱子。指数族的公式就是统计学中的那个「标准箱」!
快速复习:关键部分
\( b(\theta) \) 是最需要记住的函数,因为它决定了平均值和方差!我们称它为累积量函数 (cumulant function)。
2. 寻找平均值与方差
指数族最酷的地方在于,一旦你找到了 \( b(\theta) \),你就可以通过简单的微分求出平均值和方差,完全不需要进行任何繁琐的积分!
平均值 (Mean):
\( Y \) 的期望值(平均值,\( \mu \))简单来说就是 \( b(\theta) \) 的一阶导数:
\( E[Y] = \mu = b'(\theta) \)
方差 (Variance):
\( Y \) 的方差涉及 \( b(\theta) \) 的二阶导数和离散函数:
\( Var(Y) = b''(\theta) a(\phi) \)
你知道吗? \( b''(\theta) \) 项通常被称为方差函数 (variance function),标记为 \( V(\mu) \)。它描述了方差如何随平均值改变。在常态分布中,方差是固定的;但在泊松分布中,方差会随着平均值的增加而变大!
3. 指数族的常见成员
你需要认出哪些著名的分布属于这个家族。对于 SRM 考试来说,以下是最常见的几种:
- 常态分布 (Normal/Gaussian): 用于标准的连续型数据。
- 泊松分布 (Poisson): 用于计数数据(例如:一年内发生多少次索赔)。
- 二项分布 (Binomial): 用于二元结果(例如:这名考生是否通过考试?是或否)。
- 伽马 (Gamma) 与反高斯 (Inverse Gaussian) 分布: 用于呈现「偏态」的连续型正数数据(例如:保险索赔的金额)。
常见错误: 同学们经常忘记,标准线性回归其实只是 GLM 的一种特殊情况,即其分布为常态分布!
4. 连接函数 (Link Function):连接桥梁
在标准线性模型中,我们说 \( Y = \beta_0 + \beta_1 X \)。但如果 \( Y \) 只能是正数(像索赔金额),而我们的公式 \( \beta_0 + \beta_1 X \) 算出来却是负数时该怎么办?
这就是连接函数派上用场的地方。它将数据的平均值 (\( \mu \)) 与线性预测值 (\( \eta \))「连接」起来。
公式:
\( g(\mu) = \eta = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + ... \)
类比: 连接函数就像一位翻译官。线性模型说的是「实数」(从负无穷大到正无穷大);而数据说的是「概率」(仅 0 到 1)或「计数」(仅正整数)。连接函数会转换模型的输出,使其对应的数据具有实际意义。
必须知道的连接函数:
1. 恒等连接 (Identity Link): \( g(\mu) = \mu \)。用于常态分布,不做任何改变。
2. 对数连接 (Log Link): \( g(\mu) = \ln(\mu) \)。用于泊松分布。这确保预测的平均值永远是正数,因为 \( \mu = e^\eta \)。
3. Logit 连接: \( g(\mu) = \ln(\frac{\mu}{1-\mu}) \)。用于二项分布。这确保预测的概率永远在 0 到 1 之间。
5. 标准连接函数 (Canonical Link Function)
指数族中的每个分布都有一个「自然」的连接函数,在数学运算上最简洁。这称为标准连接函数。
当我们令连接函数等于我们之前看到的标准参数时,就会得到它:
\( g(\mu) = \theta \)
快速对照表:
常态分布: 恒等连接 (Identity Link)
泊松分布: 对数连接 (Log Link)
二项分布: Logit 连接
伽马分布: 反数连接 (Inverse Link, \( 1/\mu \))
如果觉得这部分有点复杂也不用担心! 只要记住:「标准 (Canonical)」通常代表对该分布而言「预设的」或「数学上最简洁」的选项。
6. 总结与重点复习
你已经完成了 GLM 理论的核心部分!以下是考试前应该掌握的重点:
- 指数族是一个通用形式,涵盖了常态、泊松、二项及伽马分布。
- \( b(\theta) \) 是你的好朋友。它的一阶导数是平均值,二阶导数能帮你求出方差。
- 连接函数 \( g(\mu) \) 将平均值连接到线性预测值 (\( X\beta \))。
- 标准连接 (Canonical Link) 是 \( g(\mu) = \theta \) 的特定函数。
- 记忆小撇步: 要记住二项分布的 Logit 连接,可以想成「概率 (Probability)」→「胜算 (Odds)」→「对数胜算 (Log-Odds)」。Log-Odds 就是 Logit!
继续加油! 理解这些片段如何组合在一起是最困难的部分。一旦掌握了这个「骨架」,其余的 GLM 章节会让你感觉直观得多。你一定做得到的!