欢迎来到广义线性模型 (GLM) 的选择与验证世界!
你好!如果你已经来到 Exam PA 备考之路的这个阶段,你一定已经知道广义线性模型 (GLMs) 是精算预测建模的核心基础。但我们该如何判断自己建立的模型是否“优秀”呢?是变量最多的模型吗?还是对训练数据拟合得最完美的模型?(剧透一下:都不是!)
在本章中,我们将学习如何针对具体的业务问题挑选正确的 GLM,更重要的是,如何证明它确实有效。你可以把这个过程想象成从只会照本宣科的“厨师”,变成一位清楚知道为何选用特定食材的“主厨”。如果刚开始觉得内容有点重,别担心,我们会一步步为你拆解!
1. 定义业务问题:在“怎么做”之前的“为什么”
在动手操作电脑之前,你必须先了解你想要解决的问题是什么。在 Exam PA 的情境下,业务问题直接决定了你对目标变量 (Target Variable) 和误差分布 (Error Distribution) 的选择。
逐步应对方法:
1. 定义目标:我们在预测什么?(例如:索赔数量、总成本,或客户流失率)。
2. 确认限制条件:我们是否有数据限制?是否有法律对透明度的要求?
3. 选择合适的 GLM 组件:具体来说,就是分布 (Distribution) 和链接函数 (Link Function)。
选择正确的分布
你可以将分布视为数据的“形状”。如果你选错了形状,模型永远无法妥善拟合。
精算工作中常见的分布:
- 常态分布 (Normal/Gaussian): 用于对称的连续型数据(保险索赔中很少见,但常见于身高/体重等指标)。
- 泊松分布 (Poisson): 处理计数数据 (Count data) 的首选(例如:“今年发生了多少宗意外?”)。
- 伽马分布 (Gamma): 非常适合用于索赔严重程度 (Claim severity)(正值的连续数据,且呈偏态分布——大量的低额索赔,少量的高额索赔)。
- 二项分布 (Binomial): 用于二元结果 (Binary outcomes)(是/否,1/0)。
- Tweedie 分布: 一种“混合型”分布,常被用于总保险损失 (Total insurance loss),因为它能同时处理大量的零值(无索赔)以及正值的连续数据。
快速复习:你会用什么分布来衡量“机器故障次数”?
答案:泊松分布(因为这是事件的计数)。
2. 选择预测变量:特征选择 (Feature Selection)
在 GLM 中,我们并不总是想把手头上所有的变量(特征)都放进去。放入过多变量会导致过拟合 (Overfitting)——即模型学会了你特定数据集中的“噪声”,而非真正的规律。
自动化选择方法
- 向前选择 (Forward Selection): 从空模型开始,根据对模型改善程度最大的变量,逐个添加。
- 向后选择 (Backward Selection): 从包含所有变量的模型开始,逐个移除最不显著的变量。
- 逐步选择 (Stepwise Selection): 前两者的结合;在每一步中,模型可以添加或移除变量。
要避免的常见错误:仅仅因为一个变量在统计上是“显著的”(p-value 很低)并不代表它对业务有用。请务必运用常识!如果一个变量是“邮政编码”,而你有 5,000 个邮政编码,你的模型可能会崩溃。你可能需要先对它们进行分组。
3. 模型验证:现实检核 (Reality Check)
一旦有了模型,你需要对其进行验证。我们这样做的目的是确保模型在未见过的数据 (Unseen data)(即模型未训练过的数据)上也能表现良好。
训练集/测试集划分 (Train/Test Split)
想象一下在准备数学考试。如果你只练习考试题目中完全一样的练习题,你并没有真正“学会”数学;你只是背下了答案。
- 训练集 (Training Set): 模型用来“学习”模式的数据。
- 测试集 (Test Set): 像是“期末考”,用来检测模型是否真的理解了模式。
交叉验证 (Cross-Validation)
有时,单一的划分是不够的。K 折交叉验证 (k-fold Cross-Validation) 涉及将数据分成“k”个部分。我们使用 \(k-1\) 个部分训练模型,并在剩余的部分进行测试,重复此过程直到每一部分都曾担任过“测试集”。然后我们将结果取平均值。
关键要点:验证是捕捉过拟合(在训练数据上精确度极高,但在测试数据上却表现不佳)的唯一途径。
4. 评估指标:我们如何为模型打分?
我们需要数字来告诉我们模型 A 是否比模型 B 更好。以下是 Exam PA 中最重要的指标:
偏差 (Deviance)
在 GLM 中,偏差 (Deviance) 是衡量“拟合优度”的指标。较低的偏差意味着模型对数据的拟合程度更好。你可以把偏差想成是模型与完美模型之间的“误差”或“差距”。
AIC 和 BIC(“惩罚”指标)
这些指标帮助我们在拟合程度与简单性之间取得平衡。
- AIC (Akaike Information Criterion): \(AIC = -2L + 2p\)
- BIC (Bayesian Information Criterion): \(BIC = -2L + p \ln(n)\)
其中 \(L\) 是似然函数值 (Likelihood),\(p\) 是参数(变量)数量,\(n\) 是样本大小。
法则:数值越低越好!BIC 比 AIC 更“严格”——它对拥有过多变量的惩罚更重,特别是在大型数据集中。
记忆小撇步:把 AIC 和 BIC 想成才艺表演的评委。他们会为精彩的表演(Likelihood)给分,但如果你带了太多不必要的伴舞(参数/变量),他们就会扣分。
5. 残差分析:检查“剩余物”
残差 (Residuals) 是实际发生的情况与模型预测结果之间的差异(\(实际值 - 预测值\))。在一个好的模型中,残差应该看起来像“白噪声”(White noise)——随机且不可预测的。
残差类型:
1. 皮尔森残差 (Pearson Residuals): 标准化残差,对于检查常数方差 (Constant variance) 非常有用。
2. 偏差残差 (Deviance Residuals): 在 GLM 中更受偏爱,因为它们的分布更接近常态分布,使得在图表中的解读更容易。
检查重点:如果你画出残差图,却发现明显的模式(例如“U”型或“扇形”),说明你的模型漏掉了一些重要的东西!这代表数据中还有模型无法捕捉到的潜在规律。
6. 为利益相关者解读结果
业务问题的最后一步是向非精算专业人士解释你的模型。他们不在乎“对数似然函数 (Log-Likelihood)”,他们在乎的是“底线 (Bottom Line)”。
链接函数 (Link Function) 的技巧:
如果你使用了对数链接 (Log Link)(在泊松和伽马模型中很常见),系数的作用是乘法性质的 (Multiplicative)。
如果“车龄”的系数是 \(0.05\),那么车龄每增加一个单位,预测值就会增加 \(e^{0.05} \approx 1.051\) 倍,即增加 \(5.1\%\)。
你知道吗?这种乘法性质就是为什么对数链接在保险定价中如此受欢迎——因为说“年轻驾驶会让保费增加 20%”比说“它会让保费增加 200 美元”更容易让大众理解。
考试摘要检查清单
当你在考试中被要求选择并验证一个 GLM 时,请依序过一遍这份心理清单:
- 分布:是否符合目标的本质?(计数 vs. 连续)
- 链接函数:是否适当?(正值用 Log,二元变量用 Logit)
- 选择:我是否使用了 AIC/BIC 或逐步选择来删减不必要的变量?
- 验证:我是否检查了模型在测试集上的表现?
- 残差:我是否检查了残差图,确保没有遗漏的模式?
- 业务逻辑:结果对公司而言合理吗?
专家建议:如果考试要求你在两个模型之间做选择,其中一个 AIC 稍低,但复杂得多,请考虑推荐较简单的模型。在现实世界中,“简单且具可解释性”往往胜过“复杂但精确度略高”。
你一定能做到!GLM 可能看起来有很多活动的零件,但一旦你看出分布、链接函数和验证是如何协同工作的,一切就会豁然开朗。