欢迎来到模型选择的世界!
你好!如果你在 ASTAM 的学习旅程中已经走到这一步,相信你已经懂得如何为不同的模型估计参数了。但这里有一个大哉问:我们到底应该选用哪一个模型呢?
在这一章,我们将学习如何为数据与数学模型进行“配对”。我们追求的是一个既能精确拟合数据,又不至于过度复杂的模型。我们将探讨三种主要的决策方式:观察图表(图形程序)、执行正式的“质量检查”(假设检验),以及为模型的复杂度引入数学“惩罚”(分数准则)。
如果现在觉得这些概念有点抽象,别担心。想象一下买鞋子:你希望鞋子好看(图形)、穿起来舒服(假设检验),而且价钱要合理,不能因为多了一点点功能就贵得离谱(分数准则)。让我们开始吧!
1. 图形程序:直观评估法 (Eye Test)
在进行繁重的运算之前,我们通常先从观察数据入手。图形程序能帮助我们一眼看出模型在哪里表现良好,又在哪里出现失误。
经验分布与拟合分布的对比
我们将经验分布函数 (Empirical Distribution Function) \(F_n(x)\)——即数据实际呈现的情况——与拟合分布函数 (Fitted Distribution Function) \(F^*(x)\)——即模型预测的情况——进行比较。
差异图 (Difference Plot)
差异图绘制的是 \(D(x) = F_n(x) - F^*(x)\) 的数值。
• 如果图形保持在接近零的位置,说明模型表现优异。
• 如果出现明显的“凸起”或“凹陷”,说明模型在这些特定区域(例如尾部或中间部分)拟合效果不佳。
p-p 图 (概率-概率图)
在 p-p 图中,我们绘制坐标对 \((F^*(x_j), F_n(x_j))\)。
• 如果模型完美无缺,所有点会落在从 (0,0) 到 (1,1) 的 45 度直线上。
• 小贴士: p-p 图对于观察模型如何拟合数据的“中间部分”非常有用,但它往往会掩盖尾部(极大或极小值)出现的问题。
重点总结
视觉检查是用来对模型进行“初次印象检查”的好方法,但它带有主观性。某个人可能觉得曲线已经“足够贴合”,但另一个人却可能不同意。这就是为什么我们需要下一节提到的内容:假设检验!
2. 假设检验:正式的决策依据
这些检验会给我们一个数学上的“是”或“否”(或者更严谨地说,“无法拒绝零假设”或“拒绝零假设”),用以判断模型是否为合适的拟合。
柯莫哥洛夫-斯米尔诺夫检验 (Kolmogorov-Smirnov, K-S Test)
这是精算科学中最著名的检验之一。它寻找的是数据与模型之间最大的差距。
公式:
\(D = \max |F_n(x) - F^*(x)|\)
• 运作方式: 我们计算模型与数据在每一个点上的距离,而“检验统计量”就是我们找到的最大距离。
• 局限性: K-S 检验仅适用于单独(非分组)数据,且在参数非由数据估计所得时效果最佳(尽管在实务中,我们经常也会通过调整来使用它)。
安德森-达林检验 (Anderson-Darling, A-D Test)
你可以把 A-D 检验想象成 K-S 检验的“严格导师”版本。虽然 K-S 检验将所有误差一视同仁,但 A-D 检验会对尾部给予更多权重。
为什么这很重要? 在保险业中,我们非常在意“尾部风险”(即极端且罕见的赔款)。一个能完美拟合平均赔款却忽略巨额赔款的模型是非常危险的!A-D 检验有助于揪出这类问题。
概似比检验 (Likelihood Ratio Test, LRT)
这是考试中的热门考点。当我们有两个嵌套 (Nested) 模型时,就会用到它。
类比: 想象一个“基础模型”(例如指数分布)和一个“进阶模型”(例如伽玛分布)。由于指数分布只是一个参数固定的伽玛分布,因此它们是嵌套关系。
流程:
1. 计算较简单(受限)模型的对数概似值:\(\ell_0\)。
2. 计算较复杂(不受限)模型的对数概似值:\(\ell_1\)。
3. 计算统计量:\(T = 2(\ell_1 - \ell_0)\)。
4. 将 \(T\) 与卡方 (\(\chi^2\)) 分布进行比较。
自由度: \(\chi^2\) 检验的自由度为两个模型在参数数量上的差值。
重点总结
假设检验为剔除劣质模型提供了一套结构化的方法。记住: 如果 p-value 很小(通常 < 0.05),说明该模型拟合得很差!
3. 分数准则:平衡拟合与复杂度
如果你不断增加模型的参数,拟合度总会“越来越好”,但模型最后会变得难以使用。这称为过度拟合 (Overfitting)。分数准则会因为模型拥有过多参数而对其进行“惩罚”。
赤池信息准则 (Akaike Information Criterion, AIC)
AIC 旨在寻找能以最少参数解释最多数据的模型。
公式:
\(AIC = -2\ell + 2k\)
(其中 \(\ell\) 是对数概似值,\(k\) 是参数数量)。
施瓦茨贝叶斯准则 (Schwarz Bayesian Criterion, SBC 或 BIC)
SBC 与 AIC 类似,但它对增加参数的惩罚“更重”,尤其是在你有大量数据点 (\(n\)) 的情况下。
公式:
\(SBC = -2\ell + k \ln(n)\)
(其中 \(n\) 是观测值数量)。
我该选哪一个?
对于 AIC 和 SBC 来说,数值越小,模型越好。
• 你知道吗? 由于 \(\ln(n)\) 通常大于 2,因此 SBC 几乎总是比 AIC 更严格。它比 AIC 更偏好简单的模型。
避免常见错误
• 搞混 AIC/SBC: 学生常误以为“高分”比较好。错了!把它想象成高尔夫球比赛——低分者胜。
• 嵌套与非嵌套: 只有在一个模型是另一个模型的特殊情况时,才能使用概似比检验。如果你在比较对数常态分布与韦伯分布,请改用 AIC 或 SBC!
• SBC 中的数据规模: 别忘了 SBC 中的 \(\ln(n)\) 项。如果你忘记将样本数纳入考量,计算结果就会出错。
快速复习箱
1. K-S 检验: 观察最大距离 \(|F_n(x) - F^*(x)|\)。
2. A-D 检验: 类似 K-S,但对尾部的观察更为密切。
3. LRT: 用于嵌套模型;使用 \(\chi^2\) 分布。
4. AIC/SBC: 因模型过于复杂而给予惩罚。数值越小越好。
持续练习!模型选择的核心就是比较不同选项。一旦你掌握了这三种方法,你就能准确地证明为什么某个模型优于另一个。你一定做得到的!