欢迎来到实验室:创造新分配!
在你的精算旅程中,你已经认识了这些“明星级”分配:指数分配(Exponential)、伽马分配(Gamma)和帕雷托分配(Pareto)。但在现实世界的保险数据中,情况往往没那么简单。有时候,标准分配并不能完美地拟合索赔数据。
把这一章想象成一个DIY 工作坊。我们不需要“购买”新的分配,而是将现有的分配进行修改——拉伸它们、提升其幂次,甚至像拼布被一样将它们缝合在一起。读完这些笔记后,你将学会如何“构建”一个分配,以适应几乎任何严重程度(Severity)模型的场景。
快速回顾:请记住,严重程度模型(Severity Model)是用来描述索赔金额的大小。在本章中,我们正在寻找创造新的累积分配函数 (CDF, \(F(x)\)) 和概率密度函数 (PDF, \(f(x)\)) 的方法,以更精确地呈现这些索赔金额。
1. 乘法(分配的缩放 Scaling)
这是创造新分配最简单的方法。如果你有一个随机变量 \(X\)(代表一次索赔),将其乘以一个常数 \(c > 0\),你就会得到一个新的随机变量 \(Y = cX\)。
为什么要这样做?
想象一下,你手头上有以美元为单位的索赔分配,但你需要换成欧元;或者,想象由于通货膨胀,每笔索赔额都增加了 5%。这就是在对分配进行缩放(Scaling)。
数学原理:
如果 \(Y = cX\),那么新的累积分配函数 (CDF) 为:
\(F_Y(y) = F_X(y/c)\)
新的概率密度函数 (PDF) 为:
\(f_Y(y) = \frac{1}{c} f_X(y/c)\)
关键概念:尺度参数(Scale Parameter, \(\theta\))
在许多 SOA 的分配中,参数 \(\theta\) 是一个尺度参数。如果你将整个分配乘以 \(c\),通常只需将旧的 \(\theta\) 乘以 \(c\) 即可得到新的参数。例如,如果 \(X \sim \text{Exponential}(\theta)\),那么 \(cX \sim \text{Exponential}(c\theta)\)。
避免常见错误:
计算 PDF 时,千万别忘了函数内部要除以 \(c\),而外部还要再乘以 \(1/c\)!
重点总结:将分配乘以常数 \(c\) 会“拉伸”该分配。它的形状保持不变,但尺度(Scale)改变了。
2. 幂次变换(Power Transformations)
如果我们取一个分配并将其进行幂次变换会怎样?如果 \(X\) 是我们原始的变量,我们可以创建 \(Y = X^{1/\tau}\)(或 \(Y = X^\tau\))。
数学原理:
如果 \(Y = X^{1/\tau}\),则 \(X = Y^\tau\)。CDF 变为:
\(F_Y(y) = F_X(y^\tau)\)
“变换后”家族:
这就是我们如何从 ASTAM 表中得到一些著名分配的方法:
1. 变换伽马分配(Transformed Gamma): 通过对伽马分配进行幂次变换而创建。
2. 伯尔分配(Burr Distribution): 通过对帕雷托分配进行幂次变换而创建。
记忆小贴士:
把幂次 \(\tau\) (tau) 想象成“韧性”(Toughness)。对索赔额进行幂次变换会改变分配尾部的“厚重程度”。较高的幂次会使发生大额索赔的概率显著增加或减少。
重点总结:幂次变换会改变分配的形状和尾部权重,从而影响出现极端值的可能性。
3. 指数化(Exponentiation)
在这个变换中,我们取一个随机变量 \(X\),将其转变为 \(Y = e^X\)。
著名的例子:对数常态分配(Lognormal)
如果 \(X\) 服从常态分配,那么 \(Y = e^X\) 就服从对数常态分配。这是严重程度模型中最重要的分配之一,因为它永远为正且具有右偏尾部(非常适合保险索赔!)。
数学原理:
如果 \(Y = e^X\),则 \(X = \ln(Y)\)。CDF 为:
\(F_Y(y) = F_X(\ln y)\)
你知道吗?
我们使用“Log-”作为新分配的前缀(例如:Loglogistic, Lognormal)。这意味着,如果你对索赔金额取对数(Logarithm),它就会服从原始的分配。
重点总结:指数化用于创造严格为正且通常具有极长、极“厚”尾部的分配。
4. 混合分配(Mixing Distributions)
混合就像制作果昔(Smoothie)。你不是将索赔金额加在一起,而是表示一笔索赔有特定的概率来自“分配 A”,也有特定的概率来自“分配 B”。
离散混合(Discrete Mixtures):
假设你有两类驾驶员:“安全型”(分配 \(F_1\))和“风险型”(分配 \(F_2\))。如果 70% 的驾驶员是安全型,30% 是风险型,那么总分配为:
\(F(x) = 0.70 F_1(x) + 0.30 F_2(x)\)
一般公式:
\(F(x) = \sum_{i=1}^{n} a_i F_i(x)\),其中权重 \(a_i\) 的总和必须为 1 (\(\sum a_i = 1\))。
混合的步骤:
1. 识别各个单独的分配 (\(F_1, F_2, ...\))。
2. 识别权重(进入每个群组的概率)。
3. 将每个 CDF 或 PDF 乘以其对应的权重。
4. 将它们加总!
常见错误:
学生常将“混合”与“随机变量相加”混淆。
- 混合:“这笔索赔要么来自类型 A,要么来自类型 B。”
- 相加:“总索赔额是索赔 A 和索赔 B 的总和。”
这在数学上是非常不同的!混合使用权重;而相加涉及卷积(Convolutions,计算难度高得多)。
重点总结:混合允许你为具有不同行为特征的群组人口进行建模。
5. 拼接分配(Splicing Distributions)
拼接是“科学怪人”式的方法。你对小额索赔使用一种分配,对大额索赔使用另一种分配。这在保险业中非常常见,因为小型“轻微碰撞”索赔的行为与“全损”巨灾索赔的行为完全不同。
比喻:
想象一家商店,1 到 10 美元的商品使用一套定价表,而超过 10 美元的商品则使用完全不同的另一套定价表。规则改变的那个点(10 美元)称为门槛值(Threshold)或连接点(Join point)。
数学原理:
拼接后的 PDF 看起来像这样:
\(f(x) = \begin{cases} a_1 f_1(x) & 0 < x < k \\ a_2 f_2(x) & x > k \end{cases}\)
关键规则:总面积必须等于 1!
最重要的一点是,拼接后的 PDF 下方总面积必须为 1。你通常需要使用权重 (\(a_i\)) 对各个部分进行“缩放”,以确保它们能正确衔接。
拼接示例:
你可能会对 0 到 5,000 美元之间的索赔(“主体”)使用指数分配,而对超过 5,000 美元的索赔(“尾部”)使用帕雷托分配。
快速回顾:如何处理拼接
- 检查门槛值 (\(k\))。
- 确保所有区间内的概率总和等于 1。
- 如果题目要求 CDF,请谨慎地对每个部分进行积分,并继承前一个部分的累积概率。
重点总结:拼接让你能够“缝合”不同的模型,以捕捉不同索赔规模下的不同行为。
最后总结:工具箱
如果这些变换让你感到抽象,别担心。只需记住每个工具对数据“形状”的影响:
- 乘法:改变尺度(货币/通货膨胀)。
- 幂次:改变尾部权重(Burr, Transformed Gamma)。
- 指数化:创造严格为正的分配(Lognormal)。
- 混合:结合不同人群(安全型 vs. 风险型)。
- 拼接:结合不同索赔规模(小型 vs. 大型)。
你能做到的!这些工具是你在此后的 ASTAM 考试中构建复杂模型所需的底座。