欢迎来到分布的世界!
欢迎你,未来的精算师!在本章中,我们将探讨精算科学的“DNA”:单变量分布 (univariate distributions)。你可以把分布想象成一种规律或“蓝图”,它告诉我们不同结果出现的可能性。无论是你要预测今天有多少人会提出保险索赔,还是预测这些索赔的金额大小,这些分布都是你最重要的工具。
如果以前觉得统计学有点枯燥,别担心!我们会将这些概念拆解到现实场景中,让你清楚看到它们是如何运作的。
1. 离散分布:你的“计数”工具
当我们进行计数(1, 2, 3...)时,我们会用到离散分布。你总不能有 2.5 宗保险索赔吧!
伯努利分布 (Bernoulli Distribution):非黑即白的试验
这是最简单的分布。它模拟只有两种可能结果的单次试验:成功 (1) 或失败 (0)。
例子:掷一次硬币,或者检查某位保单持有人是否续保。
关键属性:若成功概率为 \(p\),其平均值 (Mean) 为 \(p\),方差 (Variance) 为 \(p(1-p)\)。
二项分布 (Binomial Distribution):多次试验
如果你将多个伯努利试验加总起来,就会得到二项分布。它告诉我们在 \(n\) 次独立试验中,成功发生的次数。
例子:如果你有 100 位保单持有人,今年有多少人会提出索赔?每位持有人就是一次“试验”。
重点复习:对于 \(X \sim Bin(n, p)\):
\(E[X] = np\)
\(Var(X) = np(1-p)\)
泊松分布 (Poisson Distribution):时间内的事件
泊松分布模拟在固定的时间或空间区间内,事件发生的次数。
类比:想象你站在桥上数着桥下经过的车辆。如果你知道平均每小时有 10 辆车经过,泊松分布能帮你计算下一个小时正好有 15 辆车经过的概率。
你知道吗?在泊松分布中,平均值与方差相等 (\(\lambda\))。这是考试时识别泊松过程的一个经典“捷径”!
几何分布与负二项分布:等待成功的到来
这些分布的重点在于成功何时发生。
- 几何分布 (Geometric):要经过多少次试验才能等到第一次成功?(例如:我要检查多少间房子才能找到一间有火灾损毁的?)
- 负二项分布 (Negative Binomial):要经过多少次试验才能等到第 k 次成功?(例如:销售员要打多少通电话才能达成 3 笔交易?)
常见错误:务必查阅你的公式表!这些分布的某些版本计算的是“试验总次数”,而另一些计算的是“失败次数”。在 CS1 中,IFoA 通常将几何分布定义为第一次成功前的“失败次数”。
重点总结:计数时请使用离散分布。记住,二项分布用于固定次数的试验,而泊松分布则用于固定的时间窗口。
2. 连续分布:你的“测量”工具
连续分布用于测量数值,如时间、重量或金额。这些数值在范围内可以是任何值(例如:一笔索赔可能是 £1,250.55)。
指数分布 (Exponential Distribution):等待时间
指数分布是泊松分布的“拍档”。泊松分布计算事件发生的次数,而指数分布则测量事件发生的时间间隔。
关键特性:无记忆性 (Memorylessness)。这是考试热门考点!这意味着无论你已经等了一小时还是刚到,接下来 10 分钟内发生事件的概率都是一样的。该分布会“忘记”过去。
伽马分布 (Gamma Distribution):累加等待时间
如果你将多个指数变量相加,就会得到伽马分布。它通常用于模拟多个独立事件发生的总时间,或由于其灵活性及恒正的特性,被用于模拟索赔金额。
正态分布 (Normal Distribution):著名的钟形曲线
正态分布 \(N(\mu, \sigma^2)\) 是对称的,描述了许多自然现象。在精算工作中,我们常假设多个独立风险的总和遵循正态分布(这多亏了中心极限定理)。
对数正态分布 (Lognormal) 与帕累托分布 (Pareto):模拟大型风险
保险索赔并不总是对称的。通常情况下,我们有很多小额索赔,但也有极少数的巨额索赔。
- 对数正态分布:如果 \(\ln(X)\) 是正态分布,则 \(X\) 为对数正态分布。它向右“偏斜”(右尾较长)。
- 帕累托分布:这是一种“厚尾”分布。它用于灾难性风险(如地震或大型工业火灾),其中极端“异常值”事件发生的概率比正态分布所预测的要高得多。
重点总结:连续分布用来模拟“有多少”或“多久”。如果你的数据有极端值,请考虑使用对数正态或帕累托分布,而不是正态分布。
3. 生成样本:概率积分变换 (PIT)
电脑如何模拟特定分布的随机数?它们使用一种称为概率积分变换 (Probability Integral Transform, PIT) 的巧妙技巧。
概念
大多数电脑可以轻易生成一个 0 到 1 之间的随机数 \(U\)(即 Uniform(0,1) 分布)。PIT 告诉我们,只要知道目标分布的累积分布函数 (CDF),即 \(F(x)\),我们就可以将 \(U\) 转换为任何想要的分布值。
步骤拆解:如何生成样本
- 从 \(Uniform(0,1)\) 分布中生成一个随机数 \(u\)。
- 令 \(u = F(x)\),其中 \(F(x)\) 是你想要采样的分布的 CDF。
- 解出 \(x\)。这通常写作 \(x = F^{-1}(u)\)。
例子:生成指数分布样本
指数分布的 CDF 为 \(F(x) = 1 - e^{-\lambda x}\)。
1. 令 \(u = 1 - e^{-\lambda x}\)
2. 移项:\(1 - u = e^{-\lambda x}\)
3. 取自然对数:\(\ln(1-u) = -\lambda x\)
4. 解出 \(x\):\(x = -\frac{1}{\lambda} \ln(1-u)\)
由于 \(1-u\) 同样是 Uniform(0,1),你通常会看到简化版本为 \(x = -\frac{1}{\lambda} \ln(u)\)。
记忆口诀:把 CDF 想象成一位“翻译官”。你给它一个标准化的数值(0 到 1),它就会把它翻译成你特定分布的“语言”。
重点总结:要生成样本,将随机数 \(u\) 设为 CDF 并解出 \(x\)。这是蒙特卡洛模拟 (Monte Carlo simulation) 的基石。
重点复习箱
考试清单:
• 你分得清哪些分布是离散型 vs 连续型吗?
• 你能识别出具有无记忆性的分布吗?(指数分布)
• 你知道哪个分布满足平均值 = 方差吗?(泊松分布)
• 你会进行 PIT 步骤来求解 \(x\) 吗?
• 记住:对于索赔金额,偏斜分布(对数正态/帕累托)通常比正态分布更适用。
如果一开始觉得很棘手,别担心!精算统计学的核心在于掌握规律。一旦你认出了每个分布的“个性”,选择正确的分布就会变得得心应手。继续多练习那些 CDF 的移项运算吧!