连续分布简介
欢迎来到 CS1 旅程中最重要的章节之一!在上一章,我们探讨了离散分布(Discrete Distributions)——即我们用来“计数”的情况(例如索赔次数)。现在,我们进入连续(Continuous)的世界,这里我们主要是进行“测量”。想象一下下一次交通事故发生的确切时间,或是某宗保险索赔的具体金额。由于这些数值可以是任何数字(例如 124.50 或 124.5023...),我们便使用连续分布来为它们建模。
如果起初觉得有点难,请不用担心!虽然数学上涉及一些微积分,但核心概念其实很简单:我们是在观察数据在某个区间内的“形状”。读完这篇笔记后,你将会熟悉用来预测未来的精算分布“工具箱”。
注:关于如何计算矩(Moments)或使用生成函数(Generating functions),请参阅“矩与累积量生成函数”章节。关于产生这些变量的“逆变换采样法”(Inverse transform method),请参阅“泊松过程与模拟”章节。
1. 核心基础:PDF 与 CDF
在连续的世界中,随机变量 \(X\) 精确地等于某个特定数值的概率永远为零:\(P(X = x) = 0\)。相反地,我们讨论的是 \(X\) 落在某个范围内的概率。
- 概率密度函数 (PDF), \(f(x)\): 这代表曲线的“高度”。曲线下的总面积必须等于 1。
- 累积分布函数 (CDF), \(F(x)\): 这是 \(X\) 小于或等于某个数值 \(x\) 的概率。数学表达式为:\(F(x) = P(X \le x)\)。
小贴士:要找出两点 \(a\) 与 \(b\) 之间的概率,你只需计算 \(F(b) - F(a)\) 即可。
2. 均匀分布 (Uniform Distribution)
均匀分布是最简单的连续分布。它假设在范围 \([a, b]\) 内,所有长度相同的区间出现的机会均等。想象一个完美的平衡转盘;指针停在 0.1 的机会与停在 0.9 的机会是完全一样的。
\(X \sim U(a, b)\) 的关键性质:
- PDF: 对于 \(a \le x \le b\),\(f(x) = \frac{1}{b-a}\)。
- 期望 (Mean): \(E(X) = \frac{a+b}{2}\)(正好在正中间!)。
- 方差 (Variance): \(Var(X) = \frac{(b-a)^2}{12}\)。
3. 指数分布 (Exponential Distribution)
指数分布是关于“等待时间”的分布。精算师常用它来模拟独立事件之间的时间间隔,例如客户服务中心接到两通电话之间的时间。
\(X \sim Exp(\lambda)\) 的关键性质:
- PDF: 对于 \(x > 0\),\(f(x) = \lambda e^{-\lambda x}\)。
- CDF: \(F(x) = 1 - e^{-\lambda x}\)。
- 期望 (Mean): \(E(X) = \frac{1}{\lambda}\)。
- 方差 (Variance): \(Var(X) = \frac{1}{\lambda^2}\)。
你知道吗? 指数分布具有“无记忆性”(Memoryless)。这意味着如果你已经等了 10 分钟索赔才到,那么再等 5 分钟的概率,与你刚刚才开始等候时的概率是完全一样的!(注:这是连续分布中唯一的特性)。
4. 正态分布 (Normal Distribution)
正态分布(或称“钟形曲线”)是统计学中最著名的分布。它是对称的,并由其期望 (\(\mu\)) 和方差 (\(\sigma^2\)) 定义。
\(X \sim N(\mu, \sigma^2)\) 的关键性质:
- 期望 (Mean): \(E(X) = \mu\)。
- 方差 (Variance): \(Var(X) = \sigma^2\)。
- 标准化 (Standardization): 我们经常使用以下公式将 \(X\) 转换为标准正态变量 \(Z \sim N(0, 1)\):\(Z = \frac{X - \mu}{\sigma}\)。
常见错误: 使用公式 \(Z = \frac{X - \mu}{\sigma}\) 时,请记住 \(\sigma\) 是标准差(方差的平方根)。同学经常忘记开方!
5. 对数正态分布 (Lognormal Distribution)
如果一个变量的自然对数服从正态分布,那么该变量本身就是对数正态。这在保险业中非常受欢迎,用于模拟索赔金额的大小,因为它是“偏斜”(Skewed)的——这意味着它有一条向右伸展的长尾巴,代表那些罕见但极其昂贵的索赔。
定义: 如果 \(Y \sim N(\mu, \sigma^2)\),那么 \(X = e^Y\) 就是对数正态分布。
6. 伽玛分布 (Gamma Distribution)
伽玛分布比指数分布更具灵活性。指数分布模拟的是直到第一个事件发生的时间,而伽玛分布则可以模拟直到第 \(n\) 个事件发生的时间。
参数: 它通常具有形状参数 (\(\alpha\)) 和率参数 (\(\lambda\))。
- 期望 (Mean): \(E(X) = \frac{\alpha}{\lambda}\)。
- 方差 (Variance): \(Var(X) = \frac{\alpha}{\lambda^2}\)。
注:如果 \(\alpha = 1\),伽玛分布实际上就是指数分布!
7. 贝塔分布 (Beta Distribution)
贝塔分布非常独特,因为它定义在固定区间内,通常是 \([0, 1]\)。这使它非常适合用来模拟比例或百分比,例如某份特定再保险合约所承担的损失百分比。
8. 用于统计推断的分布
以下三种分布主要用于对数据进行“检验”。你将在教学大纲的统计推断(Statistical Inference)部分更频繁地看到它们。
- 卡方分布 (\(\chi^2\)): 伽玛分布的一个特例。它用于检验模型与数据的拟合程度(拟合优度检验)。
- t-分布: 看起来像正态分布,但拥有“更厚实的尾部”(Fatter tails)。当样本量较小且不知道真实总体方差时,我们会使用它。
- F-分布: 主要用于比较两个不同的方差,以查看它们是否存在显著差异。
9. 计算分位数与概率
在 CS1 考试中,你需要找出概率(例如 \(P(X < 10)\))或分位数(Quantiles,即满足 \(P(X < x) = 0.95\) 的 \(x\) 值)。
Paper A(笔试/查表)
在 Paper A 中,你经常会用到 Formulae and Tables(黄表)。对于正态分布,你会查阅“Phi”函数 \(\Phi(z)\) 来找出概率。至于其他分布,你可能需要直接使用 CDF 公式。
Paper B(使用 R 语言)
在以 R 为基础的考试 (CS1B) 中,你会使用标准函数。每个分布都有一个前缀:
- p 代表概率 (CDF):例如
pnorm(x, mean, sd) - q 代表分位数 (Quantile):例如
qexp(0.95, rate) - r 代表产生随机样本 (Random samples):例如
rgamma(100, shape, rate)
重点回顾
- 连续变量是用来测量的,而不是计数的。
- 正态分布是我们的对称基准。
- 对数正态与伽玛分布对于模拟“偏斜”的保险索赔数据至关重要。
- 指数分布是处理等待时间的首选,并具有独特的无记忆性。
- 分位数与概率可以在 Paper A 中通过查表或在 Paper B 中通过 R 函数找到。
做得好!你刚刚已经掌握了连续概率中的核心“角色”。请继续练习这些分布之间的联系,因为它们构成了精算统计学中几乎所有内容的基础。