欢迎来到复合分布(Compound Distributions)的世界!
你好!今天,我们要深入探讨 CS2 课程中最实用且令人兴奋的章节之一:复合分布。如果你曾好奇保险公司是如何计算一年内预计赔付的总金额,那么你来对地方了。
乍看之下,这个主题似乎是一座公式堆砌成的大山,但请放心!我们会将其拆解成容易消化的小单元。你可以把它想象成一个“两步走”的过程:首先,计算发生了多少次事件;其次,查看每次事件的规模大小。让我们开始吧!
1. 到底什么是复合分布?
简单来说,复合分布代表了一个随机变量的随机总和。在风险建模的世界中,我们通常用它来表示总赔付额 (Aggregate Claim Amount, S)。
想像你经营一家小型保险公司。有两件事是不确定的:
1. N (频率/次数):这个月有多少人会提出索赔?
2. X (严重程度/赔付额):对于每个提出索赔的人,赔付金额是多少?
总成本 \( S \) 就是所有单一索赔的总和:
\( S = X_1 + X_2 + X_3 + ... + X_N \)
重要提示:如果 \( N = 0 \),则 \( S = 0 \)。如果没人提出索赔,总赔付额当然为零!
核心假设
为了让数学运算简便,我们通常假设两件事:
1. 单一赔付额 (\( X_1, X_2, ... \)) 是独立且分布相同 (i.i.d.) 的。这意味着每一次赔付都像重新掷一次相同的骰子。
2. 赔付次数 (\( N \)) 与赔付金额大小 (\( X \)) 是独立的。频率的高低不会改变单次索赔的严重程度。
重点总结:复合分布结合了“有多少次?”(\( N \)) 和“每次多少钱?”(\( X \)) 来告诉我们“总金额是多少”(\( S \))。
2. S 的期望值与方差
别让符号把你吓跑了!我们可以利用 \( N \) 和 \( X \) 的性质,找出总索赔额 \( S \) 的期望值(平均值)和方差。
期望值 (Mean)
这非常直观。如果你预期会有 10 次索赔,而每次平均赔付 $500,你预期总赔付金额就是 $5,000。
\( E[S] = E[N] \times E[X] \)
方差 (Variance)
方差稍微“复杂”一点,因为它包含两个部分。它考虑了索赔次数的不确定性以及每次索赔金额大小的不确定性。
\( Var(S) = E[N]Var(X) + Var(N)(E[X])^2 \)
记忆小撇步:可以把它想象成“全方差公式”(Law of Total Variance)。第一部分 (\( E[N]Var(X) \)) 是来自赔付金额大小的变异,而第二部分 (\( Var(N)(E[X])^2 \)) 则是来自赔付次数的变异。
快速复习箱:
- 总平均值:平均频率 \(\times\) 平均严重程度
- 总方差:(平均频率 \(\times\) 严重程度方差) + (频率方差 \(\times\) 平均严重程度的平方)
3. 生成函数 (Generating Functions)
在 CS2 中,我们经常使用矩生成函数 (MGFs) 和概率生成函数 (PGFs) 来描述分布。对于复合分布,存在一个非常巧妙的关系。
如果 \( S \) 是一个复合分布,其 MGF \( M_S(t) \),可以通过将 \( X \) 的 MGF “代入”到 \( N \) 的 MGF 中得到:
\( M_S(t) = M_N(\ln M_X(t)) \)
等等,为什么会有自然对数?因为总和的 MGF 涉及指数函数!如果你处理的是 PGF(通常用于离散的索赔次数 \( N \)),公式看起来会更简洁:
\( G_S(t) = G_N(G_X(t)) \)
如果一开始觉得很复杂也没关系!只要记住,“总和”的生成函数就是各个组成部分的生成函数进行复合(Composition,即函数套函数)即可。
你知道吗?这种数学上的“嵌套”结构,就是为什么复合分布有时被称为“停止总和”(stopped-sum) 分布的原因!
4. 明星级分布:复合泊松分布 (Compound Poisson Distribution)
你会遇到最常见的复合分布就是复合泊松分布。当赔付次数 \( N \) 服从参数为 \( \lambda \) 的泊松分布时,就会出现这种情况。
为什么它很特别?
因为对于泊松分布,其平均值与方差是相等的!(\( E[N] = Var(N) = \lambda \))。这大大简化了我们的公式:
\( E[S] = \lambda E[X] \)
\( Var(S) = \lambda E[X^2] \)
常见错误:学生经常忘记在复合泊松分布中,\( Var(S) \) 使用的是 \( E[X^2] \)(原始二阶矩),而不是 \( Var(X) \)。在计算时务必检查清楚!
可加性 (Additivity)
如果你有两个独立的复合泊松风险(例如:一个是汽车保险,另一个是房屋保险),它们的总和同样是复合泊松分布!你只需要将它们的 \( \lambda \) 值相加即可。这使得它在大型保险组合建模中非常受欢迎。
重点总结:复合泊松分布是风险建模中的“黄金标准”,因为它在数学上非常“规整”且易于合并计算。
5. 现实案例:面包店
让我们将其应用到现实中。想像一家面包店:
- 每小时的顾客人数 (\( N \)) 服从参数 \( \lambda = 10 \) 的泊松分布。
- 每个顾客的消费金额 (\( X \)) 服从正态分布,平均为 $15,标准差为 $3。
第一步:预计总销售额
\( E[S] = E[N] \times E[X] = 10 \times 15 = \$150 \)
第二步:总销售额方差
我们知道 \( Var(X) = 3^2 = 9 \)。
\( Var(S) = E[N]Var(X) + Var(N)(E[X])^2 \)
\( Var(S) = (10 \times 9) + (10 \times 15^2) = 90 + 2250 = 2340 \)
关键启示:尽管个别消费金额相当稳定(方差低),但总销售额的方差很高,因为顾客的人数会随机波动。
6. 总结与最终建议
我们已经涵盖了复合分布的核心内容。以下是考试的“必知”要点:
1. 定义: \( S \) 是 \( N \) 个随机变量的总和。
2. 公式: 熟记平均值和方差公式;它们是你最好的朋友。
3. 独立性: 在套用这些公式前,务必确认频率与严重程度是否互相独立。
4. 复合泊松: 记住它的特殊性质,特别是简化后的方差公式 (\( \lambda E[X^2] \)) 以及可以将独立泊松过程直接相加的特性。
继续练习吧!复合分布只是基础积木。一旦你掌握了这些,CS2 中更复杂的模型也会感觉容易驾驭得多。你一定可以做到的!