欢迎来到联合分布(Joint Distributions)的世界!

在先前的学习中,我们探讨的都是单一随机变量(Random Variables, RVs),例如单一保单持有人的索赔次数。但在现实世界中,情况往往没那么简单!精算师经常需要同时考虑两个或以上的变量。举例来说,我们可能想知道司机的年龄与其保险索赔成本之间的关系。这时候,就需要用到联合分布随机变量(Jointly Distributed Random Variables)了。

如果初看之下觉得抽象,请不必担心。我们本质上只是从观察单一数值,转变为观察成对(或一组)的数值。你可以把它想象成从 2D 线图升级到 3D 地图的概念。

1. 联合概率分布(Joint Probability Distributions)

当我们有两个随机变量 \(X\) 和 \(Y\) 时,我们会想知道它们同时取特定值的概率。

离散情况:联合概率质量函数(Joint Probability Mass Function, PMF)

若 \(X\) 和 \(Y\) 是离散的,我们使用联合 PMF,记作 \( p(x, y) = P(X = x, Y = y) \)。
黄金法则:联合分布中所有概率的总和必须等于 1。
\( \sum_{all x} \sum_{all y} p(x, y) = 1 \)

连续情况:联合概率密度函数(Joint Probability Density Function, PDF)

若 \(X\) 和 \(Y\) 是连续的,我们使用联合 PDF,记作 \( f(x, y) \)。与其想象成表格,不如把它想象成平面上方的一个“曲面”或“山丘”。曲面下的体积即代表概率。
黄金法则:曲面下的总体积必须等于 1。
\( \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} f(x, y) \,dx \,dy = 1 \)

快速复习:联合累积概率分布函数(Joint CDF)

联合累积概率分布函数(Joint Cumulative Distribution Function, CDF),记作 \( F(x, y) \),是指 \(X\) 小于或等于 \(x\) \(Y\) 小于或等于 \(y\) 的概率:
\( F(x, y) = P(X \le x, Y \le y) \)

重点总结:联合分布描述了两个变量如何共同表现。对于离散变量,想象成一个表格;对于连续变量,则想象成一个 3D 曲面。

2. 边缘分布(Marginal Distributions)

有时候,我们已经掌握了联合分布(“大局”),但只想聚焦于其中一个变量。这就称为求边缘分布(Marginal Distribution)

“消去法”(Summing Out Trick):
要找出 \(X\) 的边缘分布,你实际上是“忽略”或“加总消去”了 \(Y\)。
- 离散: \( p_X(x) = \sum_{all y} p(x, y) \)
- 连续: \( f_X(x) = \int_{-\infty}^{\infty} f(x, y) \,dy \)

记忆小撇步:为什么叫“边缘”(Marginal)?
想象一个概率表格。如果你将每一列(或每一行)加总,并把总数写在纸张的边缘(margins),你就找到了边缘分布!

重点总结:要得到一个变量的边缘分布,只需对另一个变量的整个取值范围进行积分或加总即可。

3. 条件分布(Conditional Distributions)

在精算工作中,我们常会问:“在已知 \(Y\) 值的情况下,\(X\) 的概率是多少?”。这就是条件分布(Conditional Distribution)

其公式源自基本的概率法则 \( P(A|B) = \frac{P(A \cap B)}{P(B)} \):
\( f(x|y) = \frac{f(x, y)}{f_Y(y)} \),前提是 \( f_Y(y) > 0 \)

类比:想象你在观察人口的身高(\(X\))和体重(\(Y\))。身高的边缘分布是所有人的身高。但给定体重为 100kg 的条件下,身高的条件分布则仅是指该特定重磅群体身高分布。

常见错误:搞错分母放哪个变量!永远记得要除以给定变量(即垂直线 | 后面的那个变量)的边缘分布。

4. 随机变量的独立性(Independence of Random Variables)

如果知道一个变量的值完全无法提供关于另一个变量的任何信息,这两个随机变量就是独立的(independent)

从数学上来说,\(X\) 和 \(Y\) 独立,若且唯若它们的联合分布等于其边缘分布的乘积:
离散: \( p(x, y) = p_X(x) \cdot p_Y(y) \)
连续: \( f(x, y) = f_X(x) \cdot f_Y(y) \)

实用提示:如果 \(X\) 的取值范围(限制条件)取决于 \(Y\) 的值(例如 \( 0 < x < y < 1 \)),那么这两个变量就不是独立的!

5. 期望值与协方差(Expectations and Covariance)

我们该如何描述两个变量的“平均”表现及其“链接”呢?

函数 \( g(X, Y) \) 的期望值

要计算两个变量函数的期望值,我们将该函数乘以联合概率,然后进行加总或积分:
\( E[g(X, Y)] = \int \int g(x, y) f(x, y) \,dx \,dy \)

协方差(Covariance)

协方差用来衡量 \(X\) 与 \(Y\) 之间的线性关系。
\( Cov(X, Y) = E[(X - E[X])(Y - E[Y])] \)
计算时更实用的公式是:
\( Cov(X, Y) = E[XY] - E[X]E[Y] \)

  • 若 \( Cov(X, Y) > 0 \):两者呈正相关(同步上升或同步下降)。
  • 若 \( Cov(X, Y) < 0 \):两者呈负相关(方向相反)。
  • 若 \( X \) 和 \( Y \) 独立,则 \( Cov(X, Y) = 0 \)。 (注意:反之则不一定成立!)

相关系数(Correlation Coefficient, \( \rho \))

协方差的数值范围没有限制,这使得比较变得困难。相关系数将协方差标准化,范围落在 -1 到 +1 之间:
\( \rho(X, Y) = \frac{Cov(X, Y)}{\sigma_X \sigma_Y} \)

其中 \( \sigma_X \) 和 \( \sigma_Y \) 分别是标准差。

重点总结:协方差显示关系的方向;相关系数则在标准刻度上同时显示了方向与强度

6. 条件期望值与条件方差(Conditional Expectation and Variance)

这些是 CS1 考试中的“重头戏”,涉及全期望公式(Law of Total Expectation)全方差公式(Law of Total Variance)

全期望公式(Adam's Law)

\( E[X] = E[E[X|Y]] \)
这意味着 \(X\) 的总平均值等于所有条件平均值的平均值。

全方差公式(Eve's Law)

\( Var(X) = E[Var(X|Y)] + Var(E[X|Y]) \)
记忆小撇步:期望值方差 加上 方差期望值”(E-Var + Var-E)。

为什么这很有用?
想象 \(X\) 是一年内的总索赔额,而 \(Y\) 是意外发生的次数。直接计算 \(Var(X)\) 可能很困难,但若已知特定意外次数下的方差,计算起来就简单多了。这些法则让你能够利用较简单的条件组件,“累积”出总方差。

重点总结:这些法则是将复杂问题分解为基于“已知”信息的较小、可管理部分的关键。

学习清单

  • 你能分辨一个联合分布是离散还是连续的吗?
  • 你记得为了求出边缘分布,要将另一个变量“消去”吗?
  • 你的相关系数是否介于 -1 到 1 之间?如果不是,请检查你的计算!
  • 你是否练习过使用 \( E[X] = E[E[X|Y]] \) 来处理复合分布?

如果这些二重积分或条件法则让你觉得沉重,请不用担心。随着练习,你会发现它们其实只是组合数据的简单“食谱”而已!