欢迎来到联合分布(Joint Distributions)的世界!
在先前的学习中,我们探讨的都是单一随机变量(Random Variables, RVs),例如单一保单持有人的索赔次数。但在现实世界中,情况往往没那么简单!精算师经常需要同时考虑两个或以上的变量。举例来说,我们可能想知道司机的年龄与其保险索赔成本之间的关系。这时候,就需要用到联合分布随机变量(Jointly Distributed Random Variables)了。
如果初看之下觉得抽象,请不必担心。我们本质上只是从观察单一数值,转变为观察成对(或一组)的数值。你可以把它想象成从 2D 线图升级到 3D 地图的概念。
1. 联合概率分布(Joint Probability Distributions)
当我们有两个随机变量 \(X\) 和 \(Y\) 时,我们会想知道它们同时取特定值的概率。
离散情况:联合概率质量函数(Joint Probability Mass Function, PMF)
若 \(X\) 和 \(Y\) 是离散的,我们使用联合 PMF,记作 \( p(x, y) = P(X = x, Y = y) \)。
黄金法则:联合分布中所有概率的总和必须等于 1。
\( \sum_{all x} \sum_{all y} p(x, y) = 1 \)
连续情况:联合概率密度函数(Joint Probability Density Function, PDF)
若 \(X\) 和 \(Y\) 是连续的,我们使用联合 PDF,记作 \( f(x, y) \)。与其想象成表格,不如把它想象成平面上方的一个“曲面”或“山丘”。曲面下的体积即代表概率。
黄金法则:曲面下的总体积必须等于 1。
\( \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} f(x, y) \,dx \,dy = 1 \)
快速复习:联合累积概率分布函数(Joint CDF)
联合累积概率分布函数(Joint Cumulative Distribution Function, CDF),记作 \( F(x, y) \),是指 \(X\) 小于或等于 \(x\) 且 \(Y\) 小于或等于 \(y\) 的概率:
\( F(x, y) = P(X \le x, Y \le y) \)
重点总结:联合分布描述了两个变量如何共同表现。对于离散变量,想象成一个表格;对于连续变量,则想象成一个 3D 曲面。
2. 边缘分布(Marginal Distributions)
有时候,我们已经掌握了联合分布(“大局”),但只想聚焦于其中一个变量。这就称为求边缘分布(Marginal Distribution)。
“消去法”(Summing Out Trick):
要找出 \(X\) 的边缘分布,你实际上是“忽略”或“加总消去”了 \(Y\)。
- 离散: \( p_X(x) = \sum_{all y} p(x, y) \)
- 连续: \( f_X(x) = \int_{-\infty}^{\infty} f(x, y) \,dy \)
记忆小撇步:为什么叫“边缘”(Marginal)?
想象一个概率表格。如果你将每一列(或每一行)加总,并把总数写在纸张的边缘(margins),你就找到了边缘分布!
重点总结:要得到一个变量的边缘分布,只需对另一个变量的整个取值范围进行积分或加总即可。
3. 条件分布(Conditional Distributions)
在精算工作中,我们常会问:“在已知 \(Y\) 值的情况下,\(X\) 的概率是多少?”。这就是条件分布(Conditional Distribution)。
其公式源自基本的概率法则 \( P(A|B) = \frac{P(A \cap B)}{P(B)} \):
\( f(x|y) = \frac{f(x, y)}{f_Y(y)} \),前提是 \( f_Y(y) > 0 \)
类比:想象你在观察人口的身高(\(X\))和体重(\(Y\))。身高的边缘分布是所有人的身高。但给定体重为 100kg 的条件下,身高的条件分布则仅是指该特定重磅群体身高分布。
常见错误:搞错分母放哪个变量!永远记得要除以给定变量(即垂直线 | 后面的那个变量)的边缘分布。
4. 随机变量的独立性(Independence of Random Variables)
如果知道一个变量的值完全无法提供关于另一个变量的任何信息,这两个随机变量就是独立的(independent)。
从数学上来说,\(X\) 和 \(Y\) 独立,若且唯若它们的联合分布等于其边缘分布的乘积:
离散: \( p(x, y) = p_X(x) \cdot p_Y(y) \)
连续: \( f(x, y) = f_X(x) \cdot f_Y(y) \)
实用提示:如果 \(X\) 的取值范围(限制条件)取决于 \(Y\) 的值(例如 \( 0 < x < y < 1 \)),那么这两个变量就不是独立的!
5. 期望值与协方差(Expectations and Covariance)
我们该如何描述两个变量的“平均”表现及其“链接”呢?
函数 \( g(X, Y) \) 的期望值
要计算两个变量函数的期望值,我们将该函数乘以联合概率,然后进行加总或积分:
\( E[g(X, Y)] = \int \int g(x, y) f(x, y) \,dx \,dy \)
协方差(Covariance)
协方差用来衡量 \(X\) 与 \(Y\) 之间的线性关系。
\( Cov(X, Y) = E[(X - E[X])(Y - E[Y])] \)
计算时更实用的公式是:
\( Cov(X, Y) = E[XY] - E[X]E[Y] \)
- 若 \( Cov(X, Y) > 0 \):两者呈正相关(同步上升或同步下降)。
- 若 \( Cov(X, Y) < 0 \):两者呈负相关(方向相反)。
- 若 \( X \) 和 \( Y \) 独立,则 \( Cov(X, Y) = 0 \)。 (注意:反之则不一定成立!)
相关系数(Correlation Coefficient, \( \rho \))
协方差的数值范围没有限制,这使得比较变得困难。相关系数将协方差标准化,范围落在 -1 到 +1 之间:
\( \rho(X, Y) = \frac{Cov(X, Y)}{\sigma_X \sigma_Y} \)
其中 \( \sigma_X \) 和 \( \sigma_Y \) 分别是标准差。
重点总结:协方差显示关系的方向;相关系数则在标准刻度上同时显示了方向与强度。
6. 条件期望值与条件方差(Conditional Expectation and Variance)
这些是 CS1 考试中的“重头戏”,涉及全期望公式(Law of Total Expectation)与全方差公式(Law of Total Variance)。
全期望公式(Adam's Law)
\( E[X] = E[E[X|Y]] \)
这意味着 \(X\) 的总平均值等于所有条件平均值的平均值。
全方差公式(Eve's Law)
\( Var(X) = E[Var(X|Y)] + Var(E[X|Y]) \)
记忆小撇步:“期望值的方差 加上 方差的期望值”(E-Var + Var-E)。
为什么这很有用?
想象 \(X\) 是一年内的总索赔额,而 \(Y\) 是意外发生的次数。直接计算 \(Var(X)\) 可能很困难,但若已知特定意外次数下的方差,计算起来就简单多了。这些法则让你能够利用较简单的条件组件,“累积”出总方差。
重点总结:这些法则是将复杂问题分解为基于“已知”信息的较小、可管理部分的关键。
学习清单
- 你能分辨一个联合分布是离散还是连续的吗?
- 你记得为了求出边缘分布,要将另一个变量“消去”吗?
- 你的相关系数是否介于 -1 到 1 之间?如果不是,请检查你的计算!
- 你是否练习过使用 \( E[X] = E[E[X|Y]] \) 来处理复合分布?
如果这些二重积分或条件法则让你觉得沉重,请不用担心。随着练习,你会发现它们其实只是组合数据的简单“食谱”而已!