欢迎来到迁移强度:数据与模型的桥梁!

在你的 CS2 学习之旅中,你可能已经接触过生存模型,当时迁移强度(如死亡力,\(\mu_x\))通常是直接给定的。但这些数字究竟从何而来?在现实世界中,精算师并不会在教科书里找到 \(\mu_x\);他们必须从数据中估算出来。

本章将探讨我们如何获取原始数据(例如出生日期和死亡日期列表),并将其转换为用于养老金和保险定价的迁移强度(transition intensities)。如果一开始觉得有点抽象,别担心!我们本质上只是计算发生了多少次事件,并除以人们“处于风险之中”的时间长度!

1. 核心原则:死亡力(The Force of Mortality)

在深入数学细节之前,我们先看看估算迁移强度的基本“食谱”(以 \(\mu_x\) 为例):

估算强度 = (死亡人数) / (总曝险时间)

在精算符号中,我们写作:
\( \hat{\mu}_x = \frac{d_x}{E_x^c} \)

其中:
- \(d_x\) 是在 \(x\) 岁时观察到的死亡人数。
- \(E_x^c\) 是在 \(x\) 岁时的中心曝险(Central Exposure to Risk)

类比:测速照相机

想象一下,你想知道某条道路的超速“强度”。你计算被抓到的车辆数量(即死亡人数,\(d_x\)),并除以所有车辆在那条道路上行驶的总时间(即曝险,\(E_x^c\))。如果有 10 辆车被抓,且总行驶时间为 100 小时,那么你的“超速强度”就是每小时 0.1 次。

关键点: 要估算强度,我们总是需要两样东西:事件发生的次数,以及人们“处于风险之中”的总时间。

2. 计算精确曝险(Exact Exposure)

获取 \(E_x^c\) 最精确的方法是使用精确数据(Exact Data)。这意味着我们知道每个人进入观察的确切日期、离开的确切日期(无论是由于死亡、研究结束还是退出),以及他们的确切生日。

计算步骤:

1. 对于研究中的每一个人,计算他们在 \(x\) 岁到 \(x+1\) 岁之间所花费的时间。
2. 如果他们在整个年度都处于观察状态,他们对 \(E_x^c\) 的贡献为 1 年。
3. 如果他们在年中加入,或者在一年中过了 3 个月后死亡,他们分别只贡献 0.5 或 0.25 年。
4. 将所有人的贡献相加!

例子: 如果有 3 个人:
- A 君:在 60 岁时被观察了整整一年。
- B 君:在 60 岁时被观察了 6 个月,然后死亡。
- C 君:在 60 岁时被观察了 3 个月,然后研究结束。
则精确中心曝险 \(E_{60}^c = 1 + 0.5 + 0.25 = 1.75\) 人年。

3. 人口普查法(Census Method):处理杂乱数据

在现实中,保险公司往往不会对每位保单持有人都设置“码表”。相反,他们会在特定日期(例如每年 1 月 1 日)进行“快照”(即人口普查)。

梯形近似法(Trapezium Approximation)

如果我们只知道 2022 年 1 月 1 日 \(x\) 岁的人数 (\(P_{x,0}\)) 和 2023 年 1 月 1 日 \(x\) 岁的人数 (\(P_{x,1}\)),我们假设人口在全年呈线性变化。

中心曝险的公式为:
\( E_x^c \approx \int_0^1 P_{x,t} dt \approx \frac{1}{2} (P_{x,0} + P_{x,1}) \)

你知道吗? 这被称为梯形法则(Trapezium Rule),因为如果你将人口随时间的变化绘制成图,你本质上是在计算曲线下梯形的面积!

4. 年龄定义与“费率区间”(Rate Interval)

这是学生最容易绊倒的地方。并非所有的“60 岁”都相同!我们需要定义费率区间(Rate Interval)——即我们统计死亡人数和曝险的生命周期段。

常见的年龄定义:

  • 最近生日年龄(Age Last Birthday, \(x\)): 该人处于确切年龄 \(x\) 和 \(x+1\) 之间。(这是我们日常生活中通常说的年龄)。
  • 最接近生日年龄(Age Nearest Birthday, \(x\)): 该人处于确切年龄 \(x - 0.5\) 和 \(x + 0.5\) 之间。
  • 下一个生日年龄(Age Next Birthday, \(x\)): 该人处于确切年龄 \(x-1\) 和 \(x\) 之间。

小贴士: 务必确定区间开始时的平均年龄
- 对于“最近生日年龄 \(x\)”,开始时的平均年龄为 \(x + 0.5\)。
- 对于“最接近生日年龄 \(x\)”,开始时的平均年龄为 \(x\)。

5. 死亡人数的泊松模型(Poisson Model)

在 CS2 中,我们经常假设死亡人数 (\(D_x\)) 服从泊松分布。这是考试中非常常见的主题!

如果我们假设死亡力 \(\mu_x\) 在年龄区间内是恒定的,那么:
\( D_x \sim \text{Poisson}(\mu_x \cdot E_x^c) \)

由此,我们可以推导出最大似然估计量 (MLE)
\( \hat{\mu}_x = \frac{d_x}{E_x^c} \)

以及该估计量的方差(Variance)
\( Var(\hat{\mu}_x) = \frac{\mu_x}{E_x^c} \approx \frac{d_x}{(E_x^c)^2} \)

记忆辅助: 把 \(\mu_x \cdot E_x^c\) 想成“预期死亡人数”。在泊松分布中,平均值 = \(\lambda\)。所以这里,\(\lambda = \text{强度} \times \text{曝险}\)。

6. 应避免的常见错误

1. 混淆中心曝险与初始曝险: 中心曝险 (\(E_x^c\)) 用于估算强度 (\(\mu_x\))。初始曝险 (\(E_x\)) 用于估算概率 (\(q_x\))。千万不要搞混!

2. “半年”规则: 使用人口普查数据时,如果普查是在 7 月 1 日(年中)进行的,而你需要计算日历年度的曝险,那么单个普查数 \(P_{x, \text{July}}\) 通常被用作平均人口,因此 \(E_x^c \approx P_{x, \text{July}}\)。

3. \(d_x\) 与 \(E_x^c\) 不匹配: 确保你统计的死亡人数与你计算的曝险所属的年龄区间和时间段是完全一致的。

总结复习栏

- 目标: 使用 \(\frac{d_x}{E_x^c}\) 估算 \(\mu_x\)。
- 精确数据: 使用每个人实际花费的时间(最准确)。
- 人口普查数据: 使用人口快照并假设线性变化(最实用)。
- 泊松假设: \(D_x \sim \text{Poisson}(\mu_x E_x^c)\)。
- 注意年龄! 检查数据是“最近生日”、“最接近生日”还是“下一个生日”,以确保你的 \(\mu\) 被分配到正确的年龄。

如果普查公式看起来很吓人,别担心!只要记住它们只是估算一年中“平均”存活人数,再乘以 1 年的不同方法而已。