欢迎来到数据估算的世界!

嗨,未来的精算师!在之前的学习中,你可能已经习惯把转移强度(\(\mu_{x}^{ij}\))和转移概率(\(p_{x}^{ij}\))当作是现成的数据。但这些数字到底是怎么来的呢?在真实世界中,我们必须查看历史数据并进行估算

在本章中,我们将学习如何使用最大似然估计(Maximum Likelihood Estimation, MLE)方法来找出这些强度的最佳估计值。别担心,「最大似然」听起来像个吓人的统计术语——它其实是一个非常合乎逻辑的概念,意思就是:「让我们挑选出最能解释我们所观察到的数据的数值。」

1. 全局视角:转移强度

在深入数学细节之前,我们先建立基本概念。在多状态模型(Multi-State Model,例如:健康-患病-死亡)中,我们想知道从一个状态转移到另一个状态的「力」或「强度」。这就是我们的 \(\mu_{ij}\)。

本章的核心概念取决于我们从数据中收集到的两项信息:
1. \(n_{ij}\):从状态 \(i\) 转移(跳转)到状态 \(j\) 的总观察次数。
2. \(T_{i}\):所有个体在状态 \(i\) 停留的总「等待时间」或「占用时间」。

生活中的类比

想象你在观察健身房的旋转门。
- \(n_{ij}\) 就像计算有多少人从大厅走进了重训区。
- \(T_{i}\) 就像把每个人在大厅逗留的总分钟数加总起来。
如果有 10 个人走进了重训区,而所有人待在大厅的总时间是 100 分钟,那么转移的「强度」就是 10/100 = 每分钟 0.1。

2. 最大似然估计量(MLE)公式

如果我们假设转移强度在特定时间内是常数,数学运算就会变得非常简单。对于从状态 \(i\) 到状态 \(j\) 的转移,其 MLE 为:

\(\hat{\mu}_{ij} = \frac{n_{ij}}{T_i}\)

其中:
- \(\hat{\mu}_{ij}\) 是强度的估计值(上面的「帽子」符号代表这是一个估计值)。
- \(n_{ij}\) 是我们观察到有人从 \(i\) 跳转到 \(j\) 的次数。
- \(T_i\) 是所有个体「处于风险中」即随时可能离开状态 \(i\) 的总时间。

重要提示:此公式适用于所有可能的转移。如果你有一个三状态模型(0、1 和 2),你将分别计算 \(\hat{\mu}_{01}\)、\(\hat{\mu}_{02}\)、\(\hat{\mu}_{12}\) 等,每个都使用它们各自的跳转次数和占用时间。

关键总结

转移强度的 MLE 其实就是事件数除以风险暴露量(Exposure)。这就是一个比率!

3. 理解似然函数

考试时,你可能需要理解为什么这个公式有效。「似然函数」(Likelihood Function)\(L\) 代表在给定某个 \(\mu\) 的情况下,观察到我们特定数据集的概率。

对于一个在状态中停留时间 \(t\) 然后跳转到另一个状态的人,其对似然函数的贡献为:
\(L = (\text{停留至 } t \text{ 的概率}) \times (\text{在 } t \text{ 时刻跳转的强度})\)
\(L = e^{-\mu_i \cdot t} \times \mu_{ij}\)

当我们把研究中所有人的这些数值相乘,并运用微积分(取对数并令导数为零)后,就会得出我们漂亮的 \(\hat{\mu} = n/T\) 公式。

你知道吗?
离开状态 \(i\) 的总强度(通常记为 \(\mu_i\))仅是离开该状态的所有强度之和:\(\mu_i = \sum_{j \neq i} \mu_{ij}\)。总离开强度的 MLE 为 \(\hat{\mu}_i = \frac{n_i}{T_i}\),其中 \(n_i\) 是从状态 \(i\) 离开的总次数。

4. 估算转移概率

一旦我们有了强度估计值(\(\hat{\mu}_{ij}\)),我们就可以用它们来估算转移概率(\(p_{ij}(t)\))。

在一个简单的双状态模型(如「常数死亡力」模型)中,在状态 \(i\) 停留时间 \(t\) 的概率为:
\(\hat{p}_{ii}(t) = e^{-\hat{\mu}_{i} \cdot t}\)

如果你处于一个更复杂的模型(如健康-患病-死亡模型),且假设强度是常数,你只需将 \(\hat{\mu}\) 值代入你在前几章学过的标准概率公式中(例如柯尔莫哥洛夫前向方程,Kolmogorov Forward Equations)。

分步指南:从数据到概率

1. 计算状态之间的跳转次数(\(n_{ij}\))。
2. 加总所有人停留在起始状态的总时间(\(T_i\))。
3. 相除得出强度:\(\hat{\mu}_{ij} = n_{ij} / T_i\)。
4. 代入强度到概率公式中(例如 \(e^{-\hat{\mu}t}\))。

5. 常见陷阱与错误

即使是最优秀的学员也可能在这些细节上摔跤。请特别留意以下几点:

  • 「总时间」陷阱:确保 \(T_i\) 包含了所有在状态 \(i\) 待过的人,即使是那些从未跳转到其他状态的人!他们的「等待时间」仍然算作风险暴露。
  • 设限(Censoring):如果有人因为非转移原因(如研究结束)离开了研究,我们计算他们离开前的时间,但绝对不要把他们计入 \(n_{ij}\) 的跳转次数中。
  • 时间单位:确保你的时间 \(T_i\) 与概率 \(p(t)\) 中的 \(t\) 使用相同的单位(例如:两者皆为年,或皆为月)。

6. 快速复习箱

目标:估算人们在状态间移动的速度。
数据:多少人移动了(\(n\))以及群体「处于风险中」的时间有多长(\(T\))。
公式:\(\hat{\mu} = \frac{\text{跳转次数}}{\text{总时间}}\)。
假设:我们通常假设在我们观察的区间内,强度是常数

总结

估算转移强度是连接原始数据与你一直在构建的复杂精算模型之间的桥梁。通过使用最大似然方法,我们发现最可能的强度仅仅是观察到的事件数与在该状态下总停留时间的比率。一旦你有了这些强度,你就可以像往常一样计算概率、期望值和保费了!

如果刚开始觉得有点棘手,别担心! 一旦你正确识别了跳转次数和总时间,数学运算通常就会简化为简单的除法。多练习几个识别 \(n\) 和 \(T\) 的题目,你很快就会成为 MLE 的专家!