欢迎来到估计学的世界!

在先前的学习中,我们将生存模型视为理论上的数学公式。但这些公式究竟从何而来?在现实世界中,我们并没有一颗能告诉我们精确死亡力(force of mortality)的魔法水晶球。相反,我们拥有的是数据——记录着人们何时死亡,或何时离开研究的纪录。

在本章中,我们将学习如何将杂乱无章的现实观察数据,转化为清晰的生存状况图景。我们将聚焦于两位估计界的“超级巨星”:Kaplan-MeierNelson-Aalen 估计量。别担心这些名字听起来很吓人;一旦我们将其拆解,你会发现它们其实只是很合乎逻辑的计数方法!

1. 挑战:什么是删失(Censoring)?

在进行任何估计之前,我们必须了解为什么生存数据如此“棘手”。在大多数统计研究中,你可以看到最终结果;但在生存分析中,我们往往无法看到。这就是所谓的删失(censoring)

想象一下,你正在追踪 100 人参与一项为期 5 年的新药治疗研究:

1. 有些人在 5 年内不幸离世(已观察到的死亡,Observed Deaths)。
2. 有些人在研究结束时仍然活着(右删失,Right Censoring)。
3. 有些人可能在研究中途搬走或退出(同样属于右删失,Right Censoring)。

关键概念:当我们知道个体“至少”存活到某个时间点,但之后确切的死亡时间未知时,就会发生删失。我们不能忽视这些人!如果只看那些已经死亡的人,我们对生存率的估计将会过于悲观。

2. Kaplan-Meier (乘积限) 估计量

Kaplan-Meier (KM) 估计量是当你拥有删失数据时,估计生存函数(Survival Function) \(S(t)\) 最著名的方法。

直观理解:把生存想象成一连串的跨栏障碍赛。要存活到第 10 天,你必须先撑过第 1 天,然后是第 2 天,依此类推。KM 估计量计算的是跨越每个“障碍”(即每次发生死亡事件的时刻)的存活概率,并将它们相乘。

计算 KM 的步骤:

1. 排列时间:按递增顺序列出发生至少一次死亡的时间点:\(t_1 < t_2 < t_3 \dots\)
2. 计算“风险人群”(At Risk, \(n_i\)):在每个时间点 \(t_i\),计算在该时刻之前仍然活着且在研究中的人数。
3. 计算“死亡人数”(Deaths, \(d_i\)):在时间点 \(t_i\) 准确死亡的人数有多少?
4. 计算步骤:该特定时间点的存活概率为 \((1 - \frac{d_i}{n_i})\)。
5. 相乘:要找到直到时间 \(t\) 为止的存活概率,将所有个别的概率相乘。

公式:
\(\hat{S}(t) = \prod_{i: t_i \le t} (1 - \frac{d_i}{n_i})\)

快速复习盒:
- 如果没有人死亡,生存曲线保持平坦。
- 当有人死亡时,曲线向下“阶梯式”下降。
- 当有人被删失时,曲线不会移动,但“风险人群数量”(\(n_i\)) 会在下一次死亡时间计算时减少。

3. Nelson-Aalen 估计量

虽然 Kaplan-Meier 专注于生存函数,但 Nelson-Aalen (NA) 估计量则专注于累积风险函数(Cumulative Hazard Function),\(\Lambda(t)\)。

直观理解:将风险视为随时间累积的“风险点”。每当有人死亡,我们就在“风险桶”中增加一点点数值。

计算 NA 的步骤:

1. 按照与 KM 相同的步骤,在每个死亡时间点找出 \(d_i\) 和 \(n_i\)。
2. 我们不再相乘,而是将这些比率相加
3. 每个死亡时间点的增量是 \(\frac{d_i}{n_i}\)。

公式:
\(\hat{\Lambda}(t) = \sum_{i: t_i \le t} \frac{d_i}{n_i}\)

你知道吗?你可以利用关系式 \(S(t) = \exp(-\Lambda(t))\) 将 Nelson-Aalen 估计量转回生存估计量。在某些语境下,这通常被称为 Breslow 估计量,但对于 CS2 考试,你只需要记住生存与累积风险之间的连接即可!

4. KM 与 Nelson-Aalen 的比较

你可能会问:“我应该用哪一个?”
- KM 通常在估计生存率时更受青睐,因为它是一种直接的“乘积限”方法。
- NA 常用语我们更关注发生率(风险),或在数学模型中风险相加比生存概率相乘更方便时使用。

注意:对于样本数非常大的情况,这两种方法得出的结果几乎完全相同!

5. 衡量准确性:Greenwood 公式

估计只是基于数据的猜测。我们需要知道这个猜测有多“可靠”。对于 Kaplan-Meier 估计量,我们使用 Greenwood 公式 来计算方差(Variance)

公式:
\(Var(\hat{S}(t)) \approx [\hat{S}(t)]^2 \sum_{i: t_i \le t} \frac{d_i}{n_i(n_i - d_i)}\)

如果这看起来很复杂,别担心!只要把它记作一个两部分的食谱:
1. 当前生存估计值的平方:\([\hat{S}(t)]^2\)
2. 乘以那些“死亡比率”项的总和。

考试小贴士:考试时务必保持一个表格,包含 \(t_i\)、\(n_i\)、\(d_i\) 以及 \(\frac{d_i}{n_i(n_i - d_i)}\) 这一项的栏位。这会让计算总和时更不容易出错!

6. 常见错误避坑指南

1. “风险人群”计数:学生经常忘记扣除被删失的个体。如果某人在时间 5 被删失,他们会被包含在时间 5 的死亡“风险人群”计数中,但在时间 5.1 或之后的任何死亡计算中则必须被剔除
2. 排列时间:务必再次检查你的时间是否已正确排序。任何一个放错位置的时间点都可能毁掉整个乘积计算。
3. 同时发生(Ties):如果死亡和删失发生在完全相同的时间点,IFoA 的惯例通常是假设死亡先发生(这意味着在死亡的那一刻,被删失的人仍然处于“风险”状态)。请仔细阅读题目要求!

7. 总结与关键要点

关键要点 1:生存数据因删失而独特——我们并不总能观察到事件的发生。

关键要点 2:Kaplan-Meier 估计量是每个死亡时间点生存概率的乘积:\(\hat{S}(t) = \prod (1 - \frac{d_i}{n_i})\)。

关键要点 3:Nelson-Aalen 估计量是风险增量的总和:\(\hat{\Lambda}(t) = \sum \frac{d_i}{n_i}\)。

关键要点 4:使用 Greenwood 公式 计算方差,并在你的生存曲线周围建立置信区间。

做得好!你刚刚掌握了精算师分析寿命数据的核心工具。多练习几道表格类题目,这些公式就会成为你的直觉反应。