歡迎來到估計學的世界!

在先前的學習中,我們將生存模型視為理論上的數學公式。但這些公式究竟從何而來?在現實世界中,我們並沒有一顆能告訴我們精確死亡力(force of mortality)的魔法水晶球。相反,我們擁有的是數據——記錄著人們何時死亡,或何時離開研究的紀錄。

在本章中,我們將學習如何將雜亂無章的現實觀察數據,轉化為清晰的生存狀況圖景。我們將聚焦於兩位估計界的「超級巨星」:Kaplan-MeierNelson-Aalen 估計量。別擔心這些名字聽起來很嚇人;一旦我們將其拆解,你會發現它們其實只是很合乎邏輯的計數方法!

1. 挑戰:什麼是刪失(Censoring)?

在進行任何估計之前,我們必須了解為什麼生存數據如此「棘手」。在大多數統計研究中,你可以看到最終結果;但在生存分析中,我們往往無法看到。這就是所謂的刪失(censoring)

想像一下,你正在追蹤 100 人參與一項為期 5 年的新藥治療研究:

1. 有些人在 5 年內不幸離世(已觀察到的死亡,Observed Deaths)。
2. 有些人在研究結束時仍然活著(右刪失,Right Censoring)。
3. 有些人可能在研究中途搬走或退出(同樣屬於右刪失,Right Censoring)。

關鍵概念:當我們知道個體「至少」存活到某個時間點,但之後確切的死亡時間未知時,就會發生刪失。我們不能忽視這些人!如果只看那些已經死亡的人,我們對生存率的估計將會過於悲觀。

2. Kaplan-Meier (乘積限) 估計量

Kaplan-Meier (KM) 估計量是當你擁有刪失數據時,估計生存函數(Survival Function) \(S(t)\) 最著名的方法。

直觀理解:把生存想像成一連串的跨欄障礙賽。要存活到第 10 天,你必須先撐過第 1 天,然後是第 2 天,依此類推。KM 估計量計算的是跨越每個「障礙」(即每次發生死亡事件的時刻)的存活機率,並將它們相乘。

計算 KM 的步驟:

1. 排列時間:按遞增順序列出發生至少一次死亡的時間點:\(t_1 < t_2 < t_3 \dots\)
2. 計算「風險人群」(At Risk, \(n_i\)):在每個時間點 \(t_i\),計算在該時刻之前仍然活著且在研究中的人數。
3. 計算「死亡人數」(Deaths, \(d_i\)):在時間點 \(t_i\) 準確死亡的人數有多少?
4. 計算步驟:該特定時間點的存活機率為 \((1 - \frac{d_i}{n_i})\)。
5. 相乘:要找到直到時間 \(t\) 為止的存活機率,將所有個別的機率相乘。

公式:
\(\hat{S}(t) = \prod_{i: t_i \le t} (1 - \frac{d_i}{n_i})\)

快速複習盒:
- 如果沒有人死亡,生存曲線保持平坦。
- 當有人死亡時,曲線向下「階梯式」下降。
- 當有人被刪失時,曲線不會移動,但「風險人群數量」(\(n_i\)) 會在下一次死亡時間計算時減少。

3. Nelson-Aalen 估計量

雖然 Kaplan-Meier 專注於生存函數,但 Nelson-Aalen (NA) 估計量則專注於累積風險函數(Cumulative Hazard Function),\(\Lambda(t)\)。

直觀理解:將風險視為隨時間累積的「風險點」。每當有人死亡,我們就在「風險桶」中增加一點點數值。

計算 NA 的步驟:

1. 按照與 KM 相同的步驟,在每個死亡時間點找出 \(d_i\) 和 \(n_i\)。
2. 我們不再相乘,而是將這些比率相加
3. 每個死亡時間點的增量是 \(\frac{d_i}{n_i}\)。

公式:
\(\hat{\Lambda}(t) = \sum_{i: t_i \le t} \frac{d_i}{n_i}\)

你知道嗎?你可以利用關係式 \(S(t) = \exp(-\Lambda(t))\) 將 Nelson-Aalen 估計量轉回生存估計量。在某些語境下,這通常被稱為 Breslow 估計量,但對於 CS2 考試,你只需要記住生存與累積風險之間的連結即可!

4. KM 與 Nelson-Aalen 的比較

你可能會問:「我應該用哪一個?」
- KM 通常在估計生存率時更受青睞,因為它是一種直接的「乘積限」方法。
- NA 常用於我們更關注發生率(風險),或在數學模型中風險相加比生存機率相乘更方便時使用。

注意:對於樣本數非常大的情況,這兩種方法得出的結果幾乎完全相同!

5. 衡量準確性:Greenwood 公式

估計只是基於數據的猜測。我們需要知道這個猜測有多「可靠」。對於 Kaplan-Meier 估計量,我們使用 Greenwood 公式 來計算變異數(Variance)

公式:
\(Var(\hat{S}(t)) \approx [\hat{S}(t)]^2 \sum_{i: t_i \le t} \frac{d_i}{n_i(n_i - d_i)}\)

如果這看起來很複雜,別擔心!只要把它記作一個兩部分的食譜:
1. 當前生存估計值的平方:\([\hat{S}(t)]^2\)
2. 乘以那些「死亡比率」項的總和。

考試小撇步:考試時務必保持一個表格,包含 \(t_i\)、\(n_i\)、\(d_i\) 以及 \(\frac{d_i}{n_i(n_i - d_i)}\) 這一項的欄位。這會讓計算總和時更不容易出錯!

6. 常見錯誤避坑指南

1. 「風險人群」計數:學生經常忘記扣除被刪失的個體。如果某人在時間 5 被刪失,他們會被包含在時間 5 的死亡「風險人群」計數中,但在時間 5.1 或之後的任何死亡計算中則必須被剔除
2. 排列時間:務必再次檢查你的時間是否已正確排序。任何一個放錯位置的時間點都可能毀掉整個乘積計算。
3. 同時發生(Ties):如果死亡和刪失發生在完全相同的時間點,IFoA 的慣例通常是假設死亡先發生(這意味著在死亡的那一刻,被刪失的人仍然處於「風險」狀態)。請仔細閱讀題目要求!

7. 總結與關鍵要點

關鍵要點 1:生存數據因刪失而獨特——我們並不總能觀察到事件的發生。

關鍵要點 2:Kaplan-Meier 估計量是每個死亡時間點生存機率的乘積:\(\hat{S}(t) = \prod (1 - \frac{d_i}{n_i})\)。

關鍵要點 3:Nelson-Aalen 估計量是風險增量的總和:\(\hat{\Lambda}(t) = \sum \frac{d_i}{n_i}\)。

關鍵要點 4:使用 Greenwood 公式 計算變異數,並在你的生存曲線周圍建立信賴區間。

做得好!你剛剛掌握了精算師分析壽命數據的核心工具。多練習幾道表格類題目,這些公式就會成為你的直覺反應。