歡迎來到遷移強度:數據與模型的橋樑!

在你的 CS2 學習之旅中,你可能已經接觸過生存模型,當時遷移強度(如死亡力,\(\mu_x\))通常是直接給定的。但這些數字究竟從何而來?在現實世界中,精算師並不會在教科書裡找到 \(\mu_x\);他們必須從數據中估算出來。

本章將探討我們如何獲取原始數據(例如出生日期和死亡日期列表),並將其轉換為用於養老金和保險定價的遷移強度(transition intensities)。如果一開始覺得有點抽象,別擔心!我們本質上只是計算發生了多少次事件,並除以人們「處於風險之中」的時間長度!

1. 核心原則:死亡力(The Force of Mortality)

在深入數學細節之前,我們先看看估算遷移強度的基本「食譜」(以 \(\mu_x\) 為例):

估算強度 = (死亡人數) / (總曝險時間)

在精算符號中,我們寫作:
\( \hat{\mu}_x = \frac{d_x}{E_x^c} \)

其中:
- \(d_x\) 是在 \(x\) 歲時觀察到的死亡人數。
- \(E_x^c\) 是在 \(x\) 歲時的中心曝險(Central Exposure to Risk)

類比:測速照相機

想像一下,你想知道某條道路的超速「強度」。你計算被抓到的車輛數量(即死亡人數,\(d_x\)),並除以所有車輛在那條道路上行駛的總時間(即曝險,\(E_x^c\))。如果有 10 輛車被抓,且總行駛時間為 100 小時,那麼你的「超速強度」就是每小時 0.1 次。

關鍵點: 要估算強度,我們總是需要兩樣東西:事件發生的次數,以及人們「處於風險之中」的總時間。

2. 計算精確曝險(Exact Exposure)

獲取 \(E_x^c\) 最精確的方法是使用精確數據(Exact Data)。這意味著我們知道每個人進入觀察的確切日期、離開的確切日期(無論是因為死亡、研究結束還是退出),以及他們的確切生日。

計算步驟:

1. 對於研究中的每一個人,計算他們在 \(x\) 歲到 \(x+1\) 歲之間所花費的時間。
2. 如果他們在整個年度都處於觀察狀態,他們對 \(E_x^c\) 的貢獻為 1 年。
3. 如果他們在年中加入,或者在一年中過了 3 個月後死亡,他們分別只貢獻 0.5 或 0.25 年。
4. 將所有人的貢獻相加!

例子: 如果有 3 個人:
- A 君:在 60 歲時被觀察了整整一年。
- B 君:在 60 歲時被觀察了 6 個月,然後死亡。
- C 君:在 60 歲時被觀察了 3 個月,然後研究結束。
則精確中心曝險 \(E_{60}^c = 1 + 0.5 + 0.25 = 1.75\) 人年。

3. 人口普查法(Census Method):處理雜亂數據

在現實中,保險公司往往不會對每位保單持有人都設置「碼表」。相反,他們會在特定日期(例如每年 1 月 1 日)進行「快照」(即人口普查)。

梯形近似法(Trapezium Approximation)

如果我們只知道 2022 年 1 月 1 日 \(x\) 歲的人數 (\(P_{x,0}\)) 和 2023 年 1 月 1 日 \(x\) 歲的人數 (\(P_{x,1}\)),我們假設人口在全年呈線性變化。

中心曝險的公式為:
\( E_x^c \approx \int_0^1 P_{x,t} dt \approx \frac{1}{2} (P_{x,0} + P_{x,1}) \)

你知道嗎? 這被稱為梯形法則(Trapezium Rule),因為如果你將人口隨時間的變化繪製成圖,你本質上是在計算曲線下梯形的面積!

4. 年齡定義與「費率區間」(Rate Interval)

這是學生最容易絆倒的地方。並非所有的「60 歲」都相同!我們需要定義費率區間(Rate Interval)——即我們統計死亡人數和曝險的生命週期段。

常見的年齡定義:

  • 最近生日年齡(Age Last Birthday, \(x\)): 該人處於確切年齡 \(x\) 和 \(x+1\) 之間。(這是我們日常生活中通常說的年齡)。
  • 最接近生日年齡(Age Nearest Birthday, \(x\)): 該人處於確切年齡 \(x - 0.5\) 和 \(x + 0.5\) 之間。
  • 下一個生日年齡(Age Next Birthday, \(x\)): 該人處於確切年齡 \(x-1\) 和 \(x\) 之間。

小貼士: 務必確定區間開始時的平均年齡
- 對於「最近生日年齡 \(x\)」,開始時的平均年齡為 \(x + 0.5\)。
- 對於「最接近生日年齡 \(x\)」,開始時的平均年齡為 \(x\)。

5. 死亡人數的泊松模型(Poisson Model)

在 CS2 中,我們經常假設死亡人數 (\(D_x\)) 服從泊松分佈。這是考試中非常常見的主題!

如果我們假設死亡力 \(\mu_x\) 在年齡區間內是恆定的,那麼:
\( D_x \sim \text{Poisson}(\mu_x \cdot E_x^c) \)

由此,我們可以推導出最大概似估計量 (MLE)
\( \hat{\mu}_x = \frac{d_x}{E_x^c} \)

以及該估計量的變異數(Variance)
\( Var(\hat{\mu}_x) = \frac{\mu_x}{E_x^c} \approx \frac{d_x}{(E_x^c)^2} \)

記憶輔助: 把 \(\mu_x \cdot E_x^c\) 想成「預期死亡人數」。在泊松分佈中,平均值 = \(\lambda\)。所以這裡,\(\lambda = \text{強度} \times \text{曝險}\)。

6. 應避免的常見錯誤

1. 混淆中心曝險與初始曝險: 中心曝險 (\(E_x^c\)) 用於估算強度 (\(\mu_x\))。初始曝險 (\(E_x\)) 用於估算機率 (\(q_x\))。千萬不要搞混!

2. 「半年」規則: 使用人口普查數據時,如果普查是在 7 月 1 日(年中)進行的,而你需要計算日曆年度的曝險,那麼單個普查數 \(P_{x, \text{July}}\) 通常被用作平均人口,因此 \(E_x^c \approx P_{x, \text{July}}\)。

3. \(d_x\) 與 \(E_x^c\) 不匹配: 確保你統計的死亡人數與你計算的曝險所屬的年齡區間和時間段是完全一致的。

總結複習欄

- 目標: 使用 \(\frac{d_x}{E_x^c}\) 估算 \(\mu_x\)。
- 精確數據: 使用每個人實際花費的時間(最準確)。
- 人口普查數據: 使用人口快照並假設線性變化(最實用)。
- 泊松假設: \(D_x \sim \text{Poisson}(\mu_x E_x^c)\)。
- 注意年齡! 檢查數據是「最近生日」、「最接近生日」還是「下一個生日」,以確保你的 \(\mu\) 被分配到正確的年齡。

如果普查公式看起來很嚇人,別擔心!只要記住它們只是估算一年中「平均」存活人數,再乘以 1 年的不同方法而已。