歡迎來到數據估算的世界!
嗨,未來的精算師!在之前的學習中,你可能已經習慣把轉移強度(\(\mu_{x}^{ij}\))和轉移概率(\(p_{x}^{ij}\))當作是現成的數據。但這些數字到底是怎麼來的呢?在真實世界中,我們必須查看歷史數據並進行估算。
在本章中,我們將學習如何使用最大概似估計(Maximum Likelihood Estimation, MLE)方法來找出這些強度的最佳估計值。別擔心,「最大概似」聽起來像個嚇人的統計術語——它其實是一個非常合乎邏輯的概念,意思就是:「讓我們挑選出最能解釋我們所觀察到的數據的數值。」
1. 全局視角:轉移強度
在深入數學細節之前,我們先建立基本概念。在多狀態模型(Multi-State Model,例如:健康-患病-死亡)中,我們想知道從一個狀態轉移到另一個狀態的「力」或「強度」。這就是我們的 \(\mu_{ij}\)。
本章的核心概念取決於我們從數據中收集到的兩項資訊:
1. \(n_{ij}\):從狀態 \(i\) 轉移(跳轉)到狀態 \(j\) 的總觀察次數。
2. \(T_{i}\):所有個體在狀態 \(i\) 停留的總「等待時間」或「佔用時間」。
生活中的類比
想像你在觀察健身房的旋轉門。
- \(n_{ij}\) 就像計算有多少人從大廳走進了重訓區。
- \(T_{i}\) 就像把每個人在大廳逗留的總分鐘數加總起來。
如果有 10 個人走進了重訓區,而所有人待在大廳的總時間是 100 分鐘,那麼轉移的「強度」就是 10/100 = 每分鐘 0.1。
2. 最大概似估計量(MLE)公式
如果我們假設轉移強度在特定時間內是常數,數學運算就會變得非常簡單。對於從狀態 \(i\) 到狀態 \(j\) 的轉移,其 MLE 為:
\(\hat{\mu}_{ij} = \frac{n_{ij}}{T_i}\)
其中:
- \(\hat{\mu}_{ij}\) 是強度的估計值(上面的「帽子」符號代表這是一個估計值)。
- \(n_{ij}\) 是我們觀察到有人從 \(i\) 跳轉到 \(j\) 的次數。
- \(T_i\) 是所有個體「處於風險中」即隨時可能離開狀態 \(i\) 的總時間。
重要提示:此公式適用於所有可能的轉移。如果你有一個三狀態模型(0、1 和 2),你將分別計算 \(\hat{\mu}_{01}\)、\(\hat{\mu}_{02}\)、\(\hat{\mu}_{12}\) 等,每個都使用它們各自的跳轉次數和佔用時間。
關鍵總結
轉移強度的 MLE 其實就是事件數除以風險暴露量(Exposure)。這就是一個比率!
3. 理解概似函數
考試時,你可能需要理解為什麼這個公式有效。「概似函數」(Likelihood Function)\(L\) 代表在給定某個 \(\mu\) 的情況下,觀察到我們特定數據集的概率。
對於一個在狀態中停留時間 \(t\) 然後跳轉到另一個狀態的人,其對概似函數的貢獻為:
\(L = (\text{停留至 } t \text{ 的概率}) \times (\text{在 } t \text{ 時刻跳轉的強度})\)
\(L = e^{-\mu_i \cdot t} \times \mu_{ij}\)
當我們將研究中所有人的這些數值相乘,並運用微積分(取對數並令導數為零)後,就會得出我們漂亮的 \(\hat{\mu} = n/T\) 公式。
你知道嗎?
離開狀態 \(i\) 的總強度(通常記為 \(\mu_i\))僅是離開該狀態的所有強度之和:\(\mu_i = \sum_{j \neq i} \mu_{ij}\)。總離開強度的 MLE 為 \(\hat{\mu}_i = \frac{n_i}{T_i}\),其中 \(n_i\) 是從狀態 \(i\) 離開的總次數。
4. 估算轉移概率
一旦我們有了強度估計值(\(\hat{\mu}_{ij}\)),我們就可以用它們來估算轉移概率(\(p_{ij}(t)\))。
在一個簡單的雙狀態模型(如「常數死亡力」模型)中,在狀態 \(i\) 停留時間 \(t\) 的概率為:
\(\hat{p}_{ii}(t) = e^{-\hat{\mu}_{i} \cdot t}\)
如果你處於一個更複雜的模型(如健康-患病-死亡模型),且假設強度是常數,你只需將 \(\hat{\mu}\) 值代入你在前幾章學過的標準概率公式中(例如柯爾莫哥洛夫前向方程,Kolmogorov Forward Equations)。
分步指南:從數據到概率
1. 計算狀態之間的跳轉次數(\(n_{ij}\))。
2. 加總所有人停留在起始狀態的總時間(\(T_i\))。
3. 相除得出強度:\(\hat{\mu}_{ij} = n_{ij} / T_i\)。
4. 代入強度到概率公式中(例如 \(e^{-\hat{\mu}t}\))。
5. 常見陷阱與錯誤
即使是最優秀的學生也可能在這些細節上摔跤。請特別留意以下幾點:
- 「總時間」陷阱:確保 \(T_i\) 包含了所有在狀態 \(i\) 待過的人,即使是那些從未跳轉到其他狀態的人!他們的「等待時間」仍然算作風險暴露。
- 設限(Censoring):如果有人因為非轉移原因(如研究結束)離開了研究,我們計算他們離開前的時間,但絕對不要把他們計入 \(n_{ij}\) 的跳轉次數中。
- 時間單位:確保你的時間 \(T_i\) 與概率 \(p(t)\) 中的 \(t\) 使用相同的單位(例如:兩者皆為年,或皆為月)。
6. 快速複習箱
目標:估算人們在狀態間移動的速度。
數據:多少人移動了(\(n\))以及群體「處於風險中」的時間有多長(\(T\))。
公式:\(\hat{\mu} = \frac{\text{跳轉次數}}{\text{總時間}}\)。
假設:我們通常假設在我們觀察的區間內,強度是常數。
總結
估算轉移強度是連接原始數據與你一直在構建的複雜精算模型之間的橋樑。通過使用最大概似方法,我們發現最可能的強度僅僅是觀察到的事件數與在該狀態下總停留時間的比率。一旦你有了這些強度,你就可以像往常一樣計算概率、期望值和保費了!
如果剛開始覺得有點棘手,別擔心! 一旦你正確識別了跳轉次數和總時間,數學運算通常就會簡化為簡單的除法。多練習幾個識別 \(n\) 和 \(T\) 的題目,你很快就會成為 MLE 的專家!