歡迎來到不完整數據的世界!
你好!在準備 Exam FAM 的過程中,你大概已經熟練掌握了針對完美、完整數據集的最大概似估計法 (Maximum Likelihood Estimation, MLE)。但在現實的保險世界中,數據往往並不完美。有時候我們只知道損失「至少」達到某個數額,或者如果損失低於免賠額(deductible),我們甚至根本看不到這筆損失。
在本章中,我們將學習如何調整我們的 MLE「食譜」,以處理設限 (Censored) 和截斷 (Truncated) 數據。如果這些術語聽起來有點技術性,別擔心——我們會用簡單的類比來拆解它們,讓你能夠自信地應對這些考題!
1. 理解術語:設限 vs. 截斷
在我們探討數學原理之前,必須先了解數據發生了什麼事。只要你能辨別數據的類型,公式就很容易套用!
設限 (Censoring):「我知道你在那裡,但我不知道你確切有多大。」
在保險業中,右設限 (Right-Censoring) 是最常見的類型。這通常是由保單限額 (Policy limit) 造成的。
例子: 一份保單的限額為 $10,000。一場大火造成了 $50,000 的損失。保險公司只會將此記錄為 $10,000 的索賠。我們知道實際損失至少是 $10,000,但我們不知道最終的確切數字。
截斷 (Truncation):「如果你不夠大,我甚至不知道你的存在。」
在保險業中,左截斷 (Left-Truncation) 因免賠額 (Deductibles) 而常見。
例子: 一份保單有 $500 的免賠額。如果投保人只有 $300 的損失,他們不會提出索賠。保險公司完全不會收到消息。我們的數據只包含那些「超過」$500 門檻的人。我們遺漏了分佈中底部的所有數據。
快速複習箱:
- 設限 (Censored): 你有一個數據點,但其數值被限制或封頂了。
- 截斷 (Truncated): 某些數據點因低於(或高於)特定數值而完全缺失。
2. 概似函數 (Likelihood Function) 的「積木」
要找到 MLE,我們需要建立一個概似函數 (Likelihood Function),\(L(\theta)\)。你可以把它想像成一個「機率乘積」,每一筆數據都為整體貢獻了一些資訊。
情況 A:精確觀測值
如果我們知道確切數值 \(x\),其貢獻就是機率密度函數 (pdf):
貢獻 = \(f(x)\)
情況 B:在 \(u\) 點右設限
如果我們只知道數值至少為 \(u\),我們就使用存活函數 (survival function)。為什麼呢?因為存活函數 \(S(u)\) 代表大於 \(u\) 的機率。
貢獻 = \(S(u) = 1 - F(u)\)
情況 C:在 \(d\) 點左截斷
這是最棘手的部分。因為我們只在數據已知大於 \(d\) 的前提下才能觀察到它,所以必須使用條件機率。我們將通常的貢獻值除以 \(S(d)\)。
貢獻 = \(\frac{\text{f(x) or S(u)}}{S(d)}\)
3. 組合起來:一般概似公式
如果我們有一組精確值 (\(x_i\)) 和設限值 (\(u_j\)) 的組合,且全部受到一個截斷點 (\(d\)) 的影響,概似函數看起來會像這樣:
\(L(\theta) = \prod_{i=1}^{n} \frac{f(x_i)}{S(d)} \times \prod_{j=1}^{m} \frac{S(u_j)}{S(d)}\)
等等!別慌! 如果沒有截斷,\(d = 0\),而因為 \(S(0) = 1\),分母就會消失。大多數考題一次只會包含其中一兩個元素。
你知道嗎?
學生最常犯的錯誤是在有免賠額時忘記除以 \(S(d)\)。請隨時問自己:「是否存在一個數值,低於該數值我就完全看不到這些索賠?」如果有,那就是截斷!
4. 求解 MLE 問題的逐步指南
請按照以下步驟操作,以避免迷失在代數運算中:
步驟 1:識別組件。
列出你的精確值 (\(x\))、設限值 (\(u\)) 以及截斷點 (\(d\))。
步驟 2:寫出概似函數 \(L(\theta)\)。
將你的數值代入該分佈(如指數分佈或帕累托分佈)的 \(f(x)\) 和 \(S(x)\) 公式中。
步驟 3:取自然對數得到對數概似函數 \(l(\theta)\)。
處理加法比處理乘法容易得多。記得:\(\ln(a \times b) = \ln(a) + \ln(b)\) 以及 \(\ln(a/b) = \ln(a) - \ln(b)\)。
步驟 4:對 \(\theta\) 求導數。
令導數等於零:\(\frac{d}{d\theta} l(\theta) = 0\)。
步驟 5:解出 \(\theta\)。
這就是你的最大概似估計值!
5. 現實世界類比:「約會軟體」模型
想像你正在研究約會軟體上人們的身高,以找出平均身高 (\(\theta\))。
- 精確數據: 人們明確標示身高為 5 呎 10 吋。(使用 \(f(x)\))
- 設限數據: 人們只勾選「6 呎以上」的選項。你不知道他們是 6 呎 1 吋還是 7 呎。(使用 \(S(6)\))
- 截斷數據: 該應用程式設有過濾器,身高未滿 5 呎的人不准註冊。你在數據集中根本看不到他們!(將所有人除以 \(S(5)\))
6. 應避免的常見陷阱
1. 混淆 \(f(x)\) 和 \(F(x)\): 記住,精確點使用 pdf (\(f\)),而設限點(範圍)使用存活函數 (\(S = 1-F\))。
2. 忘記「n」: 當對像 \(\prod S(d)\) 這樣的乘積取對數時,它會變成 \(n \ln S(d)\)。千萬別漏掉這個 \(n\)!
3. 指數分佈捷徑: 對於參數為 \(\theta\)(平均值)的指數分佈,MLE 通常就等於(超過免賠額的平均超額損失)。留意這些模式可以節省時間!
重點摘要
1. 精確值貢獻 \(f(x)\) 到概似函數中。
2. 右設限值(如保單限額)貢獻 \(S(u)\)。
3. 左截斷值(如免賠額)需要除以 \(S(d)\)。
4. 目標: 最大化總乘積的對數,以找到最佳參數 \(\theta\)。
你做得很好!MLE 結合不完整數據是 FAM 中較「硬核」的主題之一,但一旦你識別出 \(f(x)\)、\(S(u)\) 和 \(S(d)\) 的模式,這就變成了一個簡單的組裝遊戲。繼續練習!