歡迎來到最大概似估計 (Maximum Likelihood Estimation, MLE) 的世界!
你好!今天我們將深入探討精算師工具箱中最強大的工具之一:最大概似估計,簡稱為 MLE。如果你曾經看著一堆保險理賠數據,心想:「到底哪種數學模型最適合這些數據?」,那麼 MLE 就是你的答案。
你可以把 MLE 想成是一個「逆向工程」的過程。通常我們手上有公式,被要求去計算機率;但在 MLE 中,我們手上已經有了結果(數據),我們正試圖找出最有可能產生這些結果的公式(參數)。如果現在覺得這有點抽象也不用擔心,我們會一步一步拆解給你聽!
1. 核心概念:什麼是概似 (Likelihood)?
想像你有一個硬幣,投擲 10 次後出現 9 次正面。對於正面出現的機率 (\( p \)),你有兩個猜測:0.5(公平硬幣)或 0.9(加權硬幣)。哪一個比較「有可能」?顯然是 0.9!在精算學中,我們對理賠金額(嚴重程度)和理賠次數(頻率)所做的分析也是一樣的道理。
概似函數 \( L(\theta) \):
概似函數是在給定參數 \( \theta \) 的情況下,觀察到我們特定數據集的機率(對於離散數據)或機率密度(對於連續數據)。如果我們有獨立的觀察值 \( x_1, x_2, ..., x_n \),其概似值就是各個觀察值機率的乘積:
\( L(\theta) = f(x_1 | \theta) \times f(x_2 | \theta) \times ... \times f(x_n | \theta) = \prod_{i=1}^{n} f(x_i | \theta) \)
目標: 找到使 \( L(\theta) \) 最大的 \( \theta \) 值。這個值稱為最大概似估計量,記作 \( \hat{\theta} \)。
小貼士:為什麼我們喜歡用對數?
將一堆小數相乘非常麻煩,運用微積分處理乘積更是災難(乘法法則太複雜了!)。為了讓生活輕鬆一點,我們取概似函數的自然對數。這能將乘法轉換為加法:
\( \ell(\theta) = \ln[L(\theta)] = \sum_{i=1}^{n} \ln[f(x_i | \theta)] \)
由於對數函數是「遞增」的,使對數概似函數 (log-likelihood) 達到最大的 \( \theta \),同樣也會使原本的概似函數達到最大!
重點總結: 概似函數不過就是你手中數據發生的機率。我們使用對數是為了讓運算過程更易於管理。
2. 尋找 MLE 的步驟指南
當你在 FAM 考試中遇到 MLE 題目時,請遵循以下步驟:
第一步: 寫下該分佈的密度函數 \( f(x) \) 或機率質量函數 \( p(x) \)。
第二步: 寫出概似函數 \( L(\theta) \)(各項密度的乘積)。
第三步: 取自然對數得到對數概似函數 \( \ell(\theta) \)。
第四步: 對 \( \theta \) 求導:\( \frac{d}{d\theta} \ell(\theta) \)。
第五步: 令導數等於零並解出 \( \theta \)。這就是你的 \( \hat{\theta} \)!
範例:指數分佈 (Exponential Distribution)
如果我們有來自平均值為 \( \theta \) 的指數分佈的理賠數據 \( x_1, ..., x_n \),其密度函數為 \( f(x) = \frac{1}{\theta} e^{-x/\theta} \)。
1. \( L(\theta) = \prod \frac{1}{\theta} e^{-x_i/\theta} = \theta^{-n} e^{-\sum x_i / \theta} \)
2. \( \ell(\theta) = -n \ln(\theta) - \frac{\sum x_i}{\theta} \)
3. \( \frac{d}{d\theta} \ell(\theta) = -\frac{n}{\theta} + \frac{\sum x_i}{\theta^2} = 0 \)
4. 解出 \( \theta \) 得到 \( \hat{\theta} = \frac{\sum x_i}{n} = \bar{x} \)(樣本平均數)。
你知道嗎?對於許多常見的分佈,MLE 就是樣本平均數!這包括指數分佈、卜瓦松分佈 (Poisson) 和伯努利分佈 (Bernoulli)。
3. 嚴重程度 (Severity) 的 MLE:處理截斷與設限
在現實世界中,保險數據很少是「乾淨」的。我們經常要處理自負額 (Deductibles)(左截斷)和保單限額 (Policy Limits)(右設限)。這是 FAM 考試中最熱門的主題之一!
A. 分組數據 (Grouped Data)
有時候我們不知道精確的理賠金額,只知道它落在某個區間(例如:500 元到 1,000 元之間)。對於落在區間 \( (c_{j-1}, c_j] \) 的觀察值,對概似函數的貢獻就是落在該區間的機率:
\( P(c_{j-1} < X \le c_j) = F(c_j) - F(c_{j-1}) \)
B. 設限數據 (Censored Data,保單限額)
如果一筆理賠在限額 \( u \) 處被「設限」,意味著實際理賠金額其實至少是 \( u \),但我們只記錄了 \( u \)。對於這些數據點,我們不使用密度函數 \( f(x) \),而是使用生存函數 (Survival Function) \( S(u) \)。
邏輯: 我們不知道理賠確切的金額,只知道它超過了 \( u \)。
C. 截斷數據 (Truncated Data,自負額)
如果保單有自負額 \( d \),我們只會看到 \( X > d \) 的理賠。這稱為「左截斷」。我們必須使用條件密度函數:
\( f(x | X > d) = \frac{f(x)}{S(d)} \)
快速回顧:概似函數貢獻表
個別、精確數值 \( x \): 使用 \( f(x) \)
在 \( u \) 處設限(限額): 使用 \( S(u) \)
在 \( d \) 處截斷(自負額): 對於每一個此類觀察值,需將整個概似函數除以 \( S(d) \)。
常見錯誤: 出現自負額時忘記除以 \( S(d) \)。如果數據被截斷了,你的機率空間會縮小,因此必須進行「重新歸一化」!
4. 頻率分佈 (Frequency Distributions) 的 MLE
頻率處理的是理賠的「次數」。過程是一樣的,但我們使用機率質量函數 (pmf) 來代替密度函數。
三大常見頻率分佈:
1. 卜瓦松 (Poisson, \( \lambda \)): MLE \( \hat{\lambda} \) 就是樣本平均數 \( \bar{x} \)。
2. 二項分佈 (Binomial, \( m, q \)): 如果 \( m \) 已知,\( \hat{q} = \frac{\bar{x}}{m} \)。
3. 負二項分佈 (Negative Binomial, \( r, \beta \)): 如果 \( r \) 已知,\( \hat{\beta} = \frac{\bar{x}}{r} \)。
等等,如果參數未知怎麼辦?
如果你手上有頻率表(例如:50 人有 0 次理賠,30 人有 1 次理賠等),你的概似函數為:
\( L = [P(X=0)]^{n_0} \times [P(X=1)]^{n_1} \times ... \)
總結: 頻率的 MLE 通常就是找到與觀察到的平均理賠次數相符的參數。
5. MLE 的特性(為什麼我們使用它)
你可能會好奇為什麼我們要進行這麼多微積分運算。當樣本量 \( n \) 變得非常大時,MLE 擁有一些「超能力」:
1. 漸近不偏性 (Asymptotic Unbiasedness): 隨著 \( n \) 增加,偏差趨近於零。
2. 一致性 (Consistency): 隨著 \( n \) 增加,估計值會越來越接近真實值。
3. 漸近常態性 (Asymptotic Normality): 對於大的 \( n \),\( \hat{\theta} \) 的分佈看起來像常態分佈!這讓我們可以建立信賴區間。
4. 不變性 (Invariance): 這是學生最喜歡的特性。如果 \( \theta \) 的 MLE 是 \( \hat{\theta} \),那麼任何函數 \( g(\theta) \) 的 MLE 簡單來說就是 \( g(\hat{\theta}) \)。
範例:如果變異數 \( \sigma^2 \) 的 MLE 是 100,那麼標準差 \( \sigma \) 的 MLE 就是 \( \sqrt{100} = 10 \)。不需要額外的微積分!
FAM 考試最後準備小貼士
1. 練習對數運算: 大多數錯誤發生在簡化 \( \ln(L) \) 的代數過程中。記住 \( \ln(a^b) = b \ln(a) \) 和 \( \ln(ab) = \ln(a) + \ln(b) \)。
2. 留意捷徑: 如果題目要求的是標準分佈(如指數或卜瓦松)參數的 MLE,且沒有設限或截斷,答案幾乎總是樣本平均數。
3. 「自負額」陷阱: 務必檢查數據是「每次付款」(per payment) 還是「每次損失」(per loss)。如果是「每次付款」,數據在自負額 \( d \) 處是被截斷的。
4. 不要驚慌: 如果導數看起來根本解不開,看看選項。有時候你可以直接將選項代入,看看哪一個能使導數為零。
重點總結: MLE 的核心是通過最大化我們實際觀察到數據的機率來找到「最佳擬合」。熟練掌握對數概似函數的步驟以及如何處理自負額,你就離通過 FAM 考試不遠了!