簡介:尋找「最佳」模型

在之前的章節中,我們探討了廣義線性模型 (GLMs) 的基本組成部分:指數族 (exponential family)、連結函數 (link functions) 和線性預測值 (linear predictors)。現在,我們進入了流程中的「決策」階段。我們實際上是如何計算模型的參數呢?而當我們建立了一個模型後,又該如何判斷它是否真的理想,或者另一個模型會否更好?

把這一章看作精算建模中的品質控制 (quality control) 階段。我們將學習如何估計參數的「最佳」數值,並利用一個名為偏差 (Deviance) 的強大工具來比較不同的模型。如果一開始覺得數學公式很艱澀,別擔心;我們會將其拆解成邏輯清晰的步驟,即使是對數學感到畏懼的同學也能輕鬆跟上。


1. 估計參數:極大似然法

在簡單線性回歸中,我們通常使用「最小平方法」(Least Squares) 來尋找最佳擬合線。在 GLM 中,我們使用一種更通用的方法,稱為極大似然估計 (Maximum Likelihood Estimation, MLE)

核心概念

MLE 的目標是尋找一組參數值(線性預測值中的 \(\beta\) 系數),使得我們實際觀測到的數據出現的可能性 (likelihood) 最大

想像你有一個裝有紅球和藍球的桶子。如果你抽出了 10 個球,其中 9 個是紅色的,那麼你對紅球比例的「極大似然估計」就是 0.9。在 GLM 中,我們做的是同樣的事情,只是涉及的公式和分佈(如泊松分佈 Poisson 或伽瑪分佈 Gamma)更為複雜。

操作步驟:

  1. 寫出似然函數 (Likelihood Function) \(L\),它代表在給定參數下,數據出現的聯合機率。
  2. 由於數學計算上的便利,我們會取自然對數得到對數似然函數 (Log-likelihood) \(\ell = \ln(L)\)。
  3. 尋找令 \(\ell\) 最大化的 \(\beta\) 值。在實際操作中,由於通常沒有簡單的「一步到位」公式,這會由電腦軟件(如 R)透過疊代程序 (iterative process) 來完成。

快速複習: 在考試中,你通常不需要手動進行這些疊代計算,但你必須理解參數 \(\beta\) 的選擇是為了讓觀測數據的對數似然值最大化。


2. 理解偏差 (Deviance):「擬合欠佳度」

在標準回歸中,我們會討論「殘差平方和」(Residual Sum of Squares) 來查看模型與數據的偏離程度。在 GLM 中,我們則使用偏差 (Deviance)

重要概念: 偏差是一種衡量距離的指標。具體來說,它衡量的是我們的擬合模型與「完美」模型之間的距離。

飽和模型 vs. 擬合模型

為了理解偏差,我們會比較兩個模型:

  • 飽和模型 (The Saturated Model, \(S\)): 一個理論上的模型,能完美擬合數據。它的參數數量與數據點的數量一樣多。它能解釋 100% 的變動,但對於預測來說毫無用處,因為它只是「死記硬背」了噪聲 (noise)。
  • 擬合模型 (The Fitted Model, \(M\)): 我們實際測試的模型,使用較少的參數來嘗試捕捉底層的趨勢。

相關公式

偏差 (\(D\)) 的定義為:

\(D = 2(\ell(S) - \ell(M))\)

其中:

  • \(\ell(S)\) 是飽和模型的對數似然值。
  • \(\ell(M)\) 是我們擬合模型的對數似然值。

調整偏差 (Scaled Deviance, \(D^*\)): 有時我們需要考慮分佈的「尺度參數」 (\(\phi\))(例如正態分佈中的方差)。公式為:

\(D^* = \frac{D}{\phi}\)

核心重點: 由於我們希望模型盡可能接近「完美」,因此偏差越低,代表擬合效果越好。


3. 模型選擇:偏差分析

精算師經常要在簡單模型(變數較少)和複雜模型(變數較多)之間做出選擇。我們使用一種稱為偏差分析 (Analysis of Deviance) 的程序來決定增加的複雜性是否值得。

嵌套模型 (Nested Models)

這種方法適用於模型之間存在嵌套關係的情況。這意味著模型 1 是模型 2 的簡化版本(例如,模型 2 包含了模型 1 的所有變數,再加上一個額外的變數)。

似然比檢定 (Likelihood Ratio Test, LRT)

為了查看模型 2 中的額外變數是否真的有用,我們計算兩者偏差的差值:

\(\text{Test Statistic} = D_1 - D_2\)

(如果使用調整偏差,則為 \(D_1^* - D_2^*\))

規則: 如果模型擬合良好,這個差值大約服從卡方 (\(\chi^2\)) 分佈
\(\text{自由度 (df)} = \text{模型 2 中額外參數的數量}\)

決策步驟:

  1. 計算偏差的減少量:\(D_1 - D_2\)。
  2. 使用參數數量的差值作為自由度 (\(df\)),查閱 \(\chi^2\) 分佈表。
  3. 如果減少量大於臨界值(或者 p-值很小,通常 \(< 0.05\)),那麼額外的變數具有統計顯著性。保留複雜模型!
  4. 如果減少量很小,則額外變數提供的價值不大。應堅持使用簡單模型(簡約原則 Parsimony)。

類比:想像給汽車加裝一個華麗的尾翼。如果汽車沒有因此跑得更快(偏差減少量很小),那麼尾翼只是額外的重量。保持汽車設計簡約吧!


4. 檢定參數顯著性

在比較兩個大型模型之前,我們通常會先觀察單個參數。當你查看軟件輸出(如在 Paper B 中)時,你會看到每個系數 (\(\beta\)) 的 p-值 (p-value)

  • 虛無假設 (\(H_0\)): 參數 \(\beta_i = 0\)(意即該變數沒有影響)。
  • 對立假設 (\(H_1\)): 參數 \(\beta_i \neq 0\)。

如果 p-值非常小(通常 \(p < 0.05\)),我們拒絕 \(H_0\)。這告訴我們該變數是一個顯著的預測因子,應保留在模型中。


5. 實務解讀(Paper B 重點)

在考試中,題目可能會給你一個關於「索賠次數」(泊松分佈 Poisson) 或「索賠金額」(伽瑪分佈 Gamma) 的 GLM 擬合結果表。以下是需要留意的重點:

1. 虛無偏差 (Null Deviance): 沒有解釋變數(只有截距項)時模型的偏差。這是你的起點。

2. 殘差偏差 (Residual Deviance): 加入變數後模型的偏差。你希望它明顯低於虛無偏差。

3. AIC (Akaike 信息準則): 你可能會在軟件輸出中看到這個指標。它類似於偏差,但會對增加過多變數進行「懲罰」。AIC 越低越好。

你知不知道? 「簡約原則」(Parsimony) 一詞在精算學中經常被使用。它源於「奧卡姆剃刀」(Occam's Razor) 原則——如果兩個模型對數據的解釋能力不相上下,通常選擇較簡單的模型對未來預測會更好。


快速複習方塊

極大似然法 (Maximum Likelihood): 用於尋找最佳 \(\beta\) 值的方法。

偏差 (Deviance): 衡量「擬合欠佳度」。越低 = 擬合越好。

飽和模型 (Saturated Model): 作為基準的「完美」但過度擬合的模型。

似然比檢定 (Likelihood Ratio Test): 使用 \(D_1 - D_2 \sim \chi^2_k\) 來比較嵌套模型。

顯著變數: 尋找較小的 p-值 (\(< 0.05\)) 以證明保留變數的合理性。

別擔心這些概念起初看起來很棘手!關鍵是要記住,我們總是在良好的擬合度(低偏差)與模型的簡約性(參數較少)之間尋求平衡。