歡迎來到廣義線性模型 (GLM) 的世界!

在你的 CS1 學習旅程中,你應該已經接觸過線性迴歸 (Linear Regression)。它是一個強大的工具,但有一個重大限制:它假設數據符合常態分佈 (Normal Distribution)。但在現實世界(以及精算考試中!),數據往往沒那麼「聽話」。例如賠款次數可能是計數(卜瓦松分佈 Poisson),或者是「有/無」類型的事件(二項分佈 Binomial)。

這就是廣義線性模型 (Generalised Linear Models, GLMs) 大顯身手的時候!它們就像是線性迴歸的「強化版」,讓我們能夠為幾乎任何類型的數據建模。如果一開始覺得這些概念有點抽象也不用擔心,我們會一點一點拆解給你聽。

1. 指數分佈族 (The Exponential Family of Distributions)

在建立 GLM 之前,我們需要確保數據來自一個特定的分佈家族,稱為指數分佈族 (Exponential Family)。這包括常態分佈、卜瓦松分佈、二項分佈、伽瑪分佈 (Gamma) 和指數分佈。

若一個分佈的機率密度函數 (PDF) 或機率質量函數 (PMF) 可以寫成以下特定格式,它就屬於這個家族:
\( f(y; \theta, \phi) = \exp \left[ \frac{y\theta - b(\theta)}{a(\phi)} + c(y, \phi) \right] \)

公式拆解:

  • \( y \):實際數據點(觀測值)。
  • \( \theta \) (Theta):自然參數 (Natural parameter)。它與平均值有關。
  • \( \phi \) (Phi):離散參數 (Dispersion parameter)。它與變異數有關(即數據的分散程度)。
  • \( a, b, c \):這些函數取決於你所使用的具體分佈。

為什麼我們在乎這種格式?

因為如果分佈符合這個「模板」,我們就可以用簡單的捷徑找到平均值 (Mean)變異數 (Variance)
1. 平均值: \( E[Y] = \mu = b'(\theta) \) (\( b \) 的一階導數)
2. 變異數: \( Var(Y) = a(\phi)b''(\theta) \) (\( b \) 的二階導數,並由 \( a \) 進行縮放)

小撇步: 在考試中,你常會被要求證明某個分佈屬於指數分佈族。只需將 PDF/PMF 取對數,然後嘗試整理成上述公式的模樣即可!

重點總結: 指數分佈族提供了一個統一的架構,讓我們可以用同樣的數學邏輯處理不同類型的數據(如賠款次數和賠款金額)。

2. GLM 的三個組成部分

每個 GLM 都由三個必要成分組成,可以把它想像成模型的「食譜」:

成分 1:隨機成分 (The Random Component)

這是回應變數 \( Y \) 的機率分佈。我們假設觀測值是獨立的,並來自指數分佈族(例如用卜瓦松分佈來模擬汽車事故次數)。

成分 2:系統成分 (The Systematic Component)

這是我們的線性預測因子 (Linear Predictor),以希臘字母 eta (\( \eta \)) 表示。它是解釋變數(如年齡、車型或地區)的線性組合:
\( \eta = \beta_1 x_1 + \beta_2 x_2 + ... + \beta_k x_k \)

成分 3:連結函數 (The Link Function)

這是連接平均值 (Mean, \( \mu \))線性預測因子 (\( \eta \)) 的「橋樑」:
\( g(\mu) = \eta \)

情境比喻:
想像你正試圖根據音樂音量來預測參加派對的人數。
- 隨機成分是參加派對的實際人數(計數)。
- 系統成分是音樂的音量。
- 連結函數就是把音量轉換成人數的「氛圍機制」。它確保即便你把音樂調到「100」,模型也不會預測出負數人數(這是不可能的!)。

重點總結: GLM = 分佈 + 線性預測因子 + 連結函數。

3. 常見的連結函數

連結函數 \( g(\mu) \) 至關重要,因為它確保模型保持在合理的範圍內。例如,機率必須介於 0 和 1 之間。

  • 恆等連結 (Identity Link): \( \eta = \mu \)。 (用於標準常態迴歸)。
  • 對數連結 (Log Link): \( \eta = \ln(\mu) \)。 (常用於卜瓦松數據,確保 \( \mu > 0 \))。
  • Logit 連結 (Logit Link): \( \eta = \ln \left( \frac{\mu}{1-\mu} \right) \)。 (二項數據/機率的標準選擇)。

你知道嗎? 每個分佈都有一個正則連結 (Canonical Link)。這是一種特殊的連結函數,其中 \( \eta = \theta \)。使用正則連結會使電腦在計算時簡化許多數學過程!

4. 參數估計與「離差」(Deviance)

我們如何找到 \( \beta \) 係數的最佳值?在 GLM 中,我們使用最大概似估計法 (Maximum Likelihood Estimation, MLE)。我們不是透過最小化「誤差平方和」(像普通最小平方法 OLS 那樣),而是尋找讓觀測數據出現機率最大的係數值。

什麼是離差 (Deviance)?

在標準迴歸中,我們談論的是「殘差平方和」。在 GLM 中,我們則談論離差 (Deviance)
離差是用來衡量模型偏離「完美模型」(稱為飽和模型 Saturated Model)的程度。
- 低離差 = 擬合良好。
- 高離差 = 擬合不佳。

常見錯誤: 不要把離差 (Deviance)縮放離差 (Scaled Deviance) 搞混了。縮放離差會調整離散參數 \( \phi \)。在卜瓦松和二項分佈中,由於 \( \phi = 1 \),兩者是相同的!

複習箱:
- 飽和模型 (Saturated Model): 一個完美的模型,為每個數據點都設定一個參數。
- 虛無模型 (Null Model): 一個簡單模型,假設所有數據點都有相同的平均值(無解釋變數)。
- 你的模型: 介於兩者之間。

5. 檢查模型是否有效(殘差分析)

建立模型後,你需要檢查剩下的部分——即殘差 (Residuals)。如果模型是好的,殘差看起來應該像隨機雜訊。

  1. 皮爾遜殘差 (Pearson Residuals): 這類似於「標準化」誤差。我們計算實際值與預測值的差,再除以標準差。
  2. 離差殘差 (Deviance Residuals): 這比較複雜,但在 GLM 中更受偏好。它們代表每個單獨觀測值對總離差的貢獻。

重點總結: 如果你繪製殘差圖並看到特定規律(例如「U」型),說明你的模型漏掉了重要的資訊!

6. 模型選擇:哪一個比較好?

通常你需要比較兩個模型。例如:「加入『駕駛年齡』真的能讓我的保險模型更好嗎?」

  • 概似比檢定 (Likelihood Ratio Test, LRT): 用於比較巢狀 (nested) 模型(即其中一個是另一個的簡化版)。檢定統計量為 \( 2 \times (\ln L_{big} - \ln L_{small}) \),它服從卡方分佈 (Chi-square distribution)。
  • AIC (Akaike Information Criterion): 一種「公平性」評分。它獎勵擬合度良好的模型,但會懲罰加入過多不必要變數的模型。AIC 越低越好!

總結與最後的鼓勵

GLM 是現代精算工作的基石。透過超越簡單的直線和常態分佈,你可以準確地模擬現實世界中的風險,如保險賠款頻率和嚴重程度。

記住核心步驟:
1. 檢查分佈是否屬於指數分佈族
2. 選擇你的連結函數
3. 使用 MLE 求出係數。
4. 檢查離差 (Deviance)AIC 來確認模型品質。

如果一開始覺得指數分佈族的代數處理很困難,請別擔心。只要多練習推導幾次卜瓦松和二項分佈的 PDF,這些就會變成你的本能!你可以的!