簡介:超越「標準」模型

歡迎來到統計的世界!如果你曾經花時間鑽研統計學,想必對普通最小平方法 (Ordinary Least Squares, OLS) 回歸模型並不陌生。它是預測模型中的「家常便飯」。然而,在精算科學的真實世界裡——我們處理的是保險理賠、事故發生頻率以及死亡率——OLS 往往顯得力不從心。

在本章中,我們將探討為什麼有時需要拋棄僵化的 OLS 模型,轉而採用更靈活的廣義線性模型 (Generalized Linear Model, GLM)。我們會深入了解區分兩者的特定假設。如果起初覺得這些概念有些抽象,請不用擔心;一旦你看懂了其中的規律,一切都會豁然開朗!

1. 起點:OLS 的假設

在了解 GLM 有何不同之前,我們必須先回顧 OLS 對數據的要求。你可以運用 LINE 這個記憶口訣來記住 OLS 的核心假設:

L – Linearity (線性):預測變數與回應變數之間的關係呈現直線關係。
I – Independence (獨立性):觀測值(數據點)之間互不相關。
N – Normality (常態性):誤差項(殘差)遵循常態分佈 (Normal/Gaussian distribution)
E – Equal Variance (等變異數性):誤差的變異數維持恆定(這是一個專業術語,稱為同質變異性 (homoscedasticity))。

類比:想像 OLS 就像一件標準「M 號」的 T 恤。它能讓大多數人穿起來還算合身,但如果你特別高或特別矮,穿起來就會很奇怪。OLS 非常適合「常態」的數據,但保險數據往往比較「古怪」。

重點總結:

OLS 假設你的目標變數是連續的,數值可正可負,且無論預測值為何,其變異程度(變異數)都保持一致。

2. 為什麼 OLS 在精算工作中會失敗?

在 SRM 考試的「線性模型」章節中,你會發現保險數據經常違反 OLS 的規則。考慮以下兩個常見情境:

1. 理賠件數:事故發生次數不可能為 -2。OLS 可能會預測出負數,這完全不合理!此外,件數是離散的整數(0, 1, 2...),而非連續值。
2. 理賠金額:大型保險理賠(例如房子燒毀)的變異數通常遠高於小型理賠(例如擋風玻璃破裂)。OLS 假設兩者的變異數相同,這通常是錯誤的。

3. GLM 的解決方案:靈活的框架

廣義線性模型 (GLM) 放寬了 OLS 的嚴格限制。GLM 不再強迫數據塞進「常態」的框框裡,而是由三個特定部分組成:

A. 隨機成分 (Random Component - 分佈)

在 OLS 中,我們假設回應變數 \(Y\) 遵循常態分佈。在 GLM 中,我們假設 \(Y\) 遵循指數族分佈 (Exponential Family)。這個家族包含:
- 常態分佈 (Normal)(用於標準的連續數據)
- 卜瓦松分佈 (Poisson)(用於計算事件發生的次數)
- 二項分佈 (Binomial)(用於是/否的二元結果)
- 伽瑪分佈/反高斯分佈 (Gamma/Inverse Gaussian)(用於正值且偏態的保險理賠金額)

B. 系統成分 (Systematic Component - 線性預測值)

這部分看起來很眼熟!它就是解釋變數 (\(X\)) 與其係數 (\(\beta\)) 的組合。我們稱之為 eta (\(\eta\)):
\(\eta = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + ... + \beta_p X_p\)

C. 連結函數 (Link Function)

這是連接兩者的「橋樑」。它將我們數據的平均值 (\(\mu\))線性預測值 (\(\eta\)) 連接起來。
公式如下:\(g(\mu) = \eta\)。

在 OLS 中,連結函數是「恆等 (identity)」,意味著我們假設 \(\mu = \eta\)。在 GLM 中,我們可以使用「對數 (Log)」連結 (\(ln(\mu) = \eta\)) 來確保我們的預測結果保持為正數!

你知道嗎?

OLS 其實就是 GLM 的一種特殊形式!如果你選擇常態分佈恆等連結函數,你的 GLM 就會變成 OLS 模型。

4. OLS 與 GLM:並排比較

讓我們拆解它們在假設上的主要差異,讓你能在考試中一眼辨識出來:

1. 回應變數的分佈
- OLS:必須是常態分佈。
- GLM:可以是指數族中的任何分佈(卜瓦松、二項、伽瑪等)。

2. 變異數的關係
- OLS:變異數是恆定的,且不依賴於平均值(同質變異性)。
- GLM:變異數是平均值的函數。例如,在卜瓦松分佈中,隨著平均值增加,變異數也會增加。這對於保險數據來說要真實得多!

3. 關係轉換
- OLS:假設 \(\mu = \beta X\)(直接的線性關係)。
- GLM:假設 \(g(\mu) = \beta X\)。連結函數 \(g(.)\) 允許關係呈現非線性,同時保持參數的線性。

快速複習:常見錯誤

- 不要說 GLM 假設數據是非線性的。其參數 (\(\beta\)) 仍然是線性的!是因為與平均值的連結方式可以是線性的。
- 不要假設 GLM 的殘差必須是常態的。我們關心的是回應變數的分佈,而不是像 OLS 那樣只看「誤差」。

5. 考試重點總結

當你參加 SRM 考試時,請記住 GLM 與 OLS 假設的這三大支柱:

1. 靈活性:GLM 允許使用非常態分佈(指數族)。
2. 變異數非恆定:GLM 允許變異數隨著平均值改變(為平均值的函數)。
3. 連結函數:GLM 使用連結函數將平均值與線性預測值掛鉤,這有助於將預測值保持在有效範圍內(例如確保理賠件數不為負)。

鼓勵的話:如果連結函數背後的數學看起來很沉重,只需記住其目的:我們只是在尋找一種方法,確保模型的「數學邏輯」能與我們研究數據的「現實情況」相符。你一定能搞定的!

重點總結:

GLM 相對於 OLS 的主要優勢在於,它移除了常態性與恆定變異數的「緊身衣」,使我們能夠更準確地對現實世界的風險進行建模。