歡迎來到廣義線性模型 (GLM) 的世界!

你好!如果你一直在研讀線性回歸,你應該知道它是一個強大的工具。但如果你的數據不符合完美的「鐘形曲線」(常態分佈)時該怎麼辦呢?如果你要建立的模型是關於汽車意外的次數(不可能為負數),或者人壽保險單是否失效(是/否),你該如何處理?

這就是廣義線性模型 (Generalized Linear Models, GLMs) 的用武之地。在本章中,我們將探討 GLM 的「骨架」:指數族 (Exponential Family)連結函數 (Link Functions)。你可以把指數族想像成機率分佈的「貴賓俱樂部」,而連結函數則是讓這些分佈能與線性模型相容的「秘密暗號」。讓我們開始吧!

1. 什麼是指數族 (Exponential Family)?

指數族是一組具有相同數學結構的機率分佈。透過將它們轉換成這種特定的格式,我們可以使用一套統一的框架來解決許多不同類型的問題。

如果一個機率分佈的機率密度(或質量)函數可以寫成以下形式,它就屬於指數族:

\( f(y; \theta, \phi) = \exp \left( \frac{y\theta - b(\theta)}{a(\phi)} + c(y, \phi) \right) \)

別被這些符號嚇到了!讓我們拆解一下這個方程式中的「主要角色」:

  • \( y \): 這是你的觀測數據(應變數)。
  • \( \theta \) (Theta): 這稱為標準參數 (canonical parameter)(或稱自然參數)。它與分佈的平均值有關。
  • \( \phi \) (Phi): 這稱為離散參數 (dispersion parameter)。它與數據的散佈程度(尺度)有關。
  • \( a(\phi) \)、\( b(\theta) \) 和 \( c(y, \phi) \): 這些只是會根據你使用的分佈(常態、卜瓦松等)而改變的函數。

為什麼這很有用?

類比: 想像一家運輸公司只處理特定尺寸的箱子。如果你想運送一輛車、一台鋼琴或一袋彈珠,你必須先將它們裝進那個標準箱子裡。一旦裝箱後,運輸公司就不會在意裡面裝的是什麼——他們以同樣的方式對待每一個箱子。指數族的公式就是統計學中的那個「標準箱」!

快速複習:關鍵部分

\( b(\theta) \) 是最需要記住的函數,因為它決定了平均值和變異數!我們稱它為累積量函數 (cumulant function)


2. 尋找平均值與變異數

指數族最酷的地方在於,一旦你找到了 \( b(\theta) \),你就可以透過簡單的微分求出平均值和變異數,完全不需要進行任何繁瑣的積分!

平均值 (Mean):
\( Y \) 的期望值(平均值,\( \mu \))簡單來說就是 \( b(\theta) \) 的一階導數:
\( E[Y] = \mu = b'(\theta) \)

變異數 (Variance):
\( Y \) 的變異數涉及 \( b(\theta) \) 的二階導數和離散函數:
\( Var(Y) = b''(\theta) a(\phi) \)

你知道嗎? \( b''(\theta) \) 項通常被稱為變異數函數 (variance function),標記為 \( V(\mu) \)。它描述了變異數如何隨平均值改變。在常態分佈中,變異數是固定的;但在卜瓦松分佈中,變異數會隨著平均值的增加而變大!


3. 指數族的常見成員

你需要認出哪些著名的分佈屬於這個家族。對於 SRM 考試來說,以下是最常見的幾種:

  • 常態分佈 (Normal/Gaussian): 用於標準的連續型數據。
  • 卜瓦松分佈 (Poisson): 用於計數數據(例如:一年內發生多少次索賠)。
  • 二項分佈 (Binomial): 用於二元結果(例如:這名考生是否通過考試?是或否)。
  • 伽瑪 (Gamma) 與反高斯 (Inverse Gaussian) 分佈: 用於呈現「偏態」的連續型正數數據(例如:保險索賠的金額)。

常見錯誤: 同學們經常忘記,標準線性回歸其實只是 GLM 的一種特殊情況,即其分佈為常態分佈!


在標準線性模型中,我們說 \( Y = \beta_0 + \beta_1 X \)。但如果 \( Y \) 只能是正數(像索賠金額),而我們的公式 \( \beta_0 + \beta_1 X \) 算出來卻是負數時該怎麼辦?

這就是連結函數派上用場的地方。它將數據的平均值 (\( \mu \)) 與線性預測值 (\( \eta \))「連結」起來。

公式:
\( g(\mu) = \eta = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + ... \)

類比: 連結函數就像一位翻譯官。線性模型說的是「實數」(從負無窮大到正無窮大);而數據說的是「機率」(僅 0 到 1)或「計數」(僅正整數)。連結函數會轉換模型的輸出,使其對應的數據具有實際意義。

必須知道的連結函數:

1. 恆等連結 (Identity Link): \( g(\mu) = \mu \)。用於常態分佈,不做任何改變。
2. 對數連結 (Log Link): \( g(\mu) = \ln(\mu) \)。用於卜瓦松分佈。這確保預測的平均值永遠是正數,因為 \( \mu = e^\eta \)。
3. Logit 連結: \( g(\mu) = \ln(\frac{\mu}{1-\mu}) \)。用於二項分佈。這確保預測的機率永遠在 0 到 1 之間。


指數族中的每個分佈都有一個「自然」的連結函數,在數學運算上最簡潔。這稱為標準連結函數

當我們令連結函數等於我們之前看到的標準參數時,就會得到它:
\( g(\mu) = \theta \)

快速對照表:

常態分佈: 恆等連結 (Identity Link)
卜瓦松分佈: 對數連結 (Log Link)
二項分佈: Logit 連結
伽瑪分佈: 反數連結 (Inverse Link, \( 1/\mu \))

如果覺得這部分有點複雜也不用擔心! 只要記住:「標準 (Canonical)」通常代表對該分佈而言「預設的」或「數學上最簡潔」的選項。


6. 總結與重點複習

你已經完成了 GLM 理論的核心部分!以下是考試前應該掌握的重點:

  • 指數族是一個通用形式,涵蓋了常態、卜瓦松、二項及伽瑪分佈。
  • \( b(\theta) \) 是你的好朋友。它的一階導數是平均值,二階導數能幫你求出變異數
  • 連結函數 \( g(\mu) \) 將平均值連接到線性預測值 (\( X\beta \))。
  • 標準連結 (Canonical Link) 是 \( g(\mu) = \theta \) 的特定函數。
  • 記憶小撇步: 要記住二項分佈的 Logit 連結,可以想成「機率 (Probability)」→「勝算 (Odds)」→「對數勝算 (Log-Odds)」。Log-Odds 就是 Logit!

繼續加油! 理解這些片段如何組合在一起是最困難的部分。一旦掌握了這個「骨架」,其餘的 GLM 章節會讓你感覺直觀得多。你一定做得到的!