歡迎來到進階預測模型!

你好!如果你已經掌握了廣義線性模型(Generalized Linear Models, GLMs),那你的基礎已經相當紮實。然而,在現實世界中,數據並不總是呈現「線性」的。有時數據會呈現曲線,有時會聚集成群,甚至有時複雜到我們需要類似「大腦」的結構才能解析。在本章中,我們將探討加性模型(Additive Models)線性混合模型(Linear Mixed Models)以及神經網絡(Neural Networks)。這些工具能將你的預測分析技能從「標準」提升至「進階」。不用擔心,這些概念聽起來可能很深奧——我們會一步步為你拆解!


1. 廣義加性模型 (Generalized Additive Models, GAMs)

你可以把標準的 GLM 想成一把死板的尺,它嘗試用直線(或簡單的曲線)來擬合你的數據。但如果數據看起來像雲霄飛車一樣起伏不定呢?這就是 GAMs 出場的時候了。它們允許預測變數與目標變數之間存在靈活的「波動」關係。

核心概念

在 GLM 中,我們假設預測變數的影響是線性的:\( \beta \cdot x \)。在 GAM 中,我們將那條直線替換為一個平滑函數(smooth function),記作 \( f(x) \)。
公式如下:
\( g(E[Y]) = \beta_0 + f_1(x_1) + f_2(x_2) + ... + f_p(x_p) \)
其中 \( g \) 是連結函數(link function),而每個 \( f_i \) 都是針對該特定變數量身打造的平滑函數。

為什麼要使用 GAMs?

  • 靈活性: 它們能捕捉 GLM 無法處理的非線性模式。
  • 可解釋性: 與「黑盒」模型不同,你仍然可以透過觀察每個變數特定的「波動(wiggle)」來了解它們如何影響預測結果。
  • 可加性: 由於我們將各種影響相加,在保持其他變數不變的情況下,我們仍然可以解釋單一變數的影響力。

類比與工具

類比: 想像你在訂製西裝。GLM 就像在商店購買一件「中碼(Medium)」成衣,雖然合身但版型固定。而 GAM 就像一位裁縫師,根據你身體的具體曲線來調整布料。

關鍵術語:樣條函數(Splines)。這是構成平滑函數的「基本組件」。你可以把它們想像成由多個小曲線片段在稱為節點(knots)的連接點組合而成,從而創造出一條長且平滑的線。

快速複習:
- 平滑參數(\( \lambda \)): 用於控制「緊貼數據(波動大)」與「保持簡單(平滑)」之間的平衡。過度波動會導致過度擬合(overfitting)
- 有效自由度(Effective Degrees of Freedom, EDF): 用於衡量平滑程度的複雜度指標。EDF 為 1 代表直線;EDF 越高,模型越複雜。

重點總結:GAMs 在 GLM 的簡潔性與機器學習模型的高複雜度之間,提供了一個理想的中間方案。

2. 線性混合模型 (Linear Mixed Models, LMMs)

有時,我們的數據點並不是相互獨立的。例如,如果你正在分析保險理賠,來自同一位保單持有人的 10 筆理賠資料很可能存在相關性。線性混合模型正是為了處理這種「分組(grouped)」或「階層(hierarchical)」數據而設計的。

固定效應 vs. 隨機效應

這是 LMM 中最重要的區分:

  1. 固定效應(Fixed Effects): 我們在整個群體中關心的變數(例如年齡、性別)。它們被稱為「固定」,因為我們假設它們對每個人的影響是相同的。
  2. 隨機效應(Random Effects): 代表組內的變異(例如某位特定保單持有人或特定地理區域的「運氣」或「風險」)。我們假設這些效應來自於一個常態分佈。

公式

\( Y = X\beta + Zu + \epsilon \)
- \( X\beta \):固定部分(類似標準迴歸)。
- \( Zu \):隨機部分(針對特定群體的調整)。
- \( \epsilon \):殘餘雜訊(誤差項)。

你知道嗎?

LMMs 通常也被稱為多層次模型(Multilevel Models)階層模型(Hierarchical Models)。如果在考試中看到這些術語,請直接聯想到「混合模型」!

常見錯誤

錯誤: 對僅有 2 或 3 個水準的變數(如性別)使用隨機效應。
修正: 當你擁有大量群組(例如 50 個州或 1,000 位保單持有人)並且希望考慮它們之間的變異時,隨機效應的效果最好。

重點總結:當你的數據是「嵌套」或「聚集」的,且你需要考慮群組內的相關性時,LMMs 是你的首選工具。

3. 神經網絡 (Neural Networks, NNs)

神經網絡的靈感源自人類大腦。它們在從海量數據中尋找複雜且隱藏的模式方面極為強大。雖然它們通常被視為「黑盒」(難以解釋),但其預測能力堪稱頂尖。

架構

神經網絡由多層「神經元」組成:

  • 輸入層(Input Layer): 數據(特徵)進入模型的地方。
  • 隱藏層(Hidden Layers): 「引擎室」。模型在此處對輸入進行複雜的組合。
  • 輸出層(Output Layer): 最終預測結果(例如「此人會否理賠?」或「預期損失為何?」)。

運作原理(逐步解析)

1. 權重(Weights)與偏差(Biases): 神經元之間的每個連結都有一個權重(代表重要性)。每個神經元還有一個偏差(偏移量)。
2. 加總: 神經元將所有加權後的輸入相加。
3. 激活函數(Activation Function): 這是「守門員」。它決定訊號是否足夠強大以傳遞到下一層。常見函數包括:
    - ReLU(修正線性單元): 非常流行;將負值轉為零。
    - Sigmoid: 將數值壓縮在 0 到 1 之間(非常適合用於機率預測)。
4. 前向傳播(Forward Propagation): 從輸入移動到輸出以取得預測值。
5. 反向傳播(Backpropagation): 模型檢查預測誤差(損失,Loss),並向後調整權重,以便下次預測更準確。

記憶法:NN 規則

NN 看作 Network of Numbers(數字網絡)。它本質上就是一個巨大的數學方程式,透過不斷調整權重,讓輸出結果盡可能符合現實情況。

NN 挑戰快速複習

  • 過度擬合: NNs 非常靈活,甚至會「死記硬背」訓練數據。我們使用 Dropout(隨機關閉部分神經元)或 提前停止法(Early Stopping) 來防止此問題。
  • 可解釋性: 與 GLM 相比,要解釋神經網絡「為什麼」做出某個決定非常困難。
重點總結:神經網絡是高強度的非線性模型,利用多層神經元和激活函數來捕捉極其複雜的關係。

考試當日總結清單

繼續前進之前,請確保你能回答以下問題:

  • GAMs: 我能解釋為什麼我們使用樣條函數(splines)而不是單純的 \( x^2 \) 或 \( x^3 \) 嗎?(答案:為了在局部保持靈活性,同時不影響整體曲線。)
  • LMMs: 我知道何時該使用隨機效應嗎?(答案:當數據是分組的,且組內觀測值存在相關性時。)
  • 神經網絡: 我能列舉兩個激活函數並解釋隱藏層的作用嗎?(答案:ReLU/Sigmoid;隱藏層捕捉非線性互動。)

加油! 這些模型是預測分析中的「重型武器」。了解何時使用靈活的 GAM 或結構化的 LMM,正是成為優秀精算師的關鍵!