歡迎來到廣義線性模型 (GLM) 的選擇與驗證世界!
你好!如果你已經來到 Exam PA 備考之路的這個階段,你一定已經知道廣義線性模型 (GLMs) 是精算預測建模的核心基礎。但我們該如何判斷自己建立的模型是否「優秀」呢?是變數最多的模型嗎?還是對訓練數據擬合得最完美的模型?(劇透一下:都不是!)
在本章中,我們將學習如何針對具體的業務問題挑選正確的 GLM,更重要的是,如何證明它確實有效。你可以把這個過程想像成從只會照本宣科的「廚師」,變成一位清楚知道為何選用特定食材的「主廚」。如果剛開始覺得內容有點重,別擔心,我們會一步步為你拆解!
1. 定義業務問題:在「怎麼做」之前的「為什麼」
在動手操作電腦之前,你必須先了解你想要解決的問題是什麼。在 Exam PA 的情境下,業務問題直接決定了你對目標變數 (Target Variable) 和誤差分佈 (Error Distribution) 的選擇。
逐步應對方法:
1. 定義目標:我們在預測什麼?(例如:索賠數量、總成本,或客戶流失率)。
2. 確認限制條件:我們是否有數據限制?是否有法律對透明度的要求?
3. 選擇合適的 GLM 組件:具體來說,就是分佈 (Distribution) 和鏈接函數 (Link Function)。
選擇正確的分佈
你可以將分佈視為數據的「形狀」。如果你選錯了形狀,模型永遠無法妥善擬合。
精算工作中常見的分佈:
- 常態分佈 (Normal/Gaussian): 用於對稱的連續型數據(保險索賠中很少見,但常見於身高/體重等指標)。
- 卜瓦松分佈 (Poisson): 處理計數數據 (Count data) 的首選(例如:「今年發生了多少宗意外?」)。
- 伽瑪分佈 (Gamma): 非常適合用於索賠嚴重程度 (Claim severity)(正值的連續數據,且呈偏態分佈——大量的低額索賠,少量的高額索賠)。
- 二項分佈 (Binomial): 用於二元結果 (Binary outcomes)(是/否,1/0)。
- Tweedie 分佈: 一種「混合型」分佈,常被用於總保險損失 (Total insurance loss),因為它能同時處理大量的零值(無索賠)以及正值的連續數據。
快速複習:你會用什麼分佈來衡量「機器故障次數」?
答案:卜瓦松分佈(因為這是事件的計數)。
2. 選擇預測變數:特徵選擇 (Feature Selection)
在 GLM 中,我們並不總是想把手頭上所有的變數(特徵)都放進去。放入過多變數會導致過度擬合 (Overfitting)——即模型學會了你特定數據集中的「雜訊」,而非真正的規律。
自動化選擇方法
- 向前選擇 (Forward Selection): 從空模型開始,根據對模型改善程度最大的變數,逐個添加。
- 向後選擇 (Backward Selection): 從包含所有變數的模型開始,逐個移除最不顯著的變數。
- 逐步選擇 (Stepwise Selection): 前兩者的結合;在每一步中,模型可以添加或移除變數。
要避免的常見錯誤:僅僅因為一個變數在統計上是「顯著的」(p-value 很低)並不代表它對業務有用。請務必運用常識!如果一個變數是「郵遞區號」,而你有 5,000 個郵遞區號,你的模型可能會崩潰。你可能需要先對它們進行分組。
3. 模型驗證:現實檢核 (Reality Check)
一旦有了模型,你需要對其進行驗證。我們這樣做的目的是確保模型在未見過的數據 (Unseen data)(即模型未訓練過的數據)上也能表現良好。
訓練集/測試集劃分 (Train/Test Split)
想像一下在準備數學考試。如果你只練習考試題目中完全一樣的練習題,你並沒有真正「學會」數學;你只是背下了答案。
- 訓練集 (Training Set): 模型用來「學習」模式的數據。
- 測試集 (Test Set): 像是「期末考」,用來檢測模型是否真的理解了模式。
交叉驗證 (Cross-Validation)
有時,單一的劃分是不夠的。K 折交叉驗證 (k-fold Cross-Validation) 涉及將數據分成「k」個部分。我們使用 \(k-1\) 個部分訓練模型,並在剩餘的部分進行測試,重複此過程直到每一部分都曾擔任過「測試集」。然後我們將結果取平均值。
關鍵要點:驗證是捕捉過度擬合(在訓練數據上精確度極高,但在測試數據上卻表現不佳)的唯一途徑。
4. 評估指標:我們如何為模型打分?
我們需要數字來告訴我們模型 A 是否比模型 B 更好。以下是 Exam PA 中最重要的指標:
偏差 (Deviance)
在 GLM 中,偏差 (Deviance) 是衡量「擬合優度」的指標。較低的偏差意味著模型對數據的擬合程度更好。你可以把偏差想成是模型與完美模型之間的「誤差」或「差距」。
AIC 和 BIC(「懲罰」指標)
這些指標幫助我們在擬合程度與簡單性之間取得平衡。
- AIC (Akaike Information Criterion): \(AIC = -2L + 2p\)
- BIC (Bayesian Information Criterion): \(BIC = -2L + p \ln(n)\)
其中 \(L\) 是概似函數值 (Likelihood),\(p\) 是參數(變數)數量,\(n\) 是樣本大小。
法則:數值越低越好!BIC 比 AIC 更「嚴格」——它對擁有過多變數的懲罰更重,特別是在大型數據集中。
記憶小撇步:把 AIC 和 BIC 想成才藝表演的評審。他們會為精彩的表演(Likelihood)給分,但如果你帶了太多不必要的伴舞(參數/變數),他們就會扣分。
5. 殘差分析:檢查「剩餘物」
殘差 (Residuals) 是實際發生的情況與模型預測結果之間的差異(\(實際值 - 預測值\))。在一個好的模型中,殘差應該看起來像「白雜訊」(White noise)——隨機且不可預測的。
殘差類型:
1. 皮爾森殘差 (Pearson Residuals): 標準化殘差,對於檢查常數變異數 (Constant variance) 非常有用。
2. 偏差殘差 (Deviance Residuals): 在 GLM 中更受偏愛,因為它們的分佈更接近常態分佈,使得在圖表中的解讀更容易。
檢查重點:如果你畫出殘差圖,卻發現明顯的模式(例如「U」型或「扇形」),說明你的模型漏掉了一些重要的東西!這代表數據中還有模型無法捕捉到的潛在規律。
6. 為利益相關者解讀結果
業務問題的最後一步是向非精算專業人士解釋你的模型。他們不在乎「對數概似函數 (Log-Likelihood)」,他們在乎的是「底線 (Bottom Line)」。
鏈接函數 (Link Function) 的技巧:
如果你使用了對數鏈接 (Log Link)(在卜瓦松和伽瑪模型中很常見),係數的作用是乘法性質的 (Multiplicative)。
如果「車齡」的係數是 \(0.05\),那麼車齡每增加一個單位,預測值就會增加 \(e^{0.05} \approx 1.051\) 倍,即增加 \(5.1\%\)。
你知道嗎?這種乘法性質就是為什麼對數鏈接在保險定價中如此受歡迎——因為說「年輕駕駛會讓保費增加 20%」比說「它會讓保費增加 200 美元」更容易讓大眾理解。
考試摘要檢查清單
當你在考試中被要求選擇並驗證一個 GLM 時,請依序過一遍這份心理清單:
- 分佈:是否符合目標的本質?(計數 vs. 連續)
- 鏈接函數:是否適當?(正值用 Log,二元變數用 Logit)
- 選擇:我是否使用了 AIC/BIC 或逐步選擇來刪減不必要的變數?
- 驗證:我是否檢查了模型在測試集上的表現?
- 殘差:我是否檢查了殘差圖,確保沒有遺漏的模式?
- 業務邏輯:結果對公司而言合理嗎?
專家建議:如果考試要求你在兩個模型之間做選擇,其中一個 AIC 稍低,但複雜得多,請考慮推薦較簡單的模型。在現實世界中,「簡單且具可解釋性」往往勝過「複雜但精確度略高」。
你一定能做到!GLM 可能看起來有很多活動的零件,但一旦你看出分佈、鏈接函數和驗證是如何協同工作的,一切就會豁然開朗。