多元線性回歸簡介
歡迎來到 CS1 課程中最具實用價值的章節之一!在上一章中,我們探討了簡單線性回歸 (Simple Linear Regression),即僅利用一個解釋變數來預測回應變數(例如:僅根據投保人的年齡來預測索償金額)。然而在現實世界中,情況鮮有如此簡單。
多元線性回歸 (Multiple Linear Regression, MLR) 允許我們同時使用多個解釋變數。想像一下你正在為汽車保險定價:你不會只看駕駛者的年齡,還會考慮汽車的引擎容量、居住地區以及享有多少年的無索償折扣 (NCD)。本章將教你如何處理多個輸入變數,以及最關鍵的一點——如何決定哪些變數真正應該留在你的模型中。
1. 多元線性回歸模型
在 MLR 中,我們假設回應變數 \( Y \) 是多個解釋變數 \( x_1, x_2, \dots, x_k \) 的線性組合,再加上一些隨機誤差。
第 \( i \) 個觀測值的模型公式如下:
\( Y_i = \beta_0 + \beta_1 x_{i1} + \beta_2 x_{i2} + \dots + \beta_k x_{ik} + \epsilon_i \)
其中:
- \( Y_i \) 是回應變數(例如:總索償金額)。
- \( x_{i1}, x_{i2}, \dots, x_{ik} \) 是解釋變數(例如:年齡、汽車馬力、行駛里程)。
- \( \beta_0 \) 是截距 (Intercept)。
- \( \beta_1, \dots, \beta_k \) 是每個變數的斜率參數(係數)。
- \( \epsilon_i \) 是隨機誤差項,通常假設其為獨立且服從正態分佈:\( \epsilon_i \sim N(0, \sigma^2) \)。
核心假設:線性 (Linearity)
別被「線性」這個詞誤導。MLR 中的「線性」是指相對於參數 (\( \beta \)) 的線性,而不是變數本身。你的模型中可以包含像 \( x^2 \) 這樣的變數,只要它的形式維持 \( \beta_j x_j^2 \),它仍然屬於線性回歸模型。
2. 解釋係數
考試中最常見的題目之一就是解釋特定 \( \beta \) 的含義。在 MLR 中,我們應用「在其他因素不變」的原則。
解釋: 係數 \( \beta_j \) 代表當模型中所有其他解釋變數保持不變時,\( x_j \) 每增加一個單位,回應變數 \( Y \) 的預期變化量。
例子: 如果「駕齡」的係數是 \( -50 \),這意味著在汽車類型和地區保持不變的情況下,駕齡每增加一年,預測保費會減少 \$50。
快速複習: 在 Paper B (R 語言考試) 中,你會使用 lm() 函數來尋找這些估計值。輸出結果會為每個係數提供估計值 (Estimate)、標準誤差 (Standard Error)、t 值 (t-value) 以及 p 值 (p-value)。
3. 評估模型擬合度
建立模型後,我們需要知道它的表現如何。我們主要使用兩個指標:
決定係數 (\( R^2 \))
\( R^2 = \frac{SS_{Reg}}{SS_{Tot}} = 1 - \frac{SS_{Res}}{SS_{Tot}} \)
這告訴我們 \( Y \) 的總變異中,有多少比例是可以由模型解釋的。其取值範圍從 0 到 1(即 0% 到 100%)。
\( R^2 \) 的問題:過度擬合 (Overfitting)
這是許多同學都會掉進的陷阱:增加更多變數總是會提高 \( R^2 \)(或至少維持不變),即使那些變數完全沒用!如果你不斷添加變數,可能會導致模型「過度擬合」,這意味著模型只是在解釋特定數據集中的隨機噪聲,而非底層的真實趨勢。
調整後 \( R^2 \) (Adjusted \( R^2 \))
為了修正過度擬合的問題,我們使用調整後 \( R^2 \)。這個指標會懲罰添加不必要變數的行為。只有當新變數帶來的改進程度超過隨機預期時,調整後 \( R^2 \) 才會增加。
\( Adjusted \ R^2 = 1 - (1 - R^2) \frac{n - 1}{n - k - 1} \)
其中 \( n \) 是觀測值數量,\( k \) 是解釋變數的數量。
4. 解釋變數的選擇
我們該如何決定保留哪些變數?精算師會使用幾種策略來尋找「簡約模型」(Parsimonious model,即表現良好且最簡單的模型)。
偏 F 檢定 (比較嵌套模型)
如果你有一個「大模型」(包含許多變數)和一個「小模型」(僅包含其中部分變數),你可以使用 F 檢定來看看大模型中額外的變數是否顯著。
虛無假設 \( H_0 \) 為額外的係數全部為零(即額外的變數沒有用處)。
赤池信息量準則 (AIC)
AIC 是精算實務中非常受歡迎的模型選擇指標。它在「似然度」(模型擬合程度)與「簡約度」(使用的變數數量)之間取得平衡。
規則: 在比較模型時,通常優先選擇 AIC 值最低 的模型。
逐步選取程序 (Stepwise Selection)
手動篩選很慢,所以我們經常使用這些演算法:
- 向後剔除法 (Backward Elimination): 從包含所有可能變數開始,移除 p 值最高(最不顯著)的一個。重複此步驟,直到所有剩餘變數都顯著(通常為 p < 0.05)。
- 向前選取法 (Forward Selection): 從沒有變數開始,添加能帶來最顯著改進的變數。重複此步驟,直到無法再添加顯著變數。
- 逐步選取法 (Stepwise): 兩者的結合,在每一步中都可以添加或移除變數。
應避免的常見錯誤: 不要孤立地看 p 值。如果兩個變數高度相關(例如「駕駛者年齡」和「取得執照年數」),同時放入模型可能會讓兩者看起來都不顯著!這稱為多重共線性 (Multicollinearity)。
5. 多元回歸中的預測
就像簡單回歸一樣,我們可以使用擬合好的模型來預測未來值。你需要了解兩種類型的區間:
- 置信區間 (Confidence Interval): 針對回應變數的平均值(給定一組 \( x \) 下的平均 \( Y \))。
- 預測區間 (Prediction Interval): 針對單個未來的觀測值。
核心重點: 預測區間總是比置信區間更寬,因為單個觀測值具有更多的不確定性(它包含了平均值的變異加上隨機誤差 \( \sigma^2 \))。
6. 模型選擇標準總結
選擇最佳解釋變數組合時,請留意:
- 低 AIC: 代表擬合度與簡約度之間取得了良好平衡。
- 高調整後 \( R^2 \): 代表變數確實增加了模型解釋力。
- 顯著的 p 值: 各別係數的 p 值通常應 \( < 0.05 \)。
- 殘差分析 (Residual Analysis): 務必檢查殘差是否看起來像隨機噪聲(無規律模式)。如果殘差呈現某種模式,說明你可能漏掉了一個變數,或者需要更換模型類型。
備註:殘差分析將在「殘差分析與模型驗證」章節詳細討論。現在只需記住,它是檢查變數選擇是否成功的關鍵步驟!
你知不知道? 在 Paper B 中,如果題目要求你選擇最佳模型,你通常應該擬合幾個不同的變體,比較它們的 AIC 值,並檢查係數的 p 值。如果 AIC 值非常接近,通常優先選擇較簡單的模型(簡約原則,Principle of Parsimony)!