歡迎來到「檢查站」:模型診斷與假設驗證
你已經辛苦地建立了一個線性模型,但你如何知道結果是否值得信賴呢?在精算建模的世界裡,建立模型只是成功的一半,另一半則是確保模型的假設成立。請把這一章當作是你模型的「健康檢查」。我們正在尋找那些可能導致預測結果不可靠的症狀。
如果起初覺得有點棘手,別擔心! 我們將透過簡單的類比和清晰的步驟,來拆解這些統計學上的「生命徵象」。
1. 「四大」假設 (LINE)
為了確保線性迴歸模型的有效性,我們通常會檢查四個特定條件。記住這些條件的好方法就是背誦 LINE 這個縮寫:
L – Linearity (線性): 預測變數與回應變數之間的關係應為一條直線。
I – Independence (獨立性): 誤差(殘差)之間彼此獨立。
N – Normality (常態性): 誤差服從常態分佈。
E – Equal Variance (等變異性): 誤差的散佈程度在所有預測變數水準下皆保持恆定(這是一個描述同質變異性 (Homoscedasticity) 的專業術語)。
為什麼這些假設很重要?
如果這些假設被違反,你的 p-value 可能會出錯,信賴區間可能會誤導人,而預測結果也可能大相逕庭。這就像用一支壞掉的溫度計烤蛋糕——你雖然遵循食譜,但結果絕對不會如你所預期!
關鍵重點:
在信任模型輸出之前,請務必檢查 LINE 假設。這些大多數都是透過查看殘差 (Residuals)(即實際值與模型預測值之間的差異)來進行檢查的。
2. 殘差圖:模型的 X 光掃描
診斷模型最常見的工具是殘差圖 (Residual Plot),我們將殘差 (\(e_i\)) 繪製在 y 軸,將擬合值 (\(\hat{y}_i\)) 繪製在 x 軸。
非線性 (曲線)
如果你在殘差圖中看到明顯的 U 型 或 曲線,這意味著你的模型遺漏了非線性關係。
解決方案: 你可能需要轉換預測變數(例如使用 \(log(x)\) 或 \(x^2\)。
異質變異性 (漏斗形)
如果殘差隨著圖表移動而變得越來越寬或越來越窄(看起來像扇子或擴音器),你就遇到了「異質變異性 (Heteroscedasticity)」。這表示「等變異性」假設不成立。
解決方案: 通常,對回應變數取對數 (\(log(y)\)) 有助於縮小該漏斗形狀。
快速複習:我們在找什麼?
在理想的情況下,殘差圖應該看起來像是一團隨機分佈的點雲,沒有明顯的規律,並集中在零附近。
3. 離群值與高槓桿點
並非所有的數據點都生而平等。有些點對模型影響巨大,而有些則不然。
離群值 (Outliers)
離群值是指該點的實際 \(y\) 值與預測值相差甚遠。它擁有較大的殘差。
類比:當其他人考試都拿 90 分時,有一個學生卻拿了 0 分。
高槓桿點 (High Leverage Points)
如果一個點擁有異常的 \(x\) 值(預測變數值),它就具有高槓桿。這些點遠離其他數據點的平均值,它們有能力將迴歸線「拉」向自己。
類比:在一群平均身高的人中,突然出現一個身高 8 英尺的人。
Cook’s Distance:模型的「戲劇分數」
我們如何知道一個點是否真的在傷害模型?我們使用 Cook’s Distance。它衡量的是如果移除該點,預測值會發生多少變化。
簡單法則: 如果 Cook’s Distance 很高(通常大於 1),該點就是具影響力點 (influential point),值得進一步深入檢查。
關鍵重點:
離群值在 \(y\) 軸方向上顯得很奇怪;槓桿點則在 \(x\) 軸方向上顯得很奇怪。而具影響力點是真正能顯著改變迴歸線斜率的點。
4. 共線性:當預測變數「打架」時
共線性 (Collinearity)(或多重共線性)發生在兩個或多個預測變數之間高度相關時。
你知道嗎? 如果兩個變數敘述的是同一件事(例如「英吋身高」與「公分身高」),模型會感到困惑,不知道該將預測的「功勞」歸給哪一個變數。
症狀:VIF (變異數膨脹因子)
我們使用 VIF 來檢測共線性。
1. VIF 為 1 表示無相關性。
2. VIF 超過 5 或 10 則表示存在嚴重的共線性問題。
常見錯誤:
學生常誤以為共線性會使模型的預測準確度降低。這是不對的! 共線性會使係數(\(\beta\) 值)變得不穩定且難以解釋,但整體的預測結果可能仍然正常。不過,針對 SRM 考試,我們通常希望移除 VIF 過高的變數以維持模型穩定。
5. 診斷步驟總結
如果你在考試中卡住了,請遵循這份心智檢查表:
1. 檢查殘差圖: 尋找規律(非線性)或漏斗狀(變異數不固定)。
2. 檢查 QQ-Plot: 這是用於常態性假設的。點應該落在對角直線上。
3. 檢查 VIF: 如果 VIF > 10,代表有共線性問題。
4. 檢查 Cook’s Distance: 尋找那些「主導模型」的具影響力點。
考試小撇步: 如果題目提到誤差項的變異數隨著預測變數增加而增加,他們就是在討論異質變異性 (Heteroscedasticity)。答案通常涉及對數轉換!
最終關鍵總結
• 殘差是檢查模型假設的主要工具。
• 線性透過「殘差對擬合值圖」進行檢查。
• 常態性透過「常態 QQ 圖」進行檢查。
• 同質變異性 (Homoscedasticity) 代表「變異數恆定」。
• VIF 衡量變數之間的重疊程度(共線性)。
• Cook’s Distance 用於識別對模型結果有重大影響的點。