簡介:你的模型真的好用嗎?
既然你已經選好了分佈、挑選了連結函數,並讓軟體(如 R)幫你算好了廣義線性模型 (GLM) 的參數,恭喜你!但在你開始用這個模型來預測保險索償或死亡率之前,你必須問一個關鍵問題:這個模型真的契合數據嗎?
在本章中,我們將探討精算界的「診斷工具」。就像醫生使用驗血和 X 光來檢查病人的健康狀況一樣,我們使用殘差 (residuals) 和統計檢定 (statistical tests) 來檢查模型的健康狀況。我們需要確保模型確實捕捉到了數據中的模式,而不僅僅是看到了「雜訊」。
註:本章假設你已熟悉 GLM 的基礎知識,例如線性預測量 (linear predictor) 和連結函數 (link function),這些內容已在回歸章節的前幾部分中涵蓋。
1. GLM 殘差:模型剩餘的「殘渣」
在簡單線性回歸中,殘差只是觀察值與預測值之間的差異:\(y_i - \hat{y}_i\)。然而,在 GLM 中情況會複雜一些,因為數據的方差 (variance) 通常會隨平均值而改變(例如在卜松分佈 (Poisson distribution) 中,方差等於平均值)。
為了考慮到這一點,我們在 GLM 中使用兩種特定類型的殘差:
A. Pearson 殘差 (Pearson Residuals)
Pearson 殘差本質上是原始誤差的「標準化」版本。它將原始殘差除以觀察值的估計標準差。
第 \(i\) 個 Pearson 殘差的公式為:
\(r_i = \frac{y_i - \hat{\mu}_i}{\sqrt{V(\hat{\mu}_i)}}\)
其中:
\(y_i\) 是實際觀察值。
\(\hat{\mu}_i\) 是我們模型預測的值。
\(V(\hat{\mu}_i)\) 是方差函數 (variance function)(取決於我們選擇的分佈,如卜松分佈或 Gamma 分佈)。
小貼士:如果你將所有 Pearson 殘差平方並求和,你就會得到 Pearson 卡方統計量 (\(X^2\)),我們用它來測試模型的擬合優度!
B. 離差殘差 (Deviance Residuals)
精算師通常更偏好離差殘差,因為它們直接與模型的「概似 (likelihood)」相關。它們衡量每個單獨觀察值對總離差 (deviance)(即「擬合不良程度」的衡量指標)的貢獻。
雖然公式比較複雜,但重要的是要記住,它們通常比 Pearson 殘差更接近「常態分佈」,因此非常適合用於視覺化檢查。
我們如何使用這些殘差?
我們通常會將這些殘差繪製成圖表。如果我們的模型「擬合良好」,我們預期會看到:
1. 殘差隨機散佈在零的周圍。
2. 沒有明顯的模式(例如「漏斗狀」或曲線)。
3. 沒有極端的離群值 (outliers)(距離零非常遠的點)。
重點總結:殘差告訴我們模型在哪些地方失敗了。如果你發現「年輕駕駛者」的所有殘差都是正數,那代表你的模型一直低估了他們的風險!
2. 模型可接受性的統計檢定
視覺化檢查固然好,但有時我們需要一個明確的「是/否」答案。我們使用兩個主要的統計檢定來確定 GLM 是否可以被接受。
A. 概似比檢定 (Likelihood-Ratio Test, LRT)
當我們想要比較兩個模型時,會使用概似比檢定:一個是「小」模型(變數較少),另一個是「大」模型(同樣的模型但增加了額外的變數)。
核心問題:那些額外的變數真的有幫助嗎?還是它們只是增加了「雜訊」?
檢定統計量:
\(LRT = 2 \times (l_{big} - l_{small})\)
其中 \(l\) 代表模型的對數概似值 (log-likelihood)。
若以離差 (Deviance, \(D\)) 表示,通常寫作:
\(LRT = D_{small} - D_{big}\)
分佈狀況:在虛無假設(即額外變數無用)下,此統計量服從卡方 (\(\chi^2\)) 分佈,其自由度等於增加的參數數量。
決策準則:如果 \(LRT\) 值非常大(高於卡方分佈表中的臨界值),我們就拒絕虛無假設。這意味著較大的模型顯著地更好!
B. Pearson 卡方檢定 (Pearson’s Chi-square Test)
此檢定檢查模型的整體適當性。它問的是:「我的數據與模型之間的總體差異,是否小到可以用隨機機會來解釋?」
檢定統計量:
\(X^2 = \sum \frac{(y_i - \hat{\mu}_i)^2}{V(\hat{\mu}_i)}\)
進行比較:我們將 \(X^2\) 與自由度為 \(n - p\) 的 \(\chi^2\) 分佈進行比較(其中 \(n\) 是觀察值數量,\(p\) 是模型中的參數數量)。
你知道嗎?對於一個擬合良好的模型,縮放離差 (scaled deviance) 和 Pearson 卡方統計量都應該大約等於自由度 (\(n - p\))。如果它們遠大於自由度,你的模型可能存在「過度離散 (over-dispersion)」的問題(即數據的散佈程度比模型預期的要大)。
3. 解讀軟體輸出結果(Paper B 重點)
在 CS1B 考試中,你很可能會使用 R 來擬合 GLM。當你執行 summary(my_model) 之類的指令時,你需要知道該看哪裡:
- Null Deviance(虛擬離差):僅含「常數項」的模型擬合程度(最壞的情況)。
- Residual Deviance(殘差離差):你的模型擬合程度。你希望這個值顯著低於 Null Deviance。
- AIC (Akaike Information Criterion,赤池信息量準則):一個「金髮姑娘」式的衡量標準(恰到好處)。它會獎勵擬合良好的模型,但會懲罰擁有過多變數的模型。AIC 越低越好!
- 係數的 p 值 (p-values for coefficients):如果某個變數的 p 值 \( < 0.05\),該變數通常被認為具有「統計顯著性」。
要避免的常見錯誤:不要只看 p 值!一個模型可能擁有顯著的變數,但整體而言仍然「擬合不良」。務必同時檢查殘差和總離差。
快速複習:模型可接受性「清單」
在評估 GLM 時,請遵循以下步驟:
- 檢查殘差:它們是隨機分佈的嗎?有離群值嗎?使用 Pearson 或離差殘差。
- 比較離差:使用概似比檢定來判斷增加變數是否值得。
- 檢查顯著性:各個參數 (\(\beta\)) 是否顯著地不等於零?
- 整體擬合度:使用 Pearson 卡方檢定來檢查整體模型是否可以接受。
- 比較 AIC:如果你有兩個不同的模型,通常偏好 AIC 較低 的那一個。
重點總結:沒有模型是完美的!我們的目標不是尋找一個完美的模型,而是尋找一個有用且在統計上站得住腳的模型。正如統計學中的名言所說:「所有模型都是錯誤的,但有些是有用的。」