歡迎來到模型選擇的世界!
你好!如果你在 ASTAM 的學習旅程中已經走到這一步,相信你已經懂得如何為不同的模型估計參數了。但這裡有一個大哉問:我們到底應該選用哪一個模型呢?
在這一章,我們將學習如何為數據與數學模型進行「配對」。我們追求的是一個既能精確擬合數據,又不至於過度複雜的模型。我們將探討三種主要的決策方式:觀察圖表(圖形程序)、執行正式的「質量檢查」(假設檢定),以及為模型的複雜度引入數學「懲罰」(分數準則)。
如果現在覺得這些概念有點抽象,別擔心。想像一下買鞋子:你希望鞋子好看(圖形)、穿起來舒服(假設檢定),而且價錢要合理,不能因為多了一點點功能就貴得離譜(分數準則)。讓我們開始吧!
1. 圖形程序:直觀評估法 (Eye Test)
在進行繁重的運算之前,我們通常先從觀察數據入手。圖形程序能幫助我們一眼看出模型在哪裡表現良好,又在哪裡出現失誤。
經驗分佈與擬合分佈的對比
我們將經驗分佈函數 (Empirical Distribution Function) \(F_n(x)\)——即數據實際呈現的情況——與擬合分佈函數 (Fitted Distribution Function) \(F^*(x)\)——即模型預測的情況——進行比較。
差異圖 (Difference Plot)
差異圖繪製的是 \(D(x) = F_n(x) - F^*(x)\) 的數值。
• 如果圖形保持在接近零的位置,說明模型表現優異。
• 如果出現明顯的「凸起」或「凹陷」,說明模型在這些特定區域(例如尾部或中間部分)擬合效果不佳。
p-p 圖 (機率-機率圖)
在 p-p 圖中,我們繪製座標對 \((F^*(x_j), F_n(x_j))\)。
• 如果模型完美無缺,所有點會落在從 (0,0) 到 (1,1) 的 45 度直線上。
• 小撇步: p-p 圖對於觀察模型如何擬合數據的「中間部分」非常有用,但它往往會掩蓋尾部(極大或極小值)出現的問題。
重點總結
視覺檢查是用來對模型進行「初次印象檢查」的好方法,但它帶有主觀性。某個人可能覺得曲線已經「足夠貼合」,但另一個人卻可能不同意。這就是為什麼我們需要下一節提到的內容:假設檢定!
2. 假設檢定:正式的決策依據
這些檢定會給我們一個數學上的「是」或「否」(或者更嚴謹地說,「無法拒絕虛無假設」或「拒絕虛無假設」),用以判斷模型是否為合適的擬合。
柯莫哥洛夫-斯米爾諾夫檢定 (Kolmogorov-Smirnov, K-S Test)
這是精算科學中最著名的檢定之一。它尋找的是數據與模型之間最大的差距。
公式:
\(D = \max |F_n(x) - F^*(x)|\)
• 運作方式: 我們計算模型與數據在每一個點上的距離,而「檢定統計量」就是我們找到的最大距離。
• 局限性: K-S 檢定僅適用於單獨(非分組)數據,且在參數非由數據估計所得時效果最佳(儘管在實務中,我們經常也會透過調整來使用它)。
安德森-達林檢定 (Anderson-Darling, A-D Test)
你可以把 A-D 檢定想像成 K-S 檢定的「嚴格導師」版本。雖然 K-S 檢定將所有誤差一視同仁,但 A-D 檢定會對尾部給予更多權重。
為什麼這很重要? 在保險業中,我們非常在意「尾部風險」(即極端且罕見的賠款)。一個能完美擬合平均賠款卻忽略巨額賠款的模型是非常危險的!A-D 檢定有助於揪出這類問題。
概似比檢定 (Likelihood Ratio Test, LRT)
這是考試中的熱門考點。當我們有兩個巢狀 (Nested) 模型時,就會用到它。
類比: 想像一個「基礎模型」(例如指數分佈)和一個「進階模型」(例如伽瑪分佈)。由於指數分佈只是一個參數固定的伽瑪分佈,因此它們是巢狀關係。
流程:
1. 計算較簡單(受限)模型的對數概似值:\(\ell_0\)。
2. 計算較複雜(不受限)模型的對數概似值:\(\ell_1\)。
3. 計算統計量:\(T = 2(\ell_1 - \ell_0)\)。
4. 將 \(T\) 與卡方 (\(\chi^2\)) 分佈進行比較。
自由度: \(\chi^2\) 檢定的自由度為兩個模型在參數數量上的差值。
重點總結
假設檢定為剔除劣質模型提供了一套結構化的方法。記住: 如果 p-value 很小(通常 < 0.05),說明該模型擬合得很差!
3. 分數準則:平衡擬合與複雜度
如果你不斷增加模型的參數,擬合度總會「越來越好」,但模型最後會變得難以使用。這稱為過度擬合 (Overfitting)。分數準則會因為模型擁有過多參數而對其進行「懲罰」。
赤池資訊準則 (Akaike Information Criterion, AIC)
AIC 旨在尋找能以最少參數解釋最多數據的模型。
公式:
\(AIC = -2\ell + 2k\)
(其中 \(\ell\) 是對數概似值,\(k\) 是參數數量)。
施瓦茨貝葉斯準則 (Schwarz Bayesian Criterion, SBC 或 BIC)
SBC 與 AIC 類似,但它對增加參數的懲罰「更重」,尤其是在你有大量數據點 (\(n\)) 的情況下。
公式:
\(SBC = -2\ell + k \ln(n)\)
(其中 \(n\) 是觀測值數量)。
我該選哪一個?
對於 AIC 和 SBC 來說,數值越小,模型越好。
• 你知道嗎? 由於 \(\ln(n)\) 通常大於 2,因此 SBC 幾乎總是比 AIC 更嚴格。它比 AIC 更偏好簡單的模型。
避免常見錯誤
• 搞混 AIC/SBC: 學生常誤以為「高分」比較好。錯了!把它想像成高爾夫球比賽——低分者勝。
• 巢狀與非巢狀: 只有在一個模型是另一個模型的特殊情況時,才能使用概似比檢定。如果你在比較對數常態分佈與韋伯分佈,請改用 AIC 或 SBC!
• SBC 中的數據規模: 別忘了 SBC 中的 \(\ln(n)\) 項。如果你忘記將樣本數納入考量,計算結果就會出錯。
快速複習箱
1. K-S 檢定: 觀察最大距離 \(|F_n(x) - F^*(x)|\)。
2. A-D 檢定: 類似 K-S,但對尾部的觀察更為密切。
3. LRT: 用於巢狀模型;使用 \(\chi^2\) 分佈。
4. AIC/SBC: 因模型過於複雜而給予懲罰。數值越小越好。
持續練習!模型選擇的核心就是比較不同選項。一旦你掌握了這三種方法,你就能準確地證明為什麼某個模型優於另一個。你一定做得到的!