歡迎來到假設檢定與適合度檢定 (Hypothesis Testing & Goodness of Fit)!
在 CS1 之前的章節中,我們學會了如何估算數值,例如平均索賠金額或發生車禍的機率。但在現實世界中,精算師不只是想估算數字,更重要的是要作出決策。這款新藥是否比舊藥更有效?索賠次數是否真的符合卜瓦松分佈 (Poisson distribution)?男性與女性的駕駛風險是否存在差異?
假設檢定正是用數據作出這些決策的「正式規則手冊」。別擔心,它起初看起來可能有點抽象,但一旦你掌握了其中的邏輯,就像在法庭上當偵探一樣有趣!
1. 假設檢定的邏輯
你可以把假設檢定想像成一場法庭審訊。在審訊中,被告在「被證明有罪前是無罪的」。在統計學中,我們這個「無罪」狀態稱為虛無假設 (Null Hypothesis)。
兩個對立的假設
1. 虛無假設 (\(H_0\)): 這是「平淡」的狀態。它假設什麼都沒有改變,或者沒有任何效應。除非我們有強有力的證據,否則我們都假設它是真的。
2. 對立假設 (\(H_1\)): 這是你試圖證明的部分。它是「令人興奮」的說法(例如:「新的保險保費實際上更低」)。
5 個標準步驟
為了通過 CS1 考試,請務必每次都遵循這些步驟:
1. 清晰地陳述 \(H_0\) 和 \(H_1\)。
2. 選擇一個顯著水準 (Significance Level, \(\alpha\))——通常為 5% 或 1%。
3. 計算檢定統計量 (Test Statistic)(即你從數據中獲得的證據)。
4. 找出 P 值 (P-value) 或臨界值 (Critical Value)。
5. 作出決策:「拒絕 \(H_0\)」或「不拒絕 \(H_0\)」。
重點總結
我們永遠不會說「接受」虛無假設。我們只能因為證據確鑿而拒絕它,或者因為證據不足而無法拒絕它。這就像陪審團宣判「無罪」——這並不代表被告絕對清白,只代表沒有足夠的證據將其定罪。
2. 誤差:當檢定出錯時
由於我們使用的是樣本(而不是整個人口),我們可能會犯錯。誤差主要分兩類:
第一類型錯誤 (Type I Error, \(\alpha\)): 即「誤報」。你在 \(H_0\) 其實正確時卻拒絕了它。(想像一下:將清白的人判罪)。
第二類型錯誤 (Type II Error, \(\beta\)): 即「錯失機會」。你在 \(H_0\) 其實錯誤時卻無法拒絕它。(想像一下:讓罪犯逍遙法外)。
記憶小撇步:RT 助記法
Type I 是 Rejecting a True \(H_0\)(拒絕一個正確的 \(H_0\))。只要記住 RT 就行了(就像拒絕了「真實真理」/ Real Truth)。
3. 平均值 (\(\mu\)) 的檢定
這是 CS1 考試中最常見的檢定。我們想要了解人口平均值是否等於特定數值。
情境 A:變異數 (\(\sigma^2\)) 已知
我們使用 Z 檢定 (Z-test)。檢定統計量為:
\(Z = \frac{\bar{X} - \mu_0}{\sigma / \sqrt{n}}\)
其中 \(\bar{X}\) 是樣本平均值,\(n\) 是樣本數。
情境 B:變異數未知
這更符合現實。由於我們不知道 \(\sigma\),我們會使用樣本標準差 (\(s\)) 以及具有 \(n-1\) 個自由度的 t 分佈 (t-distribution)。
\(t = \frac{\bar{X} - \mu_0}{s / \sqrt{n}}\)
快速複習:單尾 vs. 雙尾
- 如果你想檢查平均值是否單純「不同」(\(H_1: \mu \neq \mu_0\)),請使用雙尾檢定。
- 如果你想檢查它是否「大於」或「小於」(\(H_1: \mu > \mu_0\) 或 \(H_1: \mu < \mu_0\)),請使用單尾檢定。
4. 比較兩組群體
身為精算師,你可能需要比較兩個群體(例如:A 組與 B 組的索賠情況)。
雙樣本 t 檢定 (獨立)
如果我們假設兩組變異數相同,我們會計算合併樣本變異數 (Pooled Sample Variance, \(s_p^2\)):
\(s_p^2 = \frac{(n_1-1)s_1^2 + (n_2-1)s_2^2}{n_1 + n_2 - 2}\)
接著,檢定統計量為:
\(t = \frac{\bar{X}_1 - \bar{X}_2}{s_p \sqrt{\frac{1}{n_1} + \frac{1}{n_2}}}\)
配對 t 檢定 (依賴)
當數據是成對出現時使用(例如:10 個人節食前和後的體重)。我們只需計算每一對的差值 (\(d\)),然後對這些差值進行單樣本 t 檢定。
5. 卡方 (\(\chi^2\)) 適合度檢定
此檢定用於檢查你的數據是否「符合」理論分佈(如二項式、卜瓦松或常態分佈)。它本質上是在問:「我觀察到的與我預期的之間的差異,純粹是運氣不好,還是我的模型錯了?」
公式
\(\chi^2 = \sum \frac{(O_i - E_i)^2}{E_i}\)
其中:
\(O_i\) = 觀測頻率 (Observed frequency,實際數據)。
\(E_i\) = 預期頻率 (Expected frequency,使用你正在測試的分佈計算得出)。
適合度檢定的重要規則
1. 最小頻率: 每個預期頻率 (\(E_i\)) 應至少為 5。如果低於 5,你必須將相鄰的儲存格合併 (group)。
2. 自由度 (Degrees of Freedom, \(df\)): 這點至關重要!
\(df = (\text{組數}) - 1 - (\text{估計參數的數量})\)
例如:如果你從數據中估計了卜瓦松分佈的平均值 (\(\lambda\)),你的 \(df\) 就需要額外減去 1。
你知道嗎?
卡方檢定永遠是單尾(右尾)的。為什麼?因為公式將差異平方了,所以結果永遠為正。非常大的 \(\chi^2\) 值意味著現實與你的模型之間的「距離」太遠了——所以你要拒絕該模型!
6. 列聯表 (獨立性檢定)
我們用它來查看兩個因素是否相關。例如:「汽車保險理賠類型是否與駕駛者的年齡有關?」
我們將數據排列成表格。任何儲存格的預期頻率 (Expected Frequency) 為:
\(E = \frac{\text{列總計} \times \text{行總計}}{\text{總計}}\)
表格的自由度:
\(df = (r - 1) \times (c - 1)\)
其中 \(r\) 是列數,\(c\) 是行數。
7. 總結與常見陷阱
常見錯誤 1: 在 \(\chi^2\) 檢定中,當 \(E_i < 5\) 時忘記合併儲存格。這是經典的考試陷阱!
常見錯誤 2: 使用了錯誤的自由度。請務必再次檢查你是否從數據中估計了任何參數(如 \(\mu\) 或 \(\sigma\))。
常見錯誤 3: 搞混 Z 檢定和 T 檢定。只要記住:已知變異數?選 Z。未知變異數?選 T。
最後的鼓勵
別擔心公式看起來很嚇人。在考試中,這些步驟非常重複。如果你能掌握 5 個標準步驟並正確算出自由度,你離通過 CS1 就已經不遠了!請持續練習考古題——這是了解這些檢定如何應用於精算情境的關鍵。