R 語言檢定與置信區間簡介
歡迎來到 CS1 課程中最實用的部分之一!在卷 A(Paper A)中,你花了大量時間手動計算檢定統計量(test statistics)並查閱 Goldstein 統計表。而在卷 B(Paper B,即電腦考試)中,軟件會為你完成這些繁重的工作,你的任務重點將從「計算」轉移到「解讀」。
在本章中,我們將專注於如何使用 R 進行假設檢定(hypothesis tests)並構建置信區間(confidence intervals)。這對任何精算師來說都是一項至關重要的技能,因為現實世界的數據很少像「教科書般整齊」,幾乎總是需要藉助軟件進行分析。我們將學習如何閱讀 R 的輸出結果、如何針對原假設(null hypotheses)作出決策,以及如何理解真實參數可能存在的數值範圍。
註:如果你在進行這些檢定前,需要複習如何計算平均值(mean)或方差(variance)等基本統計量,請參閱「R 語言中的概率、分位數與總結統計量」章節。
核心邏輯:\(p\)-值
在卷 B 中,\(p\)-值是你最好的朋友。卷 A 通常要求你尋找臨界值(critical value),而卷 B 的輸出幾乎總是直接提供 \(p\)-值。
什麼是 \(p\)-值? 它是在原假設(\(H_0\))為真的前提下,觀察到與實際觀測結果同樣極端(或更極端)的結果的概率。
檢定的金科玉律:
如果 \(p\)-值 \( < \alpha \)(顯著性水平,通常為 0.05),我們拒絕 \(H_0\)。
如果 \(p\)-值 \( \ge \alpha \),我們不拒絕 \(H_0\)。
類比:你可以將 \(p\)-值視為反對原假設的「證據強度」。數值越小,代表如果 \(H_0\) 為真,該數據就越令人「驚訝」,因此我們越傾向於捨棄 \(H_0\)。
使用 t.test() 檢定平均值
t.test() 函數是 R 統計功能中的「瑞士軍刀」。它用於在方差未知的情況下,進行涉及正態分佈(Normal distribution)的檢定。
1. 單樣本 t 檢定
用於檢定單個組別的平均值(\(\mu\))是否等於特定數值(\(\mu_0\))。
R 語法: t.test(data_vector, mu = mu_0)
2. 雙樣本 t 檢定
用於比較兩個獨立組別的平均值(\(\mu_1\) 與 \(\mu_2\))。
R 語法: t.test(group1, group2)
默認情況下,R 會執行 Welch t 檢定,該檢定不假設兩組的方差相等。如果考試要求你假設方差相等,你必須加入參數 var.equal = TRUE。
3. 配對 t 檢定
當你對同一組對象有兩次測量時使用(例如:減肥前與減肥後的體重)。這就是教學大綱中提到的配對數據檢定(test for paired data)。
R 語法: t.test(before_vector, after_vector, paired = TRUE)
閱讀輸出結果
當你執行 t.test() 時,R 會提供一段文字。請重點關注以下三個區域:
1. t: 計算得出的檢定統計量。
2. p-value: 將此數值與你的顯著性水平(如 0.05)進行比較。
3. 95 percent confidence interval: 平均值差異的取值範圍。如果此區間包含 0,通常意味著該差異並不顯著!
比例與率:二項分佈與泊松分佈
教學大綱要求你掌握二項分佈概率和泊松分佈平均值的檢定,包括使用正態近似法(normal approximation)。
二項分佈檢定
要檢定比例(例如:理賠發生的概率),我們使用 binom.test() 獲取精確結果,或使用 prop.test() 進行正態近似。
例子: 如果你在 100 次試驗中有 30 次成功,想檢定 \(p = 0.25\):
binom.test(x = 30, n = 100, p = 0.25)
泊松分佈檢定
要檢定泊松過程的率(例如:每年的事故次數),請使用 poisson.test()。
R 語法: poisson.test(x = count_of_events, T = time_period, r = hypothesized_rate)
關鍵要點: 對於這兩個函數,R 都會提供 \(p\)-值以及參數(\(p\) 或 \(\lambda\))的置信區間。務必檢查來自 \(H_0\) 的「假設值」是否落在提供的置信區間內。
非參數方法:排列檢定與自助法
有時我們不想假設數據遵循完美的正態分佈或泊松分佈。教學大綱強調了兩種現代技術:排列檢定(Permutation tests)和自助法(Bootstrapping)。
1. 排列檢定法
這用於非參數假設檢定。我們不使用分佈公式,而是多次「洗牌」(shuffle)數據標籤,看看我們的觀測結果在隨機情況下發生的概率有多大。
在卷 B 中,你可能會被要求編寫一個簡單的 for 迴圈來重新排列數據並重複計算檢定統計量,從而構建你自己的分佈。
2. 自助法 (The Bootstrap Method)
當標準公式未知或分佈情況複雜時,這用於獲取估計量的置信區間。
運作方式:
1. 對你的數據進行多次有放回抽樣(resample with replacement)(例如 1,000 次)。
2. 計算每次抽樣的統計量(如平均值或方差)。
3. 這 1,000 個結果中的第 2.5 和 第 97.5 百分位數,便構成了你的 95% 自助法置信區間。
你知道嗎?「Bootstrapping」一詞源於片語「to pull oneself up by one's bootstraps」(靠自己的靴帶拉起自己),這寓意著數據可以在沒有外部幫助的情況下「尋找自己的分佈」!
解讀回歸分析輸出
雖然回歸分析有其專門的章節,但你必須能夠在回歸總結(summary(lm_model))中識別出檢定和置信區間。
1. Standard Error (標準誤差): 用於構建斜率(\(\beta\))的置信區間。
2. t value (t 值): 針對 \(H_0: \beta = 0\) 的檢定統計量。
3. Pr(>|t|): 該特定變量的 \(p\)-值。如果該值很小,則該變量是一個顯著的預測因子。
對於廣義線性模型(GLMs),你會查看離差(deviance),並使用 Pearson 卡方檢定或似然比檢定(likelihood-ratio test)來確定模型是否與數據擬合良好。
應避免的常見錯誤
1. 錯誤的對立假設: R 默認進行「雙側」檢定。如果你的假設是「大於」(\(H_1: \mu > \mu_0\)),你必須在 R 代碼中指定 alternative = "greater",否則你的 \(p\)-值將會錯誤!
2. 誤解置信區間(CI): 請記住,95% 置信區間意味著如果我們重複實驗多次,在這些計算出的區間中,有 95% 會包含真實參數。這並不代表參數有 95% 的概率落在這一個特定區間內(雖然這是學生非常容易犯的錯誤!)。
3. 混淆配對與獨立樣本: 務必問自己:「這是兩個不同的組別(獨立),還是同一組別測量了兩次(配對)?」在 t.test() 中用錯類型會導致失分。
快速複習欄
- p-value < 0.05: 結果顯著,拒絕 \(H_0\)。
- t.test(): 平均值(正態數據)。配對數據使用 paired = TRUE。
- binom.test() / prop.test(): 比例(二項數據)。
- poisson.test(): 率(泊松數據)。
- Bootstrap (自助法): 通過有放回抽樣獲取置信區間。
- Permutation (排列檢定): 通過洗牌標籤獲取非參數檢定的 \(p\)-值。
如果 R 代碼起初讓你感到不知所措,請不要擔心。在卷 B 中,你通常可以查看 R 的幫助文件(例如輸入 ?t.test),這會提醒你所需的參數!