R 語言檢定與置信區間簡介

歡迎來到 CS1 課程中最實用的部分之一!在卷 A(Paper A)中,你花了大量時間手動計算檢定統計量(test statistics)並查閱 Goldstein 統計表。而在卷 B(Paper B,即電腦考試)中,軟件會為你完成這些繁重的工作,你的任務重點將從「計算」轉移到「解讀」。

在本章中,我們將專注於如何使用 R 進行假設檢定(hypothesis tests)並構建置信區間(confidence intervals)。這對任何精算師來說都是一項至關重要的技能,因為現實世界的數據很少像「教科書般整齊」,幾乎總是需要藉助軟件進行分析。我們將學習如何閱讀 R 的輸出結果、如何針對原假設(null hypotheses)作出決策,以及如何理解真實參數可能存在的數值範圍。

註:如果你在進行這些檢定前,需要複習如何計算平均值(mean)或方差(variance)等基本統計量,請參閱「R 語言中的概率、分位數與總結統計量」章節。

核心邏輯:\(p\)-值

在卷 B 中,\(p\)-值是你最好的朋友。卷 A 通常要求你尋找臨界值(critical value),而卷 B 的輸出幾乎總是直接提供 \(p\)-值。

什麼是 \(p\)-值? 它是在原假設(\(H_0\))為真的前提下,觀察到與實際觀測結果同樣極端(或更極端)的結果的概率。

檢定的金科玉律:
如果 \(p\)-值 \( < \alpha \)(顯著性水平,通常為 0.05),我們拒絕 \(H_0\)
如果 \(p\)-值 \( \ge \alpha \),我們不拒絕 \(H_0\)

類比:你可以將 \(p\)-值視為反對原假設的「證據強度」。數值越小,代表如果 \(H_0\) 為真,該數據就越令人「驚訝」,因此我們越傾向於捨棄 \(H_0\)。

使用 t.test() 檢定平均值

t.test() 函數是 R 統計功能中的「瑞士軍刀」。它用於在方差未知的情況下,進行涉及正態分佈(Normal distribution)的檢定。

1. 單樣本 t 檢定

用於檢定單個組別的平均值(\(\mu\))是否等於特定數值(\(\mu_0\))。

R 語法: t.test(data_vector, mu = mu_0)

2. 雙樣本 t 檢定

用於比較兩個獨立組別的平均值(\(\mu_1\) 與 \(\mu_2\))。

R 語法: t.test(group1, group2)

默認情況下,R 會執行 Welch t 檢定,該檢定不假設兩組的方差相等。如果考試要求你假設方差相等,你必須加入參數 var.equal = TRUE

3. 配對 t 檢定

當你對同一組對象有兩次測量時使用(例如:減肥前與減肥後的體重)。這就是教學大綱中提到的配對數據檢定(test for paired data)

R 語法: t.test(before_vector, after_vector, paired = TRUE)

閱讀輸出結果

當你執行 t.test() 時,R 會提供一段文字。請重點關注以下三個區域:
1. t: 計算得出的檢定統計量。
2. p-value: 將此數值與你的顯著性水平(如 0.05)進行比較。
3. 95 percent confidence interval: 平均值差異的取值範圍。如果此區間包含 0,通常意味著該差異並不顯著!

比例與率:二項分佈與泊松分佈

教學大綱要求你掌握二項分佈概率和泊松分佈平均值的檢定,包括使用正態近似法(normal approximation)

二項分佈檢定

要檢定比例(例如:理賠發生的概率),我們使用 binom.test() 獲取精確結果,或使用 prop.test() 進行正態近似。

例子: 如果你在 100 次試驗中有 30 次成功,想檢定 \(p = 0.25\):
binom.test(x = 30, n = 100, p = 0.25)

泊松分佈檢定

要檢定泊松過程的率(例如:每年的事故次數),請使用 poisson.test()

R 語法: poisson.test(x = count_of_events, T = time_period, r = hypothesized_rate)

關鍵要點: 對於這兩個函數,R 都會提供 \(p\)-值以及參數(\(p\) 或 \(\lambda\))的置信區間。務必檢查來自 \(H_0\) 的「假設值」是否落在提供的置信區間內。

非參數方法:排列檢定與自助法

有時我們不想假設數據遵循完美的正態分佈或泊松分佈。教學大綱強調了兩種現代技術:排列檢定(Permutation tests)自助法(Bootstrapping)

1. 排列檢定法

這用於非參數假設檢定。我們不使用分佈公式,而是多次「洗牌」(shuffle)數據標籤,看看我們的觀測結果在隨機情況下發生的概率有多大。

在卷 B 中,你可能會被要求編寫一個簡單的 for 迴圈來重新排列數據並重複計算檢定統計量,從而構建你自己的分佈。

2. 自助法 (The Bootstrap Method)

當標準公式未知或分佈情況複雜時,這用於獲取估計量的置信區間

運作方式:
1. 對你的數據進行多次有放回抽樣(resample with replacement)(例如 1,000 次)。
2. 計算每次抽樣的統計量(如平均值或方差)。
3. 這 1,000 個結果中的第 2.5 和 第 97.5 百分位數,便構成了你的 95% 自助法置信區間。

你知道嗎?「Bootstrapping」一詞源於片語「to pull oneself up by one's bootstraps」(靠自己的靴帶拉起自己),這寓意著數據可以在沒有外部幫助的情況下「尋找自己的分佈」!

解讀回歸分析輸出

雖然回歸分析有其專門的章節,但你必須能夠在回歸總結(summary(lm_model))中識別出檢定置信區間

1. Standard Error (標準誤差): 用於構建斜率(\(\beta\))的置信區間。
2. t value (t 值): 針對 \(H_0: \beta = 0\) 的檢定統計量。
3. Pr(>|t|): 該特定變量的 \(p\)-值。如果該值很小,則該變量是一個顯著的預測因子。

對於廣義線性模型(GLMs),你會查看離差(deviance),並使用 Pearson 卡方檢定似然比檢定(likelihood-ratio test)來確定模型是否與數據擬合良好。

應避免的常見錯誤

1. 錯誤的對立假設: R 默認進行「雙側」檢定。如果你的假設是「大於」(\(H_1: \mu > \mu_0\)),你必須在 R 代碼中指定 alternative = "greater",否則你的 \(p\)-值將會錯誤!

2. 誤解置信區間(CI): 請記住,95% 置信區間意味著如果我們重複實驗多次,在這些計算出的區間中,有 95% 會包含真實參數。這並不代表參數有 95% 的概率落在這一個特定區間內(雖然這是學生非常容易犯的錯誤!)。

3. 混淆配對與獨立樣本: 務必問自己:「這是兩個不同的組別(獨立),還是同一組別測量了兩次(配對)?」在 t.test() 中用錯類型會導致失分。

快速複習欄

- p-value < 0.05: 結果顯著,拒絕 \(H_0\)。
- t.test(): 平均值(正態數據)。配對數據使用 paired = TRUE
- binom.test() / prop.test(): 比例(二項數據)。
- poisson.test(): 率(泊松數據)。
- Bootstrap (自助法): 通過有放回抽樣獲取置信區間。
- Permutation (排列檢定): 通過洗牌標籤獲取非參數檢定的 \(p\)-值。

如果 R 代碼起初讓你感到不知所措,請不要擔心。在卷 B 中,你通常可以查看 R 的幫助文件(例如輸入 ?t.test),這會提醒你所需的參數!