導論:理解數據中的關係
在精算學的世界裡,我們很少孤立地觀察單一數據。相反,我們通常對兩個事物如何共同變化感興趣。例如,如果受保人的年齡增加,他們的保險索償頻率是否也會隨之增加?這就是我們所說的相關性 (correlation)。 在本章中,我們將探索三種主要方法,用來衡量兩個變量(二元數據)之間關係的強度和方向:皮爾遜 (Pearson’s)、斯皮爾曼 (Spearman’s) 和肯德爾 (Kendall’s) 相關係數。你可以將這些視為不同的「透鏡」,透過它們觀察相同的數據,可以看到不同類型的聯繫。1. 皮爾遜積差相關係數 (Pearson’s Product-Moment Correlation Coefficient)
皮爾遜相關係數通常用樣本的 \(r\) 或母體的 \(\rho\) 表示,是最常用的相關性衡量指標。它衡量的是兩個連續變量之間線性 (linear) 關係的強度。它告訴我們什麼?
\(r\) 的值始終介於 \(-1\) 與 \(+1\) 之間:- \(r = +1\):完全正線性關係(當一個增加時,另一個以直線方式增加)。
- \(r = -1\):完全負線性關係(當一個增加時,另一個以直線方式減少)。
- \(r = 0\):完全沒有線性關係。
計算公式
對於含有 \(n\) 對數據 \((x_i, y_i)\) 的樣本,公式為:\(r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}\)
你可能也會看到使用「平方和」符號的寫法:\(r = \frac{S_{xy}}{\sqrt{S_{xx} S_{yy}}}\)
重要注意事項
皮爾遜相關係數非常敏感。它假設關係是一條直線,並且受離群值 (outliers)(極端值)的影響很大。如果你的數據呈現曲線(例如「U」形),即使存在很強的關係,皮爾遜係數也可能告訴你沒有相關性!核心重點:當你預期存在直線關係且數據中沒有極端離群值時,請使用皮爾遜係數。
2. 斯皮爾曼等級相關係數 (Spearman’s Rank Correlation Coefficient)
有時候,我們不在乎具體的數值,而在乎數據的等級 (rank) 或順序。這就是斯皮爾曼等級相關係數 (\(r_s\) 或 \(\rho_s\)) 發揮作用的地方。運作原理
我們不使用原始數據(如 $1,250 和 $5,000),而是將它們排名(第 1、第 2、第 3 等)。然後,我們對這些排名計算皮爾遜相關係數。 如果沒有重複的排名(tied ranks),我們可以使用這個簡化公式:\(r_s = 1 - \frac{6 \sum d_i^2}{n(n^2 - 1)}\)
其中 \(d_i\) 是 \(x_i\) 的排名與 \(y_i\) 的排名之間的差。為什麼要使用它?
斯皮爾曼相關係數衡量的是單調 (monotonic) 關係。如果當一個變量增加時,另一個變量也傾向於增加(即使不是呈直線),則該關係是單調的。- 它對離群值具有穩健性 (robust),因為排名限制了極端值的影響。
- 它可以用於定序數據 (ordinal data)(具有自然順序的數據,如「低」、「中」、「高」)。
核心重點:斯皮爾曼係數非常適合處理呈現曲線但持續增長的關係,或者是包含雜亂離群值的數據。
3. 肯德爾等級相關係數 (Kendall’s Rank Correlation Coefficient / Tau)
肯德爾 Tau (\(\tau\)) 是另一種基於排名的衡量方法,但其運作方式與斯皮爾曼略有不同。它觀察的是數據點對的方向。一致對 (Concordant) 與不一致對 (Discordant)
想像從數據集中任選兩個人:- 如果一個人在兩個變量中的排名都高於另一個人,則這一對是一致的 (concordant)。他們在方向上「達成共識」。
- 如果一個人在第一個變量中排名較高,但在第二個變量中排名較低,則這一對是不一致的 (discordant)。他們「意見分歧」。
\(\tau = \frac{(\text{一致對的數量}) - (\text{不一致對的數量})}{\frac{1}{2} n(n - 1)}\)
為什麼要使用肯德爾係數?
雖然斯皮爾曼較為常見,但在以下情況下通常優先選擇肯德爾 Tau:- 數據集非常小。
- 存在許多重複的排名(ties)。
- 在某些情境下,你希望衡量指標在假設檢定中具有更好的統計特性。
核心重點:肯德爾係數觀察的是成對數據之間的「一致性」,對於樣本量小或重複排名多的數據集非常有用。
4. 相關性的統計推論 (Statistical Inference)
計算出一個數字只是開始。作為精算師,我們需要知道:這個相關性是真實存在的,還是僅僅是隨機機率產生的結果?假設檢定 (Hypothesis Testing)
我們通常檢定原假設:\(H_0: \rho = 0\)(母體中不存在相關性)
對抗備擇假設:\(H_1: \rho \neq 0\)(存在相關性)
對於皮爾遜相關係數,如果數據服從二元正態分佈,我們可以使用具有 \(n - 2\) 自由度的 \(t\) 檢定:\(t = r \sqrt{\frac{n - 2}{1 - r^2}}\)
註:斯皮爾曼和肯德爾也有類似的檢定方法,通常涉及查閱圖表中的臨界值或使用 R 等軟件(正如你在 Paper B 中所做的那樣)。總結與比較
快速比較表
皮爾遜 (Pearson):線性關係;對離群值敏感;需要連續數據。
斯皮爾曼 (Spearman):單調關係;使用排名;對離群值具穩健性。
肯德爾 (Kendall):基於成對數據的一致性;最適合小樣本或多重複排名的數據。
應避免的常見錯誤
- 相關性 \(\neq\) 因果關係:僅僅因為兩件事相關,並不意味著其中一件導致了另一件。(例如:雪糕銷量和鯊魚襲擊事件相關,是因為天氣炎熱,而不是因為雪糕吸引鯊魚!)
- 誤解 \(r = 0\):對於皮爾遜係數,\(r = 0\) 僅表示沒有線性關係。兩者之間可能仍存在非常強的非線性關係。
- 忽略散佈圖 (Scatterplot):在選擇相關性衡量方法之前,務必先觀察數據的可視化圖表!
快速複習題
- 對於呈現曲線但始終向上增長的關係,你會使用哪種衡量方法?(答案:斯皮爾曼或肯德爾)
- 如果 \(r = -0.9\),這告訴你關於兩者關係的什麼信息?(答案:強負線性關係)
- 為什麼對於含有離群值的數據,斯皮爾曼通常優於皮爾遜?(答案:因為排名「中和」了極端值的影響)
欲了解更多有關數據可視化的信息,請參閱「摘要統計與探索性數據可視化」章節。若想了解這些變量在預測模型中的關係,請參考「回歸理論與應用」部分。