導言:從數據中挖掘故事

歡迎!在精算科學的世界裡,我們經常會面對龐大的數據集,它們看起來就像一堆毫無意義的數字。在深入進行複雜的模型構建之前,我們需要先進行探索性數據分析 (Exploratory Data Analysis, EDA)。在這個階段,我們會利用「探索性圖表」來將數據視覺化,並透過「相關係數」來觀察變量之間的關係。

在你的卷 B (CS1B) 考試中,題目不只要求你生成這些圖表,還會要求你進行解釋。請把自己想像成一名正在尋找線索的偵探——數據是否偏斜?有沒有奇特的離群值?兩個變量是否共同變動?讓我們一起學習如何利用 R 來找出這些答案。


1. 單變量數據視覺化:觀察單一變量

在研究變量間的關係之前,我們需要先了解個別變量。課程大綱強調使用探索性視覺化工具來理解數據的分佈情況。

直方圖 (Histogram):hist()

直方圖能幫助我們觀察數據的「形狀」。它將數據分成不同的「組距」(bins),並顯示落入每個組距的觀測值數量。這對於檢查數據是對稱還是偏斜非常有用。

R 語法:
hist(data_vector, main = "標題", xlab = "標籤", col = "blue")

精算類比:想像你正在整理索償金額。如果大部分的索償金額都很小,但有少數幾宗金額巨大,你的直方圖就會向右延伸出一條「長尾巴」。這被稱為正偏態 (positive skew),在保險領域中非常常見!

箱形圖 (Boxplot):boxplot()

箱形圖(又稱盒鬚圖)能直觀地呈現五數概括法 (five-number summary):最小值、第一四分位數 (\(Q1\))、中位數、第三四分位數 (\(Q3\)) 以及最大值。

解讀重點:
- 「箱子」部分:代表四分位距 (IQR),包含了中間 50% 的數據。
- 粗線:這代表中位數
- 「鬚線」:延伸至不被視為離群值的最極端數據點。
- 點點/圓圈:鬚線之外的點就是離群值 (outliers)。對精算師來說,這些點至關重要,因為它們可能代表「災難性」的索償個案。

R 語法:
boxplot(data_vector, horizontal = TRUE)


2. 雙變量數據視覺化:散點圖

當我們想觀察兩個變量之間是否存在關係時(例如「投保人年齡」與「索償次數」),我們會使用散點圖 (scatter plot)

繪圖函數:plot()

在 R 中,plot(x, y) 會創建一個散點圖,其中 \(x\) 是解釋變量(通常在水平軸),而 \(y\) 是反應變量(通常在垂直軸)。

觀察重點:
- 方向:點的分佈是從左下往右上(正相關)還是從左上往右下(負相關)?
- 形態:點的分佈看起來像直線(線性)還是曲線?
- 強度:點與點之間靠得有多近?分佈越密集代表關係越強。

小貼士:在卷 B 考試中,記得一定要為坐標軸標註標籤!使用 xlab = "..."ylab = "...",確保不會在這些簡單的地方丟分。


3. 相關性:衡量變量間的聯繫

雖然圖表給了我們視覺上的「感覺」,但相關係數則為關係的強度和方向提供了一個數值。CS1 課程要求你掌握三種特定的衡量指標。

相關性三劍客

1. 皮爾森積差相關係數 (Pearson’s Product-Moment Correlation, \(r\))
衡量兩個變量之間線性關係的強度。它假設數據大致呈正態分佈。
- 數值為 \(+1\):完美的正線性關係。
- 數值為 \(-1\):完美的負線性關係。
- 數值為 \(0\):無線性關係。

2. 斯皮爾曼等級相關係數 (Spearman’s Rank Correlation, \(\rho\))
這是一種「非參數」衡量指標。它不使用原始數值,而是使用數據的排名 (ranks)。它非常適合檢測單調 (monotonic) 關係(即變量朝相同方向移動,但不一定是直線)。相比皮爾森係數,它對離群值的敏感度較低。

3. 肯德爾等級相關係數 (Kendall’s Tau, \(\tau\))
與斯皮爾曼類似,這也是基於排名的指標。它觀察的是「一致對」(concordant) 與「不一致對」(discordant)。通常用於樣本量較小或存在大量相同排名(平秩)的情況。

相關性的 R 代碼

cor() 函數是你的好幫手,你只需要指定「方法」(method):

cor(x, y, method = "pearson")
cor(x, y, method = "spearman")
cor(x, y, method = "kendall")

快速複習:該用哪一個?
- 如果關係看起來像一條直線:Pearson
- 如果關係是曲線但始終遞增/遞減:Spearman
- 如果數據中有極端離群值,可能會「拉偏」直線:SpearmanKendall


4. 常見陷阱與解讀建議

如果起初覺得這有點難,請不要擔心;解讀輸出結果是一項隨著練習而增長的技能。以下是你在考試作答時需要留意的事項:

相關不代表因果 (Correlation \(\neq\) Causation)
僅僅因為兩個變量具有很高的相關係數(例如 \(0.95\)),並不代表其中一個變量導致了另一個。在考試評論中,請使用像「……之間存在強烈的正線性關聯」之類的字眼,而不要說「變量 X 導致變量 Y」

離群值的影響
單一離群值就可能顯著地降低(或增加!)Pearson 相關係數。如果你在散點圖中看到離群值,但 Spearman 相關係數很高,這表示潛在關係其實很強,只是 Pearson 數值被扭曲了。

檢查非線性關係
如果 cor(x, y) 接近 \(0\),並不代表變量之間完全沒有關係。兩者可能存在二次函數(U 型)關係。這就是為什麼我們在計算數值之前,務必要先繪製圖表


卷 B 核心重點回顧

  • hist():觀察單一變量的分佈和偏斜度。
  • boxplot():識別中位數、四分位數和離群值。
  • plot(x, y):將兩個變量之間的關係視覺化。
  • cor(..., method = "..."):量化關係。
    • Pearson:線性關係。
    • Spearman/Kendall:單調關係(基於排名)。
  • 解讀:在信任相關係數之前,一定要先看圖表!

註:關於如何將這些結果應用於正式檢定的詳情,請參閱「利用軟件輸出進行檢定與置信區間」章節。若要在模型中使用這些變量,請參閱「線性回歸輸出的擬合與解讀」。