導言:從數據中挖掘故事
歡迎!在精算科學的世界裡,我們經常會面對龐大的數據集,它們看起來就像一堆毫無意義的數字。在深入進行複雜的模型構建之前,我們需要先進行探索性數據分析 (Exploratory Data Analysis, EDA)。在這個階段,我們會利用「探索性圖表」來將數據視覺化,並透過「相關係數」來觀察變量之間的關係。
在你的卷 B (CS1B) 考試中,題目不只要求你生成這些圖表,還會要求你進行解釋。請把自己想像成一名正在尋找線索的偵探——數據是否偏斜?有沒有奇特的離群值?兩個變量是否共同變動?讓我們一起學習如何利用 R 來找出這些答案。
1. 單變量數據視覺化:觀察單一變量
在研究變量間的關係之前,我們需要先了解個別變量。課程大綱強調使用探索性視覺化工具來理解數據的分佈情況。
直方圖 (Histogram):hist()
直方圖能幫助我們觀察數據的「形狀」。它將數據分成不同的「組距」(bins),並顯示落入每個組距的觀測值數量。這對於檢查數據是對稱還是偏斜非常有用。
R 語法:
hist(data_vector, main = "標題", xlab = "標籤", col = "blue")
精算類比:想像你正在整理索償金額。如果大部分的索償金額都很小,但有少數幾宗金額巨大,你的直方圖就會向右延伸出一條「長尾巴」。這被稱為正偏態 (positive skew),在保險領域中非常常見!
箱形圖 (Boxplot):boxplot()
箱形圖(又稱盒鬚圖)能直觀地呈現五數概括法 (five-number summary):最小值、第一四分位數 (\(Q1\))、中位數、第三四分位數 (\(Q3\)) 以及最大值。
解讀重點:
- 「箱子」部分:代表四分位距 (IQR),包含了中間 50% 的數據。
- 粗線:這代表中位數。
- 「鬚線」:延伸至不被視為離群值的最極端數據點。
- 點點/圓圈:鬚線之外的點就是離群值 (outliers)。對精算師來說,這些點至關重要,因為它們可能代表「災難性」的索償個案。
R 語法:
boxplot(data_vector, horizontal = TRUE)
2. 雙變量數據視覺化:散點圖
當我們想觀察兩個變量之間是否存在關係時(例如「投保人年齡」與「索償次數」),我們會使用散點圖 (scatter plot)。
繪圖函數:plot()
在 R 中,plot(x, y) 會創建一個散點圖,其中 \(x\) 是解釋變量(通常在水平軸),而 \(y\) 是反應變量(通常在垂直軸)。
觀察重點:
- 方向:點的分佈是從左下往右上(正相關)還是從左上往右下(負相關)?
- 形態:點的分佈看起來像直線(線性)還是曲線?
- 強度:點與點之間靠得有多近?分佈越密集代表關係越強。
小貼士:在卷 B 考試中,記得一定要為坐標軸標註標籤!使用 xlab = "..." 和 ylab = "...",確保不會在這些簡單的地方丟分。
3. 相關性:衡量變量間的聯繫
雖然圖表給了我們視覺上的「感覺」,但相關係數則為關係的強度和方向提供了一個數值。CS1 課程要求你掌握三種特定的衡量指標。
相關性三劍客
1. 皮爾森積差相關係數 (Pearson’s Product-Moment Correlation, \(r\))
衡量兩個變量之間線性關係的強度。它假設數據大致呈正態分佈。
- 數值為 \(+1\):完美的正線性關係。
- 數值為 \(-1\):完美的負線性關係。
- 數值為 \(0\):無線性關係。
2. 斯皮爾曼等級相關係數 (Spearman’s Rank Correlation, \(\rho\))
這是一種「非參數」衡量指標。它不使用原始數值,而是使用數據的排名 (ranks)。它非常適合檢測單調 (monotonic) 關係(即變量朝相同方向移動,但不一定是直線)。相比皮爾森係數,它對離群值的敏感度較低。
3. 肯德爾等級相關係數 (Kendall’s Tau, \(\tau\))
與斯皮爾曼類似,這也是基於排名的指標。它觀察的是「一致對」(concordant) 與「不一致對」(discordant)。通常用於樣本量較小或存在大量相同排名(平秩)的情況。
相關性的 R 代碼
cor() 函數是你的好幫手,你只需要指定「方法」(method):
cor(x, y, method = "pearson")
cor(x, y, method = "spearman")
cor(x, y, method = "kendall")
快速複習:該用哪一個?
- 如果關係看起來像一條直線:Pearson。
- 如果關係是曲線但始終遞增/遞減:Spearman。
- 如果數據中有極端離群值,可能會「拉偏」直線:Spearman 或 Kendall。
4. 常見陷阱與解讀建議
如果起初覺得這有點難,請不要擔心;解讀輸出結果是一項隨著練習而增長的技能。以下是你在考試作答時需要留意的事項:
相關不代表因果 (Correlation \(\neq\) Causation)
僅僅因為兩個變量具有很高的相關係數(例如 \(0.95\)),並不代表其中一個變量導致了另一個。在考試評論中,請使用像「……之間存在強烈的正線性關聯」之類的字眼,而不要說「變量 X 導致變量 Y」。
離群值的影響
單一離群值就可能顯著地降低(或增加!)Pearson 相關係數。如果你在散點圖中看到離群值,但 Spearman 相關係數很高,這表示潛在關係其實很強,只是 Pearson 數值被扭曲了。
檢查非線性關係
如果 cor(x, y) 接近 \(0\),並不代表變量之間完全沒有關係。兩者可能存在二次函數(U 型)關係。這就是為什麼我們在計算數值之前,務必要先繪製圖表!
卷 B 核心重點回顧
hist():觀察單一變量的分佈和偏斜度。boxplot():識別中位數、四分位數和離群值。plot(x, y):將兩個變量之間的關係視覺化。cor(..., method = "..."):量化關係。- Pearson:線性關係。
- Spearman/Kendall:單調關係(基於排名)。
- 解讀:在信任相關係數之前,一定要先看圖表!
註:關於如何將這些結果應用於正式檢定的詳情,請參閱「利用軟件輸出進行檢定與置信區間」章節。若要在模型中使用這些變量,請參閱「線性回歸輸出的擬合與解讀」。