歡迎來到探索性數據分析(EDA)的世界!

歡迎你!精算師在構建複雜的模型來預測未來之前,首先需要了解現狀。你可以把探索性數據分析(Exploratory Data Analysis,簡稱 EDA)想像成偵探工作。在解決「犯罪」(業務問題)之前,你需要先查看所有線索(數據),看看它們講述的是什麼故事。在本章中,我們將學習如何清理、可視化並概括數據,以便日後作出更精明的決策。如果起初你覺得統計學有點枯燥,不必擔心——我們會用現實生活中的場景來為你一一拆解!

1. 理解你的數據:原始原材料

在分析數據之前,我們需要知道自己手頭上有的是什麼類型的數據。並非所有數據都是平等的!就像你不會用溫度計來測量一個人有多喜歡某部電影一樣,我們對不同類型的數據需要使用不同的工具。

分類數據(Categorical Data,質性數據)

這描述的是「性質」或「標籤」。它是可以歸入不同組別的數據。
名目數據(Nominal Data): 僅僅是名稱,沒有特定的順序。例子:眼睛顏色(藍色、棕色、綠色)。
順序數據(Ordinal Data): 具有自然的順序。例子:客戶滿意度(低、中、高)。

數值數據(Numerical Data,量化數據)

這描述的是「數量」或可以用數學處理的數字。
離散數據(Discrete Data): 可數的值,通常是整數。例子:一個人提出的保險索賠次數(0, 1, 2...)。你不可能提出 1.5 次索賠!
連續數據(Continuous Data): 可以在一定範圍內取任何值的測量結果。例子:處理索賠所需的精確時間(3.452 天)或人的身高。

小撇步: 如果你可以問「有多少?(How many?)」,它通常是離散的。如果你可以問「多少量?(How much?)」,它通常是連續的。

2. 統計摘要:描述「中心」(位置)

統計摘要能幫助我們將一大堆數字轉化為幾個有意義的數值。首先,我們尋找數據的「中間位置」。

平均數(Arithmetic Mean,算術平均值)

所有數值的總和除以觀測值的數量。
公式: \( \bar{x} = \frac{\sum_{i=1}^{n} x_i}{n} \)
現實範例: 如果你有 5 筆保險索賠,金額分別為 $100、$200、$150、$300 和 $1000,平均數為 \( (100+200+150+300+1000) / 5 = \$350 \)。

中位數(Median)

當數據從小到大排序時,位於中間的值。如果你有偶數個數據點,則取中間兩個數字的平均值。
為什麼要用它? 中位數具有「穩健性」(Robust)。它不容易受到異常值(Outliers,極端值)的影響。在上面的例子中,$1000 的索賠讓平均數看起來很高,但中位數只有 $200。對於偏態數據來說,它往往是一個更好的「典型」代表值。

眾數(Mode)

出現次數最多的數值。在我們的索賠例子中,眾數並不顯著,但如果我們有兩筆 $100 的索賠,眾數就會是 $100。

重點總結: 對於對稱數據使用平均數,當數據中存在可能扭曲平均值的極端數值時,使用中位數

3. 統計摘要:描述「離散程度」(分散度)

只知道中心點是不夠的。我們還需要知道數據是集中在一起,還是分得很開。

變異數與標準差(Variance and Standard Deviation)

這些衡量的是數據點與平均值的平均距離。
變異數(\( s^2 \)): 離差平方的平均值。
標準差(\( s \)): 變異數的平方根。我們更常用標準差,因為它的單位與原始數據相同(例如:美元,而不是平方美元)。
樣本標準差公式: \( s = \sqrt{\frac{\sum (x_i - \bar{x})^2}{n-1}} \)

全距與四分位距(Range and Interquartile Range, IQR)

全距(Range): 最大值減最小值。對異常值非常敏感。
四分位距(IQR): 第 75 百分位數(\( Q_3 \))與第 25 百分位數(\( Q_1 \))之間的距離。它涵蓋了數據中間的 50%。
公式: \( IQR = Q_3 - Q_1 \)

你知道嗎? 精算師非常關注數據的離散程度,因為它代表了風險。索賠成本的離散程度越高,意味著保險公司面臨的不確定性越大!

4. 描述形狀:偏度(Skewness)

你的數據像鐘形一樣對稱,還是其中一側有長長的「尾巴」?

對稱分佈: 平均數 \(\approx\) 中位數 \(\approx\) 眾數。左側是右側的鏡像。
正偏態(右偏態,Positively Skewed): 「尾巴」指向右側(較大的值)。平均數 > 中位數。例子:個人財富(少數億萬富翁將平均數拉高了)。
負偏態(左偏態,Negatively Skewed): 「尾巴」指向左側(較小的值)。平均數 < 中位數。例子:退休年齡(大多數人晚退休,少數人很早退休)。

記憶小技巧: 偏度在哪邊,尾巴就在哪邊。如果尾巴在右邊,就是偏態。

5. 圖形化 EDA:眼見為憑

有時候,一張圖表勝過一千個數字。

直方圖(Histograms)

用於連續數據。它將數據分組為「箱子」(區間)並顯示每個箱子的頻率。這是觀察數據形狀(偏度)的最佳方式。

盒鬚圖(Boxplots,箱型圖)

盒鬚圖使用 5 個關鍵數字來總結數據:
1. 最小值(不含異常值)
2. 下四分位數(\( Q_1 \))
3. 中位數(\( Q_2 \))
4. 上四分位數(\( Q_3 \))
5. 最大值(不含異常值)

盒鬚圖解讀步驟:
• 「箱子」顯示了 IQR(中間 50%)。
• 箱子內部的「橫線」是中位數。
• 「鬚」延伸至最小值和最大值。
• 在鬚之外的點通常被視為異常值

散點圖(Scatter Plots)

用於查看兩個數值變量之間的關係。例如,行駛里程數是否與事故數量有關?如果點形成一條向上的線,則存在正相關。

6. 識別異常值

異常值是與其他數據點「異常地」遠的觀測值。在 CS1 中,我們通常使用 1.5 x IQR 規則來找出它們。

如何尋找異常值:
1. 計算 \( IQR = Q_3 - Q_1 \)。
2. 計算「下邊界」: \( Q_1 - (1.5 \times IQR) \)。
3. 計算「上邊界」: \( Q_3 + (1.5 \times IQR) \)。
4. 任何低於下邊界或高於上邊界的數據點都是異常值!

常見錯誤: 不要直接刪除異常值!它們可能確實是錯誤,但也有可能是最重要的數據點(例如巨額的保險災難賠償)。

快速複習欄

• 分類數據: 標籤/組別。 數值數據: 測量值。
• 平均數: 對異常值敏感。 中位數: 不敏感(穩健)。
• 右偏態: 尾巴在右邊,平均數 > 中位數。
• 異常值規則: 任何超出 \( [Q_1 - 1.5IQR, Q_3 + 1.5IQR] \) 範圍的值。
• 直方圖: 顯示分佈形狀。 盒鬚圖: 顯示四分位數和異常值。

最後的鼓勵

EDA 是你在精算統計學中所做一切的基礎。如果你能掌握觀察數據並發現模式或異常情況的藝術,那麼你已經向成為一名優秀精算師邁進了一半。如果變異數或偏度的公式看起來很嚇人,不用擔心——透過練習,這些很快就會成為你的直覺!