歡迎來到單變量數據探索!

你好!歡迎來到 Exam PA 之旅最關鍵的起步階段之一。在我們構建華麗的預測模型之前,必須先了解我們的數據。將單變量數據探索(Univariate Data Exploration)想像成與數據集進行的「第一次約會」——你只需要一次針對一個變量("uni" 意為單一)來了解基本事實。完成本章後,你將學會如何總結和視覺化個別變量,從而發現其中的規律、錯誤或驚喜。

如果你還不是數學天才也不用擔心。我們會將所有內容拆解成簡單的部分,並附上大量範例!


1. 分類數據 vs. 數值數據:兩大類別

在進行任何分析前,我們必須先確認手頭上的數據類型。在精算領域中,數據通常分為兩大類:

分類數據 (Categorical / Qualitative Data)

這類數據是標籤或名稱。你無法對它們進行數學運算(例如,你不能將「紅色」+「藍色」相加)。

  • 名義數據 (Nominal): 沒有自然順序的類別(例如:性別、居住地、汽車顏色)。
  • 順序數據 (Ordinal): 具有特定順序的類別(例如:教育程度:高中、學士、碩士)。

數值數據 (Numeric / Quantitative Data)

這類數據是代表測量或計數的數字。

  • 離散數據 (Discrete): 可數的數字(例如:索賠次數、子女數目)。
  • 連續數據 (Continuous): 在一定範圍內可取任何值的數據(例如:索賠金額、保單持有人年齡)。

快速複習: 如果你能計算出一個有意義的平均值,它很可能是數值數據。如果你是將事物歸類為不同的「類型」,那麼它就是分類數據


2. 探索分類數據

由於我們無法計算顏色或地區的「平均值」,我們會使用頻率(frequencies)來探索分類數據。

頻率表 (Frequency Tables)

這僅僅是計算每個類別出現的次數。我們通常也會查看相對頻率 (Relative Frequency),即各類別佔總數的百分比。

使用長條圖 (Bar Charts) 視覺化

長條圖在這裡是你最好的幫手。每個長條代表一個類別,長條的高度則代表該類別的計數或百分比。

範例: 一張顯示按「地區」(北、南、東、西)銷售保單數量的長條圖。如果「北部」的長條高度是「南部」的兩倍,你立刻就能看出業務集中在哪裡。

常見錯誤: 不要把長條圖和直方圖(Histogram)搞混了!長條圖的長條之間有間隙,因為類別是離散的;而直方圖沒有間隙,因為數據是連續的。


3. 探索數值數據:集中趨勢 (Central Tendency)

我們想知道數據的「中心」在哪裡。主要有三種測量方式:

  • 平均值 (Mean): 算術平均數。將所有數值加總後除以個數。
    \( \bar{x} = \frac{\sum x_i}{n} \)
  • 中位數 (Median): 將數據排序後的中間值。如果數據存在極端值 (outliers),中位數通常比平均值更能代表「典型」情況。
  • 眾數 (Mode): 出現頻率最高的數值。

現實生活類比: 想像房間裡有 10 個年薪 5 萬美元的人。這時,一位億萬富翁走了進來。平均值薪水會飆升,讓每個人看起來都很富有。然而,中位數(中間那位的薪水)幾乎完全不變。這就是為什麼我們說中位數對極端值具有穩健性 (robust)


4. 探索數值數據:離散程度 (Dispersion / Spread)

只知道中心還不夠,我們還需要知道數據是緊密聚集還是分散的。

變異數與標準差 (Variance and Standard Deviation)

這些指標用於衡量數據點平均偏離平均值的程度。

  • 變異數 (\( \sigma^2 \)): 數據點偏離平均值後的平方差的平均值。
  • 標準差 (\( \sigma \)): 變異數的平方根。它的單位與原始數據相同(例如:美元),因此更易於解讀。

五數概括與四分位距 (Five-Number Summary and IQR)

這是觀察數據分散程度,而不受極端值干擾的好方法:

  1. 最小值 (Minimum)
  2. 第一四分位數 (Q1 - 第 25 百分位數)
  3. 中位數 (Q2 - 第 50 百分位數)
  4. 第三四分位數 (Q3 - 第 75 百分位數)
  5. 最大值 (Maximum)

四分位距 (IQR): \( Q3 - Q1 \)。它告訴你數據中「中間 50%」的範圍。


5. 分佈形狀 (Shape of the Distribution)

當你查看數據圖表時,它的「輪廓」長什麼樣子?

偏度 (Skewness)

偏度告訴我們數據的對稱性。

  • 右偏 (Right Skewed / Positive Skew): 「尾巴」指向右側。大多數數值較小,但少數極大的數值將平均值拉向右側。(範例:保險索賠金額——大多數很小,但少數金額巨大!
  • 左偏 (Left Skewed / Negative Skew): 「尾巴」指向左側。(範例:退休年齡——大多數人年紀較大,但少數人很年輕就退休。
  • 對稱 (Symmetric): 左側和右側是鏡像關係(如常態分佈)。

記憶小撇步: 「尾巴指明方向」。如果長長的細尾巴在右邊,就是右偏!

峰度 (Kurtosis)

這描述了尾巴有多「厚」。高峰度意味著出現極端值的風險更高(厚尾效應)。


6. 視覺化數值數據

直方圖 (Histograms)

直方圖將數值數據分組到「區間 (bins)」中並顯示頻率。它非常適合用來觀察數據的形狀偏度

箱型圖 (Boxplots / Whisker Plots)

箱型圖視覺化呈現了五數概括:

  • 箱體 (Box) 顯示了 IQR(中間 50% 的數據)。
  • 箱體內的線條是中位數。
  • 鬍鬚 (Whiskers) 延伸顯示範圍(通常為 1.5 倍的 IQR)。
  • 鬍鬚外的代表潛在的極端值 (outliers)

你知道嗎? 箱型圖是檢測極端值的利器。如果你看到離鬍鬚很遠的點,那些就是你在 Exam PA 專案中應該深入調查的對象!


7. 發現問題:極端值與缺失值

單變量探索是你發現「髒」數據的第一機會。

  • 極端值 (Outliers): 與其餘數據顯著不同的數據點。它們可能是錯誤(例如 200 歲的保單持有人),也可能是合法的極端個案(例如 1,000 萬美元的索賠)。
  • 缺失值 (Missing Values): 尋找 "NA" 或空白。有時數據會用 "0" 或 "999" 來表示缺失——要小心!

快速總結表:

特徵: 集中趨勢 | 指標: 平均值、中位數、眾數
特徵: 離散程度 | 指標: 標準差、IQR、全距 (Range)
特徵: 形狀 | 指標: 偏度、峰度
特徵: 視覺化 | 指標: 直方圖、箱型圖、長條圖


Exam PA 核心要點

1. 務必先檢查變量的類型(分類數據 vs. 數值數據)。

2. 對於數值數據,觀察平均值 vs. 中位數。如果兩者相差甚遠,數據很可能是偏態的。

3. 使用直方圖觀察分佈形狀,並使用箱型圖找出極端值。

4. 右偏數據在保險業中非常常見(如索賠/損失)。在後續建模過程中,你可能需要對這些數據進行轉換(例如使用對數轉換 Log transform)。

繼續加油!你正在構建向評分員解釋數據所需的堅實基礎。你一定能做到的!