歡迎來到單變量數據探索!
你好!歡迎來到 Exam PA 之旅最關鍵的起步階段之一。在我們構建華麗的預測模型之前,必須先了解我們的數據。將單變量數據探索(Univariate Data Exploration)想像成與數據集進行的「第一次約會」——你只需要一次針對一個變量("uni" 意為單一)來了解基本事實。完成本章後,你將學會如何總結和視覺化個別變量,從而發現其中的規律、錯誤或驚喜。
如果你還不是數學天才也不用擔心。我們會將所有內容拆解成簡單的部分,並附上大量範例!
1. 分類數據 vs. 數值數據:兩大類別
在進行任何分析前,我們必須先確認手頭上的數據類型。在精算領域中,數據通常分為兩大類:
分類數據 (Categorical / Qualitative Data)
這類數據是標籤或名稱。你無法對它們進行數學運算(例如,你不能將「紅色」+「藍色」相加)。
- 名義數據 (Nominal): 沒有自然順序的類別(例如:性別、居住地、汽車顏色)。
- 順序數據 (Ordinal): 具有特定順序的類別(例如:教育程度:高中、學士、碩士)。
數值數據 (Numeric / Quantitative Data)
這類數據是代表測量或計數的數字。
- 離散數據 (Discrete): 可數的數字(例如:索賠次數、子女數目)。
- 連續數據 (Continuous): 在一定範圍內可取任何值的數據(例如:索賠金額、保單持有人年齡)。
快速複習: 如果你能計算出一個有意義的平均值,它很可能是數值數據。如果你是將事物歸類為不同的「類型」,那麼它就是分類數據。
2. 探索分類數據
由於我們無法計算顏色或地區的「平均值」,我們會使用頻率(frequencies)來探索分類數據。
頻率表 (Frequency Tables)
這僅僅是計算每個類別出現的次數。我們通常也會查看相對頻率 (Relative Frequency),即各類別佔總數的百分比。
使用長條圖 (Bar Charts) 視覺化
長條圖在這裡是你最好的幫手。每個長條代表一個類別,長條的高度則代表該類別的計數或百分比。
範例: 一張顯示按「地區」(北、南、東、西)銷售保單數量的長條圖。如果「北部」的長條高度是「南部」的兩倍,你立刻就能看出業務集中在哪裡。
常見錯誤: 不要把長條圖和直方圖(Histogram)搞混了!長條圖的長條之間有間隙,因為類別是離散的;而直方圖沒有間隙,因為數據是連續的。
3. 探索數值數據:集中趨勢 (Central Tendency)
我們想知道數據的「中心」在哪裡。主要有三種測量方式:
- 平均值 (Mean): 算術平均數。將所有數值加總後除以個數。
\( \bar{x} = \frac{\sum x_i}{n} \) - 中位數 (Median): 將數據排序後的中間值。如果數據存在極端值 (outliers),中位數通常比平均值更能代表「典型」情況。
- 眾數 (Mode): 出現頻率最高的數值。
現實生活類比: 想像房間裡有 10 個年薪 5 萬美元的人。這時,一位億萬富翁走了進來。平均值薪水會飆升,讓每個人看起來都很富有。然而,中位數(中間那位的薪水)幾乎完全不變。這就是為什麼我們說中位數對極端值具有穩健性 (robust)!
4. 探索數值數據:離散程度 (Dispersion / Spread)
只知道中心還不夠,我們還需要知道數據是緊密聚集還是分散的。
變異數與標準差 (Variance and Standard Deviation)
這些指標用於衡量數據點平均偏離平均值的程度。
- 變異數 (\( \sigma^2 \)): 數據點偏離平均值後的平方差的平均值。
- 標準差 (\( \sigma \)): 變異數的平方根。它的單位與原始數據相同(例如:美元),因此更易於解讀。
五數概括與四分位距 (Five-Number Summary and IQR)
這是觀察數據分散程度,而不受極端值干擾的好方法:
- 最小值 (Minimum)
- 第一四分位數 (Q1 - 第 25 百分位數)
- 中位數 (Q2 - 第 50 百分位數)
- 第三四分位數 (Q3 - 第 75 百分位數)
- 最大值 (Maximum)
四分位距 (IQR): \( Q3 - Q1 \)。它告訴你數據中「中間 50%」的範圍。
5. 分佈形狀 (Shape of the Distribution)
當你查看數據圖表時,它的「輪廓」長什麼樣子?
偏度 (Skewness)
偏度告訴我們數據的對稱性。
- 右偏 (Right Skewed / Positive Skew): 「尾巴」指向右側。大多數數值較小,但少數極大的數值將平均值拉向右側。(範例:保險索賠金額——大多數很小,但少數金額巨大!)
- 左偏 (Left Skewed / Negative Skew): 「尾巴」指向左側。(範例:退休年齡——大多數人年紀較大,但少數人很年輕就退休。)
- 對稱 (Symmetric): 左側和右側是鏡像關係(如常態分佈)。
記憶小撇步: 「尾巴指明方向」。如果長長的細尾巴在右邊,就是右偏!
峰度 (Kurtosis)
這描述了尾巴有多「厚」。高峰度意味著出現極端值的風險更高(厚尾效應)。
6. 視覺化數值數據
直方圖 (Histograms)
直方圖將數值數據分組到「區間 (bins)」中並顯示頻率。它非常適合用來觀察數據的形狀和偏度。
箱型圖 (Boxplots / Whisker Plots)
箱型圖視覺化呈現了五數概括:
- 箱體 (Box) 顯示了 IQR(中間 50% 的數據)。
- 箱體內的線條是中位數。
- 鬍鬚 (Whiskers) 延伸顯示範圍(通常為 1.5 倍的 IQR)。
- 鬍鬚外的點代表潛在的極端值 (outliers)。
你知道嗎? 箱型圖是檢測極端值的利器。如果你看到離鬍鬚很遠的點,那些就是你在 Exam PA 專案中應該深入調查的對象!
7. 發現問題:極端值與缺失值
單變量探索是你發現「髒」數據的第一機會。
- 極端值 (Outliers): 與其餘數據顯著不同的數據點。它們可能是錯誤(例如 200 歲的保單持有人),也可能是合法的極端個案(例如 1,000 萬美元的索賠)。
- 缺失值 (Missing Values): 尋找 "NA" 或空白。有時數據會用 "0" 或 "999" 來表示缺失——要小心!
快速總結表:
特徵: 集中趨勢 | 指標: 平均值、中位數、眾數
特徵: 離散程度 | 指標: 標準差、IQR、全距 (Range)
特徵: 形狀 | 指標: 偏度、峰度
特徵: 視覺化 | 指標: 直方圖、箱型圖、長條圖
Exam PA 核心要點
1. 務必先檢查變量的類型(分類數據 vs. 數值數據)。
2. 對於數值數據,觀察平均值 vs. 中位數。如果兩者相差甚遠,數據很可能是偏態的。
3. 使用直方圖觀察分佈形狀,並使用箱型圖找出極端值。
4. 右偏數據在保險業中非常常見(如索賠/損失)。在後續建模過程中,你可能需要對這些數據進行轉換(例如使用對數轉換 Log transform)。
繼續加油!你正在構建向評分員解釋數據所需的堅實基礎。你一定能做到的!