歡迎來到「數據偵探」階段!
在 CP2(建模實踐)中,你經常會面對一大堆雜亂無章的原始數據。在開始構建複雜的公式或模型之前,你必須精確地了解你正在處理的內容。你可以將這一章想像成與數據的「初次見面與交流」。
總結數據的目的是將成千上萬行的數字轉化為幾個關鍵的洞察。這很重要,因為它能幫助你發現錯誤、識別趨勢,並決定哪種建模方法最合適。如果你的數據是「垃圾」,那麼你的模型也會是「垃圾」(這就是著名的 GIGO 原則:Garbage In, Garbage Out,垃圾進,垃圾出!)。
別擔心如果你不是統計天才——我們將會把它拆解成簡單、易於管理的步驟,幫助你在考試中取得好成績。
1. 描述性統計:「三大」衡量指標
當我們觀察一欄數據時,我們想知道「中間」在哪裡。我們稱之為集中趨勢(Central Tendency)。以下是我們衡量它的三種方法:
A. 平均數 (Mean)
即所有數值的總和除以數值的個數。
公式: \( \bar{x} = \frac{\sum x_i}{n} \)
何時使用:當數據呈對稱分佈(分佈均勻)時使用。
陷阱:平均數對離群值(outliers,極端值)非常敏感。例如,如果有五個人每人賺 20,000 美元,而一個人賺 1,000,000 美元,即便這個「平均值」並不能代表大多數人,但它看起來會非常高。
B. 中位數 (Median,中間值)
當你將所有數值按從小到大排列時,位於中間的數值。
何時使用:當你的數據呈偏態(skewed)或存在極端離群值(如樓價或薪酬)時使用。在這些情況下,它比平均數更能反映「典型」數值。
C. 眾數 (Mode,最常見值)
出現頻率最高的數值。
何時使用:非常適合用於分類數據(categorical data)(例如:「哪種索償類型最常見?」)。
快速回顧箱:
• 平均數:對極端值敏感。
• 中位數:對極端值具有穩健性(Robust)。
• 眾數:適合分類數據。
2. 衡量「離散度」:數據有多亂?
單知道平均數是不夠的。想像一條平均深度為 4 英尺的河流——如果某個部分有 10 英尺深,你還是可能會溺水!我們需要了解數據的離散程度(dispersion)。
標準差 (Standard Deviation) 與 方差 (Variance)
它們告訴我們數據點平均距離平均值有多遠。
標準差公式: \( \sigma = \sqrt{\frac{\sum(x_i - \bar{x})^2}{n}} \)
簡單類比:如果班上每個人的考試成績都是 70%,標準差就是零。如果一半人考 40%,一半人考 100%,平均分仍然是 70%,但標準差會非常高!
全距 (Range) 與 四分位距 (IQR)
• 全距:最大值與最小值之間的差。很簡單,但容易受到單一離群值的嚴重影響。
• 四分位距 (IQR):第 75 百分位數(上四分位數)與第 25 百分位數(下四分位數)之差。它告訴你數據中中間 50% 的分佈範圍。
你知道嗎? 在 CP2 中,計算這些統計數據通常是數據驗證(Data Validation)的第一步。如果你的「最小年齡」是 -5 或「最大年齡」是 250,那你已經發現數據錯誤了!
3. 圖形化呈現:視覺化數據的故事
有時候,一張圖表勝過 Excel 中的一千行數據。在 CP2 中,你必須為正確的目的選擇正確的圖表。
直方圖 (Histograms)
它是什麼:一種長條圖,x 軸代表數值的範圍(組距)。
目的:觀察數據的分佈(distribution)形狀。它是鐘形(常態分佈),還是向一側傾斜(偏態)?
盒鬚圖 (Box Plots / Box and Whisker)
它是什麼:一個顯示 IQR 的盒子,中間有一條代表中位數的線,而「鬚」則顯示數據的範圍。
目的:非常適合發現離群值並並排比較不同的組別。
散點圖 (Scatter Plots)
它是什麼:在 X 和 Y 軸上的點。
目的:查看兩個變數之間是否存在相關性(correlation)。例如:「索償金額是否會隨著司機年齡的增加而增加?」
折線圖 (Line Graphs)
它是什麼:由線連接的數據點。
目的:最適合時間序列(Time Series)數據。用它來顯示數值隨月份或年份的變化情況。
關鍵要點:不要僅僅因為圖表看起來好看就使用它。在你的 CP2 總結文件中,你必須解釋為什麼選擇該圖表以及它顯示了什麼(例如:「散點圖顯示體重與成本之間存在微弱的正相關性」)。
4. 數據合理性與品質檢查
這是「數據準備與分析」部分的核心。你必須向考官證明你已經檢查過數據是否合理。
常見的檢查項目:
1. 完整性 (Completeness):是否有空白儲存格或「N/A」值?
2. 唯一性 (Uniqueness):是否有重複的記錄(例如:相同的保單號碼出現兩次)?
3. 範圍檢查 (Range Checks):日期是否出現了不該出現的過去或未來時間?數值是否本應為正數卻出現了負數?
4. 一致性 (Consistency):如果一張保單被標記為「已失效 (Lapsed)」,那麼「已收保費」一欄是否為零?
數據品質記憶法:嘗試 "ACCURATE"
• Accurate(準確)
• Complete(完整)
• Consistent(一致)
• Up-to-date(最新)
• Relevant(相關)
• Authoritative(權威)
• Timely(及時)
• Extended(易於理解)
5. 避免常見錯誤
• 忽略「零」:有時「0」意味著「未收集數據」,有時則真正代表「零」。未經檢查,切勿將它們混為一談!
• 過度簡化:如果你只看平均數,你可能會忽略數據被分為兩個截然不同組別的事實(雙峰分佈)。
• 糟糕的組距劃分:在直方圖中,如果組距太寬,你會丟失細節;如果太窄,圖表看起來就會亂成一團。
• 未加標籤:在 CP2 中,沒有標題和軸標籤的圖表會讓你輕易丟失分數。
總結:CP2 工作流程
1. 清理 (Clean):找出空白處和錯誤。
2. 計算 (Calculate):獲得平均數、中位數、標準差和全距。
3. 視覺化 (Visualise):製作直方圖或盒鬚圖以查看分佈形狀。
4. 驗證 (Verify):問自己:「這些數據對於精算模型來說是否合理?」
5. 記錄 (Document):寫下你的發現。如果你刪除了 10 行錯誤數據,你必須在你的審計追蹤(audit trail)中說明!
如果這在你開始「建模」之前看起來像繁重的工作,別擔心。理解數據是 CP2 戰鬥中 50% 的部分。一旦你了解了數據,寫公式就會變得容易得多!