歡迎來到資料探索與視覺化!
你好!如果你正在準備 Exam PA,你大概已經意識到資料不僅僅是試算表上的數字——它更是在講述一個故事。在本章中,我們將專注於繪圖的核心原則 (Key Principles of Constructing Graphs)。你可以把這些原則想像成視覺傳達的「語法」。無論你是為了尋找規律而進行資料探索,還是向客戶呈現最終發現,這些原則都能確保你的訊息清晰、準確且專業。別擔心如果你自認沒有「藝術天分」——高效的視覺化其實更像是一門科學,而非藝術!
1. 目的:探索 vs. 溝通
在你在 R 語言中點擊任何按鈕之前,你需要先問自己:這張圖是給誰看的?
探索性資料分析 (EDA):這是為你(精算師)準備的。這些圖表能幫助你了解資料的分佈、找出離群值 (outliers) 並發現變數之間的關係。它們不需要完美,只要能提供資訊即可。
解釋性視覺化 (Explanatory Visualization):這是為他們(你的老闆或客戶)準備的。這些圖表必須精緻、標籤清晰,並且明確點出你想讓受眾看到的那個「啊哈!」時刻。
2. 黃金法則:資料墨水比 (Data-to-Ink Ratio)
由 Edward Tufte 提出的資料墨水比是預測分析中的一個基本概念。想法很簡單:儘可能使用最多的「墨水」來展示實際資料,而對非資料元素則使用儘可能少的「墨水」。
高資料墨水比(好):線條簡潔、點位清晰、設計極簡。螢幕上的每一個元素都有其用途。
低資料墨水比(差):雜亂的格線、3D 特效、陰影以及分散注意力的背景圖像。這通常被稱為「圖表垃圾 (chartjunk)」。
小撇步:橡皮擦測試
看著你的圖表並問自己:「如果我擦掉這個元素,這張圖會失去意義嗎?」如果答案是「不會」,那就把它刪掉!務必避免使用 3D 長條圖——它們讓讀取實際數值變得困難,且對分析毫無幫助。
3. 克里夫蘭圖形感知階層 (Cleveland’s Hierarchy of Graphical Perception)
並非所有的視覺線索都是平等的。William Cleveland 對人類感知不同視覺資訊類型的準確度進行了排序。當你希望受眾準確比較數值時,請優先使用該列表頂端的視覺特徵:
- 在共同基準線上的位置 (Position along a common scale):(最佳)試想散佈圖 (Scatterplot)。這是我們大腦最容易判斷的。
- 長度 (Length):試想長條圖 (Bar Chart)。我們非常擅長辨別哪條線比較長。
- 角度/斜率 (Angle/Slope):試想圓餅圖 (Pie Chart)。(警告:人類在比較角度方面表現意外地差!)
- 面積 (Area):試想泡泡圖 (Bubble Chart)。相比於比較兩條線,要分辨一個圓形是否剛好是另一個圓形的兩倍大要困難得多。
- 體積/顏色飽和度 (Volume/Color Saturation):(最差)這些僅適合用於營造「氛圍」或展現高層次模式,不適合精確比較。
記憶口訣:「People Love Apples and Oranges」(P-L-A-O)
Position(位置)> Length(長度)> Angle(角度)> Others(其他:面積/顏色)。在展示最重要的變數時,請堅持使用列表頂端的這些選項!
4. 為任務選擇正確的圖表
在 Exam PA 中,你經常會被要求證明為什麼選擇某種特定的圖表。以下是一個快速指南:
單變數分析 (Univariate Analysis - 觀察單一變數)
直方圖 (Histograms):非常適合查看連續數值變數的分佈(形狀)。它有助於識別偏態 (skewness) 或雙峰模式。
盒鬚圖 (Boxplots):識別離群值 (outliers) 的絕佳工具,一眼就能看出五數摘要(最小值、第一四分位數 Q1、中位數、第三四分位數 Q3、最大值)。
雙變數分析 (Bivariate Analysis - 觀察兩個變數之間的關係)
散佈圖 (Scatterplots):當你有兩個數值變數時使用。它們能揭示相關性與非線性模式。
並排盒鬚圖 (Side-by-Side Boxplots):當你有一個數值變數和一個類別變數時使用。例如,比較不同「地區」(類別)之間的「賠款金額」(數值)。
長條圖 (Bar Charts):最適合類別變數。用它們來顯示各類別的計數或平均值。
5. 縮放與標籤的重要性
一張沒有標籤的圖表只是一堆點點。為了在考試中取得好分數,你的圖表必須看起來專業。
- 務必標註軸標籤:使用具描述性的名稱,例如「年度收入 (美元)」,而不是 R 語言中原始變數名稱如 "ann_inc_v2"。
- 加入標題:告訴讀者他們正在看什麼(例如:「年齡與索賠頻率之間的關係」)。
- 注意縮放比例:在長條圖中,讓 y 軸的起點非零有時會產生誤導。確保比例對資料來說是適當的——不要為了「放大」而放大,導致微小的差異看起來像巨大的危機。
6. 應避免的常見錯誤
即使是經驗豐富的精算師也會犯這些錯誤。請留意這些「危險訊號」:
1. 過度繪圖 (Overplotting):當散佈圖中有 10,000 個資料點時,它看起來就像一團巨大的斑點。 解決方案:使用透明度(設定「alpha」值)或使用「六邊形分箱圖 (hexbin plot)」。
2. 類別過多:一個擁有 50 種不同顏色對應 50 個州的長條圖是不可能閱讀的。 解決方案:將較小的類別合併為「其他」類別,或使用排序後的水平長條圖。
3. 無故使用顏色:如果所有的長條都代表同一件事,它們就不需要不同的顏色。只有在顏色代表額外的變數時才使用它。
快速複習盒
- 高資料墨水比:保持簡潔。
- 位置 > 長度:優先使用散佈圖和長條圖。
- 語境至上:標籤和標題是強制要求的,而非選填。
- 拒絕 3D:永遠不要將 3D 特效用於 2D 資料。
總結:關鍵要點
資料視覺化是預測分析的第一步,因為它能幫助你「訪談」你的資料。遵循資料墨水比和克里夫蘭感知階層,你可以確保你的圖表不僅美觀,而且在數學上是嚴謹且易於解釋的。在 Exam PA 中,請務必解釋你為什麼選擇特定的圖表,以及它告訴了你哪些關於業務問題的資訊。祝繪圖順利!