歡迎來到雙變量數據探索!

在上一個章節中,我們介紹了單變量 (Univariate) 分析——也就是一次只研究一個變量。現在,讓我們進階一下!雙變量數據探索 (Bivariate Data Exploration) 的核心在於同時觀察兩個變量,看看它們之間如何互相影響。

為什麼這是 Exam PA 的「心臟」呢?因為預測建模的本質,其實就是試圖理解你的預測變量 (Predictors / Features)目標變量 (Target)(即你想預測的目標)之間的關係。如果你能掌握如何透過視覺和數字來找出這些關係,你就已經成功了一半!別擔心自己不是數學天才——我們將會把它拆解成簡單且直觀的步驟。

1. 數值型 vs. 數值型:黃金拍檔

當你有兩個連續變量(例如年齡收入)時,你會想看看它們是否同步變動。它們是步調一致的好友,還是互不相干的陌生人?

散點圖 (Scatterplot)

散點圖是你在這裡最好的幫手。它將一個變量放在 x 軸,另一個放在 y 軸。
- 正相關 (Positive Relationship): 點呈現「向右上方」趨勢。隨著 \(X\) 增加,\(Y\) 也會增加。
- 負相關 (Negative Relationship): 點呈現「向右下方」趨勢。隨著 \(X\) 增加,\(Y\) 會減少。
- 無相關 (No Relationship): 點看起來像是一群隨意飛舞的蜜蜂。

相關係數 (\(r\))

這是一個用來總結線性關係強度的單一數字。
- 範圍介於 -1 到 +1 之間。
- +1 代表完美的正線性關係。
- -1 代表完美的負線性關係。
- 0 代表完全沒有線性關係。

重點複習:
相關係數只能衡量線性(直線)關係。如果你的數據呈現完美的「U」型,相關係數可能是 0,但這並不代表它們沒有關係!一定要觀察圖表,不要只盲目相信數字。

你知道嗎? 在 Exam PA 的背景下,如果兩個預測變量之間的相關性極高(例如 \(r > 0.8\)),這被稱為多重共線性 (Multicollinearity)。這可能會使你的模型變得不穩定,你可能需要考慮剔除其中一個!

關鍵總結:

使用散點圖來視覺化趨勢,並使用相關係數來量化兩個數值變量之間的線性關係強度。

2. 數值型 vs. 類別型:分組比較

通常,你會想知道某個數值(例如索賠金額)是否會根據某個類別(例如性別地區)而有所不同。

並排盒鬚圖 (Side-by-Side Boxplot)

這是 Exam PA 的「黃金標準」。將類別放在 x 軸,將數值放在 y 軸。
- 觀察重點: 「盒子」的高度是否相同?如果「A 組」的盒子比「B 組」高得多,那麼該類別很可能是一個強有力的預測指標!

密度圖 (Density Plots, Overlaid)

想像在同一張圖上畫出兩個平滑的山丘(曲線)。如果兩個山丘完全重疊,說明類別差異不大。如果一個山丘遠遠地移向右邊,你就找到了顯著的關係。

類比:籃球員 vs. 體操選手
如果我們將按運動項目(類別)分組的人員身高(數值)繪製出來,籃球員的盒鬚圖在圖表上的位置會比體操選手高得多。這告訴我們,運動項目是預測身高的一個絕佳指標。

常見錯誤: 只關注「中間值」(平均數/中位數)。也要觀察離散程度 (Spread)(盒子的寬度)。如果其中一組的分散程度比另一組大得多,這對於風險管理來說是一個重要的洞察!

關鍵總結:

要觀察類別如何影響數值,請使用並排盒鬚圖。重點觀察中位數線以及盒子的整體垂直位置差異。

3. 類別型 vs. 類別型:發現規律

如果兩個變量都是類別呢?例如,吸菸狀況(是/否)與保單類型(基本/高級)是否有關聯?

列聯表 (Contingency Tables / Crosstabs)

這是一個顯示計數的簡單網格。
- 進階技巧: 不要只看原始計數,要看比例。如果 80% 的吸菸者選擇「基本」,但只有 20% 的非吸菸者選擇「基本」,你就發現了關聯!

堆疊或分組長條圖 (Stacked or Grouped Bar Charts)

- 堆疊長條圖: 每一根長條代表一個類別,並由第二個類別進行「填色」。如果顏色在不同長條間的分佈不同,就代表存在交互作用。
- 填滿(比例)長條圖: 每根長條的高度相同(100%)。這通常更適合觀察類別的比例是否發生變化。

記憶小撇步:「100% 原則」
當比較不同規模的類別時(例如 1,000 名男性 vs. 10 名女性),請務必使用比例(百分比)而非原始計數,否則較小的群體在圖表中會被「隱沒」。

關鍵總結:

使用比例堆疊長條圖來觀察一個類別變量的分佈是否會隨另一個變量而改變。

4. 為什麼這對考試很重要?

在 Exam PA 中,你繪製圖表不是為了好玩。你正在進行特徵選擇 (Feature Selection)
1. 預測變量 vs. 目標變量: 如果在這裡發現關係,保留該預測變量!它很有用。
2. 預測變量 vs. 預測變量: 如果在這裡發現非常強的關係,你可能存在冗餘 (Redundancy)。同時使用兩者可能會降低模型的可解釋性。

如果一開始覺得很複雜,別擔心! 你在 R 中練習繪製這些圖表的次數越多,你就會越快學會「閱讀」數據所講述的故事。撰寫報告時,就像我們描述籃球員的例子一樣,用簡單明瞭的語言描述你看到的現象即可!

雙變量分析工具總結:

1. 數值型 + 數值型: 散點圖,相關係數 \(r\)。
2. 數值型 + 類別型: 並排盒鬚圖,重疊密度圖。
3. 類別型 + 類別型: 列聯表,堆疊長條圖。

重點複習:
雙變量 (Bivariate) = 兩個變量。
目標: 找出關係、檢測多重共線性,並為你的模型識別出最重要的預測指標。