歡迎來到決戰時刻:決策樹 vs. 線性模型!

你好!你已經學過線性回歸 (Linear Regression) 的運作方式,也了解過決策樹 (Decision Trees) 如何將數據分割成不同的分支。現在來了一個關鍵問題:我該為我的模型選擇哪一種呢?

在本章中,我們將對這兩位「重量級選手」進行一番對決。世上沒有「完美」的模型能永遠勝出,勝負完全取決於你手頭上的數據。讀完這些筆記後,你將能精準判斷該選擇哪種工具,從而在 SRM 考試中輕鬆斬獲額外分數!

1. 核心理念:直線 vs. 方格

為了弄清楚哪個模型更好,我們首先要看看它們是如何「看待」這個世界的。如果剛開始覺得有點抽象,別擔心,我們用一個簡單的視覺化概念來解釋。

線性模型

線性模型(如線性回歸)假設預測變數與結果之間存在一條直線(在高維空間中則是一個平坦的超平面)。它的公式看起來像這樣:
\( Y = \beta_0 + \beta_1X_1 + \beta_2X_2 + ... + \epsilon \)

決策樹

決策樹一點都不在乎直線。相反地,它將數據分割(split)成多個矩形區域。它會尋找「切分點」將相似的數據歸類在一起。它的公式看起來更像是連串的「如果……那麼……」判斷句:
\( f(X) = \sum_{m=1}^M c_m \cdot I(X \in R_m) \)

類比時間:想像你要把一個花園劃分成「花卉區」和「蔬菜區」。
- 線性模型就像是在院子裡拉出一條長長的直線柵欄。
- 決策樹則像是在院子裡搭建幾個小小的矩形木箱,把特定的植物分門別類地裝進去。

關鍵重點:

如果自然界的真實關係是線性的,線性模型通常會勝過決策樹;如果關係是複雜且非線性的,那麼決策樹通常會更勝一籌。

2. 兩者何時大顯身手?

讓我們拆解一下各自適合的特定場景,這可是考試中常見的概念題重點!

場景 A:線性關係

想像你的數據呈現平滑的對角線趨勢。線性模型可以用一條斜率完美捕捉這種規律。然而,決策樹在這裡會顯得很吃力,因為它只能進行水平或垂直的分割(軸對齊分割,axis-parallel splits),被迫使用「階梯狀」的圖案來模擬對角線,這種做法既沒效率又不夠精確。

場景 B:非線性關係

想像你的數據分佈在不同的「群集」中,或者存在複雜的交互作用(例如:某種藥物只對「年齡超過 50 歲」且「患有高血壓」的人有效)。除非你手動加入複雜的交互項,否則線性模型可能會忽略這些細節。而決策樹透過先按年齡分割、再按血壓分割,能自動找出這些交互作用 (interactions)

快速複習箱:
- 線性模型獲勝:若關係大致是加性且線性的。
- 決策樹獲勝:若預測變數之間存在高階且複雜的交互作用。

3. 優缺點:並列比較

在準備 SRM 考試時,有一份兩者權衡比較(Trade-offs)的「小抄」會非常有幫助。

決策樹

優點:
1. 可解釋性強:簡單的決策樹對非技術背景的人來說非常直觀(甚至比線性回歸係數更容易理解!)。
2. 符合人類邏輯:它們的運作方式反映了我們日常決策的思維過程。
3. 處理類別數據:能輕易處理定性預測變數,無需使用「虛擬變數 (dummy variables)」(儘管軟體實現略有不同)。
4. 視覺化:你可以直接把模型畫成流程圖。

缺點:
1. 高變異性 (High Variance):這點很重要!數據中一點點的小變動都可能導致最終生成的樹完全不同。
2. 預測準確度:單一決策樹的預測準確度通常不如線性模型或更進階的「集成方法 (ensemble methods)」(如隨機森林)。
3. 缺乏平滑性:由於它們使用階梯狀/方塊狀切割,無法很好地預測平滑、漸變的趨勢。

線性模型

優點:
1. 穩定性:它們的變異性通常比單一決策樹低。
2. 統計推論:更容易計算 p 值和信賴區間,以判斷變數是否具有「統計顯著性」。
3. 效率:如果世界本質是線性的,這是你手中最強大的工具。

缺點:
1. 僵化:它們假設世界是一條直線,這往往是一種過度簡化。
2. 勞力密集:如果你認為變數之間會互相影響,必須手動尋找並加入「交互項」(如 \( X_1 \times X_2 \))。

關鍵重點:

決策樹靈活但不穩定(高變異性)。線性模型僵化但穩定(低變異性,但若模型過於簡單則可能產生高偏差)。

4. 常見避雷指南

「等等,決策樹比較新,所以它不是總是比較好嗎?」
誤區:不要假設「越複雜」就代表「越好」。如果真實關係是線性的,決策樹會對數據中的雜訊進行過度擬合 (overfit),導致在未見過的新數據上表現不佳。

「決策樹可以預測訓練範圍之外的值嗎?」
誤區:千萬別以為決策樹可以進行外推 (extrapolation)。回歸樹預測的是葉節點中觀察值的平均值,它絕對無法預測出比訓練數據中出現過的最大值還要高的數值。

你知道嗎?
在現實工作中,數據科學家通常會同時建立這兩種模型,並比較它們的測試均方誤差 (Test MSE)。在測試集上誤差較低的那一個,通常就是他們最終投入使用的模型!

5. 考試總結檢查表

如果考試遇到這兩者的比較題,請記住以下「經驗法則」:

  • 可解釋性:決策樹通常勝出(若樹的規模較小)。
  • 處理非線性:決策樹勝出。
  • 處理線性數據:線性模型勝出。
  • 變異性:決策樹有較高的變異性(較不穩定)。
  • 預測能力:單一決策樹通常比線性模型,但決策樹的「集成方法」(如 Bagging 或 Boosting,將在後續章節提到)表現非常強大。

最後的鼓勵:
別被公式嚇到了!只要腦海中記住「直線 vs. 方格」的類比即可。只要你能想像每個模型是如何切割數據的,SOA 對這一章提出的任何概念題你都能迎刃而解。加油,你一定可以的!