歡迎來到分類樹的世界!

在之前的學習中,我們探討了回歸樹(Regression Trees),它們能幫助我們預測數值型資料,例如房屋價格或保險理賠金額。但如果我們想預測的是「類別」呢?例如:「這位駕駛會申請理賠嗎?」(是/否)或者「這顆腫瘤是惡性還是良性?」

這就是分類樹(Classification Trees)派上用場的時候了!你可以把分類樹想像成一系列的問題,幫助你將資料分類到正確的「桶子」裡。它們非常直觀,容易向非精算專業人士解釋,也是你在之後 Exam SRM 課程中會接觸到的更複雜模型之基礎。讓我們深入了解吧!

1. 什麼是分類樹?

分類樹是用於預測質化(定性/類別)反應變數,而不是量化變數。

在分類樹中,我們將每個觀測值預測為該區域內訓練觀測值中最常見的類別。這也被稱為多數決法則(plurality rule)眾數(mode)

現實生活中的類比:想像你在分類水果。你的第一個問題可能是「它是圓的嗎?」,接著是「它是紅色的嗎?」。透過這些問題的終點,你將水果分類為「蘋果」。你並沒有計算出一個數值,而是找出了一個類別。

快速回顧: - 回歸樹:預測平均值(例如:$5,000)。 - 分類樹:預測類別(例如:「高風險」)。

2. 建立樹狀模型:遞迴二元分割(Recursive Binary Splitting)

與回歸樹一樣,我們使用遞迴二元分割來建立分類樹。我們從頂端開始,根據一個預測變數將資料拆分為兩個分支,然後對每個分支重複此過程。

然而,我們遇到了一個問題:在回歸中,我們使用 RSS(殘差平方和) 來決定分割位置。但在這裡,你無法用「蘋果」減去「橘子」,所以 RSS 無法運作!因此,我們需要一種衡量節點純度(node purity)的方法。

為什麼「純度」很重要?

我們希望最終產生的組別(節點)越「純」越好。所謂純節點,是指幾乎所有觀測值都屬於同一類別。如果一個節點是「不純的」,代表它是不同類別的混雜體。

3. 衡量不純度:三個關鍵指標

為了決定在哪裡進行分割,我們會尋找能產生最低不純度的分割方式。在 SRM 課程中,有三種常用的衡量方法:

A. 分類錯誤率(Classification Error Rate)

這是最簡單的指標。它指的是在某個區域中,訓練觀測值不屬於最常見類別的比例。

\( E = 1 - \max_k(\hat{p}_{mk}) \)

其中 \( \hat{p}_{mk} \) 代表在第 m 個區域中,屬於第 k 個類別的訓練觀測值比例。

常見陷阱:雖然簡單,但分類錯誤率對於樹的生長來說不夠敏感。它比較適合作為後續「剪枝(pruning)」的指標,而非用於選擇最初的分割點。

B. 吉尼係數(Gini Index)

吉尼係數衡量的是跨類別的總變異量。其定義為:

\( G = \sum_{k=1}^K \hat{p}_{mk}(1 - \hat{p}_{mk}) \)

核心概念:如果節點中的所有觀測值都屬於同一類別(純),則吉尼係數將為。如果類別分配得很平均(不純),吉尼係數就會很高。我們想要最小化吉尼係數。

C. 熵(Entropy / Deviance)

的概念借鏡於資訊理論,用來衡量節點中的「混亂程度」。其定義為:

\( D = -\sum_{k=1}^K \hat{p}_{mk} \log \hat{p}_{mk} \)

與吉尼係數類似,如果節點是純的,熵將為。如果節點混亂且混合,熵就會很高。

記憶小撇步:想像一個充滿幼兒的房間。 - 純:每個人都在安靜地玩積木(低熵/低吉尼係數)。 - 不純:有的在尖叫,有的在睡覺,有的在丟積木(高熵/高吉尼係數)。

不純度衡量指標總結表

1. 分類錯誤率:適合最終評估,不適合用來進行分割。
2. 吉尼係數:非常適合分割;衡量的是「純度」。
3. 熵:非常適合分割;衡量的是「混亂程度」。

4. 比較吉尼係數與熵

不用太糾結於吉尼係數與熵在數學上的差異——它們其實非常相似!在實務操作中,它們通常會產生非常類似的樹。兩者對節點純度的敏感度都比簡單的分類錯誤率來得高。

你知道嗎?當電腦在建立樹時,會計算每一個可能分割點的吉尼係數或熵,並選擇那個能最大程度降低不純度的分割。這就是所謂的「貪婪(Greedy)」演算法!

5. 解釋與預測

樹建立好後,我們該如何使用它?

1. 拿取一個新的觀測值。
2. 沿著「是/否」的問題路徑向下走,直到到達一個葉節點(Leaf Node)(終端節點)。
3. 預測類別即為該葉節點中的最常見類別

範例:如果一個葉節點包含 80 名「安全」駕駛和 20 名「高風險」駕駛,任何落入該葉節點的新成員都會被預測為「安全」。

等等!那機率呢?
分類樹也可以預測屬於某個類別的機率。在上面的例子中,我們會說該人士有 80% 的機率屬於「安全」駕駛。

6. 分類樹的優缺點

在 SRM 考試中,了解何時使用樹以及它們何時會失效是非常重要的。

優點:
- 易於解釋:你可以向主管展示樹狀圖,他們能立即理解。
- 無需虛擬變數(Dummy Variables):樹能自然處理類別預測變數(如「顏色」),不需要將其轉換為 0 和 1。
- 模擬人類決策:我們經常以「如果...就...」的邏輯來思考。

缺點:
- 高變異性(High Variance):資料的小幅變動可能導致產生完全不同的樹。(這是它們最大的弱點!)
- 預測準確度較低:單一棵樹的準確度往往不如其他模型(如廣義線性模型 GLM)。注意:這就是為什麼我們後來會學習「隨機森林」和「提升法(Boosting)」來修正這個問題!

7. 考試重點總結

1. 預測法則:我們預測區域內訓練資料的眾數(最常見類別)
2. 分割準則:我們使用吉尼係數來生長樹,因為它們傾向於形成純節點。
3. 錯誤率:分類錯誤率通常用於剪枝/評估,而非用於最初的分割。
4. 可解釋性:樹具有高度的可解釋性,但通常面臨高變異性的挑戰。

如果熵的數學公式看起來很嚇人,別擔心!在考試中,你比較可能會被問到有關純度的「概念」,或是進行簡單的吉尼係數計算,而不是推導複雜的對數運算。請專注於理解為什麼我們想要純節點!