歡迎來到分類樹的世界!
在之前的學習中,我們探討了回歸樹(Regression Trees),它們能幫助我們預測數值型資料,例如房屋價格或保險理賠金額。但如果我們想預測的是「類別」呢?例如:「這位駕駛會申請理賠嗎?」(是/否)或者「這顆腫瘤是惡性還是良性?」
這就是分類樹(Classification Trees)派上用場的時候了!你可以把分類樹想像成一系列的問題,幫助你將資料分類到正確的「桶子」裡。它們非常直觀,容易向非精算專業人士解釋,也是你在之後 Exam SRM 課程中會接觸到的更複雜模型之基礎。讓我們深入了解吧!
1. 什麼是分類樹?
分類樹是用於預測質化(定性/類別)反應變數,而不是量化變數。
在分類樹中,我們將每個觀測值預測為該區域內訓練觀測值中最常見的類別。這也被稱為多數決法則(plurality rule)或眾數(mode)。
現實生活中的類比:想像你在分類水果。你的第一個問題可能是「它是圓的嗎?」,接著是「它是紅色的嗎?」。透過這些問題的終點,你將水果分類為「蘋果」。你並沒有計算出一個數值,而是找出了一個類別。
快速回顧: - 回歸樹:預測平均值(例如:$5,000)。 - 分類樹:預測類別(例如:「高風險」)。
2. 建立樹狀模型:遞迴二元分割(Recursive Binary Splitting)
與回歸樹一樣,我們使用遞迴二元分割來建立分類樹。我們從頂端開始,根據一個預測變數將資料拆分為兩個分支,然後對每個分支重複此過程。
然而,我們遇到了一個問題:在回歸中,我們使用 RSS(殘差平方和) 來決定分割位置。但在這裡,你無法用「蘋果」減去「橘子」,所以 RSS 無法運作!因此,我們需要一種衡量節點純度(node purity)的方法。
為什麼「純度」很重要?
我們希望最終產生的組別(節點)越「純」越好。所謂純節點,是指幾乎所有觀測值都屬於同一類別。如果一個節點是「不純的」,代表它是不同類別的混雜體。
3. 衡量不純度:三個關鍵指標
為了決定在哪裡進行分割,我們會尋找能產生最低不純度的分割方式。在 SRM 課程中,有三種常用的衡量方法:
A. 分類錯誤率(Classification Error Rate)
這是最簡單的指標。它指的是在某個區域中,訓練觀測值不屬於最常見類別的比例。
\( E = 1 - \max_k(\hat{p}_{mk}) \)
其中 \( \hat{p}_{mk} \) 代表在第 m 個區域中,屬於第 k 個類別的訓練觀測值比例。
常見陷阱:雖然簡單,但分類錯誤率對於樹的生長來說不夠敏感。它比較適合作為後續「剪枝(pruning)」的指標,而非用於選擇最初的分割點。
B. 吉尼係數(Gini Index)
吉尼係數衡量的是跨類別的總變異量。其定義為:
\( G = \sum_{k=1}^K \hat{p}_{mk}(1 - \hat{p}_{mk}) \)
核心概念:如果節點中的所有觀測值都屬於同一類別(純),則吉尼係數將為零。如果類別分配得很平均(不純),吉尼係數就會很高。我們想要最小化吉尼係數。
C. 熵(Entropy / Deviance)
熵的概念借鏡於資訊理論,用來衡量節點中的「混亂程度」。其定義為:
\( D = -\sum_{k=1}^K \hat{p}_{mk} \log \hat{p}_{mk} \)
與吉尼係數類似,如果節點是純的,熵將為零。如果節點混亂且混合,熵就會很高。
記憶小撇步:想像一個充滿幼兒的房間。 - 純:每個人都在安靜地玩積木(低熵/低吉尼係數)。 - 不純:有的在尖叫,有的在睡覺,有的在丟積木(高熵/高吉尼係數)。
不純度衡量指標總結表
1. 分類錯誤率:適合最終評估,不適合用來進行分割。
2. 吉尼係數:非常適合分割;衡量的是「純度」。
3. 熵:非常適合分割;衡量的是「混亂程度」。
4. 比較吉尼係數與熵
不用太糾結於吉尼係數與熵在數學上的差異——它們其實非常相似!在實務操作中,它們通常會產生非常類似的樹。兩者對節點純度的敏感度都比簡單的分類錯誤率來得高。
你知道嗎?當電腦在建立樹時,會計算每一個可能分割點的吉尼係數或熵,並選擇那個能最大程度降低不純度的分割。這就是所謂的「貪婪(Greedy)」演算法!
5. 解釋與預測
樹建立好後,我們該如何使用它?
1. 拿取一個新的觀測值。
2. 沿著「是/否」的問題路徑向下走,直到到達一個葉節點(Leaf Node)(終端節點)。
3. 預測類別即為該葉節點中的最常見類別。
範例:如果一個葉節點包含 80 名「安全」駕駛和 20 名「高風險」駕駛,任何落入該葉節點的新成員都會被預測為「安全」。
等等!那機率呢?
分類樹也可以預測屬於某個類別的機率。在上面的例子中,我們會說該人士有 80% 的機率屬於「安全」駕駛。
6. 分類樹的優缺點
在 SRM 考試中,了解何時使用樹以及它們何時會失效是非常重要的。
優點:
- 易於解釋:你可以向主管展示樹狀圖,他們能立即理解。
- 無需虛擬變數(Dummy Variables):樹能自然處理類別預測變數(如「顏色」),不需要將其轉換為 0 和 1。
- 模擬人類決策:我們經常以「如果...就...」的邏輯來思考。
缺點:
- 高變異性(High Variance):資料的小幅變動可能導致產生完全不同的樹。(這是它們最大的弱點!)
- 預測準確度較低:單一棵樹的準確度往往不如其他模型(如廣義線性模型 GLM)。注意:這就是為什麼我們後來會學習「隨機森林」和「提升法(Boosting)」來修正這個問題!
7. 考試重點總結
1. 預測法則:我們預測區域內訓練資料的眾數(最常見類別)。
2. 分割準則:我們使用吉尼係數或熵來生長樹,因為它們傾向於形成純節點。
3. 錯誤率:分類錯誤率通常用於剪枝/評估,而非用於最初的分割。
4. 可解釋性:樹具有高度的可解釋性,但通常面臨高變異性的挑戰。
如果熵的數學公式看起來很嚇人,別擔心!在考試中,你比較可能會被問到有關純度的「概念」,或是進行簡單的吉尼係數計算,而不是推導複雜的對數運算。請專注於理解為什麼我們想要純節點!