歡迎來到選擇「K」的藝術!

無監督學習 (Unsupervised Learning) 的世界裡,分群就像在整理混亂的衣櫃。我們希望能將相似的物品歸類在一起,但問題在於:沒有人告訴我們要用幾個儲物箱!應該要 3 個嗎?還是 5 個或 10 個?

決定分群數量 (Number of Clusters) 是統計學中最常見的挑戰之一。與有「標籤」(例如正確答案鍵)來告訴我們做得對不對的監督學習不同,無監督學習更具主觀性。在本指南中,我們將探討 SRM 考試中用來尋找那個「金髮姑娘」(Goldilocks) 般完美分群數的方法——不多不少,恰到好處。

1. 核心問題:偏差-變異權衡 (Bias-Variance Tradeoff)

在深入探討數學之前,我們先想想背後的邏輯。如果我們有 \( n \) 個數據點,並將分群數量 (\( K \)) 設為 \( n \),那麼每個人都會擁有自己的一個群組。群組內的「誤差」將會是零,因為每個人跟自己都是完美的相似!

然而,單人一組並不是真正的「分群」——那只是一份清單而已。反過來說,如果 \( K = 1 \),整個數據集就是一團巨大的雜訊,這無法告訴我們關於人與人之間差異的任何資訊。我們的目標是在簡潔(較少的分群)與細節(較低的組內變異)之間找到平衡。

2. 肘部法則 (The Elbow Method)(總組內變異)

在 K-means 分群中,選擇 \( K \) 最流行的方法之一是觀察總組內平方和 (Total Within-Cluster Sum of Squares, WSS)。這用來衡量我們的分群有多緊密。

單個群組 \( C_k \) 的組內變異公式為:
\[ W(C_k) = \sum_{i \in C_k} \sum_{j=1}^{p} (x_{ij} - \bar{x}_{kj})^2 \]
我們將所有 \( K \) 個群組的這些數值相加,即可得到總 WSS

如何找到「肘部」:

1. 對一系列 \( K \) 值(例如 \( K = 1 \) 到 \( 10 \))運行 K-means。
2. 對於每個 \( K \),計算總 WSS。
3. 將 \( K \) 繪製在 x 軸上,總 WSS 繪製在 y 軸上。

隨著 \( K \) 增加,WSS 總是會下降。但在某個點,下降的速度會顯著減緩。這個點在圖表上看起來就像一個「肘部」(Elbow)。那個「肘部」通常就是我們選擇 \( K \) 的最佳位置。

比喻:想像你在為旅行購買行李箱。一個巨大的行李箱很難搬運 (K=1)。50 個小包包則根本無法管理 (K=n)。你會注意到,增加第二或第三個行李箱會讓整理變得容易許多,但當你增加到 15 個行李箱時,第 16 個行李箱對於整理並無實質幫助。「肘部」就是那個再增加數量也不再有幫助的轉折點。

快速複習:
- 低 WSS:數據點非常接近其群組中心(好!)。
- 高 K:總是會導致較低的 WSS,但會有過度擬合 (Overfitting) 的風險(壞!)。
- 肘部:邊際效益遞減的轉折點。

3. 在階層式分群中做決定

階層式分群 (Hierarchical Clustering) 中,我們不需要在開始前就選定 \( K \)。取而代之的是,我們建立一個樹狀圖 (Dendrogram)(一種像樹一樣的圖表)。要決定這裡的分群數量,我們想像在樹狀圖上畫一條水平線。

「最長垂直距離」規則:

觀察樹狀圖時,垂直高度代表兩個群組之間的差異程度。要找到合適的分群數量:
1. 尋找那些未被任何水平「分支」截斷的最長垂直線。
2. 沿著這些長線水平地切開樹狀圖。
3. 你的水平切割線穿過的垂直線數量,就是你的分群數量 (\( K \))。

要避免的常見錯誤:不要只看樹的底部!底部顯示的是單個數據點。要尋找那些群組在很長一段垂直距離內都保持分離的「間隙」。

4. 間隙統計量 (The Gap Statistic)

肘部法則很好,但它有點「視覺化」且主觀。間隙統計量 (Gap Statistic) 提供了一種更具數學性的方法。

間隙統計量將我們實際數據的總 WSS 與「虛無」(null) 數據集的期望 WSS 進行比較(通常指數據點只是隨機且均勻分佈、沒有真正群組的數據集)。

運作原理:

1. 計算數據在不同 \( K \) 值下的 WSS。
2. 生成一個「虛構」的隨機數據集,並計算其在相同 \( K \) 值下的 WSS。
3. 間隙 (Gap) 是虛構數據的 log(WSS) 與真實數據的 log(WSS) 之間的差值。
4. 最佳的 \( K \) 是使這個間隙最大化的那個值。這告訴我們,我們的分群效果遠優於單純的機率隨機結果。

記憶口訣:「注意間隙」(Mind the Gap)
將「間隙」視為相較於隨機性所帶來的改進。我們想要儘可能達到最大的改進!

5. 實務考量(商業現實)

如果數學看起來有點抽象也不用擔心;有時候最佳的 \( K \) 是由實務需求而非公式決定的。對於 SRM 考試,請記住無監督學習通常是進一步分析的起點。

實務限制的例子:
- 行銷:如果一家公司只有預算製作 4 種不同類型的廣告,他們會選擇 \( K=4 \),即使「肘部」顯示 \( K=6 \)。
- 可解釋性:向經理說明 3 種鮮明的客戶畫像,比說明 15 種只有些微差異的畫像要容易得多。

重點總結:

1. 肘部法則:尋找增加分群數量已無法顯著降低組內變異的那個點。
2. 樹狀圖切割:在階層式分群中,在穿過最長垂直線的高度處切割樹狀圖。
3. 間隙統計量:選擇那個在數據與隨機雜訊之間展現最大差異的 \( K \)。
4. 背景資訊至關重要:使用對你所解決的特定問題最有意義的分群數量。

你知道嗎?分群數量並沒有單一的「正確」答案。這就是為什麼它被稱為無監督——沒有老師來告訴演算法它做得對!我們能做的最好的事,就是利用這些工具找到一個既符合統計原則,又能對我們的目標有所幫助的解決方案。