欢迎来到选择“K”的艺术!
在无监督学习 (Unsupervised Learning) 的世界里,分群就像在整理混乱的衣柜。我们希望能将相似的物品归类在一起,但问题在于:没有人告诉我们要用几个储物箱!应该要 3 个吗?还是 5 个或 10 个?
决定分群数量 (Number of Clusters) 是统计学中最常见的挑战之一。与有“标签”(例如正确答案键)来告诉我们做得对不对的监督学习不同,无监督学习更具主观性。在本指南中,我们将探讨 SRM 考试中用来寻找那个“金发姑娘”(Goldilocks) 般完美分群数的方法——不多不少,恰到好处。
1. 核心问题:偏差-方差权衡 (Bias-Variance Tradeoff)
在深入探讨数学之前,我们先想想背后的逻辑。如果我们有 \( n \) 个数据点,并将分群数量 (\( K \)) 设为 \( n \),那么每个人都会拥有自己的一组。组内的“误差”将会是零,因为每个人跟自己都是完美的相似!
然而,单人一组并不是真正的“分群”——那只是一份清单而已。反过来说,如果 \( K = 1 \),整个数据集就是一团巨大的噪声,这无法告诉我们关于人与人之间差异的任何信息。我们的目标是在简洁(较少的分群)与细节(较低的组内方差)之间找到平衡。
2. 肘部法则 (The Elbow Method)(总组内方差)
在 K-means 分群中,选择 \( K \) 最流行的方法之一是观察总组内平方和 (Total Within-Cluster Sum of Squares, WSS)。这用来衡量我们的分群有多紧密。
单个群组 \( C_k \) 的组内方差公式为:
\[ W(C_k) = \sum_{i \in C_k} \sum_{j=1}^{p} (x_{ij} - \bar{x}_{kj})^2 \]
我们将所有 \( K \) 个群组的这些数值相加,即可得到总 WSS。
如何找到“肘部”:
1. 对一系列 \( K \) 值(例如 \( K = 1 \) 到 \( 10 \))运行 K-means。
2. 对于每个 \( K \),计算总 WSS。
3. 将 \( K \) 绘制在 x 轴上,总 WSS 绘制在 y 轴上。
随着 \( K \) 增加,WSS 总是会下降。但在某个点,下降的速度会显著减缓。这个点在图表上看起来就像一个“肘部”(Elbow)。那个“肘部”通常就是我们选择 \( K \) 的最佳位置。
快速复习:
- 低 WSS:数据点非常接近其群组中心(好!)。
- 高 K:总是会导致较低的 WSS,但会有过度拟合 (Overfitting) 的风险(坏!)。
- 肘部:边际效益递减的转折点。
3. 在层级式分群中做决定
在层级式分群 (Hierarchical Clustering) 中,我们不需要在开始前就选定 \( K \)。取而代之的是,我们建立一个树状图 (Dendrogram)(一种像树一样的图表)。要决定这里的分群数量,我们想象在树状图上画一条水平线。
“最长垂直距离”规则:
观察树状图时,垂直高度代表两个群组之间的差异程度。要找到合适的分群数量:
1. 寻找那些未被任何水平“分支”截断的最长垂直线。
2. 沿着这些长线水平地切开树状图。
3. 你的水平切割线穿过的垂直线数量,就是你的分群数量 (\( K \))。
要避免的常见错误:不要只看树的底部!底部显示的是单个数据点。要寻找那些群组在很长一段垂直距离内都保持分离的“间隙”。
4. 间隙统计量 (The Gap Statistic)
肘部法则很好,但它有点“可视化”且主观。间隙统计量 (Gap Statistic) 提供了一种更具数学性的方法。
间隙统计量将我们实际数据的总 WSS 与“虚无”(null) 数据集的期望 WSS 进行比较(通常指数据点只是随机且均匀分布、没有真正群组的数据集)。
运作原理:
1. 计算数据在不同 \( K \) 值下的 WSS。
2. 生成一个“虚构”的随机数据集,并计算其在相同 \( K \) 值下的 WSS。
3. 间隙 (Gap) 是虚构数据的 log(WSS) 与真实数据的 log(WSS) 之间的差值。
4. 最佳的 \( K \) 是使这个间隙最大化的那个值。这告诉我们,我们的分群效果远优于单纯的概率随机结果。
记忆口诀:“注意间隙”(Mind the Gap)
将“间隙”视为相较于随机性所带来的改进。我们想要尽可能达到最大的改进!
5. 实务考量(商业现实)
如果数学看起来有点抽象也不用担心;有时候最佳的 \( K \) 是由实务需求而非公式决定的。对于 SRM 考试,请记住无监督学习通常是进一步分析的起点。
实务限制的例子:
- 行销:如果一家公司只有预算制作 4 种不同类型的广告,他们会选择 \( K=4 \),即使“肘部”显示 \( K=6 \)。
- 可解释性:向经理说明 3 种鲜明的客户画像,比说明 15 种只有些微差异的画像要容易得多。
重点总结:
1. 肘部法则:寻找增加分群数量已无法显著降低组内方差的那个点。
2. 树状图切割:在层级式分群中,在穿过最长垂直线的高度处切割树状图。
3. 间隙统计量:选择那个在数据与随机噪声之间展现最大差异的 \( K \)。
4. 背景信息至关重要:使用对你所解决的特定问题最有意义的分群数量。
你知道吗?分群数量并没有单一的“正确”答案。这就是为什么它被称为无监督——没有老师来告诉算法它做得对!我们能做的最好的事,就是利用这些工具找到一个既符合统计原则,又能对我们的目标有所帮助的解决方案。