欢迎来到分类树的世界!

在之前的学习中,我们探讨了回归树(Regression Trees),它们能帮助我们预测数值型数据,例如房屋价格或保险理赔金额。但如果我们想预测的是“类别”呢?例如:“这位驾驶会申请理赔吗?”(是/否)或者“这颗肿瘤是恶性还是良性?”

这就是分类树(Classification Trees)派上用场的时候了!你可以把分类树想象成一系列的问题,帮助你将数据分类到正确的“桶子”里。它们非常直观,容易向非精算专业人士解释,也是你在之后 Exam SRM 课程中会接触到的更复杂模型之基础。让我们深入了解吧!

1. 什么是分类树?

分类树是用于预测质化(定性/类别)反应变量,而不是量化变量。

在分类树中,我们将每个观测值预测为该区域内训练观测值中最常见的类别。这也被称为多数决法则(plurality rule)众数(mode)

现实生活中的类比:想象你在分类水果。你的第一个问题可能是“它是圆的吗?”,接着是“它是红色的吗?”。透过这些问题的终点,你将水果分类为“苹果”。你并没有计算出一个数值,而是找出了一个类别。

快速回顾: - 回归树:预测平均值(例如:$5,000)。 - 分类树:预测类别(例如:“高风险”)。

2. 建立树状模型:递归二元分割(Recursive Binary Splitting)

与回归树一样,我们使用递归二元分割来建立分类树。我们从顶端开始,根据一个预测变量将数据拆分为两个分支,然后对每个分支重复此过程。

然而,我们遇到了一个问题:在回归中,我们使用 RSS(残差平方和) 来决定分割位置。但在这里,你无法用“苹果”减去“橘子”,所以 RSS 无法运作!因此,我们需要一种衡量节点纯度(node purity)的方法。

为什么“纯度”很重要?

我们希望最终产生的组别(节点)越“纯”越好。所谓纯节点,是指几乎所有观测值都属于同一类别。如果一个节点是“不纯的”,代表它是不同类别的混杂体。

3. 衡量不纯度:三个关键指标

为了决定在哪里进行分割,我们会寻找能产生最低不纯度的分割方式。在 SRM 课程中,有三种常用的衡量方法:

A. 分类错误率(Classification Error Rate)

这是最简单的指标。它指的是在某个区域中,训练观测值不属于最常见类别的比例。

\( E = 1 - \max_k(\hat{p}_{mk}) \)

其中 \( \hat{p}_{mk} \) 代表在第 m 个区域中,属于第 k 个类别的训练观测值比例。

常见陷阱:虽然简单,但分类错误率对于树的生长来说不够敏感。它比较适合作为后续“剪枝(pruning)”的指标,而非用于选择最初的分割点。

B. 吉尼系数(Gini Index)

吉尼系数衡量的是跨类别的总变异量。其定义为:

\( G = \sum_{k=1}^K \hat{p}_{mk}(1 - \hat{p}_{mk}) \)

核心概念:如果节点中的所有观测值都属于同一类别(纯),则吉尼系数将为。如果类别分配得很平均(不纯),吉尼系数就会很高。我们想要最小化吉尼系数。

C. 熵(Entropy / Deviance)

的概念借镜于信息理论,用来衡量节点中的“混乱程度”。其定义为:

\( D = -\sum_{k=1}^K \hat{p}_{mk} \log \hat{p}_{mk} \)

与吉尼系数类似,如果节点是纯的,熵将为。如果节点混乱且混合,熵就会很高。

记忆小撇步:想象一个充满幼儿的房间。 - 纯:每个人都在安静地玩积木(低熵/低吉尼系数)。 - 不纯:有的在尖叫,有的在睡觉,有的在丢积木(高熵/高吉尼系数)。

不纯度衡量指标总结表

1. 分类错误率:适合最终评估,不适合用来进行分割。
2. 吉尼系数:非常适合分割;衡量的是“纯度”。
3. 熵:非常适合分割;衡量的是“混乱程度”。

4. 比较吉尼系数与熵

不用太纠结于吉尼系数与熵在数学上的差异——它们其实非常相似!在实务操作中,它们通常会产生非常类似的树。两者对节点纯度的敏感度都比简单的分类错误率来得高。

你知道吗?当计算机在建立树时,会计算每一个可能分割点的吉尼系数或熵,并选择那个能最大程度降低不纯度的分割。这就是所谓的“贪婪(Greedy)”算法!

5. 解释与预测

树建立好后,我们该如何使用它?

1. 拿取一个新的观测值。
2. 沿着“是/否”的问题路径向下走,直到到达一个叶节点(Leaf Node)(终端节点)。
3. 预测类别即为该叶节点中的最常见类别

范例:如果一个叶节点包含 80 名“安全”驾驶和 20 名“高风险”驾驶,任何落入该叶节点的新成员都会被预测为“安全”。

等等!那概率呢?
分类树也可以预测属于某个类别的概率。在上面的例子中,我们会说该人士有 80% 的概率属于“安全”驾驶。

6. 分类树的优缺点

在 SRM 考试中,了解何时使用树以及它们何时会失效是非常重要的。

优点:
- 易于解释:你可以向主管展示树状图,他们能立即理解。
- 无需虚拟变量(Dummy Variables):树能自然处理类别预测变量(如“颜色”),不需要将其转换为 0 和 1。
- 模拟人类决策:我们经常以“如果...就...”的逻辑来思考。

缺点:
- 高变异性(High Variance):数据的小幅变动可能导致产生完全不同的树。(这是它们最大的弱点!)
- 预测准确度较低:单一棵树的准确度往往不如其他模型(如广义线性模型 GLM)。注意:这就是为什么我们后来会学习“随机森林”和“提升法(Boosting)”来修正这个问题!

7. 考试重点总结

1. 预测法则:我们预测区域内训练数据的众数(最常见类别)
2. 分割准则:我们使用吉尼系数来生长树,因为它们倾向于形成纯节点。
3. 错误率:分类错误率通常用于剪枝/评估,而非用于最初的分割。
4. 可解释性:树具有高度的可解释性,但通常面临高变异性的挑战。

如果熵的数学公式看起来很吓人,别担心!在考试中,你比较可能会被问到有关纯度的“概念”,或是进行简单的吉尼系数计算,而不是推导复杂的对数运算。请专注于理解为什么我们想要纯节点!