欢迎来到统计学习的基础!

各位未来的精算师,欢迎你们!当你深入了解 Exam SRM 时,你会发现统计学习 (Statistical Learning) 是现代数据分析的核心。你可以把这一章当作准备考试的“GPS”。在我们构建复杂模型来预测保险索赔或股票价格之前,我们必须明确了解我们到底要解决什么样的问题。

在本节中,我们将学习如何将所有模型归类为两大“风格”(监督式学习 vs. 非监督式学习)和两大“目标”(回归 vs. 分类)。别担心这些术语听起来很高深;读完这些笔记后,你就会对它们了如指掌!

1. 监督式学习 vs. 非监督式学习

统计学习中最重大的区别在于:我们是有一个“老师”在引导模型,还是模型必须靠自己摸索出规律。

监督式学习:在老师的指导下学习

监督式学习 (Supervised Learning) 中,对于每一个输入数据观测值 \( (x_i) \),我们都有一个对应的输出或“标签”\( (y_i) \)。我们的目标是找到一个函数,将输入映射到输出,精确到当我们看到的输入时,可以准确预测的输出。

类比:想象你正在教一个孩子辨认水果。你拿一个苹果给他看并说:“这是苹果。”拿一个橙子给他看并说:“这是橙子。”因为你提供了“答案”(标签),这就是监督式学习。

精算范例:根据驾驶年龄车辆类型(输入 \( X \))来预测索赔成本(输出 \( Y \))。我们使用过去已知索赔成本的数据来“监督”模型进行训练。

非监督式学习:通过探索学习

非监督式学习 (Unsupervised Learning) 中,我们有输入 \( (x_i) \),但没有对应的输出 \( (y_i) \)。这里没有“答案卷”,也没有“老师”。目标是在数据中找出有趣的模式、结构或分组。

类比:想象给同一个孩子一大桶随机形状和颜色的积木,但什么也不说。孩子可能会开始把所有圆形积木放在一堆,方形积木放在另一堆。他们并没有“命名”这些积木,只是根据相似性找到了规律。

精算范例:市场细分 (Market Segmentation)。你拥有数千名保单持有人的数据。你没有要预测的特定目标,但你想看看他们是否自然地分成了不同群体(例如:“城市年轻专业人士”与“退休乡村屋主”),以便更精准地进行行销。

快速回顾:主要区别

监督式:我们有 \( X \) 和 \( Y \)。我们想要预测 \( Y \)。
非监督式:我们只有 \( X \)。我们想要在 \( X \) 中找出模式。

2. 回归 vs. 分类

如果你正在进行监督式学习(意味着你有输出 \( Y \)),下一步就是决定你面对的是回归 (Regression) 问题还是分类 (Classification) 问题。这完全取决于你拥有的输出变量类型

回归:预测数值

当响应变量 \( Y \) 是定量 (quantitative)(数值型)时,我们使用回归。这些变量的数值具有数学意义,并且可以进行排序。

关键词:定量变量取数值(例如:$100、55.5 岁、12 英寸)。

\n

范例:
\n• 预测股票的价格
\n• 估计设备发生故障前的时间
\n• 计算飓风造成的总损失

\n\n

分类:预测类别

\n

当响应变量 \( Y \) 是定性 (qualitative)(分类型)时,我们使用分类。这些变量代表的是“类别”或“标签”,而非测量值。

\n

关键词:定性变量在 \( K \) 个不同的类别中取值(例如:是/否、蓝/绿/红、合格/不合格)。

\n

范例:
\n• 保单持有人是否会续保?(是或否)。
\n• 一笔信用卡交易是欺诈还是合法
\n• 分配信用评级(A、B、C 或 D)。

\n\n
记忆技巧:“C”与“R”速记法
\n

Classification(分类)是用于 Categories(类别,如“A 组”或“B 组”)。
\n• Regression(回归)是用于 Real numbers(实数,如 $5.50 或 100 度)。

3. 重要细微差别与常见错误

如果界限有时显得模糊也不要担心!以下是学生经常踩坑的几点:

“逻辑回归”的困惑

警告! 有一种技术叫做逻辑回归 (Logistic Regression)。尽管它的名字里有“回归”,但它几乎总是用于分类。它估计的是一个观测值属于某个类别的概率(例如某人在保单期限内死亡的概率)。

我们可以将数字视为类别吗?

有时,我们会将数值变量视为类别。例如,如果我们在预测星级评分(1、2、3、4 或 5),我们可以将其视为回归问题(因为 5 分优于 4 分),也可以视为分类问题(将每个星级视为不同的桶)。通常,分析的目标决定了你选择哪种方式。

你知道吗?

大多数 Exam SRM 的考纲集中在监督式学习。不过,主成分分析 (PCA)聚类分析 (Clustering)(你稍后会看到)是你必须掌握的两个重要的非监督式技术!

4. 总结与关键要点

为了总结本节,让我们看一个建模思维的决策树:

第一步:我有目标输出 (\( Y \)) 吗?
有:这是监督式学习。(进入第二步)
没有:这是非监督式学习。

第二步:我的目标 (\( Y \)) 是数字还是类别?
数字:使用回归模型。
类别:使用分类模型。

需要记住的关键点:

监督式模型用于预测
非监督式模型用于探索和了解数据结构。
定量 (Quantitative) = 数字 = 回归。
定性 (Qualitative) = 标签/类别 = 分类。

做得好!你刚刚为整个 SRM 的学习内容打下了基础。在接下来的章节中,我们将开始研究实际执行这些任务所需的数学和模型!