欢迎来到预测分析(Predictive Analytics)的基础!

你好!在开始编写程序代码或为 Exam PA 构建复杂模型之前,你需要精确地厘清你所要解决的问题类型。将这一章节视为你的“蓝图规划阶段”。就像建筑师在动工前必须先有蓝图一样,精算师在定义问题特性之前,也不应贸然开始建模。

在本节中,我们将学习如何识别数据的本质、模型的目标以及我们面临的限制。如果其中一些术语对你来说很陌生,不用担心——我们会逐一为你拆解!


1. 问题的核心:监督式学习与非监督式学习

你需要问自己的第一个问题是:“我是否有一个具体的目标(Target)需要预测?”

监督式学习(Supervised Learning)

监督式学习中,我们拥有一个“导师”(即目标变量)。我们为模型提供输入(特征,Features)以及已知的结果(标签,Label)。模型通过学习两者之间的关系,从而对新的、未见过的数据进行预测。

比喻:想象你在教导孩子辨识水果。你给他们看一个苹果并说:“这是苹果。”你给他们看一个橘子并说:“这是橘子。”这就是监督式学习,因为你提供了标签

非监督式学习(Unsupervised Learning)

非监督式学习中,没有目标变量。我们单纯是在数据本身中寻找模式(Patterns)或群组(Clusters)。

比喻:你给孩子一桶混在一起的积木,告诉他们:“把看起来相似的东西放在一起。”他们可能会根据颜色或形状将积木分组,而你并没有告诉他们每一组具体叫什么名称。

快速复习:大多数 Exam PA 的考题都属于监督式学习任务,因为身为精算师,我们通常需要预测具体的数值,例如索赔成本或保单失效情况。


2. 回归与分类(目标变量的类型)

一旦确定是在进行监督式学习,我们必须判断目标变量的类型。这是 Exam PA 中最重要的步骤之一!

回归(Regression,连续型目标)

当目标变量是数值且连续时,我们使用回归。如果你可以测量它,且它具有明确的顺序(例如金额或时间),那它很可能是一个回归问题。

范例:
- 预测保险索赔的美元金额
- 估计处理一宗法律案件所需的时间
- 计算业务组合的损失率(Loss Ratio)

分类(Classification,类别型目标)

当目标变量属于离散类别(Discrete Category)时,我们使用分类

范例:
- 客户会续保(Renew)还是失效(Lapse)?(二元分类:是/否)
- 索赔是欺诈(Fraudulent)还是合法(Legitimate)
- 驾驶属于哪一个“风险等级”:低、中或高?(多类别分类)

你知道吗?有时候界限可能较为模糊。例如,你可以将“年龄”视为连续数值(回归),也可以将其分组为“年龄区间”,如 18-25 岁、26-40 岁等(分类)。具体选择取决于你的商业目标!


3. 预测与解释:两者之间的取舍(The Great Trade-off)

在定义预测模型问题时,你必须决定什么更重要:准确性(Accuracy)还是可解释性(Understanding/Interpretability)

预测目标(“黑盒”模型)

有时候,我们只在乎得到尽可能准确的预测。如果一个模型能完美预测索赔成本,但我们并不完全了解它为什么做出这些选择,对于某些自动化系统来说,这或许是可以接受的。

解释目标(“白盒”模型)

身为精算师,我们经常需要向利害关系人或监管机构解释我们的结果。我们必须知道哪些特征(例如年龄或地点)正在驱动预测,以及影响程度有多大。简单的模型如广义线性模型(GLMs)非常适合解释;而复杂的模型如随机森林(Random Forests)通常在原始预测能力上较强,但却较难解释。

关键要点:在 Exam PA 考试中,你经常被要求平衡这两者。务必考量:如果是一个你无法解释的模型,监管机构是否会接受?


4. 数据结构:结构化与非结构化数据

在进行建模之前,你必须了解数据的“形状”。

结构化数据(Structured Data)

这是“经典”的数据格式。想象一个带有行与列的电子表格。每一行是一个观察值(Observation)(例如一位保单持有人),每一列是一个特征(Feature)(例如车龄)。

非结构化数据(Unstructured Data)

这包含索赔记录中的文字、车祸照片或客户服务通话的录音档等。虽然信息量大,但非结构化数据通常需要先转换为结构化格式,大多数预测模型才能使用它们。

记忆小技巧:记得结构化数据的 "ROC"Rows(行/观察值)、Observations(观察值)、Columns(列/特征)。


5. 道德考量与数据隐私

这是 SOA 课程中的一个重要主题。并非所有数据在伦理上都是“公平”使用的,即使它能提高模型的准确性。

在定义问题时,你必须过滤掉受保护的特征(Protected Characteristics)。这些是基于法律或道德原因,不应被用于决策的变量,例如:

- 种族或族群
- 宗教
- 健康状况(在某些类型的保险中)
- 性别(取决于司法管辖区和产品)

常见错误:使用“代理变量(Proxy Variable)”。即使你移除了“种族”,但如果你使用了与特定种族高度相关的“邮递区号”,你的模型可能仍然存在偏见。这被称为间接歧视(Indirect Discrimination)


问题定义总结清单

在进入下一章之前,请确保你能够回答任何场景下的以下问题:

1. 是否有目标?(监督式 vs. 非监督式)
2. 目标是什么类型?(回归/连续型 vs. 分类/类别型)
3. 优先考量为何?(准确性 vs. 可解释性)
4. 是否存在道德隐忧?(潜在偏见或受保护族群)

快速复习框:
- 回归:预测一个数值(例如 \( \hat{y} = \$1,250 \))。
- 分类:预测一个标签(例如 \( \text{Result} = \text{'Lapse'} \))。
- 监督式:我们拥有已知的结果来进行学习。
- 非监督式:我们正在寻找隐藏的结构。

如果现在觉得这些听起来还很理论化,别担心!在接下来的章节中,我们将开始接触实际数据,并学习如何为模型进行资料清理。你做得很好!