欢迎踏上你的预测分析(Predictive Analytics)之旅!

刚开始准备 Exam PA 时,可能会觉得像是在学一种新语言,但别担心——这里面大多数的概念,其实都是你凭直觉就能理解的东西。在这章里,我们将探讨任何预测模型中的“原材料”:变量(Variables)。了解你手上的数据类型是“数据探索(Data Exploration)”的第一步,因为它决定了你将绘制什么图表以及建立什么模型。让我们开始吧!

1. 全局观:变量的角色

在我们我们将数据按“类别”分门别类之前,我们需要先了解每一项数据在模型中扮演的角色。在预测建模中,我们通常有两个主角:

目标变量(“目标”)

目标变量(Target Variable)(也称为响应变量(Response)因变量(Dependent Variable))是你试图预测或解释的对象。在 Exam PA 的项目中,商业问题总会指引你找到一个明确的目标。
比喻: 如果你试图预测烤蛋糕需要多久,那么“烘烤时间”就是你的目标变量。

预测变量(“配料”)

预测变量(Predictors)(也称为特征(Features)自变量(Independent Variables)解释变量(Explanatory Variables))是你用来进行预测的信息。
比喻: 为了预测烘烤时间,你可能会查看烤箱温度、面糊重量以及你所在厨房的海拔高度。这些就是你的预测变量。

公式小检查:
在许多教科书中,你会看到两者的关系写成:
\( Y = f(X) + \epsilon \)
其中:
\( Y \) = 目标变量。
\( X \) = 预测变量。
\( f \) = 我们试图寻找的数学函数或模型。
\( \epsilon \) (epsilon) = 我们无法解释的“噪声”或随机误差。

关键点: 预测建模简单来说,就是使用预测变量 (X) 来估计目标 (Y)

2. 定性(类别)变量

定性变量(Qualitative variables)代表的是描述或“组别”,而非测量值。这些变量描述了观测对象的某种特质。我们将其分为两大类:

名义变量(仅有名称)

名义变量(Nominal variables)是指没有逻辑顺序的类别。一个类别并不会比另一个“更高”或“更好”。
例子: 性别、发色、居住省份,或保险单类型(汽车险 vs. 房屋险)。
记忆小撇步: Nominal(名义)= Name(名称)。

次序变量(顺序很重要)

次序变量(Ordinal variables)是指类别之间有明确的顺序,但类别之间的数学距离是不固定的。
例子: 教育程度(高中、学士、硕士、博士)或客户满意度(低、中、高)。
比喻: 想象一场赛跑。跑出第 1、第 2 和第 3 名是次序关系。你知道第 1 名比第 2 名快,但单看排名并不知道具体快了“多少”。

重点复习表:
- 名义: 没有顺序的类别(红、蓝、绿)。
- 次序: 有明确等级的类别(小、中、大)。

3. 定量(数值)变量

定量变量(Quantitative variables)是代表可测量数量的数字。你可以对这些数值进行运算(例如计算平均值)。我们将其分为两组:

离散变量

离散变量(Discrete variables)是你数出来的东西。它们通常取整数值,且数值之间有“间隙”。
例子: 一个人提出的索赔次数、家庭拥有的汽车数量,或家庭中的子女数量。
检查: 你能有 2.47 个孩子吗?不能。这代表它是离散的。

连续变量

连续变量(Continuous variables)是你测量出来的东西。它们可以在某个范围内取任何值,包括小数。
例子: 索赔损失的确切美元金额、一个人的年龄,或其年收入。
检查: 一笔索赔金额可以是 $1,205.52 吗?可以。这让它是连续的。

你知道吗? 有时在 Exam PA 中,离散与连续之间的界线会变得模糊。例如,年龄在技术上是连续的(你可以是 25.432 岁),但通常会记录为离散的整数(25 岁)。如果发生这种情况,请不要惊慌,只需观察数据在数据集中实际是如何存储的即可。

4. 你需要知道的专门术语

当你阅读 Exam PA 的教材时,你会经常看到这些术语。我们现在来厘清一下:

二元(或二分)变量(Binary / Dichotomous Variables):一种特殊的类别变量,只有两个选项。通常为 0/1、是/否,或通过/不通过。
虚拟变量(Dummy Variables / Indicators):将类别变量转化为数字以便电脑理解的过程。例如,如果你有“性别”,你可能会建立一个名为“Is_Female”的变量,其中 1 代表是,0 代表否。
水平(Levels):这是指定性变量中的不同类别。如果“颜色”有红、蓝、绿,我们就说该变量有 三个水平(three levels)
观测值(Observations):这就是数据中的行(rows)。每一行代表被测量的一个独立“个体”(例如一个保单持有人或一份索赔案件)。

5. 需避免的常见陷阱

陷阱 1:将次序变量视为名义变量。
如果你将“信用评分等级”(差、中、好)视为名义变量,你的模型就会丢失“好”优于“差”这一重要的信息。

陷阱 2:混淆标签与数字。
有时数据会用数字作为标签。例如,“区域 1、区域 2、区域 3”。即使它们是数字,它们实际上是名义变量。将“区域 1”加上“区域 2”并不会变出“区域 3”。

陷阱 3:忘记目标变量的类型。
这是最重要的一点!如果你的目标连续的(如索赔成本),你处理的是回归(Regression)问题。如果你的目标类别的(如“客户会续保吗?”),你处理的是分类(Classification)问题。

本章总结

1. 预测变量 (X) 用于预测目标变量 (Y)
2. 定性数据是类别性的。分为名义(无顺序)次序(有顺序)
3. 定量数据是数值性的。分为离散(数出来的)连续(测量出来的)
4. 目标变量的类型决定了你的建模方法:数字型选回归,类别型选分类

如果这些标签看起来很多,请别担心!当你在接下来的章节中接触实际数据时,这些定义就会变得自然而然。你一定可以的!