欢迎来到单变量数据探索!
你好!欢迎来到 Exam PA 之旅最关键的起步阶段之一。在我们构建华丽的预测模型之前,必须先了解我们的数据。将单变量数据探索(Univariate Data Exploration)想象成与数据集进行的“第一次约会”——你只需要一次针对一个变量("uni" 意为单一)来了解基本事实。完成本章后,你将学会如何总结和可视化个别变量,从而发现其中的规律、错误或惊喜。
如果你还不是数学天才也不用担心。我们会将所有内容拆解成简单的部分,并附上大量示例!
1. 分类数据 vs. 数值数据:两大类别
在进行任何分析前,我们必须先确认手头上的数据类型。在精算领域中,数据通常分为两大类别:
分类数据 (Categorical / Qualitative Data)
这类数据是标签或名称。你无法对它们进行数学运算(例如,你不能将“红色”+“蓝色”相加)。
- 名义数据 (Nominal): 没有自然顺序的类别(例如:性别、居住地、汽车颜色)。
- 顺序数据 (Ordinal): 具有特定顺序的类别(例如:教育程度:高中、学士、硕士)。
数值数据 (Numeric / Quantitative Data)
这类数据是代表测量或计数的数字。
- 离散数据 (Discrete): 可数的数字(例如:索赔次数、子女数目)。
- 连续数据 (Continuous): 在一定范围内可取任何值的数据(例如:索赔金额、保单持有人年龄)。
快速复习: 如果你能计算出一个有意义的平均值,它很可能是数值数据。如果你是将事物归类为不同的“类型”,那么它就是分类数据。
2. 探索分类数据
由于我们无法计算颜色或地区的“平均值”,我们会使用频率(frequencies)来探索分类数据。
频率表 (Frequency Tables)
这仅仅是计算每个类别出现的次数。我们通常也会查看相对频率 (Relative Frequency),即各类别占总数的百分比。
使用条形图 (Bar Charts) 可视化
条形图在这里是你最好的帮手。每个条形代表一个类别,条形的高度则代表该类别的计数或百分比。
示例: 一张显示按“地区”(北、南、东、西)销售保单数量的条形图。如果“北部”的条形高度是“南部”的两倍,你立刻就能看出业务集中在哪里。
常见错误: 不要把条形图和直方图(Histogram)搞混了!条形图的条形之间有间隙,因为类别是离散的;而直方图没有间隙,因为数据是连续的。
3. 探索数值数据:集中趋势 (Central Tendency)
我们想知道数据的“中心”在哪里。主要有三种测量方式:
- 平均值 (Mean): 算术平均数。将所有数值加总后除以个数。
\( \bar{x} = \frac{\sum x_i}{n} \) - 中位数 (Median): 将数据排序后的中间值。如果数据存在极端值 (outliers),中位数通常比平均值更能代表“典型”情况。
- 众数 (Mode): 出现频率最高的数值。
现实生活类比: 想象房间里有 10 个年薪 5 万美元的人。这时,一位亿万富翁走了进来。平均值薪水会飙升,让每个人看起来都很富有。然而,中位数(中间那位的薪水)几乎完全不变。这就是为什么我们说中位数对极端值具有稳健性 (robust)!
4. 探索数值数据:离散程度 (Dispersion / Spread)
只知道中心还不够,我们还需要知道数据是紧密聚集还是分散的。
变异数与标准差 (Variance and Standard Deviation)
这些指标用于衡量数据点平均偏离平均值的程度。
- 变异数 (\( \sigma^2 \)): 数据点偏离平均值后的平方差的平均值。
- 标准差 (\( \sigma \)): 变异数的平方根。它的单位与原始数据相同(例如:美元),因此更易于解读。
五数概括与四分位距 (Five-Number Summary and IQR)
这是观察数据分散程度,而不受极端值干扰的好方法:
- 最小值 (Minimum)
- 第一四分位数 (Q1 - 第 25 百分位数)
- 中位数 (Q2 - 第 50 百分位数)
- 第三四分位数 (Q3 - 第 75 百分位数)
- 最大值 (Maximum)
四分位距 (IQR): \( Q3 - Q1 \)。它告诉你数据中“中间 50%”的范围。
5. 分布形状 (Shape of the Distribution)
当你查看数据图表时,它的“轮廓”长什么样子?
偏度 (Skewness)
偏度告诉我们数据的对称性。
- 右偏 (Right Skewed / Positive Skew): “尾巴”指向右侧。大多数数值较小,但少数极大的数值将平均值拉向右侧。(示例:保险索赔金额——大多数很小,但少数金额巨大!)
- 左偏 (Left Skewed / Negative Skew): “尾巴”指向左侧。(示例:退休年龄——大多数人年纪较大,但少数人很年轻就退休。)
- 对称 (Symmetric): 左侧和右侧是镜像关系(如常态分布)。
记忆小撇步: “尾巴指明方向”。如果长长的细尾巴在右边,就是右偏!
峰度 (Kurtosis)
这描述了尾巴有多“厚”。高峰度意味着出现极端值的风险更高(厚尾效应)。
6. 可视化数值数据
直方图 (Histograms)
直方图将数值数据分组到“区间 (bins)”中并显示频率。它非常适合用来观察数据的形状和偏度。
箱型图 (Boxplots / Whisker Plots)
箱型图可视化呈现了五数概括:
- 箱体 (Box) 显示了 IQR(中间 50% 的数据)。
- 箱体内的线条是中位数。
- 胡须 (Whiskers) 延伸显示范围(通常为 1.5 倍的 IQR)。
- 胡须外的点代表潜在的极端值 (outliers)。
你知道吗? 箱型图是检测极端值的利器。如果你看到离胡须很远的点,那些就是你在 Exam PA 项目中应该深入调查的对象!
7. 发现问题:极端值与缺失值
单变量探索是你发现“脏”数据的第一机会。
- 极端值 (Outliers): 与其余数据显著不同的数据点。它们可能是错误(例如 200 岁的保单持有人),也可能是合法的极端个案(例如 1,000 万美元的索赔)。
- 缺失值 (Missing Values): 寻找 "NA" 或空白。有时数据会用 "0" 或 "999" 来表示缺失——要小心!
快速总结表:
特征: 集中趋势 | 指标: 平均值、中位数、众数
特征: 离散程度 | 指标: 标准差、IQR、全距 (Range)
特征: 形状 | 指标: 偏度、峰度
特征: 可视化 | 指标: 直方图、箱型图、条形图
Exam PA 核心要点
1. 务必先检查变量的类型(分类数据 vs. 数值数据)。
2. 对于数值数据,观察平均值 vs. 中位数。如果两者相差甚远,数据很可能是偏态的。
3. 使用直方图观察分布形状,并使用箱型图找出极端值。
4. 右偏数据在保险业中非常常见(如索赔/损失)。在后续建模过程中,你可能需要对这些数据进行转换(例如使用对数转换 Log transform)。
继续加油!你正在构建向评分员解释数据所需的坚实基础。你一定能做到的!