欢迎来到探索性数据分析(EDA)的世界!

欢迎你!精算师在构建复杂的模型来预测未来之前,首先需要了解现状。你可以把探索性数据分析(Exploratory Data Analysis,简称 EDA)想象成侦探工作。在解决“犯罪”(业务问题)之前,你需要先查看所有线索(数据),看看它们讲述的是什么故事。在本章中,我们将学习如何清理、可视化并概括数据,以便日后作出更精明的决策。如果起初你觉得统计学有点枯燥,不必担心——我们会用现实生活中的场景来为你一一拆解!

1. 理解你的数据:原始原材料

在分析数据之前,我们需要知道自己手头上有的,是什么类型的数据。并非所有数据都是平等的!就像你不会用温度计来测量一个人有多喜欢某部电影一样,我们对不同类型的数据需要使用不同的工具。

分类数据(Categorical Data,定性数据)

这描述的是“性质”或“标签”。它是可以归入不同组别的数据。
名义数据(Nominal Data): 仅仅是名称,没有特定的顺序。例子:眼睛颜色(蓝色、棕色、绿色)。
顺序数据(Ordinal Data): 具有自然的顺序。例子:客户满意度(低、中、高)。

数值数据(Numerical Data,定量数据)

这描述的是“数量”或可以用数学处理的数字。
离散数据(Discrete Data): 可数的值,通常是整数。例子:一个人提出的保险索赔次数(0, 1, 2...)。你不可能提出 1.5 次索赔!
连续数据(Continuous Data): 可以在一定范围内取任何值的测量结果。例子:处理索赔所需的精确时间(3.452 天)或人的身高。

小贴士: 如果你可以问“有多少?(How many?)”,它通常是离散的。如果你可以问“多少量?(How much?)”,它通常是连续的。

2. 统计摘要:描述“中心”(位置)

统计摘要能帮助我们将一大堆数字转化为几个有意义的数值。首先,我们寻找数据的“中间位置”。

平均数(Arithmetic Mean,算术平均值)

所有数值的总和除以观测值的数量。
公式: \( \bar{x} = \frac{\sum_{i=1}^{n} x_i}{n} \)
现实范例: 如果你有 5 笔保险索赔,金额分别为 $100、$200、$150、$300 和 $1000,平均数为 \( (100+200+150+300+1000) / 5 = \$350 \)。

中位数(Median)

当数据从小到大排序时,位于中间的值。如果你有偶数个数据点,则取中间两个数字的平均值。
为什么要用它? 中位数具有“稳健性”(Robust)。它不容易受到异常值(Outliers,极端值)的影响。在上面的例子中,$1000 的索赔让平均数看起来很高,但中位数只有 $200。对于偏态数据来说,它往往是一个更好的“典型”代表值。

众数(Mode)

出现次数最多的数值。在我们的索赔例子中,众数并不显著,但如果我们有两笔 $100 的索赔,众数就会是 $100。

重点总结: 对于对称数据使用平均数,当数据中存在可能扭曲平均值的极端数值时,使用中位数

3. 统计摘要:描述“离散程度”(分散度)

只知道中心点是不够的。我们还需要知道数据是集中在一起,还是分得很开。

方差与标准差(Variance and Standard Deviation)

这些衡量的是数据点与平均值的平均距离。
方差(\( s^2 \)): 离差平方的平均值。
标准差(\( s \)): 方差的平方根。我们更常用标准差,因为它的单位与原始数据相同(例如:美元,而不是平方美元)。
样本标准差公式: \( s = \sqrt{\frac{\sum (x_i - \bar{x})^2}{n-1}} \)

全距与四分位距(Range and Interquartile Range, IQR)

全距(Range): 最大值减最小值。对异常值非常敏感。
四分位距(IQR): 第 75 百分位数(\( Q_3 \))与第 25 百分位数(\( Q_1 \))之间的距离。它涵盖了数据中间的 50%。
公式: \( IQR = Q_3 - Q_1 \)

你知道吗? 精算师非常关注数据的离散程度,因为它代表了风险。索赔成本的离散程度越高,意味着保险公司面临的不确定性越大!

4. 描述形状:偏度(Skewness)

你的数据像钟形一样对称,还是其中一侧有长长的“尾巴”?

对称分布: 平均数 \(\approx\) 中位数 \(\approx\) 众数。左侧是右侧的镜像。
正偏态(右偏态,Positively Skewed): “尾巴”指向右侧(较大的值)。平均数 > 中位数。例子:个人财富(少数亿万富翁将平均数拉高了)。
负偏态(左偏态,Negatively Skewed): “尾巴”指向左侧(较小的值)。平均数 < 中位数。例子:退休年龄(大多数人晚退休,少数人很早退休)。

记忆小技巧: 偏度在哪边,尾巴就在哪边。如果尾巴在右边,就是偏态。

5. 图形化 EDA:眼见为凭

有时候,一张图表胜过一千个数字。

直方图(Histograms)

用于连续数据。它将数据分组为“箱子”(区间)并显示每个箱子的频率。这是观察数据形状(偏度)的最佳方式。

盒须图(Boxplots,箱型图)

盒须图使用 5 个关键数字来总结数据:
1. 最小值(不含异常值)
2. 下四分位数(\( Q_1 \))
3. 中位数(\( Q_2 \))
4. 上四分位数(\( Q_3 \))
5. 最大值(不含异常值)

盒须图解读步骤:
• “箱子”显示了 IQR(中间 50%)。
• 箱子内部的“横线”是中位数。
• “须”延伸至最小值和最大值。
• 在须之外的点通常被视为异常值

散点图(Scatter Plots)

用于查看两个数值变量之间的关系。例如,行驶里程数是否与事故数量有关?如果点形成一条向上的线,则存在正相关。

6. 识别异常值

异常值是与其他数据点“异常地”远的观测值。在 CS1 中,我们通常使用 1.5 x IQR 规则来找出它们。

如何寻找异常值:
1. 计算 \( IQR = Q_3 - Q_1 \)。
2. 计算“下边界”: \( Q_1 - (1.5 \times IQR) \)。
3. 计算“上边界”: \( Q_3 + (1.5 \times IQR) \)。
4. 任何低于下边界或高于上边界的数据点都是异常值!

常见错误: 不要直接删除异常值!它们可能确实是错误,但也有可能是最重要的数据点(例如巨额的保险灾难赔偿)。

快速复习栏

• 分类数据: 标签/组别。 数值数据: 测量值。
• 平均数: 对异常值敏感。 中位数: 不敏感(稳健)。
• 右偏态: 尾巴在右边,平均数 > 中位数。
• 异常值规则: 任何超出 \( [Q_1 - 1.5IQR, Q_3 + 1.5IQR] \) 范围的值。
• 直方图: 显示分布形状。 盒须图: 显示四分位数和异常值。

最后的鼓励

EDA 是你在精算统计学中所做一切的基础。如果你能掌握观察数据并发现模式或异常情况的艺术,那么你已经向成为一名优秀精算师迈进了一半。如果方差或偏度的公式看起来很吓人,不用担心——通过练习,这些很快就会成为你的直觉!