导言:从数据中挖掘故事
欢迎!在精算学的世界里,我们经常会面对庞大的数据集,它们看起来就像一堆毫无意义的数字。在深入进行复杂的模型构建之前,我们需要先进行探索性数据分析 (Exploratory Data Analysis, EDA)。在这个阶段,我们会利用“探索性图表”来将数据可视化,并通过“相关系数”来观察变量之间的关系。
在你的卷 B (CS1B) 考试中,题目不只要求你生成这些图表,还会要求你进行解释。请把自己想象成一名正在寻找线索的侦探——数据是否偏斜?有没有奇特的离群值?两个变量是否共同变动?让我们一起学习如何利用 R 来找出这些答案。
1. 单变量数据可视化:观察单一变量
在研究变量间的关系之前,我们需要先了解个别变量。课程大纲强调使用探索性可视化工具来理解数据的分布情况。
直方图 (Histogram):hist()
直方图能帮助我们观察数据的“形状”。它将数据分成不同的“组距”(bins),并显示落入每个组距的观测值数量。这对于检查数据是对称还是偏斜非常有用。
R 语法:
hist(data_vector, main = "标题", xlab = "标签", col = "blue")
精算类比:想象你正在整理索赔金额。如果大部分的索赔金额都很小,但有少数几宗金额巨大,你的直方图就会向右延伸出一条“长尾巴”。这被称为正偏态 (positive skew),在保险领域中非常常见!
箱线图 (Boxplot):boxplot()
箱线图(又称盒须图)能直观地呈现五数概括法 (five-number summary):最小值、第一四分位数 (\(Q1\))、中位数、第三四分位数 (\(Q3\)) 以及最大值。
解读重点:
- “箱子”部分:代表四分位距 (IQR),包含了中间 50% 的数据。
- 粗线:这代表中位数。
- “须线”:延伸至不被视为离群值的最极端数据点。
- 点点/圆圈:须线之外的点就是离群值 (outliers)。对精算师来说,这些点至关重要,因为它们可能代表“灾难性”的索赔个案。
R 语法:
boxplot(data_vector, horizontal = TRUE)
2. 双变量数据可视化:散点图
当我们想观察两个变量之间是否存在关系时(例如“投保人年龄”与“索赔次数”),我们会使用散点图 (scatter plot)。
绘图函数:plot()
在 R 中,plot(x, y) 会创建一个散点图,其中 \(x\) 是解释变量(通常在水平轴),而 \(y\) 是响应变量(通常在垂直轴)。
观察重点:
- 方向:点的分布是从左下往右上(正相关)还是从左上往右下(负相关)?
- 形态:点的分布看起来像直线(线性)还是曲线?
- 强度:点与点之间靠得有多近?分布越密集代表关系越强。
小贴士:在卷 B 考试中,记得一定要为坐标轴标注标签!使用 xlab = "..." 和 ylab = "...",确保不会在这些简单的地方丢分。
3. 相关性:衡量变量间的联系
虽然图表给了我们视觉上的“感觉”,但相关系数则为关系的强度和方向提供了一个数值。CS1 课程要求你掌握三种特定的衡量指标。
相关性三剑客
1. 皮尔逊积差相关系数 (Pearson’s Product-Moment Correlation, \(r\))
衡量两个变量之间线性关系的强度。它假设数据大致呈正态分布。
- 数值为 \(+1\):完美的正线性关系。
- 数值为 \(-1\):完美的负线性关系。
- 数值为 \(0\):无线性关系。
2. 斯皮尔曼等级相关系数 (Spearman’s Rank Correlation, \(\rho\))
这是一种“非参数”衡量指标。它不使用原始数值,而是使用数据的排名 (ranks)。它非常适合检测单调 (monotonic) 关系(即变量朝相同方向移动,但不一定是直线)。相比皮尔逊系数,它对离群值的敏感度较低。
3. 肯德尔等级相关系数 (Kendall’s Tau, \(\tau\))
与斯皮尔曼类似,这也是基于排名的指标。它观察的是“一致对”(concordant) 与“不一致对”(discordant)。通常用于样本量较小或存在大量相同排名(平秩)的情况。
相关性的 R 代码
cor() 函数是你的好帮手,你只需要指定“方法”(method):
cor(x, y, method = "pearson")
cor(x, y, method = "spearman")
cor(x, y, method = "kendall")
快速复习:该用哪一个?
- 如果关系看起来像一条直线:Pearson。
- 如果关系是曲线但始终递增/递减:Spearman。
- 如果数据中有极端离群值,可能会“拉偏”直线:Spearman 或 Kendall。
4. 常见陷阱与解读建议
如果起初觉得这有点难,请不要担心;解读输出结果是一项随着练习而增长的技能。以下是你在考试作答时需要留意的事项:
相关不代表因果 (Correlation \(\neq\) Causation)
仅仅因为两个变量具有很高的相关系数(例如 \(0.95\)),并不代表其中一个变量导致了另一个。在考试评论中,请使用像“……之间存在强烈的正线性关联”之类的字眼,而不要说“变量 X 导致变量 Y”。
离群值的影响
单一离群值就可能显著地降低(或增加!)Pearson 相关系数。如果你在散点图中看到离群值,但 Spearman 相关系数很高,这表示潜在关系其实很强,只是 Pearson 数值被扭曲了。
检查非线性关系
如果 cor(x, y) 接近 \(0\),并不代表变量之间完全没有关系。两者可能存在二次函数(U 型)关系。这就是为什么我们在计算数值之前,务必要先绘制图表!
卷 B 核心重点回顾
hist():观察单一变量的分布和偏斜度。boxplot():识别中位数、四分位数和离群值。plot(x, y):将两个变量之间的关系可视化。cor(..., method = "..."):量化关系。- Pearson:线性关系。
- Spearman/Kendall:单调关系(基于排名)。
- 解读:在信任相关系数之前,一定要先看图表!
注:关于如何将这些结果应用于正式检验的详情,请参阅“利用软件输出进行检验与置信区间”章节。若要在模型中使用这些变量,请参阅“线性回归输出的拟合与解读”。