欢迎来到双变量数据探索!
在上一个章节中,我们介绍了单变量 (Univariate) 分析——也就是一次只研究一个变量。现在,让我们进阶一下!双变量数据探索 (Bivariate Data Exploration) 的核心在于同时观察两个变量,看看它们之间如何互相影响。
为什么这是 Exam PA 的“心脏”呢?因为预测建模的本质,其实就是试图理解你的预测变量 (Predictors / Features) 与目标变量 (Target)(即你想预测的目标)之间的关系。如果你能掌握如何通过视觉和数字来找出这些关系,你就已经成功了一半!别担心自己不是数学天才——我们将把它拆解成简单且直观的步骤。
1. 数值型 vs. 数值型:黄金拍档
当你有两个连续变量(例如年龄和收入)时,你会想看看它们是否同步变动。它们是步调一致的好友,还是互不相干的陌生人?
散点图 (Scatterplot)
散点图是你在这里最好的帮手。它将一个变量放在 x 轴,另一个放在 y 轴。
- 正相关 (Positive Relationship): 点呈现“向右上方”趋势。随着 \(X\) 增加,\(Y\) 也会增加。
- 负相关 (Negative Relationship): 点呈现“向右下方”趋势。随着 \(X\) 增加,\(Y\) 会减少。
- 无相关 (No Relationship): 点看起来像是一群随意飞舞的蜜蜂。
相关系数 (\(r\))
这是一个用来总结线性关系强度的单个数字。
- 范围介于 -1 到 +1 之间。
- +1 代表完美的正线性关系。
- -1 代表完美的负线性关系。
- 0 代表完全没有线性关系。
重点复习:
相关系数只能衡量线性(直线)关系。如果你的数据呈现完美的“U”型,相关系数可能是 0,但这并不代表它们没有关系!一定要观察图表,不要只盲目相信数字。
你知道吗? 在 Exam PA 的背景下,如果两个预测变量之间的相关性极高(例如 \(r > 0.8\)),这被称为多重共线性 (Multicollinearity)。这可能会使你的模型变得不稳定,你可能需要考虑剔除其中一个!
关键总结:
使用散点图来可视化趋势,并使用相关系数来量化两个数值变量之间的线性关系强度。
2. 数值型 vs. 类别型:分组比较
通常,你会想知道某个数值(例如索赔金额)是否会根据某个类别(例如性别或地区)而有所不同。
并排箱线图 (Side-by-Side Boxplot)
这是 Exam PA 的“黄金标准”。将类别放在 x 轴,将数值放在 y 轴。
- 观察重点: “盒子”的高度是否相同?如果“A 组”的盒子比“B 组”高得多,那么该类别很可能是一个强有力的预测指标!
密度图 (Density Plots, Overlaid)
想象在同一张图上画出两个平滑的山丘(曲线)。如果两个山丘完全重叠,说明类别差异不大。如果一个山丘远远地移向右边,你就找到了显著的关系。
类比:篮球运动员 vs. 体操选手
如果我们按运动项目(类别)分组绘制人员身高(数值),篮球运动员的箱线图在图表上的位置会比体操选手高得多。这告诉我们,运动项目是预测身高的一个绝佳指标。
常见错误: 只关注“中间值”(平均数/中位数)。也要观察离散程度 (Spread)(盒子的宽度)。如果其中一组的分散程度比另一组大得多,这对于风险管理来说是一个重要的洞察!
关键总结:
要观察类别如何影响数值,请使用并排箱线图。重点观察中位数线以及盒子的整体垂直位置差异。
3. 类别型 vs. 类别型:发现规律
如果两个变量都是类别呢?例如,吸烟状况(是/否)与保单类型(基本/高级)是否有关联?
列联表 (Contingency Tables / Crosstabs)
这是一个显示计数的简单网格。
- 进阶技巧: 不要只看原始计数,要看比例。如果 80% 的吸烟者选择“基本”,但只有 20% 的非吸烟者选择“基本”,你就发现了关联!
堆叠或分组条形图 (Stacked or Grouped Bar Charts)
- 堆叠条形图: 每一根条形代表一个类别,并由第二个类别进行“填色”。如果颜色在不同条形间的分布不同,就代表存在交互作用。
- 填充(比例)条形图: 每根条形的高度相同(100%)。这通常更适合观察类别的比例是否发生变化。
记忆小撇步:“100% 原则”
当比较不同规模的类别时(例如 1,000 名男性 vs. 10 名女性),请务必使用比例(百分比)而非原始计数,否则较小的群体在图表中会被“淹没”。
关键总结:
使用比例堆叠条形图来观察一个类别变量的分布是否会随另一个变量而改变。
4. 为什么这对考试很重要?
在 Exam PA 中,你绘制图表不是为了好玩。你正在进行特征选择 (Feature Selection)。
1. 预测变量 vs. 目标变量: 如果在这里发现关系,保留该预测变量!它很有用。
2. 预测变量 vs. 预测变量: 如果在这里发现非常强的关系,你可能存在冗余 (Redundancy)。同时使用两者可能会降低模型的可解释性。
如果一开始觉得很复杂,别担心! 你在 R 中练习绘制这些图表的次数越多,你就会越快学会“阅读”数据所讲述的故事。撰写报告时,就像我们描述篮球运动员的例子一样,用简单明了的语言描述你看到的现象即可!
双变量分析工具总结:
1. 数值型 + 数值型: 散点图,相关系数 \(r\)。
2. 数值型 + 类别型: 并排箱线图,重叠密度图。
3. 类别型 + 类别型: 列联表,堆叠条形图。
重点复习:
双变量 (Bivariate) = 两个变量。
目标: 找出关系、检测多重共线性,并为你的模型识别出最重要的预测指标。