欢迎来到数据探索与可视化!

你好!如果你正在准备 Exam PA,你大概已经意识到数据不仅仅是电子表格上的数字——它更是在讲述一个故事。在本章中,我们将专注于绘图的核心原则 (Key Principles of Constructing Graphs)。你可以把这些原则想象成视觉传达的“语法”。无论你是为了寻找规律而进行数据探索,还是向客户呈现最终发现,这些原则都能确保你的信息清晰、准确且专业。别担心如果你自认没有“艺术天分”——高效的可视化其实更像是一门科学,而非艺术!

1. 目的:探索 vs. 沟通

在你通过 R 语言点击任何按钮之前,你需要先问自己:这张图是给谁看的?

探索性数据分析 (EDA):这是为(精算师)准备的。这些图表能帮助你了解数据的分布、找出离群值 (outliers) 并发现变量之间的关系。它们不需要完美,只要能提供信息即可。

解释性可视化 (Explanatory Visualization):这是为他们(你的老板或客户)准备的。这些图表必须精致、标签清晰,并且明确点出你想让受众看到的那个“啊哈!”时刻。

2. 黄金法则:数据墨水比 (Data-to-Ink Ratio)

由 Edward Tufte 提出的数据墨水比是预测分析中的一个基本概念。想法很简单:尽可能使用最多的“墨水”来展示实际数据,而对非数据元素则使用尽可能少的“墨水”。

高数据墨水比(好):线条简洁、点位清晰、设计极简。屏幕上的每一个元素都有其用途。
低数据墨水比(差):杂乱的网格线、3D 特效、阴影以及分散注意力的背景图像。这通常被称为“图表垃圾 (chartjunk)”。

小撇步:橡皮擦测试

看着你的图表并问自己:“如果我擦掉这个元素,这张图会失去意义吗?”如果答案是“不会”,那就把它删掉!务必避免使用 3D 条形图——它们让读取实际数值变得困难,且对分析毫无帮助。

3. 克里夫兰图形感知阶层 (Cleveland’s Hierarchy of Graphical Perception)

并非所有的视觉线索都是平等的。William Cleveland 对人类感知不同视觉信息类型的准确度进行了排序。当你希望受众准确比较数值时,请优先使用该列表顶端的视觉特征:

  1. 在共同基准线上的位置 (Position along a common scale):(最佳)试想散点图 (Scatterplot)。这是我们大脑最容易判断的。
  2. 长度 (Length):试想条形图 (Bar Chart)。我们非常擅长辨别哪条线比较长。
  3. 角度/斜率 (Angle/Slope):试想饼图 (Pie Chart)。(警告:人类在比较角度方面表现意外地差!)
  4. 面积 (Area):试想气泡图 (Bubble Chart)。相比于比较两条线,要分辨一个圆形是否刚好是另一个圆形的两倍大要困难得多。
  5. 体积/颜色饱和度 (Volume/Color Saturation):(最差)这些仅适合用于营造“氛围”或展现高层次模式,不适合精确比较。
记忆口诀:“People Love Apples and Oranges”(P-L-A-O)

Position(位置)> Length(长度)> Angle(角度)> Others(其他:面积/颜色)。在展示最重要的变量时,请坚持使用列表顶端的这些选项!

4. 为任务选择正确的图表

在 Exam PA 中,你经常会被要求证明为什么选择某种特定的图表。以下是一个快速指南:

单变量分析 (Univariate Analysis - 观察单一变量)

直方图 (Histograms):非常适合查看连续数值变量的分布(形状)。它有助于识别偏态 (skewness) 或双峰模式。
箱线图 (Boxplots):识别离群值 (outliers) 的绝佳工具,一眼就能看出五数概括(最小值、第一四分位数 Q1、中位数、第三四分位数 Q3、最大值)。

双变量分析 (Bivariate Analysis - 观察两个变量之间的关系)

散点图 (Scatterplots):当你拥有两个数值变量时使用。它们能揭示相关性与非线性模式。
并排箱线图 (Side-by-Side Boxplots):当你拥有一个数值变量和一个类别变量时使用。例如,比较不同“地区”(类别)之间的“赔款金额”(数值)。
条形图 (Bar Charts):最适合类别变量。用它们来显示各类别的计数或平均值。

5. 缩放与标签的重要性

一张没有标签的图表只是一堆点点。为了在考试中取得好分数,你的图表必须看起来专业。

  • 务必标注轴标签:使用具描述性的名称,例如“年度收入 (美元)”,而不是 R 语言中原始变量名称如 "ann_inc_v2"
  • 加入标题:告诉读者他们正在看什么(例如:“年龄与索赔频率之间的关系”)。
  • 注意缩放比例:在条形图中,让 y 轴的起点非零有时会产生误导。确保比例对数据来说是适当的——不要为了“放大”而放大,导致微小的差异看起来像巨大的危机。

6. 应避免的常见错误

即使是经验丰富的精算师也会犯这些错误。请留意这些“危险信号”:

1. 过度绘图 (Overplotting):当散点图中拥有 10,000 个数据点时,它看起来就像一团巨大的斑点。 解决方案:使用透明度(设置“alpha”值)或使用“六边形分箱图 (hexbin plot)”。

2. 类别过多:一个拥有 50 种不同颜色对应 50 个州的条形图是不可能阅读的。 解决方案:将较小的类别合并为“其他”类别,或使用排序后的水平条形图。

3. 无故使用颜色:如果所有的条形都代表同一件事,它们就不需要不同的颜色。只有在颜色代表额外的变量时才使用它。

快速复习盒

- 高数据墨水比:保持简洁。
- 位置 > 长度:优先使用散点图和条形图。
- 语境至上:标签和标题是强制要求的,而非选填。
- 拒绝 3D:永远不要将 3D 特效用于 2D 数据。

总结:关键要点

数据可视化是预测分析的第一步,因为它能帮助你“访谈”你的数据。遵循数据墨水比克里夫兰感知阶层,你可以确保你的图表不仅美观,而且在数学上是严谨且易于解释的。在 Exam PA 中,请务必解释你为什么选择特定的图表,以及它告诉了你哪些关于业务问题的信息。祝绘图顺利!