欢迎来到数据探索:了解数据的「形态」

你好!在我们深入研究复杂模型和各种华丽的算法之前,必须先从最重要的材料入手:数据 (data)。你可以把数据想象成建筑房屋的材料。你不会用处理木材的工具去处理砖块,对吧?同样地,在 Exam PA 中,你需要辨识不同「类型」的数据,这样才能知道应该使用哪些「工具」(统计方法)。

在本章中,我们将探讨结构化数据 (Structured Data)非结构化数据 (Unstructured Data)。别担心,这些术语听起来可能有点专业——看完这一页,你闭着眼都能分辨出它们的区别!


1. 结构化数据:整齐划一的表格

结构化数据是精算工作的日常,也是最重要的基础。如果你能想象它完美地存在 Excel 电子表格中,且行与列都有明确的标签,那它通常就是结构化数据。

什么是结构化数据的特征?
1. 它有预定义的格式(即「模式/schema」)。
2. 每一列 (column) 代表一个特定的变量(例如年龄、保费或性别)。
3. 每一行 (row) 代表一个独立的观察值(例如特定的保单持有人或单一保险理赔案件)。

真实世界范例:
想象一份汽车保单列表。每一条记录都有「保单号码」、「生效日期」和「车辆品牌」。这些资料是可以预测的,电脑搜索起来非常方便。

比喻:
把结构化数据想象成一个玛芬蛋糕烤盘。你知道每个玛芬应该放在哪里,而且因为烤盘的孔位早已固定,每个玛芬的大小和形状都差不多。

快速回顾:结构化数据的关键特征

• 可轻松储存在关系型数据库 (Relational Databases) (SQL) 中。
• 定量数据(通常是数值或定义明确的类别)。
• 在放入模型前,相较于非结构化数据,所需的「清洗」工作较少。


2. 非结构化数据:信息的「蛮荒西部」

非结构化数据则是其他所有类型的数据。它没有预定义的模式,也没有整齐的表格可供存放。这类数据通常包含大量的文字、图像或音频。

在 Exam PA 的情境中,你可能会遇到调整员写下的理赔备注客户电子邮件这类非结构化数据。由于没有行列之分,电脑无法像读取电子表格那样轻易地「阅读」它们。我们通常需要使用特殊的技术(例如文本挖掘/Text Mining),将这些数据转化为数值后,才能进行建模。

真实世界范例:
医生在医疗档案上的手写笔记。一位医生可能会写「患者有咳嗽症状」,而另一位则可能写「注意:呼吸窘迫」。这里没有固定的「字段」来存放这些信息,它们仅仅是原始文字。

比喻:
把非结构化数据想象成一个装满各种衣物的洗衣篮。衬衫、袜子和帽子全都纠缠在一起。为了厘清它们,你必须先把它门分门别类!

你知道吗?

据估计,现今产生的所有数据中超过 80% 是非结构化数据!虽然精算师传统上使用结构化数据,但「大数据」革命使得非结构化数据在预测欺诈或客户情绪等方面变得越来越重要。


3. 中间地带:半结构化数据

有时候,数据介于两者之间,我们称之为半结构化数据 (Semi-Structured data)。它不存放于整齐的表格中,但具有区分各元素的标签 (tags)标记 (markers)。常见的格式包括 JSONXML 文件(当你从网站抓取数据时可能会看到)。

记忆小撇步:
结构化 = 一堵砖墙(排列完美)。
半结构化 = 一套乐高积木(零件各异,但有「凸点」帮助它们连接在一起)。
非结构化 = 一团黏土(在塑形前没有任何固定形状)。


4. 深入探讨:变量的类型

一旦我们有了结构化数据,我们就需要对变量(字段)进行分类。这在 Exam PA 中是一个非常常见的考点!

A. 数值型 (定量) 变量

这些代表可测量的数量。你可以对它们进行数学运算!我们将其细分为两类:

1. 连续型 (Continuous): 在一定范围内可取任何值(例如 \( X = 152.45 \))。范例:身高、保费、理赔金额。
2. 离散型 (Discrete): 可计数的值,通常是整数。范例:家庭汽车数量、一年内的理赔次数。

B. 分类型 (定性) 变量

这些代表组别或标签。你无法以传统方式计算它们的「平均值」。

1. 名义型 (Nominal): 没有自然顺序的类别。范例:汽车颜色(红色、蓝色、绿色)。红色比蓝色「更高」吗?不,它们只是不同的颜色。
2. 次序型 (Ordinal): 具有明确逻辑顺序的类别。范例:教育程度(高中、学士、硕士、博士)。我们知道硕士比高中「更高」,但我们无法用简单的减法精确说明到底「高出多少」。

常见错误避雷区:

「数字」陷阱:并非使用了数字就代表它是数值型变量!
范例:邮政编码 (90210) 是名义型变量。将两个邮政编码相加没有任何意义——这些数字仅仅是用于定位地点的标签!


逐步指南:如何在 Exam PA 中识别数据类型

当你在考试中看到数据集时,请遵循以下步骤:

步骤 1:观察格式。它是表格形式吗?(如果是,那就是结构化数据)。
步骤 2:观察特定字段。是数字还是文字?
步骤 3:如果是数字,请自问:「计算这栏的平均值有意义吗?」(如果有,则为数值型;如果没有,则可能是分类型/名义型)。
步骤 4:如果是文字/类别,请自问:「有明确的等级或顺序吗?」(如果有,则为次序型;如果没有,则为名义型)。


总结与关键要点

• 结构化数据:以表格(行列)组织。准备好进行分析。
• 非结构化数据:无固定格式(文字、图像)。需要先经过处理。
• 数值型变量:连续型(任何数值)或离散型(计数)。
• 分类型变量:名义型(无顺序)或次序型(有排名)。
• 关键点:识别数据类型是数据探索的第一步,因为它决定了你将使用哪种图表(例如:你会对数值型数据使用直方图,而对分类型数据使用条形图)。

别担心这看起来是否太过于基础——掌握这些定义可以确保你在考试遇到复杂问题时,不会在基础题上丢分!继续加油!