欢迎来到“数据侦探”阶段!
在 CP2(建模实践)中,你经常会面对一大堆杂乱无章的原始数据。在开始构建复杂的公式或模型之前,你必须精确地了解你正在处理的内容。你可以将这一章想象成与数据的“初次见面与交流”。
总结数据的目的是将成千上万行的数字转化为几个关键的洞察。这很重要,因为它能帮助你发现错误、识别趋势,并决定哪种建模方法最合适。如果你的数据是“垃圾”,那么你的模型也会是“垃圾”(这就是著名的 GIGO 原则:Garbage In, Garbage Out,垃圾进,垃圾出!)。
别担心如果你不是统计天才——我们将把它拆解成简单、易于管理的步骤,帮助你在考试中取得好成绩。
1. 描述性统计:“三大”衡量指标
当我们观察一栏数据时,我们想知道“中间”在哪里。我们称之为集中趋势(Central Tendency)。以下是我们衡量它的三种方法:
A. 平均数 (Mean)
即所有数值的总和除以数值的个数。
公式: \( \bar{x} = \frac{\sum x_i}{n} \)
何时使用:当数据呈对称分布(分布均匀)时使用。
陷阱:平均数对离群值(outliers,极值)非常敏感。例如,如果有五个人每人赚 20,000 美元,而一个人赚 1,000,000 美元,即便这个“平均值”并不能代表大多数人,但它看起来会非常高。
B. 中位数 (Median,中间值)
当你将所有数值按从小到大排列时,位于中间的数值。
何时使用:当你的数据呈偏态(skewed)或存在极端离群值(如房价或薪酬)时使用。在这些情况下,它比平均数更能反映“典型”数值。
C. 众数 (Mode,最常见值)
出现频率最高的数值。
何时使用:非常适合用于分类数据(categorical data)(例如:“哪种索赔类型最常见?”)。
快速回顾箱:
• 平均数:对极值敏感。
• 中位数:对极值具有稳健性(Robust)。
• 众数:适合分类数据。
2. 衡量“离散度”:数据有多乱?
单知道平均数是不够的。想象一条平均深度为 4 英尺的河流——如果某个部分有 10 英尺深,你还是可能会溺水!我们需要了解数据的离散程度(dispersion)。
标准差 (Standard Deviation) 与 方差 (Variance)
它们告诉我们数据点平均距离平均值有多远。
标准差公式: \( \sigma = \sqrt{\frac{\sum(x_i - \bar{x})^2}{n}} \)
简单类比:如果班上每个人的考试成绩都是 70%,标准差就是零。如果一半人考 40%,一半人考 100%,平均分仍然是 70%,但标准差会非常高!
全距 (Range) 与 四分位距 (IQR)
• 全距:最大值与最小值之间的差。很简单,但容易受到单一离群值的严重影响。
• 四分位距 (IQR):第 75 百分位数(上四分位数)与第 25 百分位数(下四分位数)之差。它告诉你数据中中间 50% 的分布范围。
你知道吗? 在 CP2 中,计算这些统计数据通常是数据验证(Data Validation)的第一步。如果你的“最小年龄”是 -5 或“最大年龄”是 250,那你已经发现数据错误了!
3. 图形化呈现:可视化数据的故事
有时候,一张图表胜过 Excel 中的一千行数据。在 CP2 中,你必须为正确的目的选择正确的图表。
直方图 (Histograms)
它是什么:一种条形图,x 轴代表数值的范围(组距)。
目的:观察数据的分布(distribution)形状。它是钟形(正态分布),还是向一侧倾斜(偏态)?
盒须图 (Box Plots / Box and Whisker)
它是什么:一个显示 IQR 的盒子,中间有一条代表中位数的线,而“须”则显示数据的范围。
目的:非常适合发现离群值并并排比较不同的组别。
散点图 (Scatter Plots)
它是什么:在 X 和 Y 轴上的点。
目的:查看两个变量之间是否存在相关性(correlation)。例如:“索赔金额是否会随着司机年龄的增加而增加?”
折线图 (Line Graphs)
它是什么:由线连接的数据点。
目的:最适合时间序列(Time Series)数据。用它来显示数值随月份或年份的变化情况。
关键要点:不要仅仅因为图表看起来好看就使用它。在你的 CP2 总结文件中,你必须解释为什么选择该图表以及它显示了什么(例如:“散点图显示体重与成本之间存在微弱的正相关性”)。
4. 数据合理性与质量检查
这是“数据准备与分析”部分的核心。你必须向考官证明你已经检查过数据是否合理。
常见的检查项目:
1. 完整性 (Completeness):是否有空白单元格或“N/A”值?
2. 唯一性 (Uniqueness):是否有重复的记录(例如:相同的保单号码出现两次)?
3. 范围检查 (Range Checks):日期是否出现了不该出现的过去或未来时间?数值是否本应为正数却出现了负数?
4. 一致性 (Consistency):如果一张保单被标记为“已失效 (Lapsed)”,那么“已收保费”一栏是否为零?
数据质量记忆法:尝试 "ACCURATE"
• Accurate(准确)
• Complete(完整)
• Consistent(一致)
• Up-to-date(最新)
• Relevant(相关)
• Authoritative(权威)
• Timely(及时)
• Extended(易于理解)
5. 避免常见错误
• 忽略“零”:有时“0”意味着“未收集数据”,有时则真正代表“零”。未经检查,切勿将它们混为一谈!
• 过度简化:如果你只看平均数,你可能会忽略数据被分为两个截然不同组别的事实(双峰分布)。
• 糟糕的组距划分:在直方图中,如果组距太宽,你会丢失细节;如果太窄,图表看起来就会乱成一团。
• 未加标签:在 CP2 中,没有标题和轴标签的图表会让你轻易丢失分数。
总结:CP2 工作流程
1. 清理 (Clean):找出空白处和错误。
2. 计算 (Calculate):获得平均数、中位数、标准差和全距。
3. 可视化 (Visualise):制作直方图或盒须图以查看分布形状。
4. 验证 (Verify):问自己:“这些数据对于精算模型来说是否合理?”
5. 记录 (Document):写下你的发现。如果你删除了 10 行错误数据,你必须在你的审计追踪(audit trail)中说明!
如果这在你开始“建模”之前看起来像繁重的工作,别担心。理解数据是 CP2 战斗中 50% 的部分。一旦你了解了数据,写公式就会变得容易得多!