欢迎来到数据清理的世界!
在精算建模的世界里,我们几乎无法获得「完美」的数据。现实中的数据往往杂乱无章、充满缺失,甚至异常怪异。本章重点在于修复损坏或缺失的数据。你可以把自己想象成一名「数据侦探」:你的任务是找出线索、修复错误,并确保你的模型依然可靠。别担心,即使起初看起来有点技术性,在读完这些笔记后,你将掌握一套应对任何数据灾难的清晰工具包!
1. 识别问题:什么是「坏」数据?
在修复数据之前,我们必须先知道问题所在。通常,数据问题可分为两大类:
1. 缺失数据 (Missing Data):本该有数值的地方却是空白(例如:保单持有人年龄缺失)。
2. 损坏或不合理的数据 (Corrupt/Illogical Data):现有的数据明显错误(例如:保单持有人的年龄被记录为 -5 或 250)。
如何发现这些问题:
利用 Excel 中的描述性统计 (Summary Statistics) 或筛选器 (Data Filters) 是发现这些错误的好方法。如果你检查年龄的「最大值」发现是 999,你就知道自己找到了需要修复的预留值(placeholder)!
快速回顾:常见的危险信号 (Red Flags)
• 本应为正数的栏位出现负数(如保费)。
• 未来的日期(如 2050 年的理赔日期)。
• 分类错误(如性别栏出现「男性」、「女性」和「披萨」)。
• 极端离群值(数值过大或过小,以至于扭曲了平均值)。
总结要点:请务必先对数据进行「概览分析」(Profiling)。如果你连漏洞都没发现,就无法进行修复!
2. 三大核心问题
当你发现错误时,必须决定如何处理它。请试着问自己:
1. 问题严重吗?如果 100 万笔记录中只有 1 笔缺失中间名,这可能不重要。但如果你的「保额」栏位中有 10% 缺失,那就是个大问题!
2. 我能找到真实数值吗?你能通过查阅其他数据库或原始纸本档案来核实吗?
3. 我应该修复还是删除?这就是「修复与删除」(Repair vs. Remove) 的决策辩论。
3. 修复方法
如果你决定修复数据,以下是标准的精算技巧:
A. 删除(「最后手段」)
如果一笔记录损坏严重到完全不可信,你可能需要删除整列资料。 例子:一笔人寿保险记录同时缺失了年龄、性别和保额。这笔资料完全无用! 警告:要小心。如果你删除太多记录,可能会引入偏差 (Bias)(例如:如果你只删除了老年人的记录,你的模型会错误地认为所有人都是年轻人)。
B. 平均值/中位数填补 (Mean/Median Imputation)
这意味着用该栏位其余数据的平均值或中位数来填补空白单元格。 类比:如果你正在组织一次团体聚餐,而有人忘记告诉你是他们的预算,你会假设他们的花费与团队的「平均」水平相近。
C. 逻辑预设值 (Logical Defaults)
有时你可以根据其他线索推断出数值。 例子:如果「吸烟状况」栏位空白,但该保单属于「非吸烟者优惠」产品,那么将其设定为「非吸烟者」是合乎逻辑的。
D. 线性插值法 (Linear Interpolation)
如果你有一组数列中间有断层,你可以尝试「桥接」这个缺口。 如果你已知时间 1 的数值为 10,时间 3 的数值为 20,你可以假设时间 2 为 15。 在两个点 \( (x_0, y_0) \) 和 \( (x_1, y_1) \) 之间进行线性插值以求得特定 \( x \) 对应之 \( y \) 的公式为: \( y = y_0 + (x - x_0) \frac{y_1 - y_0}{x_1 - x_0} \)
你知道吗?「插值」(Interpolation) 一词源自拉丁文 inter(在……之间)和 polare(平滑/打磨)。这确实就是在平滑处理中间的空隙!
4. 记录你的变更(审计追踪 Audit Trail)
在 CP2 中,你如何修复数据,通常不如你如何解释它来得重要。你必须保存每一次变更的记录,这称为审计追踪 (Audit Trail)。
数据修复的「黄金法则」:
1. 绝对不要覆盖原始数据:务必保留「原始数据」(Raw Data) 和「已清理数据」(Cleaned Data) 工作表。
2. 标记你的修复:建立一个名为「Repair_Flag」的新栏位。如果你修改了数据就标记为「1」,原始数据则标记为「0」。这有助于你日后追踪修复的影响。
3. 证明你的选择:不要只说「我修复了它」。要说明「我将 5 个缺失年龄替换为中位数 42 岁,以避免缩减样本规模」。
总结要点:模型的品质取决于它的文件记录。如果同事无法精确重现你的「修复过程」,你就没通过审计追踪测试。
5. 应避免的常见错误
• 忽略「零」与「空白」的区别:空白单元格代表「没有数据」,而零是一个特定的数值。除非有充分理由,否则不要将两者混为一谈!
• 修复没坏的东西:有时一个「离群值」实际上是真实且特殊的数据。不要仅因为赔偿额巨大就删除它;那笔理赔可能是你风险分析中最重要的部分!
• 没有检查一致性:如果你将年龄修复为 25 岁,请确保「驾驶经验年数」不是 30 年!
6. M.E.N.D. 记忆口诀
当你发现数据错误时,记得运用 M.E.N.D. 法则:
M (Measure) - 衡量:到底有多少数据缺失或出错?
E (Examine) - 检查:是否有规律?(例如:是否只有女性的年龄缺失?)
N (Note) - 记录:在动手前,先记录下你发现的一切。
D (Decide) - 决定:选择一种修复方法(删除、填补或预设)并解释原因。
最终重点总结
修复数据并非要让数据变得「完美」,而是要让数据适用于预期用途 (fit for purpose)。每一次你修复数据,其实都是在做出一项假设。你在 CP2 中的目标是做出合理的假设,并清晰地传达给读者。你可以做到的!