欢迎来到数据假设的世界!

在你的 CP2 学习之旅中,你很快就会发现现实世界中的数据鲜少是完美的。它们可能杂乱无章、缺失不全,甚至显得怪异。这就是假设(Assumptions)发挥作用的地方。你可以将假设视为一座“桥梁”,连接你所获得的不完美数据与你需要建立的工作模型。在本章中,我们将学习当数据无法提供完整信息时,如何做出明智且专业的选择。

如果起初觉得这有点像是在凭空猜测,不必担心。精算假设并非随意的盲目臆测;它们是基于我们现有信息所作出的合理辩证(reasoned justifications)。读完这份笔记,你将会更有信心处理那些“棘手”的数据!


1. 为什么我们需要做出假设?

当你收到一份 CP2 项目的数据集时,可能会发现其中存在缺漏。也许有些保单持有人忘了填写年龄,或者某一栏数字中出现了明显的输入错误。如果我们直接忽略这些问题,模型可能会崩溃或得出错误的结果。

我们做出假设是为了:
• 填补缺失的信息
• 修正明显的错误(异常值)。
简化复杂的数据,使模型运行更有效率。
• 在无法取得所需特定数据时,建立一个替代指标(proxy)

生活类比:想象你正在按照食谱烤蛋糕,但食谱页面破损,你看不到该用多少糖。根据你烤其他蛋糕的经验,你假设用一杯糖大概就可以了。这正是我们处理数据时所做的事——利用已知的知识来填补空白。


2. 处理缺失数据

缺失数据是最常见的障碍。处理缺失数据主要有两种方法,具体取决于数据缺失的程度。

A. 删除数据(“删除”法)

如果数据缺失的比例极小(例如 10,000 笔纪录中只有 2 笔缺失),最安全的做法可能是直接剔除它们。你假设这几笔纪录不会影响整体的计算结果。

B. 填补数据(“填补”法)

如果缺失的数据量较大,删除它们可能会导致结果产生偏差。此时,你应做出假设来填补空缺。例如:
平均值:如果“投保年龄”缺失,你可以假设该人员为其余群体的平均数(mean)中位数(median)年龄。
谨慎原则(Prudence):在某些情况下,为了安全起见,你可以采取“最坏情况”假设(例如,在寿险模型中,假设缺失吸烟状态的样本为“吸烟者”)。

快速检视:务必问自己——“我的假设会实质性地改变最终答案吗?”如果答案是肯定的,你必须在审计追踪(audit trail)中非常仔细地解释你的选择!


3. 处理异常值与特例

异常值(Outlier)是指那些偏离其他数据太多,看起来明显错误的数据点。例如,你看到某位保单持有人的年龄被标记为 150 岁,或者月缴保费为 \$-5,000。

该如何处理这些数据?
1. 设定上限与下限(Cap and Floor):如果那是保单的限制,你可以假设该年龄实际上为 100 岁(设上限)或 18 岁(设下限)。
2. 修正:如果数值明显是输入错误(例如 202.3 而非 2023),你可以根据周边背景来假设其预期的数值。
3. 删除:如果该数据点在物理上是不可能的,且你无法推断出正确数值,则直接将其排除。

你知道吗?在 CP2 考试中,评分员较不在意你做了什么假设,而更在意你为什么做这个假设。通常没有唯一的“正确”答案,只有“论证充分”的答案。


4. 使用替代指标(Proxies)

有时,你需要的数据根本不存在。在这些情况下,你会使用替代指标(proxy)——一种行为与缺失数据相似的替代方案。

例子:你正在为电动车(EV)进行汽车保险索赔建模,但你只有汽油车的数据。你可以假设电动车驾驶的行为与汽油车驾驶相似,并可能因为电动车零件较昂贵,而将维修成本假设略微调高几个百分点。

记忆法:P.A.R. 原则
做出假设时,检查它是否符合:
Practical(实用性):它能被轻易地建模吗?
Appropriate(适当性):它对于这个特定问题合适吗?
Reasonable(合理性):其他精算师会同意你的看法吗?


5. 审计追踪:记录你的假设

在 CP2 中,如果没有记录下来,就等于没发生过!这是“数据准备与分析”部分最重要的环节。你必须写下你对所提供数据所作出的每一项假设。

文件应包含的内容:
假设内容(例如:“假设缺失的年龄均为 45 岁”)。
假设原因(例如:“45 岁是有效纪录的平均年龄”)。
潜在影响(例如:“由于仅有 1% 的数据缺失,预计对最终保费的影响微乎其微”)。

避免常见错误:不要只写“我假设缺失值为 0”。你必须解释为什么 0 是一个合理的选择。如果不合理,就不要这样做!


总结检查清单

在进入建模阶段前,请确保你已经:
• 识别出所有缺失或不一致的数据点。
• 决定了是否要排除或调整这些数据点。
• 检查了你的假设是否与任务的整体目标保持一致
• 在摘要文件中为每一项假设写下了清晰的论证

关键收获:假设并非“作弊”——它们是使模型运行的必要工具。只需对你的操作保持诚实,并清楚解释你的逻辑即可!