欢迎来到数据侦探工作坊!
你好!准备 ATPA 考试感觉就像跑马拉松,但今天我们要专注于一项关键技能:检测偏差(Detecting Biases)。在预测分析的世界里,模型的质量取决于你输入的数据。把准备数据想象成准备一顿大餐——如果你一开始用的食材就不新鲜,再厉害的厨艺(或复杂的算法)也无法让料理变美味!
在本章中,我们将学习如何找出“变质”的数据,确保我们的模型既公平、准确又可靠。如果一开始觉得这些概念很抽象也不用担心,我们会将其拆解成简单易懂的步骤。
1. 数据准备中的偏差是什么?
在日常生活中,“偏差”通常指个人偏见。但在预测分析中,偏差(Bias)是一种系统性误差,导致对群体的呈现不公平或不正确。当我们处理数据(清理、合并或转换)时,可能会无意中引入这些误差。
为什么会这样?
通常偏差并非蓄意造成。它源于数据收集的方式、我们处理“混乱”数值的方法,甚至是数据本身所记录的历史已经包含了人类的偏见。
2. 选择偏差(Selection Bias):谁被遗漏了?
选择偏差是指用来训练模型的数据,无法准确代表模型未来将要应用的实际群体或事物。
经典例子:生存者偏差(Survival Bias)
想象你是一位精算师,正在分析人寿保险保单。如果你只分析“有效”保单,而忽略了过去“已取消”或“失效”的保单,你的模型将会偏向“生存者”。这样一来,模型将无法理解为什么客户会离开,导致针对客户留存率的预测大错特错!
常见的选择偏差类型:
• 抽样偏差(Sampling Bias):群体中某些成员被纳入的概率比其他人高。
• 流失偏差(Attrition Bias):参与者随着时间推移退出研究(这在长期保险数据中很常见)。
• 自我选择偏差(Self-Selection Bias):人们自行决定是否参与(例如自愿参与的客户问卷调查)。
快速检视:为了避免选择偏差,请务必问自己:“我所观察的群体,在某个本质上是否与我想要预测的目标群体有所不同?”
3. 数据泄露(Data Leakage):偷看答案卷
数据泄露可能是 ATPA 考试中最常见的错误。当来自“未来”的信息(即目标变量)不小心混入你的训练数据时,就会发生这种情况。
比喻:
想象你参加一场数学考试,考卷背面用浅铅笔写着答案。你可能拿到了 A+,但你实际上并没有学会数学。如果模型发生“泄露”,它在训练阶段看起来会异常精准,但在现实世界中却会惨败。
数据准备过程中如何发生泄露:
1. 包含未来变量:例如,使用“已支付理赔总额”来预测“高风险驾驶”。但在年度结束前,你根本不会知道理赔总额!
2. 不当的缩放(Scaling):在将数据拆分为“训练集”和“测试集”之前,就计算整个数据集的“平均值”并用它来填补遗漏值。
重点总结:
务必在执行计算(如平均值、中位数或缩放)之前将数据拆分为训练集和测试集。这能确保你的模型不会“偷看”到测试数据。
4. 处理遗漏值带来的偏差
数据几乎永远不完美。通常会有缺失(遗漏值),而你填补这些缺失的方式可能会引入偏差。
常见错误:
• 删除包含遗漏值的列:如果高收入人士较不愿意回报薪资,而你删除了这些列,你的模型会以为所有人其实都更穷。
• 平均值填补(Mean Imputation):用平均值替换每个遗漏值。这会人为地降低数据的变异数(Variance,即散布程度),使你的模型变得过度自信。
记忆辅助:M.A.R. 与 M.N.A.R.
• 随机遗漏(Missing At Random, MAR):数据的缺失与我们拥有的其他数据相关(例如:年轻人较不常填写健康问卷)。这种情况通常可以修正。
• 非随机遗漏(Missing Not At Random, MNAR):数据的缺失与数值本身有关(例如:患有特定疾病的人隐瞒病情)。这非常难以修正,且通常会引入遗漏偏差(Omission Bias)。
5. 代理偏差(Proxy Bias):隐藏的影响因子
即使你移除了“受保护”或“敏感”变量(如种族或性别)以确保公平,但如果包含了代理变量(Proxy Variable),模型依然可能带有偏差。
什么是代理变量?
代理变量是与敏感属性高度相关的变量。
例子:在模型中使用“邮政编码”,由于历史住房格局的影响,它可能成为“社会经济地位”或“种族”的代理变量。如果你的模型使用邮政编码来拒绝承保,这可能在无意中造成歧视。
你知道吗?
在精算实务中,检测代理偏差对专业精神(Professionalism)和道德(Ethics)至关重要。监管机构常会密切检视“中立”变量是否实际上成为了不公平歧视的代理工具。
6. 测量偏差(Measurement Bias)
当我们测量数据的方式不一致或有瑕疵时就会发生。
• 舍入误差:如果一个办公室将理赔金额舍入到最近的 1,000 元,而另一个办公室舍入到最近的 1 元,我们的数据就会出现“凹凸不平”的现象。
• 测量代理:使用“医生就诊次数”作为“生病程度”的代理。这是带有偏差的,因为它同时也衡量了“获取医疗资源的机会”——一个非常病重的人,如果负担不起医疗费用,可能一次医生都没看果。
7. 总结与快速检查
如何检测偏差(步骤说明):
1. 探索性数据分析(EDA):寻找异常规律。是否有数据空缺?分布情况是否符合预期?
2. 检查相关性:是否有任何变量与目标变量呈现可疑的相关性?(潜在泄露)。
3. 子群体分析:测试模型在不同群体上的表现。它对男性的表现是否比女性好?对某个地区是否比另一个地区好?如果是,那就存在偏差。
4. 检视来源:询问数据是如何收集的。它是自愿性问卷吗?(潜在选择偏差)。
考试重点总结:
• 选择偏差 = 样本不具代表性。
• 数据泄露 = 偷看了未来/目标值。
• 代理偏差 = 隐藏的敏感变量。
• 填补(Imputation) = 小心填补缺失值,避免扭曲事实。
记住:“干净”的数据集并不等同于“正确”的数据集。时刻保持怀疑,并多留意数据中“没有告诉你”的部分!