欢迎来到不完整数据的世界!
你好!在准备 Exam FAM 的过程中,你大概已经熟练掌握了针对完美、完整数据集的最大似然估计法 (Maximum Likelihood Estimation, MLE)。但在现实的保险世界中,数据往往并不完美。有时候我们只知道损失“至少”达到某个数额,或者如果损失低于免赔额(deductible),我们甚至根本看不到这笔损失。
在本章中,我们将学习如何调整我们的 MLE“食谱”,以处理设限 (Censored) 和截断 (Truncated) 数据。如果这些术语听起来有点技术性,别担心——我们会用简单的类比来拆解它们,让你能够自信地应对这些考题!
1. 理解术语:设限 vs. 截断
在我们探讨数学原理之前,必须先了解数据发生了什么事。只要你能辨别数据的类型,公式就很容易套用!
设限 (Censoring):“我知道你在那里,但我不知道你确切有多大。”
在保险业中,右设限 (Right-Censoring) 是最常见的类型。这通常是由保单限额 (Policy limit) 造成的。
例子: 一份保单的限额为 $10,000。一场大火造成了 $50,000 的损失。保险公司只会将其记录为 $10,000 的索赔。我们知道实际损失至少是 $10,000,但我们不知道最终的确切数字。
截断 (Truncation):“如果你不够大,我甚至不知道你的存在。”
在保险业中,左截断 (Left-Truncation) 因免赔额 (Deductibles) 而常见。
例子: 一份保单有 $500 的免赔额。如果投保人只有 $300 的损失,他们不会提出索赔。保险公司完全不会收到消息。我们的数据只包含那些“超过”$500 门槛的人。我们遗漏了分布中底部的所有数据。
快速复习箱:
- 设限 (Censored): 你有一个数据点,但其数值被限制或封顶了。
- 截断 (Truncated): 某些数据点因低于(或高于)特定数值而完全缺失。
2. 似然函数 (Likelihood Function) 的“积木”
要找到 MLE,我们需要建立一个似然函数 (Likelihood Function),\(L(\theta)\)。你可以把它想象成一个“概率乘积”,每一笔数据都为整体贡献了一些信息。
情况 A:精确观测值
如果我们知道确切数值 \(x\),其贡献就是概率密度函数 (pdf):
贡献 = \(f(x)\)
情况 B:在 \(u\) 点右设限
如果我们只知道数值至少为 \(u\),我们就使用生存函数 (survival function)。为什么呢?因为生存函数 \(S(u)\) 代表大于 \(u\) 的概率。
贡献 = \(S(u) = 1 - F(u)\)
情况 C:在 \(d\) 点左截断
这是最棘手的部分。因为我们只在数据已知大于 \(d\) 的前提下才能观察到它,所以必须使用条件概率。我们将通常的贡献值除以 \(S(d)\)。
贡献 = \(\frac{\text{f(x) or S(u)}}{S(d)}\)
3. 组合起来:一般似然公式
如果我们有一组精确值 (\(x_i\)) 和设限值 (\(u_j\)) 的组合,且全部受到一个截断点 (\(d\)) 的影响,似然函数看起来会像这样:
\(L(\theta) = \prod_{i=1}^{n} \frac{f(x_i)}{S(d)} \times \prod_{j=1}^{m} \frac{S(u_j)}{S(d)}\)
等等!别慌! 如果没有截断,\(d = 0\),而因为 \(S(0) = 1\),分母就会消失。大多数考题一次只会包含其中一两个元素。
你知道吗?
学生最常犯的错误是在有免赔额时忘记除以 \(S(d)\)。请随时问自己:“是否存在一个数值,低于该数值我就完全看不到这些索赔?”如果有,那就是截断!
4. 求解 MLE 问题的逐步指南
请按照以下步骤操作,以避免迷失在代数运算中:
步骤 1:识别组件。
列出你的精确值 (\(x\))、设限值 (\(u\)) 以及截断点 (\(d\))。
步骤 2:写出似然函数 \(L(\theta)\)。
将你的数值代入该分布(如指数分布或帕累托分布)的 \(f(x)\) 和 \(S(x)\) 公式中。
步骤 3:取自然对数得到对数似然函数 \(l(\theta)\)。
处理加法比处理乘法容易得多。记得:\(\ln(a \times b) = \ln(a) + \ln(b)\) 以及 \(\ln(a/b) = \ln(a) - \ln(b)\)。
步骤 4:对 \(\theta\) 求导数。
令导数等于零:\(\frac{d}{d\theta} l(\theta) = 0\)。
步骤 5:解出 \(\theta\)。
这就是你的最大似然估计值!
5. 现实世界类比:“约会软件”模型
想像你正在研究约会软件上人们的身高,以找出平均身高 (\(\theta\))。
- 精确数据: 人们明确标示身高为 5 呎 10 吋。(使用 \(f(x)\))
- 设限数据: 人们只勾选“6 呎以上”的选项。你不知道他们是 6 呎 1 吋还是 7 呎。(使用 \(S(6)\))
- 截断数据: 该应用程序设有过滤器,身高未满 5 呎的人不准注册。你在数据集中根本看不到他们!(将所有人除以 \(S(5)\))
6. 应避免的常见陷阱
1. 混淆 \(f(x)\) 和 \(F(x)\): 记住,精确点使用 pdf (\(f\)),而设限点(范围)使用生存函数 (\(S = 1-F\))。
2. 忘记“n”: 当对像 \(\prod S(d)\) 这样的乘积取对数时,它会变成 \(n \ln S(d)\)。千万别漏掉这个 \(n\)!
3. 指数分布捷径: 对于参数为 \(\theta\)(平均值)的指数分布,MLE 通常就等于(超过免赔额的平均超额损失)。留意这些模式可以节省时间!
重点摘要
1. 精确值贡献 \(f(x)\) 到似然函数中。
2. 右设限值(如保单限额)贡献 \(S(u)\)。
3. 左截断值(如免赔额)需要除以 \(S(d)\)。
4. 目标: 最大化总乘积的对数,以找到最佳参数 \(\theta\)。
你做得很好!MLE 结合不完整数据是 FAM 中较“硬核”的主题之一,但一旦你识别出 \(f(x)\)、\(S(u)\) 和 \(S(d)\) 的模式,这就变成了一个简单的组装游戏。继续练习!