欢迎来到“似然”的世界!

你好,未来的精算师!欢迎来到 ASTAM 学习旅程中最重要的章节之一:最大似然估计 (Maximum Likelihood Estimation, MLE)。如果你曾好奇保险公司是如何为其模型决定具体的“数字”(参数)——例如平均索赔额或意外发生的频率——那你现在找对地方了。

将 MLE 想象成一位侦探。你手头上有线索(数据),而你想找出造成这些线索出现的“头号嫌疑犯”(参数)。这是参数估计的“黄金标准”,因为它具备非常强大的数学特性,能确保我们模型的可靠性。如果起初觉得内容有点深奥,别担心,我们会一步步拆解!

1. 核心概念:什么是似然?

在日常用语中,“似然”(Likelihood) 和“概率”(Probability) 的意思差不多。但在精算学中,两者有细微的差别:
概率 (Probability):当我们知道参数,想预测数据时使用。
似然 (Likelihood):当我们拥有数据,想推测参数时使用。

似然函数 (Likelihood Function),记作 \(L(\theta)\),代表在给定特定参数 \(\theta\) 的情况下,观察到现有数据的概率。我们的目标是找到让观察数据成为最可能结果的 \(\theta\) 值。我们将此估计值称为 \(\hat{\theta}\)(读作 "theta-hat")。

为什么要取自然对数?

在大多数问题中,似然函数是一连串概率的巨大乘积。将几十个小数相乘简直是场噩梦!为了让计算更轻松,我们取自然对数得到对数似然函数 (Log-likelihood),记作 \(l(\theta)\) 或 \(\ln L(\theta)\)。
你知道吗? 因为对数是一个“递增函数”,使对数似然函数最大化的 \(\theta\) 值,与使原始似然函数最大化的值完全相同。这将乘法转化为加法,让微积分计算变得友善多了!

2. 个别损失严重程度 (Severity) 的 MLE

我们先从严重程度 (Severity)(索赔金额的大小)开始。假设我们有一组独立的索赔观察值 \(x_1, x_2, ..., x_n\)。

基本情况:
如果我们有一组完整的数据,没有免赔额 (deductible) 或赔偿上限 (limit),似然函数就是每个观察值的概率密度函数 (PDF) 的乘积:
\(L(\theta) = \prod_{i=1}^{n} f(x_i; \theta)\)

精算现实:截断 (Truncation) 与设限 (Censoring)
在 ASTAM 的现实世界中,我们很少见到“纯粹”的数据。我们需要处理免赔额 (d)保单限额 (u)。这会改变我们编写似然函数的方式!

左截断 (Left Truncation,即免赔额): 如果索赔只有在超过免赔额 \(d\) 时才会被记录,我们处理的是条件概率。该观察值 \(x\) 对似然函数的贡献为:\(\frac{f(x)}{S(d)}\)。
右设限 (Right Censoring,即赔偿上限): 如果索赔被限制在上限 \(u\),我们不知道确切价值——只知道它“至少是 \(u\)”。对于被设限的索赔,其对似然函数的贡献为:\(S(u)\)。

严重程度 MLE 的步骤:

1. 构建似然函数:对于每个数据点,判断它是具体数值 \(f(x)\) 还是设限数值 \(S(u)\),必要时除以免赔额的生存函数 \(/ S(d)\)。
2. 取对数:对整个表达式取 \(\ln\)。
3. 求导:对 \(\theta\) 进行求导。
4. 求解零点:令导数等于零并解出 \(\hat{\theta}\)。
5. 验证:(理论上) 检查二阶导数以确保其为最大值,但在考试中,第一次解出的答案通常就是你需要的。

重点提示: 对于严重程度,记住:“精确值用 PDF,设限值用生存函数 (Survival),截断数据除以免赔额的生存函数。”

3. 频率数据 (Frequency Data) 的 MLE

频率是指发生了多少次索赔。在这里,我们的数据点 \(n_i\) 是计数(0, 1, 2...)。

如果我们观察到 \(k\) 次索赔 \(n_1, n_2, ..., n_k\),似然函数就是概率质量函数 (PMF) 的乘积:
\(L(\theta) = \prod_{i=1}^{k} P(N = n_i; \theta)\)

通常,频率数据会以表格形式给出(例如:“有 50 张保单索赔 0 次,30 张保单索赔 1 次...”)。在这种情况下,请将计数作为指数:
\(L(\theta) = [P(N=0)]^{50} \times [P(N=1)]^{30} ...\)

常用的频率捷径:

对于某些分布,你甚至不需要微积分!MLE 的结果非常直观:
泊松分布 (Poisson): \(\hat{\lambda}\) 就是样本均值 (\(\bar{x}\))。
二项分布 (Binomial): \(\hat{q}\) 是样本均值除以 \(m\)。
负二项分布 (Negative Binomial): 如果 \(r\) 是固定的,则 \(\hat{\beta} = \bar{x} / r\)。

快速回顾框:
• 严重程度 = 连续型(使用 \(f(x)\) 和 \(S(x)\))
• 频率 = 离散型(使用 \(p_k\))
• 对数是你的好朋友!

4. 最大似然估计量的特性

为什么精算师这么爱用 MLE?因为当样本量 \(n\) 变得足够大时,MLE 就会成为“完美的估计量”。以下是你必须知道的三个“A”特性:

1. 渐近无偏性 (Asymptotic Unbiasedness): 当你获得更多数据时,估计量 \(\hat{\theta}\) 的平均值会精确地命中真实值。
2. 渐近正态性 (Asymptotic Normality): 对于大样本,\(\hat{\theta}\) 的分布看起来像钟形曲线(正态分布)。这对于建立置信区间非常有用!
3. 渐近有效性 (Asymptotic Efficiency): 在所有“良好”的估计量中,MLE 具有最小的方差。它是我们工具箱中最“精确”的工具。

计算 MLE 的方差

为了了解我们的估计值可能会有多大的“波动”,我们使用信息矩阵 (Information Matrix)(或费雪信息 Fisher Information)。
\(\hat{\theta}\) 的方差大约为:
\(Var(\hat{\theta}) \approx \frac{1}{-E[l''(\theta)]}\) 或在考试中更常见的形式:\(\frac{1}{-l''(\hat{\theta})}\)

记忆辅助: 将二阶导数 (\(l''\)) 想象成“曲率”。如果对数似然曲线非常尖锐(曲率高),我们对估计值就非常有信心,因此方差很小!

5. 分组数据 (「桶」问题)

有时,我们不知道确切的索赔金额,只知道有多少索赔落入某些“桶”中(例如,10 笔索赔金额在 $0 到 $1,000 之间)。
对于边界 \(c_{j-1}\) 和 \(c_j\) 之间有 \(n_j\) 个观察值的组,其对似然函数的贡献为:
\([F(c_j) - F(c_{j-1})]^{n_j}\)

常见错误: 对于分组数据,千万不要用 PDF \(f(x)\)!因为你没有具体的 \(x\)。你必须使用累积分布函数 (CDF) 的差值。

6. 总结与最后的建议

保持条理: MLE 问题可能很冗长。在进行对数转换前,请先清晰地写出你的 PDF 或 PMF。
留意免赔额: 如果数据是“按赔付金额 (per payment)”计算的,你通常需要除以 \(S(d)\)。如果是“按损失金额 (per loss)”且只知道超过 \(d\) 的损失,逻辑亦同。
练习求导: 许多 ASTAM 学生失分不是因为精算概念,而是基本的微积分错误。温习一下 \(\frac{d}{dx} \ln(u) = \frac{1}{u} u'\) 这个公式。
检查分布类型: 是 Gamma 分布?Pareto 分布?还是指数分布?每一种都有自己的捷径或特定的 PDF。随时准备好你的 ASTAM 表格!

考试重点: MLE 的本质是找到一个参数,使得观察到的现实成为最可能的结果。无论是频率还是严重程度,模式永远是:似然 \(\rightarrow\) 对数 \(\rightarrow\) 求导 \(\rightarrow\) 零。 你做得到的!