欢迎来到最大概似估计 (MLE) 的世界!
各位准精算师你们好!今天,我们将深入探讨精算师工具箱中最重要的工具之一:最大概似估计 (Maximum Likelihood Estimation, MLE)。虽然这个名字听起来有点吓人,但它的概念其实非常直观。在本章中,我们将聚焦于完整且独立的样本数据 (complete, individual data)。这意味着我们拥有样本中每一个数据点的清晰、准确列表——没有缺失信息、没有“大于”某个数值的数据,也没有分组区间。
你可以把 MLE 想象成一位侦探。你手头上有“线索”(你的数据),而你正试图找出哪一个“故事”(参数 \(\theta\))能让这些线索看起来最合理。让我们开始吧!
1. 什么是最大概似估计?
想象你有一个装满红色和蓝色弹珠的袋子,但你不知道红色弹珠的比例(\(\theta\))是多少。你随机抽出了 10 颗弹珠,发现其中 9 颗是红色的。你会猜袋子里只有 10% 是红色的吗?大概不会吧!你应该会猜一个较高的比例,因为这样才能使“抽到 9 颗红弹珠”的结果变得最有可能发生。这正是 MLE 在数学上的运作方式。
核心概念:概似函数 (Likelihood Function),记作 \(L(\theta)\),表示在给定某个参数值的情况下,观测到你手中特定数据的概率(或概率密度)。
为什么要用它?精算师使用 MLE 来估计损失分布的参数(例如平均索赔额),这样我们才能准确地为保单定价。
2. 个体数据的概似函数
当我们有完整、个体的数据时,我们拥有一组观测值:\(x_1, x_2, ..., x_n\)。由于这些观测值是独立的,同时观察到所有这些数据的概率就是它们各自概率的乘积。
如果分布是连续型的,我们使用概率密度函数 (PDF),即 \(f(x)\):
\(L(\theta) = f(x_1; \theta) \cdot f(x_2; \theta) \cdot ... \cdot f(x_n; \theta) = \prod_{i=1}^{n} f(x_i; \theta)\)
如果分布是离散型的,我们使用概率质量函数 (PMF),即 \(p(x)\):
\(L(\theta) = p(x_1; \theta) \cdot p(x_2; \theta) \cdot ... \cdot p(x_n; \theta) = \prod_{i=1}^{n} p(x_i; \theta)\)
快速回顾:目标
我们希望找到能使 \(L(\theta)\) 最大化的 \(\theta\) 值。在微积分中,这通常意味着对函数进行求导并将其设为零。
3. “对数概似”的捷径
处理乘积(乘法)很麻烦,特别是当你必须使用乘积法则 (product rule) 来进行微分时。为了让生活更轻松,我们使用一个数学技巧:自然对数 (Natural Logarithm)。
由于对数函数是“单调递增”的,使 \(L(\theta)\) 最大的 \(\theta\) 值,同样也会使对数概似函数 (Log-Likelihood Function)(记作 \(l(\theta)\))最大化。
该技巧:
\(l(\theta) = \ln[L(\theta)] = \ln[f(x_1) \cdot f(x_2) \cdot ... \cdot f(x_n)]\)
利用对数规则,乘积的对数会变成对数的和:
\(l(\theta) = \sum_{i=1}^{n} \ln f(x_i; \theta)\)
记忆小贴士:“对数将乘法变为加法。”对相加的项进行微分比对相乘的项容易得多!
4. 分步骤:如何计算 MLE
如果一开始觉得很棘手,别担心!每次只要遵循这五个步骤即可:
第一步:写出单个观测值 \(x_i\) 的 PDF 或 PMF。
第二步:将所有的 PDF 相乘,建立概似函数 \(L(\theta)\)。
第三步:取自然对数得到对数概似函数 \(l(\theta)\)。利用对数规则尽可能简化它!
第四步:对 \(l(\theta)\) 关于 \(\theta\) 进行微分。
第五步:将导数设为零并求解 \(\theta\)。所得结果就是你的最大概似估计量,通常记作 \(\hat{\theta}\)。
重点总结
如果你在 Exam FAM 考试中看到“估计 (Estimate)”和“MLE”这两个词,你的大脑应该立即反射:概似函数 \(\rightarrow\) 取对数 \(\rightarrow\) 微分 \(\rightarrow\) 设为零。
5. 范例:指数分布
让我们看看考试中的热门考题。假设我们有来自指数分布的索赔额 \(x_1, x_2, ..., x_n\),其平均值为 \(\theta\)。其 PDF 为 \(f(x) = \frac{1}{\theta} e^{-x/\theta}\)。
1. 概似函数: \(L(\theta) = \prod \frac{1}{\theta} e^{-x_i/\theta} = \theta^{-n} e^{-\sum x_i / \theta}\)
2. 对数概似函数: \(l(\theta) = -n \ln(\theta) - \frac{\sum x_i}{\theta}\)
3. 微分: \(\frac{dl}{d\theta} = -\frac{n}{\theta} + \frac{\sum x_i}{\theta^2}\)
4. 设为零: \(0 = -\frac{n}{\theta} + \frac{\sum x_i}{\theta^2} \implies \frac{n}{\theta} = \frac{\sum x_i}{\theta^2}\)
5. 结果: \(\hat{\theta} = \frac{\sum x_i}{n} = \bar{x}\) (即样本平均值!)
你知道吗?对于许多基础分布(如指数分布、泊松分布和正态分布),平均值的 MLE 通常就是数据的算术平均数。
6. 常见的陷阱
即使是成绩最好的学生也常犯这些错误,请务必留意!
1. 使用 CDF 而非 PDF: 对于完整、个体的数据,请务必使用密度函数 \(f(x)\)。只有在处理截断/删失数据 (censored data,我们会在另一章讨论) 时,才会使用 CDF \(F(x)\)。
2. 对数规则错误: 请记住 \(\ln(e^A) = A\) 以及 \(\ln(A^B) = B \ln(A)\)。弄错指数位置是得到错误答案的最快途径。
3. 忘记了 'n': 当你将 \(n\) 个相同的项相乘时,常数部分会变成 \(n\) 次方。在对数概似函数中,这会变成乘以 \(n\)。
4. 多个参数: 如果一个分布有两个参数(例如 Gamma 分布中的 \(\alpha\) 和 \(\theta\)),你必须分别对每个参数进行偏微分,并将它们作为方程组来求解。
7. 总结与快速回顾
为了总结这一章,让我们重温完整、个体数据的精髓:
- 完整数据: 你知道每一个观测值的精确数值。
- 概似函数: \(L(\theta) = \prod f(x_i)\)。
- 对数概似函数: \(l(\theta) = \sum \ln f(x_i)\)。
- “捷径”: 对于指数分布和泊松分布,平均值的 MLE 几乎总是样本平均值 (\(\bar{x}\))。
最后的小提示:多练习代数运算!大多数在 Exam FAM 的 MLE 题目上遇到困难的学生,其实都理解统计学原理,只是被自然对数和微分绊倒了。你可以做到的!