简介:贝叶斯可信区间地图

欢迎来到这里!在你的贝叶斯统计旅程中,你已经学会如何结合既有认知(先验分布 Prior)与新数据(概似函数 Likelihood),从而得出对世界的更新观点(后验分布 Posterior)。但一旦你拥有了这个后验分布,你该如何利用它来进行决策或给出估计呢?

在本章中,我们将探讨可信区间(Credible Intervals)。你可以把它想象成你在频率学派(Frequentist statistics)统计中见过的“置信区间(Confidence Intervals)”的贝叶斯版本。然而,正如你即将看到的,贝叶斯区间在解释上通常直观得多,也更“友好”。如果初看数学算式觉得有点吃力,请别担心——我们会一步步为你拆解!

1. 什么是可信区间?

可信区间是指在已知观测数据的情况下,未知参数(我们称之为 \( \theta \))以特定概率落入的数值范围。

如果我们计算出索赔频率 \( \lambda \) 的 95% 可信区间为 [0.02, 0.08],我们可以直接说:“\( \lambda \) 的真实值有 95% 的概率介于 0.02 到 0.08 之间。”

等等,这不就是置信区间吗?
事实上,并非如此!在频率学派统计(置信区间)中,参数是固定的,而区间本身是随机的。你必须说:“在 95% 的重复抽样中,这个区间将包含真实参数。”
在贝叶斯统计中,参数是随机的,而数据是固定的。这让我们可以直接针对参数本身进行概率陈述。对大多数人来说,这理解起来自然得多!

重点总结:

\( \theta \) 的 \( 100(1-\alpha)\% \) 贝叶斯可信区间是指任何满足以下条件的区间 \((a, b)\):
\( P(a < \theta < b | \text{data}) = 1 - \alpha \)

2. “简单情况”:中央可信区间

虽然选取区间的方法有很多种(因为许多不同的范围累加起来都可以达到 95%),但 IFoA 课程主要关注中央可信区间(Central Credible Intervals)(也称为等尾区间)。

要找到 \( 100(1-\alpha)\% \) 的中央可信区间,我们只需将“剩余”的概率 (\( \alpha \)) 一分为二,各占 \( \alpha/2 \),分别放在左尾和右尾。

步骤流程:
1. 找出你参数的后验分布(例如:它是正态分布?Gamma 分布?还是 Beta 分布?)。
2. 确定你想要的总概率(例如:95%,所以 \( \alpha = 0.05 \))。
3. 找到 \( \alpha/2 \) 分位数(下界,\( a \))。
4. 找到 \( 1 - \alpha/2 \) 分位数(上界,\( b \))。

例子:对于 95% 的区间,你需要找出后验分布的第 2.5 百分位数和第 97.5 百分位数。

3. 使用正态分布

最常见的“简单情况”涉及正态后验分布。由于正态分布是对称的,找到区间非常直接。

如果 \( \theta \) 的后验分布为 \( N(\mu_{post}, \sigma^2_{post}) \),则 \( 100(1-\alpha)\% \) 的可信区间为:
\( (\mu_{post} - z_{\alpha/2} \cdot \sigma_{post}, \mu_{post} + z_{\alpha/2} \cdot \sigma_{post}) \)

你知道吗?
对于 95% 的区间,\( z_{\alpha/2} \) 是 1.96。对于 90% 的区间,它是 1.6449。你可以在你的公式与统计表(Gold Book)中找到这些数值!

例子示范:
想象你计算出未知平均损失 \( \mu \) 的后验分布为 \( N(500, 100) \)。请注意,方差为 100,因此标准差为 10。
要找到 95% 的可信区间:
下界:\( 500 - (1.96 \times 10) = 480.4 \)
上界:\( 500 + (1.96 \times 10) = 519.6 \)
解读:真实平均损失有 95% 的概率介于 480.4 和 519.6 之间。

4. 其他分布(Gamma 与 Beta)

有时你的后验分布不是正态分布。例如:
- 如果你使用泊松 (Poisson) 概似函数和Gamma 先验,你的后验分布为Gamma
- 如果你使用二项式 (Binomial) 概似函数和Beta 先验,你的后验分布为Beta

在这些情况下,你不能直接使用“加减”捷径,因为这些分布通常不对称。相反,你必须使用统计表或分布的性质,找到累积分布函数 (CDF) 等于 \( \alpha/2 \) 和 \( 1 - \alpha/2 \) 的点。

Gamma 分布的小撇步:
IFoA 的统计表提供了 \( \chi^2 \)(卡方)分布的值。请记住,Gamma 分布可以转换为卡方分布!
如果 \( \theta \sim Gamma(\alpha, \lambda) \),那么 \( 2\lambda\theta \sim \chi^2_{2\alpha} \)。这在考试中简直是救命稻草!

快速复习:

- 先验分布 (Prior):我们在看到数据前的想法。
- 后验分布 (Posterior):我们在看到数据后更新的信念。
- 可信区间 (Credible Interval):后验分布得出的数值范围,以特定概率包含该参数。

5. 需避开的常见陷阱

1. 使用了先验分布:学生常会不小心使用先验参数而不是后验参数来计算区间。务必检查你的作业!区间应该基于你“更新后”的知识。
2. 混淆方差与标准差:在正态分布公式中,记得要使用标准差 (\( \sigma \)),而不是方差 (\( \sigma^2 \))。
3. 使用频率学派的语言:在书面回答时要小心措辞。不要说“95% 的样本...”,而要说“参数落在此范围内的概率为 95%”。

考试成功步骤总结

1. 识别概似函数和先验分布,以确定后验分布及其参数。
2. 决定显著性水平 \( \alpha \)(例如:对于 90% 可信区间,\( \alpha = 0.10 \))。
3. 找到数值 \( a \) 和 \( b \),使得 \( a \) 左侧的面积为 \( \alpha/2 \),而 \( b \) 右侧的面积为 \( \alpha/2 \)。
4. 清晰地将区间表达为 \( (a, b) \),并在被要求时提供简短的解读。

如果起初觉得这些很棘手,别担心!一旦你识别出你正在处理的分布,数学计算通常只是简单的代数运算。练习先找出后验参数,区间计算自然会迎刃而解。