欢迎来到贝叶斯统计 (Bayesian Statistics)!
在目前的 CS1 学习旅程中,大家接触的多半是频率论 (Frequentist) 统计。在那个世界里,我们假设参数(例如平均值 \(\mu\))是一个固定但未知的数值。但今天,我们要踏入贝叶斯统计的世界。在这里,我们将参数视为随机变量 (random variables)。这意味着在我们看见任何数据之前,其实是可以对参数拥有“个人观点”的!如果觉得这有点颠覆逻辑,别担心,我们一步一步来。
研读完这份笔记后,你将学会如何将最初的信念与新证据结合,从而得出更准确的结论。这正是精算判断的核心所在!
1. 三剑客:先验 (Prior)、似然 (Likelihood) 与后验 (Posterior)
要理解贝叶斯统计,你需要认识三个主角。让我们用“天气预报”来做个比喻。
A. 先验分布 \(\pi(\theta)\)
先验分布代表你收集任何数据之前,对参数 \(\theta\) 的信念。这就是基于过往经验的“直觉”。
例子:在看窗外之前,因为现在是伦敦的四月,你觉得今天有 70% 的机会下雨。
B. 似然函数 \(f(x|\theta)\)
似然 (Likelihood) 是在给定特定参数 \(\theta\) 为真的情况下,观察到目前数据 \(x\) 的概率。这就是“新证据”。
例子:你向窗外看去,发现乌云密布。“似然”告诉我们,当快要下雨时,出现乌云的频率有多高。
C. 后验分布 \(\pi(\theta|x)\)
后验分布是考虑新数据后,对 \(\theta\) 更新后的信念。它是结合先验与似然的结果。
例子:结合你对伦敦四月天气的认知以及刚看到的乌云,你现在有 95% 的把握肯定会下雨。
快速回顾:
先验:数据出现前的信念。
似然:数据告诉我们的资讯。
后验:数据出现后更新的信念。
2. 黄金公式:贝叶斯定理 (Bayes' Theorem)
在 CS1 中,我们使用特定版本的贝叶斯定理来计算后验分布。正式写法如下:
\(\pi(\theta|x) = \frac{f(x|\theta)\pi(\theta)}{\int f(x|\theta)\pi(\theta) d\theta}\)
等等!别慌! 分母(底部那部分)只是一个常数,用来确保总概率相加等于 1。在大多数考试题目中,我们会使用比例捷径 (Proportionality Shortcut):
后验 (Posterior) \(\propto\) 似然 (Likelihood) \(\times\) 先验 (Prior)
符号 \(\propto\) 代表“正比于”。这在考试中是你最好的朋友。如果你能将似然与先验相乘,并认出结果的“形状”,你就完全不需要进行底层复杂的积分运算!
3. 共轭先验分布 (Conjugate Prior Distributions)
有时候,数学运算会变得非常“顺手”。共轭先验是一种特殊的先验分布,当它与特定的似然结合时,产生的后验分布会与先验属于同一个分布家族。
为什么这很有用?
如果你从 Gamma 分布开始,最后也得到 Gamma 分布,就不需要进行任何复杂的微积分。你只需要算出参数(如 \(\alpha\) 和 \(\beta\))如何改变即可!
你知道吗? 使用共轭先验就像电子游戏里的捷径,让你跳过“魔王战”(艰难的积分),直接获得奖励(后验参数)。
4. 必须记住的“三大”共轭配对
IFoA 考试经常测试这三对组合。如果你能背下这些“更新规则”,将能节省大量时间。
配对 1:泊松似然 (Poisson Likelihood) + Gamma 先验
如果你的数据 \(x_1, ..., x_n\) 服从 Poisson(\(\lambda\)) 分布,而 \(\lambda\) 的先验为 Gamma(\(\alpha, \beta\)):
\(\lambda\) 的后验为 Gamma(\(\alpha + \sum x_i, \beta + n\))。
记忆小撇步:
将 \(\alpha\) 加上观测值的总和。
将 \(\beta\) 加上观测值的数量。
配对 2:二项式似然 (Binomial Likelihood) + Beta 先验
如果数据服从 Binomial(\(n, \theta\)) 分布(其中 \(\theta\) 为成功概率),而 \(\theta\) 的先验为 Beta(\(\alpha, \beta\)):
\(\theta\) 的后验为 Beta(\(\alpha + \text{成功次数}, \beta + \text{失败次数}\))。
快速提示: 如果数据是伯努利 (Bernoulli) 分布,那只是 \(n=1\) 的二项式分布。更新规则是一样的!
配对 3:正态似然 (Normal Likelihood) + 正态先验
如果数据服从 Normal(\(\theta, \sigma^2\))(\(\sigma^2\) 已知),而 \(\theta\) 的先验为 Normal(\(\mu_0, \sigma_0^2\)):
后验同样是正态分布。更新后的平均值和方差公式较长,但本质上是根据各自的精确度,对先验均值和样本均值进行“加权”。
5. 步骤详解:如何计算后验
如果你遇到不是标准共轭配对的题目,请按照以下步骤:
1. 写下先验 \(\pi(\theta)\):忽略任何不包含 \(\theta\) 的常数项。
2. 写下似然 \(f(x|\theta)\):这是数据的联合密度函数。如果你有 \(n\) 个独立观测值,将各个单独密度相乘。
3. 相乘:\(\pi(\theta|x) \propto f(x|\theta) \times \pi(\theta)\)。
4. 化简:将所有包含 \(\theta\) 的项组合在一起,其他的移到一边。
5. 识别分布:观察结果表达式。它看起来像 Gamma 的核心吗?还是 Beta 或正态?将它与公式表 (Tables) 比对,找出新的参数。
6. 常见的错误陷阱
1. 忘记 \(n\): 在 Poisson-Gamma 更新中,别忘了要用 \(\beta + n\)。如果你有 10 年的数据,\(n=10\)。
2. 搞混 \(\alpha\) 和 \(\beta\): 务必检查公式表对 Gamma 和 Beta 的定义。有些教科书可能会互换符号!
3. 过度计算: 学生常浪费时间计算分母(标准化常数)。除非题目明确要求计算“x 的边际分布 (marginal distribution)”,否则使用 \(\propto\) 符号即可忽略它。
重点总结
- 贝叶斯统计透过新数据更新初始信念。
- 后验 \(\propto\) 似然 \(\times\) 先验。
- 共轭先验能让后验分布维持在同一分布家族,使计算变得简单。
- Poisson 更新 Gamma;Binomial 更新 Beta;Normal 更新 Normal。
- 专注于包含参数 \(\theta\) 的项,并将其他部分视为常数。
刚开始觉得棘手也没关系!贝叶斯统计是一种不同的思维方式。一旦你练习熟练了这“三大配对”的参数更新规则,你会发现这将是 CS1 考试中最能稳拿分数的题目之一。