欢迎来到贝叶斯更新(Bayesian Updating)的世界!

你好!如果你曾经在看到新证据后改变了对某事物的看法,那么你已经具备了贝叶斯(Bayesian)思维。在 CS1 的这一章,我们将从“频率论”(Frequentist)统计(其中参数被视为固定数值)转向贝叶斯统计,在这里,我们将参数视为随机变量,并拥有各自的分布。

如果起初觉得这些概念有点“元”(meta),别担心。我们只是在学习一个正式的表达方式,用以说明:“我原本有一个猜测(先验分布 Prior),我看了一些数据(似然函数 Likelihood),现在我有了更准确的猜测(后验分布 Posterior)。” 让我们开始吧!


1. 核心要素:贝叶斯定理(Bayes' Theorem)

要找到后验分布(Posterior Distribution),我们使用贝叶斯定理的一个特定版本。把它想象成一个食谱,我们将先验信念与新信息混合在一起。

基本公式

其关系定义为:
\( \pi(\theta | x) = \frac{f(x|\theta) \pi(\theta)}{f(x)} \)

然而,在大多数 CS1 考试中,我们使用比例(Proportionality)版本,因为计算起来简单得多:
\( \pi(\theta | x) \propto f(x|\theta) \times \pi(\theta) \)

简单来说:
后验分布 \(\propto\) 似然函数 \(\times\) 先验分布

关键术语:
1. 先验分布(Prior Distribution)\(\pi(\theta)\): 在观察任何数据之前,我们对参数 \(\theta\) 的认知。
2. 似然函数(Likelihood Function)\(f(x|\theta)\): 在给定特定 \(\theta\) 值的情况下,观察到我们数据的概率。
3. 后验分布(Posterior Distribution)\(\pi(\theta|x)\): 在观察数据 \(x\) 后,我们对 \(\theta\) 更新后的认知。
4. 比例符号(\(\propto\)): 这代表“成正比”。我们在计算时可以忽略任何不涉及 \(\theta\) 的常数。

小撇步:删除常数技巧(Dropping Constants)

在计算后验分布时,如果某项不包含 \(\theta\),你可以直接把它扔掉!例如,如果你有 \( 3\theta^2 e^{-5\theta} \),其中的“3”就是常数,在推导过程中可以直接忽略。这会让数学运算看起来没那么吓人。


2. 寻找后验分布的步骤指引

如果在考试中被要求求出后验分布,请每次都遵循以下步骤:

第 1 步:写下先验分布。 找出 \(\pi(\theta)\) 并删除所有不包含 \(\theta\) 的常数。
第 2 步:写下似然函数。 这是 \(f(x|\theta)\)。如果你有 \(n\) 个观测值的样本,它就是个别概率密度的乘积:\( \prod f(x_i|\theta) \)。
第 3 步:将两者相乘。 将第 1 步和第 2 步的项组合起来。
第 4 步:简化。 将所有 \(\theta\) 的项放在一起,并将所有 \(e^{\dots \theta}\) 的项放在一起。
第 5 步:识别分布。 观察你简化后的表达式。它看起来像不像 Gamma、Beta 或 Normal 等常见分布的“核心”(kernel,即包含变量的部分)?(请查阅你的公式与统计表!)

类比:想象你在猜罐子里有多少颗红色糖果。你的“先验分布”是你根据标签所做的猜测。而“似然函数”是你取出 5 颗糖果后所看到的结果。“后验分布”则是你不经过旧猜测,所得出的更好、更准确的新猜测。


3. 共轭先验(Conjugate Priors):捷径组合

在 CS1 中,你经常会遇到共轭先验。这其实是一个高深的说法,意思就是:“如果先验分布和后验分布属于同一个分布家族,那么这个先验分布就是该似然函数的共轭先验。”

记住这些组合就像是在脑中自备一份“小抄”。以下是考试大纲中最重要的三组:

A. Poisson-Gamma 组合

如果你的数据服从 Poisson(\(\theta\)) 分布,而你的先验分布是 Gamma(\(\alpha, \lambda\)),那么你的后验分布也将是 Gamma 分布。

更新规则:
新 \(\alpha_{post} = \alpha + \sum x_i\)
新 \(\lambda_{post} = \lambda + n\)
(其中 \(n\) 为观测值的数量)

B. Binomial-Beta 组合

如果你的数据是 Binomial(\(n, \theta\)),而你的先验分布是 Beta(\(a, b\)),那么你的后验分布将是 Beta

更新规则:
新 \(a_{post} = a + \text{成功次数}\)
新 \(b_{post} = b + \text{失败次数}\)
(若资料为成功/失败次数)

C. Normal-Normal 组合(固定方差)

如果你的数据是 Normal(\(\theta, \sigma^2\)),而你的先验分布是 Normal(\(\mu, \tau^2\)),那么你的后验分布也同样是 Normal

注意:这部分的数学计算稍微复杂一点,但“新平均值”基本上就是先验平均值与样本平均值的加权平均。

总结: 共轭先验让生活变得简单,因为你不需要进行繁重的积分运算,只需要直接“更新”分布的参数即可。


4. 总结后验分布

一旦找到了后验分布,考官通常会要求你进行点估计(Point Estimate)。这是一个代表你对 \(\theta\) 的“最佳猜测”的单一数值。

1. 后验平均值(Posterior Mean)

这是后验分布的期望值 \(E[\theta | x]\)。
例如:如果你的后验分布是 Gamma(\(\alpha', \lambda'\)),其平均值即为 \(\alpha' / \lambda'\)。

2. 后验众数(Posterior Mode)

这是 \(\theta\) 最有可能出现的值(即分布的最高点)。你可以通过最大化后验密度函数(将导数设为零)来找到它。
记忆小撇步:“Mode”=“Most”。它是最热门的数值!

3. 后验中位数(Posterior Median)

将后验分布平分成两半的数值。这在考试中较少见,计算方式是解出满足 \(P(\theta \le M | x) = 0.5\) 的 \(M\)。


5. 常见避坑指南

1. 混淆 \(n\) 和 \(\sum x_i\): 在 Poisson-Gamma 更新中,学生常忘记将 \(\lambda\) 加上 \(n\)。请记住:\(\lambda\) 处理的是样本量,而 \(\alpha\) 处理的是总次数

2. 忘记似然函数的乘积: 如果你有 10 个数据点,你的似然函数是 \(f(x_1|\theta) \times f(x_2|\theta) \dots f(x_{10}|\theta)\)。千万不要只用一个 \(x\) 来计算!

3. 对比例常数感到恐慌: 除非题目特别要求,否则你不需要计算分母 \(f(x)\)。只要专注于那些包含 \(\theta\) 的项即可。


最终快速复习清单

- 先验分布(Prior): 数据出现前的信念。
- 似然函数(Likelihood): 数据告诉我们的信息。
- 后验分布(Posterior): 更新后的信念(先验 \(\times\) 似然)。
- 共轭(Conjugate): 先验与后验属于同一类分布。
- 目标: 识别 \(\theta\) 的分布,并利用其性质(平均值/众数)进行估计。

继续练习这些推导!一旦你熟悉了 Gamma 和 Beta 核心的规律,你会发现这些“简单案例”是 CS1 考试中最容易拿分的地方。你可以做到的!