歡迎來到貝葉斯更新(Bayesian Updating)的世界!

你好!如果你曾經在看到新證據後改變了對某事物的看法,那麼你已經具備了貝葉斯(Bayesian)思維。在 CS1 的這一章,我們將從「頻率論」(Frequentist)統計(其中參數被視為固定數值)轉向貝葉斯統計,在這裡,我們將參數視為隨機變數,並擁有各自的分佈。

如果起初覺得這些概念有點「元」(meta),別擔心。我們只是在學習一個正式的表達方式,用以說明:「我原本有一個猜測(先驗分佈 Prior),我看了一些數據(似然函數 Likelihood),現在我有了更準確的猜測(後驗分佈 Posterior)。」 讓我們開始吧!


1. 核心要素:貝葉斯定理(Bayes' Theorem)

要找到後驗分佈(Posterior Distribution),我們使用貝葉斯定理的一個特定版本。把它想像成一個食譜,我們將先驗信念與新資訊混合在一起。

基本公式

其關係定義為:
\( \pi(\theta | x) = \frac{f(x|\theta) \pi(\theta)}{f(x)} \)

然而,在大多數 CS1 考試中,我們使用比例(Proportionality)版本,因為計算起來簡單得多:
\( \pi(\theta | x) \propto f(x|\theta) \times \pi(\theta) \)

簡單來說:
後驗分佈 \(\propto\) 似然函數 \(\times\) 先驗分佈

關鍵術語:
1. 先驗分佈(Prior Distribution)\(\pi(\theta)\): 在觀察任何數據之前,我們對參數 \(\theta\) 的認知。
2. 似然函數(Likelihood Function)\(f(x|\theta)\): 在給定特定 \(\theta\) 值的情況下,觀察到我們數據的概率。
3. 後驗分佈(Posterior Distribution)\(\pi(\theta|x)\): 在觀察數據 \(x\) 後,我們對 \(\theta\) 更新後的認知。
4. 比例符號(\(\propto\)): 這代表「成正比」。我們在計算時可以忽略任何不涉及 \(\theta\) 的常數。

小撇步:刪除常數技巧(Dropping Constants)

在計算後驗分佈時,如果某項不包含 \(\theta\),你可以直接把它扔掉!例如,如果你有 \( 3\theta^2 e^{-5\theta} \),其中的「3」就是常數,在推導過程中可以直接忽略。這會讓數學運算看起來沒那麼嚇人。


2. 尋找後驗分佈的步驟指引

如果在考試中被要求求出後驗分佈,請每次都遵循以下步驟:

第 1 步:寫下先驗分佈。 找出 \(\pi(\theta)\) 並刪除所有不包含 \(\theta\) 的常數。
第 2 步:寫下似然函數。 這是 \(f(x|\theta)\)。如果你有 \(n\) 個觀測值的樣本,它就是個別機率密度的乘積:\( \prod f(x_i|\theta) \)。
第 3 步:將兩者相乘。 將第 1 步和第 2 步的項組合起來。
第 4 步:簡化。 將所有 \(\theta\) 的項放在一起,並將所有 \(e^{\dots \theta}\) 的項放在一起。
第 5 步:識別分佈。 觀察你簡化後的表達式。它看起來像不像 Gamma、Beta 或 Normal 等常見分佈的「核心」(kernel,即包含變數的部分)?(請查閱你的公式與統計表!)

類比:想像你在猜罐子裡有多少顆紅色糖果。你的「先驗分佈」是你根據標籤所做的猜測。而「似然函數」是你取出 5 顆糖果後所看到的結果。「後驗分佈」則是你不經過舊猜測,所得出的更好、更準確的新猜測。


3. 共軛先驗(Conjugate Priors):捷徑組合

在 CS1 中,你經常會遇到共軛先驗。這其實是一個高深的說法,意思就是:「如果先驗分佈和後驗分佈屬於同一個分佈家族,那麼這個先驗分佈就是該似然函數的共軛先驗。」

記住這些組合就像是在腦中自備一份「小抄」。以下是考試大綱中最重要的三組:

A. Poisson-Gamma 組合

如果你的數據服從 Poisson(\(\theta\)) 分佈,而你的先驗分佈是 Gamma(\(\alpha, \lambda\)),那麼你的後驗分佈也將是 Gamma 分佈。

更新規則:
新 \(\alpha_{post} = \alpha + \sum x_i\)
新 \(\lambda_{post} = \lambda + n\)
(其中 \(n\) 為觀測值的數量)

B. Binomial-Beta 組合

如果你的數據是 Binomial(\(n, \theta\)),而你的先驗分佈是 Beta(\(a, b\)),那麼你的後驗分佈將是 Beta

更新規則:
新 \(a_{post} = a + \text{成功次數}\)
新 \(b_{post} = b + \text{失敗次數}\)
(若資料為成功/失敗次數)

C. Normal-Normal 組合(固定變異數)

如果你的數據是 Normal(\(\theta, \sigma^2\)),而你的先驗分佈是 Normal(\(\mu, \tau^2\)),那麼你的後驗分佈也同樣是 Normal

注意:這部分的數學計算稍微複雜一點,但「新平均值」基本上就是先驗平均值與樣本平均值的加權平均。

總結: 共軛先驗讓生活變得簡單,因為你不需要進行繁重的積分運算,只需要直接「更新」分佈的參數即可。


4. 總結後驗分佈

一旦找到了後驗分佈,考官通常會要求你進行點估計(Point Estimate)。這是一個代表你對 \(\theta\) 的「最佳猜測」的單一數值。

1. 後驗平均值(Posterior Mean)

這是後驗分佈的期望值 \(E[\theta | x]\)。
例如:如果你的後驗分佈是 Gamma(\(\alpha', \lambda'\)),其平均值即為 \(\alpha' / \lambda'\)。

2. 後驗眾數(Posterior Mode)

這是 \(\theta\) 最有可能出現的值(即分佈的最高點)。你可以透過最大化後驗密度函數(將導數設為零)來找到它。
記憶小撇步:「Mode」=「Most」。它是最熱門的數值!

3. 後驗中位數(Posterior Median)

將後驗分佈平分成兩半的數值。這在考試中較少見,計算方式是解出滿足 \(P(\theta \le M | x) = 0.5\) 的 \(M\)。


5. 常見避坑指南

1. 混淆 \(n\) 和 \(\sum x_i\): 在 Poisson-Gamma 更新中,學生常忘記將 \(\lambda\) 加上 \(n\)。請記住:\(\lambda\) 處理的是樣本量,而 \(\alpha\) 處理的是總次數

2. 忘記似然函數的乘積: 如果你有 10 個數據點,你的似然函數是 \(f(x_1|\theta) \times f(x_2|\theta) \dots f(x_{10}|\theta)\)。千萬不要只用一個 \(x\) 來計算!

3. 對比例常數感到恐慌: 除非題目特別要求,否則你不需要計算分母 \(f(x)\)。只要專注於那些包含 \(\theta\) 的項即可。


最終快速複習清單

- 先驗分佈(Prior): 數據出現前的信念。
- 似然函數(Likelihood): 數據告訴我們的資訊。
- 後驗分佈(Posterior): 更新後的信念(先驗 \(\times\) 似然)。
- 共軛(Conjugate): 先驗與後驗屬於同一類分佈。
- 目標: 識別 \(\theta\) 的分佈,並利用其性質(平均值/眾數)進行估計。

繼續練習這些推導!一旦你熟悉了 Gamma 和 Beta 核心的規律,你會發現這些「簡單案例」是 CS1 考試中最容易拿分的地方。你可以做到的!