歡迎來到貝葉斯統計 (Bayesian Statistics)!
在目前的 CS1 學習旅程中,大家接觸的多半是頻率論 (Frequentist) 統計。在那個世界裡,我們假設參數(例如平均值 \(\mu\))是一個固定但未知的數值。但今天,我們要踏入貝葉斯統計的世界。在這裡,我們將參數視為隨機變量 (random variables)。這意味著在我們看見任何數據之前,其實是可以對參數擁有「個人觀點」的!如果覺得這有點顛覆邏輯,別擔心,我們一步一步來。
研讀完這份筆記後,你將學會如何將最初的信念與新證據結合,從而得出更準確的結論。這正是精算判斷的核心所在!
1. 三劍客:先驗 (Prior)、似然 (Likelihood) 與後驗 (Posterior)
要理解貝葉斯統計,你需要認識三個主角。讓我們用「天氣預報」來做個比喻。
A. 先驗分佈 \(\pi(\theta)\)
先驗分佈代表你收集任何數據之前,對參數 \(\theta\) 的信念。這就是基於過往經驗的「直覺」。
例子:在看窗外之前,因為現在是倫敦的四月,你覺得今天有 70% 的機會下雨。
B. 似然函數 \(f(x|\theta)\)
似然 (Likelihood) 是在給定特定參數 \(\theta\) 為真的情況下,觀察到目前數據 \(x\) 的概率。這就是「新證據」。
例子:你向窗外看去,發現烏雲密佈。「似然」告訴我們,當快要下雨時,出現烏雲的頻率有多高。
C. 後驗分佈 \(\pi(\theta|x)\)
後驗分佈是考慮新數據後,對 \(\theta\) 更新後的信念。它是結合先驗與似然的結果。
例子:結合你對倫敦四月天氣的認知以及剛看到的烏雲,你現在有 95% 的把握肯定會下雨。
快速回顧:
先驗:數據出現前的信念。
似然:數據告訴我們的資訊。
後驗:數據出現後更新的信念。
2. 黃金公式:貝葉斯定理 (Bayes' Theorem)
在 CS1 中,我們使用特定版本的貝葉斯定理來計算後驗分佈。正式寫法如下:
\(\pi(\theta|x) = \frac{f(x|\theta)\pi(\theta)}{\int f(x|\theta)\pi(\theta) d\theta}\)
等等!別慌! 分母(底部那部分)只是一個常數,用來確保總概率相加等於 1。在大多數考試題目中,我們會使用比例捷徑 (Proportionality Shortcut):
後驗 (Posterior) \(\propto\) 似然 (Likelihood) \(\times\) 先驗 (Prior)
符號 \(\propto\) 代表「正比於」。這在考試中是你最好的朋友。如果你能將似然與先驗相乘,並認出結果的「形狀」,你就完全不需要進行底層複雜的積分運算!
3. 共軛先驗分佈 (Conjugate Prior Distributions)
有時候,數學運算會變得非常「順手」。共軛先驗是一種特殊的先驗分佈,當它與特定的似然結合時,產生的後驗分佈會與先驗屬於同一個分佈家族。
為什麼這很有用?
如果你從 Gamma 分佈開始,最後也得到 Gamma 分佈,就不需要進行任何複雜的微積分。你只需要算出參數(如 \(\alpha\) 和 \(\beta\))如何改變即可!
你知道嗎? 使用共軛先驗就像電子遊戲裡的捷徑,讓你跳過「魔王戰」(艱難的積分),直接獲得獎勵(後驗參數)。
4. 必須記住的「三大」共軛配對
IFoA 考試經常測試這三對組合。如果你能背下這些「更新規則」,將能節省大量時間。
配對 1:泊松似然 (Poisson Likelihood) + Gamma 先驗
如果你的數據 \(x_1, ..., x_n\) 服從 Poisson(\(\lambda\)) 分佈,而 \(\lambda\) 的先驗為 Gamma(\(\alpha, \beta\)):
\(\lambda\) 的後驗為 Gamma(\(\alpha + \sum x_i, \beta + n\))。
記憶小撇步:
將 \(\alpha\) 加上觀測值的總和。
將 \(\beta\) 加上觀測值的數量。
配對 2:二項式似然 (Binomial Likelihood) + Beta 先驗
如果數據服從 Binomial(\(n, \theta\)) 分佈(其中 \(\theta\) 為成功概率),而 \(\theta\) 的先驗為 Beta(\(\alpha, \beta\)):
\(\theta\) 的後驗為 Beta(\(\alpha + \text{成功次數}, \beta + \text{失敗次數}\))。
快速提示: 如果數據是伯努利 (Bernoulli) 分佈,那只是 \(n=1\) 的二項式分佈。更新規則是一樣的!
配對 3:正態似然 (Normal Likelihood) + 正態先驗
如果數據服從 Normal(\(\theta, \sigma^2\))(\(\sigma^2\) 已知),而 \(\theta\) 的先驗為 Normal(\(\mu_0, \sigma_0^2\)):
後驗同樣是正態分佈。更新後的平均值和方差公式較長,但本質上是根據各自的精確度,對先驗均值和樣本均值進行「加權」。
5. 步驟詳解:如何計算後驗
如果你遇到不是標準共軛配對的題目,請按照以下步驟:
1. 寫下先驗 \(\pi(\theta)\):忽略任何不包含 \(\theta\) 的常數項。
2. 寫下似然 \(f(x|\theta)\):這是數據的聯合密度函數。如果你有 \(n\) 個獨立觀測值,將各個單獨密度相乘。
3. 相乘:\(\pi(\theta|x) \propto f(x|\theta) \times \pi(\theta)\)。
4. 化簡:將所有包含 \(\theta\) 的項組合在一起,其他的移到一邊。
5. 識別分佈:觀察結果表達式。它看起來像 Gamma 的核心嗎?還是 Beta 或正態?將它與公式表 (Tables) 比對,找出新的參數。
6. 常見的錯誤陷阱
1. 忘記 \(n\): 在 Poisson-Gamma 更新中,別忘了要用 \(\beta + n\)。如果你有 10 年的數據,\(n=10\)。
2. 搞混 \(\alpha\) 和 \(\beta\): 務必檢查公式表對 Gamma 和 Beta 的定義。有些教科書可能會互換符號!
3. 過度計算: 學生常浪費時間計算分母(標準化常數)。除非題目明確要求計算「x 的邊際分佈 (marginal distribution)」,否則使用 \(\propto\) 符號即可忽略它。
重點總結
- 貝葉斯統計透過新數據更新初始信念。
- 後驗 \(\propto\) 似然 \(\times\) 先驗。
- 共軛先驗能讓後驗分佈維持在同一分佈家族,使計算變得簡單。
- Poisson 更新 Gamma;Binomial 更新 Beta;Normal 更新 Normal。
- 專注於包含參數 \(\theta\) 的項,並將其他部分視為常數。
剛開始覺得棘手也沒關係!貝葉斯統計是一種不同的思維方式。一旦你練習熟練了這「三大配對」的參數更新規則,你會發現這將是 CS1 考試中最能穩拿分數的題目之一。