簡介:貝葉斯可信區間地圖

歡迎來到這裡!在你的貝葉斯統計旅程中,你已經學會如何結合既有認知(先驗分佈 Prior)與新數據(概似函數 Likelihood),從而得出對世界的更新觀點(後驗分佈 Posterior)。但一旦你擁有了這個後驗分佈,你該如何利用它來進行決策或給出估計呢?

在本章中,我們將探討可信區間(Credible Intervals)。你可以把它想像成你在頻率學派(Frequentist statistics)統計中見過的「置信區間(Confidence Intervals)」的貝葉斯版本。然而,正如你即將看到的,貝葉斯區間在解釋上通常直觀得多,也更「友善」。如果初看數學算式覺得有點吃力,請別擔心——我們會一步步為你拆解!

1. 什麼是可信區間?

可信區間是指在已知觀測數據的情況下,未知參數(我們稱之為 \( \theta \))以特定機率落入的數值範圍。

如果我們計算出索賠頻率 \( \lambda \) 的 95% 可信區間為 [0.02, 0.08],我們可以直接說:「\( \lambda \) 的真實值有 95% 的機率介於 0.02 到 0.08 之間。」

等等,這不就是置信區間嗎?
事實上,並非如此!在頻率學派統計(置信區間)中,參數是固定的,而區間本身是隨機的。你必須說:「在 95% 的重複抽樣中,這個區間將包含真實參數。」
在貝葉斯統計中,參數是隨機的,而數據是固定的。這讓我們可以直接針對參數本身進行機率陳述。對大多數人來說,這理解起來自然得多!

重點總結:

\( \theta \) 的 \( 100(1-\alpha)\% \) 貝葉斯可信區間是指任何滿足以下條件的區間 \((a, b)\):
\( P(a < \theta < b | \text{data}) = 1 - \alpha \)

2. 「簡單情況」:中央可信區間

雖然選取區間的方法有很多種(因為許多不同的範圍累加起來都可以達到 95%),但 IFoA 課程主要關注中央可信區間(Central Credible Intervals)(也稱為等尾區間)。

要找到 \( 100(1-\alpha)\% \) 的中央可信區間,我們只需將「剩餘」的機率 (\( \alpha \)) 一分為二,各佔 \( \alpha/2 \),分別放在左尾和右尾。

步驟流程:
1. 找出你參數的後驗分佈(例如:它是常態分佈?Gamma 分佈?還是 Beta 分佈?)。
2. 確定你想要的總機率(例如:95%,所以 \( \alpha = 0.05 \))。
3. 找到 \( \alpha/2 \) 分位數(下界,\( a \))。
4. 找到 \( 1 - \alpha/2 \) 分位數(上界,\( b \))。

例子:對於 95% 的區間,你需要找出後驗分佈的第 2.5 百分位數和第 97.5 百分位數。

3. 使用常態分佈

最常見的「簡單情況」涉及常態後驗分佈。由於常態分佈是對稱的,找到區間非常直接。

如果 \( \theta \) 的後驗分佈為 \( N(\mu_{post}, \sigma^2_{post}) \),則 \( 100(1-\alpha)\% \) 的可信區間為:
\( (\mu_{post} - z_{\alpha/2} \cdot \sigma_{post}, \mu_{post} + z_{\alpha/2} \cdot \sigma_{post}) \)

你知道嗎?
對於 95% 的區間,\( z_{\alpha/2} \) 是 1.96。對於 90% 的區間,它是 1.6449。你可以在你的公式與統計表(Gold Book)中找到這些數值!

例子示範:
想像你計算出未知平均損失 \( \mu \) 的後驗分佈為 \( N(500, 100) \)。請注意,變異數為 100,因此標準差為 10。
要找到 95% 的可信區間:
下界:\( 500 - (1.96 \times 10) = 480.4 \)
上界:\( 500 + (1.96 \times 10) = 519.6 \)
解讀:真實平均損失有 95% 的機率介於 480.4 和 519.6 之間。

4. 其他分佈(Gamma 與 Beta)

有時你的後驗分佈不是常態分佈。例如:
- 如果你使用卜瓦松 (Poisson) 概似函數和Gamma 先驗,你的後驗分佈為Gamma
- 如果你使用二項式 (Binomial) 概似函數和Beta 先驗,你的後驗分佈為Beta

在這些情況下,你不能直接使用「加減」捷徑,因為這些分佈通常不對稱。相反,你必須使用統計表或分佈的性質,找到累積分配函數 (CDF) 等於 \( \alpha/2 \) 和 \( 1 - \alpha/2 \) 的點。

Gamma 分佈的小撇步:
IFoA 的統計表提供了 \( \chi^2 \)(卡方)分佈的值。請記住,Gamma 分佈可以轉換為卡方分佈!
如果 \( \theta \sim Gamma(\alpha, \lambda) \),那麼 \( 2\lambda\theta \sim \chi^2_{2\alpha} \)。這在考試中簡直是救命稻草!

快速複習:

- 先驗分佈 (Prior):我們在看到數據前的想法。
- 後驗分佈 (Posterior):我們在看到數據後更新的信念。
- 可信區間 (Credible Interval):後驗分佈得出的數值範圍,以特定機率包含該參數。

5. 需避開的常見陷阱

1. 使用了先驗分佈:學生常會不小心使用先驗參數而不是後驗參數來計算區間。務必檢查你的作業!區間應該基於你「更新後」的知識。
2. 混淆變異數與標準差:在常態分佈公式中,記得要使用標準差 (\( \sigma \)),而不是變異數 (\( \sigma^2 \))。
3. 使用頻率學派的語言:在書面回答時要小心措辭。不要說「95% 的樣本...」,而要說「參數落在此範圍內的機率為 95%」。

考試成功步驟總結

1. 識別概似函數和先驗分佈,以確定後驗分佈及其參數。
2. 決定顯著性水平 \( \alpha \)(例如:對於 90% 可信區間,\( \alpha = 0.10 \))。
3. 找到數值 \( a \) 和 \( b \),使得 \( a \) 左側的面積為 \( \alpha/2 \),而 \( b \) 右側的面積為 \( \alpha/2 \)。
4. 清晰地將區間表達為 \( (a, b) \),並在被要求時提供簡短的解讀。

如果起初覺得這些很棘手,別擔心!一旦你識別出你正在處理的分佈,數學計算通常只是簡單的代數運算。練習先找出後驗參數,區間計算自然會迎刃而解。