歡迎來到貝葉斯估計(Bayesian Estimates)的世界!
在 CS1 的學習旅程中,你已經學會如何求出後驗分佈(posterior distribution)。但重點來了:在現實世界中,精算師不可能直接甩給客戶一個複雜的概率公式就了事!客戶通常需要一個單一數字,也就是所謂的「最佳猜測」,來用於保險產品定價或準備金提存。這個單一數字就稱為點估計(point estimate)。
在本章中,我們將學習如何利用損失函數(Loss Functions)來選出這個「最佳猜測」。你可以把損失函數想像成一種衡量「估計錯誤會付出多大代價」的方法。透過將這種「代價」最小化,我們就能找到參數最合理的估計值。如果現在覺得有點抽象也別擔心,我們會一步一步拆解!
1. 到底什麼是損失函數?
想像一下,你正試圖估計下個月會收到多少保險理賠申請。如果你猜 10 件,但實際數量是 15 件,你的誤差就是 5。在貝葉斯統計中,我們使用損失函數,記作 \( L(\theta, \hat{\theta}) \),來為這個誤差賦予一個數學價值。
- \(\theta\)(Theta):參數的真實未知值。
- \(\hat{\theta}\)(Theta-hat):你的估計值或「最佳猜測」。
- \(L(\theta, \hat{\theta})\):當真實值為 \(\theta\) 而你猜測為 \(\hat{\theta}\) 時,你所承擔的「損失」或懲罰。
我們的目標是選擇一個能將預期損失(Expected Loss)最小化的估計值 \(\hat{\theta}\)。由於我們不知道真實的 \(\theta\),我們會在後驗分佈(即觀察數據後所獲得的知識)上計算平均損失。
你知道嗎?損失函數的概念源自決策論(Decision Theory)。精算師運用這些概念,是為了確保即使估計錯誤,保險公司所承受的財務「痛感」也能降至最低!
2. 三大損失函數
IFoA 課程重點關注三種特定的損失函數。每一種都會導向後驗分佈中不同的「最佳猜測」。讓我們逐一來看看。
A. 平方損失(Quadratic Loss,對應:平均值)
這是最常見的損失函數。它會將誤差平方,這意味著它會對那些偏離真實值太遠的猜測進行極重的懲罰。
公式: \( L(\theta, \hat{\theta}) = (\theta - \hat{\theta})^2 \)
貝葉斯估計: 為了使預期平方損失最小化,你應該選擇後驗分佈的平均值(mean)。
類比: 想像你在玩射飛鏢。如果你偏離靶心 2cm,懲罰是 4;如果你偏離 10cm,懲罰就是 100!因為懲罰隨著距離增加得非常快,所以你會有動力讓自己保持在最中間的位置——也就是平均值。
B. 絕對誤差損失(Absolute Error Loss,對應:中位數)
這個函數不會將誤差平方,它只計算你的猜測與真實值之間的直線距離。
公式: \( L(\theta, \hat{\theta}) = |\theta - \hat{\theta}| \)
貝葉斯估計: 為了使預期絕對誤差損失最小化,你應該選擇後驗分佈的中位數(median)。
實用提示: 中位數就是「中間」的值。它將機率分佈精確地一分為二(真實值大於它的機率為 50%,小於它的機率亦為 50%)。
C. 全或無損失(All-or-Nothing Loss,對應:眾數)
這是「嚴格」的版本。只有當你完全猜對時,你才會「贏」(損失為 0)。如果你錯了一點點,就會受到固定的懲罰。
公式: 當 \( \hat{\theta} = \theta \) 時,\( L(\theta, \hat{\theta}) = 0 \);當 \( \hat{\theta} \neq \theta \) 時,\( L(\theta, \hat{\theta}) = 1 \)。
貝葉斯估計: 為了使這種損失最小化,你應該選擇出現機率最高的值——也就是後驗分佈的眾數(mode)。
3. 總結表:我該用哪一個?
如果你在記憶哪個估計值對應哪個損失函數時感到困惑,請參考這張實用的表格:
| 損失函數 | 數學形式 | 貝葉斯估計 (\(\hat{\theta}\)) |
|---|---|---|
| 平方損失 | \( (\theta - \hat{\theta})^2 \) | 後驗分佈的平均值 |
| 絕對誤差損失 | \( |\theta - \hat{\theta}| \) | 後驗分佈的中位數 |
| 全或無損失 | 猜對為 0,猜錯為 1 | 後驗分佈的眾數 |
快速複習: 如果考題問你在「平方誤差損失」下的貝葉斯估計,其實它就是在問你計算後驗分佈的平均值!
4. 一步步來:如何推導估計值
處理考題時,請依照以下步驟:
- 識別後驗分佈: 使用概似函數(likelihood)和先驗分佈(prior)來找出後驗分佈(例如:Gamma, Beta, Normal 分佈)。
- 確認損失函數: 查看題目指定的是哪種損失函數。
- 計算對應特徵:
- 若是平方損失:求 \( E[\theta | data] \)。
- 若是絕對誤差損失:解出 \( m \),使得 \( P(\theta \le m | data) = 0.5 \)。
- 若是全或無損失:找出使後驗密度函數(posterior density function)最大化的 \(\theta\) 值。
例子: 如果你的後驗分佈是 Gamma(\(\alpha, \lambda\)),題目要求在平方損失下的估計,你的答案就是 Gamma 分佈的平均值:\( \frac{\alpha}{\lambda} \)。
5. 避免常見錯誤
1. 使用先驗分佈而非後驗分佈: 這是最常見的錯誤!貝葉斯估計永遠是根據後驗分佈(即觀察到數據之後的分佈)推導出來的。
2. 混淆平均值與眾數: 對於偏態分佈(如 Gamma 或 Beta),平均值、中位數和眾數通常不同。請確保你使用的是公式表(Formula Tables)(俗稱「金書」)中正確的公式。
3. 忘記權重: 在許多 CS1 問題中,後驗平均值是先驗平均值與樣本平均值的加權平均。如果你算出來的值不在先驗平均值與數據平均值之間,請務必重新檢查你的運算!
6. 重點總結
- 損失函數量化了估計誤差的「成本」。
- 平方損失最受歡迎,對應後驗平均值。
- 絕對誤差損失對離群值較具穩健性,對應後驗中位數。
- 全或無損失關注出現機率最高的值,對應後驗眾數。
- 考試小貼士: 考試時請始終翻開你的「金書」(Tables)到分佈頁面,這樣你就能快速查閱剛剛算出的後驗分佈之平均值或眾數公式!
如果剛開始覺得棘手,請不用擔心。只要多練習識別後驗分佈,選擇正確的估計方法很快就會變成你的直覺!