歡迎來到經驗貝葉斯信度理論 (EBCT) 的世界!

你好!如果你一直在研讀貝葉斯統計 (Bayesian statistics),你就會知道我們通常會從「先驗分佈 (Prior)」開始(在看到數據之前的想法),然後將其更新為「後驗分佈 (Posterior)」(在看到數據之後的想法)。但如果我們對「先驗分佈」毫無頭緒,該怎麼辦呢?

這正是經驗貝葉斯信度理論 (Empirical Bayes Credibility Theory, EBCT) 發揮作用的時候!我們不再盲目猜測先驗分佈,而是利用多個相似風險的實際數據來「估計」先驗分佈。這是一種非常實用且貼近現實的方法,用來決定我們應該多大程度上信任個人的索賠歷史,以及多大程度上信任群體平均值。

別擔心,如果現在覺得這些概念有點抽象也沒關係——我們會一步一步為你拆解!

1. 核心概念:個人經驗 vs. 群體表現

想像你是一位保險核保員,正在為「司機 A」計算汽車保險費。你有兩條資訊:
1. 司機 A 的個人歷史:他在過去 3 年內沒有發生過任何事故。
2. 群體平均值:該市的司機平均每年發生 0.5 次事故。

你應該多信任司機 A 的個人數據(經驗),又該多信任該市的平均數據(群體)呢?

信度保費 (Credibility Premium) 的計算公式如下:
\( P = Z\bar{X} + (1 - Z)\mu \)

其中:
\(\bar{X}\) 是個人的平均值(經驗)。
\(\mu\) 是整體人口的平均值。
\(Z\)信度因子 (Credibility Factor)(介於 0 到 1 之間的數字)。

當我們沒有預先定義的先驗分佈時,EBCT 就是我們用來計算 \(Z\) 和 \(\mu\) 的方法。

2. EBCT 模型 1(Bühlmann 模型)

Bühlmann 模型中,我們假設有 \(N\) 個不同的投保人(或群體),且我們觀察了他們每人 \(n\) 年的數據。

為了求得信度因子 \(Z\),我們需要觀察兩種「離散程度」或變異數:

A. 過程變異數的期望值 (Expected Value of Process Variance, EVPV):這代表單一風險內部的「噪音」或隨機性。即使是「好」司機,也可能因為運氣不好而發生事故。我們將其記為 \(s^2\)。

B. 假設均值的變異數 (Variance of Hypothetical Means, VHM):這代表不同人之間「真實」潛在風險的差異。如果每個人都一模一樣,VHM 就是零。我們將其記為 \(a\)。

Z 的公式:
\( Z = \frac{n}{n + \frac{s^2}{a}} \)

記憶小撇步:你可以把 \(s^2\)(噪音)視為讓我們懷疑數據的「壞」因子,而將 \(a\)(人與人之間的差異)視為讓個人數據更有參考價值的「好」因子。如果噪音 \(s^2\) 很高,\(Z\) 就會下降;如果人與人之間的變異 \(a\) 很高,\(Z\) 就會上升!

重點總結:

我們擁有的數據越多 (\(n\)),且個體之間的差異越明顯 (\(a\)),我們對個人自身經驗賦予的信度 (\(Z\)) 就越高。

3. 如何計算 EBCT 參數(逐步指南)

別被符號嚇到了!如果你拿到一份包含 \(N\) 個群體和 \(n\) 年的數據表,按照以下步驟操作即可:

第 1 步:求出每個群體的平均值 (\(\bar{X}_i\))
計算每一列(每個投保人)的平均值。

第 2 步:求出整體平均值 (\(\bar{X}\))
計算所有群體平均值的平均值。這就是我們對 \(\mu\) 的估計值。

第 3 步:估計過程變異數 (\(s^2\))
1. 計算每個個別群體的樣本變異數。
2. 將這些變異數取平均,這就是 \(\hat{s}^2\)。

第 4 步:估計假設均值的變異數 (\(a\))
這是最棘手的部分!請使用這個公式:
\( \hat{a} = \text{群體平均值的變異數} - \frac{\hat{s}^2}{n} \)

為什麼要減去?因為我們在群體平均值之間觀察到的變異,部分來自於「真實」差異 (\(a\)),部分來自於隨機噪音 (\(s^2\))。我們減去噪音,才能找出「純粹」的差異。

第 5 步:計算 Z 和保費
將結果代入 \( Z = \frac{n}{n + \hat{s}^2/\hat{a}} \),然後計算保費 \( Z\bar{X}_i + (1-Z)\bar{X} \)。

快速複習框:

\(N\) = 群體數量(行數)。
\(n\) = 時間週期數量(列數)。
\(\hat{s}^2\) = 內部變異數的平均值。
\(\hat{a}\) = 平均值的變異數減去(噪音 / \(n\))。

4. 常見陷阱與小技巧

1. 負變異數:有時在計算 \(\hat{a}\) 時,你可能會得到一個負數。由於變異數不可能是負的,在這些極少數情況下,我們設 \(\hat{a} = 0\)(這代表 \(Z = 0\))。這意味著該個人數據充滿噪音,毫無參考價值。

2. 混淆 \(n\) 和 \(N\):請記住,\(n\) 是每個群體的年份/觀察次數。\(N\) 是群體的總數。\(Z\) 的公式使用的是 \(n\),而不是 \(N\)。

3. 「你知道嗎?」EBCT 方法通常被稱為「最精確信度 (Greatest Accuracy Credibility)」,因為它最小化了我們估計值的均方誤差!

5. 現實生活中的類比:咖啡店

假設你想知道「咖啡店 A」是否總是服務很慢,還是你只是那天運氣不好。
個人經驗 (\(\bar{X}\)):你今天等了 15 分鐘。
群體平均值 (\(\mu\)):全市所有咖啡店的平均等待時間為 5 分鐘。
過程變異數 (\(s^2\)):「店 A」的等待時間是否每天波動很大?(噪音高 = \(Z\) 低)。
假設均值的變異數 (\(a\)):全市是否有些店真的穩定地比其他店慢?(店與店差異大 = \(Z\) 高)。
如果所有店基本上都一樣(\(a\) 很小),你會認為自己只是運氣不好,「真實」等待時間很可能是 5 分鐘。如果店與店之間差異很大(\(a\) 很大),你就會相信你 15 分鐘的經驗,並給予「店 A」較高的信度,認為它確實服務很慢!

EBCT 模型 1 總結

EBCT 允許我們在先驗分佈參數未知時計算信度保費。我們直接從數據中估計過程變異數假設均值的變異數

需要背誦的關鍵公式:
1. \( Z = \frac{n}{n + E[Var(X|\theta)] / Var(E[X|\theta]) } \)
2. \( \text{保費} = Z(\text{個人平均值}) + (1-Z)(\text{總體平均值}) \)

你一定可以的!多練習幾道表格題,你很快就能掌握其中的規律。