歡迎來到不確定性的世界(以及如何衡量它!)

在你之前的學習中,你已經學會了如何使用最大概似估計法(Maximum Likelihood Estimation, MLE)找出參數的「最佳估計值」。但在精算領域,單單一個數字是不夠的。如果你告訴你的老闆平均賠款額是 5,000 美元,他們的第一個問題通常會是:「你有多大的把握?」

這一章就是要回答這個問題。我們將學習如何計算估計量的變異數(variance)並建立信賴區間(confidence intervals)。這能讓我們知道真實參數可能隱藏的數值範圍。如果這看起來數學成分很重,別擔心——我們會將其拆解成簡單、符合邏輯的步驟!

1. 基礎:資訊量與曲率

為了求出 MLE 的變異數,我們需要觀察概似函數(Likelihood Function)。你可以把概似函數想像成一座山,而山的頂峰就是我們的 MLE (\(\hat{\theta}\))。

尖峰:如果這座山非常尖峭且陡峭,我們就會對峰值正好落在 \(\hat{\theta}\) 這一點非常有信心。高度的確定性意味著低變異數
平緩的高原:如果這座山平坦且圓潤,峰值可能落在廣大範圍內的任何地方。低確定性意味著高變異數

觀察資訊量(Observed Information)

在微積分中,「陡峭程度」或「曲率」是透過二階導數來衡量的。在精算數學中,我們稱之為觀察資訊量(Observed Information),記作 \(O(\theta)\)。它的計算方式是對對數概似函數 \(l(\theta)\) 取負的二階導數:

\(O(\theta) = -\frac{d^2}{d\theta^2} l(\theta)\)

費雪資訊量(Fisher Information)

我們通常會想要這個概念的「平均」版本,稱為費雪資訊量(Fisher Information)期望資訊量(Expected Information),記作 \(I(\theta)\):

\(I(\theta) = E[O(\theta)] = E[-\frac{d^2}{d\theta^2} l(\theta)]\)

關鍵連結:估計量的變異數近似於資訊量的倒數
\(\text{Var}(\hat{\theta}) \approx \frac{1}{I(\hat{\theta})}\)

快速回顧:資訊量越多 = 確定性越高 = 變異數越小!

2. Delta 方法:精算師的秘密武器

有時候,我們關心的不僅是參數 \(\theta\)(例如分佈的平均值)。我們可能關心該參數的函數 \(g(\theta)\)(例如賠款超過 10,000 美元的機率)。如果我們已知 \(\hat{\theta}\) 的變異數,該如何求出 \(g(\hat{\theta})\) 的變異數呢?

這時我們就要使用 Delta 方法(Delta Method)。本質上,它是利用一階泰勒級數(Taylor series)進行的線性近似。

公式:
\(\text{Var}(g(\hat{\theta})) \approx [g'(\hat{\theta})]^2 \text{Var}(\hat{\theta})\)

步驟流程:
1. 求出 MLE \(\hat{\theta}\)。
2. 利用資訊矩陣(負二階導數的倒數)求出 \(\hat{\theta}\) 的變異數。
3. 定義函數 \(g(\theta)\) 並求其導數 \(g'(\theta)\)。
4. 將所有數值代入 Delta 方法公式中。

範例:如果你要估計存活函數 \(S(x)\) 的變異數,你的 \(g(\theta)\) 就是存活函數本身!

3. 建立信賴區間

信賴區間(CI)給我們一個範圍(例如:「我們有 95% 的把握真實值落在 A 和 B 之間」)。由於中央極限定理(Central Limit Theorem)的緣故,MLE 具有「漸近常態性」。這意味著在樣本數很大時,它們會呈現鐘形曲線!

標準(Wald)信賴區間

這是你在基礎統計學中可能見過的經典公式:
\(\hat{\theta} \pm z_{\alpha/2} \sqrt{\text{Var}(\hat{\theta})}\)

其中的 \(\sqrt{\text{Var}(\hat{\theta})}\) 項也稱為標準誤(Standard Error, SE)

對數轉換信賴區間

你知道嗎?在保險業中,許多參數(如賠款嚴重程度)不可能為負數。標準 CI 可能會不小心給出一個包含負數的範圍(例如 -500 美元到 2,000 美元),這在成本問題上是不合理的!為了解決這個問題,我們使用對數轉換(Log-Transform)

我們不直接為 \(\theta\) 建立 CI,而是先為 \(\ln(\theta)\) 建立,然後再轉換回來。這確保了我們的邊界永遠為正數。

最終結果範圍:
\([\hat{\theta} / U, \hat{\theta} \times U]\)
其中 \(U = \exp \left( \frac{z_{\alpha/2} \text{SE}(\hat{\theta})}{\hat{\theta}} \right)\)

關鍵收穫:當你的參數必須為正數時,請使用對數轉換區間,以確保你的數學運算符合實際物理意義!

4. 多參數處理

如果我們的模型有兩個參數呢?例如 Gamma 分佈中的 \(\alpha\) 和 \(\theta\)。這時我們需要使用資訊矩陣(Information Matrix)(一個由導數組成的方形表)。

矩陣設定:
矩陣 \(I(\theta)\) 包含:
• 左上角:對 \(\theta_1\) 的負二階導數
• 右下角:對 \(\theta_2\) 的負二階導數
• 非對角線位置:負混合偏導數

為了求出變異數,你必須對矩陣求反矩陣(invert the matrix)。反矩陣對角線上的元素就是各個參數的變異數。

避免常見錯誤:不要只是把個別元素的倒數取出來!你必須先對整個矩陣求逆,然後再看對角線上的數值。

5. 總結與快速提示

工作流程:
1. 對數概似函數 \(\rightarrow\) 2. 二階導數 \(\rightarrow\) 3. 資訊量 \(\rightarrow\) 4. 變異數 \(\rightarrow\) 5. 信賴區間。

記憶小撇步:
「負負得正」:記住資訊量是二階導數的負值。因為對數概似函數通常是向下凹(像個哭臉),所以二階導數是負的。取負號後,我們就能得到一個正的資訊量值!如果你算出的變異數是負的,那你一定是忘了這一步。
「Delta = Derivative」:Delta 方法永遠涉及將導數平方。

最終鼓勵:
估計變異數與信賴區間是連接「純數學」與「現實應用」的橋樑。它承認我們無法完美地知道一切,但我們可以精確地衡量我們「不知道」的程度有多少。掌握 Delta 方法與資訊矩陣,你離通過 Exam ASTAM 就更近一步了!