連續分佈簡介
歡迎來到 CS1 旅程中最重要的章節之一!在上一章,我們探討了離散分佈(Discrete Distributions)——即我們用來「計數」的情況(例如索償次數)。現在,我們進入連續(Continuous)的世界,這裡我們主要是進行「測量」。想像一下下一次交通意外發生的確切時間,或是某宗保險索償的具體金額。由於這些數值可以是任何數字(例如 124.50 或 124.5023...),我們便使用連續分佈來為它們建模。
如果起初覺得有點難,請不用擔心!雖然數學上涉及一些微積分,但核心概念其實很簡單:我們是在觀察數據在某個區間內的「形狀」。讀完這篇筆記後,你將會熟悉用來預測未來的精算分佈「工具箱」。
註:關於如何計算矩(Moments)或使用生成函數(Generating functions),請參閱「矩與累積量生成函數」章節。關於產生這些變量的「逆變換採樣法」(Inverse transform method),請參閱「泊松過程與模擬」章節。
1. 核心基礎:PDF 與 CDF
在連續的世界中,隨機變量 \(X\) 精確地等於某個特定數值的概率永遠為零:\(P(X = x) = 0\)。相反地,我們討論的是 \(X\) 落在某個範圍內的概率。
- 概率密度函數 (PDF), \(f(x)\): 這代表曲線的「高度」。曲線下的總面積必須等於 1。
- 累積分佈函數 (CDF), \(F(x)\): 這是 \(X\) 小於或等於某個數值 \(x\) 的概率。數學表達式為:\(F(x) = P(X \le x)\)。
小貼士:要找出兩點 \(a\) 與 \(b\) 之間的概率,你只需計算 \(F(b) - F(a)\) 即可。
2. 均匀分佈 (Uniform Distribution)
均匀分佈是最簡單的連續分佈。它假設在範圍 \([a, b]\) 內,所有長度相同的區間出現的機會均等。想像一個完美的平衡轉盤;指針停在 0.1 的機會與停在 0.9 的機會是完全一樣的。
\(X \sim U(a, b)\) 的關鍵性質:
- PDF: 對於 \(a \le x \le b\),\(f(x) = \frac{1}{b-a}\)。
- 期望值 (Mean): \(E(X) = \frac{a+b}{2}\)(正好在正中間!)。
- 方差 (Variance): \(Var(X) = \frac{(b-a)^2}{12}\)。
3. 指數分佈 (Exponential Distribution)
指數分佈是關於「等待時間」的分佈。精算師常用它來模擬獨立事件之間的時間間隔,例如客戶服務中心接到兩通電話之間的時間。
\(X \sim Exp(\lambda)\) 的關鍵性質:
- PDF: 對於 \(x > 0\),\(f(x) = \lambda e^{-\lambda x}\)。
- CDF: \(F(x) = 1 - e^{-\lambda x}\)。
- 期望值 (Mean): \(E(X) = \frac{1}{\lambda}\)。
- 方差 (Variance): \(Var(X) = \frac{1}{\lambda^2}\)。
你知道嗎? 指數分佈具有「無記憶性」(Memoryless)。這意味著如果你已經等了 10 分鐘索償才到,那麼再等 5 分鐘的概率,與你剛剛才開始等候時的概率是完全一樣的!(註:這是連續分佈中唯一的特性)。
4. 正態分佈 (Normal Distribution)
正態分佈(或稱「鐘形曲線」)是統計學中最著名的分佈。它是對稱的,並由其期望值 (\(\mu\)) 和方差 (\(\sigma^2\)) 定義。
\(X \sim N(\mu, \sigma^2)\) 的關鍵性質:
- 期望值 (Mean): \(E(X) = \mu\)。
- 方差 (Variance): \(Var(X) = \sigma^2\)。
- 標準化 (Standardization): 我們經常使用以下公式將 \(X\) 轉換為標準正態變量 \(Z \sim N(0, 1)\):\(Z = \frac{X - \mu}{\sigma}\)。
常見錯誤: 使用公式 \(Z = \frac{X - \mu}{\sigma}\) 時,請記住 \(\sigma\) 是標準差(方差的平方根)。同學經常忘記開方!
5. 對數正態分佈 (Lognormal Distribution)
如果一個變量的自然對數服從正態分佈,那麼該變量本身就是對數正態。這在保險業中非常受歡迎,用於模擬索償金額的大小,因為它是「偏斜」(Skewed)的——這意味著它有一條向右伸展的長尾巴,代表那些罕見但極其昂貴的索償。
定義: 如果 \(Y \sim N(\mu, \sigma^2)\),那麼 \(X = e^Y\) 就是對數正態分佈。
6. 伽瑪分佈 (Gamma Distribution)
伽瑪分佈比指數分佈更具靈活性。指數分佈模擬的是直到第一個事件發生的時間,而伽瑪分佈則可以模擬直到第 \(n\) 個事件發生的時間。
參數: 它通常具有形狀參數 (\(\alpha\)) 和率參數 (\(\lambda\))。
- 期望值 (Mean): \(E(X) = \frac{alpha}{\lambda}\)。
- 方差 (Variance): \(Var(X) = \frac{\alpha}{\lambda^2}\)。
註:如果 \(\alpha = 1\),伽瑪分佈實際上就是指數分佈!
7. 貝塔分佈 (Beta Distribution)
貝塔分佈非常獨特,因為它定義在固定區間內,通常是 \([0, 1]\)。這使它非常適合用來模擬比例或百分比,例如某份特定再保險合約所承擔的損失百分比。
8. 用於統計推斷的分佈
以下三種分佈主要用於對數據進行「檢驗」。你將在教學大綱的統計推斷(Statistical Inference)部分更頻繁地看到它們。
- 卡方分佈 (\(\chi^2\)): 伽瑪分佈的一個特例。它用於檢驗模型與數據的擬合程度(擬合優度檢驗)。
- t-分佈: 看起來像正態分佈,但擁有「更厚實的尾部」(Fatter tails)。當樣本量較小且不知道真實總體方差時,我們會使用它。
- F-分佈: 主要用於比較兩個不同的方差,以查看它們是否存在顯著差異。
9. 計算分位數與概率
在 CS1 考試中,你需要找出概率(例如 \(P(X < 10)\))或分位數(Quantiles,即滿足 \(P(X < x) = 0.95\) 的 \(x\) 值)。
Paper A(筆試/查表)
在 Paper A 中,你經常會用到 Formulae and Tables(黃表)。對於正態分佈,你會查閱「Phi」函數 \(\Phi(z)\) 來找出概率。至於其他分佈,你可能需要直接使用 CDF 公式。
Paper B(使用 R 語言)
在以 R 為基礎的考試 (CS1B) 中,你會使用標準指令。每個分佈都有一個前綴:
- p 代表概率 (CDF):例如
pnorm(x, mean, sd) - q 代表分位數 (Quantile):例如
qexp(0.95, rate) - r 代表產生隨機樣本 (Random samples):例如
rgamma(100, shape, rate)
重點回顧
- 連續變量是用來測量的,而不是計數的。
- 正態分佈是我們的對稱基準。
- 對數正態與伽瑪分佈對於模擬「偏斜」的保險索償數據至關重要。
- 指數分佈是處理等待時間的首選,並具有獨特的無記憶性。
- 分位數與概率可以在 Paper A 中透過查表或在 Paper B 中透過 R 函數找到。
做得好!你剛剛已經掌握了連續概率中的核心「角色」。請繼續練習這些分佈之間的聯繫,因為它們構成了精算統計學中幾乎所有內容的基礎。