簡介
歡迎來到 CS1 課程中最具實用性的章節之一!在此之前,你可能一直將隨機變量視為靜態的「快照」。在本章中,我們將轉向研究事件如何隨時間演變,並學習 泊松過程 (Poisson process)。此外,我們還會學習統計學中的一個「神奇戲法」:逆變換模擬法 (Simulation by Inverse Transform)。這項技術能讓我們將 0 到 1 之間的簡單隨機數,轉換為幾乎任何我們想要的特定分佈數值。無論你是數學達人,還是覺得公式有點令人畏縮,這份筆記都能幫助你掌握這些核心原理。
1. 泊松過程
想像你正坐在咖啡店裡,計算有多少顧客進門。如果顧客以恆定的平均速率到達,且一個人的到達不會影響另一個人,那麼你觀察到的就是一個 泊松過程。
泊松過程的定義是什麼?
一個 速率 為 \(\lambda\)(其中 \(\lambda > 0\))的泊松過程,是用於模擬在固定時間間隔內發生事件次數的模型。在 CS1 課程大綱中,你需要掌握的最關鍵聯繫是它與 泊松分佈 (Poisson distribution) 的關係。
如果我們將 \(N(t)\) 定義為截止至時間 \(t\) 所發生的事件總數,則:
\(N(t) \sim \text{Poisson}(\lambda t)\)
在時間 \(t\) 內觀察到恰好 \(k\) 個事件的概率公式為:
\(P(N(t) = k) = \frac{e^{-\lambda t} (\lambda t)^k}{k!}\) 其中 \(k = 0, 1, 2, ...\)
核心特徵
- 獨立性: 一個時間段內的事件數量,不會影響另一個不重疊時間段內的事件數量。
- 恆定速率: 單位時間內的平均事件次數 \(\lambda\) 在整個過程中保持不變。
- 成正比例性: 在長度為 \(t\) 的區間內,期望的事件次數簡單地表示為 \(E[N(t)] = \lambda t\)。
小貼士: 務必檢查你的單位!如果 \(\lambda\) 是「每小時到達 3 人」,而題目要求計算 20 分鐘內的到達概率,請記住 \(t\) 應以小時為單位(即 \(t = 1/3\)),或者將 \(\lambda\) 轉換為「每 20 分鐘到達 1 人」。
總結表:過程 vs. 分佈
泊松過程: 隨時間發生的事件之連續「故事」。
泊松分佈: 在該時間段的特定窗口內所發生的事件「計數」。
2. 模擬:逆變換抽樣法
電腦是如何為正態分佈或指數分佈「生成」隨機數的?它們通常從 標準均勻 (Standard Uniform) 隨機變量 \(U \sim \text{Uniform}(0, 1)\) 開始,然後對其進行轉換。最基本的方法就是 逆變換抽樣法。
核心概念
每個概率分佈都有一個 累積分佈函數 (CDF),記作 \(F(x)\)。\(F(x)\) 的值永遠介乎 0 到 1 之間。逆變換法的原理是將此過程「反轉」:我們先選取一個 0 到 1 之間的隨機數 \(u\),然後找到滿足 \(F(x) = u\) 的 \(x\) 值。
步驟拆解:連續分佈
如果這看起來有點複雜,別擔心;只需遵循以下三個步驟:
- 找出 CDF: 確定 \(F(x) = P(X \le x)\) 的表達式。
- 將其設為 \(u\): 寫出方程 \(F(x) = u\)。
- 求解 \(x\): 整理方程,使 \(x\) 位於等號的一側。這就是你的「生成公式」 \(x = F^{-1}(u)\)。
範例:生成一個指數分佈 Exponential(\(\lambda\)) 的變量。
1. CDF 為 \(F(x) = 1 - e^{-\lambda x}\)。
2. 設 \(u = 1 - e^{-\lambda x}\)。
3. 求解 \(x\):
\(1 - u = e^{-\lambda x}\)
\(\ln(1 - u) = -\lambda x\)
\(x = -\frac{1}{\lambda} \ln(1 - u)\)
由於 \(u\) 服從均勻分佈 Uniform(0,1),\(1-u\) 實際上也服從均勻分佈 Uniform(0,1),因此我們通常將其簡化為:\(x = -\frac{1}{\lambda} \ln(u)\)。
步驟拆解:離散分佈
對於離散分佈(如二項分佈或泊松分佈),我們無法總是「解」方程,因為其 CDF 看起來像階梯。相反,我們使用 查表法。
如果我們有一個隨機數 \(u\):
- 如果 \(0 < u \le P(X = x_0)\),則 \(X = x_0\)。
- 如果 \(P(X = x_0) < u \le P(X = x_0) + P(X = x_1)\),則 \(X = x_1\)。
- 總括而言,我們選擇滿足 \(F(x_{i-1}) < u \le F(x_i)\) 的 \(x_i\) 值。
類比: 想像一把 1 米長的尺子被分成幾個部分。如果「0」的概率是 0.3,「1」的概率是 0.7,你就在 30 厘米處做個標記。你投擲飛鏢;如果落在 30 厘米之前,你選中的是「0」;如果落在 30 厘米之後,你選中的就是「1」。
關鍵要點:
逆變換抽樣法 非常強大,因為它只需要一個均勻隨機數就能生成一個目標分佈的樣本。它是 CS1 中基礎模擬實驗的「金科玉律」。
3. 應避免的常見陷阱
1. 混淆 \(f(x)\) 與 \(F(x)\): 進行逆變換時,務必使用 累積 分佈函數 (\(F(x)\)),而非概率密度函數 (\(f(x)\))。
2. 代數運算錯誤: 在整理 \(u = F(x)\) 時,處理自然對數 (\(\ln\)) 和正負號要非常小心。處理指數分佈時,最常見的錯誤就是漏掉負號。
3. 誤解泊松速率: 在泊松過程中,速率 \(\lambda\) 是「每單位時間」的。如果題目詢問的是 5 分鐘區間,而 \(\lambda\) 是以每分鐘計,那麼你的泊松分佈參數應為 \(5\lambda\)。
4. 快速複習框
- 泊松過程: 事件以速率 \(\lambda\) 發生;事件計數 \(N(t) \sim \text{Poisson}(\lambda t)\)。
- 逆變換(連續): 求解 \(x = F^{-1}(u)\)。
- 逆變換(離散): 在累積概率中找出 \(u\) 所屬的區間。
- 標準均勻分佈: 所有模擬的起點 (\(U \sim \text{Uniform}(0, 1)\))。
你知道嗎? 精算師常用泊松過程來模擬保險索償的到達情況。雖然現實世界的索償更為複雜,但泊松過程是理解風險隨時間演變的基礎基石!
下一步: 在 Paper B 中,你可能會使用 R 語言來執行這些模擬。至於 Paper A,請多練習代數運算,以便能快速反轉指數分佈、帕累托分佈 (Pareto) 或韋伯分佈 (Weibull) 的 CDF。