歡迎來到「偏移項 (Offsets)」與「權重 (Weights)」的世界!
在我們探索廣義線性模型 (GLMs) 的過程中,已經學會如何運用各種特徵來預測結果。但當某些觀測值並不「等價」時,我們該怎麼辦呢?舉個例子,如果你在預測車禍發生率,將一個開車僅一個月的人與一個開車十年的人放在一起比較,這合理嗎?當然不合理!
在本章中,我們將學習偏移項 (Offsets) 與權重 (Weights)。這兩個關鍵工具能幫助模型處理數據在「規模」或「可靠性」上的差異。如果初看之下覺得有點抽象也不用擔心,我們將透過簡單的類比和循序漸進的邏輯來一一拆解。
第一部分:偏移項 (Offsets) – 處理風險暴露 (Exposure)
想像你在經營一個檸檬水攤。你想預測會有多少顧客上門。如果你今天只開 2 小時,明天開 10 小時,你會預期兩天的顧客人數一樣嗎?當然不會!當你營業時間越長,你接觸到顧客的風險暴露 (Exposure) 就越多。
什麼是偏移項 (Offset)?
偏移項 (Offset) 是一種特殊的預測變數,其係數固定為 1。與其他變數不同的是,模型不需要計算其「斜率」(\(\beta\));對於偏移項,我們已經確切知道它與目標變數之間的關係:在連結函數 (link-function) 的尺度上呈線性關係。
卜瓦松分佈範例 (最常見的應用場景)
在 Exam PA 中,偏移項最常用於卜瓦松回歸 (Poisson regression) 來進行費率 (rates) 建模。通常,卜瓦松模型預測的是計數 (\(\mu\)),但我們往往想預測的是費率,例如「每年索賠次數」。
數學表達如下:
\(\text{Rate} = \frac{\mu}{E}\),其中 \(E\) 是風險暴露 (exposure)。
如果我們使用對數連結函數 (log link) (卜瓦松模型的標準做法),我們會得到:
\(\ln(\frac{\mu}{E}) = \beta_0 + \beta_1 X_1 + ...\)
利用對數法則,這會變成:
\(\ln(\mu) - \ln(E) = \beta_0 + \beta_1 X_1 + ...\)
\(\ln(\mu) = \mathbf{\ln(E)} + \beta_0 + \beta_1 X_1 + ...\)
請注意,\(\ln(E)\) 只是被加在後面,它沒有需要被估計的 \(\beta\) 係數。這就是你的偏移項 (Offset)!
偏移項重點摘要:
- 目的: 調整不同層級的風險暴露 (時間、距離、保單數量)。
- 係數: 永遠固定為 1。模型被強制要求將其視為直接比例關係。
- 對數技巧: 在 R 語言中,如果你使用 log link,你必須將風險暴露的對數值 (log of the exposure) 作為偏移項傳入。
小撇步: 可以把偏移項想像成一個「尺度調整器」。它能拉平起跑線,讓你可以公平地比較 1 個月的保單與 12 個月的保單。
第二部分:權重 (Weights) – 處理可靠性 (Reliability)
現在,讓我們來談談權重 (Weights)。在 GLMs 中,我們經常使用「先驗權重 (Prior Weights)」 (有時記為 \(\omega\))。
什麼是權重 (Weight)?
權重告訴模型單一資料列承載了多少資訊量或精確度。在計算模型參數時,權重較高的資料列被視為更「可靠」或「重要」。
「平均數」的類比
想像你在觀察兩所學校的平均考試成績:
1. A 校: 平均成績 90 分 (基於 5 位學生)。
2. B 校: 平均成績 85 分 (基於 500 位學生)。
如果你要預測全城市的平均成績,你會比較相信哪所學校的數據?當然是 B 校,因為樣本數大得多。在 GLM 中,你會給 B 校分配一個較高的權重。
權重如何影響模型
在 GLM 中,觀測值的變異數通常定義為:
\(\text{Var}(Y_i) = \frac{\phi V(\mu_i)}{\omega_i}\)
其中:
- \(\phi\) 是離散參數 (dispersion parameter)。
- \(V(\mu_i)\) 是變異數函數。
- \(\omega_i\) 是權重。
注意權重是在分母。這意味著:
- 較大的權重 (\(\omega\)) = 較小的變異數。
- 較小的變異數 = 更高的確定性。
權重的常見應用場景:
- 分組數據 (Grouped Data): 如果你的資料列代表 \(n\) 個觀測值的平均值,請將 \(n\) 作為權重。
- 二項分佈模型 (Binomial Models): 當對成功的比例建模時,試驗次數 (\(n\)) 即作為權重。
你知道嗎? 當數據在送達你手中之前已經經過「彙總」或「總結」時,使用權重是非常常見的做法。
第三部分:偏移項 vs. 權重 (總結表)
學生常常搞混這兩個概念。這裡有一個簡單的區分方法:
| 特徵 | 偏移項 (Offset) | 權重 (Weight) |
|---|---|---|
| 主要目標 | 調整平均數 (預期計數)。 | 調整精確度 (變異數)。 |
| 對公式影響 | 加入線性預測項 (係數 = 1)。 | 用於縮放變異數/影響力。 |
| 類比 | 「我營業了 5 小時,而不是 1 小時。」 | 「我的數據基於 100 人,而不是 1 人。」 |
| 典型變數 | Log(風險暴露)、Log(時間)。 | 試驗次數、樣本大小。 |
第四部分:常見陷阱與錯誤
如果剛開始覺得很難,別擔心!即便是資深的精算師有時也會搞混。以下是在 Exam PA 中最需要避免的錯誤:
- 忘記對偏移項取對數 (Log): 如果你使用帶有 log link 的卜瓦松模型,你必須在將風險暴露變數作為偏移項之前,先取自然對數。否則,模型會假設你的風險暴露比實際值大上指數倍!
- 將權重用於計數資料: 如果你正在對原始計數進行建模,通常不需要為樣本大小設置權重 (卜瓦松分佈會根據平均數自行處理變異數)。權重較常用於對平均值或比例進行建模時。
- 搞混係數: 請記住,如果一個變數被設為偏移項,R 語言不會顯示它的 p-value 或係數,因為它的值已固定為 1。如果你在摘要輸出中看到它帶有估計出的 \(\beta\),那就代表它沒有被當作偏移項處理!
快速複習箱
1. 偏移項 (Offsets): 用於「風險暴露」。係數固定為 1。加入線性預測項中。
2. 權重 (Weights): 用於「可靠性」。與變異數成反比。權重越高 = 對模型影響力越大。
3. 卜瓦松連結函數: 當使用 log-link 卜瓦松模型時,偏移項通常是 log(Exposure)。
關鍵總結
偏移項透過考慮「機會窗口」(風險暴露),使平均數的比較更公平。權重則透過考慮數據點的「確定性」(可靠性),使估計過程更公平。精通這兩項工具,你就能建立出真正反映保險與商業數據背後風險的模型!