歡迎來到非線性的世界!

到目前為止,在你的 Exam SRM 旅程中,你可能一直在接觸最簡單形式的線性模型 (Linear Models):「當 \(X\) 上升,\(Y\) 就會以固定幅度上升」。雖然這是一個很好的起點,但現實世界(以及精算數據)很少如此直接。有時變量之間的關係是曲線的,有時一個變量的影響完全取決於另一個變量。

在本章中,我們將探索變量變換 (Variable Transformations)(改變變量的形狀)和交互作用 (Interactions)(觀察變量如何共同發揮作用)。這些工具讓我們的線性模型能夠捕捉更複雜的現實模式,同時又不失普通最小二乘法 (Ordinary Least Squares, OLS) 的數學魔力。


1. 變量變換 (Variable Transformations)

變換涉及對預測變量 \(X\)、響應變量 \(Y\) 或兩者同時應用數學函數。當原始數據不符合直線關係時,我們就會這樣做。

A. 對數變換 (Logarithmic Transformations)

對數變換(通常是自然對數 \( \ln \))是精算師工具箱中最常用的工具之一。當數據高度偏斜 (skewed),或者我們預期變化是以「百分比」而非絕對單位發生時,它特別有用。

  • 對數—線性模型 (Log-Linear Model): \( \ln(Y) = \beta_0 + \beta_1 X + \epsilon \)。在這裡,\(X\) 每變動 1 個單位,\(Y\) 就會相應變動 \( (e^{\beta_1} - 1) \times 100\% \)。
  • 雙對數模型 (Log-Log Model): \( \ln(Y) = \beta_0 + \beta_1 \ln(X) + \epsilon \)。在這裡,\( \beta_1 \) 代表彈性 (elasticity)——\(X\) 每變動 1%,會導致 \(Y\) 變動 \( \beta_1 \)%。

小貼士:如果你看到散點圖中的點像喇叭一樣散開(異方差性 heteroscedasticity),對 \(Y\) 進行對數變換通常有助於「穩定」這種方差!

B. 多項式回歸 (Polynomial Regression)

有時 \(X\) 和 \(Y\) 之間的關係是曲線的(例如 U 形或 S 形)。為了捕捉這一點,我們可以在模型中加入多項式項,如 \(X^2\) 或 \(X^3\)。

\( Y = \beta_0 + \beta_1 X + \beta_2 X^2 + \dots + \beta_p X^p + \epsilon \)

儘管與 \(X\) 的關係是曲線的,這仍然是一個線性模型。為什麼?因為模型對「參數」(\(\beta\)) 而言是線性的。我們只是把 \(X^2\) 當作一個全新的、獨立的變量來處理。

常見錯誤:別做得太過火!加入次數太高的多項式(例如 \(X^8\))會導致過度擬合 (overfitting),模型會去追蹤數據中的「雜訊」而非真正的潛在模式。

快速複習:變換
  • 對數變換處理乘法關係和偏斜數據。
  • 多項式處理曲線(二次方、三次方)。
  • 變換後務必觀察你的殘差圖 (residual plots),看看誤差中的「模式」是否已經消失。

2. 交互項 (Interaction Terms)

在標準線性模型中,我們假設 \(X_1\) 對 \(Y\) 的影響是恆定的,無論 \(X_2\) 的值是多少。但如果事實並非如此呢?

例子: 想想運動 (\(X_1\)) 和飲食 (\(X_2\)) 對減重 (\(Y\) ) 的影響。如果一個人同時配合健康飲食,運動對減重的效果可能會更顯著。這種「協同效應」就是一種交互作用

A. 交互作用公式

我們透過將兩個預測變量相乘來表示交互作用:

\( Y = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \beta_3 (X_1 \times X_2) + \epsilon \)

在這個模型中:

  • \( \beta_1 \) 和 \( \beta_2 \) 是主效應 (main effects)
  • \( \beta_3 \) 是交互效應 (interaction effect)

B. 解讀變化

你可以重寫方程式,看看 \(X_1\) 的「斜率」是如何變化的:

\( Y = \beta_0 + (\beta_1 + \beta_3 X_2) X_1 + \beta_2 X_2 + \epsilon \)

\(X_1\) 的「有效斜率」現在是 \( (\beta_1 + \beta_3 X_2) \)。這意味著 \(X_1\) 的影響取決於 \(X_2\) 的數值。

C. 與定性變量(虛擬變量)的交互作用

這是 SRM 考試中非常常見的主題。如果你有一個定量變量(例如:年齡)和一個虛擬變量(例如:性別,男 = 1),加入交互項可以讓不同組別擁有不同的斜率

  • 無交互作用: 平行線(截距不同,但斜率相同)。
  • 有交互作用: 非平行線(截距不同,且斜率也不同)。

你知道嗎? 在精算定價中,我們經常使用「地區」和「年齡」之間的交互作用,因為年輕司機在城市地區的風險可能比在郊區更高。


3. 等級原則 (The Hierarchical Principle)

這是 SRM 考試的一條「金科玉律」。等級原則指出,如果我們在模型中包含了一個交互項 (\(X_1 X_2\)),我們必須同時包含其對應的主效應 (\(X_1\) 和 \(X_2\))。

為什麼? 即使 \(X_1\) 或 \(X_2\) 的 p 值單獨看起來不顯著,如果沒有它們,交互項就很難被合理解釋。主效應提供了交互作用發生偏離的基準。

例子: 如果你的軟體輸出顯示 \(X_1 X_2\) 的 p 值非常小(顯著),但 \(X_1\) 的 p 值很大(不顯著),請兩者都保留在模型中!


4. 模型選擇的考量

當你加入變換(如 \(X^2\))或交互作用(如 \(X_1 X_2\))時,你正在增加模型的複雜度。這會增加預測變量的數量 \(d\)。

回想一下你在模型選擇(在另一章節討論)中所學到的內容:增加變量總會降低訓練數據上的殘差平方和 (RSS),但可能會損害模型在新數據上的表現。要決定變換或交互作用是否真的「值得」,我們會使用:

  • T 檢定 (T-tests): 查看新項的係數是否顯著不為零。
  • F 檢定 (F-tests): 查看一組新項(如 \(X^2\) 和 \(X^3\))是否整體提升了模型。
  • AIC/BIC: 對擁有過多參數的模型進行懲罰。(具體公式請參考模型選擇標準章節)。
常見陷阱:解釋說明

別忘了:當交互項存在時,你不能再簡單地說「\(X_1\) 每增加 1 個單位會導致 \(Y\) 產生 \( \beta_1 \) 的變化」。你必須提到,該變化還取決於交互作用中另一個變量的水平!


重點回顧

1. 變換: 使用對數處理百分比或偏斜數據,使用多項式處理曲線。它們讓線性模型能夠擬合非線性的形狀。

2. 交互作用: 當一個變量的影響隨另一個變量而改變時使用。它們在回歸方程中以乘積項的形式出現(例如 \(X_1 \times X_2\))。

3. 等級原則: 如果有交互項,主效應就必須保留。沒有例外!

4. 複雜度 vs 擬合度: 使用統計檢定(T 檢定、F 檢定)和標準(AIC、BIC)來確保你的變換和交互作用是真的為模型增值,而不僅僅是在製造噪音。