欢迎来到非线性的世界!
到目前为止,在你的 Exam SRM 旅程中,你可能一直在接触最简单形式的线性模型 (Linear Models):“当 \(X\) 上升,\(Y\) 就会以固定幅度上升”。虽然这是一个很好的起点,但现实世界(以及精算数据)很少如此直接。有时变量之间的关系是曲线的,有时一个变量的影响完全取决于另一个变量。
在本章中,我们将探索变量变换 (Variable Transformations)(改变变量的形状)和交互作用 (Interactions)(观察变量如何共同发挥作用)。这些工具让我们的线性模型能够捕捉更复杂的现实模式,同时又不失普通最小二乘法 (Ordinary Least Squares, OLS) 的数学魔力。
1. 变量变换 (Variable Transformations)
变换涉及对预测变量 \(X\)、响应变量 \(Y\) 或两者同时应用数学函数。当原始数据不符合直线关系时,我们就会这样做。
A. 对数变换 (Logarithmic Transformations)
对数变换(通常是自然对数 \( \ln \))是精算师工具箱中最常用的工具之一。当数据高度偏斜 (skewed),或者我们预期变化是以“百分比”而非绝对单位发生时,它特别有用。
- 对数—线性模型 (Log-Linear Model): \( \ln(Y) = \beta_0 + \beta_1 X + \epsilon \)。在这里,\(X\) 每变动 1 个单位,\(Y\) 就会相应变动 \( (e^{\beta_1} - 1) \times 100\% \)。
- 双对数模型 (Log-Log Model): \( \ln(Y) = \beta_0 + \beta_1 \ln(X) + \epsilon \)。在这里,\( \beta_1 \) 代表弹性 (elasticity)——\(X\) 每变动 1%,会导致 \(Y\) 变动 \( \beta_1 \)%。
小贴士:如果你看到散点图中的点像喇叭一样散开(异方差性 heteroscedasticity),对 \(Y\) 进行对数变换通常有助于“稳定”这种方差!
B. 多项式回归 (Polynomial Regression)
有时 \(X\) 和 \(Y\) 之间的关系是曲线的(例如 U 形或 S 形)。为了捕捉这一点,我们可以在模型中加入多项式项,如 \(X^2\) 或 \(X^3\)。
\( Y = \beta_0 + \beta_1 X + \beta_2 X^2 + \dots + \beta_p X^p + \epsilon \)
尽管与 \(X\) 的关系是曲线的,这仍然是一个线性模型。为什么?因为模型对“参数”(\(\beta\)) 而言是线性的。我们只是把 \(X^2\) 当作一个全新的、独立的变量来处理。
常见错误:别做得太过火!加入次数太高的多项式(例如 \(X^8\))会导致过度拟合 (overfitting),模型会去追踪数据中的“噪声”而非真正的潜在模式。
快速复习:变换
- 对数变换处理乘法关系和偏斜数据。
- 多项式处理曲线(二次方、三次方)。
- 变换后务必观察你的残差图 (residual plots),看看误差中的“模式”是否已经消失。
2. 交互项 (Interaction Terms)
在标准线性模型中,我们假设 \(X_1\) 对 \(Y\) 的影响是恒定的,无论 \(X_2\) 的值是多少。但如果事实并非如此呢?
例子: 想想运动 (\(X_1\)) 和饮食 (\(X_2\)) 对减重 (\(Y\) ) 的影响。如果一个人同时配合健康饮食,运动对减重的效果可能会更显著。这种“协同效应”就是一种交互作用。
A. 交互作用公式
我们通过将两个预测变量相乘来表示交互作用:
\( Y = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \beta_3 (X_1 \times X_2) + \epsilon \)
在这个模型中:
- \( \beta_1 \) 和 \( \beta_2 \) 是主效应 (main effects)。
- \( \beta_3 \) 是交互效应 (interaction effect)。
B. 解读变化
你可以重写方程式,看看 \(X_1\) 的“斜率”是如何变化的:
\( Y = \beta_0 + (\beta_1 + \beta_3 X_2) X_1 + \beta_2 X_2 + \epsilon \)
\(X_1\) 的“有效斜率”现在是 \( (\beta_1 + \beta_3 X_2) \)。这意味着 \(X_1\) 的影响取决于 \(X_2\) 的数值。
C. 与定性变量(虚拟变量)的交互作用
这是 SRM 考试中非常常见的主题。如果你有一个定量变量(例如:年龄)和一个虚拟变量(例如:性别,男 = 1),加入交互项可以让不同组别拥有不同的斜率。
- 无交互作用: 平行线(截距不同,但斜率相同)。
- 有交互作用: 非平行线(截距不同,且斜率也不同)。
你知道吗? 在精算定价中,我们经常使用“地区”和“年龄”之间的交互作用,因为年轻司机在城市地区的风险可能比在郊区更高。
3. 等级原则 (The Hierarchical Principle)
这是 SRM 考试的一条“金科玉律”。等级原则指出,如果我们在模型中包含了一个交互项 (\(X_1 X_2\)),我们必须同时包含其对应的主效应 (\(X_1\) 和 \(X_2\))。
为什么? 即使 \(X_1\) 或 \(X_2\) 的 p 值单独看起来不显著,如果没有它们,交互项就很难被合理解释。主效应提供了交互作用发生偏离的基准。
例子: 如果你的软件输出显示 \(X_1 X_2\) 的 p 值非常小(显著),但 \(X_1\) 的 p 值很大(不显著),请两者都保留在模型中!
4. 模型选择的考量
当你加入变换(如 \(X^2\))或交互作用(如 \(X_1 X_2\))时,你正在增加模型的复杂度。这会增加预测变量的数量 \(d\)。
回想一下你在模型选择(在另一章节讨论)中所学到的内容:增加变量总会降低训练数据上的残差平方和 (RSS),但可能会损害模型在新数据上的表现。要决定变换或交互作用是否真的“值得”,我们会使用:
- T 检验 (T-tests): 查看新项的系数是否显著不为零。
- F 检验 (F-tests): 查看一组新项(如 \(X^2\) 和 \(X^3\))是否整体提升了模型。
- AIC/BIC: 对拥有过多参数的模型进行惩罚。(具体公式请参考模型选择标准章节)。
常见陷阱:解释说明
别忘了:当交互项存在时,你不能再简单地说“\(X_1\) 每增加 1 个单位会导致 \(Y\) 产生 \( \beta_1 \) 的变化”。你必须提到,该变化还取决于交互作用中另一个变量的水平!
重点回顾
1. 变换: 使用对数处理百分比或偏斜数据,使用多项式处理曲线。它们让线性模型能够拟合非线性的形状。
2. 交互作用: 当一个变量的影响随另一个变量而改变时使用。它们在回归方程中以乘积项的形式出现(例如 \(X_1 \times X_2\))。
3. 等级原则: 如果有交互项,主效应就必须保留。没有例外!
4. 复杂度 vs 拟合度: 使用统计检验(T 检验、F 检验)和标准(AIC、BIC)来确保你的变换和交互作用是真的为模型增值,而不仅仅是在制造噪声。