多元线性回归简介

欢迎来到 CS1 课程中最具实用价值的章节之一!在上一章中,我们探讨了简单线性回归 (Simple Linear Regression),即仅利用一个解释变量来预测响应变量(例如:仅根据投保人的年龄来预测索赔金额)。然而在现实世界中,情况鲜有如此简单。

多元线性回归 (Multiple Linear Regression, MLR) 允许我们同时使用多个解释变量。想象一下你正在为汽车保险定价:你不会只看驾驶者的年龄,还会考虑汽车的发动机排量、居住地区以及享有多少年的无赔款优待 (NCD)。本章将教你如何处理多个输入变量,以及最关键的一点——如何决定哪些变量真正应该留在你的模型中。

1. 多元线性回归模型

在 MLR 中,我们假设响应变量 \( Y \) 是多个解释变量 \( x_1, x_2, \dots, x_k \) 的线性组合,再加上一些随机误差。

第 \( i \) 个观测值的模型公式如下:

\( Y_i = \beta_0 + \beta_1 x_{i1} + \beta_2 x_{i2} + \dots + \beta_k x_{ik} + \epsilon_i \)

其中:

  • \( Y_i \) 是响应变量(例如:总索赔金额)。
  • \( x_{i1}, x_{i2}, \dots, x_{ik} \) 是解释变量(例如:年龄、汽车马力、行驶里程)。
  • \( \beta_0 \) 是截距 (Intercept)
  • \( \beta_1, \dots, \beta_k \) 是每个变量的斜率参数(系数)
  • \( \epsilon_i \) 是随机误差项,通常假设其为独立且服从正态分布:\( \epsilon_i \sim N(0, \sigma^2) \ Hexadecimal \)。

核心假设:线性 (Linearity)

别被“线性”这个词误导。MLR 中的“线性”是指相对于参数 (\( \beta \)) 的线性,而不是变量本身。你的模型中可以包含像 \( x^2 \) 这样的变量,只要它的形式维持 \( \beta_j x_j^2 \),它仍然属于线性回归模型。

2. 解释系数

考试中最常见的题目之一就是解释特定 \( \beta \) 的含义。在 MLR 中,我们应用“在其他因素不变”的原则。

解释: 系数 \( \beta_j \) 代表当模型中所有其他解释变量保持不变时,\( x_j \) 每增加一个单位,响应变量 \( Y \) 的预期变化量。

例子: 如果“驾龄”的系数是 \( -50 \),这意味着在汽车类型和地区保持不变的情况下,驾龄每增加一年,预测保费会减少 \$50。

快速复习: 在 Paper B (R 语言考试) 中,你会使用 lm() 函数来寻找这些估计值。输出结果会为每个系数提供估计值 (Estimate)标准误差 (Standard Error)t 值 (t-value) 以及 p 值 (p-value)

3. 评估模型拟合优度

建立模型后,我们需要知道它的表现如何。我们主要使用两个指标:

决定系数 (\( R^2 \))

\( R^2 = \frac{SS_{Reg}}{SS_{Tot}} = 1 - \frac{SS_{Res}}{SS_{Tot}} \)

这告诉我们 \( Y \) 的总变异中,有多少比例是可以由模型解释的。其取值范围从 0 到 1(即 0% 到 100%)。

\( R^2 \) 的问题:过拟合 (Overfitting)

这是许多同学都会掉进的陷阱:增加更多变量总是会提高 \( R^2 \)(或至少维持不变),即使那些变量完全没用!如果你不断添加变量,可能会导致模型“过拟合”,这意味着模型只是在解释特定数据集中的随机噪声,而非底层的真实趋势。

调整后 \( R^2 \) (Adjusted \( R^2 \))

为了修正过拟合的问题,我们使用调整后 \( R^2 \)。这个指标会惩罚添加不必要变量的行为。只有当新变量带来的改进程度超过随机预期时,调整后 \( R^2 \) 才会增加。

\( Adjusted \ R^2 = 1 - (1 - R^2) \frac{n - 1}{n - k - 1} \)

其中 \( n \) 是观测值数量,\( k \) 是解释变量的数量。

4. 解释变量的选择

我们该如何决定保留哪些变量?精算师会使用几种策略来寻找“简约模型”(Parsimonious model,即表现良好且最简单的模型)。

偏 F 检验 (比较嵌套模型)

如果你有一个“大模型”(包含许多变量)和一个“小模型”(仅包含其中部分变量),你可以使用 F 检验来看看大模型中额外的变量是否显著。

原假设 \( H_0 \) 为额外的系数全部为零(即额外的变量没有用处)。

赤池信息量准则 (AIC)

AIC 是精算实务中非常受欢迎的模型选择指标。它在“似然度”(模型拟合程度)与“简约度”(使用的变量数量)之间取得平衡。

规则: 在比较模型时,通常优先选择 AIC 值最低 的模型。

逐步选取程序 (Stepwise Selection)

手动筛选很慢,所以我们经常使用这些算法:

  • 向后剔除法 (Backward Elimination): 从包含所有可能变量开始,移除 p 值最高(最不显著)的一个。重复此步骤,直到所有剩余变量都显著(通常为 p < 0.05)。
  • 向前选取法 (Forward Selection): 从没有变量开始,添加能带来最显著改进的变量。重复此步骤,直到无法再添加显著变量。
  • 逐步选取法 (Stepwise): 两者的结合,在每一步中都可以添加或移除变量。

应避免的常见错误: 不要孤立地看 p 值。如果两个变量高度相关(例如“驾驶者年龄”和“取得执照年数”),同时放入模型可能会让两者看起来都不显著!这称为多重共线性 (Multicollinearity)。

5. 多元回归中的预测

就像简单回归一样,我们可以使用拟合好的模型来预测未来值。你需要了解两种类型的区间:

  • 置信区间 (Confidence Interval): 针对响应变量的平均值(给定一组 \( x \) 下的平均 \( Y \))。
  • 预测区间 (Prediction Interval): 针对单个未来的观测值。

核心重点: 预测区间总是比置信区间更宽,因为单个观测值具有更多的不确定性(它包含了平均值的变异加上随机误差 \( \sigma^2 \))。

6. 模型选择标准总结

选择最佳解释变量组合时,请留意:

  1. 低 AIC: 代表拟合度与简约度之间取得了良好平衡。
  2. 高调整后 \( R^2 \): 代表变量确实增加了模型解释力。
  3. 显著的 p 值: 各别系数的 p 值通常应 \( < 0.05 \)。
  4. 残差分析 (Residual Analysis): 务必检查残差是否看起来像随机噪声(无规律模式)。如果残差呈现某种模式,说明你可能漏掉了一个变量,或者需要更换模型类型。

备注:残差分析将在“残差分析与模型验证”章节详细讨论。现在只需记住,它是检查变量选择是否成功的关键步骤!

你知不知道? 在 Paper B 中,如果题目要求你选择最佳模型,你通常应该拟合几个不同的变体,比较它们的 AIC 值,并检查系数的 p 值。如果 AIC 值非常接近,通常优先选择较简单的模型(简约原则,Principle of Parsimony)!