欢迎来到正则化回归与 K-最近邻算法的世界!

欢迎!在本章中,我们将学习如何让线性模型变得更强大。到目前为止,你可能已经学过普通最小二乘法 (Ordinary Least Squares, OLS) 回归,它的原理是透过最小化误差来寻找“最佳拟合”。但有时候,OLS 会显得有点“操之过急”——它可能会对数据过度拟合 (Overfit),导致它在解释过往数据时表现亮眼,但在预测未来时却惨不忍睹。

我们将探讨两种主要的解决方法:正则化 (Regularization)(透过在模型中加入“惩罚”来保持其简单性)以及 K-最近邻算法 (K-Nearest Neighbors, KNN)(一种透过查看“相似”数据点来预测的另类方法)。这些工具对于风险建模至关重要,因为它们能帮助我们建立稳定且可靠的模型。如果刚开始觉得有点复杂,别担心;我们会一步步拆解说明!


第一部分:收缩方法 (正则化回归)

在标准回归中,我们旨在最小化残差平方和 (Residual Sum of Squares, RSS)。然而,当我们有许多预测变量时,模型可能会变得过于复杂。收缩方法 (Shrinkage methods)(也称为正则化)会将系数估计值 (\(\beta\)) “收缩”至零。这能在稍微增加偏差 (Bias) 的代价下,降低模型的方差 (Variance)。

1. 岭回归 (Ridge Regression)

岭回归的运作方式是在 RSS 中加入一个惩罚项。其目标是最小化:

\(RSS + \lambda \sum_{j=1}^{p} \beta_j^2\)

其中:
- \(\lambda\) (Lambda):调整参数。它控制我们对系数大小的惩罚程度。
- \(\sum \beta_j^2\):这是 L2 惩罚项。它将系数进行平方。

关于岭回归你需要知道的事:
- 当 \(\lambda = 0\) 时,岭回归与 OLS 完全相同。
- 当 \(\lambda \to \infty\) 时,系数会向零收缩(但永远不会真正变成零!)。
- 重要:岭回归并不会执行变量选择。所有变量都会保留在模型中,只是系数变小了而已。

2. Lasso 回归

Lasso(最小绝对收缩与选择算子)与岭回归非常相似,但它使用了不同的惩罚项:

\(RSS + \lambda \sum_{j=1}^{p} |\beta_j|\)

其中:
- \(\sum |\beta_j|\):这是 L1 惩罚项。它取系数的绝对值。

关于 Lasso 你需要知道的事:
- 与岭回归不同,如果 \(\lambda\) 足够大,Lasso 可以强制将某些系数变为精确的零
- 这意味着 Lasso 会执行变量选择,让我们得到一个更简单、更具可解释性的模型。
- 记忆小撇步:“Lasso”就像套索一样,把变量套住,然后把没用的踢出圈外!

快速回顾:岭回归 vs. Lasso
- 岭回归:当大多数预测变量都有用时效果较好。它保留所有变量但进行收缩。
- Lasso:当只有少数预测变量真正重要时效果较好。它能消除“杂讯”变量。

正则化总结:

正则化帮助我们解决偏差-方差权衡 (Bias-Variance Trade-off)。透过增加一点点偏差(收缩系数),我们能显著降低方差,使我们的预测在处理新数据时更加稳定。


第二部分:选择调整参数 (\(\lambda\))

我们如何知道该使用哪一个 \(\lambda\) 呢?我们使用交叉验证 (Cross-Validation)。通常,我们会测试一系列的 \(\lambda\) 值,并选择产生最低交叉验证误差 (Cross-Validation Error) 的那一个。

需要避免的常见错误:
学生常认为 \(\lambda\) 越大越好,因为它能简化模型。记住:如果 \(\lambda\) 太大,模型会变得过于简单(偏差过高),从而忽略了数据中的真实规律(欠拟合/Underfitting)。


第三部分:K-最近邻算法 (KNN)

现在,让我们看看一种完全不同的方法。虽然回归属于参数方法 (Parametric)(它假设了一种特定的函数形式,例如直线),但 K-最近邻算法 (KNN)非参数方法 (Non-parametric)。它对数据的形状不做任何假设。

KNN 的运作方式:

想像你要预测一间房子的价格。你不是用数学公式计算,而是找出与它最相似的 K 间房子(它的“邻居”),并取它们价格的平均值。

1. 用于回归:找出最接近的 K 个点,并计算它们响应值的平均值
2. 用于分类:找出最接近的 K 个点,并对类别进行多数表决

K 的角色:

K 的选择至关重要:
- 小 K (例如 K=1):模型非常灵活且“蜿蜒”。它的偏差低方差高(容易过度拟合)。
- 大 K (例如 K=100):模型非常平滑。它的方差低偏差高(容易欠拟合)。

你知道吗?
随着 \(K\) 增加,KNN 模型的灵活性会降低。这与我们对数字的直观感受相反,所以考试时请特别留意这一点!

维度灾难 (Curse of Dimensionality):

KNN 听起来很棒,但它有一个称为维度灾难的重大弱点。在高维空间中(即预测变量很多时),所谓的“最近”邻居在距离上可能其实非常遥远。当预测变量 \(p\) 相对于观测值 \(n\) 的数量很大时,这会使 KNN 的表现远不如线性回归。


比较:线性回归 vs. KNN

为什么要选择其中一种而非另一种?

若符合以下情况,选择线性回归(或岭回归/Lasso):
- 预测变量与响应值之间的关系接近线性。
- 每个预测变量对应的数据量较少。
- 你需要简单地解释每个变量如何影响结果。

若符合以下情况,选择 KNN:
- 变量间的关系是高度非线性或“古怪”的。
- 你拥有海量的数据,但只有少数预测变量。
- 预测能力比了解“原因”更重要。


SRM 考试关键总结

1. 正则化 (岭回归/Lasso):
- 用于防止过度拟合并处理大量预测变量。
- 岭回归使用 \(\beta^2\),不会将系数归零。
- Lasso 使用 \(|\beta|\),可以将系数归零(变量选择)。

2. 调整参数 (\(\lambda\)):
- 控制偏差与方差的权衡。我们透过交叉验证找到最佳的 \(\lambda\)。

3. K-最近邻算法 (KNN):
- 基于相似性的非参数方法。
- 小 K = 高灵活性 / 高方差。
- 大 K = 低灵活性 / 高偏差。
- 会受到维度灾难的影响。

加油:你一定行的!正则化和 KNN 只是尝试在“过于简单”与“过于复杂”的模型之间寻找“甜蜜点”的不同手段。练习判断哪种方法最适合不同的情境,你就能准备好应付 SRM 考试中出现的任何题目!