欢迎来到多元回归的世界!
在之前的学习中,我们探讨了简单线性回归 (Simple Linear Regression, SLR),利用一个变量(例如市场收益率)来预测另一个变量(例如股票收益率)。但说实话,现实世界往往没那么简单!一档股票的价格不仅受市场影响,还同时受利率、油价及公司获利等多重因素影响。
在本章中,我们将踏入现实世界,学习多元线性回归 (Multiple Linear Regression, MLR)。这让我们能利用多个解释变量来解释单一因变量。如果起初觉得数学有点复杂,请别担心;我们会把它拆解成小部分来学习。读完这些笔记后,你会发现它其实只是你所学知识的延伸!
1. 多元回归模型
在多元回归中,我们试图在多维数据点组成的“云状分布”中找到一条“最佳拟合”线。其数学公式如下:
\( Y_i = \beta_0 + \beta_1 X_{1i} + \beta_2 X_{2i} + ... + \beta_k X_{ki} + \epsilon_i \)
其中:
- \( Y_i \):因变量(我们想预测的对象)。
- \( \beta_0 \):截距项(若所有 \(X\) 均为零时,\(Y\) 的数值)。
- \( \beta_1, \beta_2... \):偏回归系数 (Partial regression coefficients)。
- \( X_1, X_2... \):自变量(解释变量)。
- \( \epsilon_i \):误差项(其他影响 \(Y\) 但未纳入模型的因素)。
理解“偏”效应
对于 FRM 考试,最重要的一点是如何解读这些系数。我们使用“其他条件不变”(ceteris paribus) 这一概念。
范例:假设我们根据房屋面积 (\(X_1\)) 和卧室数量 (\(X_2\)) 来预测房价 (\(Y\))。如果 \(\beta_1 = 150\),这意味着在保持卧室数量不变的前提下,房屋面积每增加 1 个单位,房价将增加 150 美元。
快速复习:在多元回归中,每个系数都告诉我们在保持模型中所有其他变量不变的情况下,该特定变量的影响。
2. 拟合优度:\(R^2\) 与调整后 \(R^2\)
在简单回归中,我们使用 \(R^2\) 来观察模型对数据的解释程度。但在多元回归中,标准 \(R^2\) 存在一个“陷阱”。
问题所在:每当你在模型中增加一个新变量时——即使它完全没用(例如用“天空中的鸟类数量”来预测“股票价格”)——\(R^2\) 永远会保持不变或上升。它绝对不会下降!
解决方案:调整后 \(R^2\) (Adjusted \(R^2\))
为了修正这个问题,我们使用调整后 \(R^2\)(记作 \(\bar{R}^2\))。这个版本会针对那些无法有效解释因变量的变量进行“惩罚”。这有助于我们判断增加一个新变量是否真的值得。
\( \bar{R}^2 = 1 - \frac{(1-R^2)(n-1)}{n-k-1} \)
其中:
- \( n \) = 样本数
- \( k \) = 自变量个数
你知道吗?由于增加了对变量个数的惩罚机制,调整后 \(R^2\) 永远会小于或等于标准 \(R^2\)。如果在考试题目中看到调整后 \(R^2 > R^2\),那肯定是一个陷阱题!
关键结论:使用 \(R^2\) 来查看被解释的变异量,但在比较不同变量个数的模型时,请务必使用调整后 \(R^2\)。
3. 假设检验:T 检验与 F 检验
建立模型后,我们需要知道这些变量是否真的重要。我们主要使用两种类型的检验:
T 检验(个别显著性)
我们使用 T 检验来检查单一变量是否具备统计显著性。
零假设 (\(H_0\)): \(\beta_i = 0\)(该变量无影响)。
公式: \( t = \frac{\text{估计系数} - \text{假设值}}{\text{系数标准误}} \)
F 检验(联合显著性)
F 检验用于检查所有解释变量作为一个整体是否具有预测力。它检验的是至少有一个 \(\beta\) 系数不为零。
零假设 (\(H_0\)): \(\beta_1 = \beta_2 = ... = \beta_k = 0\)。
类比:如果 T 检验像是检查球队中某位球员的个人能力,那么 F 检验就像是检查整支球队是否有赢球的能力。
常见错误:学生常误以为若所有个别 T 检验都失败,F 检验也一定会失败。事实并非如此!有时变量在一起工作时的效果比单独存在时更好。
4. 陷阱:遗漏变量偏差与多重共线性
多元回归功能强大,但 FRM 考试中必须辨识两大“死敌”。
死敌一:遗漏变量偏差 (Omitted Variable Bias, OVB)
当你遗漏了一个既重要(会影响 \(Y\))又与模型中现有变量高度相关的变量时,就会发生这种情况。
结果:你的估计系数将会是有偏差的 (biased) 且不一致的 (inconsistent)。模型会把遗漏变量的功劳(或责任)“归咎”到你纳入的变量上。
死敌二:多重共线性 (Multicollinearity)
当两个或多个“自变量”之间高度相关时就会发生。例如,如果你试图用“左腿长度”和“右腿长度”来预测一个人的身高。
如何察觉:
1. \(R^2\) 非常高,且 F 检验显著。
2. 但是,个别 T 检验并不显著(单看这些变量似乎没用)。
3. 系数的标准误非常大。
类比:想象两个人同时大喊相同的讯息。你知道讯息正在传递(高 \(R^2\)),但你无法分辨是谁在传递哪部分的讯息(低 T 统计量)。
快速复习:OVB 让你的结果错误(偏差);多重共线性则让你的结果不可靠(高方差/高标准误)。
5. 多元回归模型的假设
为了使我们的 OLS(普通最小二乘法)估计量成为“最佳线性无偏估计量”(BLUE),必须满足某些假设。这些是延伸至多元回归的高斯-马尔可夫假设 (Gauss-Markov Assumptions):
1. 线性:变量间的关系是线性的。
2. 随机抽样:数据为具代表性的样本。
3. 无完全共线性:没有任何自变量是其他变量的完全线性组合。
4. 零条件期望:给定 \(X\) 时,误差项的期望值为零。\(E(\epsilon | X) = 0\)。(这是关于偏差最重要的一点!)
5. 同方差性 (Homoskedasticity):误差项的方差在所有观察值中保持恒定。
总结重点:
- 系数:解读时记得“保持其他变量不变”。
- 调整后 \(R^2\):用于比较模型;它会惩罚模型的复杂度。
- F 检验:检验整体模型;T 检验检验单一变量。
- 多重共线性:\(X\) 变量间高度相关会导致标准误过大、T 统计量过低。
- OVB:当遗漏了相关变量时发生,导致估计值出现偏差。