欢迎来到多元回归的世界!
在 Level I,你已经学过简单线性回归——即使用单一变量(例如市场回报)来预测另一件事(例如股票回报)。但说实话,现实世界远比这复杂。房价不仅仅取决于面积,还受限于地理位置、楼龄以及浴室数量等因素。
多元线性回归 (Multiple Linear Regression, MLR) 正是你处理这些“现实世界”复杂性的工具。它让我们能够利用两个或以上的自变量来解释一个因变量。别担心,如果这些公式一开始看起来有点吓人,我们会一步步为你拆解!
1. 多元回归模型
多元回归的基本方程如下:
\( Y_i = b_0 + b_1X_{1i} + b_2X_{2i} + ... + b_kX_{ki} + \epsilon_i \)
其中:
- \( Y_i \):因变量(你试图预测的目标)。
- \( b_0 \):截距(当所有 \( X \) 都为零时,\( Y \) 的数值)。
- \( b_1, b_2, ..., b_k \):偏回归系数 (Partial regression coefficients)。
- \( X_{1}, X_{2}, ..., X_{k} \):自变量(预测因子)。
- \( \epsilon_i \):误差项(模型无法解释的“噪音”)。
- \( k \):自变量的数量。
核心概念:偏斜率系数
这是考试中的热门考点!一个系数(例如 \( b_1 \))告诉你,在保持其他所有自变量不变的前提下,\( X_1 \) 每变动一个单位,\( Y \) 会随之改变多少。这部分“保持不变”非常重要,意味着我们正在抽离出该特定变量的独特影响。
例子: 如果我们根据工作年限 (\( X_1 \)) 和教育程度 (\( X_2 \)) 来预测薪资,那么工作年限的系数就代表了在教育程度完全相同的情况下,每多工作一年所带来的薪资增长。快速回顾:
- 因变量 (Dependent Variable) = 结果
- 自变量 (Independent Variables) = 原因/预测因子
- 解读 \( b_j \): 在 ceteris paribus(其他条件不变)的情况下,\( X_j \) 每变动 1 个单位时,\( Y \) 的变化量。
2. MLR 的 6 大基础假设
为了确保回归模型可靠,它必须遵循一些规则。如果这些规则被破坏,我们的结论可能会出现“偏差”或根本错误。以下是有效 MLR 的“食谱”:
1. 线性关系 (Linearity): 因变量与自变量之间必须是线性关系。(不容许曲线!)
2. 无多重共线性 (No Multicollinearity): 自变量之间不存在高度相关性。
3. 同方差性 (Homoscedasticity): 误差项的方差在所有观测值中保持不变。(如果误差的“散布”会改变,我们称之为异方差性 (Heteroscedasticity))。
4. 误差项独立性 (Independence of Errors): 一个观测值的误差项与另一个观测值的误差项无关。(无自相关性 (Autocorrelation))。
5. 常态性 (Normality): 误差项呈常态分布。
6. 自变量与误差项独立 (Independence of X and Error): 自变量与误差项之间没有相关性。
助记口诀: "LINE-M"
- Linear relationship (线性关系)
- Independent errors (误差独立)
- Normal errors (误差呈常态分布)
- Equal variance (等方差性,即同方差性)
- Multicollinearity (无多重共线性!)
重点: 如果这些假设成立,我们的估计量就是 BLUE(最佳线性不偏估计量,Best Linear Unbiased Estimators)。
3. 评估模型:ANOVA 与 R-平方
模型运行后,我们如何判断它是否真的好用?我们可以使用 ANOVA(方差分析) 表格。
三个平方和
1. 总平方和 (Total Sum of Squares, SST): 因变量的总变异。
2. 回归平方和 (Regression Sum of Squares, RSS): 由你的模型所解释的变异。
3. 残差平方和 (Sum of Squared Errors, SSE): 模型未能解释的“剩余”变异。
关系式: \( SST = RSS + SSE \)
R-平方 (\( R^2 \)) 与 调整后 R-平方 (\( R^2_{adj} \))
\( R^2 \)(判定系数)告诉我们因变量中由自变量解释的变异百分比。
\( R^2 = \frac{RSS}{SST} \)
你知道吗? 如果你在模型中添加*任何*新变量,\( R^2 \) 要么保持不变,要么上升。它永远不会下降!这是一个问题,因为我们可能会仅仅为了让模型看起来更好看而添加无用的变量。
为了修正这个问题,我们使用 调整后 \( R^2 \) (Adjusted \( R^2 \)):
\( R^2_{adj} = 1 - [(\frac{n-1}{n-k-1}) \times (1 - R^2)] \)
调整后 \( R^2 \) 会对那些不能提供实际价值的变量进行惩罚。它永远小于或等于 \( R^2 \)。
4. 假设检验:结果显著吗?
我们主要使用两个检验来查看模型是否真正提供了有用的信息。
t 检验 (个别显著性)
某个特定的自变量是否有用?
- 零假设 (\( H_0 \)): \( b_j = 0 \)(该变量无效)。
- 对立假设 (\( H_a \)): \( b_j \neq 0 \)(该变量显著)。
- 计算: \( t = \frac{\text{估计系数}}{\text{系数标准误}} \)
F 检验 (整体显著性)
所有自变量放在一起是否能解释 \( Y \) 的变异?
- 零假设 (\( H_0 \)): \( b_1 = b_2 = ... = b_k = 0 \)(整个模型无效)。
- 计算: \( F = \frac{MSR}{MSE} = \frac{RSS/k}{SSE/(n-k-1)} \)
注意:F 检验永远是单尾检验。如果计算出的 F 值大于临界 F 值,我们拒绝零假设,并称该模型显著。
常见错误: 不要混淆 t 检验和 F 检验。使用 t 检验 来检测单一变量,使用 F 检验 来检测整个变量群组。
5. 估计标准误 (SEE)
SEE 用来衡量误差项的标准差。它告诉我们实际数据点围绕回归线变动的程度。
- 较小的 SEE 意味着模型的预测更“精确”。
- 公式: \( SEE = \sqrt{MSE} = \sqrt{\frac{SSE}{n-k-1}} \)
核心重点: 将 SEE 视为模型的“平均误差”。数值越低越好!
成功清单
在进入下一章之前,请确保你能:
- [ ] 区分因变量与自变量。
- [ ] 解读系数(记住:“其他条件不变”)。
- [ ] 列出 6 大假设 (LINE-M)。
- [ ] 解释为何调整后 \( R^2 \) 通常比 \( R^2 \) 更准确。
- [ ] 计算 t 统计量与 F 统计量。
- [ ] 理解 \( SST = RSS + SSE \) 的关系。
如果这些计算让你看起来感到吃力,别担心!大多数 CFA 题目都会为你提供 ANOVA 表格;你的工作是理解这些数字之间的关联以及它们对你的投资分析代表什么意义。加油,你做得到的!