欢迎来到回归诊断:为你的模型进行“健康检查”
在你的 FRM 学习旅程中,你已经学会了如何建立回归模型。但我们如何知道模型是否真正可靠?在金融界,一个“故障”的模型可能会导致灾难性的风险管理决策。回归诊断 (Regression Diagnostics) 就是用来检验模型假设是否成立的过程。你可以把这一章想象成诊断工具箱——就像技师检查引擎一样——以确保我们的结果精确、无偏差,并且在现实世界中能够派上用场。
1. 理解目标:为什么诊断如此重要?
为了使普通最小平方法 (OLS) 回归成为“最佳线性无偏估计量”(BLUE),必须满足某些假设。如果这些假设被违反,我们的结果在纸面上看起来可能很漂亮,但在实务上却完全错误。我们主要在寻找四个“捣乱分子”:异方差性 (Heteroskedasticity)、多重共线性 (Multicollinearity)、序列相关 (Serial Correlation) 以及 模型设定错误 (Model Specification Errors)。
快速复习:请记住,如果模型是“无偏的 (unbiased)”,代表它平均而言能命中目标。如果它是“有效的 (efficient)”,则代表它拥有尽可能小的变异数(也就是精确度高)。
2. 异方差性:随之变化的变异数
这是什么?
在理想状态下,我们模型的“误差”(残差) 应该具有恒定的变异数,这称为同方差性 (Homoskedasticity)。当误差项的变异数不是恒定时,就会发生异方差性 (Heteroskedasticity)。
类比: 想象你在练习射箭。如果你是一个稳定的射手,无论你站得多远,你的失误都会均匀地散布在靶心周围,这就是同方差性。如果你站得越远,动作就越松散、越难预测,你的“误差变异数”会随着距离增加而变大。这就是异方差性!
异方差性的类型
1. 无条件 (Unconditional): 变异数改变,但与我们的自变量无关。这对我们的测试通常不会造成重大问题。
2. 条件 (Conditional): 变异数与自变量的水准有关。这是我们在 FRM 中最担心的情况,因为它会导致我们的统计检验失效。
后果与检测
后果: 系数 (\( \hat{\beta} \)) 仍然是无偏的,但标准误 (Standard Errors) 通常会被低估。这会让我们的 t 统计量看起来比实际大,误导我们“发现”了并不存在的显著关系!
如何识别它:
- 残差图 (Residual Plots): 查看残差散布图中是否有“扇形”或“漏斗形”的形状。
- Breusch-Pagan 检验: 一种正式的统计检验,将残差平方对自变量进行回归。
- White 检验: 一种更稳健的检验,不需要预设异方差性的具体形式。
如何修正它: 使用 White 的异方差稳健标准误 (White’s Heteroskedasticity-Consistent Standard Errors)(也称为稳健标准误)。这可以在不改变系数的情况下修正 t 统计量。
关键结论: 异方差性会让你的模型看起来比实际更“确定”。使用稳健标准误来保障安全性。
3. 多重共线性:当变量太过相似时
这是什么?
多重共线性发生在两个或多个自变量之间存在高度相关性时。
类比: 想象一个小组作业,两名学生拥有完全相同的知识,并且说着完全一样的话。这时就无法分辨到底是哪位学生对最终报告贡献了哪一部分。每个人的“贡献”都变得模糊不清。
后果与检测
后果: 整个模型看起来可能很棒(R-squared 很高),但个别的 t 统计量会非常低。系数变得不稳定——数据的一点点变动就可能导致系数从正数变为负数!
如何识别它:
- 高 R-squared + 低 t 统计量: 这是最“经典”的危险信号。
- 相关系数矩阵: 检查自变量之间的相关性是否非常高(例如 > 0.8 或 0.9)。
- 方差膨胀因子 (VIF): VIF 超过 5 或 10 则暗示存在严重的多重共线性。
如何修正它: 最简单的修正方法是移除其中一个高度相关的变量。反正它们已经是冗余的信息了!
关键结论: 多重共线性不会导致结果产生偏差,但它让你无法判断到底是哪个变量在发挥作用。
4. 序列相关(自相关):习惯性的误差
这是什么?
当一个时期的误差项与前一期的误差项相关时,就会出现序列相关。这在时间序列数据中极为常见。
类比: 如果你今天心情不好是因为你昨天心情也不好,那么你的“心情误差”就是序列相关的,它们并非独立事件。
后果与检测
后果: 与异方差性类似,OLS 系数仍然是无偏的,但标准误会被低估。这会导致 t 统计量膨胀,并对模型的准确性产生虚假的安全感。
如何识别它:
- Durbin-Watson (DW) 检验: 这是最常见的检验。
- 若 \( DW \approx 2 \):无序列相关。
- 若 \( DW < 2 \):正序列相关(金融领域中最常见)。
- 若 \( DW > 2 \):负序列相关。
如何修正它: 使用 Newey-West 调整后标准误,它可以同时修正异方差性和序列相关。
快速复习表:
问题: 异方差性 | 修正: White 标准误
问题: 序列相关 | 修正: Newey-West 标准误
5. 模型设定:打造正确的机器
有时候问题不在数据,而在于我们如何构建模型。这被称为设定错误 (Specification Error)。
常见错误
1. 遗漏变量偏差 (Omitted Variable Bias): 你遗漏了一个实际上很重要且与自变量相关的变量。这确实会导致系数出现偏差!
2. 包含不相关的变量: 你加入了“垃圾”变量。这不会导致偏差,但会降低模型的有效性(精确度)。
3. 函数形式错误: 你使用直线(线性)来建模,但实际关系却是曲线(非线性)。
正态性检验
我们通常假设残差服从正态分布。为了测试这一点,我们使用 Jarque-Bera (JB) 检验。
JB 检验着眼于偏度 (Skewness)(对称性)和峰度 (Kurtosis)(尾部厚度)。对于正态分布,偏度 = 0 且峰度 = 3。如果 JB 检验统计量很高,我们就会拒绝正态性假设。
如果起初觉得这些很棘手,别担心: 只要记住大多数金融数据都有“厚尾”(高峰度),因此 JB 检验在现实世界中经常无法通过!
6. 关键诊断检验总结
为了帮你记忆,这里有一份考前复习清单:
- 异方差性: Breusch-Pagan 或 White 检验。用 White 标准误修正。
- 序列相关: Durbin-Watson 检验。用 Newey-West 标准误修正。
- 多重共线性: 寻找高 R-squared 配合低 t 统计量。透过移除变量来修正。
- 正态性: Jarque-Bera 检验。
- 函数形式: Ramsey RESET 检验(检查是否应加入非线性成分)。
最后鼓励: 你不需要成为数学天才也能精通这些!只要专注于识别症状(检验)和治疗方法(修正)。如果你能做到这一点,你将为 FRM Part I 考试中的数量分析部分做好万全准备。