欢迎来到模型误设(Model Misspecification)的世界!
在之前的计量经济学课程中,我们已经学会如何建立并解读回归模型。但如果我们建立的模型从根本上就错了,会发生什么事呢?这就是所谓的模型误设(Model Misspecification)。试着把回归模型想像成盖房子的蓝图。如果蓝图本身有错——比如少了一根支撑梁,或者用了错误的建材——那么无论建筑工人技术多好,整栋房子最终还是会倒塌。
在本章中,我们要学会如何找出这些“蓝图错误”、它们为何会发生,以及它们会如何干扰我们的投资分析。如果起初觉得有些抽象也不用担心,我们会一点一点把它拆解开来!
1. 什么是模型误设?
模型误设是指我们设定模型时违反了线性回归的基本假设。如果模型被误设,回归系数(\(b_i\))就会产生偏差(Biased)且不一致(Inconsistent)。这代表我们的预测将会失准,而我们的假设检验(如 t-检验)也将不再可靠。
模型误设的三大类别
我们通常将这些错误归纳为三大类:
- 函数形式(Functional Form): 我们选用了错误的数学关系(例如:明明数据是曲线,却硬要用直线来拟合)。
- 解释变量(Explanatory Variables): 我们遗漏了重要的变量,或者加入了一些不该加入的变量。
- 测量误差(Measurement Error): 数据本身存在“噪音”或记录不准确。
快速复习: 如果模型误设,误差项(\(\epsilon\))就会与自变量(\(X\))产生相关性。这可是违反了回归分析的核心规则!
2. 遗漏变量偏差(缺失的成分)
想像你要预测房价。你加入了卧室数量作为变量,但却遗漏了地区品质。由于地区品质通常与卧室数量相关(较大的房子往往位于较好的地段),模型会把原本由地区导致的价格上涨,错误地“怪罪”在卧室数量上。
遗漏变量的结果:
- 模型呈现偏差(Biased):估计出的系数系统性地过高或过低。
- 模型呈现不一致(Inconsistent):即使我们增加数千个数据点,误差也不会消失。
你知道吗? 在基础统计学中,这常被称为“潜在变量(Lurking variable)”偏差。在 CFA 课程中,我们关注的是它如何导致我们的 \(b\) 系数变得不可信。
3. 函数形式误设
有时候,我们模型的“形状”就是错的。以下是我们最容易犯的错误:
A. 遗漏变量转换
如果 \(X\) 和 \(Y\) 之间的关系是曲线(指数型),但我们却使用了标准的线性回归(\(Y = b_0 + b_1X\)),我们的模型将无法拟合。这时我们可能需要对变量使用自然对数(Natural log)来使其线性化。
B. 不当地合并数据(Pooling Data)
如果你把 1990 年的数据和 2024 年的数据“混合”在一起做回归,这就叫合并数据。如果这段时间经济发生了根本性的改变,你的系数将无法准确描述任何一个时期。这就像试图通过测量幼童和 NBA 球员的脚,来计算平均鞋码一样——这个平均值对谁都不适用!
关键点: 在合并数据前,务必确认它们来自同一个“总体”或时期。
4. 内生性(Endogeneity)与变量及误差项的相关性
这听起来是个可怕的词,但内生性其实只是指自变量(\(X\))与误差项(\(\epsilon\))相关。这是回归分析中的“弥天大罪”。通常由以下三个原因造成:
1. 遗漏变量(如前所述)
2. 测量误差
如果你的 \(X\) 数据“模糊”或不准确,这些不准确性会进入误差项中。这会让变量(\(X\))看起来比实际影响力更小(这称为衰减偏差(Attenuation bias))。
3. 同步性(双向因果)
在标准回归中,我们假设 \(X\) 导致 \(Y\)。但如果 \(Y\) 也会导致 \(X\) 呢?
例子: 高营销支出(\(X\))是否会带来高销售额(\(Y\))?还是说销售额高的公司(\(Y\))本来就有更多钱花在营销上(\(X\))?如果关系是双向的,模型就是误设的。
总结提示: 若看到“同步性”、“遗漏变量”或“测量误差”,请马上想到:系数不一致且具偏差。
5. 定性因变量(Qualitative Dependent Variables)
到目前为止,我们假设因变量(\(Y\))是一个数值(如股价)。但如果 \(Y\) 是“是/否”或“通过/不通过”的结果呢?我们称这些为定性因变量。
你不能对此使用标准的普通最小二乘法(OLS),因为 OLS 可能会预测出 150% 或 -20% 的概率,这是不可能的!相反,我们使用以下三种模型:
- Probit 模型: 基于正态分布,用来估计事件发生的概率。
- Logit 模型: 基于逻辑分布(Logistic distribution)。与 Probit 相似,但使用了不同的数学“曲线”。
- 判别分析(Discriminant Analysis): 这会创造一个“分数”来将观察值分组(例如:“会破产”对“不会破产”)。知名的 Altman Z-score 就是一个很好的例子。
快速复习盒:
Y 是数值? 使用线性回归。
Y 是 是/否? 使用 Probit 或 Logit 模型。
6. 关键问题与后果总结
为了帮助你复习,这里有一份当事情出错时会发生的“作弊小抄”:
| 问题 | 后果 |
|---|---|
| 遗漏变量 | 系数具偏差且不一致。 |
| 变量缩放不当 | 标准误(Standard errors)会出错,导致 t-检验不可信。 |
| 测量误差 | 系数具偏差且不一致。 |
| 同步性 | 系数具偏差且不一致。 |
最后的鼓励
计量方法有时候感觉就像在学一门新的语言。如果“内生性”和“同步性”让你感到困惑,请记住核心讯息:自变量绝对不能跟误差项“称兄道弟”。 如果两者相关,你的结果就会出现偏差,你就不能信任你的模型来做投资决策。你一定做得到的,加油!