欢迎来到多元回归的延伸探讨!
你好!如果你已经掌握了基本的多元线性回归(Multiple Linear Regression, MLR),你一定知道它是预测变量的强大工具。但在现实世界中,数据往往很杂乱。有时候我们的数据不仅仅是数字,还包含类别(例如“行业”或“信用评级”);有时候变量之间会以复杂的方式产生交互作用。这正是多元回归延伸(Extensions of Multiple Regression)发挥作用的地方。
你可以把这一章看作是回归分析的“专业版”。我们将学习如何处理更复杂的情况,让你的模型在财务分析中变得更精准、更有用。如果一开始觉得有点棘手,不用担心,我们会把它拆解开来,一步一步为你分析!
1. 定性自变量(虚拟变量 / Dummy Variables)
标准回归通常使用“定量”数据(如价格或盈利)。但如果你想知道“科技行业”这一类别是否会影响股票回报呢?你无法直接将“科技”这个词放入方程式中。这时,我们就需要使用虚拟变量(Dummy Variables)。
什么是虚拟变量?
虚拟变量是一种“二元”变量,它只会取两个值:1(如果条件成立)或 0(如果不成立)。你可以把它想象成针对特定特征的开关(On/Off switch)。
“n-1”法则(虚拟变量陷阱 / The Dummy Variable Trap)
这是考试中非常常见的考点!如果你有 n 个类别,模型中只能包含 \( n-1 \) 个虚拟变量。例如,如果要为四季(春、夏、秋、冬)建立模型,你只需要 3 个虚拟变量。
为什么呢? 因为如果你知道该数据既不是春天,也不是夏天或秋天,那它一定就是冬天。若放入全部 4 个变量,会导致“完全多重共线性”,令模型崩溃。这就是所谓的虚拟变量陷阱。
解读截距(Intercept)
在包含虚拟变量的模型中,截距(\( b_0 \))代表“基准案例(base case)”——也就是那个被剔除在外、所有虚拟变量皆为 0 的类别。而虚拟变量的系数则告诉你,该类别与基准案例之间的差异。
重点复习:
- 虚拟变量: 取值为 1 或 0。
- 变量数量: 类别总数减一。
- 截距: 代表被剔除的基准类别。
2. 交互作用项(Interaction Terms)
有时候,一个变量的影响效果取决于另一个变量的值。例如,“工作年资”对“薪资”的影响,在“男性”与“女性”之间可能有所不同。为了捕捉这种情况,我们使用交互作用项。
运作机制
交互作用项是透过将两个自变量相乘来创建的。模型如下所示:
\( Y = b_0 + b_1 X_1 + b_2 X_2 + b_3(X_1 \times X_2) \)
比喻:咖啡与糖
想象 \( X_1 \) 是咖啡,\( X_2 \) 是糖。\( b_1 \) 是你单喝咖啡的喜好程度,\( b_2 \) 是你单吃糖的喜好程度。但交互作用项 \( b_3 \) 捕捉了当两者结合时产生的“化学反应”。糖的影响效果取决于它是加在咖啡里,还是单独食用!
核心要点: 如果交互作用项的系数(\( b_3 \))在统计上显著(p-value < 0.05),意味着因变量与 \( X_1 \) 之间的关系会随 \( X_2 \) 的水平而改变。
3. 定性因变量(Qualitative Dependent Variables)
到目前为止,我们预测的都是数字(如股价)。但如果我们要预测的是一个类别呢?例如:公司会不会破产?(会/不会)。债券会不会被升级?(会/不会)。
在这些情况下,我们的因变量 (Y) 是定性的。我们主要使用三种模型:
A. Probit 与 Logit 模型
这些模型用于结果为二元(0 或 1)的情况。它们不是预测 Y 的精确值,而是预测 Y 等于 1 的概率。
- Logit 模型: 基于“罗吉斯(logistic)”分布。
- Probit 模型: 基于“常态(normal)”分布。
注意:对于 CFA 考试,你不需要了解背后复杂的数学,只需知道它们是用来估算概率,并确保结果永远在 0 到 1 之间即可。
B. 判别分析(Discriminant Analysis)
这会根据自变量建立一个“分数”,将观察值归类。想象用于预测破产的 Z-score。如果分数高于某个阈值,公司就是“健康”的;低于该值,则是“有风险”的。
常见错误: 当因变量为 0/1 时,不要使用标准线性回归(OLS)。它可能会算出 1.5 或 -0.2 这样的预测值,这对于“是/否”的问题来说完全没有意义!
4. 评估模型规格(Model Specification)
建立模型很简单,但建立一个“好”模型就很难。模型规格指的是选择正确的变量和正确的函数形式。
遗漏变量偏差(Omitted Variable Bias)
如果你遗漏了一个既重要又与现有变量相关的变量,你的模型结果将会出现偏差且不一致。这就像“忘了加调味料”的问题,它会让剩下的变量系数显得比实际更重要(或更不重要)。
变量形式不当
有时候关系并非直线。我们可能需要转换数据:
- Log-Log 模型: 当你预期 X 的百分比变动会导致 Y 的百分比变动时使用(恒定弹性)。
- Log-Lin 模型: 当 Y 以恒定百分比增长时使用(如复利)。
- Lin-Log 模型: 当 X 对 Y 的影响具有边际递减效应时使用。
5. 处理极值与影响点(Outliers and Influential Points)
一个“奇怪”的数据点可能会毁掉整个回归分析。我们需要识别并处理它们。
极值 vs. 影响点
- 极值(Outlier): 残差非常大的观察值(它远离回归线)。
- 高杠杆点(High Leverage Point): 自变量 (X) 取值非常极端的观察值。
- 影响点(Influential Point): 移除该点后,会显著改变估计系数的点。
如何侦测?
库克距离(Cook’s Distance, Cook’s D): 这是最常见的指标。如果 Cook's D 很大,说明该数据点具有高度影响力,可能正在扭曲你的结果。
如何修正?
如果你的数据“很脏”且包含许多极值,你可以使用稳健回归(Robust Regression)或 M-估计(M-estimation)。这些方法会降低极值的权重,让它们不会把回归线拉得太偏离其余数据。
总结检核清单:
1. 我是否有使用 \( n-1 \) 个虚拟变量?
2. 是否有遗漏交互作用效应?
3. 因变量是否为类别?(如果是,请使用 Logit/Probit)。
4. 是否使用 Cook's D 检查过具影响力的极值?
继续加油!你正在掌握现实世界量化分析师每天使用的工具。回归可能看起来数学味很重,但其实它只是关于如何用数据说故事!