欢迎来到线性回归的世界!
你好,未来的 FRM 持证人!别被「线性回归」(Linear Regression) 这个名字吓到了。这个章节的核心其实非常简单:就是寻找变量之间的关系。在金融领域,我们总是在探讨一件事情(例如利率)如何影响另一件事情(例如债券价格)。线性回归就是一种数学工具,它能帮助我们在杂乱的数据中画出一条「最佳拟合线」(line of best fit),让我们看清背后的逻辑。如果你曾经看过散点图,并试着在点与点之间画出一条直线,那你其实已经做过回归分析的基本功了!
研读完这份笔记后,你将会学会如何构建这些模型、理解「Beta」系数的真正含义,以及如何判断你的模型是一个可靠的工具,还是仅仅是一次幸运的猜测。
1. 单变量线性回归模型
在单变量线性回归中,我们探讨两个变量之间的关系:因变量 (Dependent Variable, \(Y\)) 与 自变量 (Independent Variable, \(X\))。
方程式:
\( Y_i = \beta_0 + \beta_1 X_i + \epsilon_i \)
让我们将其拆解,逐一理解:
• \(Y_i\)(因变量): 这是你试图预测或解释的目标(例如:股票回报率)。
• \(X_i\)(自变量/解释变量): 这是你认为会影响 \(Y\) 的因素(例如:市场回报率)。
• \(\beta_0\)(截距项): 当 \(X\) 为零时,\(Y\) 的数值。在图表上,它是直线与纵轴的交点。
• \(\beta_1\)(斜率系数): 这是最重要的部分!它告诉我们 \(X\) 每变动 1 个单位时,\(Y\) 会发生多少变动。
• \(\epsilon_i\)(误差项): 这就是所谓的「噪声」。现实世界的数据永远不完美,误差项代表了模型中未纳入、但会影响 \(Y\) 的所有其他因素。
真实案例: 想象你的考试分数 (\(Y\)) 取决于复习时数 (\(X\))。其中的 \(\beta_1\) 会告诉你每多复习一小时能增加多少分数;而 \(\epsilon\) 则可能包括你的睡眠时间或考场环境是否吵杂等因素。
重点总结: 回归分析能帮助我们精确量化一个变量改变时,另一个变量会产生多少程度的联动。
2. 普通最小二乘法 (OLS) 估计
我们究竟该如何找出这条「最佳」直线呢?我们使用一种称为普通最小二乘法 (Ordinary Least Squares, OLS) 的技术。别担心它听起来很复杂,概念其实非常直观。
OLS 的目标是找到一条直线,使得真实数据点与直线之间的垂直距离平方和**达到最小。我们之所以将距离取平方,是因为我们不希望正误差与负误差相互抵消,我们想要惩罚所有的「偏离」。
参考公式:
估计斜率 (\(\hat{\beta}_1\)) 的计算方式为:
\( \hat{\beta}_1 = \frac{Cov(X, Y)}{Var(X)} \)
截距 (\(\hat{\beta}_0\)) 的计算方式为:
\( \hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X} \)
快速回顾: OLS 通过最小化平方误差给出「最佳拟合」线。这条线一定会通过 \(X\) 的平均值和 \(Y\) 的平均值。
3. 黄金法则:OLS 的假设条件
为了让 OLS 产生可靠的结果(即成为「最佳线性无偏估计量」或称 BLUE),必须满足某些假设条件。如果这些规则被破坏,我们的模型可能会误导我们!
1. 线性关系: \(X\) 与 \(Y\) 之间的关系必须是一条直线。
2. 随机抽样: 数据必须能代表总体情况。
3. 无完全共线性: \(X\) 必须具有变动性。如果 \(X\) 永远是同一个数值,我们就无法观察它如何影响 \(Y\)。
4. 外生性: 误差项不能与 \(X\) 相关。这意味着 \(E(\epsilon | X) = 0\)。若违反此假设,将会产生遗漏变量偏差 (Omitted Variable Bias)。
5. 同方差性 (Homoskedasticity): 误差项的「散布」或方差在所有 \(X\) 的数值下应保持恒定。
你知道吗? 如果上述假设成立,OLS 估计量就是现有方法中效率最高的。这被称为高斯-马尔可夫定理 (Gauss-Markov Theorem)。
4. 适配度:模型表现如何?
当我们画出直线后,需要确认它是否表现良好。我们使用判定系数 (\(R^2\)) 来进行衡量。
\(R^2\) 解读:
\(R^2\) 告诉我们 \(Y\) 的变异中有多少百分比是由 \(X\) 解释的。
• \(R^2 = 0.80\) 代表 \(Y\) 的变动中有 80% 可以由我们的模型解释。
• \(R^2\) 的数值范围永远在 0 到 1 之间。
公式:
\( R^2 = \frac{解释变异平方和 (ESS)}{总变异平方和 (TSS)} \)
或者:\( 1 - \frac{残差平方和 (SSR)}{TSS} \)
记忆小撇步: 将 TSS 想象成一个「完整的披萨」。ESS 是你真正吃掉的部分(已被解释),而 SSR 则是剩下的披萨边(未被解释的误差)。
5. 假设检验:关系是否真实存在?
仅仅因为我们找到了一个斜率 (\(\beta_1\)),并不代表它是「真实的」。它可能只是小样本中的随机巧合。我们使用 t-检验 (t-test) 来进行验证。
检验步骤:
1. 设定零假设 (\(H_0\)): 通常我们假设 \(\beta_1 = 0\)(意味着 \(X\) 对 \(Y\) 没有影响)。
2. 计算 t-统计量:
\( t = \frac{\hat{\beta}_1 - 假设数值}{ \hat{\beta}_1 的标准误 } \)
3. 与临界值比较: 如果你的 t-统计量绝对值大于临界值(对于 5% 显著性水平,通常约为 2.0),你就可以拒绝零假设!
关键词: p-值 (p-value) 指的是在零假设为真的情况下,观察到此结果的概率。较低的 p-值(通常 < 0.05)意味着该关系具有「统计显著性」。
常见误区: 不要将统计显著性与经济显著性混淆。一个变量可能具有统计显著性 (p < 0.05),但其斜率 (\(\beta_1\)) 可能非常微小,以至于在现实金融操作中毫无意义。
6. 置信区间
我们通常不会只给出一个估计点,而是提供一个范围,这就是置信区间 (Confidence Interval)。
公式:
\( \hat{\beta}_1 \pm (t_{临界值} \times SE_{\hat{\beta}_1}) \)
如果我们想要 95% 的置信区间,代表我们有 95% 的把握认为真实的总体参数落在这个范围内。如果该区间包含了零,则表示该关系在统计上是不显著的!
快速总结表:
• 高 t-统计量 (> 2): 具显著关系。
• 低 p-值 (< 0.05): 具显著关系。
• 置信区间包含 0: 不显著。
结语
线性回归是量化金融的基石。无论你是计算股票的「Beta」,还是试图预测通胀,你都在使用这些工具。请记住:OLS 最小化平方误差、\(R^2\) 衡量适配度,以及 t-检验检查显著性。掌握这三个支柱,你一定能在 FRM 考试的这部分拿到高分!