欢迎来到简单线性回归(Simple Linear Regression)!
在你的 CFA 学习之旅中,你已经学过如何计算平均值和描述数据。但如果你想利用一项资讯来预测另一项呢?例如,我们能否根据整体市场的表现来预测某只股票的报酬?这正是简单线性回归 (Simple Linear Regression, SLR) 的用途。你可以把它想像成在散布图的数据点中画出一条“最合适”的线,帮助我们理解两个变量之间的关系。
如果刚开始看到数学公式觉得有些头痛,别担心——我们会一步步为你拆解!
1. 基础概念:我们在建立什么?
在简单线性回归中,我们探讨的是两个变量之间的关系:
1. 应变量 (Dependent Variable, Y): 这是我们试图解释或预测的目标。它也被称为“反应 (Response)”或“被解释 (Explained)”变量。
2. 自变量 (Independent Variable, X): 这是我们用来解释 Y 的因素。它也被称为“解释 (Explanatory)”或“预测 (Predictor)”变量。
回归方程式:
\( Y_i = b_0 + b_1X_i + \epsilon_i \)
其中:
- \( Y_i \) 是应变量。
- \( b_0 \) 是截距 (Intercept)(线条与纵轴的交点)。
- \( b_1 \) 是斜率 (Slope)(X 每变动 1 个单位时,Y 的变动量)。
- \( \epsilon_i \) 是误差项 (Error Term)(实际数据点与回归线之间的差距)。
现实生活中的例子: 想像一下你要根据室外温度 (X) 来预测你的电费单 (Y)。截距 (\( b_0 \)) 就是即使你没用电也要付的基本费。斜率 (\( b_1 \)) 则是每升高一度温度,你的电费会增加多少钱。
快速重点:
应变量 (Y) = 我们想知道的东西。
自变量 (X) = 我们已经知道的东西。
斜率 (\( b_1 \)) = 关系的“强度”与“方向”。
2. “最合适”的线:普通最小二乘法 (OLS)
我们如何决定哪条线是“最合适”的?我们使用一种称为普通最小二乘法 (Ordinary Least Squares, OLS) 的技术。
OLS 方法会选择一条线,使得实际数据点与回归线之间的垂直距离平方和最小化。我们将距离进行平方,是为了确保线条上方的“误差”不会与下方的“误差”互相抵消。
你知道吗? 我们将实际点与线上的预测点之间的垂直距离称为残差 (Residual, \( \hat{\epsilon} \))。
3. 简单线性回归的假设
为了确保我们的回归模型可靠,我们必须对数据做出一些假设。记忆这些假设的一个流行缩写是 "LINE":
1. Linearity (线性): X 与 Y 之间的关系是一条直线。
2. Independence (独立性): 观测值(误差项)之间彼此独立。
3. Normality (常态性): 误差项呈现常态分布。
4. Equal Variance (等方差性): 误差项在所有 X 水平下的方差皆为固定(这是一个专业术语,称为同方差性 (Homoscedasticity))。
常见陷阱: 学生常会忘记“同方差性”。只要记住:“Homo”代表相同,“scedasticity”代表散布程度。我们希望误差沿着整条线都有“相同的散布程度”!
4. 评估模型:我们的“拟合度”有多好?
一旦有了回归线,我们需要知道它是否有用。我们使用三个主要工具:
A. 判定系数 (Coefficient of Determination, \( R^2 \))
\( R^2 \) 告诉我们 Y 的变异中有多少百分比是由 X 所解释的。
- 范围从 0 到 1。
- \( R^2 \) 为 0.80 代表 Y 的变动中有 80% 可以由 X 解释。
- 在简单线性回归中,\( R^2 \) 简单来说就是相关系数 (r) 的平方。
B. 估计标准误 (Standard Error of Estimate, SEE)
\( SEE \) 衡量的是数据点距离回归线的平均“距离”。
- 越低越好! \( SEE \) 越小,代表数据点越靠近回归线,我们的预测就越准确。
C. 方差分析 (ANOVA)
ANOVA 将应变量的总变异分解为两个部分:
1. SSR (回归平方和): 我们模型所解释的变异。
2. SSE (残差平方和): 我们模型无法解释的变异(即“剩余部分”)。
3. SST (总平方和): 总变异 (\( SST = SSR + SSE \))。
“披萨”比喻: 想像 SST 是一整个披萨。SSR 是你朋友吃掉的部分(已解释)。SSE 是掉在地上的部分(未解释/误差)。\( R^2 \) 就是你朋友成功吃掉的披萨百分比 (\( SSR / SST \))。
5. 假设检验:斜率显著吗?
计算出斜率 (\( b_1 \)) 并不代表真实关系一定存在,它可能是随机误差导致的!我们使用 t 检验 (t-test) 来进行测试。
原假设 (Null Hypothesis, \( H_0 \)): \( b_1 = 0 \)(没有关系)。
备择假设 (Alternative Hypothesis, \( H_a \)): \( b_1 \neq 0 \)(有显著关系)。
为了进行检验,我们计算:
\( t = \frac{\hat{b}_1 - 0}{s_{b1}} \)
其中 \( s_{b1} \) 是斜率系数的标准误。
如果计算出的 t 统计量大于临界 t 值,我们就拒绝原假设,并称该关系在统计上是显著的!
6. 进行预测
这是最有趣的部分!一旦你有了系数 (\( b_0 \) 和 \( b_1 \)),你就可以对任何 X 值预测 Y。
预测步骤:
1. 确定给定的截距 (\( b_0 \)) 和斜率 (\( b_1 \))。
2. 代入给定的 X 值。
3. 计算 \( \hat{Y} = b_0 + b_1(X) \)。
范例: 若 \( b_0 = 2 \),\( b_1 = 0.5 \),且我们想预测 X 为 10 时的 Y 值:
\( \hat{Y} = 2 + 0.5(10) = 2 + 5 = 7 \)。
7. 回归分析的限制
在你离开前,请记住回归并非万能,它有其限制:
- 异常值 (Outliers): 一个极端的数据点可能会“拉动”线条并破坏整个模型。
- 相关性 vs. 因果关系: X 与 Y 同步变动并不代表 X 导致 Y。(例如:冰淇淋销量和鲨鱼攻击事件在夏天都会增加,但冰淇淋并不会导致鲨鱼攻击!)
- 非线性关系: 如果真实关系是曲线,直线的拟合效果会很差。
快速复习箱:
OLS: 最小化残差平方和。
\( R^2 \): “计分卡”(越高代表拟合越好)。
标准误 (SEE): “错误”衡量指标(越低越好)。
t 检验: 用于检测斜率是否显著不为零。
继续练习!简单线性回归是你未来在 Level II 和 Level III 中接触到的所有进阶建模的基石。你一定做得到的!